OWLv2
OWLv2 là detector đối tượng với từ vựng mở do Google Research phát triển, chấm điểm các vùng ảnh theo embedding văn bản từ encoder kiểu CLIP. LibreYOLO bọc mô hình thành họ chỉ dành cho dự đoán trong cấp detector với từ vựng mở.
- Tác vụ
- detection
- Kích thước
- b16, l14 at 960 to 1008 px
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
- Giấy phép
- Mã nguồn MIT, trọng số Apache-2.0. Sử dụng thương mại
Cài đặt
OWLv2 tải qua cấp detector với từ vựng mở của LibreYOLO, cấp này cần extra openvocab:
pip install "libreyolo[openvocab]"Extra đó kéo về transformers và timm, các thư viện Hugging Face mà cấp này sử dụng.
Dự đoán
OWLv2 không phải checkpoint mà LibreYOLO tải qua LibreYOLO(). Mô hình tải qua factory LibreOpenVocab cùng cấp, factory này tải snapshot Hugging Face trong lần sử dụng đầu tiên và lưu vào bộ nhớ đệm dưới weights/.
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("owlv2-b16")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.1)for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreOpenVocab, SAMPLE_IMAGE # Bỏ qua set_classes() sẽ giữ từ vựng COCO-80 mặc định của cấp.model = LibreOpenVocab("owlv2-l14")result = model.predict(SAMPLE_IMAGE, conf=0.1)print(result.names)set_classes() đặt từ vựng văn bản được giữ lại: gọi lại để thay danh sách hoặc bỏ qua để giữ nhãn COCO-80 mặc định. Mỗi nhãn được bọc trong mẫu prompt cố định trước khi đến text tower, phù hợp với cách Owlv2ForObjectDetection của transformers được huấn luyện.
OWLv2 không có ngưỡng text-token: chỉ conf lọc detection, còn truyền text_threshold sẽ phát sinh lỗi. iou được chấp nhận để tương thích API nhưng phát cảnh báo và không làm gì vì không có non-maximum suppression ở đây. imgsz và augment=True bị từ chối hoàn toàn: processor của transformers sở hữu bước đổi kích thước, còn tăng cường khi kiểm thử nằm ngoài phạm vi của cấp này. predict() trên một ảnh trả về một Results, không phải danh sách; truyền thư mục, danh sách ảnh hoặc stream=True cho nguồn video để nhận nhiều kết quả. Không có tuyến CLI cho họ mô hình này; libreyolo predict chỉ tải checkpoint .pt qua LibreYOLO(), vì vậy các họ LibreOpenVocab chạy từ Python. Xem dự đoán để biết loại nguồn và xử lý luồng.
Biến thể
Có hai checkpoint b16 (base, kích thước patch 16) và l14 (large, kích thước patch 14). b16 là kích thước mặc định của cấp này khi không chỉ định. Cả hai mirror bản phát hành Google Research chính thức qua Owlv2ForObjectDetection của transformers, được tải một lần vào snapshot Hugging Face do LibreYOLO host và giữ nguyên các tệp upstream. Chưa có số liệu độ chính xác hoặc độ trễ nào được công bố cho họ mô hình này.
Huấn luyện, xác thực tập dữ liệu (dataset) và xuất đều nằm ngoài phạm vi của cấp này: train(), val() và export() luôn phát sinh NotImplementedError. Đây là wrapper chỉ dành cho dự đoán quanh checkpoint đã phát hành.
Checkpoint
Mọi tệp trọng số đã phát hành cho họ mô hình này.
| Tệp | Đầu vào (px) | Giấy phép trọng số |
|---|---|---|
| Detection | ||
| LibreOWLv2b16.pt | 960 | apache-2.0 |
| LibreOWLv2l14.pt | 1008 | apache-2.0 |
Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- OWLv2, Google Research
- Giấy phép thượng nguồn
- Apache-2.0
- Nguồn thượng nguồn
- github.com/google-research/scenic/tree/main/scenic/projects/owl_vit
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
- Diễn giải
- Apache-2.0 is a permissive license, so these checkpoints can be used in commercial and closed-source products. It asks you to keep the license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. LibreYOLO vendors no OWLv2 model source of its own: LibreOWLv2 calls the Apache-2.0 `transformers` implementation, `Owlv2ForObjectDetection`, directly, and downloads the official checkpoints into a LibreYOLO-hosted mirror repository that preserves the upstream snapshot files.
Trích dẫn
@article{minderer2023scaling,
title={Scaling Open-Vocabulary Object Detection},
author={Matthias Minderer, Alexey Gritsenko, Neil Houlsby},
journal={NeurIPS},
year={2023},
}Được sao chép từ khối trích dẫn của tác giả tại github.com/google-research/scenic/blob/main/scenic/projects/owl_vit/README.md#references.