OWLv2

OWLv2 là detector đối tượng với từ vựng mở do Google Research phát triển, chấm điểm các vùng ảnh theo embedding văn bản từ encoder kiểu CLIP. LibreYOLO bọc mô hình thành họ chỉ dành cho dự đoán trong cấp detector với từ vựng mở.

Tác vụ
detection
Kích thước
b16, l14 at 960 to 1008 px
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Bậc song hành, từ v. Một bề mặt sản phẩm riêng với factory và contract riêng.
Thượng nguồn
OWLv2 của Google Research, Apache-2.0. Bài báo, mã nguồn
Giấy phép
Mã nguồn MIT, trọng số Apache-2.0. Sử dụng thương mại

Cài đặt

OWLv2 tải qua cấp detector với từ vựng mở của LibreYOLO, cấp này cần extra openvocab:

bash
pip install "libreyolo[openvocab]"

Extra đó kéo về transformerstimm, các thư viện Hugging Face mà cấp này sử dụng.

Dự đoán

OWLv2 không phải checkpoint mà LibreYOLO tải qua LibreYOLO(). Mô hình tải qua factory LibreOpenVocab cùng cấp, factory này tải snapshot Hugging Face trong lần sử dụng đầu tiên và lưu vào bộ nhớ đệm dưới weights/.

Python
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("owlv2-b16")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.1)for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Từ vựng mặc định
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE # Bỏ qua set_classes() sẽ giữ từ vựng COCO-80 mặc định của cấp.model = LibreOpenVocab("owlv2-l14")result = model.predict(SAMPLE_IMAGE, conf=0.1)print(result.names)

set_classes() đặt từ vựng văn bản được giữ lại: gọi lại để thay danh sách hoặc bỏ qua để giữ nhãn COCO-80 mặc định. Mỗi nhãn được bọc trong mẫu prompt cố định trước khi đến text tower, phù hợp với cách Owlv2ForObjectDetection của transformers được huấn luyện.

OWLv2 không có ngưỡng text-token: chỉ conf lọc detection, còn truyền text_threshold sẽ phát sinh lỗi. iou được chấp nhận để tương thích API nhưng phát cảnh báo và không làm gì vì không có non-maximum suppression ở đây. imgszaugment=True bị từ chối hoàn toàn: processor của transformers sở hữu bước đổi kích thước, còn tăng cường khi kiểm thử nằm ngoài phạm vi của cấp này. predict() trên một ảnh trả về một Results, không phải danh sách; truyền thư mục, danh sách ảnh hoặc stream=True cho nguồn video để nhận nhiều kết quả. Không có tuyến CLI cho họ mô hình này; libreyolo predict chỉ tải checkpoint .pt qua LibreYOLO(), vì vậy các họ LibreOpenVocab chạy từ Python. Xem dự đoán để biết loại nguồn và xử lý luồng.

Biến thể

Có hai checkpoint b16 (base, kích thước patch 16) và l14 (large, kích thước patch 14). b16 là kích thước mặc định của cấp này khi không chỉ định. Cả hai mirror bản phát hành Google Research chính thức qua Owlv2ForObjectDetection của transformers, được tải một lần vào snapshot Hugging Face do LibreYOLO host và giữ nguyên các tệp upstream. Chưa có số liệu độ chính xác hoặc độ trễ nào được công bố cho họ mô hình này.

Huấn luyện, xác thực tập dữ liệu (dataset) và xuất đều nằm ngoài phạm vi của cấp này: train(), val()export() luôn phát sinh NotImplementedError. Đây là wrapper chỉ dành cho dự đoán quanh checkpoint đã phát hành.

Checkpoint

Mọi tệp trọng số đã phát hành cho họ mô hình này.

TệpĐầu vào (px)Giấy phép trọng số
Detection
LibreOWLv2b16.pt960apache-2.0
LibreOWLv2l14.pt1008apache-2.0

Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
OWLv2, Google Research
Giấy phép thượng nguồn
Apache-2.0
Mã nguồn LibreYOLO
MIT
Trọng số
Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
Diễn giải
Apache-2.0 is a permissive license, so these checkpoints can be used in commercial and closed-source products. It asks you to keep the license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. LibreYOLO vendors no OWLv2 model source of its own: LibreOWLv2 calls the Apache-2.0 `transformers` implementation, `Owlv2ForObjectDetection`, directly, and downloads the official checkpoints into a LibreYOLO-hosted mirror repository that preserves the upstream snapshot files.

Trích dẫn

@article{minderer2023scaling,
  title={Scaling Open-Vocabulary Object Detection},
  author={Matthias Minderer, Alexey Gritsenko, Neil Houlsby},
  journal={NeurIPS},
  year={2023},
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/google-research/scenic/blob/main/scenic/projects/owl_vit/README.md#references.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.