OWLv2

OWLv2 adalah detector objek open-vocabulary yang dikembangkan Google Research dan menilai region gambar terhadap embedding teks dari encoder bergaya CLIP. LibreYOLO membungkusnya sebagai family khusus prediksi dalam tingkat detector open-vocabulary.

Task
detection
Ukuran
b16, l14 at 960 to 1008 px
Instalasi
pip install libreyolo
Tier dukungan
Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
Proyek upstream
OWLv2 oleh Google Research, Apache-2.0. Makalah, sumber
Lisensi
Kode MIT, bobot Apache-2.0. Penggunaan komersial

Instalasi

OWLv2 dimuat melalui tingkat detector open-vocabulary LibreYOLO yang memerlukan extra openvocab:

bash
pip install "libreyolo[openvocab]"

Extra tersebut memasang transformers dan timm, yaitu library Hugging Face yang dipanggil oleh tingkat ini.

Prediksi

OWLv2 bukan checkpoint yang dimuat LibreYOLO melalui LibreYOLO(). Model ini dimuat melalui factory pendamping LibreOpenVocab, yang mengunduh snapshot Hugging Face saat pertama kali digunakan dan menyimpannya dalam cache di bawah weights/.

Python
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("owlv2-b16")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.1)for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Vocabulary default
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE # Melewati set_classes() mempertahankan vocabulary COCO-80 default tingkat ini.model = LibreOpenVocab("owlv2-l14")result = model.predict(SAMPLE_IMAGE, conf=0.1)print(result.names)

set_classes() menetapkan vocabulary teks yang persisten. Panggil lagi untuk mengganti daftar atau lewati untuk mempertahankan label COCO-80 default. Setiap label dibungkus dalam template prompt tetap sebelum mencapai text tower, sesuai cara Owlv2ForObjectDetection milik transformers dilatih.

OWLv2 tidak memiliki ambang batas token teks. Hanya conf yang memfilter deteksi, dan meneruskan text_threshold memunculkan error. iou diterima untuk kompatibilitas API, tetapi mengeluarkan peringatan dan tidak melakukan apa pun karena tidak ada non-maximum suppression yang dijalankan. imgsz dan augment=True langsung ditolak. Processor transformers mengendalikan resize, sedangkan augmentasi waktu pengujian tidak termasuk cakupan tingkat ini. predict() pada satu gambar mengembalikan satu Results, bukan daftar. Teruskan direktori, daftar gambar, atau stream=True untuk sumber video agar memperoleh beberapa hasil. Tidak ada jalur CLI untuk family ini. libreyolo predict hanya memuat checkpoint .pt melalui LibreYOLO(), sehingga family LibreOpenVocab dijalankan dari Python. Lihat prediksi untuk jenis sumber dan streaming.

Varian

Ada dua checkpoint, b16 (base, ukuran patch 16) dan l14 (large, ukuran patch 14). b16 adalah ukuran default tingkat ini jika tidak ada ukuran yang diberikan. Keduanya mencerminkan rilis resmi Google Research melalui Owlv2ForObjectDetection milik transformers, yang diunduh satu kali ke snapshot Hugging Face yang dihosting LibreYOLO dan tetap mempertahankan berkas upstream. Belum ada angka akurasi atau latensi yang dipublikasikan untuk family ini.

Pelatihan, validasi dataset, dan ekspor berada di luar cakupan tingkat ini: train(), val(), dan export() semuanya selalu memunculkan NotImplementedError. Ini adalah wrapper khusus prediksi untuk checkpoint yang telah dipublikasikan.

Checkpoint

Semua berkas bobot yang dipublikasikan untuk family ini.

BerkasInput (piksel)Lisensi bobot
Detection
LibreOWLv2b16.pt960apache-2.0
LibreOWLv2l14.pt1008apache-2.0

Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
OWLv2, Google Research
Lisensi upstream
Apache-2.0
Kode LibreYOLO
MIT
Bobot
Apache-2.0, dipublikasikan ulang di huggingface.co/LibreYOLO
Interpretasi
Apache-2.0 is a permissive license, so these checkpoints can be used in commercial and closed-source products. It asks you to keep the license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. LibreYOLO vendors no OWLv2 model source of its own: LibreOWLv2 calls the Apache-2.0 `transformers` implementation, `Owlv2ForObjectDetection`, directly, and downloads the official checkpoints into a LibreYOLO-hosted mirror repository that preserves the upstream snapshot files.

Sitasi

@article{minderer2023scaling,
  title={Scaling Open-Vocabulary Object Detection},
  author={Matthias Minderer, Alexey Gritsenko, Neil Houlsby},
  journal={NeurIPS},
  year={2023},
}

Disalin dari blok sitasi penulis di github.com/google-research/scenic/blob/main/scenic/projects/owl_vit/README.md#references.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.