OWLv2
OWLv2 adalah detector objek open-vocabulary yang dikembangkan Google Research dan menilai region gambar terhadap embedding teks dari encoder bergaya CLIP. LibreYOLO membungkusnya sebagai family khusus prediksi dalam tingkat detector open-vocabulary.
- Task
- detection
- Ukuran
- b16, l14 at 960 to 1008 px
- Instalasi
pip install libreyolo- Tier dukungan
- Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
- Lisensi
- Kode MIT, bobot Apache-2.0. Penggunaan komersial
Instalasi
OWLv2 dimuat melalui tingkat detector open-vocabulary LibreYOLO yang memerlukan
extra openvocab:
pip install "libreyolo[openvocab]"Extra tersebut memasang transformers dan timm, yaitu library Hugging Face
yang dipanggil oleh tingkat ini.
Prediksi
OWLv2 bukan checkpoint yang dimuat LibreYOLO melalui LibreYOLO(). Model ini
dimuat melalui factory pendamping LibreOpenVocab, yang mengunduh snapshot
Hugging Face saat pertama kali digunakan dan menyimpannya dalam cache di bawah
weights/.
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("owlv2-b16")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.1)for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreOpenVocab, SAMPLE_IMAGE # Melewati set_classes() mempertahankan vocabulary COCO-80 default tingkat ini.model = LibreOpenVocab("owlv2-l14")result = model.predict(SAMPLE_IMAGE, conf=0.1)print(result.names)set_classes() menetapkan vocabulary teks yang persisten. Panggil lagi untuk
mengganti daftar atau lewati untuk mempertahankan label COCO-80 default. Setiap
label dibungkus dalam template prompt tetap sebelum mencapai text tower, sesuai
cara Owlv2ForObjectDetection milik transformers dilatih.
OWLv2 tidak memiliki ambang batas token teks. Hanya conf yang memfilter
deteksi, dan meneruskan text_threshold memunculkan error. iou diterima untuk
kompatibilitas API, tetapi mengeluarkan peringatan dan tidak melakukan apa pun
karena tidak ada non-maximum suppression yang dijalankan. imgsz dan
augment=True langsung ditolak. Processor transformers mengendalikan resize,
sedangkan augmentasi waktu pengujian tidak termasuk cakupan tingkat ini.
predict() pada satu gambar mengembalikan satu Results, bukan daftar. Teruskan
direktori, daftar gambar, atau stream=True untuk sumber video agar memperoleh
beberapa hasil. Tidak ada jalur CLI untuk family ini. libreyolo predict hanya
memuat checkpoint .pt melalui LibreYOLO(), sehingga family
LibreOpenVocab dijalankan dari Python. Lihat prediksi untuk
jenis sumber dan streaming.
Varian
Ada dua checkpoint, b16 (base, ukuran patch 16) dan l14 (large, ukuran patch
14). b16 adalah ukuran default tingkat ini jika tidak ada ukuran yang
diberikan. Keduanya mencerminkan rilis resmi Google Research melalui
Owlv2ForObjectDetection milik transformers, yang diunduh satu kali ke
snapshot Hugging Face yang dihosting LibreYOLO dan tetap mempertahankan berkas
upstream. Belum ada angka akurasi atau latensi yang dipublikasikan untuk family
ini.
Pelatihan, validasi dataset, dan ekspor berada di luar cakupan tingkat ini:
train(), val(), dan export() semuanya selalu memunculkan
NotImplementedError. Ini adalah wrapper khusus prediksi untuk checkpoint yang
telah dipublikasikan.
Checkpoint
Semua berkas bobot yang dipublikasikan untuk family ini.
| Berkas | Input (piksel) | Lisensi bobot |
|---|---|---|
| Detection | ||
| LibreOWLv2b16.pt | 960 | apache-2.0 |
| LibreOWLv2l14.pt | 1008 | apache-2.0 |
Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.
Lisensi
Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.
Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.
- Karya asli
- OWLv2, Google Research
- Lisensi upstream
- Apache-2.0
- Kode LibreYOLO
- MIT
- Bobot
- Apache-2.0, dipublikasikan ulang di huggingface.co/LibreYOLO
- Interpretasi
- Apache-2.0 is a permissive license, so these checkpoints can be used in commercial and closed-source products. It asks you to keep the license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. LibreYOLO vendors no OWLv2 model source of its own: LibreOWLv2 calls the Apache-2.0 `transformers` implementation, `Owlv2ForObjectDetection`, directly, and downloads the official checkpoints into a LibreYOLO-hosted mirror repository that preserves the upstream snapshot files.
Sitasi
@article{minderer2023scaling,
title={Scaling Open-Vocabulary Object Detection},
author={Matthias Minderer, Alexey Gritsenko, Neil Houlsby},
journal={NeurIPS},
year={2023},
}Disalin dari blok sitasi penulis di github.com/google-research/scenic/blob/main/scenic/projects/owl_vit/README.md#references.