Grounding DINO
Grounding DINO adalah detector objek open-set yang dikembangkan IDEA Research. Model ini menilai gambar terhadap prompt teks bebas, bukan daftar kelas tetap. LibreYOLO membungkusnya sebagai family khusus prediksi dalam tingkat detector open-vocabulary.
- Task
- detection
- Ukuran
- t, b at 800 px
- Instalasi
pip install libreyolo- Tier dukungan
- Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
- Lisensi
- Kode MIT, bobot Apache-2.0. Penggunaan komersial
Instalasi
Grounding DINO dimuat melalui tingkat detector open-vocabulary LibreYOLO yang
memerlukan extra openvocab:
pip install "libreyolo[openvocab]"Extra tersebut memasang transformers dan timm, yaitu library Hugging Face
yang dipanggil oleh tingkat ini.
Prediksi
Grounding DINO bukan checkpoint yang dimuat LibreYOLO melalui LibreYOLO().
Model ini dimuat melalui factory pendamping LibreOpenVocab, yang mengunduh
snapshot Hugging Face saat pertama kali digunakan dan menyimpannya dalam cache
di bawah weights/.
from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("grounding-dino-t")model.set_classes(["person", "dog", "skateboard"]) result = model.predict(SAMPLE_IMAGE, conf=0.25)for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreOpenVocab, SAMPLE_IMAGE model = LibreOpenVocab("grounding-dino-b")model.set_classes(["remote control", "school bus"]) # conf memfilter berdasarkan skor box, sedangkan text_threshold berdasarkan skor token# frasa yang didekode. Keduanya memakai nilai default 0.25 jika tidak ditetapkan.result = model.predict(SAMPLE_IMAGE, conf=0.25, text_threshold=0.3)print(result.names)set_classes() menetapkan vocabulary teks yang persisten. Panggil lagi untuk
mengganti daftar atau lewati untuk mempertahankan label COCO-80 default.
Grounding DINO mendekode frasa bebas dari output teksnya sendiri dan memetakan
frasa itu kembali ke vocabulary secara mandiri. Kecocokan ternormalisasi yang
persis diprioritaskan, kecocokan token utuh diterima, sedangkan frasa ambigu
atau tidak cocok dibuang alih-alih ditebak. Karena itu, school bus tidak
pernah dipetakan hanya ke bus atau school. Vocabulary yang cukup panjang
hingga melampaui batas token encoder teks dibagi menjadi beberapa prompt,
dijalankan sebagai forward pass terpisah, lalu digabungkan kembali menjadi
satu set deteksi yang dibatasi oleh max_det.
iou diterima untuk kompatibilitas API, tetapi mengeluarkan peringatan dan
tidak melakukan apa pun karena tidak ada non-maximum suppression yang
dijalankan. imgsz dan augment=True langsung ditolak. Processor
transformers mengendalikan resize, sedangkan augmentasi waktu pengujian tidak
termasuk cakupan tingkat ini. predict() pada satu gambar mengembalikan satu
Results, bukan daftar. Teruskan direktori, daftar gambar, atau stream=True
untuk sumber video agar memperoleh beberapa hasil. Tidak ada jalur CLI untuk
family ini. libreyolo predict hanya memuat checkpoint .pt melalui
LibreYOLO(), sehingga family LibreOpenVocab dijalankan dari Python. Lihat
prediksi untuk jenis sumber dan streaming.
Varian
Ada dua checkpoint, t dan b. t adalah ukuran default tingkat ini bila
tidak ada ukuran yang diberikan. Keduanya mencerminkan rilis resmi IDEA
Research melalui GroundingDinoForObjectDetection milik transformers, yang
diunduh satu kali ke snapshot Hugging Face yang dihosting LibreYOLO dan tetap
mempertahankan berkas upstream. Belum ada angka akurasi atau latensi yang
dipublikasikan untuk family ini.
Pelatihan, validasi dataset, dan ekspor berada di luar cakupan tingkat ini:
train(), val(), dan export() semuanya selalu memunculkan
NotImplementedError. Ini adalah wrapper khusus prediksi untuk checkpoint yang
telah dipublikasikan.
Checkpoint
Semua berkas bobot yang dipublikasikan untuk family ini.
| Berkas | Input (piksel) | Lisensi bobot |
|---|---|---|
| Detection | ||
| LibreGroundingDINOt.pt | 800 | apache-2.0 |
| LibreGroundingDINOb.pt | 800 | apache-2.0 |
Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.
Lisensi
Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.
Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.
- Karya asli
- Grounding DINO, IDEA Research
- Lisensi upstream
- Apache-2.0
- Sumber upstream
- github.com/IDEA-Research/GroundingDINO
- Kode LibreYOLO
- MIT
- Bobot
- Apache-2.0, dipublikasikan ulang di huggingface.co/LibreYOLO
- Interpretasi
- Apache-2.0 is a permissive license, so this checkpoint can be used in commercial and closed-source products. It asks you to keep the license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. LibreYOLO vendors no Grounding DINO model source of its own: LibreGroundingDINO calls the Apache-2.0 `transformers` implementation, `GroundingDinoForObjectDetection`, directly, and downloads the official checkpoint into a LibreYOLO-hosted mirror repository that preserves the upstream snapshot files.
Sitasi
@article{liu2023grounding,
title={Grounding dino: Marrying dino with grounded pre-training for open-set object detection},
author={Liu, Shilong and Zeng, Zhaoyang and Ren, Tianhe and Li, Feng and Zhang, Hao and Yang, Jie and Li, Chunyuan and Yang, Jianwei and Su, Hang and Zhu, Jun and others},
journal={arXiv preprint arXiv:2303.05499},
year={2023}
}Disalin dari blok sitasi penulis di github.com/IDEA-Research/GroundingDINO#black_nib-citation.