LocateAnything

LocateAnything adalah model grounding vision-language yang dirilis NVIDIA dan mendekode bounding box serta titik secara paralel, bukan satu token koordinat pada satu waktu. LibreYOLO membungkusnya sebagai detector dan penunjuk open-vocabulary: daftar label teks apa pun menjadi set kelas, tanpa head tetap dan tanpa memerlukan fine-tuning.

Task
detection, point
Ukuran
3b at 2500 px
Instalasi
pip install libreyolo
Tier dukungan
Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
Proyek upstream
LocateAnything oleh NVIDIA, NVIDIA License (non-commercial). Makalah, sumber
Lisensi
Kode MIT, bobot NVIDIA License (non-commercial). Penggunaan komersial

Instalasi

LocateAnything memerlukan extra vlm, yang memasang transformers beserta paket decord, lmdb, dan peft yang diimpor kode remote Hugging Face saat model dimuat.

bash
pip install "libreyolo[vlm]"

Prediksi

LibreLocateAnything adalah kelas Python, bukan checkpoint .pt. Model ini tidak dimuat melalui factory LibreYOLO(), dan CLI libreyolo tidak dapat menentukannya. Factory LibreVLM(...) (from libreyolo import LibreVLM) juga dapat mencapai family ini berdasarkan alias, misalnya LibreVLM("locate-anything"). Kelas yang digunakan di bawah adalah objek yang dibangun factory tersebut. Memuatnya akan mengunduh dan menjalankan kode model remote milik NVIDIA dari Hugging Face, sehingga LibreYOLO mematok unduhan ke satu revisi commit tetap alih-alih branch main yang dapat berubah, serta mencatat pemberitahuan lisensi satu kali sebelum unduhan pertama.

Python
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabulary terbuka: kata apa pun dapat digunakan, bukan head kelas tetap. Persisten# pada setiap panggilan predict()/track() berikutnya sampai ditetapkan kembali.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Prompt titik
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" mengembalikan satu titik per objek yang cocok, bukan box.# Beralih task pada model yang sudah dimuat dengan model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points:    print(pt.cls, pt.conf, pt.xy)
Chat mentah
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Jalur langsung di bawah kemudahan deteksi: pertanyaan bebas,# penghitungan, atau prompt apa pun yang tidak dicakup wrapper box.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes (task detect) dan result.points (task point) memuat output yang telah di-parse seperti family lain. Confidence merupakan placeholder. LocateAnything tidak menghasilkan skor per box, sehingga setiap deteksi memperoleh confidence konstan yang sama, dan conf= hanya membuang baris di bawah konstanta itu, bukan memberi peringkat. Jika set_classes() dilewati, vocabulary memakai nama COCO-80 sebagai default. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.

Varian

Ada satu ukuran yang dipublikasikan, 3b. Dua task memakai bobot yang sama: detect (default) mengembalikan box, sedangkan task="point" mengembalikan satu titik per objek yang cocok dalam result.points. Beralih di antara keduanya pada model yang sudah dimuat dengan model.set_task("point"). Harness benchmark LibreYOLO belum mengukur family ini, sehingga belum ada angka akurasi yang dipublikasikan sebagai pembanding.

LibreYOLO menyediakan family ini hanya untuk prediksi. train(), val(), dan export() semuanya memunculkan NotImplementedError. Lakukan fine-tuning di upstream dan muat hasilnya. Validasi dataset dilewati karena confidence placeholder akan membuat mAP COCO menyesatkan, sedangkan ekspor berada di luar cakupan model generatif tanpa state dict yang dapat di-trace.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
LocateAnything, NVIDIA
Lisensi upstream
NVIDIA License (non-commercial)
Kode LibreYOLO
MIT
Bobot
NVIDIA License (non-commercial), didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
Interpretasi
The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.

NVIDIA License mengizinkan penggunaan, reproduksi, dan modifikasi, tetapi membatasi model dan semua turunannya hanya untuk penggunaan nonkomersial, penelitian, atau evaluasi bagi siapa pun selain NVIDIA dan afiliasinya. Tidak ada ambang pendapatan atau pengecualian berbayar. LocateAnything-3B juga menggabungkan dua komponen berlisensi lain: backbone bahasa Qwen2.5-3B-Instruct di bawah Qwen Research License dan encoder vision MoonViT-SO-400M berlisensi MIT. LibreYOLO tidak menghosting, mencerminkan, atau mendistribusikan ulang bagian apa pun. LibreLocateAnything mengunduh bobot dan kode remote yang diperlukan langsung dari nvidia/LocateAnything-3B di Hugging Face, dipatok ke satu commit tetap, saat pertama kali dijalankan.

Sitasi

@article{wang2025locateanything,
  title   = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author  = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
             Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
             Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal = {arXiv:2605.27365},
  year    = {2026},
}

Disalin dari blok sitasi penulis di github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.