LocateAnything
LocateAnything è un modello di grounding visione-linguaggio pubblicato da NVIDIA che decodifica bounding box e punti in parallelo, invece di procedere un token di coordinata alla volta. LibreYOLO lo avvolge come rilevatore e localizzatore a punti a vocabolario aperto: qualsiasi lista di etichette testuali diventa l'insieme delle classi, senza testa fissa e senza bisogno di fine-tuning.
- Task
- detection, point
- Dimensioni
- 3b at 2500 px
- Installa
pip install libreyolo- Livello di supporto
- Livello parallelo, dalla v. Un'interfaccia di prodotto separata, con una propria factory e un proprio contratto.
- Licenze
- Codice MIT, pesi NVIDIA License (non-commercial). Uso commerciale
Installazione
LocateAnything richiede l'extra vlm, che porta con sé transformers insieme
ai pacchetti decord, lmdb e peft che il suo codice remoto su Hugging Face
importa al caricamento.
pip install "libreyolo[vlm]"Predizione
LibreLocateAnything è una classe Python, non un checkpoint .pt: non si
carica attraverso la factory LibreYOLO() e la CLI libreyolo non lo risolve.
Anche la factory LibreVLM(...) (from libreyolo import LibreVLM) raggiunge
questa famiglia tramite alias, per esempio LibreVLM("locate-anything"); la
classe usata qui sotto è quella che costruisce. Caricarla scarica ed esegue il
codice remoto del modello pubblicato da NVIDIA su Hugging Face, quindi LibreYOLO
fissa il download a una revisione di commit precisa invece che al ramo mutabile
main, e registra un avviso di licenza una tantum prima del primo download.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabolario aperto: vale qualsiasi parola, non una testa di classi# fissa. Persiste in ogni predict()/track() successivo finché non lo reimposti.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" restituisce un punto per ogni oggetto trovato, non un box.# Cambia task su un modello già caricato con model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # La via di fuga sotto la comodità del rilevamento: domande libere,# conteggi o qualsiasi prompt che il wrapper dei box non copre.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (task detect) e result.points (task point) portano
l'output parsato come in qualsiasi altra famiglia. La confidenza è un
segnaposto: LocateAnything non emette nessun punteggio per box, quindi ogni
rilevamento riceve la stessa confidenza costante, e conf= scarta soltanto le
righe sotto quella costante, non le ordina. Se salti set_classes(), il
vocabolario ricade sui nomi di COCO-80. Vedi predizione per
sorgenti, streaming e gestione dei risultati.
Varianti
Una sola dimensione pubblicata, 3b. Due task condividono gli stessi pesi:
detect (quello predefinito) restituisce i box, mentre task="point"
restituisce invece un singolo punto per ogni oggetto trovato, in
result.points; si passa dall'uno all'altro su un modello già caricato con
model.set_task("point"). L'harness di benchmark di LibreYOLO non ha misurato
questa famiglia, quindi non ci sono numeri di accuratezza pubblicati con cui
confrontarla.
LibreYOLO espone questa famiglia solo per la predizione. train(), val() ed
export() sollevano tutti NotImplementedError: fai fine-tuning upstream e
carica il risultato, la validazione su dataset è saltata perché una confidenza
segnaposto renderebbe fuorviante il mAP di COCO, e l'esportazione è fuori
ambito per un modello generativo senza state dict da tracciare.
Licenze
Controlla la licenza nel repository Hugging Face degli specifici pesi che scarichi. Ogni checkpoint nell<link>organizzazione LibreYOLO</link> ne include una e non è sempre la stessa per tutta la famiglia. Quel repository è la fonte autorevole; il riepilogo seguente descrive le condizioni applicabili al momento dellultima verifica di questa pagina.
Questa è una descrizione delle licenze coinvolte, non una consulenza legale. Se la risposta è importante a fini commerciali, leggi personalmente le licenze e chiedi una consulenza indipendente.
- Lavoro originale
- LocateAnything, NVIDIA
- Licenza upstream
- NVIDIA License (non-commercial)
- Sorgente upstream
- github.com/NVlabs/Eagle/tree/main/Embodied
- Codice LibreYOLO
- MIT
- Pesi
- NVIDIA License (non-commercial), distribuiti dai rispettivi autori. LibreYOLO non li ospita né ne mantiene una copia.
- Interpretazione
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
La NVIDIA License permette l'uso, la riproduzione e la modifica, ma limita il
modello e qualsiasi suo derivato al solo uso non commerciale, di ricerca o di
valutazione, per chiunque non sia NVIDIA e le sue affiliate: non c'è nessuna
soglia di fatturato né eccezione a pagamento. LocateAnything-3B inoltre mette
insieme altri due componenti con licenza propria: un backbone linguistico
Qwen2.5-3B-Instruct sotto la Qwen Research License e un encoder visivo
MoonViT-SO-400M sotto MIT. LibreYOLO non ospita, non replica e non
ridistribuisce niente di tutto questo: LibreLocateAnything scarica i pesi e
il codice remoto necessario direttamente da nvidia/LocateAnything-3B su
Hugging Face, fissati a un commit preciso, la prima volta che viene eseguito.
Citazione
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Copiato dal blocco di citazione degli autori disponibile su github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.