LocateAnything
LocateAnything est un modèle de grounding vision-langage publié par NVIDIA qui décode les boîtes englobantes et les points en parallèle plutôt qu'un token de coordonnée à la fois. LibreYOLO l'intègre comme détecteur et pointeur à vocabulaire ouvert : n'importe quelle liste d'étiquettes texte devient l'ensemble de classes, sans tête figée et sans fine-tuning requis.
- Tâches
- detection, point
- Tailles
- 3b at 2500 px
- Installer
pip install libreyolo- Niveau de support
- Niveau parallèle, depuis v. Une interface produit distincte avec sa propre factory et son propre contrat.
- Licences
- Code MIT, poids NVIDIA License (non-commercial). Usage commercial
Installation
LocateAnything a besoin de l'extra vlm, qui installe transformers ainsi que
les paquets decord, lmdb et peft que son code distant Hugging Face
importe au chargement.
pip install "libreyolo[vlm]"Prédire
LibreLocateAnything est une classe Python, pas un checkpoint .pt : elle ne
se charge pas via la factory LibreYOLO(), et la CLI libreyolo ne la résout
pas. La factory LibreVLM(...) (from libreyolo import LibreVLM) atteint elle
aussi cette famille par alias, par exemple LibreVLM("locate-anything") ; la
classe utilisée ci-dessous est celle qu'elle construit. Son chargement
télécharge et exécute le code de modèle distant de NVIDIA depuis Hugging Face,
si bien que LibreYOLO fige le téléchargement sur une révision de commit fixe
plutôt que sur la branche mutable main, et journalise un avis de licence
unique avant le premier téléchargement.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabulaire ouvert : n'importe quels mots, pas de tête figée.# Persiste sur les predict()/track() suivants jusqu'à redéfinition.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" renvoie un point par objet trouvé au lieu d'une boîte.# Changez de tâche sur un modèle chargé via model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # La trappe de sortie sous la couche de détection : questions# libres, comptage, ou tout prompt que le wrapper ne couvre pas.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (tâche detect) et result.points (tâche point) portent la
sortie analysée comme dans toute autre famille. La confiance est un
substitut : LocateAnything n'émet aucun score par boîte, donc chaque détection
reçoit la même confiance constante, et conf= ne fait qu'écarter les lignes
situées sous cette constante, il ne les classe pas. Omettez set_classes() et
le vocabulaire retombe sur les noms COCO-80. Voir la
prédiction pour les sources, le streaming et le traitement des
résultats.
Variantes
Une seule taille publiée, 3b. Deux tâches partagent les mêmes poids : detect
(la valeur par défaut) renvoie des boîtes, et task="point" renvoie à la place
un unique point par objet trouvé, dans result.points ; passez de l'une à
l'autre sur un modèle déjà chargé avec model.set_task("point"). Le harnais de
benchmark de LibreYOLO n'a pas mesuré cette famille, il n'y a donc aucun
chiffre d'exactitude publié auquel se comparer.
LibreYOLO expose cette famille en prédiction seule. train(), val() et
export() lèvent tous NotImplementedError : faites le fine-tuning en amont
et chargez le résultat à la place, la validation sur dataset est écartée parce
qu'une confiance de substitution rendrait la mAP COCO trompeuse, et l'export
est hors périmètre pour un modèle génératif dont aucun state dict n'est là pour
être tracé.
Licence
Vérifiez la licence dans le dépôt Hugging Face des poids précis que vous téléchargez. Chaque checkpoint de l<link>organisation LibreYOLO</link> en possède une, et elles ne sont pas toujours identiques au sein dune même famille. Ce dépôt fait autorité ; le résumé ci-dessous décrit les conditions applicables lors de la dernière vérification de cette page.
Ceci décrit les licences concernées et ne constitue pas un conseil juridique. Si la réponse a une importance commerciale, lisez vous-même les licences et consultez votre propre avocat.
- Travail d'origine
- LocateAnything, NVIDIA
- Licence du projet d'origine
- NVIDIA License (non-commercial)
- Source du projet d'origine
- github.com/NVlabs/Eagle/tree/main/Embodied
- Code de LibreYOLO
- MIT
- Poids
- NVIDIA License (non-commercial), distribués par leurs auteurs. LibreYOLO ne les héberge pas et n'en fournit pas de miroir.
- Interprétation
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
La NVIDIA License autorise l'utilisation, la reproduction et la modification,
mais restreint le modèle et tout dérivé à un usage non commercial, de recherche
ou d'évaluation uniquement, pour quiconque autre que NVIDIA et ses affiliés :
il n'y a ni seuil de revenus ni exception payante. LocateAnything-3B compose
par ailleurs deux autres composants sous licence : un backbone de langage
Qwen2.5-3B-Instruct sous la Qwen Research License, et un encodeur visuel
MoonViT-SO-400M sous MIT. LibreYOLO n'héberge, ne met en miroir ni ne
redistribue rien de tout cela : LibreLocateAnything télécharge les poids et
le code distant requis directement depuis nvidia/LocateAnything-3B sur
Hugging Face, figé sur un commit fixe, lors de sa première exécution.
Citation
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Copié depuis le bloc de citation des auteurs sur github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.