LocateAnything

LocateAnything est un modèle de grounding vision-langage publié par NVIDIA qui décode les boîtes englobantes et les points en parallèle plutôt qu'un token de coordonnée à la fois. LibreYOLO l'intègre comme détecteur et pointeur à vocabulaire ouvert : n'importe quelle liste d'étiquettes texte devient l'ensemble de classes, sans tête figée et sans fine-tuning requis.

Tâches
detection, point
Tailles
3b at 2500 px
Installer
pip install libreyolo
Niveau de support
Niveau parallèle, depuis v. Une interface produit distincte avec sa propre factory et son propre contrat.
Origine
LocateAnything par NVIDIA, NVIDIA License (non-commercial). Article, source
Licences
Code MIT, poids NVIDIA License (non-commercial). Usage commercial

Installation

LocateAnything a besoin de l'extra vlm, qui installe transformers ainsi que les paquets decord, lmdb et peft que son code distant Hugging Face importe au chargement.

bash
pip install "libreyolo[vlm]"

Prédire

LibreLocateAnything est une classe Python, pas un checkpoint .pt : elle ne se charge pas via la factory LibreYOLO(), et la CLI libreyolo ne la résout pas. La factory LibreVLM(...) (from libreyolo import LibreVLM) atteint elle aussi cette famille par alias, par exemple LibreVLM("locate-anything") ; la classe utilisée ci-dessous est celle qu'elle construit. Son chargement télécharge et exécute le code de modèle distant de NVIDIA depuis Hugging Face, si bien que LibreYOLO fige le téléchargement sur une révision de commit fixe plutôt que sur la branche mutable main, et journalise un avis de licence unique avant le premier téléchargement.

Python
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabulaire ouvert : n'importe quels mots, pas de tête figée.# Persiste sur les predict()/track() suivants jusqu'à redéfinition.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Prompt de pointage
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" renvoie un point par objet trouvé au lieu d'une boîte.# Changez de tâche sur un modèle chargé via model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points:    print(pt.cls, pt.conf, pt.xy)
Chat brut
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # La trappe de sortie sous la couche de détection : questions# libres, comptage, ou tout prompt que le wrapper ne couvre pas.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes (tâche detect) et result.points (tâche point) portent la sortie analysée comme dans toute autre famille. La confiance est un substitut : LocateAnything n'émet aucun score par boîte, donc chaque détection reçoit la même confiance constante, et conf= ne fait qu'écarter les lignes situées sous cette constante, il ne les classe pas. Omettez set_classes() et le vocabulaire retombe sur les noms COCO-80. Voir la prédiction pour les sources, le streaming et le traitement des résultats.

Variantes

Une seule taille publiée, 3b. Deux tâches partagent les mêmes poids : detect (la valeur par défaut) renvoie des boîtes, et task="point" renvoie à la place un unique point par objet trouvé, dans result.points ; passez de l'une à l'autre sur un modèle déjà chargé avec model.set_task("point"). Le harnais de benchmark de LibreYOLO n'a pas mesuré cette famille, il n'y a donc aucun chiffre d'exactitude publié auquel se comparer.

LibreYOLO expose cette famille en prédiction seule. train(), val() et export() lèvent tous NotImplementedError : faites le fine-tuning en amont et chargez le résultat à la place, la validation sur dataset est écartée parce qu'une confiance de substitution rendrait la mAP COCO trompeuse, et l'export est hors périmètre pour un modèle génératif dont aucun state dict n'est là pour être tracé.

Licence

Vérifiez la licence dans le dépôt Hugging Face des poids précis que vous téléchargez. Chaque checkpoint de l<link>organisation LibreYOLO</link> en possède une, et elles ne sont pas toujours identiques au sein dune même famille. Ce dépôt fait autorité ; le résumé ci-dessous décrit les conditions applicables lors de la dernière vérification de cette page.

Ceci décrit les licences concernées et ne constitue pas un conseil juridique. Si la réponse a une importance commerciale, lisez vous-même les licences et consultez votre propre avocat.

Travail d'origine
LocateAnything, NVIDIA
Licence du projet d'origine
NVIDIA License (non-commercial)
Code de LibreYOLO
MIT
Poids
NVIDIA License (non-commercial), distribués par leurs auteurs. LibreYOLO ne les héberge pas et n'en fournit pas de miroir.
Interprétation
The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.

La NVIDIA License autorise l'utilisation, la reproduction et la modification, mais restreint le modèle et tout dérivé à un usage non commercial, de recherche ou d'évaluation uniquement, pour quiconque autre que NVIDIA et ses affiliés : il n'y a ni seuil de revenus ni exception payante. LocateAnything-3B compose par ailleurs deux autres composants sous licence : un backbone de langage Qwen2.5-3B-Instruct sous la Qwen Research License, et un encodeur visuel MoonViT-SO-400M sous MIT. LibreYOLO n'héberge, ne met en miroir ni ne redistribue rien de tout cela : LibreLocateAnything télécharge les poids et le code distant requis directement depuis nvidia/LocateAnything-3B sur Hugging Face, figé sur un commit fixe, lors de sa première exécution.

Citation

@article{wang2025locateanything,
  title   = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author  = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
             Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
             Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal = {arXiv:2605.27365},
  year    = {2026},
}

Copié depuis le bloc de citation des auteurs sur github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.

Vérifié avec LibreYOLO v1.5.0. Les tableaux de support, les checkpoints et les chiffres de benchmark de cette page sont générés à partir de la bibliothèque publiée et des poids publiés, et non rédigés à la main.