LocateAnything
LocateAnything es un modelo de grounding de visión y lenguaje publicado por NVIDIA que decodifica bounding boxes y puntos en paralelo, en lugar de ir token de coordenada en token de coordenada. LibreYOLO lo envuelve como detector y localizador por puntos de vocabulario abierto: cualquier lista de etiquetas de texto se convierte en el conjunto de clases, sin cabeza fija y sin necesidad de hacer fine-tuning.
- Tareas
- detection, point
- Tamaños
- 3b at 2500 px
- Instalación
pip install libreyolo- Nivel de compatibilidad
- Nivel hermano, desde v. Una superficie de producto independiente con su propia factoría y su propio contrato.
- Licencias
- Código MIT, pesos NVIDIA License (non-commercial). Uso comercial
Instalación
LocateAnything necesita el extra vlm, que arrastra transformers junto con
los paquetes decord, lmdb y peft que importa al cargarse su código
remoto de Hugging Face.
pip install "libreyolo[vlm]"Predicción
LibreLocateAnything es una clase de Python, no un checkpoint .pt: no se
carga a través de la factoría LibreYOLO() y la CLI de libreyolo no lo
resuelve. La factoría LibreVLM(...) (from libreyolo import LibreVLM)
también llega a esta familia por alias, por ejemplo
LibreVLM("locate-anything"); la clase que se usa abajo es lo que construye.
Cargarla descarga y ejecuta el código remoto del modelo publicado por NVIDIA
en Hugging Face, así que LibreYOLO fija la descarga a una revisión de commit
concreta en lugar de a la rama mutable main, y registra un aviso de licencia
una única vez antes de la primera descarga.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabulario abierto: vale cualquier palabra, no una cabeza de clases# fija. Persiste en cada predict()/track() posterior hasta volver a fijarlo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" devuelve un punto por objeto encontrado en vez de una caja.# Cambia de tarea en un modelo ya cargado con model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # La vía de escape bajo la comodidad de la detección: preguntas libres,# recuentos o cualquier prompt que el envoltorio de cajas no cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (tarea detect) y result.points (tarea point) llevan la
salida parseada igual que en cualquier otra familia. La confianza es un
marcador de posición: LocateAnything no emite ninguna puntuación por caja, así
que todas las detecciones reciben la misma confianza constante, y conf= solo
descarta las filas por debajo de esa constante, no las ordena. Si te saltas
set_classes(), el vocabulario cae por defecto en los nombres de COCO-80.
Consulta predicción para fuentes, streaming y manejo de
resultados.
Variantes
Un único tamaño publicado, 3b. Dos tareas comparten los mismos pesos: detect
(la predeterminada) devuelve cajas y task="point" devuelve en su lugar un
único punto por objeto encontrado, en result.points; se cambia de una a otra
sobre un modelo ya cargado con model.set_task("point"). El harness de
benchmarks de LibreYOLO no ha medido esta familia, así que no hay cifras de
precisión publicadas con las que compararlo.
LibreYOLO expone esta familia solo para predicción. train(), val() y
export() lanzan todos NotImplementedError: haz el fine-tuning upstream y
carga el resultado, la validación sobre dataset se omite porque una confianza
de marcador de posición haría engañoso el mAP de COCO, y la exportación queda
fuera del alcance para un modelo generativo sin state dict que trazar.
Licencia
Comprueba la licencia en el repositorio de Hugging Face de los pesos concretos que descargues. Cada checkpoint de la organización de LibreYOLO incluye una, y no siempre es la misma en toda una familia. Ese repositorio es la fuente autorizada; el resumen siguiente describe qué se aplicaba cuando se verificó esta página por última vez.
Esta es una descripción de las licencias implicadas, no asesoramiento legal. Si la respuesta es importante a nivel comercial, lee las licencias y busca tu propio asesoramiento.
- Trabajo original
- LocateAnything, NVIDIA
- Licencia del proyecto original
- NVIDIA License (non-commercial)
- Fuente del proyecto original
- github.com/NVlabs/Eagle/tree/main/Embodied
- Código de LibreYOLO
- MIT
- Pesos
- NVIDIA License (non-commercial), distribuidos por sus autores. LibreYOLO no los aloja ni los replica.
- Interpretación
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
La NVIDIA License permite el uso, la reproducción y la modificación, pero
restringe el modelo y cualquier derivado a uso no comercial, de investigación
o de evaluación únicamente, para cualquiera que no sea NVIDIA y sus filiales:
no hay ningún umbral de ingresos ni excepción de pago. LocateAnything-3B
además combina otros dos componentes con licencia propia: un backbone de
lenguaje Qwen2.5-3B-Instruct bajo la Qwen Research License y un codificador de
visión MoonViT-SO-400M bajo MIT. LibreYOLO no aloja, replica ni redistribuye
nada de ello: LibreLocateAnything descarga los pesos y el código remoto
necesario directamente de nvidia/LocateAnything-3B en Hugging Face, fijados a
un commit concreto, la primera vez que se ejecuta.
Cita
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Copiado del bloque de cita de los autores en github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.