Ver como Markdown

LocateAnything

LocateAnything es un modelo de grounding de visión y lenguaje publicado por NVIDIA que decodifica bounding boxes y puntos en paralelo, en lugar de ir token de coordenada en token de coordenada. LibreYOLO lo envuelve como detector y localizador por puntos de vocabulario abierto: cualquier lista de etiquetas de texto se convierte en el conjunto de clases, sin cabeza fija y sin necesidad de hacer fine-tuning.

Tareas
detection, point
Tamaños
3b at 2500 px
Instalación
pip install libreyolo
Nivel de compatibilidad
Nivel hermano, desde v. Una superficie de producto independiente con su propia factoría y su propio contrato.
Proyecto original
LocateAnything de NVIDIA, NVIDIA License (non-commercial). Artículo, fuente
Licencias
Código MIT, pesos NVIDIA License (non-commercial). Uso comercial

Instalación

LocateAnything necesita el extra vlm, que arrastra transformers junto con los paquetes decord, lmdb y peft que importa al cargarse su código remoto de Hugging Face.

bash
pip install "libreyolo[vlm]"

Predicción

LibreLocateAnything es una clase de Python, no un checkpoint .pt: no se carga a través de la factoría LibreYOLO() y la CLI de libreyolo no lo resuelve. La factoría LibreVLM(...) (from libreyolo import LibreVLM) también llega a esta familia por alias, por ejemplo LibreVLM("locate-anything"); la clase que se usa abajo es lo que construye. Cargarla descarga y ejecuta el código remoto del modelo publicado por NVIDIA en Hugging Face, así que LibreYOLO fija la descarga a una revisión de commit concreta en lugar de a la rama mutable main, y registra un aviso de licencia una única vez antes de la primera descarga.

Python
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabulario abierto: vale cualquier palabra, no una cabeza de clases# fija. Persiste en cada predict()/track() posterior hasta volver a fijarlo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Prompt de punto
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" devuelve un punto por objeto encontrado en vez de una caja.# Cambia de tarea en un modelo ya cargado con model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points:    print(pt.cls, pt.conf, pt.xy)
Chat directo
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # La vía de escape bajo la comodidad de la detección: preguntas libres,# recuentos o cualquier prompt que el envoltorio de cajas no cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes (tarea detect) y result.points (tarea point) llevan la salida parseada igual que en cualquier otra familia. La confianza es un marcador de posición: LocateAnything no emite ninguna puntuación por caja, así que todas las detecciones reciben la misma confianza constante, y conf= solo descarta las filas por debajo de esa constante, no las ordena. Si te saltas set_classes(), el vocabulario cae por defecto en los nombres de COCO-80. Consulta predicción para fuentes, streaming y manejo de resultados.

Variantes

Un único tamaño publicado, 3b. Dos tareas comparten los mismos pesos: detect (la predeterminada) devuelve cajas y task="point" devuelve en su lugar un único punto por objeto encontrado, en result.points; se cambia de una a otra sobre un modelo ya cargado con model.set_task("point"). El harness de benchmarks de LibreYOLO no ha medido esta familia, así que no hay cifras de precisión publicadas con las que compararlo.

LibreYOLO expone esta familia solo para predicción. train(), val() y export() lanzan todos NotImplementedError: haz el fine-tuning upstream y carga el resultado, la validación sobre dataset se omite porque una confianza de marcador de posición haría engañoso el mAP de COCO, y la exportación queda fuera del alcance para un modelo generativo sin state dict que trazar.

Licencia

Comprueba la licencia en el repositorio de Hugging Face de los pesos concretos que descargues. Cada checkpoint de la organización de LibreYOLO incluye una, y no siempre es la misma en toda una familia. Ese repositorio es la fuente autorizada; el resumen siguiente describe qué se aplicaba cuando se verificó esta página por última vez.

Esta es una descripción de las licencias implicadas, no asesoramiento legal. Si la respuesta es importante a nivel comercial, lee las licencias y busca tu propio asesoramiento.

Trabajo original
LocateAnything, NVIDIA
Licencia del proyecto original
NVIDIA License (non-commercial)
Fuente del proyecto original
github.com/NVlabs/Eagle/tree/main/Embodied
Código de LibreYOLO
MIT
Pesos
NVIDIA License (non-commercial), distribuidos por sus autores. LibreYOLO no los aloja ni los replica.
Interpretación
The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.

La NVIDIA License permite el uso, la reproducción y la modificación, pero restringe el modelo y cualquier derivado a uso no comercial, de investigación o de evaluación únicamente, para cualquiera que no sea NVIDIA y sus filiales: no hay ningún umbral de ingresos ni excepción de pago. LocateAnything-3B además combina otros dos componentes con licencia propia: un backbone de lenguaje Qwen2.5-3B-Instruct bajo la Qwen Research License y un codificador de visión MoonViT-SO-400M bajo MIT. LibreYOLO no aloja, replica ni redistribuye nada de ello: LibreLocateAnything descarga los pesos y el código remoto necesario directamente de nvidia/LocateAnything-3B en Hugging Face, fijados a un commit concreto, la primera vez que se ejecuta.

Cita

@article{wang2025locateanything,
  title   = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author  = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
             Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
             Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal = {arXiv:2605.27365},
  year    = {2026},
}

Copiado del bloque de cita de los autores en github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.

Verificado con LibreYOLO v1.5.0. Las tablas de compatibilidad, los checkpoints y las cifras de rendimiento de esta página se generan a partir de la biblioteca publicada y los pesos publicados; no se escriben a mano.