LocateAnything
O LocateAnything é um modelo de grounding de visão e linguagem lançado pela NVIDIA que decodifica bounding boxes e pontos em paralelo, em vez de ir um token de coordenada por vez. O LibreYOLO o envolve como detector e localizador por pontos de vocabulário aberto: qualquer lista de rótulos de texto vira o conjunto de classes, sem cabeça fixa e sem precisar de fine-tuning.
- Tarefas
- detection, point
- Tamanhos
- 3b at 2500 px
- Instalação
pip install libreyolo- Nível de suporte
- Nível irmão, desde a v. Uma superfície de produto separada, com sua própria fábrica e seu próprio contrato.
- Origem
- LocateAnything por NVIDIA, NVIDIA License (non-commercial). Artigo, código-fonte
- Licenças
- Código MIT, pesos NVIDIA License (non-commercial). Uso comercial
Instalação
O LocateAnything precisa do extra vlm, que traz junto o transformers mais
os pacotes decord, lmdb e peft que o código remoto dele no Hugging Face
importa no carregamento.
pip install "libreyolo[vlm]"Predição
LibreLocateAnything é uma classe Python, não um checkpoint .pt: ele não é
carregado pela factory LibreYOLO(), e a CLI libreyolo não o resolve. A
factory LibreVLM(...) (from libreyolo import LibreVLM) também alcança esta
família por alias, por exemplo LibreVLM("locate-anything"); a classe usada
abaixo é a que ela constrói. Carregá-lo baixa e executa o código remoto do
próprio modelo da NVIDIA no Hugging Face, então o LibreYOLO fixa o download em
uma revisão de commit fixa em vez do branch mutável main, e registra um aviso
de licença único antes do primeiro download.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabulário aberto: vale qualquer palavra, não uma cabeça de# classes fixa. Persiste em cada predict()/track() posterior até# ser definido de novo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" devolve um ponto por objeto encontrado, em vez de# uma caixa. Troque de tarefa em um modelo já carregado com# model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # A via de escape sob a comodidade da detecção: perguntas livres,# contagens ou qualquer prompt que o wrapper de boxes não cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (tarefa detect) e result.points (tarefa point) carregam a
saída já parseada como em qualquer outra família. A confiança é um marcador de
posição: o LocateAnything não emite nenhuma pontuação por box, então toda
detecção recebe a mesma confiança constante, e conf= só descarta as linhas
abaixo dessa constante, ele não as ordena. Pule set_classes() e o vocabulário
cai nos nomes do COCO-80 por padrão. Veja predição para
fontes, streaming e tratamento de resultados.
Variantes
Um único tamanho publicado, 3b. Duas tarefas compartilham os mesmos pesos:
detect (a padrão) devolve boxes, e task="point" devolve no lugar um único
ponto por objeto encontrado, em result.points; alterne entre elas em um
modelo já carregado com model.set_task("point"). O harness de benchmark do
LibreYOLO não mediu esta família, então não há números de acurácia publicados
para comparação.
O LibreYOLO expõe esta família apenas para predição. train(), val() e
export() levantam todos NotImplementedError: faça o fine-tuning upstream e
carregue o resultado, a validação sobre dataset é ignorada porque uma confiança
de marcador de posição tornaria o mAP do COCO enganoso, e a exportação está
fora de escopo para um modelo generativo sem state dict para traçar.
Licenciamento
Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.
Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.
- Trabalho original
- LocateAnything, NVIDIA
- Licença original
- NVIDIA License (non-commercial)
- Código-fonte original
- github.com/NVlabs/Eagle/tree/main/Embodied
- Código do LibreYOLO
- MIT
- Pesos
- NVIDIA License (non-commercial), distribuído pelos autores. O LibreYOLO não hospeda nem espelha esses pesos.
- Interpretação
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
A NVIDIA License permite uso, reprodução e modificação, mas restringe o modelo
e qualquer derivado a uso não comercial, de pesquisa ou de avaliação apenas,
para qualquer um que não seja a NVIDIA e suas afiliadas: não há limite de
receita nem exceção paga. O LocateAnything-3B também combina outros dois
componentes licenciados: um backbone de linguagem Qwen2.5-3B-Instruct sob a
Qwen Research License, e um codificador de visão MoonViT-SO-400M sob MIT. O
LibreYOLO não hospeda, espelha nem redistribui nada disso:
LibreLocateAnything baixa os pesos e o código remoto necessário diretamente
de nvidia/LocateAnything-3B no Hugging Face, fixado em um único commit, na
primeira vez que roda.
Citação
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Copiado do bloco de citação dos autores em github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.