Ver como markdown

LocateAnything

O LocateAnything é um modelo de grounding de visão e linguagem lançado pela NVIDIA que decodifica bounding boxes e pontos em paralelo, em vez de ir um token de coordenada por vez. O LibreYOLO o envolve como detector e localizador por pontos de vocabulário aberto: qualquer lista de rótulos de texto vira o conjunto de classes, sem cabeça fixa e sem precisar de fine-tuning.

Tarefas
detection, point
Tamanhos
3b at 2500 px
Instalação
pip install libreyolo
Nível de suporte
Nível irmão, desde a v. Uma superfície de produto separada, com sua própria fábrica e seu próprio contrato.
Origem
LocateAnything por NVIDIA, NVIDIA License (non-commercial). Artigo, código-fonte
Licenças
Código MIT, pesos NVIDIA License (non-commercial). Uso comercial

Instalação

O LocateAnything precisa do extra vlm, que traz junto o transformers mais os pacotes decord, lmdb e peft que o código remoto dele no Hugging Face importa no carregamento.

bash
pip install "libreyolo[vlm]"

Predição

LibreLocateAnything é uma classe Python, não um checkpoint .pt: ele não é carregado pela factory LibreYOLO(), e a CLI libreyolo não o resolve. A factory LibreVLM(...) (from libreyolo import LibreVLM) também alcança esta família por alias, por exemplo LibreVLM("locate-anything"); a classe usada abaixo é a que ela constrói. Carregá-lo baixa e executa o código remoto do próprio modelo da NVIDIA no Hugging Face, então o LibreYOLO fixa o download em uma revisão de commit fixa em vez do branch mutável main, e registra um aviso de licença único antes do primeiro download.

Python
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Vocabulário aberto: vale qualquer palavra, não uma cabeça de# classes fixa. Persiste em cada predict()/track() posterior até# ser definido de novo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Prompt de ponto
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" devolve um ponto por objeto encontrado, em vez de# uma caixa. Troque de tarefa em um modelo já carregado com# model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points:    print(pt.cls, pt.conf, pt.xy)
Chat direto
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # A via de escape sob a comodidade da detecção: perguntas livres,# contagens ou qualquer prompt que o wrapper de boxes não cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes (tarefa detect) e result.points (tarefa point) carregam a saída já parseada como em qualquer outra família. A confiança é um marcador de posição: o LocateAnything não emite nenhuma pontuação por box, então toda detecção recebe a mesma confiança constante, e conf= só descarta as linhas abaixo dessa constante, ele não as ordena. Pule set_classes() e o vocabulário cai nos nomes do COCO-80 por padrão. Veja predição para fontes, streaming e tratamento de resultados.

Variantes

Um único tamanho publicado, 3b. Duas tarefas compartilham os mesmos pesos: detect (a padrão) devolve boxes, e task="point" devolve no lugar um único ponto por objeto encontrado, em result.points; alterne entre elas em um modelo já carregado com model.set_task("point"). O harness de benchmark do LibreYOLO não mediu esta família, então não há números de acurácia publicados para comparação.

O LibreYOLO expõe esta família apenas para predição. train(), val() e export() levantam todos NotImplementedError: faça o fine-tuning upstream e carregue o resultado, a validação sobre dataset é ignorada porque uma confiança de marcador de posição tornaria o mAP do COCO enganoso, e a exportação está fora de escopo para um modelo generativo sem state dict para traçar.

Licenciamento

Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.

Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.

Trabalho original
LocateAnything, NVIDIA
Licença original
NVIDIA License (non-commercial)
Código do LibreYOLO
MIT
Pesos
NVIDIA License (non-commercial), distribuído pelos autores. O LibreYOLO não hospeda nem espelha esses pesos.
Interpretação
The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.

A NVIDIA License permite uso, reprodução e modificação, mas restringe o modelo e qualquer derivado a uso não comercial, de pesquisa ou de avaliação apenas, para qualquer um que não seja a NVIDIA e suas afiliadas: não há limite de receita nem exceção paga. O LocateAnything-3B também combina outros dois componentes licenciados: um backbone de linguagem Qwen2.5-3B-Instruct sob a Qwen Research License, e um codificador de visão MoonViT-SO-400M sob MIT. O LibreYOLO não hospeda, espelha nem redistribui nada disso: LibreLocateAnything baixa os pesos e o código remoto necessário diretamente de nvidia/LocateAnything-3B no Hugging Face, fixado em um único commit, na primeira vez que roda.

Citação

@article{wang2025locateanything,
  title   = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author  = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
             Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
             Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal = {arXiv:2605.27365},
  year    = {2026},
}

Copiado do bloco de citação dos autores em github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.

Verificado com o LibreYOLO v1.5.0. As tabelas de suporte, os checkpoints e os números de benchmark desta página são gerados a partir da biblioteca lançada e dos pesos publicados, não escritos à mão.