LocateAnything

LocateAnything to model groundingu wizyjno-językowego wydany przez NVIDIA, który dekoduje ramki ograniczające i punkty równolegle zamiast po jednym tokenie współrzędnych. LibreYOLO udostępnia go jako detektor i wskaźnik z otwartym słownikiem: dowolna lista etykiet tekstowych staje się zbiorem klas, bez stałej głowicy i bez potrzeby dostrajania.

Zadania
detection, point
Rozmiary
3b at 2500 px
Instalacja
pip install libreyolo
Poziom obsługi
Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
Projekt źródłowy
LocateAnything, autorzy: NVIDIA, licencja: NVIDIA License (non-commercial). Publikacja, kod źródłowy
Licencje
Kod: MIT, wagi: NVIDIA License (non-commercial). Użycie komercyjne

Instalacja

LocateAnything wymaga dodatku vlm, który instaluje transformers oraz pakiety decord, lmdb i peft importowane podczas wczytywania przez zdalny kod modelu z Hugging Face.

bash
pip install "libreyolo[vlm]"

Predykcja

LibreLocateAnything jest klasą Pythona, a nie checkpointem .pt. Nie jest wczytywany przez fabrykę LibreYOLO(), a CLI libreyolo go nie rozpoznaje. Fabryka LibreVLM(...) (from libreyolo import LibreVLM) także udostępnia tę rodzinę przez alias, na przykład LibreVLM("locate-anything"). Użyta poniżej klasa jest tym, co tworzy ta fabryka. Wczytanie pobiera i wykonuje własny zdalny kod modelu NVIDIA z Hugging Face, dlatego LibreYOLO przypina pobieranie do jednej stałej rewizji commita zamiast zmiennej gałęzi main i jednorazowo wypisuje informację o licencji przed pierwszym pobraniem.

Python
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Otwarty słownik: działają dowolne słowa, a nie stała głowica klas. Ustawienie# obowiązuje w każdym późniejszym wywołaniu predict()/track(), dopóki nie zostanie zmienione.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Sterowanie promptem punktowym
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" zwraca jeden punkt dla każdego dopasowanego obiektu zamiast ramki.# Zadania we wczytanym modelu przełącza model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points:    print(pt.cls, pt.conf, pt.xy)
Surowy czat
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Bezpośredni dostęp pod wygodną warstwą detekcji: swobodne pytania,# zliczanie lub dowolny prompt nieobsługiwany przez wrapper ramek.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes (zadanie detect) i result.points (zadanie point) zawierają przetworzone wyjście tak jak w każdej innej rodzinie. Pewność jest wartością zastępczą. LocateAnything nie zwraca wyniku dla poszczególnych ramek, dlatego każda detekcja otrzymuje tę samą stałą pewność, a conf= jedynie odrzuca wiersze poniżej tej stałej, bez ich klasyfikowania. Pominięcie set_classes() pozostawia domyślne nazwy COCO-80. Więcej informacji o źródłach, streamingu i obsłudze wyników zawiera strona predykcji.

Warianty

Opublikowano jeden rozmiar, 3b. Dwa zadania współdzielą te same wagi: detect (domyślne) zwraca ramki, a task="point" zwraca zamiast nich jeden punkt na dopasowany obiekt w result.points. We wczytanym modelu można je przełączać za pomocą model.set_task("point"). Zestaw testowy LibreYOLO nie wykonał pomiarów tej rodziny, dlatego nie ma opublikowanych wyników dokładności do porównania.

LibreYOLO udostępnia tę rodzinę wyłącznie do predykcji. train(), val() i export() zawsze zgłaszają NotImplementedError. Model należy dostroić w projekcie źródłowym i wczytać wynik. Walidacja zbioru danych jest pomijana, ponieważ zastępcza pewność nadawałaby metryce COCO mAP mylący charakter, a eksport pozostaje poza zakresem modelu generatywnego bez state dict możliwego do śledzenia.

Licencja

Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.

To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.

Oryginalna praca
LocateAnything, NVIDIA
Licencja projektu źródłowego
NVIDIA License (non-commercial)
Kod LibreYOLO
MIT
Wagi
NVIDIA License (non-commercial), rozpowszechniane przez autorów. LibreYOLO ich nie hostuje ani nie udostępnia kopii.
Interpretacja
The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.

Licencja NVIDIA zezwala na użycie, powielanie i modyfikację, ale dla podmiotów innych niż NVIDIA i jej jednostki stowarzyszone ogranicza model oraz wszelkie pochodne wyłącznie do zastosowań niekomercyjnych, badawczych lub ewaluacyjnych. Nie ma progu przychodów ani płatnego wyjątku. LocateAnything-3B łączy także dwa inne licencjonowane komponenty: backbone językowy Qwen2.5-3B-Instruct na licencji Qwen Research License oraz enkoder wizyjny MoonViT-SO-400M na licencji MIT. LibreYOLO nie hostuje, nie tworzy kopii lustrzanej ani nie redystrybuuje żadnego z nich. Przy pierwszym uruchomieniu LibreLocateAnything pobiera wagi i wymagany zdalny kod bezpośrednio z nvidia/LocateAnything-3B na Hugging Face, przypięte do jednego stałego commita.

Cytowanie

@article{wang2025locateanything,
  title   = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author  = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
             Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
             Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal = {arXiv:2605.27365},
  year    = {2026},
}

Skopiowano z bloku cytowania autorów w github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.

Zweryfikowano z LibreYOLO v1.5.0. Tabele obsługi, checkpointy i wyniki benchmarków na tej stronie są generowane na podstawie wydanej biblioteki i opublikowanych wag, a nie wpisywane ręcznie.