LocateAnything
LocateAnything to model groundingu wizyjno-językowego wydany przez NVIDIA, który dekoduje ramki ograniczające i punkty równolegle zamiast po jednym tokenie współrzędnych. LibreYOLO udostępnia go jako detektor i wskaźnik z otwartym słownikiem: dowolna lista etykiet tekstowych staje się zbiorem klas, bez stałej głowicy i bez potrzeby dostrajania.
- Zadania
- detection, point
- Rozmiary
- 3b at 2500 px
- Instalacja
pip install libreyolo- Poziom obsługi
- Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
- Projekt źródłowy
- LocateAnything, autorzy: NVIDIA, licencja: NVIDIA License (non-commercial). Publikacja, kod źródłowy
- Licencje
- Kod: MIT, wagi: NVIDIA License (non-commercial). Użycie komercyjne
Instalacja
LocateAnything wymaga dodatku vlm, który instaluje transformers oraz pakiety
decord, lmdb i peft importowane podczas wczytywania przez zdalny kod modelu
z Hugging Face.
pip install "libreyolo[vlm]"Predykcja
LibreLocateAnything jest klasą Pythona, a nie checkpointem .pt. Nie jest
wczytywany przez fabrykę LibreYOLO(), a CLI libreyolo go nie rozpoznaje.
Fabryka LibreVLM(...) (from libreyolo import LibreVLM) także udostępnia tę
rodzinę przez alias, na przykład LibreVLM("locate-anything"). Użyta poniżej
klasa jest tym, co tworzy ta fabryka. Wczytanie pobiera i wykonuje własny zdalny
kod modelu NVIDIA z Hugging Face, dlatego LibreYOLO przypina pobieranie do jednej
stałej rewizji commita zamiast zmiennej gałęzi main i jednorazowo wypisuje
informację o licencji przed pierwszym pobraniem.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Otwarty słownik: działają dowolne słowa, a nie stała głowica klas. Ustawienie# obowiązuje w każdym późniejszym wywołaniu predict()/track(), dopóki nie zostanie zmienione.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" zwraca jeden punkt dla każdego dopasowanego obiektu zamiast ramki.# Zadania we wczytanym modelu przełącza model.set_task("point").model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Bezpośredni dostęp pod wygodną warstwą detekcji: swobodne pytania,# zliczanie lub dowolny prompt nieobsługiwany przez wrapper ramek.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (zadanie detect) i result.points (zadanie point) zawierają
przetworzone wyjście tak jak w każdej innej rodzinie. Pewność jest wartością
zastępczą. LocateAnything nie zwraca wyniku dla poszczególnych ramek, dlatego
każda detekcja otrzymuje tę samą stałą pewność, a conf= jedynie odrzuca
wiersze poniżej tej stałej, bez ich klasyfikowania. Pominięcie set_classes()
pozostawia domyślne nazwy COCO-80. Więcej informacji o źródłach, streamingu i
obsłudze wyników zawiera strona predykcji.
Warianty
Opublikowano jeden rozmiar, 3b. Dwa zadania współdzielą te same wagi: detect
(domyślne) zwraca ramki, a task="point" zwraca zamiast nich jeden punkt na
dopasowany obiekt w result.points. We wczytanym modelu można je przełączać za
pomocą model.set_task("point"). Zestaw testowy LibreYOLO nie wykonał pomiarów
tej rodziny, dlatego nie ma opublikowanych wyników dokładności do porównania.
LibreYOLO udostępnia tę rodzinę wyłącznie do predykcji. train(), val() i
export() zawsze zgłaszają NotImplementedError. Model należy dostroić w
projekcie źródłowym i wczytać wynik. Walidacja zbioru danych jest pomijana,
ponieważ zastępcza pewność nadawałaby metryce COCO mAP mylący charakter, a
eksport pozostaje poza zakresem modelu generatywnego bez state dict możliwego do
śledzenia.
Licencja
Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.
To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.
- Oryginalna praca
- LocateAnything, NVIDIA
- Licencja projektu źródłowego
- NVIDIA License (non-commercial)
- Kod źródłowy projektu
- github.com/NVlabs/Eagle/tree/main/Embodied
- Kod LibreYOLO
- MIT
- Wagi
- NVIDIA License (non-commercial), rozpowszechniane przez autorów. LibreYOLO ich nie hostuje ani nie udostępnia kopii.
- Interpretacja
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
Licencja NVIDIA zezwala na użycie, powielanie i modyfikację, ale dla podmiotów
innych niż NVIDIA i jej jednostki stowarzyszone ogranicza model oraz wszelkie
pochodne wyłącznie do zastosowań niekomercyjnych, badawczych lub ewaluacyjnych.
Nie ma progu przychodów ani płatnego wyjątku. LocateAnything-3B łączy także dwa
inne licencjonowane komponenty: backbone językowy Qwen2.5-3B-Instruct na
licencji Qwen Research License oraz enkoder wizyjny MoonViT-SO-400M na licencji
MIT. LibreYOLO nie hostuje, nie tworzy kopii lustrzanej ani nie redystrybuuje
żadnego z nich. Przy pierwszym uruchomieniu LibreLocateAnything pobiera wagi i
wymagany zdalny kod bezpośrednio z nvidia/LocateAnything-3B na Hugging Face,
przypięte do jednego stałego commita.
Cytowanie
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Skopiowano z bloku cytowania autorów w github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation.