LocateAnything
LocateAnything ist ein Vision-Language-Grounding-Modell von NVIDIA, das Bounding Boxes und Punkte parallel dekodiert statt ein Koordinaten-Token nach dem anderen. LibreYOLO bindet es als Open-Vocabulary-Detektor und Punktlokalisierer ein: Jede Liste von Textlabels wird ohne festen Head oder Fine-Tuning zur Klassenmenge.
- Aufgaben
- detection, point
- Größen
- 3b at 2500 px
- Installation
pip install libreyolo- Supportstufe
- Geschwisterstufe, seit v. Eine separate Produktoberfläche mit eigener Factory und eigenem Vertrag.
- Upstream
- LocateAnything von NVIDIA, NVIDIA License (non-commercial). Publikation, Quelle
- Lizenzen
- Code MIT, Gewichte NVIDIA License (non-commercial). Kommerzielle Nutzung
Installation
LocateAnything benötigt das Zusatzpaket vlm. Dieses installiert
transformers sowie die Pakete decord, lmdb und peft, die der entfernte
Hugging-Face-Code beim Laden importiert.
pip install "libreyolo[vlm]"Vorhersage
LibreLocateAnything ist eine Python-Klasse und kein .pt-Checkpoint. Sie
wird weder über die Factory LibreYOLO() geladen noch von der CLI libreyolo
aufgelöst. Die Factory LibreVLM(...) (from libreyolo import LibreVLM)
erreicht diese Familie ebenfalls über einen Alias, zum Beispiel
LibreVLM("locate-anything"). Sie erzeugt die unten verwendete Klasse. Beim
Laden wird der eigene entfernte Modellcode von NVIDIA auf Hugging Face
heruntergeladen und ausgeführt. LibreYOLO schreibt den Download daher auf eine
feste Commit-Revision statt auf den veränderlichen Branch main fest und
protokolliert vor dem ersten Download einmalig einen Lizenzhinweis.
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Offenes Vokabular: Beliebige Wörter statt eines festen Klassen-Heads. Bleibt# über alle späteren predict()/track()-Aufrufe wirksam, bis es neu gesetzt wird.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" gibt pro passendem Objekt einen Punkt statt einer Box zurück.# Aufgaben auf einem geladenen Modell mit model.set_task("point") wechseln.model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points: print(pt.cls, pt.conf, pt.xy)from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Der direkte Weg unterhalb der Erkennungsfunktion: freie Fragen,# Zählaufgaben oder beliebige Prompts außerhalb des Boxen-Wrappers.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes (Aufgabe detect) und result.points (Aufgabe point)
enthalten die geparste Ausgabe wie bei anderen Familien. Die Confidence ist
ein Platzhalter: LocateAnything gibt keinen Score pro Box aus. Jede Erkennung
erhält deshalb dieselbe konstante Confidence. conf= entfernt nur Zeilen
unterhalb dieser Konstante und sortiert sie nicht. Wenn du set_classes()
überspringst, verwendet das Vokabular standardmäßig die COCO-80-Namen. Unter
Vorhersage findest du Quellen, Streaming und die Verarbeitung
von Ergebnissen.
Varianten
Es gibt eine veröffentlichte Größe, 3b. Zwei Aufgaben verwenden dieselben
Gewichte: detect (der Standardwert) gibt Boxen zurück, task="point" dagegen
einen einzelnen Punkt pro passendem Objekt in result.points. Auf einem
bereits geladenen Modell wechselst du mit model.set_task("point") zwischen
ihnen. Der Benchmark-Testaufbau von LibreYOLO hat diese Familie nicht gemessen.
Es gibt daher keine veröffentlichten Accuracy-Werte für einen Vergleich.
LibreYOLO bietet diese Familie nur für Vorhersagen an. train(), val() und
export() lösen alle NotImplementedError aus. Führe ein Fine-Tuning upstream
durch und lade stattdessen das Ergebnis. Die Datensatzvalidierung wird
übersprungen, weil eine Platzhalter-Confidence den COCO-mAP irreführend machen
würde. Der Export liegt außerhalb des Umfangs eines generativen Modells ohne
tracebares State-Dictionary.
Lizenzierung
Prüfe die Lizenz im Hugging-Face-Repository der konkreten Gewichte, die du herunterlädst. Jeder Checkpoint in der LibreYOLO-Organisation hat eine Lizenz, und sie ist innerhalb einer Familie nicht immer gleich. Dieses Repository ist die maßgebliche Quelle. Die Zusammenfassung unten beschreibt den Stand bei der letzten Verifizierung dieser Seite.
Dies ist eine Beschreibung der beteiligten Lizenzen und keine Rechtsberatung. Wenn die Antwort kommerziell relevant ist, lies die Lizenzen selbst und hole eigenen Rechtsrat ein.
- Originalarbeit
- LocateAnything, NVIDIA
- Upstream-Lizenz
- NVIDIA License (non-commercial)
- Upstream-Quelle
- github.com/NVlabs/Eagle/tree/main/Embodied
- LibreYOLO-Code
- MIT
- Gewichte
- NVIDIA License (non-commercial), von den Autoren verbreitet. LibreYOLO hostet oder spiegelt sie nicht.
- Einordnung
- The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.
Die NVIDIA License erlaubt Nutzung, Vervielfältigung und Änderung, beschränkt
das Modell und alle abgeleiteten Werke für alle außer NVIDIA und verbundene
Unternehmen jedoch auf nicht kommerzielle Nutzung, Forschung oder Auswertung.
Es gibt weder einen Umsatzschwellenwert noch eine bezahlte Ausnahme.
LocateAnything-3B kombiniert außerdem zwei weitere lizenzierte Komponenten:
ein Sprach-Backbone Qwen2.5-3B-Instruct unter der Qwen Research License und
einen Vision-Encoder MoonViT-SO-400M unter MIT. LibreYOLO hostet, spiegelt oder
verteilt nichts davon. LibreLocateAnything lädt bei der ersten Ausführung die
Gewichte und den erforderlichen entfernten Code direkt aus
nvidia/LocateAnything-3B auf Hugging Face, festgeschrieben auf einen Commit.
Zitieren
@article{wang2025locateanything,
title = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
author = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
journal = {arXiv:2605.27365},
year = {2026},
}Aus dem Zitierblock der Autoren unter github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation kopiert.