Als Markdown anzeigen

LocateAnything

LocateAnything ist ein Vision-Language-Grounding-Modell von NVIDIA, das Bounding Boxes und Punkte parallel dekodiert statt ein Koordinaten-Token nach dem anderen. LibreYOLO bindet es als Open-Vocabulary-Detektor und Punktlokalisierer ein: Jede Liste von Textlabels wird ohne festen Head oder Fine-Tuning zur Klassenmenge.

Aufgaben
detection, point
Größen
3b at 2500 px
Installation
pip install libreyolo
Supportstufe
Geschwisterstufe, seit v. Eine separate Produktoberfläche mit eigener Factory und eigenem Vertrag.
Upstream
LocateAnything von NVIDIA, NVIDIA License (non-commercial). Publikation, Quelle
Lizenzen
Code MIT, Gewichte NVIDIA License (non-commercial). Kommerzielle Nutzung

Installation

LocateAnything benötigt das Zusatzpaket vlm. Dieses installiert transformers sowie die Pakete decord, lmdb und peft, die der entfernte Hugging-Face-Code beim Laden importiert.

bash
pip install "libreyolo[vlm]"

Vorhersage

LibreLocateAnything ist eine Python-Klasse und kein .pt-Checkpoint. Sie wird weder über die Factory LibreYOLO() geladen noch von der CLI libreyolo aufgelöst. Die Factory LibreVLM(...) (from libreyolo import LibreVLM) erreicht diese Familie ebenfalls über einen Alias, zum Beispiel LibreVLM("locate-anything"). Sie erzeugt die unten verwendete Klasse. Beim Laden wird der eigene entfernte Modellcode von NVIDIA auf Hugging Face heruntergeladen und ausgeführt. LibreYOLO schreibt den Download daher auf eine feste Commit-Revision statt auf den veränderlichen Branch main fest und protokolliert vor dem ersten Download einmalig einen Lizenzhinweis.

Python
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Offenes Vokabular: Beliebige Wörter statt eines festen Klassen-Heads. Bleibt# über alle späteren predict()/track()-Aufrufe wirksam, bis es neu gesetzt wird.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Punkt-Prompting
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE # task="point" gibt pro passendem Objekt einen Punkt statt einer Box zurück.# Aufgaben auf einem geladenen Modell mit model.set_task("point") wechseln.model = LibreLocateAnything(size="3b", task="point")model.set_classes(["the person closest to the camera"])result = model(SAMPLE_IMAGE, save=True) for pt in result.points:    print(pt.cls, pt.conf, pt.xy)
Direkter Chat
from libreyolo import LibreLocateAnything, SAMPLE_IMAGE model = LibreLocateAnything(size="3b") # Der direkte Weg unterhalb der Erkennungsfunktion: freie Fragen,# Zählaufgaben oder beliebige Prompts außerhalb des Boxen-Wrappers.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes (Aufgabe detect) und result.points (Aufgabe point) enthalten die geparste Ausgabe wie bei anderen Familien. Die Confidence ist ein Platzhalter: LocateAnything gibt keinen Score pro Box aus. Jede Erkennung erhält deshalb dieselbe konstante Confidence. conf= entfernt nur Zeilen unterhalb dieser Konstante und sortiert sie nicht. Wenn du set_classes() überspringst, verwendet das Vokabular standardmäßig die COCO-80-Namen. Unter Vorhersage findest du Quellen, Streaming und die Verarbeitung von Ergebnissen.

Varianten

Es gibt eine veröffentlichte Größe, 3b. Zwei Aufgaben verwenden dieselben Gewichte: detect (der Standardwert) gibt Boxen zurück, task="point" dagegen einen einzelnen Punkt pro passendem Objekt in result.points. Auf einem bereits geladenen Modell wechselst du mit model.set_task("point") zwischen ihnen. Der Benchmark-Testaufbau von LibreYOLO hat diese Familie nicht gemessen. Es gibt daher keine veröffentlichten Accuracy-Werte für einen Vergleich.

LibreYOLO bietet diese Familie nur für Vorhersagen an. train(), val() und export() lösen alle NotImplementedError aus. Führe ein Fine-Tuning upstream durch und lade stattdessen das Ergebnis. Die Datensatzvalidierung wird übersprungen, weil eine Platzhalter-Confidence den COCO-mAP irreführend machen würde. Der Export liegt außerhalb des Umfangs eines generativen Modells ohne tracebares State-Dictionary.

Lizenzierung

Prüfe die Lizenz im Hugging-Face-Repository der konkreten Gewichte, die du herunterlädst. Jeder Checkpoint in der LibreYOLO-Organisation hat eine Lizenz, und sie ist innerhalb einer Familie nicht immer gleich. Dieses Repository ist die maßgebliche Quelle. Die Zusammenfassung unten beschreibt den Stand bei der letzten Verifizierung dieser Seite.

Dies ist eine Beschreibung der beteiligten Lizenzen und keine Rechtsberatung. Wenn die Antwort kommerziell relevant ist, lies die Lizenzen selbst und hole eigenen Rechtsrat ein.

Originalarbeit
LocateAnything, NVIDIA
Upstream-Lizenz
NVIDIA License (non-commercial)
LibreYOLO-Code
MIT
Gewichte
NVIDIA License (non-commercial), von den Autoren verbreitet. LibreYOLO hostet oder spiegelt sie nicht.
Einordnung
The NVIDIA License permits use, reproduction and modification, but Section 3.3 restricts the Work and any derivative to non-commercial use, research or evaluation only, for anyone other than NVIDIA and its affiliates: there is no revenue threshold or paid exception. Redistribution must keep a complete copy of the license and every attribution notice. LocateAnything-3B also composes two other licensed components: a Qwen2.5-3B-Instruct language backbone under the Qwen Research License, and a MoonViT-SO-400M vision encoder under MIT. Because loading this model requires trusting NVIDIA's own Hugging Face remote code, LibreYOLO pins the exact commit revision it downloads rather than the mutable main branch, and logs a one-time notice before that download. LibreYOLO does not host, mirror or redistribute any of it.

Die NVIDIA License erlaubt Nutzung, Vervielfältigung und Änderung, beschränkt das Modell und alle abgeleiteten Werke für alle außer NVIDIA und verbundene Unternehmen jedoch auf nicht kommerzielle Nutzung, Forschung oder Auswertung. Es gibt weder einen Umsatzschwellenwert noch eine bezahlte Ausnahme. LocateAnything-3B kombiniert außerdem zwei weitere lizenzierte Komponenten: ein Sprach-Backbone Qwen2.5-3B-Instruct unter der Qwen Research License und einen Vision-Encoder MoonViT-SO-400M unter MIT. LibreYOLO hostet, spiegelt oder verteilt nichts davon. LibreLocateAnything lädt bei der ersten Ausführung die Gewichte und den erforderlichen entfernten Code direkt aus nvidia/LocateAnything-3B auf Hugging Face, festgeschrieben auf einen Commit.

Zitieren

@article{wang2025locateanything,
  title   = {LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding},
  author  = {Shihao Wang and Shilong Liu and Yuanguo Kuang and Xinyu Wei and
             Yangzhou Liu and Zhiqi Li and Yunze Man and Guo Chen and
             Andrew Tao and Guilin Liu and Jan Kautz and Lei Zhang and Zhiding Yu},
  journal = {arXiv:2605.27365},
  year    = {2026},
}

Aus dem Zitierblock der Autoren unter github.com/NVlabs/Eagle/blob/main/Embodied/README.md#-citation kopiert.

Mit LibreYOLO v1.5.0 verifiziert. Supporttabellen, Checkpoints und Benchmarkwerte auf dieser Seite werden aus der veröffentlichten Bibliothek und den publizierten Gewichten generiert und nicht von Hand geschrieben.