Qwen3-VL

Qwen3-VL ist Alibabas Vision-Language-Modell mit nativem 2D-Grounding. LibreYOLO bindet es als Open-Vocabulary-Objektdetektor ein und stellt seinen freien Chat direkt bereit: Übergib eine Klassenliste zur Erkennung oder stelle eine Frage.

Aufgaben
detection
Größen
2b, 4b, 8b at 1024 px
Installation
pip install libreyolo
Supportstufe
Geschwisterstufe, seit v. Eine separate Produktoberfläche mit eigener Factory und eigenem Vertrag.
Upstream
Qwen3-VL von Alibaba (Qwen Team), Apache-2.0. Publikation, Quelle
Lizenzen
Code MIT, Gewichte Apache-2.0. Kommerzielle Nutzung

Installation

Qwen3-VL gehört zum VLM-as-Detector-Tier von LibreYOLO. Dieses besitzt eine eigene Factory und eine getrennte Produktoberfläche neben den Checkpoint-basierten Familien. Es benötigt das Zusatzpaket vlm.

bash
pip install "libreyolo[vlm]"

Vorhersage

Die Gewichte werden bei der ersten Verwendung von Hugging Face heruntergeladen und lokal zwischengespeichert. Ein Aufruf von LibreVLM() ohne Argument verwendet standardmäßig Qwen3-VL-4B.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Der direkte Weg unterhalb der Erkennungsfunktion: jede beliebige Frage,# nicht nur eine Anfrage nach Bounding Boxes.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Diese Familie wird über die Factory LibreVLM() und nicht über LibreYOLO() geladen. VLM-Familien deklarieren keinen Checkpoint-Loader. Das auf anderen Modellseiten beschriebene Routing über die Dateiendung gilt daher nicht. set_classes() legt das Vokabular fest, nach dem Qwen3-VL suchen soll. Es bleibt wirksam, bis du es erneut festlegst, und gilt somit für jeden späteren Aufruf von predict() oder track(). Jede Erkennung trägt dieselbe Platzhalter-Confidence. Die Filterung mit conf ist daher eine Alles-oder-nichts-Entscheidung statt einer Rangfolge. iou hat bei dieser Familie eine Wirkung: Eine spätere Box derselben Klasse wird verworfen, wenn sie eine bereits beibehaltene Box stärker als der Schwellenwert überlappt. Dadurch werden nahezu identische Boxen entfernt, die ein sich wiederholender Generator sonst für ein Objekt ausgeben kann. Anders als Florence-2 und Kosmos-2 beantwortet Qwen3-VL auch freie Fragen über chat(), denselben direkten Weg, der bei der Factory LibreVLM dokumentiert ist. Die CLI von LibreYOLO unterstützt diesen Tier nicht. Es gibt keine Form libreyolo predict model=... dafür. Unter Vorhersage findest du Quellen, Streaming und die Verarbeitung von Ergebnissen.

Varianten

Es gibt drei Größen: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct und Qwen3-VL-8B-Instruct, geladen als LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") und LibreVLM("qwen3-vl-8b"). Alle drei geben eine nominelle Eingabe von 1024 px an. Die eigene intelligente Größenänderung des Qwen-Prozessors bestimmt jedoch die tatsächlich an das Netzwerk übergebene Arbeitsfläche. Dieser Wert ist daher keine feste Betriebsauflösung wie bei den anderen Familien auf dieser Website. LibreYOLO hat keinen Benchmark zum Accuracy-Vergleich der drei Größen veröffentlicht.

LibreYOLO trainiert, validiert oder exportiert Qwen3-VL nicht. train(), val() und export() lösen bei jeder Familie dieses Tiers den Fehler NotImplementedError aus (siehe Support-Tier oben). Führe das Fine-Tuning von Qwen3-VL upstream durch und lade die erzeugten Gewichte, wenn du ein fest integriertes eigenes Vokabular benötigst. Prüfe die Ausgabe von predict() visuell statt mit einem COCO-artigen Validierungsdurchlauf, weil jede Erkennung dieselbe Platzhalter-Confidence trägt.

Lizenzierung

Prüfe die Lizenz im Hugging-Face-Repository der konkreten Gewichte, die du herunterlädst. Jeder Checkpoint in der LibreYOLO-Organisation hat eine Lizenz, und sie ist innerhalb einer Familie nicht immer gleich. Dieses Repository ist die maßgebliche Quelle. Die Zusammenfassung unten beschreibt den Stand bei der letzten Verifizierung dieser Seite.

Dies ist eine Beschreibung der beteiligten Lizenzen und keine Rechtsberatung. Wenn die Antwort kommerziell relevant ist, lies die Lizenzen selbst und hole eigenen Rechtsrat ein.

Originalarbeit
Qwen3-VL, Alibaba (Qwen Team)
Upstream-Lizenz
Apache-2.0
LibreYOLO-Code
MIT
Gewichte
Apache-2.0, von den Autoren verbreitet. LibreYOLO hostet oder spiegelt sie nicht.
Einordnung
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Zitieren

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Aus dem Zitierblock der Autoren unter github.com/QwenLM/Qwen3-VL#citation kopiert.

Mit LibreYOLO v1.5.0 verifiziert. Supporttabellen, Checkpoints und Benchmarkwerte auf dieser Seite werden aus der veröffentlichten Bibliothek und den publizierten Gewichten generiert und nicht von Hand geschrieben.