Qwen3-VL
Qwen3-VL ist Alibabas Vision-Language-Modell mit nativem 2D-Grounding. LibreYOLO bindet es als Open-Vocabulary-Objektdetektor ein und stellt seinen freien Chat direkt bereit: Übergib eine Klassenliste zur Erkennung oder stelle eine Frage.
- Aufgaben
- detection
- Größen
- 2b, 4b, 8b at 1024 px
- Installation
pip install libreyolo- Supportstufe
- Geschwisterstufe, seit v. Eine separate Produktoberfläche mit eigener Factory und eigenem Vertrag.
- Upstream
- Qwen3-VL von Alibaba (Qwen Team), Apache-2.0. Publikation, Quelle
- Lizenzen
- Code MIT, Gewichte Apache-2.0. Kommerzielle Nutzung
Installation
Qwen3-VL gehört zum VLM-as-Detector-Tier von LibreYOLO. Dieses besitzt eine
eigene Factory und eine getrennte Produktoberfläche neben den
Checkpoint-basierten Familien. Es benötigt das Zusatzpaket vlm.
pip install "libreyolo[vlm]"Vorhersage
Die Gewichte werden bei der ersten Verwendung von Hugging Face heruntergeladen
und lokal zwischengespeichert. Ein Aufruf von LibreVLM() ohne Argument
verwendet standardmäßig Qwen3-VL-4B.
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Der direkte Weg unterhalb der Erkennungsfunktion: jede beliebige Frage,# nicht nur eine Anfrage nach Bounding Boxes.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)Diese Familie wird über die Factory LibreVLM() und nicht über LibreYOLO()
geladen. VLM-Familien deklarieren keinen Checkpoint-Loader. Das auf anderen
Modellseiten beschriebene Routing über die Dateiendung gilt daher nicht.
set_classes() legt das Vokabular fest, nach dem Qwen3-VL suchen soll. Es
bleibt wirksam, bis du es erneut festlegst, und gilt somit für jeden späteren
Aufruf von predict() oder track(). Jede Erkennung trägt dieselbe
Platzhalter-Confidence. Die Filterung mit conf ist daher eine
Alles-oder-nichts-Entscheidung statt einer Rangfolge. iou hat bei dieser
Familie eine Wirkung: Eine spätere Box derselben Klasse wird verworfen, wenn
sie eine bereits beibehaltene Box stärker als der Schwellenwert überlappt.
Dadurch werden nahezu identische Boxen entfernt, die ein sich wiederholender
Generator sonst für ein Objekt ausgeben kann. Anders als Florence-2 und
Kosmos-2 beantwortet Qwen3-VL auch freie Fragen über chat(), denselben
direkten Weg, der bei der Factory LibreVLM dokumentiert ist. Die CLI von
LibreYOLO unterstützt diesen Tier nicht. Es gibt keine Form
libreyolo predict model=... dafür. Unter Vorhersage findest
du Quellen, Streaming und die Verarbeitung von Ergebnissen.
Varianten
Es gibt drei Größen: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct und
Qwen3-VL-8B-Instruct, geladen als LibreVLM("qwen3-vl-2b"),
LibreVLM("qwen3-vl-4b") und LibreVLM("qwen3-vl-8b"). Alle drei geben eine
nominelle Eingabe von 1024 px an. Die eigene intelligente Größenänderung des
Qwen-Prozessors bestimmt jedoch die tatsächlich an das Netzwerk übergebene
Arbeitsfläche. Dieser Wert ist daher keine feste Betriebsauflösung wie bei den
anderen Familien auf dieser Website. LibreYOLO hat keinen Benchmark zum
Accuracy-Vergleich der drei Größen veröffentlicht.
LibreYOLO trainiert, validiert oder exportiert Qwen3-VL nicht. train(),
val() und export() lösen bei jeder Familie dieses Tiers den Fehler
NotImplementedError aus (siehe Support-Tier oben). Führe das Fine-Tuning von
Qwen3-VL upstream durch und lade die erzeugten Gewichte, wenn du ein fest
integriertes eigenes Vokabular benötigst. Prüfe die Ausgabe von predict()
visuell statt mit einem COCO-artigen Validierungsdurchlauf, weil jede Erkennung
dieselbe Platzhalter-Confidence trägt.
Lizenzierung
Prüfe die Lizenz im Hugging-Face-Repository der konkreten Gewichte, die du herunterlädst. Jeder Checkpoint in der LibreYOLO-Organisation hat eine Lizenz, und sie ist innerhalb einer Familie nicht immer gleich. Dieses Repository ist die maßgebliche Quelle. Die Zusammenfassung unten beschreibt den Stand bei der letzten Verifizierung dieser Seite.
Dies ist eine Beschreibung der beteiligten Lizenzen und keine Rechtsberatung. Wenn die Antwort kommerziell relevant ist, lies die Lizenzen selbst und hole eigenen Rechtsrat ein.
- Originalarbeit
- Qwen3-VL, Alibaba (Qwen Team)
- Upstream-Lizenz
- Apache-2.0
- Upstream-Quelle
- github.com/QwenLM/Qwen3-VL
- LibreYOLO-Code
- MIT
- Gewichte
- Apache-2.0, von den Autoren verbreitet. LibreYOLO hostet oder spiegelt sie nicht.
- Einordnung
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.
Zitieren
@article{Qwen3-VL,
title={Qwen3-VL Technical Report},
author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
journal={arXiv preprint arXiv:2511.21631},
year={2025}
}Aus dem Zitierblock der Autoren unter github.com/QwenLM/Qwen3-VL#citation kopiert.