Qwen3-VL

Qwen3-VL è il modello vision-language di Alibaba con grounding 2D nativo. LibreYOLO lo avvolge come rilevatore di oggetti a vocabolario aperto ed espone direttamente la sua chat libera: passa una lista di classi da rilevare, oppure fagli una domanda.

Task
detection
Dimensioni
2b, 4b, 8b at 1024 px
Installa
pip install libreyolo
Livello di supporto
Livello parallelo, dalla v. Un'interfaccia di prodotto separata, con una propria factory e un proprio contratto.
Origine
Qwen3-VL di Alibaba (Qwen Team), Apache-2.0. Articolo, sorgente
Licenze
Codice MIT, pesi Apache-2.0. Uso commerciale

Installazione

Qwen3-VL appartiene al livello VLM-come-detector di LibreYOLO, una superficie di prodotto separata dalle famiglie basate su checkpoint e con una factory propria. Richiede l'extra vlm.

bash
pip install "libreyolo[vlm]"

Predizione

I pesi vengono scaricati da Hugging Face al primo utilizzo e restano nella cache locale. LibreVLM() chiamata senza argomenti usa per default Qwen3-VL-4B.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # La via di fuga sotto la comodità del rilevamento: qualsiasi domanda,# non solo una query su bounding box.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Questa famiglia si carica con la factory LibreVLM(), non con LibreYOLO(): le famiglie VLM non dichiarano nessun caricatore di checkpoint, quindi il routing per suffisso di file descritto nelle altre pagine dei modelli qui non si applica. set_classes() definisce il vocabolario che si chiede a Qwen3-VL di trovare; è persistente, quindi resta in vigore in tutte le chiamate successive a predict()/track() finché non lo imposti di nuovo. Ogni rilevamento porta la stessa confidenza segnaposto, quindi filtrare per conf è tutto o niente invece che un ordinamento; iou invece ha effetto per questa famiglia, perché scarta un box successivo della stessa classe quando si sovrappone oltre la soglia a uno già tenuto, dato che un generatore ripetitivo può altrimenti emettere box quasi duplicati per uno stesso oggetto. A differenza di Florence-2 e Kosmos-2, Qwen3-VL risponde anche a domande libere tramite chat(), la stessa via di fuga documentata sulla factory LibreVLM. La CLI di LibreYOLO non copre questo livello: non esiste una forma libreyolo predict model=... per esso. Vedi predizione per sorgenti, streaming e gestione dei risultati.

Varianti

Tre dimensioni: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct e Qwen3-VL-8B-Instruct, caricate come LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") e LibreVLM("qwen3-vl-8b"). Tutte e tre dichiarano un input nominale di 1024 px, ma è lo smart-resize del processore di Qwen a decidere il canvas effettivo che arriva alla rete, quindi quella cifra non è una risoluzione operativa fissa come lo è per le altre famiglie di questo sito. LibreYOLO non ha pubblicato nessun benchmark che confronti l'accuratezza tra le tre dimensioni.

LibreYOLO non addestra, non valida e non esporta Qwen3-VL: train(), val() e export() sollevano tutti NotImplementedError per ogni famiglia di questo livello (vedi il livello di supporto qui sopra). Fai fine-tuning di Qwen3-VL upstream e carica i pesi risultanti se ti serve un vocabolario personalizzato integrato; controlla a occhio l'output di predict() invece di una passata di validazione in stile COCO, dato che ogni rilevamento porta la stessa confidenza segnaposto.

Licenze

Controlla la licenza nel repository Hugging Face degli specifici pesi che scarichi. Ogni checkpoint nell<link>organizzazione LibreYOLO</link> ne include una e non è sempre la stessa per tutta la famiglia. Quel repository è la fonte autorevole; il riepilogo seguente descrive le condizioni applicabili al momento dellultima verifica di questa pagina.

Questa è una descrizione delle licenze coinvolte, non una consulenza legale. Se la risposta è importante a fini commerciali, leggi personalmente le licenze e chiedi una consulenza indipendente.

Lavoro originale
Qwen3-VL, Alibaba (Qwen Team)
Licenza upstream
Apache-2.0
Codice LibreYOLO
MIT
Pesi
Apache-2.0, distribuiti dai rispettivi autori. LibreYOLO non li ospita né ne mantiene una copia.
Interpretazione
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Citazione

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Copiato dal blocco di citazione degli autori disponibile su github.com/QwenLM/Qwen3-VL#citation.

Verificato con LibreYOLO v1.5.0. Le tabelle di supporto, i checkpoint e i dati dei benchmark in questa pagina vengono generati dalla libreria rilasciata e dai pesi pubblicati, non scritti a mano.