Qwen3-VL

Qwen3-VL adalah model vision-language Alibaba dengan grounding 2D native. LibreYOLO membungkusnya sebagai detektor objek open-vocabulary dan mengekspos chat bebasnya secara langsung: berikan daftar kelas untuk mendeteksi, atau ajukan pertanyaan.

Task
detection
Ukuran
2b, 4b, 8b at 1024 px
Instalasi
pip install libreyolo
Tier dukungan
Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
Proyek upstream
Qwen3-VL oleh Alibaba (Qwen Team), Apache-2.0. Makalah, sumber
Lisensi
Kode MIT, bobot Apache-2.0. Penggunaan komersial

Instalasi

Qwen3-VL termasuk dalam tier VLM-sebagai-detektor LibreYOLO, permukaan produk yang terpisah dari family berbasis checkpoint dan memiliki factory sendiri. Model ini memerlukan komponen tambahan vlm.

bash
pip install "libreyolo[vlm]"

Prediksi

Bobot diunduh dari Hugging Face saat pertama kali digunakan dan disimpan dalam cache lokal. LibreVLM() yang dipanggil tanpa argumen memakai Qwen3-VL-4B secara default.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Jalur keluar di balik kemudahan deteksi: pertanyaan apa pun,# tidak terbatas pada kueri bounding box.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Family ini dimuat melalui factory LibreVLM(), bukan LibreYOLO(): family VLM tidak mendeklarasikan loader checkpoint, sehingga perutean sufiks berkas yang dijelaskan di halaman model lain tidak berlaku di sini. set_classes() menetapkan kosakata yang diminta untuk ditemukan Qwen3-VL; pengaturannya persisten, sehingga tetap berlaku pada setiap pemanggilan predict()/track() berikutnya sampai ditetapkan lagi. Setiap deteksi membawa confidence placeholder yang sama, sehingga pemfilteran conf bersifat semua-atau-tidak-sama-sekali, bukan pemeringkatan; iou tetap berpengaruh pada family ini, dengan membuang kotak berikutnya dari kelas yang sama setelah tumpang tindihnya dengan kotak yang sudah dipertahankan melewati ambang batas, karena generator berulang dapat menghasilkan kotak yang hampir duplikat untuk satu objek. Tidak seperti Florence-2 dan Kosmos-2, Qwen3-VL juga menjawab pertanyaan bebas melalui chat(), yaitu jalur keluar yang sama seperti dalam dokumentasi factory LibreVLM. CLI LibreYOLO tidak mencakup tier ini: tidak ada bentuk libreyolo predict model=... untuknya. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.

Varian

Tiga ukuran: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct, dan Qwen3-VL-8B-Instruct, yang dimuat sebagai LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b"), dan LibreVLM("qwen3-vl-8b"). Ketiganya mendeklarasikan input nominal 1024 px, tetapi smart-resize milik prosesor Qwen menentukan canvas sebenarnya yang diteruskan ke jaringan, sehingga angka tersebut bukan resolusi operasi tetap seperti pada family lain di situs ini. LibreYOLO belum menerbitkan benchmark yang membandingkan akurasi ketiga ukuran tersebut.

LibreYOLO tidak melatih, memvalidasi, atau mengekspor Qwen3-VL: train(), val(), dan export() semuanya memunculkan NotImplementedError untuk setiap family dalam tier ini (lihat tier dukungan di atas). Lakukan fine-tuning Qwen3-VL melalui upstream dan muat bobot hasilnya jika memerlukan kosakata khusus yang tertanam; periksa output predict() secara visual alih-alih memakai tahap validasi bergaya COCO karena setiap deteksi membawa confidence placeholder yang sama.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
Qwen3-VL, Alibaba (Qwen Team)
Lisensi upstream
Apache-2.0
Kode LibreYOLO
MIT
Bobot
Apache-2.0, didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
Interpretasi
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Sitasi

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Disalin dari blok sitasi penulis di github.com/QwenLM/Qwen3-VL#citation.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.