Qwen3-VL
Qwen3-VL adalah model vision-language Alibaba dengan grounding 2D native. LibreYOLO membungkusnya sebagai detektor objek open-vocabulary dan mengekspos chat bebasnya secara langsung: berikan daftar kelas untuk mendeteksi, atau ajukan pertanyaan.
- Task
- detection
- Ukuran
- 2b, 4b, 8b at 1024 px
- Instalasi
pip install libreyolo- Tier dukungan
- Tier sejajar, sejak v. Permukaan produk terpisah dengan factory dan kontraknya sendiri.
- Lisensi
- Kode MIT, bobot Apache-2.0. Penggunaan komersial
Instalasi
Qwen3-VL termasuk dalam tier VLM-sebagai-detektor LibreYOLO, permukaan produk
yang terpisah dari family berbasis checkpoint dan memiliki factory sendiri. Model ini
memerlukan komponen tambahan vlm.
pip install "libreyolo[vlm]"Prediksi
Bobot diunduh dari Hugging Face saat pertama kali digunakan dan disimpan dalam cache lokal.
LibreVLM() yang dipanggil tanpa argumen memakai Qwen3-VL-4B secara default.
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Jalur keluar di balik kemudahan deteksi: pertanyaan apa pun,# tidak terbatas pada kueri bounding box.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)Family ini dimuat melalui factory LibreVLM(), bukan LibreYOLO(): family VLM
tidak mendeklarasikan loader checkpoint, sehingga perutean sufiks berkas yang dijelaskan
di halaman model lain tidak berlaku di sini. set_classes() menetapkan kosakata
yang diminta untuk ditemukan Qwen3-VL; pengaturannya persisten, sehingga tetap berlaku
pada setiap pemanggilan predict()/track() berikutnya sampai ditetapkan lagi. Setiap
deteksi membawa confidence placeholder yang sama, sehingga pemfilteran conf bersifat
semua-atau-tidak-sama-sekali, bukan pemeringkatan; iou tetap berpengaruh pada family ini,
dengan membuang kotak berikutnya dari kelas yang sama setelah tumpang tindihnya dengan
kotak yang sudah dipertahankan melewati ambang batas, karena generator berulang dapat
menghasilkan kotak yang hampir duplikat untuk satu objek. Tidak seperti Florence-2 dan
Kosmos-2, Qwen3-VL juga menjawab pertanyaan bebas melalui chat(), yaitu jalur keluar
yang sama seperti dalam dokumentasi factory LibreVLM. CLI LibreYOLO tidak mencakup
tier ini: tidak ada bentuk libreyolo predict model=... untuknya. Lihat
prediksi untuk sumber, streaming, dan penanganan hasil.
Varian
Tiga ukuran: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct, dan Qwen3-VL-8B-Instruct,
yang dimuat sebagai LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b"), dan
LibreVLM("qwen3-vl-8b"). Ketiganya mendeklarasikan input nominal 1024 px, tetapi
smart-resize milik prosesor Qwen menentukan canvas sebenarnya yang diteruskan ke
jaringan, sehingga angka tersebut bukan resolusi operasi tetap seperti pada family
lain di situs ini. LibreYOLO belum menerbitkan benchmark yang membandingkan akurasi
ketiga ukuran tersebut.
LibreYOLO tidak melatih, memvalidasi, atau mengekspor Qwen3-VL: train(), val(), dan
export() semuanya memunculkan NotImplementedError untuk setiap family dalam tier ini
(lihat tier dukungan di atas). Lakukan fine-tuning Qwen3-VL melalui upstream dan muat
bobot hasilnya jika memerlukan kosakata khusus yang tertanam; periksa output predict()
secara visual alih-alih memakai tahap validasi bergaya COCO karena setiap deteksi membawa
confidence placeholder yang sama.
Lisensi
Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.
Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.
- Karya asli
- Qwen3-VL, Alibaba (Qwen Team)
- Lisensi upstream
- Apache-2.0
- Sumber upstream
- github.com/QwenLM/Qwen3-VL
- Kode LibreYOLO
- MIT
- Bobot
- Apache-2.0, didistribusikan oleh penulisnya. LibreYOLO tidak menghosting atau mencerminkannya.
- Interpretasi
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.
Sitasi
@article{Qwen3-VL,
title={Qwen3-VL Technical Report},
author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
journal={arXiv preprint arXiv:2511.21631},
year={2025}
}Disalin dari blok sitasi penulis di github.com/QwenLM/Qwen3-VL#citation.