Qwen3-VL

Qwen3-VL є візуально-мовною моделлю Alibaba із вбудованим двовимірним прив'язуванням. LibreYOLO надає її як детектор об'єктів із відкритим словником і відкриває прямий доступ до довільного чату: передайте список класів для виявлення або поставте моделі запитання.

Задачі
detection
Розміри
2b, 4b, 8b at 1024 px
Встановлення
pip install libreyolo
Рівень підтримки
Суміжний рівень, починаючи з v. Окремий інтерфейс продукту з власною фабрикою та контрактом.
Першоджерело
Qwen3-VL, автори: Alibaba (Qwen Team), ліцензія Apache-2.0. Стаття, джерело
Ліцензії
Код: MIT, ваги: Apache-2.0. Комерційне використання

Встановлення

Qwen3-VL належить до рівня VLM-детекторів LibreYOLO, окремої від сімейств на основі контрольних точок частини продукту з власною фабрикою. Для неї потрібен додатковий набір залежностей vlm.

bash
pip install "libreyolo[vlm]"

Передбачення

Під час першого використання ваги завантажуються з Hugging Face і кешуються локально. Виклик LibreVLM() без аргументів типово вибирає Qwen3-VL-4B.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Чат
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Прямий доступ під зручним інтерфейсом виявлення: будь-яке запитання,# а не лише запит обмежувальних рамок.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Це сімейство завантажується через фабрику LibreVLM(), а не LibreYOLO(): сімейства VLM не оголошують завантажувача контрольних точок, тому описана на інших сторінках моделей маршрутизація за суфіксом файлу тут не застосовується. set_classes() задає словник, об'єкти з якого має знайти Qwen3-VL. Налаштування зберігається для всіх наступних викликів predict()/track(), доки ви знову його не зміните. Кожне виявлення має однакову службову оцінку впевненості, тому фільтрація за conf або пропускає всі результати, або відкидає їх усі, а не ранжує. Параметр iou діє для цього сімейства: рамка класу, яка з'явилася пізніше, відкидається, якщо вона перекриває вже збережену рамку понад поріг. Інакше генератор із повтореннями може видати майже однакові рамки для одного об'єкта. На відміну від Florence-2 і Kosmos-2, Qwen3-VL також відповідає на довільні запитання через chat(), інтерфейс прямого доступу, описаний для фабрики LibreVLM. CLI LibreYOLO не охоплює цей рівень: форми libreyolo predict model=... для нього немає. Типи джерел, потокове передбачення та обробку результатів описано в розділі передбачення.

Варіанти

Доступні три розміри: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct і Qwen3-VL-8B-Instruct, які завантажуються як LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") і LibreVLM("qwen3-vl-8b"). Для всіх трьох оголошено номінальний вхід 1024 px, але фактичний розмір полотна, переданого мережі, визначає власна інтелектуальна зміна розміру процесора Qwen. Тому це значення не є фіксованою робочою роздільною здатністю, як для інших сімейств на цьому сайті. LibreYOLO не публікувала бенчмарк порівняння правильності трьох розмірів.

LibreYOLO не навчає, не валідує та не експортує Qwen3-VL: train(), val() і export() спричиняють NotImplementedError для кожного сімейства цього рівня (див. рівень підтримки вище). Якщо потрібен вбудований власний словник, донавчіть Qwen3-VL засобами початкового проєкту й завантажте отримані ваги. Перевіряйте вихід predict() візуально замість валідації у стилі COCO, оскільки кожне виявлення має однакову службову оцінку впевненості.

Ліцензування

Перевіряйте ліцензію в репозиторії Hugging Face конкретних ваг, які завантажуєте. Кожна контрольна точка в організації LibreYOLO має ліцензію, і вона не завжди однакова для всього сімейства. Цей репозиторій є авторитетним джерелом, а наведене нижче резюме описує умови на момент останньої перевірки сторінки.

Це опис відповідних ліцензій, а не юридична консультація. Якщо відповідь має комерційне значення, самостійно прочитайте ліцензії та зверніться по юридичну консультацію.

Оригінальна робота
Qwen3-VL, Alibaba (Qwen Team)
Ліцензія першоджерела
Apache-2.0
Джерело першоджерела
github.com/QwenLM/Qwen3-VL
Код LibreYOLO
MIT
Ваги
Apache-2.0, поширюється авторами. LibreYOLO не розміщує й не дублює ці ваги.
Тлумачення
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Цитування

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Скопійовано з блоку цитування авторів на сторінці github.com/QwenLM/Qwen3-VL#citation.

Перевірено з LibreYOLO v1.5.0. Таблиці підтримки, контрольні точки й результати бенчмарків на цій сторінці згенеровано з випущеної бібліотеки та опублікованих ваг, а не написано вручну.