Qwen3-VL

Qwen3-VL — vision-language модель Alibaba с нативной 2D-привязкой к изображению (grounding). LibreYOLO оборачивает её как детектор объектов с открытым словарём и заодно открывает её свободный чат напрямую: передайте список классов, чтобы детектировать, или просто задайте вопрос.

Задачи
detection
Размеры
2b, 4b, 8b at 1024 px
Установка
pip install libreyolo
Уровень поддержки
Смежный уровень, начиная с v. Отдельная часть продукта со своей фабрикой и контрактом.
Исходный проект
Qwen3-VL от Alibaba (Qwen Team), Apache-2.0. Статья, исходный код
Лицензии
Код: MIT, веса: Apache-2.0. Коммерческое использование

Установка

Qwen3-VL относится к уровню «VLM как детектор» в LibreYOLO — это отдельная часть продукта со своей фабрикой, а не одно из семейств на основе чекпойнтов. Ему нужен extra vlm.

bash
pip install "libreyolo[vlm]"

Предсказание

Веса скачиваются с Hugging Face при первом запуске и кэшируются локально. LibreVLM() без аргумента по умолчанию берёт Qwen3-VL-4B.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Чат
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # Запасной выход под удобной обёрткой для детекции: любой вопрос,# а не только запрос про рамки.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Это семейство загружается через фабрику LibreVLM(), а не LibreYOLO(): у VLM-семейств нет загрузчика чекпойнтов, поэтому маршрутизация по суффиксу файла, описанная на страницах других моделей, здесь не работает. set_classes() задаёт словарь, который Qwen3-VL просят найти на изображении; значение запоминается, поэтому оно действует во всех последующих вызовах predict()/track(), пока вы не зададите его снова. У каждой детекции одна и та же уверенность-заглушка, поэтому фильтрация по conf работает по принципу «всё или ничего», а не как ранжирование; а вот iou для этого семейства на результат влияет: очередная рамка того же класса отбрасывается, как только её перекрытие с уже оставленной превышает порог, — иначе генератор, начав повторяться, может выдать почти одинаковые рамки для одного объекта. В отличие от Florence-2 и Kosmos-2, Qwen3-VL отвечает и на произвольные вопросы через chat() — тот же запасной выход, что описан у фабрики LibreVLM. CLI LibreYOLO этот уровень не покрывает: формы libreyolo predict model=... для него нет. Про источники, стриминг и обработку результатов см. предсказание.

Варианты

Три размера: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct и Qwen3-VL-8B-Instruct, загружаются как LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") и LibreVLM("qwen3-vl-8b"). Все три заявляют номинальный вход 1024 px, но фактический холст, который уходит в сеть, определяется собственным smart-resize процессора Qwen, поэтому эта цифра — не фиксированное рабочее разрешение, как у остальных семейств на этом сайте. LibreYOLO не публиковал бенчмарк, сравнивающий точность трёх размеров.

LibreYOLO не обучает, не валидирует и не экспортирует Qwen3-VL: train(), val() и export() выбрасывают NotImplementedError для каждого семейства этого уровня (см. уровень поддержки выше). Если нужен свой словарь, запечённый в модель, дообучите Qwen3-VL в исходном проекте и загрузите получившиеся веса; вывод predict() проверяйте глазами, а не прогоном валидации в стиле COCO, поскольку у каждой детекции одна и та же уверенность-заглушка.

Лицензирование

Проверяйте лицензию в репозитории конкретных весов на Hugging Face. Она указана для каждого чекпойнта в организации LibreYOLO и может различаться даже внутри одного семейства. Этот репозиторий считается авторитетным источником, а сводка ниже описывает условия на момент последней проверки страницы.

Это описание соответствующих лицензий, а не юридическая консультация. Если ответ важен для коммерческого использования, прочитайте лицензии самостоятельно и проконсультируйтесь с юристом.

Оригинальная работа
Qwen3-VL, Alibaba (Qwen Team)
Лицензия исходного проекта
Apache-2.0
Исходный код проекта
github.com/QwenLM/Qwen3-VL
Код LibreYOLO
MIT
Веса
Apache-2.0, распространяются авторами. LibreYOLO не размещает и не зеркалирует их.
Толкование
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Цитирование

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Скопировано из блока цитирования авторов на странице github.com/QwenLM/Qwen3-VL#citation.

Проверено с LibreYOLO v1.5.0. Таблицы поддержки, чекпойнты и результаты бенчмарков на этой странице сгенерированы из выпущенной библиотеки и опубликованных весов, а не написаны вручную.