Qwen3-VL
Qwen3-VL es el modelo de visión y lenguaje de Alibaba con grounding 2D nativo. LibreYOLO lo envuelve como detector de objetos de vocabulario abierto y expone su chat libre directamente: pásale una lista de clases para detectar, o hazle una pregunta.
- Tareas
- detection
- Tamaños
- 2b, 4b, 8b at 1024 px
- Instalación
pip install libreyolo- Nivel de compatibilidad
- Nivel hermano, desde v. Una superficie de producto independiente con su propia factoría y su propio contrato.
- Licencias
- Código MIT, pesos Apache-2.0. Uso comercial
Instalación
Qwen3-VL pertenece al nivel VLM-como-detector de LibreYOLO, una superficie de
producto separada de las familias basadas en checkpoints y con su propia
factoría. Necesita el extra vlm.
pip install "libreyolo[vlm]"Predicción
Los pesos se descargan de Hugging Face en el primer uso y se guardan en la caché
local. LibreVLM(), llamado sin argumentos, usa Qwen3-VL-4B por defecto.
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # La vía de escape bajo la comodidad de la detección: cualquier pregunta,# no solo una consulta de bounding boxes.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)Esta familia se carga con la factoría LibreVLM(), no con LibreYOLO(): las
familias VLM no declaran ningún cargador de checkpoints, así que el enrutado por
sufijo de archivo que se describe en otras páginas de modelos no se aplica aquí.
set_classes() define el vocabulario que se le pide a Qwen3-VL que encuentre; es
persistente, así que sigue vigente en todas las llamadas posteriores a
predict()/track() hasta que vuelvas a definirlo. Todas las detecciones llevan
la misma confianza de relleno, así que filtrar por conf es todo o nada en lugar
de una ordenación; iou sí tiene efecto en esta familia, y descarta un bounding
box posterior de la misma clase en cuanto se solapa con uno ya conservado por
encima del umbral, ya que un generador repetitivo puede emitir cajas casi
duplicadas para un mismo objeto. A diferencia de Florence-2 y Kosmos-2, Qwen3-VL
también responde preguntas libres a través de chat(), la misma vía de escape
que se documenta en la factoría LibreVLM. La CLI de LibreYOLO no cubre este
nivel: no existe una forma libreyolo predict model=... para él. Consulta
predicción para fuentes, streaming y manejo de resultados.
Variantes
Tres tamaños: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct y Qwen3-VL-8B-Instruct,
que se cargan como LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") y
LibreVLM("qwen3-vl-8b"). Los tres declaran una entrada nominal de 1024 px, pero
es el propio smart-resize del procesador de Qwen el que decide el lienzo real que
se pasa a la red, así que esa cifra no es una resolución de trabajo fija como sí
lo es en las demás familias de este sitio. LibreYOLO no ha publicado ningún
benchmark que compare la precisión entre los tres tamaños.
LibreYOLO no entrena, valida ni exporta Qwen3-VL: train(), val() y
export() lanzan NotImplementedError en todas las familias de este nivel
(consulta el nivel de soporte de arriba). Haz fine-tuning de Qwen3-VL upstream y
carga los pesos resultantes si necesitas un vocabulario personalizado integrado;
revisa a ojo la salida de predict() en lugar de recurrir a una pasada de
validación al estilo COCO, ya que todas las detecciones llevan la misma confianza
de relleno.
Licencia
Comprueba la licencia en el repositorio de Hugging Face de los pesos concretos que descargues. Cada checkpoint de la organización de LibreYOLO incluye una, y no siempre es la misma en toda una familia. Ese repositorio es la fuente autorizada; el resumen siguiente describe qué se aplicaba cuando se verificó esta página por última vez.
Esta es una descripción de las licencias implicadas, no asesoramiento legal. Si la respuesta es importante a nivel comercial, lee las licencias y busca tu propio asesoramiento.
- Trabajo original
- Qwen3-VL, Alibaba (Qwen Team)
- Licencia del proyecto original
- Apache-2.0
- Fuente del proyecto original
- github.com/QwenLM/Qwen3-VL
- Código de LibreYOLO
- MIT
- Pesos
- Apache-2.0, distribuidos por sus autores. LibreYOLO no los aloja ni los replica.
- Interpretación
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.
Cita
@article{Qwen3-VL,
title={Qwen3-VL Technical Report},
author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
journal={arXiv preprint arXiv:2511.21631},
year={2025}
}Copiado del bloque de cita de los autores en github.com/QwenLM/Qwen3-VL#citation.