Qwen3-VL

Qwen3-VL es el modelo de visión y lenguaje de Alibaba con grounding 2D nativo. LibreYOLO lo envuelve como detector de objetos de vocabulario abierto y expone su chat libre directamente: pásale una lista de clases para detectar, o hazle una pregunta.

Tareas
detection
Tamaños
2b, 4b, 8b at 1024 px
Instalación
pip install libreyolo
Nivel de compatibilidad
Nivel hermano, desde v. Una superficie de producto independiente con su propia factoría y su propio contrato.
Proyecto original
Qwen3-VL de Alibaba (Qwen Team), Apache-2.0. Artículo, fuente
Licencias
Código MIT, pesos Apache-2.0. Uso comercial

Instalación

Qwen3-VL pertenece al nivel VLM-como-detector de LibreYOLO, una superficie de producto separada de las familias basadas en checkpoints y con su propia factoría. Necesita el extra vlm.

bash
pip install "libreyolo[vlm]"

Predicción

Los pesos se descargan de Hugging Face en el primer uso y se guardan en la caché local. LibreVLM(), llamado sin argumentos, usa Qwen3-VL-4B por defecto.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # La vía de escape bajo la comodidad de la detección: cualquier pregunta,# no solo una consulta de bounding boxes.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Esta familia se carga con la factoría LibreVLM(), no con LibreYOLO(): las familias VLM no declaran ningún cargador de checkpoints, así que el enrutado por sufijo de archivo que se describe en otras páginas de modelos no se aplica aquí. set_classes() define el vocabulario que se le pide a Qwen3-VL que encuentre; es persistente, así que sigue vigente en todas las llamadas posteriores a predict()/track() hasta que vuelvas a definirlo. Todas las detecciones llevan la misma confianza de relleno, así que filtrar por conf es todo o nada en lugar de una ordenación; iou sí tiene efecto en esta familia, y descarta un bounding box posterior de la misma clase en cuanto se solapa con uno ya conservado por encima del umbral, ya que un generador repetitivo puede emitir cajas casi duplicadas para un mismo objeto. A diferencia de Florence-2 y Kosmos-2, Qwen3-VL también responde preguntas libres a través de chat(), la misma vía de escape que se documenta en la factoría LibreVLM. La CLI de LibreYOLO no cubre este nivel: no existe una forma libreyolo predict model=... para él. Consulta predicción para fuentes, streaming y manejo de resultados.

Variantes

Tres tamaños: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct y Qwen3-VL-8B-Instruct, que se cargan como LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") y LibreVLM("qwen3-vl-8b"). Los tres declaran una entrada nominal de 1024 px, pero es el propio smart-resize del procesador de Qwen el que decide el lienzo real que se pasa a la red, así que esa cifra no es una resolución de trabajo fija como sí lo es en las demás familias de este sitio. LibreYOLO no ha publicado ningún benchmark que compare la precisión entre los tres tamaños.

LibreYOLO no entrena, valida ni exporta Qwen3-VL: train(), val() y export() lanzan NotImplementedError en todas las familias de este nivel (consulta el nivel de soporte de arriba). Haz fine-tuning de Qwen3-VL upstream y carga los pesos resultantes si necesitas un vocabulario personalizado integrado; revisa a ojo la salida de predict() en lugar de recurrir a una pasada de validación al estilo COCO, ya que todas las detecciones llevan la misma confianza de relleno.

Licencia

Comprueba la licencia en el repositorio de Hugging Face de los pesos concretos que descargues. Cada checkpoint de la organización de LibreYOLO incluye una, y no siempre es la misma en toda una familia. Ese repositorio es la fuente autorizada; el resumen siguiente describe qué se aplicaba cuando se verificó esta página por última vez.

Esta es una descripción de las licencias implicadas, no asesoramiento legal. Si la respuesta es importante a nivel comercial, lee las licencias y busca tu propio asesoramiento.

Trabajo original
Qwen3-VL, Alibaba (Qwen Team)
Licencia del proyecto original
Apache-2.0
Fuente del proyecto original
github.com/QwenLM/Qwen3-VL
Código de LibreYOLO
MIT
Pesos
Apache-2.0, distribuidos por sus autores. LibreYOLO no los aloja ni los replica.
Interpretación
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Cita

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Copiado del bloque de cita de los autores en github.com/QwenLM/Qwen3-VL#citation.

Verificado con LibreYOLO v1.5.0. Las tablas de compatibilidad, los checkpoints y las cifras de rendimiento de esta página se generan a partir de la biblioteca publicada y los pesos publicados; no se escriben a mano.