Qwen3-VL

O Qwen3-VL é o modelo de visão e linguagem da Alibaba, com grounding 2D nativo. O LibreYOLO o envolve como detector de objetos de vocabulário aberto e expõe seu chat livre diretamente: passe uma lista de classes para detectar, ou faça uma pergunta a ele.

Tarefas
detection
Tamanhos
2b, 4b, 8b at 1024 px
Instalação
pip install libreyolo
Nível de suporte
Nível irmão, desde a v. Uma superfície de produto separada, com sua própria fábrica e seu próprio contrato.
Origem
Qwen3-VL por Alibaba (Qwen Team), Apache-2.0. Artigo, código-fonte
Licenças
Código MIT, pesos Apache-2.0. Uso comercial

Instalação

O Qwen3-VL pertence ao nível VLM-como-detector do LibreYOLO, uma superfície de produto separada das famílias baseadas em checkpoints e com sua própria factory. Ele precisa do extra vlm.

bash
pip install "libreyolo[vlm]"

Predição

Os pesos são baixados do Hugging Face no primeiro uso e ficam em cache localmente. LibreVLM(), chamado sem nenhum argumento, usa o Qwen3-VL-4B por padrão.

Python
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # A via de escape sob a comodidade da detecção: qualquer pergunta,# não apenas uma consulta de bounding box.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)

Esta família é carregada pela factory LibreVLM(), não por LibreYOLO(): as famílias VLM não declaram nenhum carregador de checkpoint, então o roteamento por sufixo de arquivo descrito em outras páginas de modelos não se aplica aqui. set_classes() define o vocabulário que o Qwen3-VL deve encontrar; ele é persistente, então continua valendo em todas as chamadas posteriores a predict()/track() até que você o defina de novo. Todas as detecções carregam a mesma confiança de placeholder, então filtrar por conf é tudo ou nada em vez de uma ordenação; iou tem efeito nesta família, e descarta um box posterior da mesma classe assim que ele se sobrepõe a um já mantido acima do limiar, já que um gerador repetitivo pode emitir boxes quase duplicados para um mesmo objeto. Diferente do Florence-2 e do Kosmos-2, o Qwen3-VL também responde perguntas livres através de chat(), a mesma via de escape documentada na factory LibreVLM. A CLI do LibreYOLO não cobre este nível: não existe uma forma libreyolo predict model=... para ele. Veja predição para fontes, streaming e tratamento de resultados.

Variantes

Três tamanhos: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct e Qwen3-VL-8B-Instruct, carregados como LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") e LibreVLM("qwen3-vl-8b"). Os três declaram uma entrada nominal de 1024 px, mas é o próprio smart-resize do processador do Qwen que decide o canvas real passado para a rede, então esse número não é uma resolução de trabalho fixa como é nas outras famílias deste site. O LibreYOLO não publicou nenhum benchmark comparando a acurácia entre os três tamanhos.

O LibreYOLO não treina, valida nem exporta o Qwen3-VL: train(), val() e export() levantam NotImplementedError em todas as famílias deste nível (veja o nível de suporte acima). Faça fine-tuning do Qwen3-VL upstream e carregue os pesos resultantes se você precisar de um vocabulário personalizado embutido; confira a olho a saída de predict() em vez de uma passada de validação no estilo COCO, já que todas as detecções carregam a mesma confiança de placeholder.

Licenciamento

Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.

Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.

Trabalho original
Qwen3-VL, Alibaba (Qwen Team)
Licença original
Apache-2.0
Código-fonte original
github.com/QwenLM/Qwen3-VL
Código do LibreYOLO
MIT
Pesos
Apache-2.0, distribuído pelos autores. O LibreYOLO não hospeda nem espelha esses pesos.
Interpretação
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.

Citação

@article{Qwen3-VL,
      title={Qwen3-VL Technical Report}, 
      author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
	  journal={arXiv preprint arXiv:2511.21631},
      year={2025}
}

Copiado do bloco de citação dos autores em github.com/QwenLM/Qwen3-VL#citation.

Verificado com o LibreYOLO v1.5.0. As tabelas de suporte, os checkpoints e os números de benchmark desta página são gerados a partir da biblioteca lançada e dos pesos publicados, não escritos à mão.