Qwen3-VL
O Qwen3-VL é o modelo de visão e linguagem da Alibaba, com grounding 2D nativo. O LibreYOLO o envolve como detector de objetos de vocabulário aberto e expõe seu chat livre diretamente: passe uma lista de classes para detectar, ou faça uma pergunta a ele.
- Tarefas
- detection
- Tamanhos
- 2b, 4b, 8b at 1024 px
- Instalação
pip install libreyolo- Nível de suporte
- Nível irmão, desde a v. Uma superfície de produto separada, com sua própria fábrica e seu próprio contrato.
- Origem
- Qwen3-VL por Alibaba (Qwen Team), Apache-2.0. Artigo, código-fonte
- Licenças
- Código MIT, pesos Apache-2.0. Uso comercial
Instalação
O Qwen3-VL pertence ao nível VLM-como-detector do LibreYOLO, uma superfície de
produto separada das famílias baseadas em checkpoints e com sua própria factory.
Ele precisa do extra vlm.
pip install "libreyolo[vlm]"Predição
Os pesos são baixados do Hugging Face no primeiro uso e ficam em cache
localmente. LibreVLM(), chamado sem nenhum argumento, usa o Qwen3-VL-4B por
padrão.
from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b")model.set_classes(["forklift", "pallet", "safety vest"])result = model.predict(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreVLM, SAMPLE_IMAGE model = LibreVLM("qwen3-vl-4b") # A via de escape sob a comodidade da detecção: qualquer pergunta,# não apenas uma consulta de bounding box.answer = model.chat(SAMPLE_IMAGE, "How many people are wearing a safety vest?")print(answer)Esta família é carregada pela factory LibreVLM(), não por LibreYOLO(): as
famílias VLM não declaram nenhum carregador de checkpoint, então o roteamento
por sufixo de arquivo descrito em outras páginas de modelos não se aplica aqui.
set_classes() define o vocabulário que o Qwen3-VL deve encontrar; ele é
persistente, então continua valendo em todas as chamadas posteriores a
predict()/track() até que você o defina de novo. Todas as detecções carregam
a mesma confiança de placeholder, então filtrar por conf é tudo ou nada em vez
de uma ordenação; iou tem efeito nesta família, e descarta um box posterior da
mesma classe assim que ele se sobrepõe a um já mantido acima do limiar, já que um
gerador repetitivo pode emitir boxes quase duplicados para um mesmo objeto.
Diferente do Florence-2 e do Kosmos-2, o Qwen3-VL também responde perguntas
livres através de chat(), a mesma via de escape documentada na factory
LibreVLM. A CLI do LibreYOLO não cobre este nível: não existe uma forma
libreyolo predict model=... para ele. Veja predição para
fontes, streaming e tratamento de resultados.
Variantes
Três tamanhos: Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct e Qwen3-VL-8B-Instruct,
carregados como LibreVLM("qwen3-vl-2b"), LibreVLM("qwen3-vl-4b") e
LibreVLM("qwen3-vl-8b"). Os três declaram uma entrada nominal de 1024 px, mas é
o próprio smart-resize do processador do Qwen que decide o canvas real passado
para a rede, então esse número não é uma resolução de trabalho fixa como é nas
outras famílias deste site. O LibreYOLO não publicou nenhum benchmark comparando
a acurácia entre os três tamanhos.
O LibreYOLO não treina, valida nem exporta o Qwen3-VL: train(), val() e
export() levantam NotImplementedError em todas as famílias deste nível (veja
o nível de suporte acima). Faça fine-tuning do Qwen3-VL upstream e carregue os
pesos resultantes se você precisar de um vocabulário personalizado embutido;
confira a olho a saída de predict() em vez de uma passada de validação no
estilo COCO, já que todas as detecções carregam a mesma confiança de placeholder.
Licenciamento
Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.
Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.
- Trabalho original
- Qwen3-VL, Alibaba (Qwen Team)
- Licença original
- Apache-2.0
- Código-fonte original
- github.com/QwenLM/Qwen3-VL
- Código do LibreYOLO
- MIT
- Pesos
- Apache-2.0, distribuído pelos autores. O LibreYOLO não hospeda nem espelha esses pesos.
- Interpretação
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. All three sizes LibreYOLO downloads, Qwen3-VL-2B-Instruct, Qwen3-VL-4B-Instruct and Qwen3-VL-8B-Instruct, carry this license on their Hugging Face repository.
Citação
@article{Qwen3-VL,
title={Qwen3-VL Technical Report},
author={Shuai Bai and Yuxuan Cai and Ruizhe Chen and Keqin Chen and Xionghui Chen and Zesen Cheng and Lianghao Deng and Wei Ding and Chang Gao and Chunjiang Ge and Wenbin Ge and Zhifang Guo and Qidong Huang and Jie Huang and Fei Huang and Binyuan Hui and Shutong Jiang and Zhaohai Li and Mingsheng Li and Mei Li and Kaixin Li and Zicheng Lin and Junyang Lin and Xuejing Liu and Jiawei Liu and Chenglong Liu and Yang Liu and Dayiheng Liu and Shixuan Liu and Dunjie Lu and Ruilin Luo and Chenxu Lv and Rui Men and Lingchen Meng and Xuancheng Ren and Xingzhang Ren and Sibo Song and Yuchong Sun and Jun Tang and Jianhong Tu and Jianqiang Wan and Peng Wang and Pengfei Wang and Qiuyue Wang and Yuxuan Wang and Tianbao Xie and Yiheng Xu and Haiyang Xu and Jin Xu and Zhibo Yang and Mingkun Yang and Jianxin Yang and An Yang and Bowen Yu and Fei Zhang and Hang Zhang and Xi Zhang and Bo Zheng and Humen Zhong and Jingren Zhou and Fan Zhou and Jing Zhou and Yuanzhi Zhu and Ke Zhu},
journal={arXiv preprint arXiv:2511.21631},
year={2025}
}Copiado do bloco de citação dos autores em github.com/QwenLM/Qwen3-VL#citation.