InternVL3

O InternVL3 é um modelo de linguagem grande multimodal nativo lançado pela OpenGVLab que aprende visão e linguagem de forma conjunta em uma única etapa de pré-treinamento. O LibreYOLO o envolve como detector de objetos de vocabulário aberto: qualquer lista de rótulos de texto vira o conjunto de classes, sem cabeça fixa e sem precisar de fine-tuning.

Tarefas
detection
Tamanhos
1b, 2b, 8b at 448 px
Instalação
pip install libreyolo
Nível de suporte
Nível irmão, desde a v. Uma superfície de produto separada, com sua própria fábrica e seu próprio contrato.
Origem
InternVL3 por Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Artigo, código-fonte
Licenças
Código MIT, pesos MIT (code); Qwen License (weights). Uso comercial

Instalação

O InternVL3 precisa do extra vlm, que traz junto o transformers para o backbone de templates de chat.

bash
pip install "libreyolo[vlm]"

Predição

LibreInternVL3 é uma classe Python, não um checkpoint .pt: ele não é carregado pela factory LibreYOLO(), e a CLI libreyolo não o resolve. A factory LibreVLM(...) (from libreyolo import LibreVLM) também alcança esta família por alias, por exemplo LibreVLM("internvl3-2b"); a classe usada abaixo é a que ela constrói. Os pesos vêm dos próprios repositórios -hf da OpenGVLab no Hugging Face, não de um mirror do LibreYOLO; a primeira chamada baixa e guarda em cache localmente, e antes disso registra um aviso de licença único sobre os pesos Qwen, que são de acesso restrito.

Python
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Vocabulário aberto: vale qualquer palavra, não uma cabeça de# classes fixa. Persiste em cada predict()/track() posterior até# ser definido de novo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat direto
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # A via de escape sob a comodidade da detecção: perguntas livres,# contagens ou qualquer prompt que o wrapper de boxes não cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes carrega as detecções já parseadas como em qualquer outra família. A confiança é um marcador de posição: o InternVL3 não emite nenhuma pontuação por box, então toda detecção recebe a mesma confiança constante, e conf= só descarta as linhas abaixo dessa constante, ele não as ordena. iou descarta boxes quase duplicados da mesma classe acima da sobreposição indicada, um efeito colateral de a decodificação gulosa repetir um objeto; não é uma passada de NMS por classe. Pule set_classes() e o vocabulário cai nos nomes do COCO-80 por padrão. Veja predição para fontes, streaming e tratamento de resultados.

Variantes

Três tamanhos: 1b, 2b e 8b, todos checkpoints -hf nativos da OpenGVLab (um backbone de LLM Qwen, não a arquitetura de torre dupla que o paper original do InternVL descreve). O harness de benchmark do LibreYOLO não mediu esta família, então não há números de acurácia publicados para compará-los; escolha um tamanho de acordo com o seu próprio orçamento de computação.

O LibreYOLO expõe esta família apenas para predição. train(), val() e export() levantam todos NotImplementedError: faça o fine-tuning upstream e carregue o resultado, a validação sobre dataset é ignorada porque uma confiança de marcador de posição tornaria o mAP do COCO enganoso, e a exportação está fora de escopo para um modelo generativo sem state dict para traçar.

Licenciamento

Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.

Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.

Trabalho original
InternVL3, Shanghai AI Laboratory (OpenGVLab)
Licença original
MIT (code); Qwen License (weights)
Código-fonte original
github.com/OpenGVLab/InternVL
Código do LibreYOLO
MIT
Pesos
MIT (code); Qwen License (weights), distribuído pelos autores. O LibreYOLO não hospeda nem espelha esses pesos.
Interpretação
InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.

O código do próprio InternVL3 é MIT, permissivo e utilizável em produtos comerciais e de código fechado. Os checkpoints -hf que esta família carrega trazem um backbone de LLM Qwen e são licenciados à parte, sob a Qwen License da Alibaba Cloud: livres para usar, modificar e redistribuir com a exigência de atribuição por meio de um "Built with Qwen" ou "Improved using Qwen", e com um teto de 100 milhões de usuários ativos mensais no uso comercial, acima do qual é necessária a autorização da própria Alibaba. O LibreYOLO não hospeda nem redistribui esses pesos: LibreInternVL3 baixa o tamanho correspondente diretamente de OpenGVLab/InternVL3-<size>-hf no Hugging Face na primeira vez que roda, e registra um aviso único sobre a Qwen License antes desse download.

Citação

@article{zhu2025internvl3,
  title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
  author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
  journal={arXiv preprint arXiv:2504.10479},
  year={2025}
}

Copiado do bloco de citação dos autores em github.com/OpenGVLab/InternVL#citation.

Verificado com o LibreYOLO v1.5.0. As tabelas de suporte, os checkpoints e os números de benchmark desta página são gerados a partir da biblioteca lançada e dos pesos publicados, não escritos à mão.