InternVL3
O InternVL3 é um modelo de linguagem grande multimodal nativo lançado pela OpenGVLab que aprende visão e linguagem de forma conjunta em uma única etapa de pré-treinamento. O LibreYOLO o envolve como detector de objetos de vocabulário aberto: qualquer lista de rótulos de texto vira o conjunto de classes, sem cabeça fixa e sem precisar de fine-tuning.
- Tarefas
- detection
- Tamanhos
- 1b, 2b, 8b at 448 px
- Instalação
pip install libreyolo- Nível de suporte
- Nível irmão, desde a v. Uma superfície de produto separada, com sua própria fábrica e seu próprio contrato.
- Origem
- InternVL3 por Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Artigo, código-fonte
- Licenças
- Código MIT, pesos MIT (code); Qwen License (weights). Uso comercial
Instalação
O InternVL3 precisa do extra vlm, que traz junto o transformers para o
backbone de templates de chat.
pip install "libreyolo[vlm]"Predição
LibreInternVL3 é uma classe Python, não um checkpoint .pt: ele não é
carregado pela factory LibreYOLO(), e a CLI libreyolo não o resolve. A
factory LibreVLM(...) (from libreyolo import LibreVLM) também alcança esta
família por alias, por exemplo LibreVLM("internvl3-2b"); a classe usada
abaixo é a que ela constrói. Os pesos vêm dos próprios repositórios -hf da
OpenGVLab no Hugging Face, não de um mirror do LibreYOLO; a primeira chamada
baixa e guarda em cache localmente, e antes disso registra um aviso de licença
único sobre os pesos Qwen, que são de acesso restrito.
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Vocabulário aberto: vale qualquer palavra, não uma cabeça de# classes fixa. Persiste em cada predict()/track() posterior até# ser definido de novo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # A via de escape sob a comodidade da detecção: perguntas livres,# contagens ou qualquer prompt que o wrapper de boxes não cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes carrega as detecções já parseadas como em qualquer outra
família. A confiança é um marcador de posição: o InternVL3 não emite nenhuma
pontuação por box, então toda detecção recebe a mesma confiança constante, e
conf= só descarta as linhas abaixo dessa constante, ele não as ordena. iou
descarta boxes quase duplicados da mesma classe acima da sobreposição indicada,
um efeito colateral de a decodificação gulosa repetir um objeto; não é uma
passada de NMS por classe. Pule set_classes() e o vocabulário cai nos nomes
do COCO-80 por padrão. Veja predição para fontes, streaming e
tratamento de resultados.
Variantes
Três tamanhos: 1b, 2b e 8b, todos checkpoints -hf nativos da OpenGVLab (um
backbone de LLM Qwen, não a arquitetura de torre dupla que o paper original do
InternVL descreve). O harness de benchmark do LibreYOLO não mediu esta família,
então não há números de acurácia publicados para compará-los; escolha um
tamanho de acordo com o seu próprio orçamento de computação.
O LibreYOLO expõe esta família apenas para predição. train(), val() e
export() levantam todos NotImplementedError: faça o fine-tuning upstream e
carregue o resultado, a validação sobre dataset é ignorada porque uma confiança
de marcador de posição tornaria o mAP do COCO enganoso, e a exportação está
fora de escopo para um modelo generativo sem state dict para traçar.
Licenciamento
Confira a licença no repositório do Hugging Face correspondente aos pesos que você baixar. Cada checkpoint na organização LibreYOLO tem uma licença, e ela nem sempre é a mesma em toda a família. Esse repositório é a fonte oficial. O resumo abaixo descreve o que se aplicava na última verificação desta página.
Esta é uma descrição das licenças envolvidas, não uma orientação jurídica. Se a resposta tiver importância comercial, leia as licenças e procure sua própria assessoria.
- Trabalho original
- InternVL3, Shanghai AI Laboratory (OpenGVLab)
- Licença original
- MIT (code); Qwen License (weights)
- Código-fonte original
- github.com/OpenGVLab/InternVL
- Código do LibreYOLO
- MIT
- Pesos
- MIT (code); Qwen License (weights), distribuído pelos autores. O LibreYOLO não hospeda nem espelha esses pesos.
- Interpretação
- InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.
O código do próprio InternVL3 é MIT, permissivo e utilizável em produtos
comerciais e de código fechado. Os checkpoints -hf que esta família carrega
trazem um backbone de LLM Qwen e são licenciados à parte, sob a Qwen License da
Alibaba Cloud: livres para usar, modificar e redistribuir com a exigência de
atribuição por meio de um "Built with Qwen" ou "Improved using Qwen", e com um
teto de 100 milhões de usuários ativos mensais no uso comercial, acima do qual
é necessária a autorização da própria Alibaba. O LibreYOLO não hospeda nem
redistribui esses pesos: LibreInternVL3 baixa o tamanho correspondente
diretamente de OpenGVLab/InternVL3-<size>-hf no Hugging Face na primeira vez
que roda, e registra um aviso único sobre a Qwen License antes desse download.
Citação
@article{zhu2025internvl3,
title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
journal={arXiv preprint arXiv:2504.10479},
year={2025}
}Copiado do bloco de citação dos autores em github.com/OpenGVLab/InternVL#citation.