InternVL3
InternVL3 es un modelo de lenguaje grande multimodal nativo publicado por OpenGVLab que aprende visión y lenguaje de forma conjunta en una única etapa de preentrenamiento. LibreYOLO lo envuelve como detector de objetos de vocabulario abierto: cualquier lista de etiquetas de texto se convierte en el conjunto de clases, sin cabeza fija y sin necesidad de hacer fine-tuning.
- Tareas
- detection
- Tamaños
- 1b, 2b, 8b at 448 px
- Instalación
pip install libreyolo- Nivel de compatibilidad
- Nivel hermano, desde v. Una superficie de producto independiente con su propia factoría y su propio contrato.
- Proyecto original
- InternVL3 de Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Artículo, fuente
- Licencias
- Código MIT, pesos MIT (code); Qwen License (weights). Uso comercial
Instalación
InternVL3 necesita el extra vlm, que arrastra transformers para el backbone
de plantillas de chat.
pip install "libreyolo[vlm]"Predicción
LibreInternVL3 es una clase de Python, no un checkpoint .pt: no se carga a
través de la factoría LibreYOLO(), y la CLI libreyolo no lo resuelve. La
factoría LibreVLM(...) (from libreyolo import LibreVLM) también llega a
esta familia por alias, p. ej. LibreVLM("internvl3-2b"); la clase que se usa
abajo es la que construye. Los pesos vienen de los propios repositorios -hf
de Hugging Face de OpenGVLab, no de un mirror de LibreYOLO; la primera llamada
los descarga y los cachea en local, y antes registra un aviso de licencia único
por los pesos de Qwen, que son de acceso restringido.
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Vocabulario abierto: vale cualquier palabra, no una cabeza de clases# fija. Persiste en cada predict()/track() posterior hasta volver a fijarlo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # La vía de escape bajo la comodidad de la detección: preguntas libres,# recuentos o cualquier prompt que el envoltorio de cajas no cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes lleva las detecciones parseadas igual que en cualquier otra
familia. La confianza es un marcador de posición: InternVL3 no emite ninguna
puntuación por caja, así que todas las detecciones reciben la misma confianza
constante, y conf= solo descarta las filas por debajo de esa constante, no
las ordena. iou descarta las cajas casi duplicadas de la misma clase por
encima del solape indicado, un efecto secundario de que el decodificado voraz
repita un objeto; no es una pasada de NMS por clases. Si te saltas
set_classes(), el vocabulario cae por defecto en los nombres de COCO-80.
Consulta predicción para fuentes, streaming y manejo de
resultados.
Variantes
Tres tamaños: 1b, 2b y 8b, todos ellos checkpoints -hf nativos de OpenGVLab
(un backbone de LLM Qwen, no la arquitectura de dos torres que describe el
paper original de InternVL). El harness de benchmarks de LibreYOLO no ha medido
esta familia, así que no hay cifras de precisión publicadas con las que
compararlos; elige un tamaño según tu propio presupuesto de cómputo.
LibreYOLO expone esta familia solo para predicción. train(), val() y
export() lanzan todos NotImplementedError: haz el fine-tuning upstream y
carga el resultado, la validación sobre dataset se omite porque una confianza
de marcador de posición haría engañoso el mAP de COCO, y la exportación queda
fuera del alcance para un modelo generativo sin state dict que trazar.
Licencia
Comprueba la licencia en el repositorio de Hugging Face de los pesos concretos que descargues. Cada checkpoint de la organización de LibreYOLO incluye una, y no siempre es la misma en toda una familia. Ese repositorio es la fuente autorizada; el resumen siguiente describe qué se aplicaba cuando se verificó esta página por última vez.
Esta es una descripción de las licencias implicadas, no asesoramiento legal. Si la respuesta es importante a nivel comercial, lee las licencias y busca tu propio asesoramiento.
- Trabajo original
- InternVL3, Shanghai AI Laboratory (OpenGVLab)
- Licencia del proyecto original
- MIT (code); Qwen License (weights)
- Fuente del proyecto original
- github.com/OpenGVLab/InternVL
- Código de LibreYOLO
- MIT
- Pesos
- MIT (code); Qwen License (weights), distribuidos por sus autores. LibreYOLO no los aloja ni los replica.
- Interpretación
- InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.
El código propio de InternVL3 es MIT, permisivo y utilizable en productos
comerciales y de código cerrado. Los checkpoints -hf que carga esta familia
llevan un backbone de LLM Qwen y se licencian aparte, bajo la Qwen License de
Alibaba Cloud: libre de usar, modificar y redistribuir con la obligación de
atribuir mediante un "Built with Qwen" o "Improved using Qwen", y con un techo
de 100 millones de usuarios activos mensuales en el uso comercial por encima
del cual hace falta la autorización de la propia Alibaba. LibreYOLO no aloja ni
redistribuye estos pesos: LibreInternVL3 descarga el tamaño correspondiente
directamente de OpenGVLab/InternVL3-<size>-hf en Hugging Face la primera vez
que se ejecuta, y registra un aviso único por la Qwen License antes de esa
descarga.
Cita
@article{zhu2025internvl3,
title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
journal={arXiv preprint arXiv:2504.10479},
year={2025}
}Copiado del bloque de cita de los autores en github.com/OpenGVLab/InternVL#citation.