InternVL3

InternVL3 es un modelo de lenguaje grande multimodal nativo publicado por OpenGVLab que aprende visión y lenguaje de forma conjunta en una única etapa de preentrenamiento. LibreYOLO lo envuelve como detector de objetos de vocabulario abierto: cualquier lista de etiquetas de texto se convierte en el conjunto de clases, sin cabeza fija y sin necesidad de hacer fine-tuning.

Tareas
detection
Tamaños
1b, 2b, 8b at 448 px
Instalación
pip install libreyolo
Nivel de compatibilidad
Nivel hermano, desde v. Una superficie de producto independiente con su propia factoría y su propio contrato.
Proyecto original
InternVL3 de Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Artículo, fuente
Licencias
Código MIT, pesos MIT (code); Qwen License (weights). Uso comercial

Instalación

InternVL3 necesita el extra vlm, que arrastra transformers para el backbone de plantillas de chat.

bash
pip install "libreyolo[vlm]"

Predicción

LibreInternVL3 es una clase de Python, no un checkpoint .pt: no se carga a través de la factoría LibreYOLO(), y la CLI libreyolo no lo resuelve. La factoría LibreVLM(...) (from libreyolo import LibreVLM) también llega a esta familia por alias, p. ej. LibreVLM("internvl3-2b"); la clase que se usa abajo es la que construye. Los pesos vienen de los propios repositorios -hf de Hugging Face de OpenGVLab, no de un mirror de LibreYOLO; la primera llamada los descarga y los cachea en local, y antes registra un aviso de licencia único por los pesos de Qwen, que son de acceso restringido.

Python
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Vocabulario abierto: vale cualquier palabra, no una cabeza de clases# fija. Persiste en cada predict()/track() posterior hasta volver a fijarlo.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Chat directo
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # La vía de escape bajo la comodidad de la detección: preguntas libres,# recuentos o cualquier prompt que el envoltorio de cajas no cubra.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes lleva las detecciones parseadas igual que en cualquier otra familia. La confianza es un marcador de posición: InternVL3 no emite ninguna puntuación por caja, así que todas las detecciones reciben la misma confianza constante, y conf= solo descarta las filas por debajo de esa constante, no las ordena. iou descarta las cajas casi duplicadas de la misma clase por encima del solape indicado, un efecto secundario de que el decodificado voraz repita un objeto; no es una pasada de NMS por clases. Si te saltas set_classes(), el vocabulario cae por defecto en los nombres de COCO-80. Consulta predicción para fuentes, streaming y manejo de resultados.

Variantes

Tres tamaños: 1b, 2b y 8b, todos ellos checkpoints -hf nativos de OpenGVLab (un backbone de LLM Qwen, no la arquitectura de dos torres que describe el paper original de InternVL). El harness de benchmarks de LibreYOLO no ha medido esta familia, así que no hay cifras de precisión publicadas con las que compararlos; elige un tamaño según tu propio presupuesto de cómputo.

LibreYOLO expone esta familia solo para predicción. train(), val() y export() lanzan todos NotImplementedError: haz el fine-tuning upstream y carga el resultado, la validación sobre dataset se omite porque una confianza de marcador de posición haría engañoso el mAP de COCO, y la exportación queda fuera del alcance para un modelo generativo sin state dict que trazar.

Licencia

Comprueba la licencia en el repositorio de Hugging Face de los pesos concretos que descargues. Cada checkpoint de la organización de LibreYOLO incluye una, y no siempre es la misma en toda una familia. Ese repositorio es la fuente autorizada; el resumen siguiente describe qué se aplicaba cuando se verificó esta página por última vez.

Esta es una descripción de las licencias implicadas, no asesoramiento legal. Si la respuesta es importante a nivel comercial, lee las licencias y busca tu propio asesoramiento.

Trabajo original
InternVL3, Shanghai AI Laboratory (OpenGVLab)
Licencia del proyecto original
MIT (code); Qwen License (weights)
Fuente del proyecto original
github.com/OpenGVLab/InternVL
Código de LibreYOLO
MIT
Pesos
MIT (code); Qwen License (weights), distribuidos por sus autores. LibreYOLO no los aloja ni los replica.
Interpretación
InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.

El código propio de InternVL3 es MIT, permisivo y utilizable en productos comerciales y de código cerrado. Los checkpoints -hf que carga esta familia llevan un backbone de LLM Qwen y se licencian aparte, bajo la Qwen License de Alibaba Cloud: libre de usar, modificar y redistribuir con la obligación de atribuir mediante un "Built with Qwen" o "Improved using Qwen", y con un techo de 100 millones de usuarios activos mensuales en el uso comercial por encima del cual hace falta la autorización de la propia Alibaba. LibreYOLO no aloja ni redistribuye estos pesos: LibreInternVL3 descarga el tamaño correspondiente directamente de OpenGVLab/InternVL3-<size>-hf en Hugging Face la primera vez que se ejecuta, y registra un aviso único por la Qwen License antes de esa descarga.

Cita

@article{zhu2025internvl3,
  title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
  author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
  journal={arXiv preprint arXiv:2504.10479},
  year={2025}
}

Copiado del bloque de cita de los autores en github.com/OpenGVLab/InternVL#citation.

Verificado con LibreYOLO v1.5.0. Las tablas de compatibilidad, los checkpoints y las cifras de rendimiento de esta página se generan a partir de la biblioteca publicada y los pesos publicados; no se escriben a mano.