InternVL3
InternVL3 est un grand modèle de langage multimodal natif publié par OpenGVLab, qui apprend conjointement la vision et le langage en une seule phase de pré-entraînement. LibreYOLO l'encapsule comme détecteur d'objets à vocabulaire ouvert : n'importe quelle liste d'étiquettes textuelles devient l'ensemble des classes, sans tête fixe et sans fine-tuning à faire.
- Tâches
- detection
- Tailles
- 1b, 2b, 8b at 448 px
- Installer
pip install libreyolo- Niveau de support
- Niveau parallèle, depuis v. Une interface produit distincte avec sa propre factory et son propre contrat.
- Origine
- InternVL3 par Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Article, source
- Licences
- Code MIT, poids MIT (code); Qwen License (weights). Usage commercial
Installation
InternVL3 a besoin de l'extra vlm, qui embarque transformers pour le backbone de chat-template.
pip install "libreyolo[vlm]"Prédire
LibreInternVL3 est une classe Python, pas un checkpoint .pt : elle ne se charge pas via la factory LibreYOLO(), et la CLI libreyolo ne la résout pas. La factory LibreVLM(...) (from libreyolo import LibreVLM) atteint elle aussi cette famille par alias, par exemple LibreVLM("internvl3-2b") ; la classe utilisée ci-dessous est celle qu'elle construit. Les poids viennent des dépôts Hugging Face -hf d'OpenGVLab, pas d'un miroir LibreYOLO ; le premier appel les télécharge et les met en cache localement, après avoir journalisé un avis de licence unique pour les poids Qwen, dont l'accès est restreint.
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Vocabulaire ouvert, n'importe quels mots, pas de tête de classes# fixe. Persiste sur chaque predict()/track() jusqu'au prochain appel.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # La porte de sortie sous la couche de détection, pour les questions# libres, le comptage, ou tout prompt que le wrapper boxes ignore.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes porte les détections parsées comme dans n'importe quelle autre famille. La confiance est une valeur de remplissage : InternVL3 n'émet aucun score par boîte, donc chaque détection reçoit la même confiance constante, et conf= ne fait qu'écarter les lignes situées sous cette constante, il ne les classe pas. iou élimine les boîtes quasi dupliquées de la même classe au-dessus du recouvrement indiqué, un effet de bord du décodage glouton qui répète un objet ; ce n'est pas une passe de NMS par classe. Sautez set_classes() et le vocabulaire retombe sur les noms COCO-80. Voir la prédiction pour les sources, le streaming et le traitement des résultats.
Variantes
Trois tailles : 1b, 2b et 8b, toutes des checkpoints -hf natifs d'OpenGVLab (un backbone LLM Qwen, et non l'architecture à deux tours que décrit l'article original d'InternVL). Le harness de benchmarks de LibreYOLO n'a pas mesuré cette famille, il n'y a donc pas de chiffres d'exactitude publiés pour les comparer ; choisissez une taille en fonction de votre propre budget de calcul.
LibreYOLO n'expose cette famille que pour la prédiction. train(), val() et export() lèvent tous NotImplementedError : faites le fine-tuning en amont et chargez le résultat, la validation sur dataset est ignorée parce qu'une confiance de remplissage rendrait le mAP COCO trompeur, et l'export sort du périmètre pour un modèle génératif sans state dict à tracer.
Licence
Vérifiez la licence dans le dépôt Hugging Face des poids précis que vous téléchargez. Chaque checkpoint de l<link>organisation LibreYOLO</link> en possède une, et elles ne sont pas toujours identiques au sein dune même famille. Ce dépôt fait autorité ; le résumé ci-dessous décrit les conditions applicables lors de la dernière vérification de cette page.
Ceci décrit les licences concernées et ne constitue pas un conseil juridique. Si la réponse a une importance commerciale, lisez vous-même les licences et consultez votre propre avocat.
- Travail d'origine
- InternVL3, Shanghai AI Laboratory (OpenGVLab)
- Licence du projet d'origine
- MIT (code); Qwen License (weights)
- Source du projet d'origine
- github.com/OpenGVLab/InternVL
- Code de LibreYOLO
- MIT
- Poids
- MIT (code); Qwen License (weights), distribués par leurs auteurs. LibreYOLO ne les héberge pas et n'en fournit pas de miroir.
- Interprétation
- InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.
Le code propre à InternVL3 est sous MIT, permissif et utilisable dans des produits commerciaux et à code fermé. Les checkpoints -hf que charge cette famille portent un backbone LLM Qwen et sont sous une licence distincte, la Qwen License d'Alibaba Cloud : libres d'usage, de modification et de redistribution moyennant une attribution « Built with Qwen » ou « Improved using Qwen », et avec un plafond de 100 millions d'utilisateurs actifs mensuels sur l'usage commercial, au-delà duquel l'autorisation d'Alibaba elle-même est requise. LibreYOLO n'héberge ni ne redistribue ces poids : LibreInternVL3 télécharge la taille correspondante directement depuis OpenGVLab/InternVL3-<size>-hf sur Hugging Face au premier lancement, et journalise un avis unique pour la Qwen License avant ce téléchargement.
Citation
@article{zhu2025internvl3,
title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
journal={arXiv preprint arXiv:2504.10479},
year={2025}
}Copié depuis le bloc de citation des auteurs sur github.com/OpenGVLab/InternVL#citation.