InternVL3
InternVL3 ist ein natives multimodales Large Language Model von OpenGVLab, das Bild und Sprache gemeinsam in einer einzigen Vortrainingsphase lernt. LibreYOLO bindet es als Open-Vocabulary-Objektdetektor ein: Jede Liste von Textlabels wird ohne festen Head und ohne erforderliches Fine-Tuning zum Klassensatz.
- Aufgaben
- detection
- Größen
- 1b, 2b, 8b at 448 px
- Installation
pip install libreyolo- Supportstufe
- Geschwisterstufe, seit v. Eine separate Produktoberfläche mit eigener Factory und eigenem Vertrag.
- Upstream
- InternVL3 von Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Publikation, Quelle
- Lizenzen
- Code MIT, Gewichte MIT (code); Qwen License (weights). Kommerzielle Nutzung
Installation
InternVL3 benötigt das Extra vlm, das transformers für das
Chat-Template-Backbone mitinstalliert.
pip install "libreyolo[vlm]"Vorhersage
LibreInternVL3 ist eine Python-Klasse und kein .pt-Checkpoint. Sie wird
nicht über die Factory LibreYOLO() geladen und von der libreyolo-CLI nicht
aufgelöst. Die Factory LibreVLM(...) (from libreyolo import LibreVLM)
erreicht diese Familie ebenfalls über einen Alias, zum Beispiel mit
LibreVLM("internvl3-2b"). Sie erstellt die nachfolgend verwendete Klasse.
Die Gewichte stammen aus den eigenen -hf-Repositorys von OpenGVLab auf
Hugging Face und nicht aus einem LibreYOLO-Spiegel. Beim ersten Aufruf werden
sie heruntergeladen und lokal zwischengespeichert. Zuvor wird einmalig ein
Lizenzhinweis zu den zugangsbeschränkten Qwen-Gewichten protokolliert.
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Offenes Vokabular: beliebige Wörter statt eines festen Klassen-Heads.# Gilt für alle späteren predict()/track()-Aufrufe bis zur Neubelegung.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Der Ausweg unterhalb der komfortablen Erkennung: freie Fragen,# Zählaufgaben oder Prompts, die der Boxen-Wrapper nicht abdeckt.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes enthält wie bei jeder anderen Familie die geparsten
Erkennungen. Die Confidence ist ein Platzhalter: InternVL3 gibt keinen Score
pro Box aus. Deshalb erhält jede Erkennung denselben konstanten
Confidence-Wert, und conf= verwirft lediglich Zeilen unterhalb dieser
Konstante, ohne sie zu ordnen. iou verwirft nahezu identische Boxen derselben
Klasse oberhalb der angegebenen Überlappung. Solche Wiederholungen entstehen
als Nebeneffekt des Greedy Decoding. Dies ist kein klassenweiser NMS-Durchlauf.
Ohne set_classes() verwendet das Vokabular standardmäßig die COCO-80-Namen.
Unter Vorhersage findest du Informationen zu Quellen,
Streaming und Ergebnisverarbeitung.
Varianten
Es gibt drei Größen: 1b, 2b und 8b. Alle sind native -hf-Checkpoints von
OpenGVLab mit einem Qwen-LLM-Backbone und nicht mit der Zwei-Turm-Architektur,
die im ursprünglichen InternVL-Paper beschrieben wird. Der Benchmark-Harness
von LibreYOLO hat diese Familie noch nicht vermessen. Daher gibt es keine
veröffentlichten Accuracy-Werte für einen Vergleich. Wähle eine Größe passend
zu deinem eigenen Rechenbudget.
LibreYOLO stellt diese Familie ausschließlich für Vorhersagen bereit.
train(), val() und export() lösen jeweils NotImplementedError aus:
Führe das Fine-Tuning im Upstream-Projekt durch und lade stattdessen das
Ergebnis. Die Datensatzvalidierung wird übersprungen, weil eine
Platzhalter-Confidence die COCO-mAP irreführend machen würde. Der Export liegt
bei einem generativen Modell ohne nachverfolgbares State Dict außerhalb des
Funktionsumfangs.
Lizenzierung
Prüfe die Lizenz im Hugging-Face-Repository der konkreten Gewichte, die du herunterlädst. Jeder Checkpoint in der LibreYOLO-Organisation hat eine Lizenz, und sie ist innerhalb einer Familie nicht immer gleich. Dieses Repository ist die maßgebliche Quelle. Die Zusammenfassung unten beschreibt den Stand bei der letzten Verifizierung dieser Seite.
Dies ist eine Beschreibung der beteiligten Lizenzen und keine Rechtsberatung. Wenn die Antwort kommerziell relevant ist, lies die Lizenzen selbst und hole eigenen Rechtsrat ein.
- Originalarbeit
- InternVL3, Shanghai AI Laboratory (OpenGVLab)
- Upstream-Lizenz
- MIT (code); Qwen License (weights)
- Upstream-Quelle
- github.com/OpenGVLab/InternVL
- LibreYOLO-Code
- MIT
- Gewichte
- MIT (code); Qwen License (weights), von den Autoren verbreitet. LibreYOLO hostet oder spiegelt sie nicht.
- Einordnung
- InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.
Der eigene Code von InternVL3 steht unter der MIT-Lizenz. Er ist freizügig
lizenziert und kann in kommerziellen sowie Closed-Source-Produkten eingesetzt
werden. Die von dieser Familie geladenen -hf-Checkpoints enthalten ein
Qwen-LLM-Backbone und werden separat unter der Qwen License von Alibaba Cloud
lizenziert: Nutzung, Änderung und Weitergabe sind kostenlos, erfordern jedoch
den Hinweis „Built with Qwen“ oder „Improved using Qwen“. Außerdem gilt für
die kommerzielle Nutzung eine Obergrenze von 100 Millionen monatlich aktiven
Nutzern. Oberhalb dieser Grenze ist eine eigene Genehmigung von Alibaba
erforderlich. LibreYOLO hostet oder verteilt diese Gewichte nicht:
LibreInternVL3 lädt beim ersten Aufruf die passende Größe direkt von
OpenGVLab/InternVL3-<size>-hf auf Hugging Face herunter und protokolliert
zuvor einmalig einen Hinweis zur Qwen License.
Zitieren
@article{zhu2025internvl3,
title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
journal={arXiv preprint arXiv:2504.10479},
year={2025}
}Aus dem Zitierblock der Autoren unter github.com/OpenGVLab/InternVL#citation kopiert.