InternVL3

InternVL3 ist ein natives multimodales Large Language Model von OpenGVLab, das Bild und Sprache gemeinsam in einer einzigen Vortrainingsphase lernt. LibreYOLO bindet es als Open-Vocabulary-Objektdetektor ein: Jede Liste von Textlabels wird ohne festen Head und ohne erforderliches Fine-Tuning zum Klassensatz.

Aufgaben
detection
Größen
1b, 2b, 8b at 448 px
Installation
pip install libreyolo
Supportstufe
Geschwisterstufe, seit v. Eine separate Produktoberfläche mit eigener Factory und eigenem Vertrag.
Upstream
InternVL3 von Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Publikation, Quelle
Lizenzen
Code MIT, Gewichte MIT (code); Qwen License (weights). Kommerzielle Nutzung

Installation

InternVL3 benötigt das Extra vlm, das transformers für das Chat-Template-Backbone mitinstalliert.

bash
pip install "libreyolo[vlm]"

Vorhersage

LibreInternVL3 ist eine Python-Klasse und kein .pt-Checkpoint. Sie wird nicht über die Factory LibreYOLO() geladen und von der libreyolo-CLI nicht aufgelöst. Die Factory LibreVLM(...) (from libreyolo import LibreVLM) erreicht diese Familie ebenfalls über einen Alias, zum Beispiel mit LibreVLM("internvl3-2b"). Sie erstellt die nachfolgend verwendete Klasse. Die Gewichte stammen aus den eigenen -hf-Repositorys von OpenGVLab auf Hugging Face und nicht aus einem LibreYOLO-Spiegel. Beim ersten Aufruf werden sie heruntergeladen und lokal zwischengespeichert. Zuvor wird einmalig ein Lizenzhinweis zu den zugangsbeschränkten Qwen-Gewichten protokolliert.

Python
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Offenes Vokabular: beliebige Wörter statt eines festen Klassen-Heads.# Gilt für alle späteren predict()/track()-Aufrufe bis zur Neubelegung.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
Unverarbeiteter Chat
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Der Ausweg unterhalb der komfortablen Erkennung: freie Fragen,# Zählaufgaben oder Prompts, die der Boxen-Wrapper nicht abdeckt.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)

result.boxes enthält wie bei jeder anderen Familie die geparsten Erkennungen. Die Confidence ist ein Platzhalter: InternVL3 gibt keinen Score pro Box aus. Deshalb erhält jede Erkennung denselben konstanten Confidence-Wert, und conf= verwirft lediglich Zeilen unterhalb dieser Konstante, ohne sie zu ordnen. iou verwirft nahezu identische Boxen derselben Klasse oberhalb der angegebenen Überlappung. Solche Wiederholungen entstehen als Nebeneffekt des Greedy Decoding. Dies ist kein klassenweiser NMS-Durchlauf. Ohne set_classes() verwendet das Vokabular standardmäßig die COCO-80-Namen. Unter Vorhersage findest du Informationen zu Quellen, Streaming und Ergebnisverarbeitung.

Varianten

Es gibt drei Größen: 1b, 2b und 8b. Alle sind native -hf-Checkpoints von OpenGVLab mit einem Qwen-LLM-Backbone und nicht mit der Zwei-Turm-Architektur, die im ursprünglichen InternVL-Paper beschrieben wird. Der Benchmark-Harness von LibreYOLO hat diese Familie noch nicht vermessen. Daher gibt es keine veröffentlichten Accuracy-Werte für einen Vergleich. Wähle eine Größe passend zu deinem eigenen Rechenbudget.

LibreYOLO stellt diese Familie ausschließlich für Vorhersagen bereit. train(), val() und export() lösen jeweils NotImplementedError aus: Führe das Fine-Tuning im Upstream-Projekt durch und lade stattdessen das Ergebnis. Die Datensatzvalidierung wird übersprungen, weil eine Platzhalter-Confidence die COCO-mAP irreführend machen würde. Der Export liegt bei einem generativen Modell ohne nachverfolgbares State Dict außerhalb des Funktionsumfangs.

Lizenzierung

Prüfe die Lizenz im Hugging-Face-Repository der konkreten Gewichte, die du herunterlädst. Jeder Checkpoint in der LibreYOLO-Organisation hat eine Lizenz, und sie ist innerhalb einer Familie nicht immer gleich. Dieses Repository ist die maßgebliche Quelle. Die Zusammenfassung unten beschreibt den Stand bei der letzten Verifizierung dieser Seite.

Dies ist eine Beschreibung der beteiligten Lizenzen und keine Rechtsberatung. Wenn die Antwort kommerziell relevant ist, lies die Lizenzen selbst und hole eigenen Rechtsrat ein.

Originalarbeit
InternVL3, Shanghai AI Laboratory (OpenGVLab)
Upstream-Lizenz
MIT (code); Qwen License (weights)
LibreYOLO-Code
MIT
Gewichte
MIT (code); Qwen License (weights), von den Autoren verbreitet. LibreYOLO hostet oder spiegelt sie nicht.
Einordnung
InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.

Der eigene Code von InternVL3 steht unter der MIT-Lizenz. Er ist freizügig lizenziert und kann in kommerziellen sowie Closed-Source-Produkten eingesetzt werden. Die von dieser Familie geladenen -hf-Checkpoints enthalten ein Qwen-LLM-Backbone und werden separat unter der Qwen License von Alibaba Cloud lizenziert: Nutzung, Änderung und Weitergabe sind kostenlos, erfordern jedoch den Hinweis „Built with Qwen“ oder „Improved using Qwen“. Außerdem gilt für die kommerzielle Nutzung eine Obergrenze von 100 Millionen monatlich aktiven Nutzern. Oberhalb dieser Grenze ist eine eigene Genehmigung von Alibaba erforderlich. LibreYOLO hostet oder verteilt diese Gewichte nicht: LibreInternVL3 lädt beim ersten Aufruf die passende Größe direkt von OpenGVLab/InternVL3-<size>-hf auf Hugging Face herunter und protokolliert zuvor einmalig einen Hinweis zur Qwen License.

Zitieren

@article{zhu2025internvl3,
  title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
  author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
  journal={arXiv preprint arXiv:2504.10479},
  year={2025}
}

Aus dem Zitierblock der Autoren unter github.com/OpenGVLab/InternVL#citation kopiert.

Mit LibreYOLO v1.5.0 verifiziert. Supporttabellen, Checkpoints und Benchmarkwerte auf dieser Seite werden aus der veröffentlichten Bibliothek und den publizierten Gewichten generiert und nicht von Hand geschrieben.