InternVL3
InternVL3 to natywny, duży model multimodalny wydany przez OpenGVLab, który wspólnie uczy się obrazu i języka w jednym etapie trenowania wstępnego. LibreYOLO udostępnia go jako detektor obiektów z otwartym słownikiem: dowolna lista etykiet tekstowych staje się zbiorem klas, bez stałej głowicy i bez potrzeby dostrajania.
- Zadania
- detection
- Rozmiary
- 1b, 2b, 8b at 448 px
- Instalacja
pip install libreyolo- Poziom obsługi
- Poziom siostrzany, od wersji v. Osobna część produktu z własną fabryką i kontraktem.
- Projekt źródłowy
- InternVL3, autorzy: Shanghai AI Laboratory (OpenGVLab), licencja: MIT (code); Qwen License (weights). Publikacja, kod źródłowy
- Licencje
- Kod: MIT, wagi: MIT (code); Qwen License (weights). Użycie komercyjne
Instalacja
InternVL3 wymaga dodatku vlm, który instaluje transformers dla backbone z
szablonem czatu.
pip install "libreyolo[vlm]"Predykcja
LibreInternVL3 jest klasą Pythona, a nie checkpointem .pt. Nie jest
wczytywany przez fabrykę LibreYOLO(), a CLI libreyolo go nie rozpoznaje.
Fabryka LibreVLM(...) (from libreyolo import LibreVLM) także udostępnia tę
rodzinę przez alias, na przykład LibreVLM("internvl3-2b"). Użyta poniżej klasa
jest tym, co tworzy ta fabryka. Wagi pochodzą z własnych repozytoriów -hf
OpenGVLab na Hugging Face, a nie z kopii lustrzanej LibreYOLO. Pierwsze
wywołanie pobiera je i zapisuje lokalnie w pamięci podręcznej, uprzednio
jednorazowo wypisując informację o licencji kontrolowanych wag Qwen.
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Otwarty słownik: działają dowolne słowa, a nie stała głowica klas. Ustawienie# obowiązuje w każdym późniejszym wywołaniu predict()/track(), dopóki nie zostanie zmienione.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Bezpośredni dostęp pod wygodną warstwą detekcji: swobodne pytania,# zliczanie lub dowolny prompt nieobsługiwany przez wrapper ramek.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes zawiera przetworzone detekcje tak jak w każdej innej rodzinie.
Pewność jest wartością zastępczą. InternVL3 nie zwraca wyniku dla poszczególnych
ramek, dlatego każda detekcja otrzymuje tę samą stałą pewność, a conf= jedynie
odrzuca wiersze poniżej tej stałej, bez ich klasyfikowania. iou odrzuca prawie
identyczne ramki tej samej klasy powyżej podanego nakładania, będące skutkiem
powtarzania obiektu przez zachłanne dekodowanie. Nie jest to etap NMS osobny dla
każdej klasy. Pominięcie set_classes() pozostawia domyślne nazwy COCO-80.
Więcej informacji o źródłach, streamingu i obsłudze wyników zawiera strona
predykcji.
Warianty
Dostępne są trzy rozmiary, 1b, 2b i 8b, wszystkie jako natywne checkpointy
-hf OpenGVLab z backbone LLM Qwen, a nie dwuwieżową architekturą opisaną w
oryginalnej publikacji InternVL. Zestaw testowy LibreYOLO nie wykonał pomiarów
tej rodziny, dlatego nie ma opublikowanych wyników dokładności do ich
porównania. Rozmiar należy dobrać do własnego budżetu obliczeniowego.
LibreYOLO udostępnia tę rodzinę wyłącznie do predykcji. train(), val() i
export() zawsze zgłaszają NotImplementedError. Model należy dostroić w
projekcie źródłowym i wczytać wynik. Walidacja zbioru danych jest pomijana,
ponieważ zastępcza pewność nadawałaby metryce COCO mAP mylący charakter, a
eksport pozostaje poza zakresem modelu generatywnego bez state dict możliwego do
śledzenia.
Licencja
Sprawdź licencję w repozytorium konkretnych pobieranych wag na Hugging Face. Każdy checkpoint w organizacji LibreYOLO ma licencję, która nie zawsze jest taka sama w całej rodzinie. To repozytorium jest źródłem rozstrzygającym, a poniższe podsumowanie opisuje stan z chwili ostatniej weryfikacji tej strony.
To opis obowiązujących licencji, a nie porada prawna. Jeśli odpowiedź ma znaczenie komercyjne, przeczytaj licencje i zasięgnij własnej porady prawnej.
- Oryginalna praca
- InternVL3, Shanghai AI Laboratory (OpenGVLab)
- Licencja projektu źródłowego
- MIT (code); Qwen License (weights)
- Kod źródłowy projektu
- github.com/OpenGVLab/InternVL
- Kod LibreYOLO
- MIT
- Wagi
- MIT (code); Qwen License (weights), rozpowszechniane przez autorów. LibreYOLO ich nie hostuje ani nie udostępnia kopii.
- Interpretacja
- InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.
Własny kod InternVL3 podlega licencji MIT, jest liberalny i nadaje się do
produktów komercyjnych oraz zamkniętych. Checkpointy -hf wczytywane przez tę
rodzinę zawierają backbone LLM Qwen i mają osobną licencję Alibaba Cloud Qwen
License. Pozwala ona bezpłatnie używać, modyfikować i redystrybuować model z
wymaganym oznaczeniem „Built with Qwen” lub „Improved using Qwen” oraz limitem
100 milionów aktywnych użytkowników miesięcznie dla zastosowań komercyjnych.
Powyżej tego limitu wymagane jest zezwolenie Alibaba. LibreYOLO nie hostuje ani
nie redystrybuuje tych wag. Przy pierwszym uruchomieniu LibreInternVL3 pobiera
odpowiedni rozmiar bezpośrednio z OpenGVLab/InternVL3-<size>-hf na Hugging Face
i wyświetla przed pobraniem jednorazową informację o Qwen License.
Cytowanie
@article{zhu2025internvl3,
title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
journal={arXiv preprint arXiv:2504.10479},
year={2025}
}Skopiowano z bloku cytowania autorów w github.com/OpenGVLab/InternVL#citation.