InternVL3
InternVL3 è un large language model multimodale nativo pubblicato da OpenGVLab che impara visione e linguaggio insieme in un'unica fase di pre-addestramento. LibreYOLO lo avvolge come rilevatore di oggetti a vocabolario aperto: qualsiasi lista di etichette testuali diventa l'insieme delle classi, senza testa fissa e senza bisogno di fine-tuning.
- Task
- detection
- Dimensioni
- 1b, 2b, 8b at 448 px
- Installa
pip install libreyolo- Livello di supporto
- Livello parallelo, dalla v. Un'interfaccia di prodotto separata, con una propria factory e un proprio contratto.
- Origine
- InternVL3 di Shanghai AI Laboratory (OpenGVLab), MIT (code); Qwen License (weights). Articolo, sorgente
- Licenze
- Codice MIT, pesi MIT (code); Qwen License (weights). Uso commerciale
Installazione
InternVL3 richiede l'extra vlm, che porta con sé transformers per il
backbone a template di chat.
pip install "libreyolo[vlm]"Predizione
LibreInternVL3 è una classe Python, non un checkpoint .pt: non si carica
attraverso la factory LibreYOLO() e la CLI libreyolo non lo risolve. Anche
la factory LibreVLM(...) (from libreyolo import LibreVLM) raggiunge questa
famiglia tramite alias, per esempio LibreVLM("internvl3-2b"); la classe usata
qui sotto è quella che costruisce. I pesi arrivano dai repository -hf di
Hugging Face di OpenGVLab, non da un mirror di LibreYOLO; la prima chiamata li
scarica e li mette in cache in locale, e prima di farlo registra un avviso di
licenza una tantum per i pesi Qwen, che sono ad accesso limitato.
from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # Vocabolario aperto: vale qualsiasi parola, non una testa di classi# fissa. Persiste in ogni predict()/track() successivo finché non lo reimposti.model.set_classes(["person", "bicycle", "dog"])result = model(SAMPLE_IMAGE, save=True) for box in result.boxes: print(box.cls, box.conf, box.xyxy)from libreyolo import LibreInternVL3, SAMPLE_IMAGE model = LibreInternVL3(size="2b") # La via di fuga sotto la comodità del rilevamento: domande libere,# conteggi o qualsiasi prompt che il wrapper dei box non copre.text = model.chat(SAMPLE_IMAGE, "Describe the scene in one sentence.")print(text)result.boxes porta i rilevamenti parsati come in qualsiasi altra famiglia. La
confidenza è un segnaposto: InternVL3 non emette nessun punteggio per box,
quindi ogni rilevamento riceve la stessa confidenza costante, e conf= scarta
soltanto le righe sotto quella costante, non le ordina. iou scarta i box
quasi duplicati della stessa classe oltre la sovrapposizione indicata, un
effetto collaterale del decoding greedy che ripete un oggetto; non è una
passata di NMS per classi. Se salti set_classes(), il vocabolario ricade sui
nomi di COCO-80. Vedi predizione per sorgenti, streaming e
gestione dei risultati.
Varianti
Tre dimensioni: 1b, 2b e 8b, tutti checkpoint -hf nativi di OpenGVLab (un
backbone LLM Qwen, non l'architettura a due torri descritta dal paper originale
di InternVL). L'harness di benchmark di LibreYOLO non ha misurato questa
famiglia, quindi non ci sono numeri di accuratezza pubblicati con cui
confrontarle; scegli una dimensione in base al tuo budget di calcolo.
LibreYOLO espone questa famiglia solo per la predizione. train(), val() ed
export() sollevano tutti NotImplementedError: fai fine-tuning upstream e
carica il risultato, la validazione su dataset è saltata perché una confidenza
segnaposto renderebbe fuorviante il mAP di COCO, e l'esportazione è fuori
ambito per un modello generativo senza state dict da tracciare.
Licenze
Controlla la licenza nel repository Hugging Face degli specifici pesi che scarichi. Ogni checkpoint nell<link>organizzazione LibreYOLO</link> ne include una e non è sempre la stessa per tutta la famiglia. Quel repository è la fonte autorevole; il riepilogo seguente descrive le condizioni applicabili al momento dellultima verifica di questa pagina.
Questa è una descrizione delle licenze coinvolte, non una consulenza legale. Se la risposta è importante a fini commerciali, leggi personalmente le licenze e chiedi una consulenza indipendente.
- Lavoro originale
- InternVL3, Shanghai AI Laboratory (OpenGVLab)
- Licenza upstream
- MIT (code); Qwen License (weights)
- Sorgente upstream
- github.com/OpenGVLab/InternVL
- Codice LibreYOLO
- MIT
- Pesi
- MIT (code); Qwen License (weights), distribuiti dai rispettivi autori. LibreYOLO non li ospita né ne mantiene una copia.
- Interpretazione
- InternVL3's own code is MIT, permissive and usable in commercial and closed-source products. The `-hf` checkpoints this family loads carry a Qwen LLM backbone and are licensed separately, under Alibaba Cloud's Qwen License: free to use, modify and redistribute with a "Built with Qwen" or "Improved using Qwen" attribution requirement, and a 100 million monthly-active-user ceiling on commercial use above which Alibaba's own authorization is required. LibreYOLO does not host or redistribute these weights: LibreInternVL3 downloads the matching size directly from OpenGVLab/InternVL3-<size>-hf on Hugging Face the first time it runs, and logs a one-time notice for the Qwen License before that download.
Il codice di InternVL3 è MIT, permissivo e utilizzabile in prodotti commerciali
e a codice chiuso. I checkpoint -hf che questa famiglia carica portano un
backbone LLM Qwen e sono licenziati a parte, sotto la Qwen License di Alibaba
Cloud: liberi da usare, modificare e ridistribuire con l'obbligo di attribuire
tramite un "Built with Qwen" o "Improved using Qwen", e con un tetto di 100
milioni di utenti attivi mensili nell'uso commerciale, oltre il quale serve
l'autorizzazione di Alibaba stessa. LibreYOLO non ospita né ridistribuisce
questi pesi: LibreInternVL3 scarica la dimensione corrispondente direttamente
da OpenGVLab/InternVL3-<size>-hf su Hugging Face la prima volta che viene
eseguito, e registra un avviso una tantum per la Qwen License prima di quel
download.
Citazione
@article{zhu2025internvl3,
title={Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models},
author={Zhu, Jinguo and Wang, Weiyun and Chen, Zhe and Liu, Zhaoyang and Ye, Shenglong and Gu, Lixin and Tian, Hao and Duan, Yuchen and Su, Weijie and Shao, Jie and others},
journal={arXiv preprint arXiv:2504.10479},
year={2025}
}Copiato dal blocco di citazione degli autori disponibile su github.com/OpenGVLab/InternVL#citation.