LingBot-Vision
LingBot-Vision è una famiglia di backbone vision transformer autosupervisionati, addestrati con un masked modeling centrato sui contorni per la percezione spaziale densa, rilasciata da Robbyant. LibreYOLO abbina il backbone a una testa densa e lo supporta per un solo task: la segmentazione semantica.
- Task
- semantic
- Dimensioni
- Installa
pip install libreyolo- Livello di supporto
- Supportato, dalla v. Modelli addestrabili di supporto: mantenuti funzionanti nella CI, ricevono nuove funzionalità quando possibile.
- Licenze
- Codice Apache-2.0, pesi Apache-2.0. Uso commerciale
Installazione
LingBot-Vision non richiede nessun extra opzionale. Tutto ciò che importa è già nell'installazione di base.
pip install libreyoloPredizione
I pesi vengono scaricati da Hugging Face al primo utilizzo e restano nella cache locale.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Trueresult.semantic_mask porta la mappa densa delle classi: .data è un tensore
(H, W) di id di classe alla dimensione originale dell'immagine, e .classes
elenca gli id di classe effettivamente presenti. result.boxes è None,
perché non ci sono rilevamenti per singola istanza. conf e iou sono
accettati per parità di API ma non cambiano l'output, dato che il modello
restituisce una classe per pixel invece di rilevamenti da filtrare. Vedi
predizione per sorgenti, streaming e gestione dei risultati.
Varianti
Tre taglie pubblicate, s, b e l, distillate da un teacher ViT-g/16 da 1,1
miliardi di parametri. Il teacher stesso, taglia g, si carica e si affina in
LibreYOLO, ma LibreYOLO non ospita un checkpoint g proprio.
| File | Ingresso (px) | Licenza dei pesi |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Oggi tutti i file elencati sopra sono presenti nell<link>organizzazione LibreYOLO</link> e vengono scaricati al primo utilizzo.
Addestramento
train() fa fine-tuning di un checkpoint pubblicato. La ricetta predefinita è
il linear probe del report upstream: il backbone ViT è congelato e si addestra
solo la testa densa 1x1, esattamente come sono stati prodotti i pesi ospitati
da LibreYOLO qui sopra. Passa freeze_backbone=False per fare invece
fine-tuning dell'intera rete, e aspettati di dover abbassare lr0 di
conseguenza.
from libreyolo import LibreYOLO # Backbone congelato per impostazione predefinita, come nel protocollo# di valutazione upstream: si addestra solo la testa densa 1x1.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 imgsz=512 batch=16from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train( data="my-dataset.yaml", epochs=20, imgsz=512, batch=16, freeze_backbone=False,)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 device=0,1 batch=32Vedi addestramento per dataset, data augmentation, multi-GPU e logger.
Validazione
val() restituisce un dizionario di chiavi metrics/: mIoU e accuratezza per
pixel, misurate su qualsiasi dataset nel formato con cui hai addestrato.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yamlEsportazione
| Task | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: supportato | semantic to TorchScript: supportato | semantic to ExecuTorch: supportato | semantic to TensorRT: supportato | semantic to OpenVINO: supportato | semantic to Paddle: non supportato | semantic to MNN: non supportato | semantic to RKNN: non supportato | semantic to ncnn: non supportato | semantic to TFLite: non supportato | semantic to CoreML: non supportato | semantic to Core AI: supportato |
Un artefatto esportato si ricarica con LibreYOLO() in base al suffisso del
file, quindi un file .onnx o .engine si comporta come un checkpoint e
restituisce lo stesso Results. Esportazione elenca gli
argomenti accettati da ogni formato.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512from libreyolo import LibreYOLO, SAMPLE_IMAGE # La factory smista in base al suffisso del file, quindi un artefatto# esportato si carica come qualsiasi checkpoint e restituisce lo stesso# oggetto Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)Checkpoint
Tutti i file di pesi pubblicati per questa famiglia.
| File | Ingresso (px) | Licenza dei pesi |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Oggi tutti i file elencati sopra sono presenti nell<link>organizzazione LibreYOLO</link> e vengono scaricati al primo utilizzo.
Licenze
Controlla la licenza nel repository Hugging Face degli specifici pesi che scarichi. Ogni checkpoint nell<link>organizzazione LibreYOLO</link> ne include una e non è sempre la stessa per tutta la famiglia. Quel repository è la fonte autorevole; il riepilogo seguente descrive le condizioni applicabili al momento dellultima verifica di questa pagina.
Questa è una descrizione delle licenze coinvolte, non una consulenza legale. Se la risposta è importante a fini commerciali, leggi personalmente le licenze e chiedi una consulenza indipendente.
- Lavoro originale
- LingBot-Vision, Robbyant (Ant Group)
- Licenza upstream
- Apache-2.0
- Sorgente upstream
- github.com/robbyant/lingbot-vision
- Codice LibreYOLO
- MIT
- Pesi
- Apache-2.0, ripubblicati su huggingface.co/LibreYOLO
- Interpretazione
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.
La release upstream documenta il proprio ViT come costruito sull'architettura DINOv2/DINOv3 pubblicata da Meta AI. Robbyant distribuisce la propria implementazione con licenza Apache-2.0, e questo port per LibreYOLO è stato realizzato solo a partire dal repository di Robbyant, mai dal codice DINOv2 o DINOv3 di Meta.
Citazione
@article{lingbot-vision2026,
title={Vision Pretraining for Dense Spatial Perception},
author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
journal={arXiv preprint arXiv:2607.05247},
year={2026}
}Copiato dal blocco di citazione degli autori disponibile su github.com/robbyant/lingbot-vision#-citation.