LingBot-Vision
LingBot-Vision adalah family backbone vision transformer self-supervised yang dilatih dengan masked modeling berpusat pada batas untuk persepsi spasial padat dan dirilis oleh Robbyant. LibreYOLO memasangkan backbone dengan head padat dan mendukungnya untuk satu task, yaitu segmentasi semantik.
- Task
- semantic
- Ukuran
- Instalasi
pip install libreyolo- Tier dukungan
- Didukung, sejak v. Model pendukung yang dapat dilatih: CI dijaga tetap lulus, fitur ditambahkan saat ada kesempatan.
- Lisensi
- Kode Apache-2.0, bobot Apache-2.0. Penggunaan komersial
Instalasi
LingBot-Vision tidak memerlukan extra opsional. Semua yang diimpornya tersedia dalam instalasi dasar.
pip install libreyoloPrediksi
Bobot diunduh dari Hugging Face saat pertama kali digunakan dan disimpan dalam cache lokal.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Trueresult.semantic_mask memuat peta kelas padat. .data adalah tensor ID kelas
(H, W) pada ukuran gambar asli, sedangkan .classes mencantumkan ID kelas yang
benar-benar ada. result.boxes adalah None karena tidak ada deteksi per
instance. conf dan iou diterima demi paritas API, tetapi tidak mengubah
output karena model mengembalikan satu kelas per piksel, bukan deteksi yang
perlu difilter. Lihat prediksi untuk sumber, streaming, dan
penanganan hasil.
Varian
Ada tiga ukuran yang dipublikasikan, s, b, dan l, yang didistilasi dari teacher
ViT-g/16 dengan 1.1 miliar parameter. Teacher itu sendiri, ukuran g, dapat
dimuat dan menjalani fine-tuning di LibreYOLO, tetapi LibreYOLO tidak menghosting
checkpoint g miliknya sendiri.
| Berkas | Input (piksel) | Lisensi bobot |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.
Pelatihan
train() melakukan fine-tuning pada checkpoint yang dipublikasikan. Resep
default adalah linear probe dari laporan upstream: backbone ViT dibekukan dan
hanya head padat 1x1 yang dilatih, sesuai cara bobot yang dihosting LibreYOLO di
atas dibuat. Teruskan freeze_backbone=False untuk melakukan fine-tuning pada
seluruh jaringan dan turunkan lr0 sesuai kebutuhan.
from libreyolo import LibreYOLO # Backbone dibekukan secara default agar sesuai dengan protokol evaluasi upstream:# hanya head padat 1x1 yang dilatih.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 imgsz=512 batch=16from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train( data="my-dataset.yaml", epochs=20, imgsz=512, batch=16, freeze_backbone=False,)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 device=0,1 batch=32Lihat pelatihan untuk dataset, augmentasi, multi-GPU, dan logger.
Validasi
val() mengembalikan dictionary key metrics/, yaitu mIoU dan akurasi piksel
yang diukur terhadap dataset apa pun dalam format yang digunakan saat pelatihan.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yamlEkspor
| Task | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: didukung | semantic to TorchScript: didukung | semantic to ExecuTorch: didukung | semantic to TensorRT: didukung | semantic to OpenVINO: didukung | semantic to Paddle: tidak didukung | semantic to MNN: tidak didukung | semantic to RKNN: tidak didukung | semantic to ncnn: tidak didukung | semantic to TFLite: tidak didukung | semantic to CoreML: tidak didukung | semantic to Core AI: didukung |
Artefak hasil ekspor dapat dimuat kembali melalui LibreYOLO() berdasarkan
akhiran berkasnya, sehingga berkas .onnx atau .engine berperilaku seperti
checkpoint dan mengembalikan Results yang sama. Ekspor
mencantumkan argumen yang diterima oleh setiap format.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512from libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory merutekan berdasarkan akhiran berkas, sehingga artefak hasil ekspor dimuat# seperti checkpoint lain dan mengembalikan objek Results yang sama.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)Checkpoint
Semua berkas bobot yang dipublikasikan untuk family ini.
| Berkas | Input (piksel) | Lisensi bobot |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.
Lisensi
Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.
Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.
- Karya asli
- LingBot-Vision, Robbyant (Ant Group)
- Lisensi upstream
- Apache-2.0
- Sumber upstream
- github.com/robbyant/lingbot-vision
- Kode LibreYOLO
- MIT
- Bobot
- Apache-2.0, dipublikasikan ulang di huggingface.co/LibreYOLO
- Interpretasi
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.
Rilis upstream mendokumentasikan bahwa ViT-nya dibangun berdasarkan arsitektur DINOv2/DINOv3 yang dipublikasikan Meta AI. Robbyant mendistribusikan implementasinya dengan lisensi Apache-2.0, dan port LibreYOLO ini hanya dibuat dari repository Robbyant, tidak pernah dari kode DINOv2 atau DINOv3 milik Meta.
Sitasi
@article{lingbot-vision2026,
title={Vision Pretraining for Dense Spatial Perception},
author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
journal={arXiv preprint arXiv:2607.05247},
year={2026}
}Disalin dari blok sitasi penulis di github.com/robbyant/lingbot-vision#-citation.