LingBot-Vision

LingBot-Vision adalah family backbone vision transformer self-supervised yang dilatih dengan masked modeling berpusat pada batas untuk persepsi spasial padat dan dirilis oleh Robbyant. LibreYOLO memasangkan backbone dengan head padat dan mendukungnya untuk satu task, yaitu segmentasi semantik.

Task
semantic
Ukuran
Instalasi
pip install libreyolo
Tier dukungan
Didukung, sejak v. Model pendukung yang dapat dilatih: CI dijaga tetap lulus, fitur ditambahkan saat ada kesempatan.
Proyek upstream
LingBot-Vision oleh Robbyant (Ant Group), Apache-2.0. Makalah, sumber
Lisensi
Kode Apache-2.0, bobot Apache-2.0. Penggunaan komersial

Instalasi

LingBot-Vision tidak memerlukan extra opsional. Semua yang diimpornya tersedia dalam instalasi dasar.

bash
pip install libreyolo

Prediksi

Bobot diunduh dari Hugging Face saat pertama kali digunakan dan disimpan dalam cache lokal.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)
CLI
libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True

result.semantic_mask memuat peta kelas padat. .data adalah tensor ID kelas (H, W) pada ukuran gambar asli, sedangkan .classes mencantumkan ID kelas yang benar-benar ada. result.boxes adalah None karena tidak ada deteksi per instance. conf dan iou diterima demi paritas API, tetapi tidak mengubah output karena model mengembalikan satu kelas per piksel, bukan deteksi yang perlu difilter. Lihat prediksi untuk sumber, streaming, dan penanganan hasil.

Varian

Ada tiga ukuran yang dipublikasikan, s, b, dan l, yang didistilasi dari teacher ViT-g/16 dengan 1.1 miliar parameter. Teacher itu sendiri, ukuran g, dapat dimuat dan menjalani fine-tuning di LibreYOLO, tetapi LibreYOLO tidak menghosting checkpoint g miliknya sendiri.

BerkasInput (piksel)Lisensi bobot
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.

Pelatihan

train() melakukan fine-tuning pada checkpoint yang dipublikasikan. Resep default adalah linear probe dari laporan upstream: backbone ViT dibekukan dan hanya head padat 1x1 yang dilatih, sesuai cara bobot yang dihosting LibreYOLO di atas dibuat. Teruskan freeze_backbone=False untuk melakukan fine-tuning pada seluruh jaringan dan turunkan lr0 sesuai kebutuhan.

Python (linear probe)
from libreyolo import LibreYOLO # Backbone dibekukan secara default agar sesuai dengan protokol evaluasi upstream:# hanya head padat 1x1 yang dilatih.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)
CLI
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 imgsz=512 batch=16
Fine-tuning penuh
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(    data="my-dataset.yaml", epochs=20, imgsz=512, batch=16,    freeze_backbone=False,)
Multi-GPU
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 device=0,1 batch=32

Lihat pelatihan untuk dataset, augmentasi, multi-GPU, dan logger.

Validasi

val() mengembalikan dictionary key metrics/, yaitu mIoU dan akurasi piksel yang diukur terhadap dataset apa pun dalam format yang digunakan saat pelatihan.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])
CLI
libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yaml

Ekspor

TaskONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
semanticsemantic to ONNX: didukungsemantic to TorchScript: didukungsemantic to ExecuTorch: didukungsemantic to TensorRT: didukungsemantic to OpenVINO: didukungsemantic to Paddle: tidak didukungsemantic to MNN: tidak didukungsemantic to RKNN: tidak didukungsemantic to ncnn: tidak didukungsemantic to TFLite: tidak didukungsemantic to CoreML: tidak didukungsemantic to Core AI: didukung

Artefak hasil ekspor dapat dimuat kembali melalui LibreYOLO() berdasarkan akhiran berkasnya, sehingga berkas .onnx atau .engine berperilaku seperti checkpoint dan mengembalikan Results yang sama. Ekspor mencantumkan argumen yang diterima oleh setiap format.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)
CLI
libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512
Gunakan berkas hasil ekspor
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory merutekan berdasarkan akhiran berkas, sehingga artefak hasil ekspor dimuat# seperti checkpoint lain dan mengembalikan objek Results yang sama.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)

Checkpoint

Semua berkas bobot yang dipublikasikan untuk family ini.

BerkasInput (piksel)Lisensi bobot
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Setiap berkas di atas saat ini tersedia di organisasi LibreYOLO dan diunduh saat pertama kali digunakan.

Lisensi

Periksa lisensi di repositori Hugging Face untuk bobot tertentu yang diunduh. Setiap checkpoint di organisasi LibreYOLO memiliki lisensi, dan lisensinya tidak selalu sama dalam satu family. Repositori tersebut adalah sumber resmi. Ringkasan di bawah menjelaskan ketentuan yang berlaku saat halaman ini terakhir diverifikasi.

Ini adalah deskripsi lisensi yang terlibat, bukan nasihat hukum. Jika jawabannya penting secara komersial, baca sendiri lisensinya dan mintalah nasihat dari penasihat hukum Anda.

Karya asli
LingBot-Vision, Robbyant (Ant Group)
Lisensi upstream
Apache-2.0
Kode LibreYOLO
MIT
Bobot
Apache-2.0, dipublikasikan ulang di huggingface.co/LibreYOLO
Interpretasi
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.

Rilis upstream mendokumentasikan bahwa ViT-nya dibangun berdasarkan arsitektur DINOv2/DINOv3 yang dipublikasikan Meta AI. Robbyant mendistribusikan implementasinya dengan lisensi Apache-2.0, dan port LibreYOLO ini hanya dibuat dari repository Robbyant, tidak pernah dari kode DINOv2 atau DINOv3 milik Meta.

Sitasi

@article{lingbot-vision2026,
  title={Vision Pretraining for Dense Spatial Perception},
  author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
  journal={arXiv preprint arXiv:2607.05247},
  year={2026}
}

Disalin dari blok sitasi penulis di github.com/robbyant/lingbot-vision#-citation.

Diverifikasi dengan LibreYOLO v1.5.0. Tabel dukungan, checkpoint, dan angka benchmark di halaman ini dihasilkan dari library yang telah dirilis dan bobot yang dipublikasikan, bukan ditulis manual.