LingBot-Vision
LingBot-Vision, це сімейство бекбонів-трансформерів зору із самоконтрольованим навчанням через орієнтоване на межі масковане моделювання для щільного просторового сприйняття, випущене Robbyant. LibreYOLO поєднує бекбон зі щільною головою й підтримує його для однієї задачі, семантичної сегментації.
- Задачі
- semantic
- Розміри
- Встановлення
pip install libreyolo- Рівень підтримки
- Підтримуваний, починаючи з v. Додаткові придатні до навчання моделі: тести CI підтримують справними, а функції додають за нагоди.
- Ліцензії
- Код: Apache-2.0, ваги: Apache-2.0. Комерційне використання
Встановлення
LingBot-Vision не потребує необов'язкових залежностей. Усе, що вона імпортує, є в базовому встановленні.
pip install libreyoloПередбачення
Під час першого використання ваги завантажуються з Hugging Face і кешуються локально.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Trueresult.semantic_mask містить щільну карту класів: .data, це тензор
(H, W) ідентифікаторів класів у розмірі вихідного зображення, а
.classes перелічує фактично наявні класи. result.boxes дорівнює
None, оскільки виявлень окремих екземплярів немає. conf і iou
приймаються для узгодженості API, але не змінюють результат, адже модель
повертає один клас на піксель, а не виявлення для фільтрування. Джерела,
потокову обробку й роботу з результатами описано в розділі
передбачення.
Варіанти
Опубліковано три розміри, s, b і l, дистильовані з учителя ViT-g/16 на 1,1
млрд параметрів. Сам учитель розміру g завантажується й донавчається в
LibreYOLO, але LibreYOLO не розміщує власну контрольну точку g.
| Файл | Вхід (пікс.) | Ліцензія ваг |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Кожен наведений вище файл уже доступний у організації LibreYOLO і завантажується під час першого використання.
Навчання
train() донавчає опубліковану контрольну точку. Стандартний рецепт, це
лінійне дослідження зі звіту upstream: бекбон ViT заморожений, і навчається
лише щільна голова 1x1, як під час створення наведених вище ваг на хостингу
LibreYOLO. Передайте freeze_backbone=False, щоб натомість донавчати всю
мережу, і відповідно зменште lr0.
from libreyolo import LibreYOLO # Бекбон стандартно заморожений відповідно до протоколу оцінювання# upstream: навчається лише щільна голова 1x1.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 imgsz=512 batch=16from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train( data="my-dataset.yaml", epochs=20, imgsz=512, batch=16, freeze_backbone=False,)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 device=0,1 batch=32Датасети, аугментацію, кілька GPU й логери описано в розділі навчання.
Валідація
val() повертає словник ключів metrics/: mIoU та піксельну точність,
виміряні на будь-якому датасеті у форматі навчання.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yamlЕкспорт
| Задача | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: підтримується | semantic to TorchScript: підтримується | semantic to ExecuTorch: підтримується | semantic to TensorRT: підтримується | semantic to OpenVINO: підтримується | semantic to Paddle: не підтримується | semantic to MNN: не підтримується | semantic to RKNN: не підтримується | semantic to ncnn: не підтримується | semantic to TFLite: не підтримується | semantic to CoreML: не підтримується | semantic to Core AI: підтримується |
Експортований артефакт завантажується через LibreYOLO() за суфіксом
файла, тому файл .onnx або .engine поводиться як контрольна точка й
повертає той самий Results. Аргументи кожного формату перелічено в
розділі експорт.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512from libreyolo import LibreYOLO, SAMPLE_IMAGE # Фабрика вибирає маршрут за суфіксом файла, тому експортований артефакт# завантажується як контрольна точка й повертає той самий об'єкт Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)Контрольні точки
Усі опубліковані файли ваг для цього сімейства.
| Файл | Вхід (пікс.) | Ліцензія ваг |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Кожен наведений вище файл уже доступний у організації LibreYOLO і завантажується під час першого використання.
Ліцензування
Перевіряйте ліцензію в репозиторії Hugging Face конкретних ваг, які завантажуєте. Кожна контрольна точка в організації LibreYOLO має ліцензію, і вона не завжди однакова для всього сімейства. Цей репозиторій є авторитетним джерелом, а наведене нижче резюме описує умови на момент останньої перевірки сторінки.
Це опис відповідних ліцензій, а не юридична консультація. Якщо відповідь має комерційне значення, самостійно прочитайте ліцензії та зверніться по юридичну консультацію.
- Оригінальна робота
- LingBot-Vision, Robbyant (Ant Group)
- Ліцензія першоджерела
- Apache-2.0
- Джерело першоджерела
- github.com/robbyant/lingbot-vision
- Код LibreYOLO
- MIT
- Ваги
- Apache-2.0, повторно опубліковано на huggingface.co/LibreYOLO
- Тлумачення
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.
Випуск upstream описує свій ViT як побудований на архітектурі DINOv2/DINOv3, опублікованій Meta AI. Robbyant розповсюджує власну реалізацію за Apache-2.0, і це перенесення LibreYOLO створено лише з репозиторію Robbyant, без читання чи копіювання коду DINOv2 або DINOv3 від Meta.
Цитування
@article{lingbot-vision2026,
title={Vision Pretraining for Dense Spatial Perception},
author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
journal={arXiv preprint arXiv:2607.05247},
year={2026}
}Скопійовано з блоку цитування авторів на сторінці github.com/robbyant/lingbot-vision#-citation.