Переглянути як Markdown

LingBot-Vision

LingBot-Vision, це сімейство бекбонів-трансформерів зору із самоконтрольованим навчанням через орієнтоване на межі масковане моделювання для щільного просторового сприйняття, випущене Robbyant. LibreYOLO поєднує бекбон зі щільною головою й підтримує його для однієї задачі, семантичної сегментації.

Задачі
semantic
Розміри
Встановлення
pip install libreyolo
Рівень підтримки
Підтримуваний, починаючи з v. Додаткові придатні до навчання моделі: тести CI підтримують справними, а функції додають за нагоди.
Першоджерело
LingBot-Vision, автори: Robbyant (Ant Group), ліцензія Apache-2.0. Стаття, джерело
Ліцензії
Код: Apache-2.0, ваги: Apache-2.0. Комерційне використання

Встановлення

LingBot-Vision не потребує необов'язкових залежностей. Усе, що вона імпортує, є в базовому встановленні.

bash
pip install libreyolo

Передбачення

Під час першого використання ваги завантажуються з Hugging Face і кешуються локально.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)
CLI
libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True

result.semantic_mask містить щільну карту класів: .data, це тензор (H, W) ідентифікаторів класів у розмірі вихідного зображення, а .classes перелічує фактично наявні класи. result.boxes дорівнює None, оскільки виявлень окремих екземплярів немає. conf і iou приймаються для узгодженості API, але не змінюють результат, адже модель повертає один клас на піксель, а не виявлення для фільтрування. Джерела, потокову обробку й роботу з результатами описано в розділі передбачення.

Варіанти

Опубліковано три розміри, s, b і l, дистильовані з учителя ViT-g/16 на 1,1 млрд параметрів. Сам учитель розміру g завантажується й донавчається в LibreYOLO, але LibreYOLO не розміщує власну контрольну точку g.

ФайлВхід (пікс.)Ліцензія ваг
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Кожен наведений вище файл уже доступний у організації LibreYOLO і завантажується під час першого використання.

Навчання

train() донавчає опубліковану контрольну точку. Стандартний рецепт, це лінійне дослідження зі звіту upstream: бекбон ViT заморожений, і навчається лише щільна голова 1x1, як під час створення наведених вище ваг на хостингу LibreYOLO. Передайте freeze_backbone=False, щоб натомість донавчати всю мережу, і відповідно зменште lr0.

Python (лінійне дослідження)
from libreyolo import LibreYOLO # Бекбон стандартно заморожений відповідно до протоколу оцінювання# upstream: навчається лише щільна голова 1x1.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)
CLI
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 imgsz=512 batch=16
Повне донавчання
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(    data="my-dataset.yaml", epochs=20, imgsz=512, batch=16,    freeze_backbone=False,)
Кілька GPU
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 device=0,1 batch=32

Датасети, аугментацію, кілька GPU й логери описано в розділі навчання.

Валідація

val() повертає словник ключів metrics/: mIoU та піксельну точність, виміряні на будь-якому датасеті у форматі навчання.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])
CLI
libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yaml

Експорт

ЗадачаONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
semanticsemantic to ONNX: підтримуєтьсяsemantic to TorchScript: підтримуєтьсяsemantic to ExecuTorch: підтримуєтьсяsemantic to TensorRT: підтримуєтьсяsemantic to OpenVINO: підтримуєтьсяsemantic to Paddle: не підтримуєтьсяsemantic to MNN: не підтримуєтьсяsemantic to RKNN: не підтримуєтьсяsemantic to ncnn: не підтримуєтьсяsemantic to TFLite: не підтримуєтьсяsemantic to CoreML: не підтримуєтьсяsemantic to Core AI: підтримується

Експортований артефакт завантажується через LibreYOLO() за суфіксом файла, тому файл .onnx або .engine поводиться як контрольна точка й повертає той самий Results. Аргументи кожного формату перелічено в розділі експорт.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)
CLI
libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512
Використання експортованого файла
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Фабрика вибирає маршрут за суфіксом файла, тому експортований артефакт# завантажується як контрольна точка й повертає той самий об'єкт Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)

Контрольні точки

Усі опубліковані файли ваг для цього сімейства.

ФайлВхід (пікс.)Ліцензія ваг
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Кожен наведений вище файл уже доступний у організації LibreYOLO і завантажується під час першого використання.

Ліцензування

Перевіряйте ліцензію в репозиторії Hugging Face конкретних ваг, які завантажуєте. Кожна контрольна точка в організації LibreYOLO має ліцензію, і вона не завжди однакова для всього сімейства. Цей репозиторій є авторитетним джерелом, а наведене нижче резюме описує умови на момент останньої перевірки сторінки.

Це опис відповідних ліцензій, а не юридична консультація. Якщо відповідь має комерційне значення, самостійно прочитайте ліцензії та зверніться по юридичну консультацію.

Оригінальна робота
LingBot-Vision, Robbyant (Ant Group)
Ліцензія першоджерела
Apache-2.0
Джерело першоджерела
github.com/robbyant/lingbot-vision
Код LibreYOLO
MIT
Ваги
Apache-2.0, повторно опубліковано на huggingface.co/LibreYOLO
Тлумачення
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.

Випуск upstream описує свій ViT як побудований на архітектурі DINOv2/DINOv3, опублікованій Meta AI. Robbyant розповсюджує власну реалізацію за Apache-2.0, і це перенесення LibreYOLO створено лише з репозиторію Robbyant, без читання чи копіювання коду DINOv2 або DINOv3 від Meta.

Цитування

@article{lingbot-vision2026,
  title={Vision Pretraining for Dense Spatial Perception},
  author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
  journal={arXiv preprint arXiv:2607.05247},
  year={2026}
}

Скопійовано з блоку цитування авторів на сторінці github.com/robbyant/lingbot-vision#-citation.

Перевірено з LibreYOLO v1.5.0. Таблиці підтримки, контрольні точки й результати бенчмарків на цій сторінці згенеровано з випущеної бібліотеки та опублікованих ваг, а не написано вручну.