LingBot-Vision

LingBot-Vision là họ backbone vision transformer tự giám sát do Robbyant phát hành, được huấn luyện bằng masked modeling tập trung vào biên để nhận thức không gian dày đặc. LibreYOLO ghép backbone với một head dày đặc và hỗ trợ cho một tác vụ là phân đoạn ngữ nghĩa.

Tác vụ
semantic
Kích thước
Cài đặt
pip install libreyolo
Bậc hỗ trợ
Được hỗ trợ, từ v. Các mô hình huấn luyện bổ trợ: luôn giữ CI ở trạng thái xanh, tính năng được bổ sung khi có cơ hội.
Thượng nguồn
LingBot-Vision của Robbyant (Ant Group), Apache-2.0. Bài báo, mã nguồn
Giấy phép
Mã nguồn Apache-2.0, trọng số Apache-2.0. Sử dụng thương mại

Cài đặt

LingBot-Vision không cần extra tùy chọn. Mọi thành phần được import đều có trong bản cài đặt cơ sở.

bash
pip install libreyolo

Dự đoán

Trọng số được tải từ Hugging Face ở lần dùng đầu tiên và lưu vào bộ nhớ đệm cục bộ.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)
CLI
libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True

result.semantic_mask chứa bản đồ lớp dày đặc: .data là tensor (H, W) của các class ID trên kích thước ảnh gốc, còn .classes liệt kê các class ID thực sự xuất hiện. result.boxesNone vì không có phát hiện theo instance. confiou được chấp nhận để đồng nhất API nhưng không thay đổi đầu ra vì mô hình trả về một lớp cho mỗi pixel thay vì các phát hiện cần lọc. Xem dự đoán để biết về nguồn, streaming và xử lý kết quả.

Các biến thể

Ba kích thước đã công bố là s, b và l, được chưng cất từ mô hình giáo viên ViT-g/16 có 1,1 tỷ tham số. Bản thân mô hình giáo viên kích thước g có thể tải và tinh chỉnh trong LibreYOLO, nhưng LibreYOLO không lưu trữ checkpoint g riêng.

TệpĐầu vào (px)Giấy phép trọng số
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.

Huấn luyện

train() tinh chỉnh một checkpoint đã công bố. Công thức mặc định là linear probe trong báo cáo thượng nguồn: backbone ViT được đóng băng và chỉ head dày đặc 1x1 được huấn luyện, khớp với cách tạo ra các trọng số do LibreYOLO lưu trữ ở trên. Truyền freeze_backbone=False để tinh chỉnh toàn bộ mạng và giảm lr0 cho phù hợp.

Python (linear probe)
from libreyolo import LibreYOLO # Backbone được đóng băng theo mặc định, khớp với giao thức đánh giá# thượng nguồn: chỉ head dày đặc 1x1 được huấn luyện.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)
CLI
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 imgsz=512 batch=16
Tinh chỉnh toàn bộ
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(    data="my-dataset.yaml", epochs=20, imgsz=512, batch=16,    freeze_backbone=False,)
Multi-GPU
libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \  epochs=20 device=0,1 batch=32

Xem huấn luyện để biết về tập dữ liệu, tăng cường dữ liệu, multi-GPU và logger.

Đánh giá

val() trả về một từ điển các khóa metrics/: mIoU và độ chính xác theo pixel, được đo trên bất kỳ tập dữ liệu nào theo định dạng bạn đã dùng để huấn luyện.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])
CLI
libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yaml

Xuất

Tác vụONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
semanticsemantic to ONNX: được hỗ trợsemantic to TorchScript: được hỗ trợsemantic to ExecuTorch: được hỗ trợsemantic to TensorRT: được hỗ trợsemantic to OpenVINO: được hỗ trợsemantic to Paddle: không được hỗ trợsemantic to MNN: không được hỗ trợsemantic to RKNN: không được hỗ trợsemantic to ncnn: không được hỗ trợsemantic to TFLite: không được hỗ trợsemantic to CoreML: không được hỗ trợsemantic to Core AI: được hỗ trợ

Artifact đã xuất được tải lại qua LibreYOLO() dựa trên hậu tố tệp, vì vậy tệp .onnx hoặc .engine hoạt động như checkpoint và trả về cùng Results. Xuất liệt kê các đối số mà từng định dạng chấp nhận.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)
CLI
libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512
Use the exported file
from libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory định tuyến theo hậu tố tệp, nên artifact đã xuất được tải# như mọi checkpoint và trả về cùng đối tượng Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)

Checkpoint

Mọi tệp trọng số đã công bố cho họ này.

TệpĐầu vào (px)Giấy phép trọng số
semantic
LibreLingBotVisions-sem.ptapache-2.0
LibreLingBotVisionb-sem.ptapache-2.0
LibreLingBotVisionl-sem.ptapache-2.0

Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.

Giấy phép

Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.

Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.

Công trình gốc
LingBot-Vision, Robbyant (Ant Group)
Giấy phép thượng nguồn
Apache-2.0
Nguồn thượng nguồn
github.com/robbyant/lingbot-vision
Mã nguồn LibreYOLO
MIT
Trọng số
Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
Diễn giải
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.

Bản phát hành thượng nguồn mô tả ViT được xây dựng trên kiến trúc DINOv2/DINOv3 do Meta AI công bố. Robbyant phân phối bản triển khai theo Apache-2.0, và bản chuyển đổi LibreYOLO này chỉ được tạo từ repo Robbyant, không dùng mã DINOv2 hoặc DINOv3 của Meta.

Trích dẫn

@article{lingbot-vision2026,
  title={Vision Pretraining for Dense Spatial Perception},
  author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
  journal={arXiv preprint arXiv:2607.05247},
  year={2026}
}

Được sao chép từ khối trích dẫn của tác giả tại github.com/robbyant/lingbot-vision#-citation.

Đã kiểm chứng với LibreYOLO v1.5.0. Các bảng hỗ trợ, checkpoint và số liệu benchmark trên trang này được tạo từ thư viện đã phát hành và trọng số đã công bố, không phải viết thủ công.