LingBot-Vision
LingBot-Vision là họ backbone vision transformer tự giám sát do Robbyant phát hành, được huấn luyện bằng masked modeling tập trung vào biên để nhận thức không gian dày đặc. LibreYOLO ghép backbone với một head dày đặc và hỗ trợ cho một tác vụ là phân đoạn ngữ nghĩa.
- Tác vụ
- semantic
- Kích thước
- Cài đặt
pip install libreyolo- Bậc hỗ trợ
- Được hỗ trợ, từ v. Các mô hình huấn luyện bổ trợ: luôn giữ CI ở trạng thái xanh, tính năng được bổ sung khi có cơ hội.
- Giấy phép
- Mã nguồn Apache-2.0, trọng số Apache-2.0. Sử dụng thương mại
Cài đặt
LingBot-Vision không cần extra tùy chọn. Mọi thành phần được import đều có trong bản cài đặt cơ sở.
pip install libreyoloDự đoán
Trọng số được tải từ Hugging Face ở lần dùng đầu tiên và lưu vào bộ nhớ đệm cục bộ.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Trueresult.semantic_mask chứa bản đồ lớp dày đặc: .data là tensor (H, W) của
các class ID trên kích thước ảnh gốc, còn .classes liệt kê các class ID thực
sự xuất hiện. result.boxes là None vì không có phát hiện theo instance.
conf và iou được chấp nhận để đồng nhất API nhưng không thay đổi đầu ra vì
mô hình trả về một lớp cho mỗi pixel thay vì các phát hiện cần lọc. Xem
dự đoán để biết về nguồn, streaming và xử lý kết quả.
Các biến thể
Ba kích thước đã công bố là s, b và l, được chưng cất từ mô hình giáo viên
ViT-g/16 có 1,1 tỷ tham số. Bản thân mô hình giáo viên kích thước g có thể tải
và tinh chỉnh trong LibreYOLO, nhưng LibreYOLO không lưu trữ checkpoint g riêng.
| Tệp | Đầu vào (px) | Giấy phép trọng số |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.
Huấn luyện
train() tinh chỉnh một checkpoint đã công bố. Công thức mặc định là linear
probe trong báo cáo thượng nguồn: backbone ViT được đóng băng và chỉ head dày đặc
1x1 được huấn luyện, khớp với cách tạo ra các trọng số do LibreYOLO lưu trữ ở
trên. Truyền freeze_backbone=False để tinh chỉnh toàn bộ mạng và giảm lr0
cho phù hợp.
from libreyolo import LibreYOLO # Backbone được đóng băng theo mặc định, khớp với giao thức đánh giá# thượng nguồn: chỉ head dày đặc 1x1 được huấn luyện.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 imgsz=512 batch=16from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train( data="my-dataset.yaml", epochs=20, imgsz=512, batch=16, freeze_backbone=False,)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 device=0,1 batch=32Xem huấn luyện để biết về tập dữ liệu, tăng cường dữ liệu, multi-GPU và logger.
Đánh giá
val() trả về một từ điển các khóa metrics/: mIoU và độ chính xác theo pixel,
được đo trên bất kỳ tập dữ liệu nào theo định dạng bạn đã dùng để huấn luyện.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yamlXuất
| Tác vụ | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: được hỗ trợ | semantic to TorchScript: được hỗ trợ | semantic to ExecuTorch: được hỗ trợ | semantic to TensorRT: được hỗ trợ | semantic to OpenVINO: được hỗ trợ | semantic to Paddle: không được hỗ trợ | semantic to MNN: không được hỗ trợ | semantic to RKNN: không được hỗ trợ | semantic to ncnn: không được hỗ trợ | semantic to TFLite: không được hỗ trợ | semantic to CoreML: không được hỗ trợ | semantic to Core AI: được hỗ trợ |
Artifact đã xuất được tải lại qua LibreYOLO() dựa trên hậu tố tệp, vì vậy tệp
.onnx hoặc .engine hoạt động như checkpoint và trả về cùng Results.
Xuất liệt kê các đối số mà từng định dạng chấp nhận.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512from libreyolo import LibreYOLO, SAMPLE_IMAGE # Factory định tuyến theo hậu tố tệp, nên artifact đã xuất được tải# như mọi checkpoint và trả về cùng đối tượng Results.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)Checkpoint
Mọi tệp trọng số đã công bố cho họ này.
| Tệp | Đầu vào (px) | Giấy phép trọng số |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
Mọi tệp ở trên hiện đều có trong tổ chức LibreYOLO và được tải xuống trong lần sử dụng đầu tiên.
Giấy phép
Hãy kiểm tra giấy phép trong repo Hugging Face của trọng số cụ thể mà bạn tải xuống. Mỗi checkpoint trong tổ chức LibreYOLO đều có giấy phép riêng và giấy phép có thể khác nhau trong cùng một họ. Repo đó là nguồn có thẩm quyền; phần tóm tắt dưới đây mô tả các điều khoản áp dụng khi trang này được kiểm chứng lần gần nhất.
Đây là phần mô tả các giấy phép liên quan, không phải tư vấn pháp lý. Nếu câu trả lời có ý nghĩa về mặt thương mại, hãy tự đọc các giấy phép và tham khảo cố vấn của riêng bạn.
- Công trình gốc
- LingBot-Vision, Robbyant (Ant Group)
- Giấy phép thượng nguồn
- Apache-2.0
- Nguồn thượng nguồn
- github.com/robbyant/lingbot-vision
- Mã nguồn LibreYOLO
- MIT
- Trọng số
- Apache-2.0, được phát hành lại tại huggingface.co/LibreYOLO
- Diễn giải
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.
Bản phát hành thượng nguồn mô tả ViT được xây dựng trên kiến trúc DINOv2/DINOv3 do Meta AI công bố. Robbyant phân phối bản triển khai theo Apache-2.0, và bản chuyển đổi LibreYOLO này chỉ được tạo từ repo Robbyant, không dùng mã DINOv2 hoặc DINOv3 của Meta.
Trích dẫn
@article{lingbot-vision2026,
title={Vision Pretraining for Dense Spatial Perception},
author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
journal={arXiv preprint arXiv:2607.05247},
year={2026}
}Được sao chép từ khối trích dẫn của tác giả tại github.com/robbyant/lingbot-vision#-citation.