LingBot-Vision
LingBot-Vision은 조밀한 공간 인식을 위해 경계 중심 마스킹 모델링으로 자기 지도 학습한 vision transformer 백본 계열으로 Robbyant가 공개했습니다. LibreYOLO는 백본에 조밀 헤드를 결합하여 의미 분할 작업 하나를 지원합니다.
- 작업
- semantic
- 크기
- 설치
pip install libreyolo- 지원 티어
- 지원, v부터 지원. 보조 학습 가능 모델입니다. CI 통과 상태를 유지하며 기능은 여건에 따라 추가됩니다.
- 라이선스
- 코드 Apache-2.0, 가중치 Apache-2.0. 상업적 사용
설치
LingBot-Vision에는 선택적 extra가 필요하지 않습니다. 가져오는 모든 항목이 기본 설치에 포함됩니다.
pip install libreyolo예측
처음 사용할 때 Hugging Face에서 가중치를 다운로드해 로컬에 캐시합니다.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreLingBotVisions-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape, mask.classes)libreyolo predict model=LibreLingBotVisions-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=Trueresult.semantic_mask는 조밀한 클래스 맵을 담습니다. .data는 원본 이미지 크기의 클래스 ID (H, W) 텐서이고 .classes는 실제로 존재하는 클래스 ID를 나열합니다. 인스턴스별 탐지가 없으므로 result.boxes는 None입니다. 모델이 필터링할 탐지 대신 픽셀마다 클래스 하나를 반환하므로 conf와 iou는 API 일관성을 위해 허용되지만 출력을 바꾸지 않습니다. 소스, 스트리밍, 결과 처리는 예측을 참조합니다.
변형
공개된 s, b, l 세 크기는 매개변수 11억 개의 ViT-g/16 teacher에서 증류했습니다. g 크기 teacher 자체도 LibreYOLO에서 불러오고 파인튜닝할 수 있지만 LibreYOLO는 자체 g 체크포인트를 호스팅하지 않습니다.
| 파일 | 입력(px) | 가중치 라이선스 |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
위의 모든 파일은 현재 LibreYOLO 조직에 있으며 처음 사용할 때 내려받습니다.
학습
train()은 공개된 체크포인트를 파인튜닝합니다. 기본 레시피는 업스트림 보고서의 선형 프로브입니다. ViT 백본을 동결하고 1x1 조밀 헤드만 학습하며 위 LibreYOLO 호스팅 가중치가 생성된 방식과 일치합니다. 전체 네트워크를 파인튜닝하려면 freeze_backbone=False를 전달하고 그에 맞춰 lr0를 낮춥니다.
from libreyolo import LibreYOLO # 업스트림 평가 프로토콜과 일치하도록 기본적으로 백본을 동결합니다.# 1x1 조밀 헤드만 학습합니다.model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train(data="my-dataset.yaml", epochs=20, imgsz=512, batch=16)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 imgsz=512 batch=16from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.train( data="my-dataset.yaml", epochs=20, imgsz=512, batch=16, freeze_backbone=False,)libreyolo train model=LibreLingBotVisions-sem.pt data=my-dataset.yaml \ epochs=20 device=0,1 batch=32데이터셋, 증강, 다중 GPU, 로거는 학습을 참조합니다.
검증
val()은 학습에 사용한 형식의 데이터셋에서 측정한 mIoU와 픽셀 정확도의 metrics/ 키 사전을 반환합니다.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])libreyolo val model=LibreLingBotVisions-sem.pt data=my-dataset.yaml내보내기
| 작업 | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: 지원함 | semantic to TorchScript: 지원함 | semantic to ExecuTorch: 지원함 | semantic to TensorRT: 지원함 | semantic to OpenVINO: 지원함 | semantic to Paddle: 지원하지 않음 | semantic to MNN: 지원하지 않음 | semantic to RKNN: 지원하지 않음 | semantic to ncnn: 지원하지 않음 | semantic to TFLite: 지원하지 않음 | semantic to CoreML: 지원하지 않음 | semantic to Core AI: 지원함 |
내보낸 아티팩트는 파일 접미사에 따라 LibreYOLO()로 다시 불러오므로 .onnx 또는 .engine 파일은 체크포인트처럼 동작하며 동일한 Results를 반환합니다. 각 형식이 받는 인수는 내보내기에 나와 있습니다.
from libreyolo import LibreYOLO model = LibreYOLO("LibreLingBotVisions-sem.pt")model.export(format="onnx", imgsz=512)model.export(format="coreai", imgsz=512)libreyolo export model=LibreLingBotVisions-sem.pt format=onnx imgsz=512from libreyolo import LibreYOLO, SAMPLE_IMAGE # 팩토리는 파일 접미사에 따라 라우팅하므로 내보낸 아티팩트도# 다른 체크포인트처럼 불러와 동일한 Results 객체를 반환합니다.model = LibreYOLO("LibreLingBotVisions-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)체크포인트
이 계열에 공개된 모든 가중치 파일입니다.
| 파일 | 입력(px) | 가중치 라이선스 |
|---|---|---|
| semantic | ||
| LibreLingBotVisions-sem.pt | apache-2.0 | |
| LibreLingBotVisionb-sem.pt | apache-2.0 | |
| LibreLingBotVisionl-sem.pt | apache-2.0 | |
위의 모든 파일은 현재 LibreYOLO 조직에 있으며 처음 사용할 때 내려받습니다.
라이선스
내려받는 특정 가중치의 Hugging Face 저장소에서 라이선스를 확인하십시오. LibreYOLO 조직의 모든 체크포인트에는 라이선스가 있으며 한 계열 안에서도 항상 같지는 않습니다. 해당 저장소가 신뢰할 수 있는 기준입니다. 아래 요약은 이 페이지를 마지막으로 검증했을 때 적용된 내용을 설명합니다.
관련 라이선스에 관한 설명이며 법률 자문이 아닙니다. 상업적으로 중요한 사안이라면 라이선스를 직접 읽고 별도의 법률 자문을 받으십시오.
- 원작
- LingBot-Vision, Robbyant (Ant Group)
- 업스트림 라이선스
- Apache-2.0
- LibreYOLO 코드
- MIT
- 가중치
- Apache-2.0, huggingface.co/LibreYOLO에 다시 게시됨
- 해석
- Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. The LibreYOLO-hosted checkpoints combine Robbyant's Apache-2.0 backbone weights with a dense segmentation head LibreYOLO trained itself, so the whole checkpoint file carries the same permissive terms end to end.
업스트림 릴리스는 해당 ViT가 Meta AI에서 공개한 DINOv2/DINOv3 구조를 기반으로 구축되었다고 설명합니다. Robbyant는 구현을 Apache-2.0으로 배포하며 이 LibreYOLO 이식은 Meta의 DINOv2 또는 DINOv3 코드가 아니라 Robbyant 저장소만 사용해 만들었습니다.
인용
@article{lingbot-vision2026,
title={Vision Pretraining for Dense Spatial Perception},
author={Fu, Zelin and Tan, Bin and Sun, Changjiang and Liu, Shaohui and Zheng, Kecheng and Xu, Yinghao and Zhu, Xing and Shen, Yujun and Xue, Nan},
journal={arXiv preprint arXiv:2607.05247},
year={2026}
}github.com/robbyant/lingbot-vision#-citation에 있는 저자의 인용 블록에서 복사했습니다.