EoMT
전용 픽셀 디코더 없이 plain vision transformer에 구축된 분할 네트워크입니다. 인코더 자체에 추가된 학습 쿼리가 마스크를 예측합니다. LibreYOLO는 의미, 인스턴스, 파놉틱 분할을 지원합니다.
- 작업
- semantic, instance segmentation, panoptic
- 크기
- s, b, l at 512 px
- 설치
pip install libreyolo- 지원 티어
- 추론 전용, v부터 지원. 예측, 검증, 내보내기만 지원합니다. 학습 기능은 적용되지 않습니다.
- 라이선스
- 코드 MIT, 가중치 MIT. 상업적 사용
설치
EoMT에는 선택적 extra가 필요하지 않습니다. 가져오는 모든 항목이 기본 설치에 포함됩니다.
pip install libreyolo예측
처음 사용할 때 Hugging Face에서 가중치를 다운로드해 로컬에 캐시합니다. 파일명의 작업 접미사(-sem, -seg, -panoptic)가 작업을 선택하며 LibreYOLO()가 파일명에서 이를 추론하므로 task= 인수가 필요하지 않습니다.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreEoMTl-sem.pt")result = model(SAMPLE_IMAGE, save=True) mask = result.semantic_maskprint(mask.data.shape) # (H, W) 클래스 IDprint(mask.classes) # 이미지에 있는 클래스 ID 정렬 목록from libreyolo import LibreYOLO, SAMPLE_IMAGE # 파일명의 -seg 접미사가 인스턴스 작업을 선택하므로 여기서는# task 인수가 필요하지 않습니다.model = LibreYOLO("LibreEoMTl-seg.pt")result = model(SAMPLE_IMAGE, save=True) print(result.boxes.xyxy)print(result.masks.data.shape)from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreEoMTl-panoptic.pt")result = model(SAMPLE_IMAGE, save=True) pan = result.panopticprint(pan.data.shape) # (H, W) 세그먼트 IDprint(pan.segments_info) # [{"id": ..., "category_id": ...}, ...]libreyolo predict model=LibreEoMTl-sem.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True의미 분할은 result.semantic_mask를 채우며 .data에는 클래스 ID의 (H, W) 배열이 들어 있습니다. 인스턴스 분할은 다른 분할 계열과 같은 형태로 result.boxes와 result.masks를 채웁니다. 파놉틱 분할은 result.panoptic을 채웁니다. .data에는 (H, W) 세그먼트 ID 맵이, .segments_info에는 세그먼트마다 하나씩 {"id", "category_id"} 사전 목록이 들어 있습니다. conf는 쿼리 선택을 필터링합니다. 의미 작업은 NMS 단계 없이 픽셀별 argmax를 사용하므로 iou는 효과가 없습니다. 소스, 스트리밍, 결과 처리는 예측을 참조합니다.
변형
DINOv2 기반 인코더 크기는 s/b/l 세 가지입니다. 의미 체크포인트는 512 px의 ADE20K에서 학습했고 인스턴스 및 파놉틱 체크포인트는 640 px의 COCO에서 학습했으며, 인스턴스 체크포인트 하나는 1280 px에서 추가로 학습했습니다. 업스트림은 DINOv2 인스턴스 분할 가중치를 l 크기로만 제공합니다. s와 b는 의미 및 파놉틱 작업용으로만 공개됩니다. DINOv3 기반 EoMT 변형도 업스트림에 있지만 접근 제한이 있는 비상업적 DINOv3 가중치에 의존하므로 여기서는 제공하지 않습니다.
LibreYOLO는 EoMT를 학습하지 않습니다. 이 계열에서 train()은 NotImplementedError를 발생시키며 위의 지원 티어에서는 이를 추론 전용으로 표시합니다.
검증
val()은 작업에 따라 디스패치합니다. 의미 분할은 metrics/mIoU와 metrics/pixel_accuracy를 반환합니다. 인스턴스 분할은 다른 분할 계열과 같은 마스크 및 박스 mAP 키를 반환합니다. 파놉틱 분할은 metrics/PQ로 Panoptic Quality를 반환하고 이를 metrics/SQ(분할 품질)와 metrics/RQ(인식 품질)로 나누며 metrics/PQ_things와 metrics/PQ_stuff도 반환합니다.
from libreyolo import LibreYOLO model = LibreYOLO("LibreEoMTl-sem.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mIoU"])print(metrics["metrics/pixel_accuracy"])from libreyolo import LibreYOLO model = LibreYOLO("LibreEoMTl-seg.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mAP50-95(M)"]) # 마스크print(metrics["metrics/mAP50-95(B)"]) # 박스from libreyolo import LibreYOLO model = LibreYOLO("LibreEoMTl-panoptic.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/PQ"])print(metrics["metrics/SQ"], metrics["metrics/RQ"])libreyolo val model=LibreEoMTl-sem.pt data=my-dataset.yaml내보내기
| 작업 | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| semantic | semantic to ONNX: 지원함 | semantic to TorchScript: 지원함 | semantic to ExecuTorch: 지원하지 않음 | semantic to TensorRT: 지원함 | semantic to OpenVINO: 지원함 | semantic to Paddle: 지원하지 않음 | semantic to MNN: 지원하지 않음 | semantic to RKNN: 지원하지 않음 | semantic to ncnn: 지원하지 않음 | semantic to TFLite: 지원하지 않음 | semantic to CoreML: 지원하지 않음 | semantic to Core AI: 지원하지 않음 |
| Instance segmentation | Instance segmentation to ONNX: 지원하지 않음 | Instance segmentation to TorchScript: 지원하지 않음 | Instance segmentation to ExecuTorch: 지원하지 않음 | Instance segmentation to TensorRT: 지원하지 않음 | Instance segmentation to OpenVINO: 지원하지 않음 | Instance segmentation to Paddle: 지원하지 않음 | Instance segmentation to MNN: 지원하지 않음 | Instance segmentation to RKNN: 지원하지 않음 | Instance segmentation to ncnn: 지원하지 않음 | Instance segmentation to TFLite: 지원하지 않음 | Instance segmentation to CoreML: 지원하지 않음 | Instance segmentation to Core AI: 지원하지 않음 |
| panoptic | panoptic to ONNX: 지원하지 않음 | panoptic to TorchScript: 지원하지 않음 | panoptic to ExecuTorch: 지원하지 않음 | panoptic to TensorRT: 지원하지 않음 | panoptic to OpenVINO: 지원하지 않음 | panoptic to Paddle: 지원하지 않음 | panoptic to MNN: 지원하지 않음 | panoptic to RKNN: 지원하지 않음 | panoptic to ncnn: 지원하지 않음 | panoptic to TFLite: 지원하지 않음 | panoptic to CoreML: 지원하지 않음 | panoptic to Core AI: 지원하지 않음 |
현재는 의미 작업만 내보낼 수 있습니다. 인스턴스와 파놉틱 분할에서 export()를 호출하면 NotImplementedError가 발생합니다. 쿼리 마스크 출력의 런타임 내보내기 계약이 아직 없기 때문입니다. 내보낸 의미 아티팩트는 파일 접미사에 따라 LibreYOLO()로 다시 불러오므로 .onnx 또는 .engine 파일은 체크포인트처럼 동작하며 동일한 Results를 반환합니다.
from libreyolo import LibreYOLO model = LibreYOLO("LibreEoMTl-sem.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)libreyolo export model=LibreEoMTl-sem.pt format=onnxlibreyolo export model=LibreEoMTl-sem.pt format=tensorrt half=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE # 팩토리는 파일 접미사에 따라 라우팅하므로 내보낸 아티팩트도# 다른 체크포인트처럼 불러와 동일한 Results 객체를 반환합니다.model = LibreYOLO("LibreEoMTl-sem.onnx")result = model(SAMPLE_IMAGE) print(result.semantic_mask.data.shape)체크포인트
이 계열에 공개된 모든 가중치 파일입니다.
| 파일 | 입력(px) | 가중치 라이선스 |
|---|---|---|
| semantic | ||
| LibreEoMTl-sem.pt | 512 | mit |
| Instance segmentation | ||
| LibreEoMTl-seg.pt | 640 | mit |
| LibreEoMTl-seg-1280.pt | mit | |
| panoptic | ||
| LibreEoMTs-panoptic.pt | mit | |
| LibreEoMTb-panoptic.pt | mit | |
| LibreEoMTl-panoptic.pt | mit | |
위의 모든 파일은 현재 LibreYOLO 조직에 있으며 처음 사용할 때 내려받습니다.
라이선스
내려받는 특정 가중치의 Hugging Face 저장소에서 라이선스를 확인하십시오. LibreYOLO 조직의 모든 체크포인트에는 라이선스가 있으며 한 계열 안에서도 항상 같지는 않습니다. 해당 저장소가 신뢰할 수 있는 기준입니다. 아래 요약은 이 페이지를 마지막으로 검증했을 때 적용된 내용을 설명합니다.
관련 라이선스에 관한 설명이며 법률 자문이 아닙니다. 상업적으로 중요한 사안이라면 라이선스를 직접 읽고 별도의 법률 자문을 받으십시오.
- 원작
- EoMT, TU Eindhoven, Mobile Perception Systems Lab
- 업스트림 라이선스
- MIT
- 업스트림 소스
- github.com/tue-mps/eomt
- LibreYOLO 코드
- MIT
- 가중치
- MIT, huggingface.co/LibreYOLO에 다시 게시됨
- 해석
- MIT is a permissive license, so this code and these weights can be used in commercial and closed-source products. It asks only that you keep the copyright and license notice with any copy you redistribute. LibreYOLO ships only the DINOv2-backed EoMT checkpoints, sizes s/b/l; the DINOv3 EoMT variants are excluded because they depend on gated non-commercial DINOv3 weights. DINOv2 itself is Apache-2.0. The semantic checkpoint is trained on ADE20K and the instance and panoptic checkpoints on COCO; both are research datasets, and users remain responsible for dataset-license compliance when validating or fine-tuning against them.
인용
@inproceedings{kerssies2025eomt,
author = {Kerssies, Tommie and Cavagnero, Niccol\`{o} and Hermans, Alexander and Norouzi, Narges and Averta, Giuseppe and Leibe, Bastian and Dubbelman, Gijs and {de Geus}, Daan},
title = {{Your ViT is Secretly an Image Segmentation Model}},
booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year = {2025},
}github.com/tue-mps/eomt#bibtex-citation에 있는 저자의 인용 블록에서 복사했습니다.