태스크별 모델

라이브러리가 제공하는 모든 계열이며, v1.5.0 모델 레지스트리에서 생성했습니다. 17개 태스크에 걸쳐 82개 계열입니다.

탐지

40개 계열

객체를 감싸는 박스. 라이브러리 대부분이 이 태스크를 위해 만들어졌습니다.

RF-DETR

n, s, m, l for detection, pose and oriented boxes; n through xx for segmentation

YOLOv9

yolo9: t, s, m, c at 640 px; yolo9_p2: t, s at 640 px

D-FINE

n, s, m, l, x at 640 px

DEIM

deim: n, s, m, l, x at 640 px

EdgeCrafter

s, m, l, x at 640 px

RT-DETR

rtdetr: r18, r34, r50, r50m, r101, l, x at 640 px; rtdetrv2: r18, r34, r50, r50m, r101 for detection at 640 px, n, s, m, l, x for oriented boxes at 1024 px; rtdetrv4: s, m, l, x at 640 px

YOLO-NAS

s, m, l at 640 px

Dome-DETR

s, m, l at 800 px

PicoDet

s, m, l at 320 to 640 px

RTMDet

t, s, m, l, x at 640 px

YOLOv7

b at 640 px

YOLOX

n, t, s, m, l, x at 416 to 640 px

Florence-2

base, large at 768 px

Grounding DINO

t, b at 800 px

InternVL3

1b, 2b, 8b at 448 px

Kosmos-2

224 at 224 px

LFM2-VL

450m at 512 px

LibreMODUS
LocateAnything

3b at 2500 px

OMDet-Turbo

t at 640 px

OV-DEIM

s, m, l at 640 px

OWLv2

b16, l14 at 960 to 1008 px

Qwen3-VL

2b, 4b, 8b at 1024 px

SenseNova-Vision

7b at 1024 px

SmolVLM2

500m at 512 px

CenterNet

resdcn18, dla34 at 512 px

Deformable DETR

r50ss, r50ssdc5, r50, r50refine, r50twostage at 800 px

DETR

r50, r50dc5, r101, r101dc5 at 800 px

DINO-DETR

r50, r50s5, swinl at 800 px

EfficientDet
Faster R-CNN

n, s, m, l at 320 to 800 px

FCOS

r50 at 800 px

LW-DETR

t, s, m, l, x at 640 px

Mask R-CNN

r50 at 800 px

RetinaNet

r50, r50v2 at 800 px

SSD

300 at 300 px

YOLOv1

t, b at 448 px

YOLOv2

t, b at 416 to 608 px

YOLOv3

t, b, spp at 416 to 608 px

YOLOv4

t, b at 416 to 608 px

분할

13개 계열

박스 대신 인스턴스별 마스크.

RF-DETR

n, s, m, l for detection, pose and oriented boxes; n through xx for segmentation

D-FINE

n, s, m, l, x at 640 px

EdgeCrafter

s, m, l, x at 640 px

RTMDet

t, s, m, l, x at 640 px

MobileSAM

tiny at 1024 px

PicoSAM3

pico at 96 px

SAM

base, large, huge at 1024 px

SAM 3

large at 1008 px

SenseNova-Vision

7b at 1024 px

EoMT

s, b, l at 512 px

Mask R-CNN

r50 at 800 px

키포인트

5개 계열

탐지한 인스턴스마다 골격과 랜드마크.

RF-DETR

n, s, m, l for detection, pose and oriented boxes; n through xx for segmentation

EdgeCrafter

s, m, l, x at 640 px

YOLO-NAS

s, m, l at 640 px

SenseNova-Vision

7b at 1024 px

분류

12개 계열

이미지 전체에 레이블 하나, 그리고 나머지 모든 것의 바탕이 되는 백본.

ConvNeXt

t, s, b at 224 px

DINOv2

n, s, m, l at 518 px

EfficientNetV2

b0, b1, b2, b3 at 224 to 300 px

MobileNetV4

s, m, l at 224 to 256 px

ResNet

18, 34, 50, 101 at 224 px

AlexNet

b at 224 px

Swin Transformer

t, s, b, l at 224 px

VGG

16, 19, 16bn, 19bn at 224 px

ViT

ti, s, b, l at 224 px

DeiT

t, s, b at 224 px

회전 박스

2개 계열

회전된 박스. 항공 영상처럼 축에 정렬되지 않는 대상을 위한 것.

RF-DETR

n, s, m, l for detection, pose and oriented boxes; n through xx for segmentation

RT-DETR

rtdetr: r18, r34, r50, r50m, r101, l, x at 640 px; rtdetrv2: r18, r34, r50, r50m, r101 for detection at 640 px, n, s, m, l, x for oriented boxes at 1024 px; rtdetrv4: s, m, l, x at 640 px

깊이

6개 계열

이미지 한 장에서 얻는 픽셀별 거리.

LibreMODUS
SenseNova-Vision

7b at 1024 px

Depth Anything 3

l at 504 px

Depth Anything V2

s, b, l, g at 518 px

MiDaS

s, l at 256 to 384 px

ZipDepth

b, bnpu at 384 px

시맨틱 분할

7개 계열

인스턴스를 구분하지 않고 모든 픽셀에 클래스를 부여.

DINOv2

n, s, m, l at 518 px

LingBot-Vision
EoMT

s, b, l at 512 px

FCN

r50, r101 at 520 px

PIDNet

s, m, l at 1024 px

판옵틱 분할

2개 계열

시맨틱 마스크와 인스턴스 마스크를 한 번에.

SenseNova-Vision

7b at 1024 px

EoMT

s, b, l at 512 px

포인트와 카운팅

3개 계열

박스 대신 중심점. 마이크로컨트롤러에서 돌릴 만큼 가볍습니다.

LocateAnything

3b at 2500 px

SenseNova-Vision

7b at 1024 px

텍스트 인식

2개 계열

이미지 속 텍스트를 찾아 읽기.

SenseNova-Vision

7b at 1024 px

PP-OCRv5

t, l at 960 px

임베딩

4개 계열

검색, 클러스터링, 유사 항목 조회를 위한 벡터.

DINOv2

n, s, m, l at 518 px

LibreFaceRec

시선

1개 계열

사람이 어디를 보고 있는지.

L2CS-Net

r18, r34, r50, r101, r152 at 448 px

엣지 검출

3개 계열

윤곽과 경계.

LibreMODUS
DexiNed

b at 352 px

TEED

t at 352 px

표면 법선

2개 계열

각 표면이 향하는 방향.

LibreMODUS
MoGe-2

s, b, l at 518 px

매팅

2개 계열

알파 채널 컷아웃. 머리카락과 경계까지.

BiRefNet

t, l at 1024 px

FeyNobg

l at 1024 px

복원

3개 계열

노이즈 제거, 블러 보정, 업스케일링.

NAFNet

s, l at 256 px

Real-ESRGAN

x4, x2, x4t at 64 px

SwinIR

s, m, l at 64 px

메시

1개 계열

이미지 한 장에서 만드는 3D 형상.

SAM 3D Body

d3, h at 512 px