D-FINE

박스 회귀를 각 박스 가장자리의 확률 분포로 재정의하고 디코더 계층에 걸쳐 정제하는 detection transformer입니다. LibreYOLO는 객체 탐지와 인스턴스 분할을 지원합니다.

작업
detection, instance segmentation
크기
n, s, m, l, x at 640 px
설치
pip install libreyolo
지원 티어
코어, v1.1.0부터 지원. 학습 가능한 핵심 탐지기입니다. 기능은 같은 릴리스 주기에서 플래그십을 따릅니다.
업스트림
University of Science and Technology of China의 D-FINE, Apache-2.0. 논문, 소스
라이선스
코드 Apache-2.0, 가중치 Apache-2.0. 상업적 사용

설치

D-FINE에는 선택적 extra가 필요하지 않습니다. 가져오는 모든 항목이 기본 설치에 포함됩니다.

bash
pip install libreyolo

단, lora=True를 사용하는 어댑터 파인튜닝에는 lora extra가 필요합니다.

bash
pip install "libreyolo[lora]"

예측

처음 사용할 때 Hugging Face에서 가중치를 다운로드해 로컬에 캐시합니다.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreDFINEn.pt")result = model(SAMPLE_IMAGE, save=True) for box in result.boxes:    print(box.cls, box.conf, box.xyxy)
CLI
libreyolo predict model=LibreDFINEn.pt source=https://raw.githubusercontent.com/LibreYOLO/libreyolo/release/libreyolo/assets/parkour.jpg save=True
인스턴스 분할
from libreyolo import LibreYOLO, SAMPLE_IMAGE # 파일명의 -seg 접미사가 마스크 헤드를 선택하므로 여기서는# task 인수가 필요하지 않습니다.model = LibreYOLO("LibreDFINEn-seg.pt")result = model(SAMPLE_IMAGE, save=True) print(result.masks.data.shape)

반환되는 Results 객체는 모든 계열이 반환하는 것과 같으므로 탐지기를 바꾸려면 한 줄만 변경하면 됩니다. -seg 파일명은 스스로 분할 작업으로 해석되며 result.masks에 박스와 함께 인스턴스 마스크가 담깁니다. confmax_det은 쿼리 선택을 필터링합니다. 디코더가 NMS 단계 없는 집합 예측기이므로 iou는 API 일관성을 위해 허용되지만 효과가 없습니다. 소스, 스트리밍, 결과 처리는 예측을 참조합니다.

변형

크기는 다섯 가지입니다. 모두 같은 입력 해상도에서 실행되므로 아래 표는 매개변수 수와 정확도로 구분합니다.

체크포인트입력(px)mAP 50-95파라미터(M)
LibreDFINEl64060.031.24
LibreDFINEm64057.819.59
LibreDFINEn64045.83.78
LibreDFINEs64053.410.32
LibreDFINEx64061.462.62

COCO val2017, 500 images. LibreYOLO 벤치마크 도구로 측정하고 Vision Analysis에 공개했습니다. 이곳에서 하드웨어와 런타임별 지연 시간을 비교하고 전체 실행 기록을 확인할 수 있습니다.

분할은 탐지 백본, 인코더, 디코더를 재사용하고 마스크 헤드를 추가합니다. 따라서 -seg 체크포인트는 탐지 형제와 같은 인수를 받습니다. LibreYOLO의 RT-DETRv4 계열은 D-FINE 래퍼의 하위 클래스로 작성됩니다. 이 디코더 계열을 상속한 다음 마스크 헤드가 없으므로 작업 목록을 다시 탐지 전용으로 고정합니다.

학습

두 작업 모두 공개된 체크포인트에서 학습을 시작합니다.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDFINEn.pt")model.train(data="my-dataset.yaml", epochs=50, imgsz=640, batch=8, lr0=2e-4)
CLI
libreyolo train model=LibreDFINEn.pt data=my-dataset.yaml \  epochs=50 imgsz=640 batch=8 lr0=2e-4
인스턴스 분할
# 마스크 헤드를 포함해 공개된 분할 가중치에서 이어서 학습합니다.libreyolo train model=LibreDFINEn-seg.pt data=my-dataset.yaml \  task=segment epochs=50 imgsz=640
탐지 가중치에서 분할 전이
# 탐지 가중치에는 마스크 헤드가 없으므로 명시적인 전이입니다.# 헤드는 미학습 상태로 시작하고 학습한 뒤에만 유용합니다.# 여기서 task=segment를 요청하는 것이 전이를 승인합니다.libreyolo train model=LibreDFINEn.pt data=my-dataset.yaml \  task=segment epochs=50 imgsz=640
LoRA
from libreyolo import LibreYOLO model = LibreYOLO("LibreDFINEn.pt")model.train(data="my-dataset.yaml", epochs=50, lora=True)
다중 GPU
libreyolo train model=LibreDFINEn.pt data=my-dataset.yaml \  epochs=50 device=0,1 batch=16

기본 설정에서는 amp=False, 배치 16, lr0=2e-4로 132 epoch를 실행하며 50 epoch 동안 개선이 없으면 조기 중단합니다. 탐지 가중치는 분할 학습의 합법적인 시작점이지만 마스크 헤드가 미학습 상태로 시작하고 그렇지 않으면 의미 없는 마스크를 반환하므로 명시적인 전이로만 허용됩니다. CLI에서 task=segment를 전달하면 이를 승인합니다. Python 경로는 더 제한적입니다. LibreYOLO() 팩토리는 해당 인수를 받지 않으므로 allow_detect_to_segment_transfer=TrueLibreDFINE을 직접 생성해야 합니다. 직접 생성하면 다운로드하지 않으므로 가중치 파일이 이미 디스크에 있어야 합니다.

lora=True는 탐지에 적용됩니다. 분할 학습은 어댑터로 테스트하지 않은 마스크 헤드 때문에 이를 거부하고 대신 freeze='backbone'을 안내합니다. Apple silicon에서는 Integral의 binned matmul 역전파가 Metal 컴파일 오류를 일으키므로 학습 전체를 CPU로 이동합니다. MPS 추론은 영향을 받지 않습니다.

데이터셋, 증강, 다중 GPU, 로거는 학습을 참조합니다.

검증

val()은 지표 이름으로 키가 지정된 사전을 반환하며 verbose가 활성화되어 있으면 클래스별 결과를 출력합니다.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDFINEn.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mAP50-95"])print(metrics["metrics/mAP50"])
CLI
libreyolo val model=LibreDFINEn.pt data=my-dataset.yaml
인스턴스 분할
from libreyolo import LibreYOLO model = LibreYOLO("LibreDFINEn-seg.pt")metrics = model.val(data="my-dataset.yaml") print(metrics["metrics/mAP50-95(M)"])   # 마스크print(metrics["metrics/mAP50-95(B)"])   # 박스

-seg 체크포인트에서는 일반 metrics/mAP50-95 키에 마스크 점수가 들어갑니다. 같은 실행에서 (B) 아래에 박스, (M) 아래에 마스크를 보고하므로 한 번의 패스로 둘 다 얻을 수 있습니다.

내보내기

작업ONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
DetectionDetection to ONNX: 지원함Detection to TorchScript: 지원함Detection to ExecuTorch: 지원하지 않음Detection to TensorRT: 지원함Detection to OpenVINO: 지원함Detection to Paddle: 지원함Detection to MNN: 지원함Detection to RKNN: 지원하지 않음Detection to ncnn: 지원하지 않음Detection to TFLite: 지원하지 않음Detection to CoreML: 지원하지 않음Detection to Core AI: 지원함
Instance segmentationInstance segmentation to ONNX: 지원함Instance segmentation to TorchScript: 지원함Instance segmentation to ExecuTorch: 지원하지 않음Instance segmentation to TensorRT: 지원함Instance segmentation to OpenVINO: 지원함Instance segmentation to Paddle: 지원하지 않음Instance segmentation to MNN: 지원하지 않음Instance segmentation to RKNN: 지원하지 않음Instance segmentation to ncnn: 지원하지 않음Instance segmentation to TFLite: 지원하지 않음Instance segmentation to CoreML: 지원하지 않음Instance segmentation to Core AI: 지원하지 않음

내보낸 아티팩트는 파일 접미사에 따라 LibreYOLO()로 다시 불러오므로 .onnx 또는 .engine 파일은 체크포인트처럼 동작하며 동일한 Results를 반환합니다. OpenVINO, Paddle, MNN, Core AI 경로는 동적 형태가 아니라 고정 캔버스로 내보냅니다. 각 형식이 받는 인수와 일부 형식이 추가하는 extra는 내보내기에 나와 있습니다.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreDFINEn.pt")model.export(format="onnx", imgsz=640)model.export(format="tensorrt", imgsz=640, half=True)
CLI
libreyolo export model=LibreDFINEn.pt format=onnx imgsz=640libreyolo export model=LibreDFINEn.pt format=tensorrt imgsz=640 half=True
내보낸 파일 사용
from libreyolo import LibreYOLO, SAMPLE_IMAGE # 팩토리는 파일 접미사에 따라 라우팅하므로 내보낸 아티팩트도# 다른 체크포인트처럼 불러와 동일한 Results 객체를 반환합니다.model = LibreYOLO("LibreDFINEn.onnx")result = model(SAMPLE_IMAGE) print(result.boxes.xyxy)

체크포인트

이 계열에 공개된 모든 가중치 파일입니다.

파일입력(px)가중치 라이선스
Detection
LibreDFINEn.pt640apache-2.0
LibreDFINEs.pt640apache-2.0
LibreDFINEm.pt640apache-2.0
LibreDFINEl.pt640apache-2.0
LibreDFINEx.pt640apache-2.0
Instance segmentation
LibreDFINEn-seg.pt640apache-2.0
LibreDFINEs-seg.pt640apache-2.0
LibreDFINEm-seg.pt640apache-2.0
LibreDFINEl-seg.pt640apache-2.0
LibreDFINEx-seg.pt640apache-2.0

위의 모든 파일은 현재 LibreYOLO 조직에 있으며 처음 사용할 때 내려받습니다.

라이선스

내려받는 특정 가중치의 Hugging Face 저장소에서 라이선스를 확인하십시오. LibreYOLO 조직의 모든 체크포인트에는 라이선스가 있으며 한 계열 안에서도 항상 같지는 않습니다. 해당 저장소가 신뢰할 수 있는 기준입니다. 아래 요약은 이 페이지를 마지막으로 검증했을 때 적용된 내용을 설명합니다.

관련 라이선스에 관한 설명이며 법률 자문이 아닙니다. 상업적으로 중요한 사안이라면 라이선스를 직접 읽고 별도의 법률 자문을 받으십시오.

원작
D-FINE, University of Science and Technology of China
업스트림 라이선스
Apache-2.0
업스트림 소스
github.com/Peterande/D-FINE
LibreYOLO 코드
MIT
가중치
Apache-2.0, huggingface.co/LibreYOLO에 다시 게시됨
해석
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. It places no obligation on your own application code, and weights you train yourself on your own data are yours. The segmentation weights carry a second Apache-2.0 upstream, ArgoHA/D-FINE-seg, under the same terms.

분할 가중치에는 두 번째 업스트림이 있습니다. 마스크 디코더, 마스크 매칭, 마스크 손실은 역시 Apache-2.0인 ArgoHA/D-FINE-seg에서 가져왔으며 관리자가 저작자 표시와 함께 재사용을 승인했습니다.

인용

@misc{peng2024dfine,
      title={D-FINE: Redefine Regression Task in DETRs as Fine-grained Distribution Refinement},
      author={Yansong Peng and Hebei Li and Peixi Wu and Yueyi Zhang and Xiaoyan Sun and Feng Wu},
      year={2024},
      eprint={2410.13842},
      archivePrefix={arXiv},
      primaryClass={cs.CV}
}

github.com/Peterande/D-FINE#citation에 있는 저자의 인용 블록에서 복사했습니다.

LibreYOLO v1.5.0에서 검증되었습니다. 이 페이지의 지원 표, 체크포인트, 벤치마크 수치는 출시된 라이브러리와 공개된 가중치에서 생성되며 수동으로 작성되지 않습니다.