ConvNeXt

ConvNeXt는 표준 컨볼루션으로만 구성된 이미지 분류기로, ResNet에서 비전 트랜스포머의 설계 선택을 향해 블록별로 현대화했습니다. LibreYOLO는 분류 한 작업에서 이를 지원합니다.

작업
classify
크기
t, s, b at 224 px
설치
pip install libreyolo
지원 티어
지원, v부터 지원. 보조 학습 가능 모델입니다. CI 통과 상태를 유지하며 기능은 여건에 따라 추가됩니다.
업스트림
Meta AI (FAIR)의 ConvNeXt, Apache-2.0. 논문, 소스
라이선스
코드 MIT, 가중치 Apache-2.0. 상업적 사용

설치

ConvNeXt에는 선택적 extra가 필요하지 않습니다. 가져오는 모든 항목이 기본 설치에 포함됩니다.

bash
pip install libreyolo

lora=True를 사용하는 어댑터 파인튜닝은 예외이며 lora extra가 필요합니다.

bash
pip install "libreyolo[lora]"

예측

가중치는 처음 사용할 때 Hugging Face에서 내려받아 로컬에 캐시됩니다.

Python
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibreConvNeXtt-cls.pt")result = model(SAMPLE_IMAGE, save=True) print(result.probs.top1, result.probs.top1conf)print(result.probs.top5)
CLI
libreyolo predict model=LibreConvNeXtt-cls.pt source=cat.jpg save=True

반환되는 Results 객체는 모든 계열에서 동일하므로 다른 모델로 바꾸려면 한 줄만 수정하면 됩니다. 분류기에는 바운딩 박스나 마스크가 없습니다. result.probs에는 전체 이미지 예측이 들어 있으며 top1, top5, top1conf, top5conf를 제공합니다. 단일 확률 벡터에는 임계값을 적용하거나 억제할 항목이 없으므로 API 동등성을 위해 conf, iou, max_det를 허용하지만 효과가 없습니다. 소스, 스트리밍, 결과 처리는 예측을 참조합니다.

변형

tiny, small, base 크기 3개가 있으며 모두 같은 방식으로 학습하고 평가하므로 크기 선택은 매개변수 수와 정확도의 직접적인 절충입니다. 작업은 고정되어 모든 크기가 분류만 지원합니다. 모든 크기의 가중치 파일 이름은 -cls.pt로 끝나며 팩토리는 이 접미사를 읽어 해당 계열로 라우팅합니다. task= 인수는 필요하지 않습니다.

학습

파인튜닝은 공개된 ImageNet 백본에서 시작하며 최종 분류기 레이어를 대상 데이터셋의 클래스 수에 맞게 자동으로 다시 빌드합니다.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreConvNeXtt-cls.pt")model.train(data="imagenette160", epochs=5)
CLI
libreyolo train model=LibreConvNeXtt-cls.pt data=imagenette160 epochs=5
LoRA
from libreyolo import LibreYOLO model = LibreYOLO("LibreConvNeXtt-cls.pt")model.train(data="imagenette160", epochs=5, lora=True)
다중 GPU
libreyolo train model=LibreConvNeXtt-cls.pt data=imagenette160 \  epochs=50 device=0,1 batch=-1

다른 값을 지정하지 않으면 트레이너는 AdamW, 배치 64, lr0=1e-3으로 100 에폭을 실행하며 50 에폭 동안 개선이 없으면 조기 종료합니다. data에는 데이터셋 루트(train/val/, 클래스별 폴더), imagenette160 같은 알려진 짧은 이름 또는 .zip URL을 사용할 수 있습니다. ConvNeXt 블록에는 LoRA에 필요한 nn.Linear MLP가 있으므로 여기서는 lora=True를 지원하며, 전체 백본을 파인튜닝하는 대신 블록 MLP에 어댑터를 삽입합니다.

데이터셋, 증강, 다중 GPU, 로거는 학습을 참조합니다.

검증

val()metrics/ 키 딕셔너리를 반환합니다. 분류에서는 검증 분할의 top-1 및 top-5 정확도입니다.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreConvNeXtt-cls.pt")metrics = model.val(data="imagenette160") print(metrics["metrics/accuracy_top1"])print(metrics["metrics/accuracy_top5"])
CLI
libreyolo val model=LibreConvNeXtt-cls.pt data=imagenette160

내보내기

작업ONNXTorchScriptExecuTorchTensorRTOpenVINOPaddleMNNRKNNncnnTFLiteCoreMLCore AI
classifyclassify to ONNX: 지원함classify to TorchScript: 지원함classify to ExecuTorch: 지원함classify to TensorRT: 지원함classify to OpenVINO: 지원함classify to Paddle: 지원하지 않음classify to MNN: 지원하지 않음classify to RKNN: 지원하지 않음classify to ncnn: 지원함classify to TFLite: 지원함classify to CoreML: 지원하지 않음classify to Core AI: 지원함

내보낸 아티팩트는 파일 접미사에 따라 LibreYOLO()로 다시 불러오므로 .onnx 또는 .engine 파일이 체크포인트처럼 동작하며 동일한 Results를 반환합니다. 내보내기에는 모든 형식이 허용하는 인수와 일부 형식이 추가하는 extra가 나열되어 있습니다.

Python
from libreyolo import LibreYOLO model = LibreYOLO("LibreConvNeXtt-cls.pt")model.export(format="onnx")model.export(format="tensorrt", half=True)
CLI
libreyolo export model=LibreConvNeXtt-cls.pt format=onnxlibreyolo export model=LibreConvNeXtt-cls.pt format=tensorrt half=True
내보낸 파일 사용하기
from libreyolo import LibreYOLO, SAMPLE_IMAGE # 팩토리는 파일 접미사로 라우팅하므로 내보낸 아티팩트도# 체크포인트처럼 불러오며 동일한 Results 객체를 반환합니다.model = LibreYOLO("LibreConvNeXtt-cls.onnx")result = model(SAMPLE_IMAGE) print(result.probs.top1)

체크포인트

이 계열에서 공개된 모든 가중치 파일입니다.

파일입력(px)가중치 라이선스
classify
LibreConvNeXtt-cls.pt224apache-2.0
LibreConvNeXts-cls.pt224apache-2.0
LibreConvNeXtb-cls.pt224apache-2.0

위의 모든 파일은 현재 LibreYOLO 조직에 있으며 처음 사용할 때 내려받습니다.

라이선스

내려받는 특정 가중치의 Hugging Face 저장소에서 라이선스를 확인하십시오. LibreYOLO 조직의 모든 체크포인트에는 라이선스가 있으며 한 계열 안에서도 항상 같지는 않습니다. 해당 저장소가 신뢰할 수 있는 기준입니다. 아래 요약은 이 페이지를 마지막으로 검증했을 때 적용된 내용을 설명합니다.

관련 라이선스에 관한 설명이며 법률 자문이 아닙니다. 상업적으로 중요한 사안이라면 라이선스를 직접 읽고 별도의 법률 자문을 받으십시오.

원작
ConvNeXt, Meta AI (FAIR)
업스트림 라이선스
Apache-2.0
LibreYOLO 코드
MIT
가중치
Apache-2.0, huggingface.co/LibreYOLO에 다시 게시됨
해석
Apache-2.0 is a permissive license, so these weights can be used in commercial and closed-source products. It asks you to keep its license text and attribution notices with any copy of the weights you redistribute, and it grants a patent license. It places no obligation on your own application code, and weights you train yourself on your own data are yours. The architecture is Meta AI's original design, released under MIT at facebookresearch/ConvNeXt; the block definitions, layer-scale parameter and module naming that LibreYOLO's implementation follows come from timm, whose convnext_{tiny,small,base}.fb_in1k ImageNet-1k weights are licensed Apache-2.0 and are what LibreYOLO ships. Only ConvNeXt V1 is shipped here: ConvNeXt-V2's small pretrained checkpoints are CC-BY-NC 4.0 and are deliberately excluded as not redistributable in a commercial library.

이 계열에는 ConvNeXt V1만 제공됩니다. ConvNeXt-V2의 작은 사전 학습 체크포인트에는 CC-BY-NC 4.0이 적용되며, 비상업용 가중치를 MIT 및 상업용 라이브러리 안에서 재배포할 수 없으므로 의도적으로 제외했습니다.

인용

@Article{liu2022convnet,
  author  = {Zhuang Liu and Hanzi Mao and Chao-Yuan Wu and Christoph Feichtenhofer and Trevor Darrell and Saining Xie},
  title   = {A ConvNet for the 2020s},
  journal = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  year    = {2022},
}

github.com/facebookresearch/ConvNeXt#citation에 있는 저자의 인용 블록에서 복사했습니다.

LibreYOLO v1.5.0에서 검증되었습니다. 이 페이지의 지원 표, 체크포인트, 벤치마크 수치는 출시된 라이브러리와 공개된 가중치에서 생성되며 수동으로 작성되지 않습니다.