PP-OCRv5
PP-OCRv5는 PaddleOCR의 텍스트 탐지 및 인식 파이프라인입니다. 미분 가능한 이진화 탐지기가 텍스트 사각형을 찾고 SVTR/CTC 인식기가 읽습니다. LibreYOLO는 두 계층을 PyTorch로 포팅합니다.
- 작업
- ocr
- 크기
- t, l at 960 px
- 설치
pip install libreyolo- 지원 티어
- 추론 전용, v부터 지원. 예측, 검증, 내보내기만 지원합니다. 학습 기능은 적용되지 않습니다.
- 라이선스
- 코드 Apache-2.0, 가중치 Apache-2.0. 상업적 사용
설치
PP-OCRv5에는 기본 패키지 외에 추가 항목이 필요하지 않습니다.
pip install libreyolo예측
가중치는 처음 사용할 때 Hugging Face에서 내려받아 로컬에 캐시됩니다.
from libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibrePPOCRl-ocr.pt")result = model(SAMPLE_IMAGE, save=True) for text, conf in zip(result.ocr.texts, result.ocr.conf): print(text, float(conf))libreyolo predict model=LibrePPOCRl-ocr.pt source=receipt.jpg save=Truefrom libreyolo import LibreYOLO, SAMPLE_IMAGE model = LibreYOLO("LibrePPOCRl-ocr.pt")result = model(SAMPLE_IMAGE) # 읽기 순서의 (N, 4, 2) 폴리곤: 왼쪽 위, 오른쪽 위,# 오른쪽 아래, 왼쪽 아래입니다. 탐지 사각형은 실제 폴리곤# (회전 텍스트)이므로 result.boxes가 아닌 result.ocr에 채워집니다.print(result.ocr.data.shape)print(result.ocr.det_conf)각 체크포인트는 탐지와 인식 두 단계를 하나의 .pt 파일에 번들하며, 인식 문자
집합과 파이프라인 기본값은 체크포인트 메타데이터에 담깁니다. 인식기는 하나의
딕셔너리로 중국어 간체 및 번체, 영어, 일본어, 병음을 읽습니다. result.ocr은
OCRRegions 페이로드입니다. .data에는 4점 폴리곤, .texts에는 인식문,
.conf에는 영역별 인식 점수, .det_conf에는 탐지 점수가 들어 있습니다. 다중
이미지 소스는 순차적으로 실행합니다. 2단계 파이프라인은 이미지 간 배치를 수행하지
않습니다. 소스, 스트리밍, 결과 처리는 예측을 참조합니다.
변형
계층은 두 가지입니다. t는 CPU 사용을 위해 더 가벼운
PP-LCNetV3/PP-OCRv5_mobile 백본으로 구성되며, l은 더 높은 정확도를 위해
PP-HGNetV2 서버 백본으로 구성됩니다. 두 계층 모두 고정된 긴 변 제한으로 탐지를
실행하고 크롭을 배치로 인식합니다. rec_batch는 순전파마다 인식기를 통과하는 크롭
수를 제어합니다.
검증
val()은 이미지 디렉터리와 labels/<split>.jsonl 파일 또는 동등한 데이터셋
YAML을 기준으로 파이프라인을 측정합니다. 각 레이블에는 이미지별 텍스트 영역 폴리곤과
인식문이 나열됩니다. 탐지 hmean(IoU로 일치시킨 정밀도, 재현율, F1), 엔드투엔드
F1(hmean과 정규화 후 정확한 인식문 일치이며 체크포인트의 적합도 메트릭), 일치한 쌍의
평균 정규화 편집 거리인 1-NED를 보고합니다.
from libreyolo import LibreYOLO model = LibreYOLO("LibrePPOCRl-ocr.pt")metrics = model.val(data="my-dataset") print(metrics["metrics/det_hmean"])print(metrics["metrics/e2e_f1"]) # 주요 메트릭print(metrics["metrics/rec_1-NED"])libreyolo val model=LibrePPOCRl-ocr.pt data=my-dataset내보내기
| 작업 | ONNX | TorchScript | ExecuTorch | TensorRT | OpenVINO | Paddle | MNN | RKNN | ncnn | TFLite | CoreML | Core AI |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ocr | ocr to ONNX: 지원하지 않음 | ocr to TorchScript: 지원하지 않음 | ocr to ExecuTorch: 지원하지 않음 | ocr to TensorRT: 지원하지 않음 | ocr to OpenVINO: 지원하지 않음 | ocr to Paddle: 지원하지 않음 | ocr to MNN: 지원하지 않음 | ocr to RKNN: 지원하지 않음 | ocr to ncnn: 지원하지 않음 | ocr to TFLite: 지원하지 않음 | ocr to CoreML: 지원하지 않음 | ocr to Core AI: 지원하지 않음 |
PP-OCRv5는 하나의 추적 가능한 그래프가 아니라 탐지와 인식이 함께 이동하는 2개
네트워크 파이프라인이므로 내보내기가 구현되지 않았습니다. 아직 지원하는 형식이
없습니다. 이 형식 외의 체크포인트가 필요하면 Apache-2.0 업스트림 학습 코드를 직접
파인튜닝하고 weights/convert_ppocr_weights.py로 결과를 변환합니다.
체크포인트
이 계열에서 공개된 모든 가중치 파일입니다.
| 파일 | 입력(px) | 가중치 라이선스 |
|---|---|---|
| ocr | ||
| LibrePPOCRt-ocr.pt | apache-2.0 | |
| LibrePPOCRl-ocr.pt | apache-2.0 | |
위의 모든 파일은 현재 LibreYOLO 조직에 있으며 처음 사용할 때 내려받습니다.
라이선스
내려받는 특정 가중치의 Hugging Face 저장소에서 라이선스를 확인하십시오. LibreYOLO 조직의 모든 체크포인트에는 라이선스가 있으며 한 계열 안에서도 항상 같지는 않습니다. 해당 저장소가 신뢰할 수 있는 기준입니다. 아래 요약은 이 페이지를 마지막으로 검증했을 때 적용된 내용을 설명합니다.
관련 라이선스에 관한 설명이며 법률 자문이 아닙니다. 상업적으로 중요한 사안이라면 라이선스를 직접 읽고 별도의 법률 자문을 받으십시오.
- 원작
- PaddleOCR (PP-OCRv5), PaddlePaddle Authors
- 업스트림 라이선스
- Apache-2.0
- LibreYOLO 코드
- MIT
- 가중치
- Apache-2.0, huggingface.co/LibreYOLO에 다시 게시됨
- 해석
- Apache-2.0 is a permissive license: the architecture, the officially released PP-OCRv5 checkpoints this port converts, and LibreYOLO's own PyTorch port may all be used, modified and redistributed, including commercially, provided the license text and attribution notices travel with any copy. It grants a patent license and places no obligation on your own application code.
인용
@misc{cui2025paddleocr30technicalreport,
title={PaddleOCR 3.0 Technical Report},
author={Cheng Cui and Ting Sun and Manhui Lin and Tingquan Gao and Yubo Zhang and Jiaxuan Liu and Xueqing Wang and Zelun Zhang and Changda Zhou and Hongen Liu and Yue Zhang and Wenyu Lv and Kui Huang and Yichao Zhang and Jing Zhang and Jun Zhang and Yi Liu and Dianhai Yu and Yanjun Ma},
year={2025},
eprint={2507.05595},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2507.05595},
}github.com/PaddlePaddle/PaddleOCR#citation에 있는 저자의 인용 블록에서 복사했습니다.