Tài liệu LibreYOLO

Một API Python cho thị giác máy tính: phát hiện, phân đoạn, tư thế, độ sâu, OCR và nhiều tác vụ khác, với khả năng huấn luyện, kiểm định và xuất cho từng tác vụ. Mã nguồn có giấy phép MIT nên những gì bạn xây dựng vẫn thuộc về bạn.

cài đặt
pip install libreyolo
Mô hình
86 họ, từ các mô hình chủ lực hiện tại đến những bộ phát hiện lịch sử, dùng chung một factory
Tác vụ
17, từ phát hiện đến ước lượng hướng nhìn và khôi phục lưới cơ thể người
Trọng số
244 checkpoint đã công bố cho các họ được ghi lại tại đây, được tải xuống trong lần sử dụng đầu tiên từ huggingface.co/LibreYOLO
Xuất
12 định dạng, từ ONNX đến TensorRT, CoreML, TFLite và Core AI
Giấy phép
Mã nguồn dùng giấy phép MIT. Trọng số mang giấy phép thượng nguồn, được nêu riêng cho từng checkpoint

Bạn muốn làm gì?

Tất cả tác vụ
Phát hiện đối tượng
Bounding box và lớp đối tượng. Đây là tác vụ mặc định và được hầu hết các họ hỗ trợ.
Phân đoạn thực thể
Mặt nạ cho từng đối tượng, mỗi lần phát hiện có một mặt nạ.
Phân đoạn ngữ nghĩa
Một lớp đối tượng cho mỗi pixel, không tách riêng các đối tượng.
Phân đoạn toàn cảnh
Phân đoạn ngữ nghĩa và phân đoạn thực thể trong cùng một đầu ra.
Ước lượng tư thế
Keypoint cho từng đối tượng, từ trên xuống hoặc từ dưới lên.
Phân loại ảnh
Một nhãn cho mỗi ảnh, bao gồm cả zero-shot với CLIP và SigLIP2.
Phát hiện hộp xoay
Hộp xoay cho ảnh chụp từ trên không và ảnh tài liệu.
Phát hiện điểm
Trọng tâm thay cho bounding box. Dùng để đếm và cho các mô hình rất nhỏ.
Ước lượng độ sâu
Độ sâu theo từng pixel từ một ảnh duy nhất.
Phục hồi ảnh
Khử nhiễu, khử mờ và phóng to.
Xóa nền
Alpha matte để cắt nền.
OCR
Phát hiện và nhận dạng văn bản trong một lượt.
Nhận dạng khuôn mặt
Embedding khuôn mặt và thư viện danh tính.
Ước lượng ánh nhìn
Xác định một người đang nhìn về đâu.
Theo dõi đối tượng
Theo dõi danh tính qua các khung hình video với bất kỳ bộ phát hiện nào.
Phát hiện với từ vựng mở
Phát hiện các lớp đối tượng bạn nêu tên tại runtime mà không cần huấn luyện.
Phân đoạn theo prompt
Phân đoạn mọi thứ bạn chỉ vào bằng SAM và các mô hình tương tự.

Mô hình nào?

Tất cả mô hình

Hãy bắt đầu với một mô hình chủ lực, trừ khi bạn có lý do để chọn mô hình khác. Mọi tính năng đều được thiết kế và kiểm chứng trên GPU với các mô hình này trước, đồng thời mỗi trang đều có checkpoint, ma trận xuất và thông tin giấy phép của họ đó.

RF-DETR
4 tác vụ, 19 bản checkpoint.
YOLOv9
Phát hiện, 9 bản checkpoint.
DEIM
Phát hiện, 13 bản checkpoint.
D-FINE
2 tác vụ, 10 bản checkpoint.
EdgeCrafter
3 tác vụ, 12 bản checkpoint.
RT-DETR
2 tác vụ, 21 bản checkpoint.
YOLO-NAS
2 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
ConvNeXt
Phát hiện, 3 bản checkpoint.
DINOv2
3 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
Dome-DETR
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
EfficientNetV2
Phát hiện, 4 bản checkpoint.
FOMO
Phát hiện, 3 bản checkpoint.
LingBot-Vision
Phát hiện, 3 bản checkpoint.
MobileNetV4
Phát hiện, 3 bản checkpoint.
NAFNet
Phát hiện, 1 bản checkpoint.
PicoDet
Phát hiện, 3 bản checkpoint.
ResNet
Phát hiện, 4 bản checkpoint.
RTMDet
2 tác vụ, 10 bản checkpoint.
SegFormer
Phát hiện, 6 bản checkpoint.
YOLOv7
Phát hiện, 1 bản checkpoint.
YOLOX
Phát hiện, 6 bản checkpoint.
AlexNet
Phát hiện, 1 bản checkpoint.
BiRefNet
Phát hiện, 1 bản checkpoint.
CenterNet
Phát hiện, 2 bản checkpoint.
DeepLabv3
Phát hiện, 3 bản checkpoint.
Deformable DETR
Phát hiện, 5 bản checkpoint.
Depth Anything 3
Phát hiện, 1 bản checkpoint.
Depth Anything V2
Phát hiện, 3 bản checkpoint.
DETR
Phát hiện, 4 bản checkpoint.
DexiNed
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
DINO-DETR
Phát hiện, 3 bản checkpoint.
EfficientDet
Phát hiện, 5 bản checkpoint.
EoMT
3 tác vụ, 6 bản checkpoint.
Faster R-CNN
Phát hiện, 4 bản checkpoint.
FCN
Phát hiện, 2 bản checkpoint.
FCOS
Phát hiện, 1 bản checkpoint.
FeyNobg
Phát hiện, 3 bản checkpoint.
HRNet
Phát hiện, 2 bản checkpoint.
L2CS-Net
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
LibreFaceRec
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
LW-DETR
Phát hiện, 5 bản checkpoint.
Mask R-CNN
2 tác vụ, 1 bản checkpoint.
MiDaS
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
MoGe-2
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
PIDNet
Phát hiện, 3 bản checkpoint.
PP-OCRv5
Phát hiện, 2 bản checkpoint.
Real-ESRGAN
Phát hiện, 3 bản checkpoint.
RetinaNet
Phát hiện, 2 bản checkpoint.
SAM 3D Body
Phát hiện, 2 bản checkpoint.
SSD
Phát hiện, 1 bản checkpoint.
Swin Transformer
Phát hiện, 4 bản checkpoint.
SwinIR
Phát hiện, 3 bản checkpoint.
TEED
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
VGG
Phát hiện, 4 bản checkpoint.
ViT
Phát hiện, 4 bản checkpoint.
ZipDepth
Phát hiện, 2 bản checkpoint.
DeiT
Phát hiện, 3 bản checkpoint.
YOLOv1
Phát hiện, 1 bản checkpoint.
YOLOv2
Phát hiện, 2 bản checkpoint.
YOLOv3
Phát hiện, 3 bản checkpoint.
YOLOv4
Phát hiện, 2 bản checkpoint.
CLIP
2 tác vụ, 2 bản checkpoint.
EdgeTAM
Phát hiện, 1 bản checkpoint.
Florence-2
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
Grounding DINO
Phát hiện, 2 bản checkpoint.
InternVL3
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
Kosmos-2
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
LFM2-VL
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
LibreMODUS
4 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
LocateAnything
2 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
MobileSAM
Phát hiện, 1 bản checkpoint.
OMDet-Turbo
Phát hiện, 1 bản checkpoint.
OV-DEIM
Phát hiện, 3 bản checkpoint.
OWLv2
Phát hiện, 2 bản checkpoint.
PicoSAM3
Phát hiện, 1 bản checkpoint.
Qwen3-VL
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
SAM
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
SAM 2
Phát hiện, 4 bản checkpoint.
SAM 3
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
SenseNova-Vision
7 tác vụ, 1 bản checkpoint.
SigLIP2
2 tác vụ, 2 bản checkpoint.
SmolVLM2
Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.

Đã đo lường, không chỉ tuyên bố

Vision Analysis

Mọi số liệu về độ chính xác và độ trễ trong tài liệu này đều đến từ một lần chạy được chúng tôi công bố, kèm theo phần cứng, runtime và precision. Biểu đồ bên dưới dùng dữ liệu trực tiếp.

Làm việc với mô hình

Huấn luyện
Tập dữ liệu, đối số, tăng cường dữ liệu, nhiều GPU và trình ghi nhật ký thử nghiệm.
Dự đoán
Ảnh, thư mục, video, webcam và luồng RTSP.
Xuất và triển khai
Mười hai đích, kèm ma trận hỗ trợ cho từng họ.
Dòng lệnh
Mọi chức năng của API Python mà không cần viết Python.

Về giấy phép

Mã nguồn LibreYOLO dùng giấy phép MIT. Giấy phép không yêu cầu bạn phải mở mã nguồn ứng dụng, không áp dụng cho trọng số mô hình của bạn và không thay đổi nếu bạn bán sản phẩm mình xây dựng. Trọng số được huấn luyện sẵn là phần riêng biệt: mỗi trọng số mang giấy phép của người đã huấn luyện nó, và tài liệu nêu rõ theo từng checkpoint thay vì gộp chung thành một tuyên bố. Một số trọng số không cho phép sử dụng thương mại và được ghi rõ như vậy.

Cách giấy phép hoạt động tại đây

Tài liệu này mô tả LibreYOLO v1.5.0. Tài liệu cho các bản phát hành trước vẫn có tại /docs/versions.