Tài liệu LibreYOLO
Một API Python cho thị giác máy tính: phát hiện, phân đoạn, tư thế, độ sâu, OCR và nhiều tác vụ khác, với khả năng huấn luyện, kiểm định và xuất cho từng tác vụ. Mã nguồn có giấy phép MIT nên những gì bạn xây dựng vẫn thuộc về bạn.
pip install libreyolo- Mô hình
- 86 họ, từ các mô hình chủ lực hiện tại đến những bộ phát hiện lịch sử, dùng chung một factory
- Tác vụ
- 17, từ phát hiện đến ước lượng hướng nhìn và khôi phục lưới cơ thể người
- Trọng số
- 244 checkpoint đã công bố cho các họ được ghi lại tại đây, được tải xuống trong lần sử dụng đầu tiên từ huggingface.co/LibreYOLO
- Xuất
- 12 định dạng, từ ONNX đến TensorRT, CoreML, TFLite và Core AI
- Giấy phép
- Mã nguồn dùng giấy phép MIT. Trọng số mang giấy phép thượng nguồn, được nêu riêng cho từng checkpoint
Bạn muốn làm gì?
Tất cả tác vụ- Phát hiện đối tượng
- Bounding box và lớp đối tượng. Đây là tác vụ mặc định và được hầu hết các họ hỗ trợ.
- Phân đoạn thực thể
- Mặt nạ cho từng đối tượng, mỗi lần phát hiện có một mặt nạ.
- Phân đoạn ngữ nghĩa
- Một lớp đối tượng cho mỗi pixel, không tách riêng các đối tượng.
- Phân đoạn toàn cảnh
- Phân đoạn ngữ nghĩa và phân đoạn thực thể trong cùng một đầu ra.
- Ước lượng tư thế
- Keypoint cho từng đối tượng, từ trên xuống hoặc từ dưới lên.
- Phân loại ảnh
- Một nhãn cho mỗi ảnh, bao gồm cả zero-shot với CLIP và SigLIP2.
- Phát hiện hộp xoay
- Hộp xoay cho ảnh chụp từ trên không và ảnh tài liệu.
- Phát hiện điểm
- Trọng tâm thay cho bounding box. Dùng để đếm và cho các mô hình rất nhỏ.
- Ước lượng độ sâu
- Độ sâu theo từng pixel từ một ảnh duy nhất.
- Phục hồi ảnh
- Khử nhiễu, khử mờ và phóng to.
- Xóa nền
- Alpha matte để cắt nền.
- OCR
- Phát hiện và nhận dạng văn bản trong một lượt.
- Nhận dạng khuôn mặt
- Embedding khuôn mặt và thư viện danh tính.
- Ước lượng ánh nhìn
- Xác định một người đang nhìn về đâu.
- Theo dõi đối tượng
- Theo dõi danh tính qua các khung hình video với bất kỳ bộ phát hiện nào.
- Phát hiện với từ vựng mở
- Phát hiện các lớp đối tượng bạn nêu tên tại runtime mà không cần huấn luyện.
- Phân đoạn theo prompt
- Phân đoạn mọi thứ bạn chỉ vào bằng SAM và các mô hình tương tự.
Mô hình nào?
Tất cả mô hìnhHãy bắt đầu với một mô hình chủ lực, trừ khi bạn có lý do để chọn mô hình khác. Mọi tính năng đều được thiết kế và kiểm chứng trên GPU với các mô hình này trước, đồng thời mỗi trang đều có checkpoint, ma trận xuất và thông tin giấy phép của họ đó.
- RF-DETR
- 4 tác vụ, 19 bản checkpoint.
- YOLOv9
- Phát hiện, 9 bản checkpoint.
- DEIM
- Phát hiện, 13 bản checkpoint.
- D-FINE
- 2 tác vụ, 10 bản checkpoint.
- EdgeCrafter
- 3 tác vụ, 12 bản checkpoint.
- RT-DETR
- 2 tác vụ, 21 bản checkpoint.
- YOLO-NAS
- 2 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
- ConvNeXt
- Phát hiện, 3 bản checkpoint.
- DINOv2
- 3 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
- Dome-DETR
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- EfficientNetV2
- Phát hiện, 4 bản checkpoint.
- FOMO
- Phát hiện, 3 bản checkpoint.
- LingBot-Vision
- Phát hiện, 3 bản checkpoint.
- MobileNetV4
- Phát hiện, 3 bản checkpoint.
- NAFNet
- Phát hiện, 1 bản checkpoint.
- PicoDet
- Phát hiện, 3 bản checkpoint.
- ResNet
- Phát hiện, 4 bản checkpoint.
- RTMDet
- 2 tác vụ, 10 bản checkpoint.
- SegFormer
- Phát hiện, 6 bản checkpoint.
- YOLOv7
- Phát hiện, 1 bản checkpoint.
- YOLOX
- Phát hiện, 6 bản checkpoint.
- AlexNet
- Phát hiện, 1 bản checkpoint.
- BiRefNet
- Phát hiện, 1 bản checkpoint.
- CenterNet
- Phát hiện, 2 bản checkpoint.
- DeepLabv3
- Phát hiện, 3 bản checkpoint.
- Deformable DETR
- Phát hiện, 5 bản checkpoint.
- Depth Anything 3
- Phát hiện, 1 bản checkpoint.
- Depth Anything V2
- Phát hiện, 3 bản checkpoint.
- DETR
- Phát hiện, 4 bản checkpoint.
- DexiNed
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- DINO-DETR
- Phát hiện, 3 bản checkpoint.
- EfficientDet
- Phát hiện, 5 bản checkpoint.
- EoMT
- 3 tác vụ, 6 bản checkpoint.
- Faster R-CNN
- Phát hiện, 4 bản checkpoint.
- FCN
- Phát hiện, 2 bản checkpoint.
- FCOS
- Phát hiện, 1 bản checkpoint.
- FeyNobg
- Phát hiện, 3 bản checkpoint.
- HRNet
- Phát hiện, 2 bản checkpoint.
- L2CS-Net
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- LibreFaceRec
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- LW-DETR
- Phát hiện, 5 bản checkpoint.
- Mask R-CNN
- 2 tác vụ, 1 bản checkpoint.
- MiDaS
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- MoGe-2
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- PIDNet
- Phát hiện, 3 bản checkpoint.
- PP-OCRv5
- Phát hiện, 2 bản checkpoint.
- Real-ESRGAN
- Phát hiện, 3 bản checkpoint.
- RetinaNet
- Phát hiện, 2 bản checkpoint.
- SAM 3D Body
- Phát hiện, 2 bản checkpoint.
- SSD
- Phát hiện, 1 bản checkpoint.
- Swin Transformer
- Phát hiện, 4 bản checkpoint.
- SwinIR
- Phát hiện, 3 bản checkpoint.
- TEED
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- VGG
- Phát hiện, 4 bản checkpoint.
- ViT
- Phát hiện, 4 bản checkpoint.
- ZipDepth
- Phát hiện, 2 bản checkpoint.
- DeiT
- Phát hiện, 3 bản checkpoint.
- YOLOv1
- Phát hiện, 1 bản checkpoint.
- YOLOv2
- Phát hiện, 2 bản checkpoint.
- YOLOv3
- Phát hiện, 3 bản checkpoint.
- YOLOv4
- Phát hiện, 2 bản checkpoint.
- CLIP
- 2 tác vụ, 2 bản checkpoint.
- EdgeTAM
- Phát hiện, 1 bản checkpoint.
- Florence-2
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- Grounding DINO
- Phát hiện, 2 bản checkpoint.
- InternVL3
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- Kosmos-2
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- LFM2-VL
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- LibreMODUS
- 4 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
- LocateAnything
- 2 tác vụ, trọng số do tác giả phân phối, không phải chúng tôi.
- MobileSAM
- Phát hiện, 1 bản checkpoint.
- OMDet-Turbo
- Phát hiện, 1 bản checkpoint.
- OV-DEIM
- Phát hiện, 3 bản checkpoint.
- OWLv2
- Phát hiện, 2 bản checkpoint.
- PicoSAM3
- Phát hiện, 1 bản checkpoint.
- Qwen3-VL
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- SAM
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- SAM 2
- Phát hiện, 4 bản checkpoint.
- SAM 3
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
- SenseNova-Vision
- 7 tác vụ, 1 bản checkpoint.
- SigLIP2
- 2 tác vụ, 2 bản checkpoint.
- SmolVLM2
- Phát hiện, trọng số do tác giả phân phối, không phải chúng tôi.
Đã đo lường, không chỉ tuyên bố
Vision AnalysisMọi số liệu về độ chính xác và độ trễ trong tài liệu này đều đến từ một lần chạy được chúng tôi công bố, kèm theo phần cứng, runtime và precision. Biểu đồ bên dưới dùng dữ liệu trực tiếp.
Làm việc với mô hình
- Huấn luyện
- Tập dữ liệu, đối số, tăng cường dữ liệu, nhiều GPU và trình ghi nhật ký thử nghiệm.
- Dự đoán
- Ảnh, thư mục, video, webcam và luồng RTSP.
- Xuất và triển khai
- Mười hai đích, kèm ma trận hỗ trợ cho từng họ.
- Dòng lệnh
- Mọi chức năng của API Python mà không cần viết Python.
Về giấy phép
Mã nguồn LibreYOLO dùng giấy phép MIT. Giấy phép không yêu cầu bạn phải mở mã nguồn ứng dụng, không áp dụng cho trọng số mô hình của bạn và không thay đổi nếu bạn bán sản phẩm mình xây dựng. Trọng số được huấn luyện sẵn là phần riêng biệt: mỗi trọng số mang giấy phép của người đã huấn luyện nó, và tài liệu nêu rõ theo từng checkpoint thay vì gộp chung thành một tuyên bố. Một số trọng số không cho phép sử dụng thương mại và được ghi rõ như vậy.