Dokumentacja LibreYOLO

Jedno API Pythona do wizji komputerowej: detekcji, segmentacji, estymacji pozy i głębi, OCR oraz innych zadań, z trenowaniem, walidacją i eksportem każdego z nich. Kod jest objęty licencją MIT, więc zachowujesz prawa do tego, co zbudujesz.

Instalacja
pip install libreyolo
Modele
Rodziny modeli: 86, od obecnych modeli flagowych po historyczne detektory, dostępne przez jedną fabrykę
Zadania
Liczba zadań: 17, od detekcji po estymację kierunku wzroku i rekonstrukcję siatki człowieka
Wagi
244 opublikowanych checkpointów dla opisanych tutaj rodzin, pobieranych przy pierwszym użyciu z huggingface.co/LibreYOLO
Eksport
Liczba formatów: 12, od ONNX po TensorRT, CoreML, TFLite i Core AI
Licencja
Kod na licencji MIT. Wagi zachowują licencję projektu źródłowego, podaną dla każdego checkpointu

Co chcesz zrobić?

Wszystkie zadania
Detekcja obiektów
Ramki i klasy. Domyślne zadanie obsługiwane przez większość rodzin.
Segmentacja instancji
Maski poszczególnych obiektów, jedna maska na detekcję.
Segmentacja semantyczna
Klasa dla każdego piksela, bez rozdzielania obiektów.
Segmentacja panoptyczna
Segmentacja semantyczna i segmentacja instancji w jednym wyniku.
Estymacja pozy
Punkty kluczowe każdego obiektu, w podejściu top-down lub bottom-up.
Klasyfikacja obrazów
Jedna etykieta na obraz, w tym klasyfikacja zero-shot za pomocą CLIP i SigLIP2.
Detekcja obróconych obiektów
Obrócone ramki do obrazów lotniczych i dokumentów.
Detekcja punktów
Centroidy zamiast ramek. Liczenie i bardzo małe modele.
Estymacja głębi
Głębia każdego piksela z pojedynczego obrazu.
Odtwarzanie obrazów
Odszumianie, usuwanie rozmycia i skalowanie w górę.
Usuwanie tła
Maski alfa do wycinania obiektów.
OCR
Detekcja i rozpoznawanie tekstu w jednym przebiegu.
Rozpoznawanie twarzy
Embeddingi twarzy i galerie tożsamości.
Estymacja spojrzenia
Określanie, gdzie patrzy dana osoba.
Śledzenie obiektów
Tożsamości między klatkami wideo, niezależnie od detektora.
Detekcja z otwartym słownikiem
Detekcja klas podanych w czasie działania, bez trenowania.
Segmentacja sterowana promptem
Segmentacja dowolnego wskazanego obiektu za pomocą SAM i podobnych modeli.

Który model?

Wszystkie modele

Zacznij od modelu flagowego, chyba że istnieje powód, aby wybrać inaczej. Każda funkcja jest najpierw projektowana i walidowana na GPU właśnie dla tych modeli, a każda strona zawiera checkpointy, macierz eksportu i informacje o licencjach danej rodziny.

RF-DETR
4 zadań, 19 checkpointów.
YOLOv9
Detekcja, 9 checkpointów.
DEIM
Detekcja, 13 checkpointów.
D-FINE
2 zadań, 10 checkpointów.
EdgeCrafter
3 zadań, 12 checkpointów.
RT-DETR
2 zadań, 21 checkpointów.
YOLO-NAS
2 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
ConvNeXt
Detekcja, 3 checkpointów.
DINOv2
3 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
Dome-DETR
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
EfficientNetV2
Detekcja, 4 checkpointów.
FOMO
Detekcja, 3 checkpointów.
LingBot-Vision
Detekcja, 3 checkpointów.
MobileNetV4
Detekcja, 3 checkpointów.
NAFNet
Detekcja, 1 checkpoint.
PicoDet
Detekcja, 3 checkpointów.
ResNet
Detekcja, 4 checkpointów.
RTMDet
2 zadań, 10 checkpointów.
SegFormer
Detekcja, 6 checkpointów.
YOLOv7
Detekcja, 1 checkpoint.
YOLOX
Detekcja, 6 checkpointów.
AlexNet
Detekcja, 1 checkpoint.
BiRefNet
Detekcja, 1 checkpoint.
CenterNet
Detekcja, 2 checkpointów.
DeepLabv3
Detekcja, 3 checkpointów.
Deformable DETR
Detekcja, 5 checkpointów.
Depth Anything 3
Detekcja, 1 checkpoint.
Depth Anything V2
Detekcja, 3 checkpointów.
DETR
Detekcja, 4 checkpointów.
DexiNed
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
DINO-DETR
Detekcja, 3 checkpointów.
EfficientDet
Detekcja, 5 checkpointów.
EoMT
3 zadań, 6 checkpointów.
Faster R-CNN
Detekcja, 4 checkpointów.
FCN
Detekcja, 2 checkpointów.
FCOS
Detekcja, 1 checkpoint.
FeyNobg
Detekcja, 3 checkpointów.
HRNet
Detekcja, 2 checkpointów.
L2CS-Net
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
LibreFaceRec
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
LW-DETR
Detekcja, 5 checkpointów.
Mask R-CNN
2 zadań, 1 checkpoint.
MiDaS
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
MoGe-2
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
PIDNet
Detekcja, 3 checkpointów.
PP-OCRv5
Detekcja, 2 checkpointów.
Real-ESRGAN
Detekcja, 3 checkpointów.
RetinaNet
Detekcja, 2 checkpointów.
SAM 3D Body
Detekcja, 2 checkpointów.
SSD
Detekcja, 1 checkpoint.
Swin Transformer
Detekcja, 4 checkpointów.
SwinIR
Detekcja, 3 checkpointów.
TEED
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
VGG
Detekcja, 4 checkpointów.
ViT
Detekcja, 4 checkpointów.
ZipDepth
Detekcja, 2 checkpointów.
DeiT
Detekcja, 3 checkpointów.
YOLOv1
Detekcja, 1 checkpoint.
YOLOv2
Detekcja, 2 checkpointów.
YOLOv3
Detekcja, 3 checkpointów.
YOLOv4
Detekcja, 2 checkpointów.
CLIP
2 zadań, 2 checkpointów.
EdgeTAM
Detekcja, 1 checkpoint.
Florence-2
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
Grounding DINO
Detekcja, 2 checkpointów.
InternVL3
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
Kosmos-2
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
LFM2-VL
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
LibreMODUS
4 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
LocateAnything
2 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
MobileSAM
Detekcja, 1 checkpoint.
OMDet-Turbo
Detekcja, 1 checkpoint.
OV-DEIM
Detekcja, 3 checkpointów.
OWLv2
Detekcja, 2 checkpointów.
PicoSAM3
Detekcja, 1 checkpoint.
Qwen3-VL
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
SAM
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
SAM 2
Detekcja, 4 checkpointów.
SAM 3
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
SenseNova-Vision
7 zadań, 1 checkpoint.
SigLIP2
2 zadań, 2 checkpointów.
SmolVLM2
Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.

Zmierzone, nie deklarowane

Vision Analysis

Każda wartość dokładności i opóźnienia w tej dokumentacji pochodzi z opublikowanego przebiegu wraz z informacjami o sprzęcie, środowisku uruchomieniowym i precyzji. Poniższy wykres jest aktualizowany na żywo.

Praca z modelem

Trenowanie
Zbiory danych, argumenty, augmentacja, wiele GPU i rejestrowanie eksperymentów.
Predykcja
Obrazy, foldery, wideo, kamery internetowe i strumienie RTSP.
Eksport i wdrożenie
Dwanaście środowisk docelowych z macierzą obsługi dla każdej rodziny.
Wiersz poleceń
Wszystkie możliwości API Pythona bez pisania kodu w Pythonie.

O licencji

Kod LibreYOLO jest objęty licencją MIT. Nie wymaga ona otwarcia kodu aplikacji, nie obejmuje wag modelu i nie zmienia się, gdy sprzedajesz zbudowany produkt. Wstępnie wytrenowane wagi są osobne: każda zachowuje licencję osoby lub organizacji, która ją wytrenowała, a dokumentacja podaje ją dla każdego checkpointu zamiast sprowadzać wszystkie do jednego stwierdzenia. Niektóre wagi są przeznaczone wyłącznie do użytku niekomercyjnego i jest to wyraźnie zaznaczone.

Jak działają tu licencje

Ta dokumentacja opisuje LibreYOLO v1.5.0. Dokumentacja wcześniejszych wydań pozostaje dostępna na stronie /docs/versions.