Dokumentacja LibreYOLO
Jedno API Pythona do wizji komputerowej: detekcji, segmentacji, estymacji pozy i głębi, OCR oraz innych zadań, z trenowaniem, walidacją i eksportem każdego z nich. Kod jest objęty licencją MIT, więc zachowujesz prawa do tego, co zbudujesz.
pip install libreyolo- Modele
- Rodziny modeli: 86, od obecnych modeli flagowych po historyczne detektory, dostępne przez jedną fabrykę
- Zadania
- Liczba zadań: 17, od detekcji po estymację kierunku wzroku i rekonstrukcję siatki człowieka
- Wagi
- 244 opublikowanych checkpointów dla opisanych tutaj rodzin, pobieranych przy pierwszym użyciu z huggingface.co/LibreYOLO
- Eksport
- Liczba formatów: 12, od ONNX po TensorRT, CoreML, TFLite i Core AI
- Licencja
- Kod na licencji MIT. Wagi zachowują licencję projektu źródłowego, podaną dla każdego checkpointu
Co chcesz zrobić?
Wszystkie zadania- Detekcja obiektów
- Ramki i klasy. Domyślne zadanie obsługiwane przez większość rodzin.
- Segmentacja instancji
- Maski poszczególnych obiektów, jedna maska na detekcję.
- Segmentacja semantyczna
- Klasa dla każdego piksela, bez rozdzielania obiektów.
- Segmentacja panoptyczna
- Segmentacja semantyczna i segmentacja instancji w jednym wyniku.
- Estymacja pozy
- Punkty kluczowe każdego obiektu, w podejściu top-down lub bottom-up.
- Klasyfikacja obrazów
- Jedna etykieta na obraz, w tym klasyfikacja zero-shot za pomocą CLIP i SigLIP2.
- Detekcja obróconych obiektów
- Obrócone ramki do obrazów lotniczych i dokumentów.
- Detekcja punktów
- Centroidy zamiast ramek. Liczenie i bardzo małe modele.
- Estymacja głębi
- Głębia każdego piksela z pojedynczego obrazu.
- Odtwarzanie obrazów
- Odszumianie, usuwanie rozmycia i skalowanie w górę.
- Usuwanie tła
- Maski alfa do wycinania obiektów.
- OCR
- Detekcja i rozpoznawanie tekstu w jednym przebiegu.
- Rozpoznawanie twarzy
- Embeddingi twarzy i galerie tożsamości.
- Estymacja spojrzenia
- Określanie, gdzie patrzy dana osoba.
- Śledzenie obiektów
- Tożsamości między klatkami wideo, niezależnie od detektora.
- Detekcja z otwartym słownikiem
- Detekcja klas podanych w czasie działania, bez trenowania.
- Segmentacja sterowana promptem
- Segmentacja dowolnego wskazanego obiektu za pomocą SAM i podobnych modeli.
Który model?
Wszystkie modeleZacznij od modelu flagowego, chyba że istnieje powód, aby wybrać inaczej. Każda funkcja jest najpierw projektowana i walidowana na GPU właśnie dla tych modeli, a każda strona zawiera checkpointy, macierz eksportu i informacje o licencjach danej rodziny.
- RF-DETR
- 4 zadań, 19 checkpointów.
- YOLOv9
- Detekcja, 9 checkpointów.
- DEIM
- Detekcja, 13 checkpointów.
- D-FINE
- 2 zadań, 10 checkpointów.
- EdgeCrafter
- 3 zadań, 12 checkpointów.
- RT-DETR
- 2 zadań, 21 checkpointów.
- YOLO-NAS
- 2 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
- ConvNeXt
- Detekcja, 3 checkpointów.
- DINOv2
- 3 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
- Dome-DETR
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- EfficientNetV2
- Detekcja, 4 checkpointów.
- FOMO
- Detekcja, 3 checkpointów.
- LingBot-Vision
- Detekcja, 3 checkpointów.
- MobileNetV4
- Detekcja, 3 checkpointów.
- NAFNet
- Detekcja, 1 checkpoint.
- PicoDet
- Detekcja, 3 checkpointów.
- ResNet
- Detekcja, 4 checkpointów.
- RTMDet
- 2 zadań, 10 checkpointów.
- SegFormer
- Detekcja, 6 checkpointów.
- YOLOv7
- Detekcja, 1 checkpoint.
- YOLOX
- Detekcja, 6 checkpointów.
- AlexNet
- Detekcja, 1 checkpoint.
- BiRefNet
- Detekcja, 1 checkpoint.
- CenterNet
- Detekcja, 2 checkpointów.
- DeepLabv3
- Detekcja, 3 checkpointów.
- Deformable DETR
- Detekcja, 5 checkpointów.
- Depth Anything 3
- Detekcja, 1 checkpoint.
- Depth Anything V2
- Detekcja, 3 checkpointów.
- DETR
- Detekcja, 4 checkpointów.
- DexiNed
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- DINO-DETR
- Detekcja, 3 checkpointów.
- EfficientDet
- Detekcja, 5 checkpointów.
- EoMT
- 3 zadań, 6 checkpointów.
- Faster R-CNN
- Detekcja, 4 checkpointów.
- FCN
- Detekcja, 2 checkpointów.
- FCOS
- Detekcja, 1 checkpoint.
- FeyNobg
- Detekcja, 3 checkpointów.
- HRNet
- Detekcja, 2 checkpointów.
- L2CS-Net
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- LibreFaceRec
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- LW-DETR
- Detekcja, 5 checkpointów.
- Mask R-CNN
- 2 zadań, 1 checkpoint.
- MiDaS
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- MoGe-2
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- PIDNet
- Detekcja, 3 checkpointów.
- PP-OCRv5
- Detekcja, 2 checkpointów.
- Real-ESRGAN
- Detekcja, 3 checkpointów.
- RetinaNet
- Detekcja, 2 checkpointów.
- SAM 3D Body
- Detekcja, 2 checkpointów.
- SSD
- Detekcja, 1 checkpoint.
- Swin Transformer
- Detekcja, 4 checkpointów.
- SwinIR
- Detekcja, 3 checkpointów.
- TEED
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- VGG
- Detekcja, 4 checkpointów.
- ViT
- Detekcja, 4 checkpointów.
- ZipDepth
- Detekcja, 2 checkpointów.
- DeiT
- Detekcja, 3 checkpointów.
- YOLOv1
- Detekcja, 1 checkpoint.
- YOLOv2
- Detekcja, 2 checkpointów.
- YOLOv3
- Detekcja, 3 checkpointów.
- YOLOv4
- Detekcja, 2 checkpointów.
- CLIP
- 2 zadań, 2 checkpointów.
- EdgeTAM
- Detekcja, 1 checkpoint.
- Florence-2
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- Grounding DINO
- Detekcja, 2 checkpointów.
- InternVL3
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- Kosmos-2
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- LFM2-VL
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- LibreMODUS
- 4 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
- LocateAnything
- 2 zadań, wagi rozpowszechniane przez autorów, a nie przez nas.
- MobileSAM
- Detekcja, 1 checkpoint.
- OMDet-Turbo
- Detekcja, 1 checkpoint.
- OV-DEIM
- Detekcja, 3 checkpointów.
- OWLv2
- Detekcja, 2 checkpointów.
- PicoSAM3
- Detekcja, 1 checkpoint.
- Qwen3-VL
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- SAM
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- SAM 2
- Detekcja, 4 checkpointów.
- SAM 3
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
- SenseNova-Vision
- 7 zadań, 1 checkpoint.
- SigLIP2
- 2 zadań, 2 checkpointów.
- SmolVLM2
- Detekcja, wagi rozpowszechniane przez autorów, a nie przez nas.
Zmierzone, nie deklarowane
Vision AnalysisKażda wartość dokładności i opóźnienia w tej dokumentacji pochodzi z opublikowanego przebiegu wraz z informacjami o sprzęcie, środowisku uruchomieniowym i precyzji. Poniższy wykres jest aktualizowany na żywo.
Praca z modelem
- Trenowanie
- Zbiory danych, argumenty, augmentacja, wiele GPU i rejestrowanie eksperymentów.
- Predykcja
- Obrazy, foldery, wideo, kamery internetowe i strumienie RTSP.
- Eksport i wdrożenie
- Dwanaście środowisk docelowych z macierzą obsługi dla każdej rodziny.
- Wiersz poleceń
- Wszystkie możliwości API Pythona bez pisania kodu w Pythonie.
O licencji
Kod LibreYOLO jest objęty licencją MIT. Nie wymaga ona otwarcia kodu aplikacji, nie obejmuje wag modelu i nie zmienia się, gdy sprzedajesz zbudowany produkt. Wstępnie wytrenowane wagi są osobne: każda zachowuje licencję osoby lub organizacji, która ją wytrenowała, a dokumentacja podaje ją dla każdego checkpointu zamiast sprowadzać wszystkie do jednego stwierdzenia. Niektóre wagi są przeznaczone wyłącznie do użytku niekomercyjnego i jest to wyraźnie zaznaczone.