LibreYOLO-Dokumentation

Eine Python-API für Computer Vision: Erkennung, Segmentierung, Pose, Tiefe, OCR und mehr, jeweils mit Training, Validierung und Export. Der Code steht unter der MIT-Lizenz, deshalb bleibt das, was du damit baust, deins.

install
pip install libreyolo
Modelle
86 Familien, von den aktuellen Flaggschiffen bis zu den historischen Detektoren, hinter einer Factory
Aufgaben
17, von der Erkennung bis zur Blickrichtungsschätzung und Rekonstruktion menschlicher 3D-Netze
Gewichte
244 veröffentlichte Checkpoints für die hier dokumentierten Familien, bei der ersten Verwendung von huggingface.co/LibreYOLO heruntergeladen
Export
12 Formate, von ONNX über TensorRT, CoreML und TFLite bis Core AI
Lizenz
MIT für den Code. Gewichte tragen ihre Upstream-Lizenz, die für jeden Checkpoint angegeben ist

Was möchtest du tun?

Alle Aufgaben
Objekterkennung
Boxen und Klassen. Die Standardaufgabe, die von den meisten Familien unterstützt wird.
Instanzsegmentierung
Masken pro Objekt, eine Maske pro Erkennung.
Semantische Segmentierung
Eine Klasse für jedes Pixel, ohne Objekte zu trennen.
Panoptische Segmentierung
Semantische Segmentierung und Instanzsegmentierung in einer Ausgabe.
Posenschätzung
Keypoints pro Objekt, Top-down oder Bottom-up.
Bildklassifikation
Ein Label pro Bild, einschließlich Zero-Shot mit CLIP und SigLIP2.
Orientierte Objekterkennung
Gedrehte Boxen für Luft- und Dokumentbilder.
Punkterkennung
Schwerpunkte statt Boxen. Zum Zählen und für sehr kleine Modelle.
Tiefenschätzung
Tiefe pro Pixel aus einem einzigen Bild.
Bildrestaurierung
Rauschen entfernen, Unschärfe korrigieren und hochskalieren.
Hintergrundentfernung
Alpha-Matten zum Freistellen.
OCR
Textlokalisierung und -erkennung in einem Durchlauf.
Gesichtserkennung
Gesichts-Embeddings und Identitätsgalerien.
Blickrichtungsschätzung
Wohin eine Person schaut.
Objekt-Tracking
Identitäten über Videoframes hinweg, mit jedem Detektor.
Open-Vocabulary-Erkennung
Erkenne zur Laufzeit benannte Klassen ohne Training.
Promptbasierte Segmentierung
Segmentiere mit SAM und ähnlichen Modellen alles, worauf du zeigst.

Welches Modell?

Alle Modelle

Beginne mit einem Flaggschiff, sofern nichts dagegenspricht. Jede Funktion wird zuerst für diese Modelle entwickelt und auf GPUs validiert. Jede Seite enthält die Checkpoints, die Exportmatrix und die Lizenzierung der jeweiligen Familie.

RF-DETR
4 Aufgaben, 19 Checkpoints.
YOLOv9
Erkennung, 9 Checkpoints.
DEIM
Erkennung, 13 Checkpoints.
D-FINE
2 Aufgaben, 10 Checkpoints.
EdgeCrafter
3 Aufgaben, 12 Checkpoints.
RT-DETR
2 Aufgaben, 21 Checkpoints.
YOLO-NAS
2 Aufgaben, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
ConvNeXt
Erkennung, 3 Checkpoints.
DINOv2
3 Aufgaben, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
Dome-DETR
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
EfficientNetV2
Erkennung, 4 Checkpoints.
FOMO
Erkennung, 3 Checkpoints.
LingBot-Vision
Erkennung, 3 Checkpoints.
MobileNetV4
Erkennung, 3 Checkpoints.
NAFNet
Erkennung, 1 Checkpoint.
PicoDet
Erkennung, 3 Checkpoints.
ResNet
Erkennung, 4 Checkpoints.
RTMDet
2 Aufgaben, 10 Checkpoints.
SegFormer
Erkennung, 6 Checkpoints.
YOLOv7
Erkennung, 1 Checkpoint.
YOLOX
Erkennung, 6 Checkpoints.
AlexNet
Erkennung, 1 Checkpoint.
BiRefNet
Erkennung, 1 Checkpoint.
CenterNet
Erkennung, 2 Checkpoints.
DeepLabv3
Erkennung, 3 Checkpoints.
Deformable DETR
Erkennung, 5 Checkpoints.
Depth Anything 3
Erkennung, 1 Checkpoint.
Depth Anything V2
Erkennung, 3 Checkpoints.
DETR
Erkennung, 4 Checkpoints.
DexiNed
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
DINO-DETR
Erkennung, 3 Checkpoints.
EfficientDet
Erkennung, 5 Checkpoints.
EoMT
3 Aufgaben, 6 Checkpoints.
Faster R-CNN
Erkennung, 4 Checkpoints.
FCN
Erkennung, 2 Checkpoints.
FCOS
Erkennung, 1 Checkpoint.
FeyNobg
Erkennung, 3 Checkpoints.
HRNet
Erkennung, 2 Checkpoints.
L2CS-Net
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
LibreFaceRec
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
LW-DETR
Erkennung, 5 Checkpoints.
Mask R-CNN
2 Aufgaben, 1 Checkpoint.
MiDaS
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
MoGe-2
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
PIDNet
Erkennung, 3 Checkpoints.
PP-OCRv5
Erkennung, 2 Checkpoints.
Real-ESRGAN
Erkennung, 3 Checkpoints.
RetinaNet
Erkennung, 2 Checkpoints.
SAM 3D Body
Erkennung, 2 Checkpoints.
SSD
Erkennung, 1 Checkpoint.
Swin Transformer
Erkennung, 4 Checkpoints.
SwinIR
Erkennung, 3 Checkpoints.
TEED
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
VGG
Erkennung, 4 Checkpoints.
ViT
Erkennung, 4 Checkpoints.
ZipDepth
Erkennung, 2 Checkpoints.
DeiT
Erkennung, 3 Checkpoints.
YOLOv1
Erkennung, 1 Checkpoint.
YOLOv2
Erkennung, 2 Checkpoints.
YOLOv3
Erkennung, 3 Checkpoints.
YOLOv4
Erkennung, 2 Checkpoints.
CLIP
2 Aufgaben, 2 Checkpoints.
EdgeTAM
Erkennung, 1 Checkpoint.
Florence-2
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
Grounding DINO
Erkennung, 2 Checkpoints.
InternVL3
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
Kosmos-2
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
LFM2-VL
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
LibreMODUS
4 Aufgaben, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
LocateAnything
2 Aufgaben, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
MobileSAM
Erkennung, 1 Checkpoint.
OMDet-Turbo
Erkennung, 1 Checkpoint.
OV-DEIM
Erkennung, 3 Checkpoints.
OWLv2
Erkennung, 2 Checkpoints.
PicoSAM3
Erkennung, 1 Checkpoint.
Qwen3-VL
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
SAM
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
SAM 2
Erkennung, 4 Checkpoints.
SAM 3
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.
SenseNova-Vision
7 Aufgaben, 1 Checkpoint.
SigLIP2
2 Aufgaben, 2 Checkpoints.
SmolVLM2
Erkennung, Gewichte werden von ihren Autoren verbreitet, nicht von uns.

Gemessen, nicht behauptet

Vision Analysis

Jeder Accuracy- und Latenzwert in dieser Dokumentation stammt aus einem von uns veröffentlichten Lauf, zusammen mit Angaben zu Hardware, Runtime und Precision. Das Diagramm unten ist live.

Mit einem Modell arbeiten

Training
Datensätze, Argumente, Augmentierung, Multi-GPU und Experiment-Logger.
Vorhersage
Bilder, Ordner, Videos, Webcams und RTSP-Streams.
Export und Deployment
Zwölf Ziele mit einer Supportmatrix pro Familie.
Kommandozeile
Alles, was die Python-API kann, ohne Python zu schreiben.

Zur Lizenz

Der Code von LibreYOLO steht unter der MIT-Lizenz. Du musst den Quellcode deiner Anwendung nicht offenlegen, die Lizenz erstreckt sich nicht auf deine Modellgewichte, und daran ändert sich nichts, wenn du dein Produkt verkaufst. Vortrainierte Gewichte sind davon getrennt: Jedes trägt die Lizenz der Person oder Organisation, die es trainiert hat. Die Dokumentation gibt sie für jeden Checkpoint einzeln an, statt sie zu einer pauschalen Aussage zusammenzufassen. Einige sind nicht kommerziell nutzbar, und das wird ausdrücklich angegeben.

So funktioniert die Lizenzierung hier

Diese Dokumentation beschreibt LibreYOLO v1.5.0. Die Dokumentation früherer Releases bleibt unter /docs/versions verfügbar.