Documentação do LibreYOLO

Uma única API Python para visão computacional: detecção, segmentação, pose, profundidade, OCR e muito mais, com treinamento, validação e exportação para cada tarefa. O código tem licença MIT, então o que você criar com ele continua sendo seu.

instalação
pip install libreyolo
Modelos
86 famílias, dos carros-chefe atuais aos detectores históricos, por trás de uma única fábrica
Tarefas
17, da detecção à estimativa de olhar e à recuperação de malha humana
Pesos
244 checkpoints publicados para as famílias documentadas aqui, baixados no primeiro uso de huggingface.co/LibreYOLO
Exportação
12 formatos, de ONNX a TensorRT, CoreML, TFLite e Core AI
Licença
MIT para o código. Os pesos mantêm a licença original, indicada para cada checkpoint

O que você quer fazer?

Todas as tarefas
Detecção de objetos
Bounding boxes e classes. A tarefa padrão, atendida pela maioria das famílias.
Segmentação de instâncias
Máscaras por objeto, uma máscara por detecção.
Segmentação semântica
Uma classe para cada pixel, sem separar os objetos.
Segmentação panóptica
Segmentação semântica e de instâncias em uma única saída.
Estimativa de pose
Keypoints por objeto, de cima para baixo ou de baixo para cima.
Classificação de imagens
Uma label por imagem, incluindo zero-shot com CLIP e SigLIP2.
Detecção orientada
Bounding boxes rotacionados, para imagens aéreas e de documentos.
Detecção de pontos
Centroides em vez de bounding boxes. Contagem e modelos muito pequenos.
Estimativa de profundidade
Profundidade por pixel a partir de uma única imagem.
Restauração de imagens
Remoção de ruído, de desfoque e aumento de escala (upscaling).
Remoção de fundo
Máscaras alfa para recortes.
OCR
Detecção e reconhecimento de texto em uma única passagem.
Reconhecimento facial
Embeddings faciais e galerias de identidades.
Estimativa do olhar
Para onde uma pessoa está olhando.
Rastreamento de objetos
Identidades ao longo dos quadros do vídeo, sobre qualquer detector.
Detecção de vocabulário aberto
Detecte as classes que você nomear em runtime, sem treinamento.
Segmentação por prompt
Segmente qualquer coisa que você indicar, com SAM e modelos semelhantes.

Qual modelo?

Todos os modelos

Comece com um carro-chefe, a menos que tenha um motivo para escolher outro. Todos os recursos são projetados e validados em GPU primeiro nesses modelos, e cada página traz os checkpoints, a matriz de exportação e as licenças da família.

RF-DETR
4 tarefas, 19 checkpoints.
YOLOv9
Detecção, 9 checkpoints.
DEIM
Detecção, 13 checkpoints.
D-FINE
2 tarefas, 10 checkpoints.
EdgeCrafter
3 tarefas, 12 checkpoints.
RT-DETR
2 tarefas, 21 checkpoints.
YOLO-NAS
2 tarefas, pesos distribuídos pelos autores, não por nós.
ConvNeXt
Detecção, 3 checkpoints.
DINOv2
3 tarefas, pesos distribuídos pelos autores, não por nós.
Dome-DETR
Detecção, pesos distribuídos pelos autores, não por nós.
EfficientNetV2
Detecção, 4 checkpoints.
FOMO
Detecção, 3 checkpoints.
LingBot-Vision
Detecção, 3 checkpoints.
MobileNetV4
Detecção, 3 checkpoints.
NAFNet
Detecção, 1 checkpoint.
PicoDet
Detecção, 3 checkpoints.
ResNet
Detecção, 4 checkpoints.
RTMDet
2 tarefas, 10 checkpoints.
SegFormer
Detecção, 6 checkpoints.
YOLOv7
Detecção, 1 checkpoint.
YOLOX
Detecção, 6 checkpoints.
AlexNet
Detecção, 1 checkpoint.
BiRefNet
Detecção, 1 checkpoint.
CenterNet
Detecção, 2 checkpoints.
DeepLabv3
Detecção, 3 checkpoints.
Deformable DETR
Detecção, 5 checkpoints.
Depth Anything 3
Detecção, 1 checkpoint.
Depth Anything V2
Detecção, 3 checkpoints.
DETR
Detecção, 4 checkpoints.
DexiNed
Detecção, pesos distribuídos pelos autores, não por nós.
DINO-DETR
Detecção, 3 checkpoints.
EfficientDet
Detecção, 5 checkpoints.
EoMT
3 tarefas, 6 checkpoints.
Faster R-CNN
Detecção, 4 checkpoints.
FCN
Detecção, 2 checkpoints.
FCOS
Detecção, 1 checkpoint.
FeyNobg
Detecção, 3 checkpoints.
HRNet
Detecção, 2 checkpoints.
L2CS-Net
Detecção, pesos distribuídos pelos autores, não por nós.
LibreFaceRec
Detecção, pesos distribuídos pelos autores, não por nós.
LW-DETR
Detecção, 5 checkpoints.
Mask R-CNN
2 tarefas, 1 checkpoint.
MiDaS
Detecção, pesos distribuídos pelos autores, não por nós.
MoGe-2
Detecção, pesos distribuídos pelos autores, não por nós.
PIDNet
Detecção, 3 checkpoints.
PP-OCRv5
Detecção, 2 checkpoints.
Real-ESRGAN
Detecção, 3 checkpoints.
RetinaNet
Detecção, 2 checkpoints.
SAM 3D Body
Detecção, 2 checkpoints.
SSD
Detecção, 1 checkpoint.
Swin Transformer
Detecção, 4 checkpoints.
SwinIR
Detecção, 3 checkpoints.
TEED
Detecção, pesos distribuídos pelos autores, não por nós.
VGG
Detecção, 4 checkpoints.
ViT
Detecção, 4 checkpoints.
ZipDepth
Detecção, 2 checkpoints.
DeiT
Detecção, 3 checkpoints.
YOLOv1
Detecção, 1 checkpoint.
YOLOv2
Detecção, 2 checkpoints.
YOLOv3
Detecção, 3 checkpoints.
YOLOv4
Detecção, 2 checkpoints.
CLIP
2 tarefas, 2 checkpoints.
EdgeTAM
Detecção, 1 checkpoint.
Florence-2
Detecção, pesos distribuídos pelos autores, não por nós.
Grounding DINO
Detecção, 2 checkpoints.
InternVL3
Detecção, pesos distribuídos pelos autores, não por nós.
Kosmos-2
Detecção, pesos distribuídos pelos autores, não por nós.
LFM2-VL
Detecção, pesos distribuídos pelos autores, não por nós.
LibreMODUS
4 tarefas, pesos distribuídos pelos autores, não por nós.
LocateAnything
2 tarefas, pesos distribuídos pelos autores, não por nós.
MobileSAM
Detecção, 1 checkpoint.
OMDet-Turbo
Detecção, 1 checkpoint.
OV-DEIM
Detecção, 3 checkpoints.
OWLv2
Detecção, 2 checkpoints.
PicoSAM3
Detecção, 1 checkpoint.
Qwen3-VL
Detecção, pesos distribuídos pelos autores, não por nós.
SAM
Detecção, pesos distribuídos pelos autores, não por nós.
SAM 2
Detecção, 4 checkpoints.
SAM 3
Detecção, pesos distribuídos pelos autores, não por nós.
SenseNova-Vision
7 tarefas, 1 checkpoint.
SigLIP2
2 tarefas, 2 checkpoints.
SmolVLM2
Detecção, pesos distribuídos pelos autores, não por nós.

Medido, não alegado

Vision Analysis

Todos os números de acurácia e latência desta documentação vêm de uma execução que publicamos, acompanhados do hardware, runtime e precisão usados. O gráfico abaixo é atualizado ao vivo.

Como trabalhar com um modelo

Treinar
Datasets, argumentos, data augmentation, multi-GPU e registradores de experimentos.
Predizer
Imagens, pastas, vídeo, webcams e streams RTSP.
Exportar e fazer deploy
Doze destinos, com uma matriz de compatibilidade por família.
Linha de comando
Tudo o que a API Python faz, sem escrever Python.

Sobre a licença

O código do LibreYOLO é MIT. Ele não exige que você abra o código do seu aplicativo, não alcança os pesos do seu modelo e não muda se você vender o que criar. Os pesos pré-treinados são separados: cada um mantém a licença de quem o treinou, e a documentação informa isso para cada checkpoint em vez de transformar tudo em uma alegação genérica. Alguns não permitem uso comercial, e isso é indicado claramente.

Como as licenças funcionam aqui

Esta documentação descreve o LibreYOLO v1.5.0. A documentação de versões anteriores continua disponível em /docs/versions.