Documentação do LibreYOLO
Uma única API Python para visão computacional: detecção, segmentação, pose, profundidade, OCR e muito mais, com treinamento, validação e exportação para cada tarefa. O código tem licença MIT, então o que você criar com ele continua sendo seu.
pip install libreyolo- Modelos
- 86 famílias, dos carros-chefe atuais aos detectores históricos, por trás de uma única fábrica
- Tarefas
- 17, da detecção à estimativa de olhar e à recuperação de malha humana
- Pesos
- 244 checkpoints publicados para as famílias documentadas aqui, baixados no primeiro uso de huggingface.co/LibreYOLO
- Exportação
- 12 formatos, de ONNX a TensorRT, CoreML, TFLite e Core AI
- Licença
- MIT para o código. Os pesos mantêm a licença original, indicada para cada checkpoint
O que você quer fazer?
Todas as tarefas- Detecção de objetos
- Bounding boxes e classes. A tarefa padrão, atendida pela maioria das famílias.
- Segmentação de instâncias
- Máscaras por objeto, uma máscara por detecção.
- Segmentação semântica
- Uma classe para cada pixel, sem separar os objetos.
- Segmentação panóptica
- Segmentação semântica e de instâncias em uma única saída.
- Estimativa de pose
- Keypoints por objeto, de cima para baixo ou de baixo para cima.
- Classificação de imagens
- Uma label por imagem, incluindo zero-shot com CLIP e SigLIP2.
- Detecção orientada
- Bounding boxes rotacionados, para imagens aéreas e de documentos.
- Detecção de pontos
- Centroides em vez de bounding boxes. Contagem e modelos muito pequenos.
- Estimativa de profundidade
- Profundidade por pixel a partir de uma única imagem.
- Restauração de imagens
- Remoção de ruído, de desfoque e aumento de escala (upscaling).
- Remoção de fundo
- Máscaras alfa para recortes.
- OCR
- Detecção e reconhecimento de texto em uma única passagem.
- Reconhecimento facial
- Embeddings faciais e galerias de identidades.
- Estimativa do olhar
- Para onde uma pessoa está olhando.
- Rastreamento de objetos
- Identidades ao longo dos quadros do vídeo, sobre qualquer detector.
- Detecção de vocabulário aberto
- Detecte as classes que você nomear em runtime, sem treinamento.
- Segmentação por prompt
- Segmente qualquer coisa que você indicar, com SAM e modelos semelhantes.
Qual modelo?
Todos os modelosComece com um carro-chefe, a menos que tenha um motivo para escolher outro. Todos os recursos são projetados e validados em GPU primeiro nesses modelos, e cada página traz os checkpoints, a matriz de exportação e as licenças da família.
- RF-DETR
- 4 tarefas, 19 checkpoints.
- YOLOv9
- Detecção, 9 checkpoints.
- DEIM
- Detecção, 13 checkpoints.
- D-FINE
- 2 tarefas, 10 checkpoints.
- EdgeCrafter
- 3 tarefas, 12 checkpoints.
- RT-DETR
- 2 tarefas, 21 checkpoints.
- YOLO-NAS
- 2 tarefas, pesos distribuídos pelos autores, não por nós.
- ConvNeXt
- Detecção, 3 checkpoints.
- DINOv2
- 3 tarefas, pesos distribuídos pelos autores, não por nós.
- Dome-DETR
- Detecção, pesos distribuídos pelos autores, não por nós.
- EfficientNetV2
- Detecção, 4 checkpoints.
- FOMO
- Detecção, 3 checkpoints.
- LingBot-Vision
- Detecção, 3 checkpoints.
- MobileNetV4
- Detecção, 3 checkpoints.
- NAFNet
- Detecção, 1 checkpoint.
- PicoDet
- Detecção, 3 checkpoints.
- ResNet
- Detecção, 4 checkpoints.
- RTMDet
- 2 tarefas, 10 checkpoints.
- SegFormer
- Detecção, 6 checkpoints.
- YOLOv7
- Detecção, 1 checkpoint.
- YOLOX
- Detecção, 6 checkpoints.
- AlexNet
- Detecção, 1 checkpoint.
- BiRefNet
- Detecção, 1 checkpoint.
- CenterNet
- Detecção, 2 checkpoints.
- DeepLabv3
- Detecção, 3 checkpoints.
- Deformable DETR
- Detecção, 5 checkpoints.
- Depth Anything 3
- Detecção, 1 checkpoint.
- Depth Anything V2
- Detecção, 3 checkpoints.
- DETR
- Detecção, 4 checkpoints.
- DexiNed
- Detecção, pesos distribuídos pelos autores, não por nós.
- DINO-DETR
- Detecção, 3 checkpoints.
- EfficientDet
- Detecção, 5 checkpoints.
- EoMT
- 3 tarefas, 6 checkpoints.
- Faster R-CNN
- Detecção, 4 checkpoints.
- FCN
- Detecção, 2 checkpoints.
- FCOS
- Detecção, 1 checkpoint.
- FeyNobg
- Detecção, 3 checkpoints.
- HRNet
- Detecção, 2 checkpoints.
- L2CS-Net
- Detecção, pesos distribuídos pelos autores, não por nós.
- LibreFaceRec
- Detecção, pesos distribuídos pelos autores, não por nós.
- LW-DETR
- Detecção, 5 checkpoints.
- Mask R-CNN
- 2 tarefas, 1 checkpoint.
- MiDaS
- Detecção, pesos distribuídos pelos autores, não por nós.
- MoGe-2
- Detecção, pesos distribuídos pelos autores, não por nós.
- PIDNet
- Detecção, 3 checkpoints.
- PP-OCRv5
- Detecção, 2 checkpoints.
- Real-ESRGAN
- Detecção, 3 checkpoints.
- RetinaNet
- Detecção, 2 checkpoints.
- SAM 3D Body
- Detecção, 2 checkpoints.
- SSD
- Detecção, 1 checkpoint.
- Swin Transformer
- Detecção, 4 checkpoints.
- SwinIR
- Detecção, 3 checkpoints.
- TEED
- Detecção, pesos distribuídos pelos autores, não por nós.
- VGG
- Detecção, 4 checkpoints.
- ViT
- Detecção, 4 checkpoints.
- ZipDepth
- Detecção, 2 checkpoints.
- DeiT
- Detecção, 3 checkpoints.
- YOLOv1
- Detecção, 1 checkpoint.
- YOLOv2
- Detecção, 2 checkpoints.
- YOLOv3
- Detecção, 3 checkpoints.
- YOLOv4
- Detecção, 2 checkpoints.
- CLIP
- 2 tarefas, 2 checkpoints.
- EdgeTAM
- Detecção, 1 checkpoint.
- Florence-2
- Detecção, pesos distribuídos pelos autores, não por nós.
- Grounding DINO
- Detecção, 2 checkpoints.
- InternVL3
- Detecção, pesos distribuídos pelos autores, não por nós.
- Kosmos-2
- Detecção, pesos distribuídos pelos autores, não por nós.
- LFM2-VL
- Detecção, pesos distribuídos pelos autores, não por nós.
- LibreMODUS
- 4 tarefas, pesos distribuídos pelos autores, não por nós.
- LocateAnything
- 2 tarefas, pesos distribuídos pelos autores, não por nós.
- MobileSAM
- Detecção, 1 checkpoint.
- OMDet-Turbo
- Detecção, 1 checkpoint.
- OV-DEIM
- Detecção, 3 checkpoints.
- OWLv2
- Detecção, 2 checkpoints.
- PicoSAM3
- Detecção, 1 checkpoint.
- Qwen3-VL
- Detecção, pesos distribuídos pelos autores, não por nós.
- SAM
- Detecção, pesos distribuídos pelos autores, não por nós.
- SAM 2
- Detecção, 4 checkpoints.
- SAM 3
- Detecção, pesos distribuídos pelos autores, não por nós.
- SenseNova-Vision
- 7 tarefas, 1 checkpoint.
- SigLIP2
- 2 tarefas, 2 checkpoints.
- SmolVLM2
- Detecção, pesos distribuídos pelos autores, não por nós.
Medido, não alegado
Vision AnalysisTodos os números de acurácia e latência desta documentação vêm de uma execução que publicamos, acompanhados do hardware, runtime e precisão usados. O gráfico abaixo é atualizado ao vivo.
Como trabalhar com um modelo
- Treinar
- Datasets, argumentos, data augmentation, multi-GPU e registradores de experimentos.
- Predizer
- Imagens, pastas, vídeo, webcams e streams RTSP.
- Exportar e fazer deploy
- Doze destinos, com uma matriz de compatibilidade por família.
- Linha de comando
- Tudo o que a API Python faz, sem escrever Python.
Sobre a licença
O código do LibreYOLO é MIT. Ele não exige que você abra o código do seu aplicativo, não alcança os pesos do seu modelo e não muda se você vender o que criar. Os pesos pré-treinados são separados: cada um mantém a licença de quem o treinou, e a documentação informa isso para cada checkpoint em vez de transformar tudo em uma alegação genérica. Alguns não permitem uso comercial, e isso é indicado claramente.