Documentación de LibreYOLO

Una API de Python para visión por computador: detección, segmentación, pose, profundidad, OCR y mucho más, con entrenamiento, validación y exportación para cada tarea. El código tiene licencia MIT, así que lo que construyas con él sigue siendo tuyo.

instalación
pip install libreyolo
Modelos
86 familias, desde los modelos emblemáticos actuales hasta los detectores históricos, bajo una sola factoría
Tareas
17, desde detección hasta estimación de mirada y recuperación de mallas humanas
Pesos
244 checkpoints publicados para las familias documentadas aquí, descargados la primera vez que se usan desde huggingface.co/LibreYOLO
Exportación
12 formatos, desde ONNX hasta TensorRT, CoreML, TFLite y Core AI
Licencia
MIT para el código. Los pesos conservan su licencia original, indicada para cada checkpoint

¿Qué quieres hacer?

Todas las tareas
Detección de objetos
Cajas y clases. La tarea predeterminada y la que admite la mayoría de las familias.
Segmentación de instancias
Máscaras por objeto, una máscara por detección.
Segmentación semántica
Una clase para cada píxel, sin separar objetos.
Segmentación panóptica
Segmentación semántica y de instancias en una sola salida.
Estimación de pose
Puntos clave por objeto, de arriba abajo o de abajo arriba.
Clasificación de imágenes
Una etiqueta por imagen, incluido zero-shot con CLIP y SigLIP2.
Detección orientada
Cajas rotadas para imágenes aéreas y de documentos.
Detección de puntos
Centroides en lugar de cajas. Conteo y modelos muy pequeños.
Estimación de profundidad
Profundidad por píxel a partir de una sola imagen.
Restauración de imágenes
Eliminación de ruido, corrección de desenfoque y reescalado.
Eliminación de fondo
Máscaras alfa para recortes.
OCR
Detección y reconocimiento de texto en una sola pasada.
Reconocimiento facial
Embeddings faciales y galerías de identidades.
Estimación de la mirada
Hacia dónde mira una persona.
Seguimiento de objetos
Identidades entre fotogramas de vídeo, sobre cualquier detector.
Detección de vocabulario abierto
Detecta las clases que indiques durante la ejecución, sin entrenamiento.
Segmentación con prompts
Segmenta cualquier cosa que señales, con SAM y modelos afines.

¿Qué modelo?

Todos los modelos

Empieza con un modelo emblemático salvo que tengas un motivo para no hacerlo. Todas las funciones se diseñan y validan en GPU primero con esos modelos, y cada página incluye los checkpoints, la matriz de exportación y las licencias de esa familia.

RF-DETR
4 tareas, 19 checkpoints.
YOLOv9
Detección, 9 checkpoints.
DEIM
Detección, 13 checkpoints.
D-FINE
2 tareas, 10 checkpoints.
EdgeCrafter
3 tareas, 12 checkpoints.
RT-DETR
2 tareas, 21 checkpoints.
YOLO-NAS
2 tareas, pesos distribuidos por sus autores, no por nosotros.
ConvNeXt
Detección, 3 checkpoints.
DINOv2
3 tareas, pesos distribuidos por sus autores, no por nosotros.
Dome-DETR
Detección, pesos distribuidos por sus autores, no por nosotros.
EfficientNetV2
Detección, 4 checkpoints.
FOMO
Detección, 3 checkpoints.
LingBot-Vision
Detección, 3 checkpoints.
MobileNetV4
Detección, 3 checkpoints.
NAFNet
Detección, 1 checkpoint.
PicoDet
Detección, 3 checkpoints.
ResNet
Detección, 4 checkpoints.
RTMDet
2 tareas, 10 checkpoints.
SegFormer
Detección, 6 checkpoints.
YOLOv7
Detección, 1 checkpoint.
YOLOX
Detección, 6 checkpoints.
AlexNet
Detección, 1 checkpoint.
BiRefNet
Detección, 1 checkpoint.
CenterNet
Detección, 2 checkpoints.
DeepLabv3
Detección, 3 checkpoints.
Deformable DETR
Detección, 5 checkpoints.
Depth Anything 3
Detección, 1 checkpoint.
Depth Anything V2
Detección, 3 checkpoints.
DETR
Detección, 4 checkpoints.
DexiNed
Detección, pesos distribuidos por sus autores, no por nosotros.
DINO-DETR
Detección, 3 checkpoints.
EfficientDet
Detección, 5 checkpoints.
EoMT
3 tareas, 6 checkpoints.
Faster R-CNN
Detección, 4 checkpoints.
FCN
Detección, 2 checkpoints.
FCOS
Detección, 1 checkpoint.
FeyNobg
Detección, 3 checkpoints.
HRNet
Detección, 2 checkpoints.
L2CS-Net
Detección, pesos distribuidos por sus autores, no por nosotros.
LibreFaceRec
Detección, pesos distribuidos por sus autores, no por nosotros.
LW-DETR
Detección, 5 checkpoints.
Mask R-CNN
2 tareas, 1 checkpoint.
MiDaS
Detección, pesos distribuidos por sus autores, no por nosotros.
MoGe-2
Detección, pesos distribuidos por sus autores, no por nosotros.
PIDNet
Detección, 3 checkpoints.
PP-OCRv5
Detección, 2 checkpoints.
Real-ESRGAN
Detección, 3 checkpoints.
RetinaNet
Detección, 2 checkpoints.
SAM 3D Body
Detección, 2 checkpoints.
SSD
Detección, 1 checkpoint.
Swin Transformer
Detección, 4 checkpoints.
SwinIR
Detección, 3 checkpoints.
TEED
Detección, pesos distribuidos por sus autores, no por nosotros.
VGG
Detección, 4 checkpoints.
ViT
Detección, 4 checkpoints.
ZipDepth
Detección, 2 checkpoints.
DeiT
Detección, 3 checkpoints.
YOLOv1
Detección, 1 checkpoint.
YOLOv2
Detección, 2 checkpoints.
YOLOv3
Detección, 3 checkpoints.
YOLOv4
Detección, 2 checkpoints.
CLIP
2 tareas, 2 checkpoints.
EdgeTAM
Detección, 1 checkpoint.
Florence-2
Detección, pesos distribuidos por sus autores, no por nosotros.
Grounding DINO
Detección, 2 checkpoints.
InternVL3
Detección, pesos distribuidos por sus autores, no por nosotros.
Kosmos-2
Detección, pesos distribuidos por sus autores, no por nosotros.
LFM2-VL
Detección, pesos distribuidos por sus autores, no por nosotros.
LibreMODUS
4 tareas, pesos distribuidos por sus autores, no por nosotros.
LocateAnything
2 tareas, pesos distribuidos por sus autores, no por nosotros.
MobileSAM
Detección, 1 checkpoint.
OMDet-Turbo
Detección, 1 checkpoint.
OV-DEIM
Detección, 3 checkpoints.
OWLv2
Detección, 2 checkpoints.
PicoSAM3
Detección, 1 checkpoint.
Qwen3-VL
Detección, pesos distribuidos por sus autores, no por nosotros.
SAM
Detección, pesos distribuidos por sus autores, no por nosotros.
SAM 2
Detección, 4 checkpoints.
SAM 3
Detección, pesos distribuidos por sus autores, no por nosotros.
SenseNova-Vision
7 tareas, 1 checkpoint.
SigLIP2
2 tareas, 2 checkpoints.
SmolVLM2
Detección, pesos distribuidos por sus autores, no por nosotros.

Medido, no declarado

Vision Analysis

Todas las cifras de precisión y latencia de esta documentación proceden de una ejecución que publicamos, junto con el hardware, el runtime y la precisión numérica registrados. El gráfico siguiente muestra datos en vivo.

Trabajar con un modelo

Entrenar
Datasets, argumentos, aumento de datos, multi-GPU y registradores de experimentos.
Predecir
Imágenes, carpetas, vídeo, cámaras web y streams RTSP.
Exportar y desplegar
Doce destinos, con una matriz de compatibilidad por familia.
Línea de comandos
Todo lo que hace la API de Python, sin escribir Python.

Sobre la licencia

El código de LibreYOLO tiene licencia MIT. No exige que publiques el código fuente de tu aplicación, no afecta a los pesos de tu modelo y no cambia si vendes lo que construyes. Los pesos preentrenados son independientes: cada uno conserva la licencia de quien lo entrenó, y la documentación lo indica para cada checkpoint en lugar de generalizarlo en una afirmación. Algunos no permiten el uso comercial, y se indica con claridad.

Cómo funcionan las licencias aquí

Esta documentación describe LibreYOLO v1.5.0. La documentación de versiones anteriores sigue disponible en /docs/versions.