Documentación de LibreYOLO
Una API de Python para visión por computador: detección, segmentación, pose, profundidad, OCR y mucho más, con entrenamiento, validación y exportación para cada tarea. El código tiene licencia MIT, así que lo que construyas con él sigue siendo tuyo.
pip install libreyolo- Modelos
- 86 familias, desde los modelos emblemáticos actuales hasta los detectores históricos, bajo una sola factoría
- Tareas
- 17, desde detección hasta estimación de mirada y recuperación de mallas humanas
- Pesos
- 244 checkpoints publicados para las familias documentadas aquí, descargados la primera vez que se usan desde huggingface.co/LibreYOLO
- Exportación
- 12 formatos, desde ONNX hasta TensorRT, CoreML, TFLite y Core AI
- Licencia
- MIT para el código. Los pesos conservan su licencia original, indicada para cada checkpoint
¿Qué quieres hacer?
Todas las tareas- Detección de objetos
- Cajas y clases. La tarea predeterminada y la que admite la mayoría de las familias.
- Segmentación de instancias
- Máscaras por objeto, una máscara por detección.
- Segmentación semántica
- Una clase para cada píxel, sin separar objetos.
- Segmentación panóptica
- Segmentación semántica y de instancias en una sola salida.
- Estimación de pose
- Puntos clave por objeto, de arriba abajo o de abajo arriba.
- Clasificación de imágenes
- Una etiqueta por imagen, incluido zero-shot con CLIP y SigLIP2.
- Detección orientada
- Cajas rotadas para imágenes aéreas y de documentos.
- Detección de puntos
- Centroides en lugar de cajas. Conteo y modelos muy pequeños.
- Estimación de profundidad
- Profundidad por píxel a partir de una sola imagen.
- Restauración de imágenes
- Eliminación de ruido, corrección de desenfoque y reescalado.
- Eliminación de fondo
- Máscaras alfa para recortes.
- OCR
- Detección y reconocimiento de texto en una sola pasada.
- Reconocimiento facial
- Embeddings faciales y galerías de identidades.
- Estimación de la mirada
- Hacia dónde mira una persona.
- Seguimiento de objetos
- Identidades entre fotogramas de vídeo, sobre cualquier detector.
- Detección de vocabulario abierto
- Detecta las clases que indiques durante la ejecución, sin entrenamiento.
- Segmentación con prompts
- Segmenta cualquier cosa que señales, con SAM y modelos afines.
¿Qué modelo?
Todos los modelosEmpieza con un modelo emblemático salvo que tengas un motivo para no hacerlo. Todas las funciones se diseñan y validan en GPU primero con esos modelos, y cada página incluye los checkpoints, la matriz de exportación y las licencias de esa familia.
- RF-DETR
- 4 tareas, 19 checkpoints.
- YOLOv9
- Detección, 9 checkpoints.
- DEIM
- Detección, 13 checkpoints.
- D-FINE
- 2 tareas, 10 checkpoints.
- EdgeCrafter
- 3 tareas, 12 checkpoints.
- RT-DETR
- 2 tareas, 21 checkpoints.
- YOLO-NAS
- 2 tareas, pesos distribuidos por sus autores, no por nosotros.
- ConvNeXt
- Detección, 3 checkpoints.
- DINOv2
- 3 tareas, pesos distribuidos por sus autores, no por nosotros.
- Dome-DETR
- Detección, pesos distribuidos por sus autores, no por nosotros.
- EfficientNetV2
- Detección, 4 checkpoints.
- FOMO
- Detección, 3 checkpoints.
- LingBot-Vision
- Detección, 3 checkpoints.
- MobileNetV4
- Detección, 3 checkpoints.
- NAFNet
- Detección, 1 checkpoint.
- PicoDet
- Detección, 3 checkpoints.
- ResNet
- Detección, 4 checkpoints.
- RTMDet
- 2 tareas, 10 checkpoints.
- SegFormer
- Detección, 6 checkpoints.
- YOLOv7
- Detección, 1 checkpoint.
- YOLOX
- Detección, 6 checkpoints.
- AlexNet
- Detección, 1 checkpoint.
- BiRefNet
- Detección, 1 checkpoint.
- CenterNet
- Detección, 2 checkpoints.
- DeepLabv3
- Detección, 3 checkpoints.
- Deformable DETR
- Detección, 5 checkpoints.
- Depth Anything 3
- Detección, 1 checkpoint.
- Depth Anything V2
- Detección, 3 checkpoints.
- DETR
- Detección, 4 checkpoints.
- DexiNed
- Detección, pesos distribuidos por sus autores, no por nosotros.
- DINO-DETR
- Detección, 3 checkpoints.
- EfficientDet
- Detección, 5 checkpoints.
- EoMT
- 3 tareas, 6 checkpoints.
- Faster R-CNN
- Detección, 4 checkpoints.
- FCN
- Detección, 2 checkpoints.
- FCOS
- Detección, 1 checkpoint.
- FeyNobg
- Detección, 3 checkpoints.
- HRNet
- Detección, 2 checkpoints.
- L2CS-Net
- Detección, pesos distribuidos por sus autores, no por nosotros.
- LibreFaceRec
- Detección, pesos distribuidos por sus autores, no por nosotros.
- LW-DETR
- Detección, 5 checkpoints.
- Mask R-CNN
- 2 tareas, 1 checkpoint.
- MiDaS
- Detección, pesos distribuidos por sus autores, no por nosotros.
- MoGe-2
- Detección, pesos distribuidos por sus autores, no por nosotros.
- PIDNet
- Detección, 3 checkpoints.
- PP-OCRv5
- Detección, 2 checkpoints.
- Real-ESRGAN
- Detección, 3 checkpoints.
- RetinaNet
- Detección, 2 checkpoints.
- SAM 3D Body
- Detección, 2 checkpoints.
- SSD
- Detección, 1 checkpoint.
- Swin Transformer
- Detección, 4 checkpoints.
- SwinIR
- Detección, 3 checkpoints.
- TEED
- Detección, pesos distribuidos por sus autores, no por nosotros.
- VGG
- Detección, 4 checkpoints.
- ViT
- Detección, 4 checkpoints.
- ZipDepth
- Detección, 2 checkpoints.
- DeiT
- Detección, 3 checkpoints.
- YOLOv1
- Detección, 1 checkpoint.
- YOLOv2
- Detección, 2 checkpoints.
- YOLOv3
- Detección, 3 checkpoints.
- YOLOv4
- Detección, 2 checkpoints.
- CLIP
- 2 tareas, 2 checkpoints.
- EdgeTAM
- Detección, 1 checkpoint.
- Florence-2
- Detección, pesos distribuidos por sus autores, no por nosotros.
- Grounding DINO
- Detección, 2 checkpoints.
- InternVL3
- Detección, pesos distribuidos por sus autores, no por nosotros.
- Kosmos-2
- Detección, pesos distribuidos por sus autores, no por nosotros.
- LFM2-VL
- Detección, pesos distribuidos por sus autores, no por nosotros.
- LibreMODUS
- 4 tareas, pesos distribuidos por sus autores, no por nosotros.
- LocateAnything
- 2 tareas, pesos distribuidos por sus autores, no por nosotros.
- MobileSAM
- Detección, 1 checkpoint.
- OMDet-Turbo
- Detección, 1 checkpoint.
- OV-DEIM
- Detección, 3 checkpoints.
- OWLv2
- Detección, 2 checkpoints.
- PicoSAM3
- Detección, 1 checkpoint.
- Qwen3-VL
- Detección, pesos distribuidos por sus autores, no por nosotros.
- SAM
- Detección, pesos distribuidos por sus autores, no por nosotros.
- SAM 2
- Detección, 4 checkpoints.
- SAM 3
- Detección, pesos distribuidos por sus autores, no por nosotros.
- SenseNova-Vision
- 7 tareas, 1 checkpoint.
- SigLIP2
- 2 tareas, 2 checkpoints.
- SmolVLM2
- Detección, pesos distribuidos por sus autores, no por nosotros.
Medido, no declarado
Vision AnalysisTodas las cifras de precisión y latencia de esta documentación proceden de una ejecución que publicamos, junto con el hardware, el runtime y la precisión numérica registrados. El gráfico siguiente muestra datos en vivo.
Trabajar con un modelo
- Entrenar
- Datasets, argumentos, aumento de datos, multi-GPU y registradores de experimentos.
- Predecir
- Imágenes, carpetas, vídeo, cámaras web y streams RTSP.
- Exportar y desplegar
- Doce destinos, con una matriz de compatibilidad por familia.
- Línea de comandos
- Todo lo que hace la API de Python, sin escribir Python.
Sobre la licencia
El código de LibreYOLO tiene licencia MIT. No exige que publiques el código fuente de tu aplicación, no afecta a los pesos de tu modelo y no cambia si vendes lo que construyes. Los pesos preentrenados son independientes: cada uno conserva la licencia de quien lo entrenó, y la documentación lo indica para cada checkpoint en lugar de generalizarlo en una afirmación. Algunos no permiten el uso comercial, y se indica con claridad.