Benchmarks de LibreYOLO
COCO
Precisión frente a tamaño
Cuánta precisión aporta cada arquitectura para su número de parámetros. El gráfico procede de visionanalysis.org, un proyecto hermano de LibreYOLO donde los modelos se miden en COCO, en latencia sobre hardware real y en el benchmark RF100-VL.
RF100-VL
¿Sobrevive algo de eso al contacto con tus datos?
Una cifra de COCO rara vez es la puntuación que acabas obteniendo. Es un indicio de esa puntuación, porque la mayoría de los proyectos parten de pesos preentrenados en COCO y hacen fine-tuning a partir de ellos, y es la referencia común que permite comparar artículos. Eso tiene valor, pero no es lo que realmente estás adquiriendo.
Lo que estás adquiriendo es capacidad de generalización: si la arquitectura, los pesos preentrenados y la receta de entrenamiento siguen funcionando bien con datos que no se parecen en nada a COCO. Por eso Roboflow creó RF100-VL. Un modelo obtiene su puntuación tras entrenarse con 100 datasets reales, uno por uno. Algunos le dan miles de objetos por imagen; otros, apenas unas docenas de imágenes de las que aprender. Pastillas en una cinta transportadora, radiografías de tórax, fichas de mahjong, ácaros varroa, humo de incendios forestales.
Úsalo como un dato más entre varios al elegir un modelo, junto con la latencia, la licencia y cuánto quieras pelearte con el código de entrenamiento. No es una clasificación que se pueda leer empezando por arriba.
Latencia
¿Es lo bastante rápido en tu hardware?
La precisión no cambia con el hardware. La velocidad varía en dos órdenes de magnitud entre una GPU de centro de datos y una Raspberry Pi, así que la única cifra que importa es la medida en la placa en la que vas a desplegar.