YOLOv8 frente a YOLOv5#
Elegir la arquitectura de visión artificial adecuada es un paso crítico para crear canalizaciones sólidas de aprendizaje automático. En esta comparación técnica detallada, exploramos las diferencias entre dos de los modelos más populares del ecosistema de IA visual: YOLOv8 y YOLOv5. Ambos modelos fueron desarrollados por Ultralytics y han dado forma significativa al panorama de la detección de objetos en tiempo real, estableciendo estándares del sector en velocidad, precisión y facilidad de uso.
Tanto si implementas en dispositivos periféricos como si escalas la inferencia en la nube, comprender los cambios arquitectónicos, las métricas de rendimiento y las metodologías de entrenamiento de estos modelos te ayudará a tomar una decisión informada para tus proyectos de visión artificial.
Ultralytics YOLOv8: el estándar versátil#
Lanzado a principios de 2023, YOLOv8 supuso un cambio arquitectónico importante con respecto a sus predecesores. Se diseñó desde cero para servir como un marco unificado capaz de gestionar de forma nativa múltiples tareas de visión, incluida la segmentación de instancias, la clasificación de imágenes y la estimación de poses.
- Autores: Glenn Jocher, Ayush Chaurasia y Jing Qiu
- Organización: Ultralytics
- Fecha: 2023-01-10
- GitHub: ultralytics/ultralytics
- Documentación: Documentación de YOLOv8
Arquitectura y metodologías#
YOLOv8 introdujo una cabeza de detección sin anclajes, que simplifica el proceso de entrenamiento al eliminar la necesidad de configurar manualmente cajas de anclaje según la distribución del conjunto de datos. Esto hace que el modelo sea más robusto al generalizar a conjuntos de datos personalizados y reduce el número de predicciones de cajas, acelerando la supresión no máxima (NMS).
La arquitectura incorpora un módulo C2f (cuello de botella parcial entre etapas con dos convoluciones), que sustituye al módulo C3 presente en YOLOv5. El módulo C2f mejora el flujo de gradientes y permite al modelo aprender representaciones de características más ricas sin un aumento significativo del coste computacional. Además, YOLOv8 utiliza una estructura de cabeza desacoplada, que separa las tareas de objetividad, clasificación y regresión, lo que ha demostrado mejorar la velocidad de convergencia y la precisión.
Los modelos YOLO de Ultralytics, incluido YOLOv8, están optimizados para consumir menos memoria CUDA durante el entrenamiento que muchas alternativas basadas en Transformer, como RT-DETR. Esto permite a los desarrolladores utilizar tamaños de lote mayores en GPU de consumo estándar, como las de la serie NVIDIA RTX.
Puntos fuertes y débiles#
Ventajas:
- Versatilidad sin igual en múltiples tareas más allá de la simple detección de cajas delimitadoras.
- API de Python optimizada mediante el paquete
ultralytics, que hace que el entrenamiento y la exportación sean muy intuitivos. - Mayor precisión media promedio (mAP) en todas las variantes de tamaño en comparación con YOLOv5.
Desventajas:
- La cabeza desacoplada y el módulo C2f introducen un ligero aumento en el número de parámetros y los FLOPs en algunas variantes en comparación con sus equivalentes exactos de YOLOv5.
Ultralytics YOLOv5: el pionero ágil#
Presentado en 2020, YOLOv5 llevó YOLO al ecosistema de PyTorch, mejorando drásticamente la accesibilidad para los desarrolladores. Se convirtió rápidamente en el estándar del sector para modelos de detección de objetos rápidos, fiables y fáciles de implementar.
- Autor: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: ultralytics/yolov5
- Documentación: Documentación de YOLOv5
Arquitectura y metodologías#
YOLOv5 se basa en una arquitectura basada en anclajes y utiliza un backbone CSPDarknet53 modificado. Aunque los enfoques basados en anclajes requieren agrupar cuidadosamente las cajas delimitadoras del conjunto de datos para definir los anclajes óptimos antes del entrenamiento, son muy eficaces para conjuntos de datos específicos y bien definidos.
YOLOv5 incorpora el módulo C3, que extrae características de forma eficiente manteniendo un número reducido de parámetros. Su función de pérdida depende en gran medida de la pérdida de objetividad, combinada con las pérdidas de clasificación y regresión de cajas delimitadoras, para guiar la red hacia predicciones precisas.
Puntos fuertes y débiles#
Ventajas:
- Extremadamente ligero, lo que hace que las variantes Nano (YOLOv5n) y Small (YOLOv5s) sean muy adecuadas para implementaciones de IA periférica con recursos limitados.
- Velocidades de inferencia excepcionalmente rápidas, especialmente en CPU.
- Un ecosistema muy consolidado, con una gran cantidad de tutoriales de la comunidad e integraciones de terceros.
Desventajas:
- Requiere configurar las cajas de anclaje, lo que puede complicar la preparación de conjuntos de datos muy variados o personalizados.
- Menor precisión general (mAP) en comparación con arquitecturas modernas sin anclajes, como YOLOv8 y YOLO26.
Comparación de rendimiento#
Al evaluar estos modelos, es fundamental lograr un equilibrio favorable entre velocidad y precisión. La tabla siguiente presenta las métricas de rendimiento de ambas arquitecturas, evaluadas en el conjunto de datos COCO. Las velocidades en CPU se midieron mediante ONNX, mientras que las velocidades en GPU se probaron mediante TensorRT.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Aunque YOLOv5 conserva una ligera ventaja en el número de parámetros y en la velocidad absoluta sin procesar de su variante Nano, YOLOv8 ofrece un enorme aumento de mAP en todos los ámbitos, proporcionando un equilibrio de rendimiento mucho mejor para escenarios exigentes de implementación en el mundo real.
Facilidad de uso y ecosistema de Ultralytics#
Una característica definitoria de los modelos modernos de Ultralytics es el ecosistema bien mantenido que los rodea. La transición de YOLOv5 a YOLOv8 introdujo el paquete pip unificado ultralytics, creando una experiencia de usuario muy optimizada.
Los desarrolladores pueden gestionar sin problemas el entrenamiento de modelos, la validación, la predicción y la exportación con tan solo unas líneas de código Python, evitando los complejos scripts de código repetitivo que históricamente se necesitaban en los proyectos de aprendizaje profundo.
from ultralytics import YOLO
# Load a pretrained YOLOv8 model
model = YOLO("yolov8n.pt")
# Train the model on custom data efficiently
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Export the model to ONNX for production deployment
path = model.export(format="onnx")Además, la integración con herramientas como Ultralytics Platform simplifica la gestión de conjuntos de datos, el entrenamiento en la nube y la implementación, garantizando un desarrollo activo y un sólido respaldo de la comunidad.
Casos de uso ideales#
Cuándo elegir YOLOv5: Si mantienes sistemas heredados, ejecutas inferencias en CPU muy limitadas, como la de una Raspberry Pi, o trabajas en un proyecto en el que ahorrar cada fracción de megabyte del tamaño del modelo es fundamental, YOLOv5 sigue siendo una herramienta de trabajo fiable.
Cuándo elegir YOLOv8: Para prácticamente todos los proyectos nuevos que comiencen hoy, se recomienda encarecidamente YOLOv8 frente a YOLOv5. Su arquitectura avanzada gestiona sin esfuerzo el seguimiento complejo, las cajas delimitadoras orientadas (OBB) y la segmentación. Es ideal para aplicaciones modernas que abarcan desde la robótica autónoma hasta el análisis de imágenes médicas y las infraestructuras de ciudades inteligentes.
Aunque YOLOv8 es increíblemente capaz, los desarrolladores que buscan la frontera absoluta del rendimiento deberían considerar YOLO26. Lanzado en 2026, introduce varios avances revolucionarios:
- Diseño de extremo a extremo sin NMS: elimina el posprocesamiento NMS para lograr una implementación más rápida y sencilla, un concepto cuyo pionero fue YOLOv10.
- Optimizador MuSGD: un híbrido de SGD y Muon que lleva las innovaciones del entrenamiento de LLM a la visión artificial, permitiendo un entrenamiento más estable y una convergencia más rápida.
- Hasta un 43 % más de velocidad en inferencia en CPU: optimizado especialmente para entornos de computación periférica sin GPU dedicadas.
- Eliminación de DFL: se ha eliminado Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos periféricos.
- ProgLoss + STAL: funciones de pérdida avanzadas que impulsan mejoras destacables en el reconocimiento de objetos pequeños, algo fundamental para las imágenes aéreas y el IoT.
Al aprovechar la documentación completa y las herramientas proporcionadas por Ultralytics, puedes implementar fácilmente YOLOv8 o explorar el vanguardista YOLO26 para resolver desafíos visuales complejos con una velocidad y precisión sin precedentes. Para seguir aprendiendo, considera consultar nuestras guías sobre ajuste de hiperparámetros y prácticas de implementación de modelos.