YOLO26 frente a YOLOv5#
La evolución de la visión artificial se ha definido por la búsqueda incansable de velocidad, precisión y accesibilidad. Elegir la arquitectura adecuada es fundamental para el éxito de cualquier proyecto de IA. En esta guía completa, comparamos dos lanzamientos monumentales de Ultralytics: el pionero YOLOv5 y el revolucionario YOLO26. Aunque ambos han influido enormemente en el panorama de la detección de objetos en tiempo real, sus tecnologías subyacentes reflejan un cambio de paradigma masivo en la forma en que las redes neuronales procesan los datos visuales.
Descripción general de los modelos#
Antes de profundizar en los matices arquitectónicos, establezcamos los detalles fundamentales de ambos modelos.
Detalles de YOLO26:
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: Documentación de YOLO26
Detalles de YOLOv5:
- Autores: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Documentación: Documentación de YOLOv5
Innovaciones arquitectónicas#
La diferencia de seis años entre YOLOv5 y YOLO26 representa un salto enorme en la investigación sobre aprendizaje profundo. YOLOv5 popularizó el uso generalizado de PyTorch para modelos de visión, al ofrecer un mecanismo de detección basado en anchors y altamente optimizado que se convirtió en el estándar del sector. Sin embargo, dependía en gran medida de la supresión de no máximos (NMS) durante el posprocesamiento, lo que podía introducir cuellos de botella de latencia en dispositivos con recursos limitados.
YOLO26 rediseña por completo la canalización de inferencia con un diseño de extremo a extremo sin NMS. Al eliminar la necesidad del posprocesamiento NMS, YOLO26 ofrece una lógica de despliegue más rápida y sencilla, un concepto pionero de YOLOv10 que aquí se ha perfeccionado. Además, YOLO26 incorpora la eliminación de DFL (pérdida focal de distribución), que simplifica drásticamente la cabeza de salida. Esto hace que exportar el modelo a formatos como ONNX y TensorRT sea increíblemente sencillo y garantiza una excelente compatibilidad con dispositivos edge y de bajo consumo.
Durante el entrenamiento, YOLO26 emplea el avanzado optimizador MuSGD, una combinación de SGD y Muon inspirada en Kimi K2 de Moonshot AI. Esto incorpora innovaciones del entrenamiento de LLM al ámbito de la visión artificial, lo que garantiza un entrenamiento muy estable y una convergencia significativamente más rápida en comparación con los optimizadores SGD o AdamW tradicionales utilizados en YOLOv5.
Rendimiento y métricas#
Al evaluar modelos, el equilibrio entre la precisión media promedio (mAP) y la velocidad de inferencia determina su viabilidad en el mundo real. YOLO26 está optimizado de forma nativa tanto para GPU de gama alta como para CPU edge.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Los benchmarks revelan una mejora espectacular. Por ejemplo, YOLO26n alcanza un mAP de 40.9 frente al 28.0 de YOLOv5n, al tiempo que ofrece hasta un 43 % más de velocidad de inferencia en CPU. Esto convierte a YOLO26 en una opción muy superior para despliegues integrados como Raspberry Pi o dispositivos móviles. Aunque YOLOv5 mantiene una ligera ventaja en velocidad de GPU con TensorRT en la escala Nano, el equilibrio entre precisión y rendimiento favorece claramente a YOLO26.
Ecosistema de entrenamiento y facilidad de uso#
Ambos modelos se benefician enormemente del ecosistema de Ultralytics, que recibe un mantenimiento constante. Ofrecen una experiencia de «cero a héroe» con una API de Python optimizada, documentación extensa y soporte activo de la comunidad. Sin embargo, YOLO26 lleva la eficiencia del entrenamiento a un nuevo nivel.
Los modelos de Ultralytics requieren sistemáticamente mucha menos memoria CUDA durante el entrenamiento que las alternativas con gran uso de Transformer. YOLO26 amplifica esta ventaja con sus funciones de pérdida ProgLoss + STAL. Estos avances mejoran notablemente el reconocimiento de objetos pequeños sin aumentar excesivamente la memoria necesaria.
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model with the MuSGD optimizer (default for YOLO26)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Run fast, NMS-free inference on a test image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()Este sencillo script permite a los desarrolladores iterar rápidamente sobre conjuntos de datos personalizados, pasando sin complicaciones de la ingesta de datos a un modelo listo para producción.
Con la plataforma de Ultralytics, puedes exportar automáticamente tus modelos YOLO26 entrenados a formatos como CoreML o TensorFlow Lite sin escribir una sola línea de código de conversión.
Versatilidad y casos de uso ideales#
Cuándo usar YOLOv5#
YOLOv5 sigue siendo un caballo de batalla fiable para sistemas heredados. Si tienes una canalización industrial existente estrechamente vinculada a salidas basadas en anchors, o si ejecutas inferencias en dispositivos NVIDIA Jetson antiguos con pilas de TensorRT maduras y congeladas, YOLOv5 ofrece una solución estable y ampliamente documentada.
Cuándo usar YOLO26#
YOLO26 es la opción definitiva para los proyectos modernos de visión artificial. Su versatilidad supera con creces a la de su predecesor. Mientras que YOLOv5 se centra principalmente en la detección (con incorporaciones posteriores de segmentación), YOLO26 ofrece compatibilidad nativa y profunda con la segmentación de instancias, la estimación de poses, la clasificación de imágenes y las cajas delimitadoras orientadas (OBB).
YOLO26 introduce mejoras específicas para cada tarea, como una función de pérdida especializada para la segmentación semántica, la estimación de log-verosimilitud residual (RLE) para puntos clave de pose ultraprecisos y una función de pérdida angular avanzada para OBB que resuelve problemas complejos relacionados con los límites.
- IoT edge y robótica: La arquitectura sin NMS y la inferencia en CPU un 43 % más rápida hacen que YOLO26 sea ideal para la navegación robótica en tiempo real y las cámaras domésticas inteligentes.
- Imágenes aéreas: Las mejoras ProgLoss + STAL hacen que la detección de objetos diminutos desde drones —como vehículos en aparcamientos o cultivos en campos agrícolas— sea mucho más fiable.
- Análisis de vídeo en tiempo real: Ya sea para seguir a atletas en retransmisiones deportivas o supervisar flujos de tráfico, el equilibrio de rendimiento de YOLO26 garantiza un recall alto sin perder fotogramas.
En última instancia, el compromiso de Ultralytics con un ecosistema accesible y de alto rendimiento garantiza que la transición de YOLOv5 a YOLO26 sea sencilla, y permite a investigadores y desarrolladores acceder por igual a capacidades de vanguardia.