YOLO26 frente a YOLOv5#
La evolución de la visión artificial se ha definido por la búsqueda incesante de velocidad, precisión y accesibilidad. Elegir la arquitectura adecuada es fundamental para que cualquier proyecto de IA tenga éxito. En esta guía completa, comparamos dos lanzamientos históricos de Ultralytics: el pionero YOLOv5 y el revolucionario YOLO26. Aunque ambos han influido profundamente en el panorama de la detección de objetos en tiempo real, las tecnologías en las que se basan reflejan un cambio de paradigma enorme en la forma en que las redes neuronales procesan los datos visuales.
Descripción general del modelo#
Antes de profundizar en los matices de la arquitectura, repasemos los aspectos fundamentales de ambos modelos.
Detalles de YOLO26:
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: Documentación de YOLO26
Detalles de YOLOv5:
- Autores: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Documentación: Documentación de YOLOv5
Innovaciones arquitectónicas#
La diferencia de seis años entre YOLOv5 y YOLO26 representa un enorme salto en la investigación del aprendizaje profundo. YOLOv5 popularizó el uso generalizado de PyTorch para modelos de visión y ofreció un mecanismo de detección basado en anclajes y muy optimizado que se convirtió en el estándar del sector. Sin embargo, dependía en gran medida de la supresión no máxima (NMS) durante el posprocesamiento, lo que podía generar cuellos de botella de latencia en dispositivos con recursos limitados.
YOLO26 replantea por completo el flujo de inferencia con un diseño integral sin NMS. Su cabezal opcional uno a uno (nms=False) elimina la necesidad del posprocesamiento con NMS y ofrece una lógica de implementación más rápida y sencilla, un concepto que YOLOv10 introdujo y que aquí alcanza su máximo desarrollo. Además, YOLO26 incorpora la eliminación de DFL (Distribution Focal Loss), que simplifica considerablemente el cabezal de salida. Así, exportar el modelo a formatos como ONNX y TensorRT resulta muy sencillo y garantiza una excelente compatibilidad con dispositivos periféricos y de bajo consumo.
Durante el entrenamiento, YOLO26 emplea el optimizador MuSGD, de última generación, una combinación de SGD y Muon inspirada en Kimi K2 de Moonshot AI. Esto incorpora al ámbito de la visión artificial las innovaciones del entrenamiento de LLM y garantiza un entrenamiento muy estable y una convergencia mucho más rápida que con los optimizadores SGD o AdamW tradicionales que usa YOLOv5.
Rendimiento y métricas#
Al evaluar modelos, el equilibrio entre la precisión media (mAP) y la velocidad de inferencia determina su viabilidad en condiciones reales. YOLO26 está optimizado de forma nativa tanto para GPU de gama alta como para CPU periféricas.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Los resultados de referencia muestran una mejora asombrosa. Por ejemplo, YOLO26n alcanza una mAP de 40,9, frente a 28,0 de YOLOv5n, y YOLO26 ofrece hasta un 43 % más de velocidad de inferencia en CPU que YOLO11n. Esto hace que YOLO26 sea muy superior para implementaciones integradas, como en Raspberry Pi o dispositivos móviles. Aunque YOLOv5 tiene una ligera ventaja en velocidad de GPU con TensorRT en la escala Nano, el equilibrio entre precisión y velocidad favorece claramente a YOLO26.
Ecosistema de entrenamiento y facilidad de uso#
Ambos modelos se benefician enormemente del ecosistema de Ultralytics, que se mantiene activamente. Ofrecen una experiencia que te lleva de cero a experto con una API de Python optimizada, documentación exhaustiva y una comunidad que presta apoyo activo. Sin embargo, YOLO26 lleva la eficiencia del entrenamiento a otro nivel.
Los modelos de Ultralytics requieren sistemáticamente mucha menos memoria CUDA durante el entrenamiento que las alternativas basadas en gran medida en Transformer. YOLO26 mejora aún más este aspecto con sus funciones de pérdida ProgLoss + STAL. Estos avances mejoran notablemente el reconocimiento de objetos pequeños sin aumentar el consumo de memoria.
from ultralytics import YOLO
# Inicializa el modelo YOLO26 Nano de última generación
model = YOLO("yolo26n.pt")
# Entrena el modelo (optimizer='auto' selecciona MuSGD para entrenamientos más largos)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16, device=0)
# Ejecuta inferencia rápida sin NMS en una imagen de prueba
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
predictions[0].show()Este sencillo script permite a los desarrolladores iterar rápidamente con conjuntos de datos personalizados y pasar sin interrupciones de la incorporación de datos a un modelo listo para producción.
Con la plataforma de Ultralytics, puedes exportar automáticamente tus modelos YOLO26 entrenados a formatos como CoreML o LiteRT sin escribir ni una línea de código de conversión.
Versatilidad y casos de uso ideales#
Cuándo usar YOLOv5#
YOLOv5 sigue siendo una opción fiable para sistemas heredados. Si tienes un flujo industrial existente muy vinculado a salidas basadas en anclajes, o si ejecutas inferencias en dispositivos NVIDIA Jetson antiguos con pilas TensorRT consolidadas y congeladas, YOLOv5 ofrece una solución estable y muy bien documentada.
Cuándo usar YOLO26#
YOLO26 es la opción definitiva para los proyectos modernos de visión artificial. Su versatilidad supera con creces la de su predecesor. Mientras que YOLOv5 se centra principalmente en la detección (con la segmentación añadida más adelante), YOLO26 ofrece compatibilidad nativa avanzada con la segmentación de instancias, la estimación de pose, la clasificación de imágenes y las cajas delimitadoras orientadas (OBB).
YOLO26 incorpora mejoras específicas para cada tarea, como una función de pérdida especializada para la segmentación semántica, la estimación del logaritmo de verosimilitud residual (RLE) para obtener puntos clave de pose de precisión ultraalta y una función de pérdida angular avanzada para OBB que resuelve problemas complejos en los límites.
- IoT periférico y robótica: La inferencia opcional sin NMS y una velocidad de inferencia en CPU hasta un 43 % mayor que la de YOLO11n hacen que YOLO26 sea ideal para la navegación robótica en tiempo real y las cámaras domésticas inteligentes.
- Imágenes aéreas: Las mejoras ProgLoss + STAL hacen mucho más fiable la detección de objetos diminutos desde drones, como vehículos en aparcamientos o cultivos en campos agrícolas.
- Análisis de vídeo en tiempo real: Tanto si se trata de seguir a deportistas en retransmisiones como de monitorizar el tráfico, el rendimiento equilibrado de YOLO26 garantiza una alta exhaustividad sin perder fotogramas.
En definitiva, el compromiso de Ultralytics con un ecosistema accesible y de alto rendimiento permite pasar de YOLOv5 a YOLO26 sin complicaciones y pone capacidades de última generación al alcance de investigadores y desarrolladores.