YOLO11 frente a YOLO26#
La rápida evolución de la visión por computador amplía continuamente los límites de la velocidad, la precisión y la eficiencia del despliegue. En el ámbito de la detección de objetos en tiempo real, Ultralytics establece constantemente el estándar. Esta comparación técnica analiza la transición de YOLO11, de gran éxito, a YOLO26, de vanguardia, examinando sus arquitecturas, métricas de rendimiento y escenarios de despliegue ideales.
Tanto si estás desarrollando sistemas de entrega con drones como si estás optimizando una cadena global de fabricación inteligente, comprender las diferencias sutiles entre estos dos modelos te ayudará a crear soluciones de IA robustas y preparadas para el futuro.
Linaje de los modelos y ecosistema#
Ambos modelos se benefician del completo ecosistema de Ultralytics, caracterizado por su API sencilla, mantenimiento continuo y una comunidad activa. Ofrecen una versatilidad incomparable y admiten de forma nativa tareas de detección de objetos, segmentación de instancias, clasificación de imágenes, estimación de poses y cajas delimitadoras orientadas (OBB).
YOLO11: el estándar consolidado#
Lanzado a finales de 2024, YOLO11 perfeccionó los avances de generaciones anteriores y consolidó su posición como una herramienta de trabajo fiable para entornos de producción.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: Documentación de YOLO11
YOLO26: la nueva frontera#
Presentado a principios de 2026, YOLO26 representa un cambio de paradigma en la computación perimetral y la arquitectura de extremo a extremo, con mejoras significativas en la velocidad de procesamiento y la facilidad de integración.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2026-01-14
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: Documentación de YOLO26
YOLO11 y YOLO26 están totalmente integrados con la Plataforma de Ultralytics, que ofrece flujos de trabajo fluidos y sin código para anotar conjuntos de datos, entrenar en la nube y monitorizar flotas.
Innovaciones arquitectónicas#
Mientras que YOLO11 depende de métodos tradicionales de posprocesamiento que han impulsado la visión por computador durante años, YOLO26 introduce varios avances estructurales diseñados para eliminar los cuellos de botella.
Diseño de extremo a extremo sin NMS#
Una de las mejoras más importantes de YOLO26 es su arquitectura nativa de extremo a extremo. Elimina el posprocesamiento de supresión de no máximos (NMS), un concepto introducido originalmente en YOLOv10. Prescindir de NMS simplifica drásticamente la cadena de despliegue y garantiza una latencia uniforme, algo esencial para aplicaciones en tiempo real como los algoritmos de conducción autónoma.
Eliminación de DFL para la optimización en el perímetro#
YOLO26 elimina la pérdida focal de distribución (DFL). Aunque DFL resultaba útil en YOLO11 para la localización detallada, eliminarlo simplifica el grafo de exportación de la red. Esta modificación garantiza una mayor compatibilidad con hardware de bajo consumo, lo que convierte a YOLO26 en una solución excepcional para dispositivos perimetrales como Raspberry Pi o NVIDIA Jetson.
Optimizador MuSGD#
Inspirándose en los mecanismos de entrenamiento de los modelos de lenguaje de gran tamaño (LLM), concretamente en Kimi K2 de Moonshot AI, YOLO26 utiliza el revolucionario optimizador MuSGD. Esta combinación del descenso de gradiente estocástico (SGD) y Muon proporciona ejecuciones de entrenamiento extraordinariamente estables y converge mucho más rápido que los optimizadores AdamW estándar utilizados en arquitecturas anteriores.
Funciones de pérdida avanzadas#
YOLO26 incorpora ProgLoss + STAL (Progressive Loss y Small-Target-Aware Label Assignment). Esta combinación mejora drásticamente la detección de objetos pequeños y densamente apiñados. Además, YOLO26 introduce mejoras específicas para tareas: un prototipo multiescala dedicado para la segmentación semántica, Residual Log-Likelihood Estimation (RLE) para estimaciones de posturas humanas complejas y una pérdida de ángulo especializada para mitigar problemas de límites en tareas de detección OBB.
Comparación de rendimiento#
Al evaluar estos modelos, el equilibrio entre el número de parámetros, la complejidad computacional (FLOPs) y la velocidad determina la selección del hardware. YOLO26 está orientado específicamente a la velocidad de inferencia en CPU y alcanza hasta un 43 % más de velocidad de inferencia en CPU que su predecesor.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Como se muestra, YOLO26 Nano (YOLO26n) aumenta considerablemente la precisión y reduce el tiempo de inferencia en CPU de 56,1 ms a 38,9 ms mediante ONNX Runtime.
Casos de uso y aplicaciones reales#
La elección entre YOLO11 y YOLO26 depende en gran medida de tu infraestructura específica y de los objetivos de tu proyecto.
Computación perimetral e IoT#
Para aplicaciones limitadas por la energía y el hardware, como la supervisión de la agricultura inteligente mediante drones o los sistemas locales de alarma de seguridad, YOLO26 es el campeón indiscutible. La eliminación de DFL y el aumento del 43 % en la velocidad de la CPU permiten ejecutar modelos de visión complejos en dispositivos sin GPU dedicadas, manteniendo al mismo tiempo altas frecuencias de imagen.
Nube y escala empresarial#
YOLO11 sigue siendo una opción excelente para soluciones empresariales donde las granjas de servidores masivas ya están optimizadas para sus estructuras de tensores. Sirve perfectamente para el análisis de vídeo basado en la nube y las canalizaciones de procesamiento de medios a gran escala que ya están profundamente integradas con sus formatos de salida específicos.
Multitarea compleja#
Si tu proyecto requiere una precisión milimétrica con objetos pequeños —como detectar defectos en una placa de circuitos o rastrear vehículos lejanos en imágenes aéreas—, la implementación de ProgLoss + STAL en YOLO26 proporciona una mejora apreciable del recall y la precisión en esos casos límite difíciles.
Eficiencia del entrenamiento y requisitos de memoria#
Una ventaja importante del marco de Ultralytics es su huella de memoria increíblemente baja durante el entrenamiento. A diferencia de los transformadores de visión masivos como RT-DETR, que pueden consumir grandes cantidades de memoria CUDA, tanto YOLO11 como YOLO26 están optimizados para entrenar de manera eficiente en hardware de grado de consumo.
La integración del optimizador MuSGD en YOLO26 mejora aún más esto al garantizar que el modelo encuentre los pesos óptimos más rápido, lo que reduce las horas totales de cómputo de GPU y los costes de cloud computing.
Este es un ejemplo sencillo que muestra lo fácil que resulta entrenar el modelo YOLO26 más reciente mediante la API nativa de Python:
from ultralytics import YOLO
# Initialize the YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset
# The MuSGD optimizer and efficient memory management are handled automatically
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Run a quick validation to verify the mAP metrics
metrics = model.val()
# Export the trained model to ONNX for fast CPU inference
model.export(format="onnx")Exploración de arquitecturas alternativas#
Aunque YOLO26 representa la cumbre de la detección en tiempo real, explorar otros modelos de la documentación de Ultralytics puede resultar beneficioso. Para usuarios vinculados a entornos antiguos, arquitecturas anteriores como YOLOv5 siguen ofreciendo un rendimiento sólido. Para capacidades de zero-shot en las que no es posible definir las clases de antemano, YOLO-World ofrece detección de vocabulario abierto basada en indicaciones de texto.
Conclusión#
El salto de YOLO11 a YOLO26 no es una simple actualización incremental, sino una reinterpretación estructural del funcionamiento de los modelos de detección de objetos en tiempo real en producción. Al eliminar pasos complejos de posprocesamiento y optimizar la ejecución priorizando el perímetro, YOLO26 destaca como la opción preferente para los desarrolladores modernos. Respaldado por el sólido ecosistema de Ultralytics y una documentación completa, actualizar a YOLO26 garantiza despliegues más rápidos, un entrenamiento estable y una precisión SOTA para prácticamente cualquier tarea de visión por computador.