Ultralytics YOLO27:
Get Started

YOLO11 frente a YOLO26#

La rápida evolución de la visión artificial amplía continuamente los límites de la velocidad, la precisión y la eficiencia de implementación. En el ámbito de la detección de objetos en tiempo real, Ultralytics marca el estándar de forma constante. Esta comparación técnica analiza la transición del exitoso YOLO11 al avanzado YOLO26 y examina sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales.

Tanto si estás creando sistemas de entrega con drones como si estás optimizando un flujo de trabajo de fabricación inteligente a escala mundial, conocer las diferencias sutiles entre estos dos modelos te ayudará a crear soluciones de IA robustas y preparadas para el futuro.

Linaje de los modelos y ecosistema#

Ambos modelos se benefician del completo ecosistema de Ultralytics, que se caracteriza por una API sencilla, mantenimiento continuo y una comunidad activa. Ofrecen una versatilidad sin igual y admiten de forma nativa tareas de detección de objetos, segmentación de instancias, clasificación de imágenes, estimación de pose y cuadros delimitadores orientados (OBB).

YOLO11: el estándar consolidado#

Lanzado a finales de 2024, YOLO11 perfeccionó los avances de las generaciones anteriores y se consolidó como una solución fiable y versátil para entornos de producción.

YOLO26: la nueva frontera#

Presentado a principios de 2026, YOLO26 supone un cambio de paradigma en la computación perimetral y la arquitectura integral, con mejoras significativas en la velocidad de procesamiento y la facilidad de integración.

Gestión de datos e implementaciones

YOLO11 y YOLO26 están totalmente integrados con la plataforma de Ultralytics, que ofrece flujos de trabajo sencillos y sin código para anotar conjuntos de datos, entrenar en la nube y supervisar flotas.

Innovaciones arquitectónicas#

Mientras que YOLO11 se basa en métodos tradicionales de posprocesamiento que llevan años impulsando la visión artificial, YOLO26 introduce varios avances estructurales diseñados para eliminar los cuellos de botella.

Diseño integral sin NMS#

Una de las mejoras más importantes de YOLO26 es su arquitectura integral nativa. Su cabezal opcional uno a uno (nms=False) elimina el posprocesamiento de supresión no máxima (NMS), un concepto introducido por primera vez en YOLOv10. Al prescindir de NMS, se simplifica drásticamente el flujo de implementación y se garantiza una latencia uniforme, algo esencial para aplicaciones en tiempo real como los algoritmos de conducción autónoma.

Eliminación de DFL para la optimización en el perímetro#

YOLO26 elimina Distribution Focal Loss (DFL). Aunque DFL resultaba útil en YOLO11 para la localización detallada, su eliminación simplifica el grafo de exportación de la red. Esta modificación mejora la compatibilidad con hardware de bajo consumo y convierte a YOLO26 en una solución excepcional para dispositivos perimetrales como Raspberry Pi o NVIDIA Jetson.

Optimizador MuSGD#

Inspirado en los mecanismos de entrenamiento de los grandes modelos de lenguaje (LLM), concretamente en Kimi K2 de Moonshot AI, YOLO26 utiliza el revolucionario optimizador MuSGD. Esta combinación de descenso de gradiente estocástico (SGD) y Muon permite entrenamientos notablemente estables y converge mucho más rápido que los optimizadores AdamW estándar que se usan en arquitecturas anteriores.

Funciones de pérdida avanzadas#

YOLO26 incorpora ProgLoss + STAL (pérdida progresiva y asignación de etiquetas consciente de objetos pequeños). Esta combinación mejora drásticamente la detección de objetos pequeños y muy juntos. Además, YOLO26 introduce mejoras específicas para cada tarea: pérdida de segmentación semántica y un módulo proto multiescala para la segmentación de instancias, estimación de la verosimilitud logarítmica residual (RLE) para la estimación de poses humanas complejas y una pérdida angular especializada para mitigar problemas en los límites de las tareas de detección OBB.

Comparativa de rendimiento#

Al evaluar estos modelos, el equilibrio entre el número de parámetros, la complejidad computacional (FLOPs) y la velocidad determina la elección del hardware. YOLO26 se centra específicamente en la velocidad de inferencia en CPU y alcanza una inferencia en CPU hasta un 43 % más rápida que su predecesor.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Como se muestra, YOLO26 Nano (YOLO26n) aumenta considerablemente la precisión y reduce el tiempo de inferencia en CPU de 56.1 ms a 38.9 ms con ONNX Runtime.

Exportación para lograr la máxima velocidad

Para exprimir al máximo el rendimiento de estos modelos, expórtalos con TensorRT en hardware NVIDIA o con OpenVINO para CPU Intel. El diseño de YOLO26 sin NMS hace que el proceso de exportación sea más sencillo que nunca.

Casos de uso y aplicaciones reales#

La elección entre YOLO11 y YOLO26 depende en gran medida de tu infraestructura y de los objetivos específicos del proyecto.

Computación perimetral e IoT#

Para aplicaciones con limitaciones de energía y hardware, como la supervisión de la agricultura inteligente mediante drones o los sistemas de alarma de seguridad locales, YOLO26 es el campeón indiscutible. La eliminación de DFL y la mejora del 43 % en la velocidad de CPU permiten ejecutar modelos de visión complejos en dispositivos sin GPU dedicada y mantener altas frecuencias de fotogramas.

Nube y escala empresarial#

YOLO11 sigue siendo una opción excelente para soluciones empresariales en las que las granjas de servidores de gran tamaño ya están optimizadas para sus estructuras tensoriales. Es ideal para el análisis de vídeo en la nube y los flujos de procesamiento de contenido multimedia a gran escala que ya están profundamente integrados con sus formatos de salida específicos.

Multitarea compleja#

Si tu proyecto requiere una precisión milimétrica con objetos pequeños —por ejemplo, detectar defectos en una placa de circuito o seguir vehículos lejanos en imágenes aéreas—, la implementación de ProgLoss + STAL en YOLO26 mejora notablemente la exhaustividad y la precisión en esos casos límite difíciles.

Eficiencia del entrenamiento y requisitos de memoria#

Una de las principales ventajas del marco de Ultralytics es su consumo de memoria extraordinariamente bajo durante el entrenamiento. A diferencia de los enormes Transformer de visión, como RT-DETR, que pueden consumir grandes cantidades de memoria CUDA, tanto YOLO11 como YOLO26 están optimizados para entrenarse de forma eficiente en hardware de consumo.

La integración del optimizador MuSGD en YOLO26 mejora aún más este proceso, ya que permite encontrar antes los pesos óptimos del modelo y reduce el tiempo total de cálculo en GPU y los costes de computación en la nube.

Aquí tienes un ejemplo sencillo que muestra lo fácil que es entrenar el modelo YOLO26 más reciente con la API nativa de Python:

from ultralytics import YOLO

# Inicializa el modelo YOLO26 Nano
model = YOLO("yolo26n.pt")

# Entrena el modelo con el conjunto de datos COCO8
# La selección del optimizador (MuSGD para entrenamientos más largos) y la gestión de memoria se realizan automáticamente
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Ejecuta una validación rápida para comprobar las métricas mAP
metrics = model.val()

# Exporta el modelo entrenado a ONNX para obtener una inferencia rápida en CPU
model.export(format="onnx")

Explora otras arquitecturas#

Aunque YOLO26 representa la cima de la detección en tiempo real, explorar otros modelos de la documentación de Ultralytics puede resultar útil. Para quienes trabajan en entornos heredados, las arquitecturas anteriores, como YOLOv5, siguen ofreciendo un rendimiento robusto. Si necesitas capacidades de aprendizaje de cero disparos y no puedes definir las clases de antemano, YOLO-World ofrece detección de vocabulario abierto basada en indicaciones de texto.

Conclusión#

El salto de YOLO11 a YOLO26 no es una actualización incremental, sino una reformulación estructural del funcionamiento de los modelos de detección de objetos en tiempo real en producción. Al eliminar pasos complejos de posprocesamiento y optimizar la ejecución para el perímetro, YOLO26 destaca como la opción principal para los desarrolladores actuales. Respaldado por el sólido ecosistema de Ultralytics y una documentación completa, actualizar a YOLO26 garantiza implementaciones más rápidas, entrenamientos estables y precisión de última generación en prácticamente cualquier tarea de visión artificial.

Comentarios