Ultralytics YOLO27:

YOLO26 frente a RTDETRv2#

El panorama de la visión por ordenador evoluciona constantemente y plantea a los profesionales una decisión fundamental: ¿deberías aprovechar Redes neuronales convolucionales (CNNs) altamente optimizadas o adoptar las nuevas arquitecturas basadas en Transformer? Dos contendientes destacados en este ámbito son el vanguardista Ultralytics YOLO26 y el RTDETRv2 de Baidu. Ambos modelos amplían los límites de la detección de objetos en tiempo real, pero se basan en filosofías arquitectónicas fundamentalmente distintas.

Esta guía ofrece un análisis técnico profundo de ambos modelos y compara sus estructuras, métricas de rendimiento y casos de uso ideales para ayudarte a elegir la mejor base para tu próximo proyecto de visión por ordenador.

Ultralytics YOLO26: la cumbre de la IA de visión orientada al edge#

Desarrollado por Ultralytics, YOLO26 representa un enorme salto generacional para la familia YOLO. Lanzado en enero de 2026, está diseñado específicamente para ofrecer velocidad, precisión y un despliegue fluido en entornos cloud y edge.

Innovaciones y fortalezas arquitectónicas#

YOLO26 introduce varias funciones revolucionarias que lo diferencian no solo de los modelos Transformer, sino también de versiones anteriores como YOLO11:

  • Diseño de extremo a extremo sin NMS: YOLO26 elimina la supresión no máxima (NMS) tradicional durante el posprocesamiento. Este enfoque nativo de extremo a extremo, introducido por primera vez en modelos como YOLOv10, reduce la variabilidad de la latencia de inferencia y simplifica la lógica de despliegue, especialmente en hardware edge.
  • Inferencia en CPU hasta un 43 % más rápida: Al reconocer la creciente necesidad de una IA descentralizada, YOLO26 está altamente optimizado para dispositivos sin GPU dedicada, como Raspberry Pi.
  • Eliminación de DFL: Al eliminar Distribution Focal Loss (DFL), YOLO26 ofrece un proceso de exportación simplificado y una compatibilidad mucho mayor con dispositivos edge de bajo consumo y microcontroladores.
  • Optimizador MuSGD: Al conectar el entrenamiento de modelos de lenguaje grandes (LLM) con la visión por ordenador, YOLO26 utiliza el optimizador MuSGD. Esta combinación de SGD y Muon, inspirada en Kimi K2 de Moonshot AI, garantiza una estabilidad de entrenamiento sólida y una convergencia más rápida.
  • ProgLoss + STAL: Las funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños. Esto es fundamental para los sectores que dependen del análisis de imágenes aéreas y de sensores del Internet de las cosas (IoT).

Versatilidad en tareas de visión#

A diferencia de los modelos limitados estrictamente a las cajas delimitadoras, YOLO26 es una solución versátil y potente. Incorpora mejoras específicas para cada tarea, como la pérdida de segmentación semántica y el proto multiescala para la segmentación de instancias, la estimación residual de log-verosimilitud (RLE) para la estimación de poses y una pérdida angular especializada para resolver problemas de límites en tareas de cajas delimitadoras orientadas (OBB).

Estrategia de despliegue en dispositivos edge

Al realizar el despliegue en dispositivos edge, utiliza las variantes YOLO26n (Nano) o YOLO26s (Small). Exportar estos modelos a CoreML o TFLite es sencillo gracias a la eliminación de DFL y a la arquitectura sin NMS, lo que garantiza un rendimiento fluido en tiempo real en iOS y Android.

RTDETRv2: mejora de los Transformer de detección en tiempo real#

RTDETRv2, desarrollado por investigadores de Baidu, se basa en el framework RT-DETR original. Su objetivo es demostrar que los Transformadores de detección (DETRs) pueden competir con las CNN altamente optimizadas, e incluso superar su velocidad y precisión en ocasiones, en escenarios en tiempo real.

Arquitectura y capacidades#

RTDETRv2 emplea una arquitectura basada en Transformer que procesa las imágenes de forma intrínsecamente distinta a las CNN, aprovechando mecanismos de autoatención para comprender el contexto global.

  • Bag-of-Freebies: La versión v2 introduce una serie de técnicas de entrenamiento optimizadas (bag-of-freebies) que mejoran el rendimiento de referencia sin añadir costes de inferencia.
  • Comprensión del contexto global: Gracias a las capas de atención de Transformer, RTDETRv2 comprende de forma natural escenas complejas en las que el contexto global es necesario para distinguir objetos superpuestos u ocultos.

Obtén más información sobre RT-DETR

Limitaciones de los modelos Transformer#

Aunque son potentes, los modelos de detección basados en Transformer, como RTDETRv2, suelen enfrentarse a dificultades en los despliegues prácticos. Por lo general, requieren más memoria CUDA durante el entrenamiento que las CNN eficientes. Además, integrarlos en distintos entornos edge puede resultar complicado debido a las operaciones complejas que requieren las capas de atención, lo que hace que modelos como YOLO26 sean mucho más atractivos para despliegues con recursos limitados.

Comparación de rendimiento#

La evaluación directa de estos modelos revela las ventajas tangibles de las últimas optimizaciones de las CNN. La tabla siguiente muestra su rendimiento en benchmarks estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Como se demuestra, YOLO26 supera sistemáticamente a RTDETRv2 en todas las variantes de tamaño. YOLO26x alcanza unos impresionantes 57,5 mAP con una latencia menor (11,8 ms en TensorRT) y muchos menos parámetros (55,7 M) que RTDETRv2-x (54,3 mAP, 15,03 ms y 76 M de parámetros).

Casos de uso y recomendaciones#

La elección entre YOLO26 y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLO26#

YOLO26 es una opción sólida para:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

Cuándo elegir RT-DETR#

RT-DETR se recomienda para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

La ventaja de Ultralytics#

Elegir la arquitectura de machine learning adecuada es solo una parte de la ecuación; el ecosistema que la rodea determina la rapidez con la que un equipo puede pasar de la creación de prototipos a producción.

Facilidad de uso y eficiencia del entrenamiento#

La API de Python de Ultralytics ofrece una experiencia extraordinariamente optimizada. Entrenar modelos complejos ya no requiere código repetitivo y extenso. Además, la eficiencia de entrenamiento de YOLO26 es considerablemente superior: utiliza mucha menos VRAM de GPU que los mecanismos de atención de RTDETRv2, que consumen mucha memoria, lo que permite usar tamaños de lote mayores incluso en hardware de consumo.

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

Un ecosistema bien mantenido#

Al utilizar modelos de Ultralytics, los desarrolladores obtienen acceso a un framework mantenido activamente que se integra de forma nativa con herramientas modernas de seguimiento como Weights & Biases y Comet ML. Para quienes prefieren un enfoque sin código, la Ultralytics Platform facilita el entrenamiento en la nube, la gestión de datasets y el despliegue con un solo clic.

Equilibrio del rendimiento#

YOLO26 ofrece un equilibrio sin precedentes entre velocidad de inferencia y precisión. La eliminación de NMS, combinada con el optimizador MuSGD, garantiza que despliegues un modelo muy preciso con objetos pequeños (gracias a ProgLoss + STAL) y extremadamente rápido en producción, lo que lo convierte en la opción superior para casi todas las aplicaciones modernas de visión por ordenador.

Otros modelos del ecosistema#

Aunque YOLO26 y RTDETRv2 representan la vanguardia de la detección en tiempo real, los desarrolladores que mantienen pipelines heredados o exploran distintas curvas de eficiencia también pueden considerar YOLOv8 para entornos empresariales consolidados, o explorar otras arquitecturas como EfficientDet. Sin embargo, para cualquier iniciativa nueva, YOLO26 es la recomendación definitiva.

Comentarios