Ultralytics YOLO27:

RTDETRv2 frente a YOLO26#

El panorama de la detección de objetos en tiempo real ha evolucionado drásticamente, y los investigadores amplían continuamente los límites de la velocidad, la precisión y la eficiencia de despliegue. Dos de las arquitecturas más destacadas que lideran actualmente este avance son la arquitectura basada en Transformer RTDETRv2 y la Red Neuronal Convolucional (CNN) de última generación, Ultralytics YOLO26. Esta guía ofrece un análisis detallado de sus arquitecturas, métricas de rendimiento y casos de uso ideales para ayudarte a elegir el modelo adecuado para tu próximo proyecto de visión artificial.

RTDETRv2: Transformers de detección en tiempo real#

RTDETRv2 se basa en la arquitectura original de RT-DETR y busca combinar la capacidad de los Transformers de visión para comprender el contexto global con la velocidad necesaria para las aplicaciones en tiempo real.

Características principales:

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
  • Organización: Baidu
  • Fecha: 2024-07-24
  • Enlaces: Arxiv, GitHub, Documentación

Arquitectura y puntos fuertes#

A diferencia de los detectores tradicionales basados en anchors, RTDETRv2 utiliza un enfoque basado en Transformer que elimina de forma nativa la necesidad de aplicar la supresión de no máximos (NMS) durante el posprocesamiento. Gracias a un mecanismo de atención flexible, el modelo es muy eficaz a la hora de comprender escenas complejas y objetos superpuestos. Sus mejoras «Bag-of-Freebies» han aumentado significativamente su precisión en el conjunto de datos COCO, manteniendo velocidades de inferencia aceptables en GPU de gama alta.

Limitaciones#

Aunque RTDETRv2 logra resultados académicos impresionantes, a menudo plantea dificultades en entornos de producción. Las arquitecturas Transformer requieren inherentemente más memoria tanto durante el entrenamiento como durante la inferencia que las CNN. Esto puede dificultar el despliegue en dispositivos de IA en el borde con recursos limitados. Además, el entrenamiento de Transformers suele requerir tamaños de lote mayores y más memoria CUDA, lo que puede convertirse en un cuello de botella para los investigadores con hardware limitado.

Aprende más sobre RTDETRv2

YOLO26: La cima de la IA de visión orientada al edge#

Lanzado a principios de 2026, Ultralytics YOLO26 redefine lo que es posible con la detección de objetos basada en CNN. Incorpora optimizaciones de vanguardia diseñadas específicamente para permitir un despliegue fluido en producción y una eficiencia extrema del hardware.

Características principales:

Avances arquitectónicos#

YOLO26 introduce varias funciones revolucionarias que resuelven problemas habituales del despliegue de modelos:

  • Diseño de extremo a extremo sin NMS: Basándose en conceptos pioneros de YOLOv10, YOLO26 es nativamente de extremo a extremo. Al eliminar el posprocesamiento NMS, reduce drásticamente la variabilidad de la latencia y garantiza tiempos de inferencia muy predecibles en producción.
  • Hasta un 43 % más de velocidad de inferencia en CPU: Gracias a refinamientos arquitectónicos estratégicos y a la eliminación de la pérdida focal de distribución (DFL), YOLO26 alcanza velocidades de CPU sin precedentes, lo que lo convierte en la opción ideal para la computación en el borde sin GPU dedicadas.
  • Optimizador MuSGD: Inspirado en técnicas de entrenamiento de modelos de lenguaje grandes (LLM), como Kimi K2 de Moonshot AI, YOLO26 utiliza el optimizador MuSGD (una combinación de SGD y Muon). Esto garantiza entrenamientos muy estables y una convergencia increíblemente rápida.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, una actualización esencial para aplicaciones que utilizan imágenes aéreas y vigilancia mediante drones.
Mejoras específicas por tarea en YOLO26

Además de la detección estándar, YOLO26 incluye mejoras especializadas: pérdida de segmentación semántica y proto multiescala para tareas de segmentación, estimación residual de log-verosimilitud (RLE) para la estimación de poses y una pérdida de ángulo personalizada para resolver problemas de límites en la detección de cajas delimitadoras orientadas (OBB).

Comparación de rendimiento#

Al evaluar estos modelos, es fundamental lograr un equilibrio sólido entre el rendimiento, la precisión (mAP) y la eficiencia computacional. La tabla siguiente muestra cómo YOLO26 supera sistemáticamente a RTDETRv2 en distintas variantes de tamaño.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Como se muestra arriba, el modelo YOLO26x alcanza unos impresionantes 57,5 mAP, superando ampliamente al modelo RTDETRv2-x, utilizando menos parámetros y manteniendo una mayor velocidad de inferencia con TensorRT. Además, los requisitos de memoria de YOLO26 son notablemente inferiores, lo que lo convierte en la opción óptima para despliegues edge en tiempo real.

Ecosistema y facilidad de uso#

Aunque el rendimiento bruto es vital, el ecosistema que rodea al modelo determina la rapidez con la que puede pasar de la investigación a la producción. Aquí es donde la plataforma Ultralytics ofrece una ventaja inigualable.

Un ecosistema unificado y bien mantenido#

RTDETRv2 funciona principalmente como un repositorio de nivel de investigación, lo que puede requerir configuraciones de entorno complejas y scripts manuales para tareas personalizadas. En cambio, Ultralytics YOLO26 se beneficia de un paquete Python maduro y sometido a numerosas pruebas. El ecosistema Ultralytics ofrece una experiencia de usuario increíblemente optimizada, con una API sencilla para el entrenamiento, la validación, la predicción y la exportación.

Gracias a las integraciones incorporadas con Weights & Biases y Comet ML, el seguimiento de experimentos es fluido. Además, los modelos de Ultralytics son muy versátiles: mientras que RTDETRv2 se centra en la detección de objetos, YOLO26 admite de forma nativa la segmentación de instancias, la estimación de poses y la clasificación de imágenes dentro del mismo framework.

Ejemplo de código: la sencillez en acción#

La API de Ultralytics permite a los desarrolladores cargar modelos, entrenarlos y ejecutar inferencias con solo unas pocas líneas de código. Esto mejora notablemente la eficiencia del entrenamiento y reduce el tiempo de comercialización.

from ultralytics import RTDETR, YOLO

# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the YOLO26 results
results_yolo[0].show()

# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")

Casos de uso y recomendaciones#

La elección entre RT-DETR y YOLO26 depende de los requisitos específicos de tu proyecto, las restricciones de despliegue y tus preferencias respecto al ecosistema.

Cuándo elegir RT-DETR#

RT-DETR es una buena opción para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir YOLO26#

YOLO26 se recomienda para:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

Exploración de otras arquitecturas#

Mientras que YOLO26 representa la cúspide actual del rendimiento, los desarrolladores también pueden encontrar valor en explorar iteraciones anteriores. El exitoso YOLO11 sigue siendo un modelo robusto y totalmente compatible para una variedad de sistemas heredados. Puedes profundizar en sus capacidades leyendo nuestra comparativa entre RT-DETR y YOLO11. Además, si estás analizando arquitecturas más antiguas, consultar la comparativa entre EfficientDet y YOLO26 ofrece un gran contexto histórico sobre lo mucho que han avanzado las arquitecturas de detección de objetos.

Conclusiones finales#

Tanto RTDETRv2 como YOLO26 ofrecen avances increíbles en el campo de la IA. Sin embargo, para los equipos que priorizan una transición fluida a producción, una huella de memoria mínima y una amplia versatilidad de tareas, Ultralytics YOLO26 es la recomendación clara. Su arquitectura sin NMS, sus rápidas velocidades en CPU y el respaldo del sólido ecosistema Ultralytics garantizan que tus proyectos de IA de visión sigan siendo escalables, eficientes y preparados para el futuro. Tanto si lo despliegas en un servidor en la nube como en una Raspberry Pi con recursos limitados, YOLO26 ofrece un rendimiento sin concesiones desde el primer momento.

Comentarios