Ultralytics YOLO27:
Get Started

YOLO26 frente a RTDETRv2#

El campo de la visión artificial evoluciona constantemente y plantea a los profesionales una decisión crucial: ¿deberían aprovechar las redes neuronales convolucionales (CNN) altamente optimizadas o adoptar las nuevas arquitecturas basadas en Transformer? Dos destacados contendientes en este ámbito son el vanguardista Ultralytics YOLO26 y el RTDETRv2 de Baidu. Ambos modelos llevan al límite la detección de objetos en tiempo real, pero se basan en filosofías arquitectónicas fundamentalmente distintas.

Esta guía profundiza en los aspectos técnicos de ambos modelos y compara sus estructuras, métricas de rendimiento y casos de uso ideales para ayudarte a elegir la mejor base para tu próximo proyecto de visión artificial.

Ultralytics YOLO26: la máxima expresión de la IA de visión diseñada para dispositivos periféricos#

Desarrollado por Ultralytics, YOLO26 supone un enorme salto generacional para la familia YOLO. Lanzado en enero de 2026, está diseñado específicamente para ofrecer velocidad, precisión e implementación fluida en entornos en la nube y periféricos.

Innovaciones y puntos fuertes de la arquitectura#

YOLO26 incorpora varias características revolucionarias que lo diferencian tanto de los modelos Transformer como de las versiones anteriores, como YOLO11:

  • Diseño integral sin NMS: El cabezal opcional uno a uno de YOLO26 (nms=False) elimina la supresión no máxima (NMS) tradicional durante el posprocesamiento. Introducido en modelos como YOLOv10, este enfoque integral reduce la variabilidad de la latencia de inferencia y simplifica la lógica de implementación, especialmente en hardware periférico.
  • Hasta un 43 % más de velocidad de inferencia en CPU: Ante la creciente necesidad de una IA descentralizada, YOLO26 está muy optimizado para dispositivos sin GPU dedicada, como Raspberry Pi.
  • Eliminación de DFL: Al prescindir de Distribution Focal Loss (DFL), YOLO26 simplifica el proceso de exportación y mejora enormemente la compatibilidad con dispositivos periféricos de bajo consumo y microcontroladores.
  • Optimizador MuSGD: YOLO26 tiende un puente entre el entrenamiento de modelos de lenguaje grandes (LLM) y la visión artificial mediante el uso del optimizador MuSGD. Esta combinación de SGD y Muon, inspirada en Kimi K2 de Moonshot AI, garantiza una sólida estabilidad durante el entrenamiento y una convergencia más rápida.
  • ProgLoss + STAL: Las funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños. Esto es fundamental para los sectores que dependen del análisis de imágenes aéreas y de sensores del Internet de las cosas (IoT).

Versatilidad en distintas tareas de visión#

A diferencia de los modelos limitados estrictamente a las cajas delimitadoras, YOLO26 es una solución versátil y potente. Incorpora mejoras específicas para cada tarea, como una función de pérdida para la segmentación semántica y prototipos multiescala para la segmentación de instancias, la estimación del logaritmo de verosimilitud residual (RLE) para la estimación de pose y una función de pérdida angular especializada que resuelve problemas en los límites de las tareas de cajas delimitadoras orientadas (OBB).

Estrategia de implementación en dispositivos periféricos

Para implementarlos en dispositivos periféricos, utiliza las variantes YOLO26n (Nano) o YOLO26s (Small). La eliminación de DFL y el cabezal opcional sin NMS permiten exportar estos modelos a CoreML o LiteRT sin complicaciones y garantizan un rendimiento fluido en tiempo real en iOS y Android.

RTDETRv2: mejora de los Transformers de detección en tiempo real#

RTDETRv2, desarrollado por investigadores de Baidu, se basa en el marco original RT-DETR. Su objetivo es demostrar que los Transformers de detección (DETR) pueden competir con las CNN altamente optimizadas, e incluso superarlas en ocasiones, en velocidad y precisión en escenarios en tiempo real.

Arquitectura y capacidades#

RTDETRv2 emplea una arquitectura basada en Transformer, que procesa las imágenes de forma intrínsecamente distinta a las CNN mediante mecanismos de autoatención para comprender el contexto global.

  • Bag-of-Freebies: La versión 2 introduce una serie de técnicas de entrenamiento optimizadas (bag-of-freebies) que mejoran el rendimiento de referencia sin añadir costes de inferencia.
  • Comprensión del contexto global: Gracias a las capas de atención Transformer, RTDETRv2 comprende de forma natural escenas complejas en las que el contexto global es necesario para distinguir objetos superpuestos u ocultos.

Más información sobre RTDETRv2

Limitaciones de los modelos Transformer#

Aunque son potentes, los modelos de detección basados en Transformer, como RTDETRv2, suelen presentar dificultades en implementaciones prácticas. Por lo general, requieren más memoria CUDA durante el entrenamiento que las CNN eficientes. Además, integrarlos en distintos entornos periféricos puede resultar engorroso debido a las complejas operaciones que requieren las capas de atención, lo que hace que modelos como YOLO26 sean mucho más atractivos para implementaciones con recursos limitados.

Comparativa de rendimiento#

La comparación directa de estos modelos muestra las ventajas tangibles de las últimas optimizaciones de las CNN. La tabla siguiente resume su rendimiento en pruebas de referencia estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Como se muestra, YOLO26 supera sistemáticamente a RTDETRv2 en todas las variantes de tamaño. YOLO26x alcanza una impresionante mAP de 57,5 con menos latencia (11,8 ms en TensorRT) y muchos menos parámetros (55,7 M) que RTDETRv2-x (54,3 mAP, 15,03 ms, 76 M de parámetros).

Casos de uso y recomendaciones#

La elección entre YOLO26 y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir YOLO26#

YOLO26 es una buena opción para:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

Cuándo elegir RT-DETR#

RT-DETR está recomendado para:

  • Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
  • Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
  • Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

La ventaja de Ultralytics#

Elegir la arquitectura de aprendizaje automático adecuada es solo una parte del proceso; el ecosistema que la rodea determina la rapidez con la que un equipo puede pasar de la creación de prototipos a la producción.

Facilidad de uso y eficiencia del entrenamiento#

La API de Python de Ultralytics ofrece una experiencia notablemente optimizada. Ya no hace falta escribir una gran cantidad de código repetitivo para entrenar modelos complejos. Además, YOLO26 es mucho más eficiente durante el entrenamiento y utiliza mucha menos memoria VRAM de GPU que los mecanismos de atención, muy exigentes en memoria, de RTDETRv2. Esto permite usar lotes más grandes incluso en hardware de consumo.

from ultralytics import YOLO

# Inicializa el modelo YOLO26 Nano de última generación
model = YOLO("yolo26n.pt")

# Entrena con el conjunto de datos COCO8 durante 100 épocas
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Ejecuta inferencia de alta velocidad sin NMS
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Exporta a ONNX para una implementación fluida
model.export(format="onnx")

Un ecosistema bien mantenido#

Al utilizar los modelos de Ultralytics, los desarrolladores acceden a un marco de trabajo que se mantiene activamente y se integra de forma nativa con herramientas de seguimiento modernas como Weights & Biases y Comet ML. Si prefieres trabajar sin código, la plataforma de Ultralytics permite entrenar en la nube, gestionar conjuntos de datos e implementar modelos con un solo clic.

Equilibrio del rendimiento#

YOLO26 ofrece un equilibrio sin igual entre velocidad de inferencia y precisión. La eliminación opcional de NMS, junto con el optimizador MuSGD, garantiza que implementes un modelo muy preciso con objetos pequeños (gracias a ProgLoss + STAL) y rapidísimo en producción, lo que lo convierte en la opción superior para casi todas las aplicaciones modernas de visión artificial.

Otros modelos del ecosistema#

Aunque YOLO26 y RTDETRv2 representan lo más avanzado en detección en tiempo real, los desarrolladores que mantengan flujos de trabajo heredados o exploren distintos equilibrios de eficiencia también pueden considerar YOLOv8 para entornos empresariales consolidados o explorar otras arquitecturas, como EfficientDet. Sin embargo, YOLO26 es la recomendación definitiva para cualquier proyecto nuevo.

Comentarios