Ultralytics YOLO27:
Get Started

RTDETRv2 frente a PP-YOLOE+#

El rápido desarrollo de la visión artificial ha dado lugar a diversos enfoques arquitectónicos para resolver los complejos retos de la detección de objetos en tiempo real. Entre los avances recientes más destacados se encuentran RTDETRv2 y PP-YOLOE+, dos potentes modelos que abordan el reconocimiento visual desde filosofías de diseño fundamentalmente distintas. Aunque ambos aspiran a ofrecer una detección de alto rendimiento, sus mecanismos internos, paradigmas de entrenamiento y escenarios de despliegue ideales difieren considerablemente.

Esta guía exhaustiva analiza los matices técnicos de ambos modelos y compara sus arquitecturas, métricas de rendimiento y compatibilidad con el ecosistema para ayudar a desarrolladores e investigadores a elegir la solución óptima para sus necesidades de despliegue concretas.

Descripción general de los modelos#

Antes de analizar los datos de rendimiento, es importante conocer los orígenes y los objetivos arquitectónicos de cada modelo. Ambos proceden de equipos de investigación de Baidu, pero representan ramas distintas de la familia de modelos de detección de objetos.

RTDETRv2#

RTDETRv2 supone un avance importante en las arquitecturas de visión basadas en Transformer. A partir del Transformer de detección en tiempo real original, combina una red troncal CNN con un codificador híbrido eficiente y un decodificador Transformer. Su característica más definitoria es la capacidad de predicción integral nativa, que elimina por completo la necesidad de supresión no máxima (NMS) durante el posprocesamiento.

Más información sobre RTDETRv2

PP-YOLOE+#

PP-YOLOE+ es una versión avanzada de la serie YOLO, muy optimizada para aplicaciones industriales de alto rendimiento. Cuenta con una arquitectura CNN escalable y un cabezal de detección sin anclas. Está diseñado para ofrecer una excelente relación entre velocidad y precisión, e incorpora técnicas potentes como ET-head y una función de pérdida focal generalizada para mejorar la detección de objetos pequeños.

Más información sobre PP-YOLOE+

Integración en el ecosistema

Aunque ambos modelos cuentan con repositorios de investigación propios, puedes probar fácilmente el RT-DETR original directamente desde el paquete de Python de Ultralytics y aprovechar una API unificada y opciones de exportación optimizadas.

Diferencias arquitectónicas#

La diferencia fundamental entre estos dos modelos reside en cómo procesan el contexto visual y generan predicciones.

PP-YOLOE+ utiliza una red troncal de red neuronal convolucional (CNN) tradicional, pero muy optimizada. Se basa en campos receptivos locales para extraer características, lo que le permite ser extremadamente rápido y eficiente en despliegues estándar. Sin embargo, todavía requiere el posprocesamiento NMS estándar para filtrar cuadros delimitadores superpuestos, lo que puede generar cuellos de botella de latencia en escenas densas.

Por el contrario, RTDETRv2 utiliza un codificador híbrido y un decodificador Transformer. Esto permite al modelo captar simultáneamente el contexto global de toda la imagen. Los mecanismos de atención comprenden de forma intrínseca las relaciones entre objetos, por lo que el modelo puede generar directamente los cuadros delimitadores finales sin NMS. Este enfoque integral garantiza una latencia de inferencia estable, independientemente del número de objetos detectados.

Métricas de rendimiento y comparativa#

Al evaluar las métricas de rendimiento de YOLO, es fundamental equilibrar la precisión (mAP) con el coste computacional (FLOPs) y la velocidad de inferencia. La tabla siguiente muestra el rendimiento de ambos modelos en distintos tamaños.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Aunque PP-YOLOE+x alcanza una mAPval ligeramente superior, del 54,7 %, en el conjunto de datos COCO, los modelos RTDETRv2 suelen ofrecer una precisión competitiva y la ventaja añadida de una latencia constante gracias a su diseño sin NMS. Sin embargo, PP-YOLOE+ mantiene una clara ventaja en el número de parámetros y los FLOPs de los modelos más pequeños, lo que lo hace muy eficiente para despliegues periféricos.

La ventaja de Ultralytics: llega YOLO26#

Aunque RTDETRv2 y PP-YOLOE+ son modelos formidables, la tecnología de última generación sigue evolucionando. Para los desarrolladores que buscan el equilibrio definitivo entre velocidad, precisión y compatibilidad con el ecosistema, Ultralytics YOLO26 representa el nuevo estándar del sector.

YOLO26 combina lo mejor de las CNN y los Transformer. Incorpora un modo de inferencia integral sin NMS opcional (nms=False), pionero en las arquitecturas modernas, que elimina los cuellos de botella del posprocesamiento cuando está activado. Además, introduce el revolucionario optimizador MuSGD, un enfoque híbrido inspirado en las innovaciones del entrenamiento de LLM que garantiza un entrenamiento muy estable y una convergencia rápida.

Optimizado para dispositivos periféricos

A diferencia de los pesados modelos Transformer que requieren mucha memoria CUDA, YOLO26 elimina DFL (Distribution Focal Loss) y está optimizado específicamente para la computación periférica, con una inferencia en CPU hasta un 43 % más rápida que la de las generaciones anteriores.

Además, YOLO26 no se limita a la detección de objetos sencilla. Es versátil de forma nativa y ofrece compatibilidad inmediata con la segmentación de instancias, la estimación de pose y los cuadros delimitadores orientados (OBB), mientras que PP-YOLOE+ se centra principalmente en la detección de cuadros delimitadores.

Metodologías de entrenamiento y ecosistema#

La eficiencia del entrenamiento y la facilidad de uso son aspectos en los que el ecosistema Ultralytics destaca realmente frente a los repositorios de investigación independientes. PP-YOLOE+ utiliza el marco PaddlePaddle y RTDETRv2 suele requerir configuraciones de entorno complejas, mientras que la integración de modelos mediante Ultralytics ofrece una experiencia sencilla.

Con la API de Ultralytics, te beneficias de unos requisitos de memoria más bajos durante el entrenamiento, la gestión automatizada de conjuntos de datos y un ajuste simplificado de hiperparámetros. Además, puedes desplegar modelos en formatos de producción como ONNX o TensorRT con un solo comando.

Ejemplo de código: inferencia optimizada#

A continuación se muestra lo fácil que es utilizar RT-DETR junto con el modelo YOLO26 recomendado mediante el paquete de Python de Ultralytics:

from ultralytics import RTDETR, YOLO

# Inicializa un modelo RT-DETR (Ultralytics ofrece compatibilidad con RT-DETR-L y RT-DETR-X originales)
model_rtdetr = RTDETR("rtdetr-l.pt")

# Realiza una inferencia sin NMS en una imagen de prueba
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()

# Para obtener una velocidad y versatilidad superiores, inicializa el último modelo YOLO26
model_yolo26 = YOLO("yolo26n.pt")

# Entrena el modelo YOLO26 sin complicaciones y con un uso de memoria optimizado
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)

# Exportar a TensorRT para el despliegue en el edge
model_yolo26.export(format="engine")

Aplicaciones y casos de uso reales#

La elección entre estas arquitecturas suele depender de los requisitos específicos del hardware y de la aplicación.

  • RTDETRv2 destaca en entornos de servidor y en la comprensión de escenas complejas. Su mecanismo de atención global lo hace muy eficaz para la gestión de multitudes y el análisis de imágenes médicas con gran densidad de objetos, donde los objetos superpuestos suelen hacer que fallen los algoritmos NMS estándar.
  • PP-YOLOE+ es muy adecuado para la inspección industrial de alta velocidad y para entornos que utilizan ampliamente el ecosistema PaddlePaddle. Su bajo número de parámetros en las escalas más pequeñas lo hace viable para determinadas aplicaciones robóticas.
  • Ultralytics YOLO26 es la solución recomendada de forma general para un despliegue comercial integral. Gracias a sus funciones mejoradas ProgLoss + STAL, mejora drásticamente el reconocimiento de objetos pequeños, esencial para las operaciones con drones aéreos y la supervisión del tráfico en ciudades inteligentes.

Casos de uso y recomendaciones#

La elección entre RT-DETR y PP-YOLOE+ depende de los requisitos específicos de tu proyecto, las restricciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir RT-DETR#

RT-DETR es una excelente opción para:

  • Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
  • Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
  • Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir PP-YOLOE+#

PP-YOLOE+ es recomendable para:

  • Integración con el ecosistema PaddlePaddle: Organizaciones con infraestructura existente basada en el framework y las herramientas de PaddlePaddle de Baidu.
  • Implementación edge con Paddle Lite: Implementación en hardware con kernels de inferencia muy optimizados, diseñados específicamente para Paddle Lite o el motor de inferencia Paddle.
  • Detección de alta precisión en servidores: Escenarios que priorizan la máxima precisión de detección en servidores con GPU potentes, donde la dependencia del framework no supone un problema.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

Conclusión#

Tanto RTDETRv2 como PP-YOLOE+ han ampliado los límites de lo posible en visión artificial y han demostrado la viabilidad tanto de las arquitecturas Transformer como de las arquitecturas CNN altamente optimizadas. Sin embargo, la complejidad de desplegar bases de código de investigación fragmentadas puede retrasar los plazos de producción.

Para los ingenieros de IA actuales, aprovechar la Plataforma Ultralytics ofrece una ventaja sin igual. Al migrar a modelos integrados sin fisuras, como YOLO11 o el vanguardista YOLO26, los equipos pueden alcanzar la mayor relación posible entre precisión y velocidad, a la vez que reducen drásticamente los requisitos de memoria y la carga de desarrollo.

Comentarios