PP-YOLOE+ frente a RTDETRv2#
El campo de la visión por ordenador ha experimentado una evolución espectacular en los últimos años, especialmente en el ámbito de la detección de objetos en tiempo real. Elegir la arquitectura adecuada para tu despliegue puede marcar la diferencia entre una aplicación lenta y con un uso intensivo de memoria, y un sistema altamente optimizado y con gran capacidad de respuesta. En esta comparación técnica, analizamos dos modelos destacados de Baidu: el PP-YOLOE+, basado en CNN, y el RTDETRv2, basado en Transformer. Analizaremos sus arquitecturas, métricas de rendimiento y casos de uso ideales, y examinaremos también cómo se comparan con la plataforma de vanguardia Ultralytics YOLO26.
PP-YOLOE+: evolución del paradigma CNN#
Desarrollado como una iteración de sus predecesores, PP-YOLOE+ amplía los límites de lo que las redes neuronales convolucionales (CNN) tradicionales pueden lograr en la detección de objetos. Es un detector sin anclajes muy capaz que se basa en los mecanismos fundamentales de la serie YOLO, al tiempo que introduce optimizaciones específicas para el ecosistema PaddlePaddle.
Detalles del modelo:
- Autores: autores de PaddlePaddle
- Organización: Baidu
- Fecha: 2022-04-02
- Arxiv: 2203.16250
- GitHub: Repositorio de PaddleDetection
- Documentación: Documentación de PP-YOLOE+
Arquitectura y metodologías#
PP-YOLOE+ se basa en un backbone altamente optimizado y una red piramidal de características personalizada para agregar eficazmente características multiescala. Utiliza un diseño sin anclajes, lo que simplifica el proceso de ajuste heurístico que suele ser necesario para generar cajas de anclaje. Además, su metodología de entrenamiento incluye estrategias avanzadas de asignación de etiquetas para ajustar mejor las predicciones a las cajas de referencia durante la fase de aprendizaje.
Puntos fuertes y casos de uso#
El principal punto fuerte de PP-YOLOE+ reside en su sólido rendimiento en hardware de servidor estándar y en su profunda integración con las herramientas de Baidu. Es adecuado para flujos de trabajo industriales tradicionales, como la detección de defectos estáticos en entornos de fabricación donde las restricciones de hardware no son demasiado exigentes.
Más información sobre PP-YOLOE+
Aunque PP-YOLOE+ ofrece una gran precisión, desplegarlo fuera de su ecosistema nativo puede requerir a veces pasos de conversión adicionales, a diferencia de los formatos de exportación nativos disponibles directamente en las modernas canalizaciones de Ultralytics.
RTDETRv2: Transformers de detección en tiempo real#
Al alejarse de las CNN puras, RTDETRv2 (Transformer de detección en tiempo real versión 2) representa un salto hacia los mecanismos basados en atención para tareas de visión por ordenador. Intenta combinar la comprensión del contexto global de los Transformer con la baja latencia necesaria para aplicaciones del mundo real.
Detalles del modelo:
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2 Repository
- Documentación: README de RTDETRv2
Arquitectura y metodologías#
RTDETRv2 aprovecha una arquitectura híbrida que combina un backbone CNN para la extracción de características con un codificador-decodificador Transformer optimizado. Una característica definitoria de RTDETRv2 es su diseño nativo de extremo a extremo, que evita el posprocesamiento tradicional de supresión no máxima (NMS). También introduce funciones como la detección multiescala y el procesamiento de escenas complejas, utilizando autoatención para comprender las relaciones espaciales entre objetos distantes.
Puntos fuertes y casos de uso#
La arquitectura Transformer hace que RTDETRv2 sea muy eficaz en situaciones donde comprender el contexto global es crucial. Sin embargo, los modelos Transformer suelen exigir mucha más memoria CUDA durante el entrenamiento y la inferencia que las CNN ligeras. Es más adecuado para entornos con hardware sin restricciones, como los análisis de vídeo basados en la nube que se ejecutan en servidores GPU potentes.
Obtén más información sobre RT-DETR
Comparación de rendimiento y métricas#
Al evaluar estos modelos, el equilibrio entre la precisión media (mAP) y el coste computacional (medido en FLOPs y latencia de inferencia) es fundamental. La siguiente tabla resume las métricas clave de las distintas escalas de PP-YOLOE+ y RTDETRv2.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Aunque RTDETRv2 ofrece un mAP sólido a costa de un mayor número de parámetros y FLOPs, los desarrolladores que buscan desplegarlo en dispositivos edge con recursos limitados suelen encontrarse con cuellos de botella debido a las elevadas necesidades de memoria habituales de las capas Transformer.
Casos de uso y recomendaciones#
Elegir entre PP-YOLOE+ y RT-DETR depende de los requisitos específicos de tu proyecto, las restricciones del despliegue y tus preferencias de ecosistema.
Cuándo elegir PP-YOLOE+#
PP-YOLOE+ es una opción sólida para:
- Integración con el ecosistema de PaddlePaddle: Organizaciones con infraestructura existente basada en el framework y las herramientas de PaddlePaddle de Baidu.
- Implementación edge con Paddle Lite: Implementación en hardware con kernels de inferencia altamente optimizados específicamente para Paddle Lite o el motor de inferencia de Paddle.
- Detección en servidor de alta precisión: Escenarios que priorizan la máxima precisión de detección en servidores GPU potentes donde la dependencia del framework no supone un problema.
Cuándo elegir RT-DETR#
RT-DETR se recomienda para:
- Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
- Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
- Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics: presentamos YOLO26#
Aunque PP-YOLOE+ y RTDETRv2 representan hitos importantes, los desarrolladores actuales necesitan un ecosistema que equilibre a la perfección un rendimiento extremo con una usabilidad optimizada. La Ultralytics Platform y el revolucionario modelo YOLO26 ofrecen exactamente eso.
Lanzado en enero de 2026, YOLO26 establece el nuevo estándar para la IA de visión prioritaria para edge. Resuelve con elegancia los obstáculos de despliegue asociados a arquitecturas anteriores y las supera tanto en velocidad como en precisión.
Innovaciones arquitectónicas#
YOLO26 introduce varias mejoras pioneras que superan a las CNN tradicionales y a los Transformer de gran tamaño:
- Diseño de extremo a extremo sin NMS: Al igual que RTDETRv2, YOLO26 es nativo de extremo a extremo. Al eliminar el posprocesamiento de supresión no máxima (NMS), ofrece un despliegue más rápido y sencillo, con una menor variabilidad de la latencia, ideal para la robótica en tiempo real y los sistemas autónomos.
- Hasta un 43 % más rápido en inferencia en CPU: Gracias a profundas optimizaciones arquitectónicas, YOLO26 supera significativamente a los modelos de la competencia en dispositivos edge sin GPU dedicadas, lo que lo convierte en la opción principal para aplicaciones de IoT y ciudades inteligentes.
- Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de LLM, YOLO26 emplea una combinación de SGD y Muon. Esto proporciona trayectorias de entrenamiento más estables y una convergencia notablemente más rápida, reduciendo drásticamente las horas de entrenamiento en GPU.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, un área en la que modelos como PP-YOLOE+ han tenido dificultades históricamente, algo fundamental para las imágenes aéreas y las aplicaciones con drones.
- Eliminación de DFL: Eliminar Distribution Focal Loss simplifica el proceso de exportación y garantiza una compatibilidad fluida con diversos dispositivos edge y de bajo consumo.
A diferencia de los detectores de objetos especializados, YOLO26 es muy versátil y admite segmentación de instancias, estimación de pose, clasificación y cajas delimitadoras orientadas (OBB). Incluye mejoras adaptadas, como RLE para Pose y una función de pérdida angular especializada para OBB.
Facilidad de uso incomparable#
Uno de los mayores inconvenientes de adoptar arquitecturas complejas como RTDETRv2 es su pronunciada curva de aprendizaje y sus procesos de integración fragmentados. El ecosistema de Ultralytics abstrae por completo estas complejidades mediante una API de Python intuitiva y una plataforma web integral.
Tanto si estás entrenando conjuntos de datos personalizados como si ejecutas una inferencia rápida, el proceso es fluido:
from ultralytics import RTDETR, YOLO
# Initialize the state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Alternatively, initialize an RT-DETR model via the same simple API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Run real-time inference effortlessly
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# Export for edge deployment in one line
model_yolo.export(format="engine", quantize=16)Los menores requisitos de memoria habituales de los modelos Ultralytics YOLO permiten entrenar más rápido y desplegar en hardware más económico que sus equivalentes basados en Transformer. Además, el desarrollo activo y una documentación de primer nivel garantizan que tus canalizaciones de producción se mantengan estables.
Para los equipos que exploran alternativas, YOLO11 sigue siendo un predecesor muy respaldado y excepcionalmente capaz dentro del ecosistema, y ofrece una base excelente para las integraciones en hardware heredado. También te puede resultar útil leer nuestra comparación sobre YOLO11 vs RT-DETR.
Resumen#
PP-YOLOE+ y RTDETRv2 han contribuido sustancialmente a la evolución de la visión por ordenador, demostrando, respectivamente, la viabilidad de las canalizaciones CNN avanzadas y de los Transformer en tiempo real. Sin embargo, para las organizaciones que buscan desplegar aplicaciones de visión por ordenador robustas, versátiles y altamente optimizadas en 2026, Ultralytics YOLO26 ofrece una solución inigualable. Su arquitectura nativa sin NMS, una inferencia en CPU significativamente más rápida y un ecosistema optimizado permiten a los desarrolladores pasar de la idea a una producción escalable más rápido que nunca.