Ultralytics YOLO27:
Get Started

DAMO-YOLO frente a PP-YOLOE+#

En el panorama altamente competitivo de la visión artificial en tiempo real, elegir la arquitectura óptima para tus necesidades específicas de despliegue es crucial. Esta guía ofrece una comparativa técnica exhaustiva de DAMO-YOLO y PP-YOLOE+, con un análisis detallado de sus diseños arquitectónicos, metodologías de entrenamiento y métricas de rendimiento. También examinaremos cómo se comparan estos modelos con soluciones de última generación como el recién lanzado Ultralytics YOLO26.

Descripción general de los modelos#

Ambos frameworks surgieron en 2022 como alternativas potentes para aplicaciones industriales y aprovecharon técnicas sofisticadas para ampliar los límites de la precisión y la velocidad de inferencia.

DAMO-YOLO#

Desarrollado por Alibaba Group, DAMO-YOLO introdujo varias técnicas novedosas para optimizar el equilibrio entre latencia y precisión, basándose en gran medida en técnicas de búsqueda automatizada y fusión avanzada de características.

DAMO-YOLO utiliza una búsqueda de arquitectura neuronal de entropía máxima (MAE-NAS) para diseñar automáticamente backbones optimizados para la eficiencia del hardware. También incluye un RepGFPN (red piramidal de características generalizada reparametrizada) eficiente para fusionar características en el neck y un diseño ligero «ZeroHead». Además, se apoya ampliamente en técnicas de destilación durante el entrenamiento para potenciar la capacidad de representación del modelo estudiante.

Más información sobre DAMO-YOLO

PP-YOLOE+#

Del equipo de PaddlePaddle de Baidu, PP-YOLOE+ es una actualización incremental de la arquitectura PP-YOLOE. Se centra en el preentrenamiento a gran escala y en funciones de pérdida refinadas para ofrecer un mAP alto, especialmente en su framework nativo de aprendizaje profundo.

PP-YOLOE+ utiliza un backbone CSPRepResNet y un cabezal ET (cabezal eficiente alineado con la tarea). La versión «plus» incorpora una potente estrategia de preentrenamiento con el conjunto de datos Objects365, que mejora significativamente su capacidad de generalización en diversos entornos reales.

Más información sobre PP-YOLOE+

Comparativa arquitectónica#

Las diferencias en la filosofía de diseño de estos dos modelos influyen notablemente en sus casos de uso ideales y en su compatibilidad con el hardware.

Fusión de características y backbones#

Los backbones generados por MAE-NAS de DAMO-YOLO están muy adaptados a los dispositivos periféricos y suelen ofrecer una relación velocidad-parámetros favorable. Sin embargo, estas arquitecturas personalizadas pueden ser rígidas y complejas de adaptar a nuevas tareas, como la segmentación de instancias. El neck RepGFPN mejora la fusión de características multiescala, pero añade complejidad durante la fase de exportación con reparametrización.

PP-YOLOE+ se basa en CSPRepResNet, una arquitectura más tradicional pero muy eficaz. Aunque este backbone requiere más parámetros que DAMO-YOLO para obtener una precisión similar, su entrenamiento es muy estable y resulta más fácil integrarlo en los pipelines existentes. Su cabezal ET gestiona eficazmente la clasificación y la regresión, pero sigue necesitando pasos de posprocesamiento como la supresión no máxima (NMS).

Eliminación de los retrasos del posprocesamiento

Tanto DAMO-YOLO como PP-YOLOE+ requieren NMS para el posprocesamiento de las cajas delimitadoras. Si la latencia de inferencia es crucial, considera Ultralytics YOLO26, que incorpora un diseño nativo de extremo a extremo sin NMS mediante su cabezal opcional uno a uno (nms=False). Este enfoque revolucionario elimina el posprocesamiento con NMS y permite un pipeline de despliegue más rápido y sencillo.

Análisis del rendimiento y las métricas#

Al evaluar estos modelos para producción, es fundamental equilibrar la precisión (mAP), la velocidad de inferencia y el número de parámetros. A continuación se muestra una comparación directa de sus variantes principales.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

Como muestra la tabla, DAMO-YOLO ofrece mayor precisión en las escalas diminuta (t) y pequeña (s), y DAMO-YOLOt alcanza la latencia más baja en T4 TensorRT de todos los modelos comparados, gracias a sus backbones optimizados mediante NAS. Sin embargo, PP-YOLOE+ escala extraordinariamente bien en las categorías mediana (m) y grande (l), donde alcanza puntuaciones mAP superiores, aunque a costa de una ligera reducción de la velocidad en T4 TensorRT.

Requisitos de memoria y eficiencia del entrenamiento#

La dependencia de DAMO-YOLO de la destilación implica que a menudo hay que entrenar un modelo profesor mucho más grande antes de entrenar el modelo estudiante más pequeño. Esto aumenta drásticamente los requisitos de memoria CUDA y el presupuesto computacional total. PP-YOLOE+ lo simplifica con un entrenamiento estándar de una sola etapa, pero sigue estando estrechamente ligado al framework PaddlePaddle, lo que puede limitar la flexibilidad de los equipos habituados a PyTorch.

En cambio, el moderno modelo Ultralytics YOLO26 resuelve estos cuellos de botella. Gracias al nuevo optimizador MuSGD, un híbrido de SGD y Muon inspirado en innovaciones del entrenamiento de LLM, YOLO26 converge más rápido y ofrece un entrenamiento muy estable, sin necesidad de pipelines de destilación complejos. Además, los modelos YOLO suelen requerir mucha menos memoria CUDA durante el entrenamiento que los detectores basados en transformers como RT-DETR.

Aplicaciones reales y casos de uso ideales#

Cuándo usar DAMO-YOLO#

DAMO-YOLO es ideal para la inferencia periférica de alto rendimiento, donde la latencia es el principal cuello de botella. Sus variantes pequeñas destacan en entornos como los sistemas de gestión del tráfico o la vigilancia básica con drones, siempre que tu equipo de ingeniería tenga capacidad para gestionar sus complejos procesos de destilación y reparametrización.

Cuándo usar PP-YOLOE+#

PP-YOLOE+ destaca si ya estás muy integrado en el ecosistema de Baidu o gestionas despliegues de servidor a gran escala. Su impresionante mAP lo hace adecuado para el complejo análisis de imágenes médicas o la detección de defectos de fabricación en entornos con gran densidad de elementos.

La ventaja de Ultralytics#

Aunque DAMO-YOLO y PP-YOLOE+ ofrecen ventajas específicas en determinados ámbitos, los desarrolladores que buscan la máxima versatilidad, velocidad y facilidad de uso suelen elegir la plataforma Ultralytics.

Al actualizar tu pipeline de visión artificial, Ultralytics YOLO26 ofrece una experiencia de desarrollo sin igual:

  • Inferencia en CPU hasta un 43 % más rápida: Al eliminar por completo Distribution Focal Loss (DFL), YOLO26 es extraordinariamente rápido en CPU periféricas y dispositivos IoT de bajo consumo.
  • Mejora de la detección de objetos pequeños: La integración de las funciones de pérdida ProgLoss y STAL mejora considerablemente el reconocimiento de objetos pequeños, algo esencial para las imágenes aéreas.
  • Gran versatilidad: A diferencia de PP-YOLOE+, que se centra estrictamente en la detección, YOLO26 gestiona sin problemas la estimación de pose, las cajas delimitadoras orientadas (OBB) y la segmentación semántica gracias a mejoras arquitectónicas específicas para cada tarea.

Conclusión#

DAMO-YOLO y PP-YOLOE+ representan hitos importantes en la evolución de la detección de objetos sin anclajes. DAMO-YOLO amplió los límites de la búsqueda de arquitecturas neuronales para reducir la latencia en dispositivos periféricos, mientras que PP-YOLOE+ demostró el potencial del preentrenamiento a gran escala.

Sin embargo, para los desarrolladores que buscan el mejor equilibrio entre velocidad, precisión y sencillez de despliegue, el modelo Ultralytics YOLO26 es la opción definitiva. Su arquitectura sin NMS, su sólida API de Python y su integración fluida con herramientas como Weights & Biases y TensorRT garantizan que tus proyectos pasen sin problemas del prototipo a producción.

¿Todo listo para empezar? Consulta la guía de inicio rápido de Ultralytics o compara más modelos en nuestro análisis de YOLO11 frente a DAMO-YOLO.

Comentarios