RTDETRv2 frente a DAMO-YOLO#
El panorama de la visión por ordenador evoluciona constantemente, con investigadores e ingenieros que se esfuerzan por construir modelos que equilibren a la perfección la velocidad, la precisión y la eficiencia. Dos arquitecturas destacadas que han causado un gran impacto en este ámbito son RTDETRv2, desarrollada por Baidu, y DAMO-YOLO, creada por Alibaba Group. Ambos modelos superan los límites de la detección de objetos en tiempo real, pero adoptan filosofías arquitectónicas fundamentalmente diferentes para lograr sus impresionantes resultados.
En esta comparación técnica, profundizaremos en sus arquitecturas, metodologías de entrenamiento y capacidades de despliegue en el mundo real. También exploraremos cómo se comparan estos modelos con el ecosistema más amplio, en particular la Plataforma Ultralytics, altamente optimizada, y la vanguardista arquitectura YOLO26.
Innovaciones arquitectónicas#
Comprender la mecánica central de estos modelos es crucial para los ingenieros de aprendizaje automático que tienen la tarea de seleccionar la herramienta adecuada para los entornos de producción.
RTDETRv2: El enfoque Transformer#
Basándose en el éxito del RT-DETR original, RTDETRv2 utiliza un codificador híbrido y un decodificador transformer. Este diseño permite que el modelo procese el contexto global de forma muy eficaz, lo que lo hace excepcionalmente bueno para distinguir entre objetos superpuestos en escenas densas. La ventaja más significativa de esta arquitectura es su diseño nativo sin NMS (Supresión de No Máximos). Al eliminar el paso de postprocesamiento de NMS, RTDETRv2 simplifica el flujo de trabajo de inferencia y garantiza una latencia más estable en distintas configuraciones de hardware.
Más información sobre RTDETRv2
DAMO-YOLO: Avanzando en la eficiencia de CNN#
Por otro lado, DAMO-YOLO sigue arraigado en el linaje YOLO basado en CNN, que ha tenido tanto éxito, pero introduce varias mejoras revolucionarias. Aprovecha la Búsqueda de Arquitectura Neural (NAS) para optimizar su red troncal, garantizando la máxima eficiencia en la extracción de características. Además, incorpora un eficiente diseño RepGFPN (Red de Pirámide de Características Generalizada Reparameterizada) y ZeroHead, junto con técnicas de mejora de distilación y AlignedOTA. Estas innovaciones permiten a DAMO-YOLO alcanzar velocidades de inferencia rápidas a la vez que mantiene una puntuación mAPval muy competitiva.
Más información sobre DAMO-YOLO
Mientras que RTDETRv2 se enfoca en aprovechar los mecanismos de atención para la comprensión global de características sin NMS, DAMO-YOLO maximiza la eficiencia tradicional de las CNN a través de NAS y destilación avanzada, lo que requiere un post-procesamiento estándar pero ofrece ventajas de velocidad distintas en cierto hardware.
Comparación de rendimiento y métricas#
Al evaluar modelos para el despliegue, las métricas de rendimiento como la precisión media (mAP), la velocidad de inferencia y el recuento de parámetros son fundamentales. A continuación se muestra una comparación detallada de las dos familias de modelos.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | params (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Análisis de los resultados#
Como se puede ver en la tabla, el RTDETRv2-x alcanza la mayor precisión con un mAPval de 54.3, lo que demuestra la potencia de la arquitectura transformer en validaciones complejas como el conjunto de datos COCO. Sin embargo, esto tiene el coste de unos parámetros (76M) y unos FLOPs significativamente mayores.
Por el contrario, DAMO-YOLOt (Tiny) es excepcionalmente ligero, requiriendo solo 8.5M de parámetros, lo que lo convierte en una opción increíblemente rápida para entornos donde la memoria CUDA está severamente restringida. DAMO-YOLO generalmente proporciona un equilibrio favorable entre velocidad y precisión para dispositivos edge heredados.
Ecosistema, usabilidad y la ventaja de Ultralytics#
Aunque los repositorios independientes como los oficiales RT-DETR GitHub y DAMO-YOLO GitHub ofrecen el código fuente para entrenar estos modelos, integrarlos en los flujos de trabajo de producción a menudo requiere una gran cantidad de código repetitivo y optimización manual.
Aquí es donde el ecosistema Ultralytics simplifica drásticamente la experiencia del desarrollador. Ultralytics integra modelos como RTDETRv2 directamente en su API unificada, lo que permite a los usuarios entrenar, validar y exportar modelos con una sola línea de código. Además, los modelos de Ultralytics son conocidos por sus requisitos de memoria mínimos durante el entrenamiento en comparación con los pesados repositorios independientes basados en transformers.
Ejemplo de código: Integración perfecta#
Aquí tienes lo fácil que es aprovechar la biblioteca Python de Ultralytics para realizar inferencias. La API permanece consistente tanto si utilizas un modelo transformer como una CNN de última generación.
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")
# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")
# Display the results
results_yolo[0].show()Mediante el uso de la API de Ultralytics, puedes exportar tus modelos entrenados sin problemas a formatos como TensorRT, ONNX o CoreML con un simple comando model.export(format="engine"), reduciendo drásticamente la fricción en el despliegue.
Casos de uso ideales#
Elegir entre estas arquitecturas depende totalmente de los requisitos específicos de tu proyecto:
- RTDETRv2 destaca en el procesamiento del lado del servidor donde abunda la VRAM. Su conocimiento del contexto global es perfecto para la imagen médica y el análisis de multitudes densas donde las oclusiones son frecuentes.
- DAMO-YOLO es muy adecuado para aplicaciones IoT embebidas y líneas de inspección industrial de rápido movimiento donde un bajo número de parámetros y un alto valor de FPS son requisitos estrictos.
El futuro: Ultralytics YOLO26#
Aunque tanto RTDETRv2 como DAMO-YOLO tienen sus méritos, el campo de la visión por ordenador avanza rápidamente. Para los nuevos proyectos, el último Ultralytics YOLO26 representa la síntesis definitiva de velocidad, precisión y experiencia de desarrollo.
YOLO26 adopta un diseño de extremo a extremo sin NMS, capturando el beneficio principal de los transformers sin la enorme sobrecarga computacional. Incorpora el innovador optimizador MuSGD —inspirado en el entrenamiento de Large Language Model— para una convergencia estable y rápida. Además, con la eliminación de DFL (se elimina la pérdida focal de distribución para una exportación simplificada y una mejor compatibilidad con dispositivos de borde/bajo consumo), YOLO26 logra una inferencia de CPU hasta un 43% más rápida, lo que lo convierte en el campeón indiscutible para la computación en el borde. Adicionalmente, ProgLoss + STAL proporciona funciones de pérdida mejoradas con notables mejoras en el reconocimiento de objetos pequeños, algo fundamental para el IoT, la robótica y la imaginería aérea.
A diferencia de los modelos limitados estrictamente a cuadros delimitadores (bounding boxes), la familia YOLO26 ofrece una versatilidad sin igual, admitiendo tareas que van desde la segmentación de instancias y la estimación de poses hasta las cajas delimitadoras orientadas (OBB), todo ello gestionado de forma fluida a través de la intuitiva Plataforma Ultralytics.
Explora YOLO26 en la Plataforma
Detalles del modelo y referencias#
RTDETRv2#
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 24-07-2024
- Arxiv: 2407.17140
- GitHub: Repositorio RT-DETR
DAMO-YOLO#
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organization: Alibaba Group
- Fecha: 23-11-2022
- Arxiv: 2211.15444v2
- GitHub: Repositorio de DAMO-YOLO
Para los usuarios interesados en explorar otras comparaciones, echa un vistazo a nuestras guías sobre RTDETRv2 vs. YOLO11 o DAMO-YOLO vs. YOLOv8 para ver cómo se comportan estos modelos frente a las generaciones anteriores de la familia Ultralytics.