DAMO-YOLO frente a RTDETRv2#
El panorama de rápida evolución de la visión por ordenador ha producido una impresionante variedad de arquitecturas diseñadas para equilibrar la velocidad, la precisión y la eficiencia computacional. Dos modelos destacados que han aportado enfoques únicos para resolver estos desafíos son DAMO-YOLO y RTDETRv2. Aunque ambos modelos pretenden ofrecer soluciones punteras para la inferencia en tiempo real, sus filosofías arquitectónicas difieren fundamentalmente.
Esta guía exhaustiva profundiza en las especificaciones técnicas, las innovaciones arquitectónicas y los casos de uso prácticos de ambos modelos, además de explorar cómo las soluciones modernas, como la plataforma Ultralytics y el vanguardista YOLO26, han redefinido los estándares del sector para el despliegue y la facilidad de uso.
Descripción general de los modelos#
Comprender DAMO-YOLO#
Desarrollado por investigadores de Alibaba Group, DAMO-YOLO introduce un método de detección de objetos rápido y preciso que depende en gran medida de la Búsqueda de Arquitectura Neuronal (NAS). Sustituye las redes troncales diseñadas manualmente tradicionales por estructuras generadas mediante NAS, diseñadas para ofrecer una baja latencia. Además, incorpora una RepGFPN (Red Piramidal de Características Generalizada Reparametrizada) eficiente y un diseño ZeroHead para agilizar la agregación de características y las predicciones de cajas delimitadoras.
Detalles clave del modelo:
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Documentación: Documentación de DAMO-YOLO
Más información sobre DAMO-YOLO
Comprender RTDETRv2#
El RTDETRv2 de Baidu supone un avance significativo para los Transformers de detección en tiempo real. A diferencia de las Redes Neuronales Convolucionales tradicionales (CNN) que dependen de cajas de anclaje y de la supresión de no máximos (NMS), RTDETRv2 utiliza mecanismos de autoatención para analizar contextualmente la imagen completa. Genera directamente las cajas delimitadoras, evitando por completo el paso de posprocesamiento NMS. Este modelo introduce una estrategia de entrenamiento de «conjunto de ventajas gratuitas» para mejorar la precisión de referencia sin aumentar la latencia de inferencia.
Detalles clave del modelo:
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Repositorio de RT-DETR
- Documentación: Documentación de RTDETRv2
Aunque los Transformers requieren más recursos computacionales, su capacidad para procesar el contexto global los hace increíblemente eficaces para comprender escenas complejas, lo que constituye uno de los principales puntos fuertes de RTDETRv2.
Comparación de rendimiento#
Al evaluar estos modelos para su despliegue en situaciones reales, parámetros como la precisión media promedio (mAP), la velocidad de inferencia y la huella de memoria son fundamentales. Los modelos basados en Transformer, como RTDETRv2, suelen requerir más memoria CUDA durante el entrenamiento y la inferencia que las CNN ligeras, como DAMO-YOLO.
A continuación se muestra una comparación detallada de sus métricas de rendimiento.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Casos de uso ideales#
En qué destaca DAMO-YOLO: Gracias a su red troncal optimizada mediante NAS y a su número de parámetros excepcionalmente bajo en sus variantes más pequeñas, como DAMO-YOLOt, resulta muy adecuado para desplegarse en hardware con recursos muy limitados. Si estás desarrollando soluciones para dispositivos integrados mediante runtimes como ONNX o motores TensorRT especializados para la computación en el edge, DAMO-YOLO proporciona un framework muy ágil.
En qué destaca RTDETRv2: RTDETRv2 destaca en situaciones en las que hay disponibles GPU de nivel servidor y el contexto global de la imagen es primordial. Su arquitectura Transformer le permite resolver de forma natural las cajas delimitadoras superpuestas sin NMS, lo que lo convierte en una opción sólida para la gestión de multitudes o el seguimiento de objetos complejos, donde las relaciones espaciales entre objetos distantes son fundamentales.
La ventaja de Ultralytics: presentamos YOLO26#
Aunque DAMO-YOLO y RTDETRv2 representan importantes logros académicos, transformar estos modelos en aplicaciones escalables y listas para producción puede resultar complicado. Los desarrolladores suelen enfrentarse a bases de código fragmentadas, falta de compatibilidad con el aprendizaje multitarea y pipelines de despliegue complejos.
Aquí es donde el ecosistema Ultralytics realmente marca la diferencia. Al priorizar la facilidad de uso, una API de Python bien mantenida y una versatilidad inigualable, Ultralytics garantiza que los desarrolladores dediquen menos tiempo a depurar y más tiempo a crear.
El recién lanzado modelo Ultralytics YOLO26 lleva estas ventajas al siguiente nivel y ofrece avances que superan a DAMO-YOLO y RTDETRv2:
- Diseño integral sin NMS: YOLO26, cuyo desarrollo pionero se inició originalmente en YOLOv10, es integral de forma nativa. Esto elimina por completo el posprocesamiento NMS, lo que hace que el despliegue sea más rápido y mucho más sencillo que con las CNN tradicionales, a la vez que iguala las ventajas de salida directa de RTDETRv2.
- Hasta un 43 % más de velocidad en la inferencia en CPU: Optimizado especialmente para dispositivos de IA en el edge sin GPU dedicadas, lo que lo convierte en una opción muy superior para aplicaciones del IoT frente a los Transformers con un uso intensivo de memoria.
- Optimizador MuSGD: Inspirado en Kimi K2 de Moonshot AI, este híbrido de SGD y Muon incorpora innovaciones del entrenamiento de Modelos de Lenguaje Grandes (LLM) a la visión por ordenador, lo que da como resultado un entrenamiento extraordinariamente estable y una convergencia más rápida.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños, un área en la que los modelos suelen tener dificultades. Esto es fundamental para las imágenes aéreas y las aplicaciones con drones.
- Eliminación de DFL: Se ha eliminado Distribution Focal Loss para garantizar formatos de exportación simplificados y una mejor compatibilidad con dispositivos edge de bajo consumo.
- Versatilidad inigualable: A diferencia de los modelos de la competencia, limitados estrictamente a la detección, YOLO26 incluye mejoras específicas para cada tarea en todos los ámbitos, como una función de pérdida angular especializada para las cajas delimitadoras orientadas (OBB), una función de pérdida de segmentación semántica para lograr una precisión a nivel de píxel y Residual Log-Likelihood Estimation (RLE) para la estimación de poses.
Entrenar modelos basados en Transformer, como RTDETRv2, requiere asignaciones enormes de memoria CUDA, lo que a menudo hace necesarios costosos sistemas con varias GPU. Los modelos YOLO de Ultralytics mantienen unos requisitos de memoria considerablemente menores tanto durante el entrenamiento como durante la inferencia, democratizando el desarrollo de IA para investigadores y aficionados por igual.
Ejemplo de código: la API unificada de Ultralytics#
Uno de los mayores beneficios del ecosistema de Ultralytics es su API unificada. Puedes cargar, entrenar y validar de forma fluida una variedad de modelos—incluyendo una implementación en PyTorch de RT-DETR y modelos de YOLO de última generación—sin cambiar tu flujo de trabajo.
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
results_yolo[0].show()Esta sencillez también se extiende al entrenamiento con conjuntos de datos personalizados y a la exportación. Mediante el paquete de Python de Ultralytics, los desarrolladores pueden enviar fácilmente sus pesos entrenados a plataformas de despliegue como CoreML u OpenVINO con un solo comando.
Conclusión y exploración adicional#
Tanto DAMO-YOLO como RTDETRv2 han ampliado indudablemente los límites de lo posible en la detección de objetos en tiempo real. DAMO-YOLO proporciona estructuras de red autoexploradas y altamente optimizadas para lograr una eficiencia bruta, mientras que RTDETRv2 demuestra que los Transformers pueden competir en el ámbito del tiempo real al eliminar cuellos de botella tradicionales como NMS.
Sin embargo, para los desarrolladores que buscan el equilibrio definitivo entre rendimiento, documentación exhaustiva y preparación para producción, los modelos YOLO de Ultralytics siguen siendo el estándar de oro. Con la introducción de YOLO26, los usuarios obtienen acceso a detección integral similar a la de los Transformers, eficiencia de entrenamiento inspirada en los LLM y velocidades de CPU inigualables, todo ello dentro de un ecosistema intuitivo y sólido.
Si estás evaluando modelos para tu próximo proyecto, también puedes encontrar utilidad en leer nuestras comparaciones de EfficientDet vs RT-DETR, explorar la generación anterior YOLO11, o revisar líneas base académicas como YOLOX. Empieza a construir hoy explorando la guía de inicio rápido de Ultralytics.