Ultralytics YOLO27:
Get Started

DAMO-YOLO frente a RTDETRv2#

La rápida evolución de la visión artificial ha dado lugar a una impresionante variedad de arquitecturas diseñadas para equilibrar la velocidad, la precisión y la eficiencia computacional. Dos modelos destacados que han aportado enfoques propios para resolver estos desafíos son DAMO-YOLO y RTDETRv2. Aunque ambos buscan ofrecer soluciones de vanguardia para la inferencia en tiempo real, sus filosofías arquitectónicas son fundamentalmente distintas.

Esta completa guía profundiza en las especificaciones técnicas, las innovaciones arquitectónicas y los casos de uso prácticos de ambos modelos. También explora cómo soluciones modernas como la Ultralytics Platform y el vanguardista YOLO26 han redefinido los estándares del sector en cuanto a implementación y facilidad de uso.

Descripción general de los modelos#

Entender DAMO-YOLO#

Desarrollado por investigadores de Alibaba Group, DAMO-YOLO presenta un método de detección de objetos rápido y preciso que depende en gran medida de la búsqueda de arquitecturas neuronales (NAS). Sustituye los backbones tradicionales diseñados manualmente por estructuras generadas mediante NAS y concebidas para ofrecer una latencia baja. Además, incorpora Efficient RepGFPN (red piramidal de características generalizada reparametrizada) y un diseño ZeroHead para agilizar la agregación de características y las predicciones de cajas delimitadoras.

Detalles principales del modelo:

Más información sobre DAMO-YOLO

Entender RTDETRv2#

RTDETRv2 de Baidu supone un avance importante para los Transformers de detección en tiempo real. A diferencia de las redes neuronales convolucionales (CNN) tradicionales, que dependen de cajas de anclaje y de la supresión no máxima (NMS), RTDETRv2 utiliza mecanismos de autoatención para interpretar el contexto de toda la imagen. Predice directamente las cajas delimitadoras, sin necesidad de la etapa de postprocesamiento NMS. Este modelo introduce una estrategia de entrenamiento de «recursos gratuitos» para mejorar la precisión de referencia sin aumentar la latencia de inferencia.

Detalles principales del modelo:

Más información sobre RTDETRv2

La adopción de Transformers en la IA de visión

Aunque los Transformers requieren más recursos computacionales, su capacidad para procesar el contexto global los hace muy eficaces para comprender escenas complejas, una de las principales fortalezas de RTDETRv2.

Comparativa de rendimiento#

Al evaluar estos modelos para su implementación en el mundo real, son fundamentales parámetros como la precisión media (mAP), la velocidad de inferencia y la memoria ocupada. Los modelos basados en Transformer, como RTDETRv2, suelen requerir más memoria CUDA durante el entrenamiento y la inferencia que las CNN ligeras como DAMO-YOLO.

A continuación se incluye una comparación detallada de sus métricas de rendimiento.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Casos de uso ideales#

En qué destaca DAMO-YOLO: Gracias a su backbone optimizado mediante NAS y a su número excepcionalmente bajo de parámetros en las variantes más pequeñas (como DAMO-YOLOt), es muy adecuado para implementarse en hardware con recursos muy limitados. Si estás desarrollando soluciones para dispositivos integrados con runtimes como ONNX o motores TensorRT especializados para computación edge, DAMO-YOLO ofrece un framework muy ágil.

En qué destaca RTDETRv2: RTDETRv2 sobresale en escenarios con GPU de categoría servidor y en los que el contexto global de la imagen es fundamental. Su arquitectura Transformer le permite resolver de forma natural las cajas delimitadoras superpuestas sin NMS, lo que lo convierte en una opción robusta para la gestión de multitudes o el seguimiento de objetos complejos, donde las relaciones espaciales entre objetos distantes son esenciales.

La ventaja de Ultralytics: descubre YOLO26#

Aunque DAMO-YOLO y RTDETRv2 representan importantes logros académicos, convertir estos modelos en aplicaciones escalables y listas para producción puede resultar difícil. Los desarrolladores suelen encontrarse con bases de código fragmentadas, falta de compatibilidad con el aprendizaje multitarea y procesos de implementación complejos.

Aquí es donde el ecosistema de Ultralytics realmente marca la diferencia. Al priorizar la facilidad de uso, una API de Python bien mantenida y una versatilidad sin igual, Ultralytics permite a los desarrolladores dedicar menos tiempo a depurar y más a crear.

El recién lanzado modelo Ultralytics YOLO26 lleva estas ventajas al siguiente nivel con avances que superan a DAMO-YOLO y RTDETRv2:

  • Diseño integral sin NMS: Pionero originalmente en YOLOv10, YOLO26 ofrece un cabezal opcional de extremo a extremo (nms=False). Esto elimina el posprocesamiento con NMS, lo que agiliza el despliegue y lo simplifica drásticamente frente a las CNN tradicionales, a la vez que iguala las ventajas de salida directa de RTDETRv2.
  • Inferencia en CPU hasta un 43 % más rápida: YOLO26n funciona hasta un 43 % más rápido que YOLO11n en CPU ONNX y está muy optimizado para dispositivos de IA periférica sin GPU discreta, por lo que es una opción muy superior para aplicaciones IoT frente a los transformers que consumen mucha memoria.
  • Optimizador MuSGD: Inspirado en Kimi K2 de Moonshot AI, este híbrido de SGD y Muon incorpora innovaciones del entrenamiento de modelos de lenguaje grandes (LLM) a la visión artificial, lo que da lugar a un entrenamiento extraordinariamente estable y una convergencia más rápida.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, un ámbito en el que los modelos suelen tener dificultades. Esto es fundamental para las imágenes aéreas y las aplicaciones con drones.
  • Eliminación de DFL: Se ha eliminado Distribution Focal Loss para simplificar los formatos de exportación y mejorar la compatibilidad con dispositivos periféricos de bajo consumo.
  • Versatilidad sin igual: A diferencia de los modelos de la competencia, limitados estrictamente a la detección, YOLO26 incorpora mejoras específicas para cada tarea, como una pérdida angular especializada para las cajas delimitadoras orientadas (OBB), una pérdida de segmentación semántica para lograr precisión a nivel de píxel y la estimación de verosimilitud logarítmica residual (RLE) para la estimación de pose.
La eficiencia de memoria importa

El entrenamiento de modelos basados en Transformer, como RTDETRv2, requiere asignar enormes cantidades de memoria CUDA y suele hacer necesarios costosos sistemas con varias GPU. Los modelos YOLO de Ultralytics necesitan mucha menos memoria tanto durante el entrenamiento como durante la inferencia, lo que democratiza el desarrollo de IA para investigadores y aficionados.

Ejemplo de código: la API unificada de Ultralytics#

Una de las mayores ventajas del ecosistema Ultralytics es su API unificada. Puedes cargar, entrenar y validar sin problemas diversos modelos —incluida una implementación de RT-DETR en PyTorch y modelos YOLO de última generación— sin cambiar tu flujo de trabajo.

from ultralytics import RTDETR, YOLO

# Carga un modelo RT-DETR
model_rtdetr = RTDETR("rtdetr-l.pt")

# Carga el modelo YOLO26 de última generación
model_yolo = YOLO("yolo26n.pt")

# Ejecuta la inferencia en una imagen con una interfaz sencilla y unificada
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Muestra los objetos detectados
results_yolo[0].show()

Esta sencillez también se aplica al entrenamiento con conjuntos de datos personalizados y a la exportación. Con el paquete Python de Ultralytics, los desarrolladores pueden enviar fácilmente los pesos entrenados a plataformas de despliegue como CoreML u OpenVINO con un solo comando.

Conclusión y otras lecturas#

Tanto DAMO-YOLO como RTDETRv2 han ampliado indudablemente los límites de lo posible en la detección de objetos en tiempo real. DAMO-YOLO ofrece estructuras de red muy optimizadas y obtenidas mediante búsqueda automatizada para lograr una eficiencia bruta, mientras que RTDETRv2 demuestra que los transformers pueden competir en tiempo real al eliminar cuellos de botella tradicionales como NMS.

Sin embargo, para los desarrolladores que buscan el equilibrio óptimo entre rendimiento, documentación completa y preparación para producción, los modelos YOLO de Ultralytics siguen siendo la referencia. Con la llegada de YOLO26, los usuarios pueden acceder a detección opcional de extremo a extremo similar a la de los transformers, eficiencia de entrenamiento inspirada en los LLM y velocidades de CPU excepcionales, todo ello en un ecosistema intuitivo y robusto.

Si estás evaluando modelos para tu próximo proyecto, también te puede interesar leer nuestras comparativas de EfficientDet frente a RT-DETR, conocer la generación anterior YOLO11 o revisar referencias académicas como YOLOX. Empieza a crear hoy mismo con la guía de inicio rápido de Ultralytics.

Comentarios