YOLO Vision 2026:

RTDETRv2 frente a DAMO-YOLO#

El panorama de la visión por computador evoluciona constantemente, mientras investigadores e ingenieros se esfuerzan por crear modelos que equilibren a la perfección la velocidad, la precisión y la eficiencia. Dos arquitecturas destacadas que han tenido un gran impacto en este ámbito son RTDETRv2, desarrollado por Baidu, y DAMO-YOLO, creado por Alibaba Group. Ambos modelos amplían los límites de la detección de objetos en tiempo real, pero adoptan filosofías arquitectónicas fundamentalmente diferentes para lograr sus impresionantes resultados.

En esta comparación técnica, analizaremos en profundidad sus arquitecturas, metodologías de entrenamiento y capacidades de implementación en el mundo real. También examinaremos cómo se comparan estos modelos con el ecosistema más amplio, especialmente con la Ultralytics Platform, altamente optimizada, y la arquitectura YOLO26 de vanguardia.

Innovaciones arquitectónicas#

Comprender los mecanismos fundamentales de estos modelos es crucial para los ingenieros de machine learning encargados de seleccionar la herramienta adecuada para entornos de producción.

RTDETRv2: el enfoque Transformer#

Basándose en el éxito del RT-DETR original, RTDETRv2 utiliza un codificador híbrido y un decodificador Transformer. Este diseño permite al modelo procesar el contexto global de forma muy eficaz, lo que lo hace especialmente bueno a la hora de distinguir entre objetos superpuestos en escenas densas. La ventaja más importante de esta arquitectura es su diseño nativo sin NMS (supresión no máxima). Al eliminar el paso de posprocesamiento de NMS, RTDETRv2 simplifica el flujo de inferencia y garantiza una latencia más estable en distintas configuraciones de hardware.

Más información sobre RTDETRv2

DAMO-YOLO: mejora de la eficiencia de las CNN#

DAMO-YOLO, por otro lado, sigue basándose en el exitoso linaje de YOLO basado en CNN, pero introduce varias mejoras revolucionarias. Utiliza la búsqueda de arquitectura neuronal (NAS) para optimizar su backbone y garantizar la máxima eficiencia en la extracción de características. Además, incorpora una RepGFPN (red piramidal de características generalizada reparametrizada) eficiente y un diseño ZeroHead, junto con las técnicas de mejora AlignedOTA y destilación. Estas innovaciones permiten a DAMO-YOLO lograr velocidades de inferencia rápidas y mantener al mismo tiempo una puntuación mAPval altamente competitiva.

Más información sobre DAMO-YOLO

Divergencia arquitectónica

Mientras que RTDETRv2 se centra en aprovechar los mecanismos de atención para comprender las características globales sin NMS, DAMO-YOLO maximiza la eficiencia de las CNN tradicionales mediante NAS y una destilación avanzada, por lo que requiere un posprocesamiento estándar, pero ofrece ventajas de velocidad diferenciadas en cierto hardware.

Comparación de rendimiento y métricas#

Al evaluar modelos para su implementación, las métricas de rendimiento, como la precisión media promedio (mAP), la velocidad de inferencia y el número de parámetros, son fundamentales. A continuación se muestra una comparación detallada de las dos familias de modelos.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Análisis de los resultados#

Como se observa en la tabla, RTDETRv2-x logra la mayor precisión, con un mAPval de 54.3, lo que demuestra la potencia de la arquitectura Transformer en validaciones complejas, como el conjunto de datos COCO. Sin embargo, esto implica un número de parámetros (76M) y FLOPs significativamente mayor.

Por el contrario, DAMO-YOLOt (Tiny) es excepcionalmente ligero y solo requiere 8.5M parámetros, lo que lo convierte en una opción increíblemente rápida para entornos en los que la memoria CUDA está muy restringida. DAMO-YOLO suele ofrecer una relación favorable entre velocidad y precisión para dispositivos edge antiguos.

Ecosistema, facilidad de uso y la ventaja de Ultralytics#

Aunque los repositorios independientes, como el GitHub oficial de RT-DETR y el GitHub de DAMO-YOLO, ofrecen el código fuente para entrenar estos modelos, integrarlos en flujos de producción suele requerir una gran cantidad de código auxiliar y optimización manual.

Aquí es donde el ecosistema de Ultralytics simplifica enormemente la experiencia de desarrollo. Ultralytics integra modelos como RTDETRv2 directamente en su API unificada, lo que permite entrenar, validar y exportar modelos con una sola línea de código. Además, los modelos de Ultralytics son conocidos por sus reducidos requisitos de memoria durante el entrenamiento en comparación con los repositorios independientes basados en Transformer de gran tamaño.

Ejemplo de código: integración fluida#

Así de fácil es aprovechar la biblioteca Python de Ultralytics para ejecutar inferencias. La API mantiene la coherencia tanto si utilizas un modelo Transformer como una CNN de vanguardia.

from ultralytics import RTDETR, YOLO

# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")

# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Display the results
results_yolo[0].show()
Exportación de modelos para producción

Con la API de Ultralytics, puedes exportar tus modelos entrenados fácilmente a formatos como TensorRT, ONNX o CoreML con un sencillo comando model.export(format="engine"), lo que reduce enormemente las dificultades de implementación.

Casos de uso ideales#

La elección entre estas arquitecturas depende por completo de los requisitos específicos de tu proyecto:

  • RTDETRv2 destaca en el procesamiento en servidores, donde la VRAM es abundante. Su capacidad para comprender el contexto global es perfecta para la imagen médica y el análisis de multitudes densas, donde las oclusiones son frecuentes.
  • DAMO-YOLO es especialmente adecuado para aplicaciones IoT embebidas y líneas de inspección industrial de movimiento rápido, donde el bajo número de parámetros y los FPS elevados son requisitos estrictos.

El futuro: Ultralytics YOLO26#

Aunque tanto RTDETRv2 como DAMO-YOLO tienen sus ventajas, el campo de la visión por computador avanza rápidamente. Para proyectos nuevos, la última Ultralytics YOLO26 representa la síntesis definitiva de velocidad, precisión y experiencia de desarrollo.

YOLO26 adopta un diseño de extremo a extremo sin NMS, que captura la principal ventaja de los Transformers sin la enorme sobrecarga computacional. Incorpora el innovador optimizador MuSGD, inspirado en el entrenamiento de modelos de lenguaje grandes, para lograr una convergencia estable y rápida. Además, gracias a la eliminación de DFL (se elimina Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos edge y de bajo consumo), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo convierte en el campeón indiscutible de la computación edge. Asimismo, ProgLoss + STAL proporciona funciones de pérdida mejoradas, con avances destacables en el reconocimiento de objetos pequeños, algo fundamental para IoT, la robótica y las imágenes aéreas.

A diferencia de los modelos limitados estrictamente a las cajas delimitadoras, la familia YOLO26 ofrece una versatilidad inigualable y admite tareas que van desde la segmentación de instancias y la estimación de poses hasta las cajas delimitadoras orientadas (OBB), todo ello gestionado fácilmente mediante la intuitiva Ultralytics Platform.

Explora YOLO26 en Platform

Detalles y referencias del modelo#

RTDETRv2#

DAMO-YOLO#

Si te interesa explorar otras comparaciones, consulta nuestras guías sobre RTDETRv2 frente a YOLO11 o DAMO-YOLO frente a YOLOv8 para ver cómo se comportan estos modelos frente a generaciones anteriores de la familia Ultralytics.

Comentarios