YOLOv9 frente a RTDETRv2#
El panorama de la detección de objetos en tiempo real ha experimentado un cambio de paradigma en los últimos años. Han surgido dos filosofías arquitectónicas diferenciadas que dominan el campo: las redes neuronales convolucionales altamente optimizadas (CNNs) y los transformadores de detección en tiempo real (DETRs). YOLOv9 y RTDETRv2 representan la culminación de estos dos enfoques.
Esta guía exhaustiva compara estos dos potentes modelos, analizando sus innovaciones arquitectónicas, métricas de rendimiento y escenarios de implementación ideales para ayudarte a elegir el modelo adecuado para tu flujo de trabajo de visión por ordenador.
Resumen ejecutivo#
Ambos modelos logran resultados de vanguardia, pero se adaptan a restricciones de implementación y ecosistemas de desarrollo ligeramente diferentes.
- Elige YOLOv9 si: necesitas un uso muy eficiente de los parámetros y una inferencia rápida en dispositivos periféricos. YOLOv9 lleva al límite teórico la eficiencia de las CNNs, por lo que es ideal para entornos con recursos computacionales estrictamente limitados.
- Elige RTDETRv2 si: necesitas la comprensión contextual matizada que proporcionan los Transformers, especialmente en escenas con oclusiones graves o relaciones complejas entre objetos, y dispones del hardware necesario para admitir una arquitectura algo más pesada.
- Elige YOLO26 (recomendado) si: quieres lo mejor de ambos mundos. Como la generación más reciente disponible en la plataforma Ultralytics, YOLO26 incorpora un diseño nativo de extremo a extremo sin NMS (similar al de los modelos DETR, pero mucho más rápido), que elimina los cuellos de botella del posprocesamiento y ofrece una inferencia en CPU hasta un 43 % más rápida que las generaciones anteriores.
Especificaciones técnicas y autoría#
Comprender los orígenes y la intención de diseño de estos modelos aporta un contexto fundamental para sus decisiones arquitectónicas.
YOLOv9#
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica
- Fecha: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
Obtén más información sobre RT-DETR
Innovaciones arquitectónicas#
YOLOv9: resolviendo el cuello de botella de información#
Ultralytics YOLOv9 introduce dos innovaciones principales diseñadas para abordar la pérdida de información a medida que los datos atraviesan redes neuronales profundas:
- Información de gradiente programable (PGI): este marco de supervisión auxiliar garantiza la generación de gradientes fiables para actualizar los pesos de la red, preservando información fundamental de las características incluso en capas muy profundas de la red.
- Red de agregación de capas eficiente generalizada (GELAN): una arquitectura novedosa que combina los puntos fuertes de CSPNet y ELAN. GELAN optimiza la eficiencia de los parámetros, lo que permite a YOLOv9 lograr una mayor precisión con menos FLOPs que las CNNs tradicionales.
RTDETRv2: mejora de los Transformers en tiempo real#
A partir del éxito del RT-DETR original, RTDETRv2 utiliza una arquitectura basada en Transformer que evita intrínsecamente la necesidad de aplicar supresión no máxima (NMS). Entre sus mejoras se incluyen:
- Estrategia Bag-of-Freebies: la iteración v2 incorpora técnicas avanzadas de entrenamiento y aumentos de datos que mejoran significativamente la precisión sin añadir ninguna sobrecarga a la latencia de inferencia.
- Codificador híbrido eficiente: al procesar características multiescala mediante un mecanismo de atención desacoplado intraescala y entre escalas, RTDETRv2 gestiona eficientemente el coste computacional tradicionalmente elevado de los Vision Transformers.
Mientras que RTDETRv2 aprovecha los Transformers para realizar detección sin NMS, la nueva arquitectura YOLO26 lo consigue de forma nativa dentro de una estructura CNN altamente optimizada, proporcionando la misma implementación optimizada, pero con velocidades de inferencia periférica muy superiores.
Comparación de rendimiento#
Al evaluar modelos para producción, el equilibrio entre precisión y requisitos computacionales es fundamental. La tabla siguiente describe el rendimiento de distintos tamaños de modelo en benchmarks estándar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Análisis#
Como muestran los datos, YOLOv9 mantiene una clara ventaja en eficiencia de parámetros. El modelo YOLOv9c alcanza unos impresionantes 53.0 mAP con solo 25.3M de parámetros, lo que lo hace increíblemente ligero.
Por el contrario, RTDETRv2 ofrece una fuerte competencia en las categorías de modelos medianos y grandes. Sin embargo, esto implica un mayor número de parámetros y una cantidad de FLOPs significativamente superior, algo habitual en los modelos Transformer. Esta diferencia arquitectónica también se refleja en el uso de memoria: los modelos YOLO suelen requerir mucha menos memoria CUDA durante el entrenamiento y la inferencia que sus equivalentes basados en Transformer.
La ventaja de Ultralytics: ecosistema y versatilidad#
Aunque las métricas puramente arquitectónicas son importantes, el ecosistema de software suele determinar el éxito de un proyecto de IA. Acceder a estos modelos avanzados mediante la API de Python de Ultralytics ofrece ventajas incomparables.
Entrenamiento e implementación optimizados#
Entrenar un transformador de detección normalmente requiere archivos de configuración complejos y GPU de gama alta. Al utilizar el marco de Ultralytics, los desarrolladores pueden entrenar tanto los modelos YOLOv9 como los modelos RT-DETR con una sintaxis idéntica y sencilla, beneficiándose de conductos de entrenamiento altamente eficientes y de pesos preentrenados fácilmente disponibles.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")Versatilidad de tareas sin igual#
Una limitación importante de los modelos especializados como RTDETRv2 es su enfoque restringido en la detección de cajas delimitadoras. En cambio, el ecosistema más amplio de Ultralytics, que incluye modelos como YOLO11 y YOLOv8, admite una amplia variedad de tareas de visión por ordenador. Esto incluye segmentación de instancias precisa a nivel de píxel, estimación de poses esqueléticas, clasificación de imágenes completas y detección de cajas delimitadoras orientadas (OBB) para imágenes aéreas.
Aplicaciones en el mundo real#
Análisis periférico de alta velocidad#
Para entornos minoristas o líneas de fabricación que requieren reconocimiento de productos en tiempo real en dispositivos periféricos, YOLOv9 es la opción superior. Su arquitectura GELAN garantiza un alto rendimiento en hardware limitado, como la serie NVIDIA Jetson, lo que permite automatizar el control de calidad sin una latencia significativa.
Análisis de escenas complejas#
En situaciones como la supervisión de multitudes densas o intersecciones de tráfico complejas, donde los objetos se ocultan con frecuencia entre sí, los mecanismos de atención global de RTDETRv2 destacan. La capacidad del modelo para razonar de forma nativa sobre el contexto de toda la imagen le permite mantener un seguimiento y una detección sólidos incluso cuando los objetos están parcialmente ocultos.
Casos de uso y recomendaciones#
Elegir entre YOLOv9 y RT-DETR depende de los requisitos específicos de tu proyecto, las restricciones de implementación y tus preferencias en cuanto al ecosistema.
Cuándo elegir YOLOv9#
YOLOv9 es una buena opción para:
- Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
- Estudios de optimización del flujo de gradientes: Investigación centrada en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
- Evaluación comparativa de detección de alta precisión: Escenarios en los que se necesita el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO como punto de referencia para comparar arquitecturas.
Cuándo elegir RT-DETR#
RT-DETR se recomienda para:
- Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
- Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
- Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
El futuro: llega YOLO26#
Aunque YOLOv9 y RTDETRv2 representan logros extraordinarios, el campo de la visión por ordenador avanza rápidamente. Para los desarrolladores que quieran iniciar nuevos proyectos, YOLO26 es la solución de vanguardia recomendada.
Lanzado en 2026, YOLO26 incorpora las mejores características de las CNNs y los DETRs. Cuenta con un diseño de extremo a extremo sin NMS, que elimina por completo la latencia del posprocesamiento, una técnica introducida por primera vez en YOLOv10. Además, YOLO26 elimina Distribution Focal Loss (DFL) para mejorar la compatibilidad con dispositivos periféricos e introduce el revolucionario optimizador MuSGD. Inspirado en el entrenamiento de modelos de lenguaje de gran tamaño, concretamente en Kimi K2 de Moonshot AI, este optimizador híbrido garantiza una estabilidad de entrenamiento sin precedentes y una convergencia más rápida.
Junto con funciones de pérdida mejoradas como ProgLoss y STAL para lograr un reconocimiento excepcional de objetos pequeños, YOLO26 ofrece una inferencia en CPU hasta un 43 % más rápida, consolidando su posición como el modelo definitivo para las implementaciones modernas de IA.