RTDETRv2 frente a YOLOv5#
La evolución de la visión por ordenador se ha definido en gran medida por la búsqueda constante de un equilibrio entre la precisión y la velocidad de inferencia en tiempo real. Al comparar RTDETRv2 y Ultralytics YOLOv5, los desarrolladores sopesan esencialmente las sofisticadas capacidades de contexto global de las arquitecturas basadas en Transformer frente a la eficiencia altamente optimizada y probada en batalla de las Redes Neuronales Convolucionales (CNN).
Esta guía ofrece un análisis técnico exhaustivo de estas dos arquitecturas destacadas, detallando sus métricas de rendimiento, metodologías de entrenamiento, requisitos de memoria y escenarios de implementación ideales para ayudarte a elegir el mejor modelo de detección de objetos para tu caso de uso específico.
RTDETRv2: el enfoque Transformer para la detección en tiempo real#
A partir del Transformer de detección en tiempo real original (RT-DETR), RTDETRv2 introduce una serie de «ventajas gratuitas» para mejorar la arquitectura de referencia sin sacrificar su latencia de inferencia.
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Enlaces: Artículo de Arxiv, Repositorio de GitHub
Arquitectura y capacidades#
RTDETRv2 utiliza una arquitectura híbrida CNN-Transformer. La CNN actúa como backbone para extraer características visuales detalladas, mientras que las capas de codificador-decodificador del Transformer procesan todo el mapa de características para comprender el contexto global. Una de las principales características de RTDETRv2 es su naturaleza de extremo a extremo, que elimina por completo la necesidad del posprocesamiento de supresión no máxima (NMS).
Aunque RTDETRv2 logra una precisión impresionante —especialmente en escenas complejas y densas en las que los objetos se solapan—, presenta contrapartidas importantes. El mecanismo de atención inherente a los Transformer exige mucha más memoria CUDA durante el entrenamiento que las CNN estándar. Además, aunque funciona bien en GPU de gama alta como la NVIDIA A100 o la T4, su arquitectura es notablemente más lenta en CPU estándar y está gravemente limitada en dispositivos edge convencionales.
Ultralytics YOLOv5: el estándar del sector en eficiencia#
Ultralytics YOLOv5 cambió radicalmente el panorama del aprendizaje automático aplicado cuando se lanzó, al hacer accesible la visión por ordenador de alto rendimiento a desarrolladores de todo el mundo mediante un framework excepcionalmente intuitivo.
- Autor: Glenn Jocher
- Organización: Ultralytics
- Fecha: 26 de junio de 2020
- Enlaces: Documentación oficial, Repositorio de GitHub
Equilibrio entre ecosistema y rendimiento#
YOLOv5 se basa íntegramente en el framework PyTorch y utiliza una arquitectura CNN extremadamente eficiente. Se diseñó desde cero para facilitar el uso, con una API optimizada y una de las documentaciones más completas del sector de la IA.
La mayor ventaja de YOLOv5 reside en su versatilidad inigualable y sus bajos requisitos de memoria. Entrenar un modelo YOLOv5 requiere mucha menos VRAM que los modelos basados en Transformer, lo que lo hace accesible para investigadores e ingenieros con presupuestos de hardware limitados. Además, mientras que RTDETRv2 se centra exclusivamente en la detección de bounding boxes, YOLOv5 ha evolucionado hasta convertirse en una herramienta versátil compatible con la segmentación de instancias y la clasificación de imágenes.
Para disfrutar de un flujo de trabajo totalmente optimizado, puedes entrenar, validar e implementar YOLOv5 directamente mediante Ultralytics Platform. La plataforma ofrece capacidades de entrenamiento en la nube y pipelines de implementación sin código.
Comparación de rendimiento y métricas#
Al analizar el rendimiento bruto en el conjunto de datos COCO estándar, podemos observar diferencias claras en la forma en que estos modelos priorizan los recursos.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Análisis de las compensaciones#
Los datos revelan que RTDETRv2-x alcanza una precisión media promedio (mAP) máxima del 54,3 %, superando ligeramente el 50,7 % de YOLOv5x. Sin embargo, esta pequeña mejora de precisión tiene un coste computacional enorme. YOLOv5x funciona con una latencia menor (11,89 ms frente a 15,03 ms en TensorRT) y requiere una fracción de memoria. Para implementaciones edge de consumo ultrabajo, YOLOv5n (Nano) sigue sin tener rival: completa las inferencias en solo 1,12 ms con una diminuta huella de 2,6 M de parámetros, un nivel con el que RTDETRv2 ni siquiera intenta competir.
Eficiencia del entrenamiento y simplicidad del código#
Una de las principales fortalezas del ecosistema Ultralytics es su API unificada. Aunque decidas utilizar la arquitectura Transformer de RT-DETR para una tarea concreta de gran carga computacional, puedes hacerlo íntegramente dentro del paquete Ultralytics Python, intercambiando modelos sin problemas con una sola línea de código.
from ultralytics import RTDETR, YOLO
# Load the Ultralytics YOLOv5 small model
model_yolo = YOLO("yolov5s.pt")
# Load the RT-DETR large model via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")
# Train YOLOv5 effortlessly on your custom data
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference with both models seamlessly
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo[0].show()Al utilizar la biblioteca Ultralytics, los desarrolladores obtienen automáticamente acceso a un ecosistema bien mantenido que incluye integraciones de seguimiento de experimentos (como Weights & Biases y Comet ML) y exportaciones con un solo clic a formatos de implementación como ONNX y OpenVINO.
Aplicaciones en el mundo real y casos de uso ideales#
En qué destaca RTDETRv2#
RTDETRv2 es más adecuado para entornos en los que no existen limitaciones de hardware y el único objetivo es alcanzar la máxima precisión posible.
- Imagen médica en servidores: Detección de anomalías microscópicas en radiografías de alta resolución.
- Imágenes por satélite: Seguimiento de objetos densos y solapados en tareas de vigilancia aérea ejecutadas en potentes clústeres en la nube.
En qué domina YOLOv5#
YOLOv5 es el campeón indiscutible para la implementación práctica en el mundo real sobre hardware diverso.
- Dispositivos de IA edge: Implementación de sistemas de alarma de seguridad en Raspberry Pi o dispositivos NVIDIA Jetson con memoria estrictamente limitada.
- Aplicaciones móviles: Ejecución rápida y en tiempo real de inferencias de bounding boxes y segmentación directamente en smartphones mediante CoreML o TFLite.
- Fabricación industrial de alta velocidad: Inspección de piezas en líneas de producción rápidas, donde una latencia de milisegundos es fundamental para el éxito operativo.
Aunque YOLOv5 es un modelo legendario, el ecosistema Ultralytics amplía continuamente los límites de la IA. Si estás comparando modelos para un proyecto nuevo en 2026, deberías explorar el Ultralytics YOLO26 de última generación. YOLO26 incorpora un diseño nativo de extremo a extremo sin NMS (similar al de los Transformer, pero con la velocidad de las CNN), incluye el revolucionario optimizador MuSGD para un entrenamiento increíblemente estable y ofrece una inferencia en CPU hasta un 43 % más rápida. Como alternativa, YOLO11 sigue siendo una opción fantástica y con un amplio soporte para implementaciones versátiles que requieren estimación de poses y detección OBB.
En última instancia, aunque RTDETRv2 eleva el límite de precisión mediante capas Transformer, el framework YOLO de Ultralytics ofrece un equilibrio inigualable entre velocidad, bajos requisitos de memoria y una experiencia de desarrollo magníficamente diseñada que reduce drásticamente el tiempo desde el prototipo hasta la producción.