RTDETRv2 frente a YOLO11#
El panorama de la visión artificial evoluciona constantemente, con nuevas arquitecturas que amplían los límites de lo posible en dispositivos perimetrales y servidores en la nube. Dos de los contendientes más destacados en el ámbito actual de la detección de objetos en tiempo real son RTDETRv2 y YOLO11. Aunque ambos modelos ofrecen un rendimiento excepcional, representan filosofías arquitectónicas fundamentalmente distintas: el enfoque basado en Transformer frente a la red neuronal convolucional (CNN) altamente optimizada.
En esta comparativa técnica exhaustiva, analizaremos las arquitecturas, las métricas de rendimiento, las metodologías de entrenamiento y los casos de uso ideales de ambos modelos para ayudarte a tomar una decisión informada para tu próxima aplicación de inteligencia artificial.
RTDETRv2: el rival basado en Transformer#
Presentado como una evolución del Transformer de detección en tiempo real original, RTDETRv2 aprovecha mecanismos de atención para procesar datos visuales. Al tratar los parches de imagen como secuencias, consigue una comprensión global del contexto de la imagen, algo muy beneficioso para detectar objetos muy solapados en escenas complejas.
Detalles del modelo:
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Arxiv: 2407.17140
- GitHub: Repositorio de RT-DETR
- Documentación: Documentación de RTDETRv2
Puntos fuertes y débiles de la arquitectura#
La principal innovación de RTDETRv2 es su arquitectura integral sin NMS. Al eliminar la supresión no máxima (NMS), simplifica el proceso de posprocesamiento. Además, sus capacidades de extracción de características multiescala han mejorado respecto al modelo RT-DETR original, lo que le permite identificar mejor objetos de distintos tamaños.
Sin embargo, al depender de Transformers, RTDETRv2 suele requerir mucha más memoria durante el entrenamiento. Por lo general, los Transformers tardan más en converger y necesitan bastante más memoria CUDA que las CNN tradicionales, por lo que resultan menos accesibles para los investigadores que trabajan con hardware de consumo o implementan en entornos de IA perimetral con recursos limitados.
Más información sobre RTDETRv2
Ultralytics YOLO11: la cumbre de la eficiencia de las CNN#
Tras años de investigación fundamental, Ultralytics lanzó YOLO11 como un gran salto adelante en la trayectoria de YOLO. Perfecciona la arquitectura CNN para lograr una velocidad y precisión sin precedentes, y mantiene la flexibilidad y el ecosistema intuitivo para desarrolladores que la comunidad espera.
Detalles del modelo:
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 27 de septiembre de 2024
- GitHub: Repositorio de Ultralytics
La ventaja de Ultralytics#
YOLO11 destaca por su equilibrio de rendimiento. Ofrece una relación extraordinaria entre velocidad y precisión, lo que lo hace excepcionalmente versátil para diversos escenarios de implementación reales, desde enormes clústeres de computación en la nube hasta dispositivos móviles ligeros.
Además, los modelos YOLO de Ultralytics son conocidos por su menor consumo de memoria durante el entrenamiento y la inferencia. A diferencia de los modelos Transformer, que pueden agotar fácilmente la VRAM, YOLO11 permite utilizar tamaños de lote mayores en GPU estándar. Asimismo, YOLO11 no se limita a la detección de objetos: ofrece una versatilidad increíble, con compatibilidad nativa con la segmentación de instancias, la clasificación de imágenes, la estimación de pose y las cajas delimitadoras orientadas (OBB).
Comparativa de rendimiento y métricas#
Al comparar las cifras en bruto, queda claro que, aunque RTDETRv2 alcanza una precisión impresionante, YOLO11 ofrece una selección de tamaños de modelo mucho más amplia y velocidades de inferencia superiores, especialmente en TensorRT.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Como se muestra en la tabla, el modelo YOLO11x alcanza un mAPval superior, del 54,7 %, con menos FLOPs (195,3B frente a 259B) y una inferencia más rápida en TensorRT (11,3 ms frente a 15,03 ms) que la variante RTDETRv2-x. Las variantes nano y small de YOLO11 ofrecen opciones ligeras sin igual para dispositivos con recursos limitados, como la Raspberry Pi.
Ecosistema, facilidad de uso y entrenamiento#
La característica que define a los modelos de Ultralytics es una experiencia de usuario optimizada. El paquete de Python ultralytics ofrece una API unificada e intuitiva que se encarga de las tareas complejas de aumento de datos, entrenamiento distribuido y exportación de modelos. Mientras que el repositorio de investigación de RTDETRv2 requiere mucho código repetitivo y configuración, Ultralytics ofrece un flujo de trabajo que te lleva de cero a experto.
Curiosamente, el ecosistema de Ultralytics es tan sólido que admite de forma nativa la ejecución de modelos RT-DETR junto a modelos YOLO. Esto te permite aprovechar el ecosistema bien mantenido de Ultralytics —incluidas las integraciones con Weights & Biases y Comet ML— para registrar experimentos sin esfuerzo.
from ultralytics import RTDETR, YOLO
# Carga un modelo RTDETR sin complicaciones mediante la API de Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")
# Carga un modelo YOLO11 altamente optimizado
model_yolo = YOLO("yolo11n.pt")
# Entrena YOLO11 con un uso de memoria muy eficiente
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exporta el modelo YOLO entrenado al formato ONNX
model_yolo.export(format="onnx")La eficiencia del entrenamiento es fundamental en el aprendizaje automático. Los modelos de Ultralytics utilizan pesos preentrenados que convergen rápidamente. Para gestionar tus conjuntos de datos, ejecuciones de entrenamiento y puntos de conexión de implementación sin escribir código, descubre la plataforma Ultralytics y disfruta de una experiencia MLOps integrada.
Aplicaciones en el mundo real#
La elección entre estas arquitecturas suele depender de las limitaciones de implementación específicas de tu proyecto.
Dónde destaca RTDETRv2: La base Transformer de RTDETRv2 es muy eficaz en situaciones con objetos densos y muy ocluidos que requieren contexto global. Suele evaluarse en investigación académica y aplicaciones en las que el presupuesto computacional importa menos que la asignación de relaciones mediante mecanismos de atención.
Dónde destaca YOLO11: YOLO11 es el líder indiscutible para la implementación práctica en entornos reales. Su reducido uso de memoria y su altísima velocidad de inferencia lo hacen ideal para:
- Fabricación inteligente: Ejecutar detección de defectos en tiempo real en líneas de producción mediante PC industriales.
- Agricultura: Implementarlo en drones para supervisar en tiempo real la salud de los cultivos y automatizar la robótica de recolección.
- Analítica para el comercio minorista: Procesar simultáneamente flujos de varias cámaras para gestionar colas y hacer un seguimiento del inventario sin necesitar enormes granjas de servidores.
Casos de uso y recomendaciones#
La elección entre RT-DETR y YOLO11 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir RT-DETR#
RT-DETR es una excelente opción para:
- Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
- Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
- Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.
Cuándo elegir YOLO11#
Se recomienda YOLO11 para:
- Despliegue periférico en producción: Aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
- Aplicaciones de visión multitarea: Proyectos que requieren detección, segmentación, estimación de poses y OBB dentro de un único framework unificado.
- Prototipado y despliegue rápidos: Equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la sencilla API de Python de Ultralytics.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
Perspectivas de futuro: llega YOLO26#
Si vas a empezar un proyecto nuevo, también deberías considerar la próxima generación de IA visual: Ultralytics YOLO26. Lanzado en enero de 2026, YOLO26 combina lo mejor de ambos mundos. Incorpora una cabeza integral opcional sin NMS (nms=False, presentada por primera vez en YOLOv10) que elimina el posprocesamiento NMS, igual que RTDETRv2, pero con la velocidad inigualable de una CNN.
YOLO26 incorpora el optimizador MuSGD, inspirado en las innovaciones del entrenamiento de LLM, para lograr una convergencia increíblemente estable y rápida, y ofrece una inferencia en CPU hasta un 43 % más rápida al eliminar Distribution Focal Loss (DFL). Gracias a sus funciones de pérdida especializadas ProgLoss + STAL, que mejoran notablemente el reconocimiento de objetos pequeños, YOLO26 es la recomendación definitiva para cualquier flujo de trabajo moderno de visión artificial.
Tanto si eliges YOLO11 por su versatilidad demostrada, RTDETRv2 por sus mecanismos de atención o el vanguardista YOLO26 por su máximo rendimiento en dispositivos perimetrales, la documentación de Ultralytics ofrece todos los recursos que necesitas para avanzar en tu trayectoria en visión artificial.