Ultralytics YOLO27:

RTDETRv2 frente a YOLO11#

El panorama de la visión artificial evoluciona constantemente, con nuevas arquitecturas que amplían los límites de lo posible en dispositivos edge y servidores en la nube. Dos de los contendientes más destacados en el ámbito actual de la detección de objetos en tiempo real son RTDETRv2 y YOLO11. Aunque ambos modelos ofrecen un rendimiento excepcional, representan filosofías arquitectónicas fundamentalmente diferentes: el enfoque basado en Transformer frente a la red neuronal convolucional (CNN) altamente optimizada.

En esta completa comparación técnica, analizaremos las arquitecturas, las métricas de rendimiento, las metodologías de entrenamiento y los casos de uso ideales de ambos modelos para ayudarte a tomar una decisión informada para tu próxima aplicación de inteligencia artificial.

RTDETRv2: el competidor basado en Transformer#

Presentado como una evolución del Transformer de detección en tiempo real original, RTDETRv2 utiliza mecanismos de atención para procesar datos visuales. Al tratar los parches de imagen como secuencias, consigue una comprensión global del contexto de la imagen, lo que resulta muy beneficioso para detectar objetos muy solapados en escenas complejas.

Detalles del modelo:

Puntos fuertes y débiles de la arquitectura#

La principal innovación de RTDETRv2 es su arquitectura de extremo a extremo sin NMS. Al eliminar la supresión no máxima (NMS), simplifica la canalización de posprocesamiento. Además, sus capacidades de extracción de características multiescala han mejorado con respecto al modelo RT-DETR original, lo que le permite identificar mejor objetos de distintos tamaños.

Sin embargo, como depende de Transformers, RTDETRv2 suele requerir bastante más memoria durante el entrenamiento. Por lo general, los Transformers convergen más despacio y necesitan mucha más memoria CUDA que las CNN tradicionales, lo que los hace menos accesibles para investigadores que trabajan con hardware de consumo o que realizan despliegues en entornos de IA edge con recursos limitados.

Obtén más información sobre RT-DETR

Ultralytics YOLO11: la cumbre de la eficiencia de las CNN#

Basándose en años de investigación fundamental, Ultralytics presentó YOLO11 como un salto enorme en la evolución de YOLO. Perfecciona la arquitectura CNN para lograr una velocidad y precisión sin precedentes, manteniendo la flexibilidad y el ecosistema intuitivo para desarrolladores que la comunidad espera.

Detalles del modelo:

La ventaja de Ultralytics#

YOLO11 destaca por su equilibrio de rendimiento. Consigue un equilibrio extraordinario entre velocidad y precisión, lo que lo hace excepcionalmente versátil para diversos escenarios de despliegue reales, desde enormes clústeres de computación en la nube hasta dispositivos móviles ligeros.

Además, los modelos YOLO de Ultralytics son conocidos por su menor uso de memoria durante el entrenamiento y la inferencia. A diferencia de los modelos Transformer, que pueden agotar fácilmente la VRAM, YOLO11 permite utilizar tamaños de lote mayores en GPU estándar. Asimismo, YOLO11 no se limita a la detección de objetos; ofrece una versatilidad extraordinaria, con compatibilidad nativa con la segmentación de instancias, la clasificación de imágenes, la estimación de poses y las cajas delimitadoras orientadas (OBB).

Comparación de rendimiento y métricas#

Al comparar las cifras brutas, resulta evidente que, aunque RTDETRv2 alcanza una precisión impresionante, YOLO11 ofrece una selección mucho más granular de tamaños de modelo con velocidades de inferencia superiores, especialmente en TensorRT.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Como se muestra en la tabla, el modelo YOLO11x alcanza un mAPval superior del 54,7 %, utiliza menos FLOPs (194.9B frente a 259B) y ofrece una inferencia más rápida en TensorRT (11.3ms frente a 15.03ms) que la variante RTDETRv2-x. Las variantes nano y small de YOLO11 ofrecen opciones ligeras sin precedentes para dispositivos con recursos limitados, como Raspberry Pi.

Ecosistema, facilidad de uso y entrenamiento#

La característica que define a los modelos de Ultralytics es su experiencia de usuario optimizada. El paquete de Python ultralytics proporciona una API unificada e intuitiva que se encarga de la ampliación de datos, el entrenamiento distribuido y la exportación de modelos. Mientras que el repositorio de investigación de RTDETRv2 requiere una cantidad considerable de código repetitivo y configuración, Ultralytics ofrece una canalización «de cero a experto».

Curiosamente, el ecosistema de Ultralytics es tan sólido que permite ejecutar modelos RT-DETR junto con modelos YOLO de forma nativa. Esto te permite aprovechar el ecosistema bien mantenido de Ultralytics —incluidas las integraciones con Weights & Biases y Comet ML— para realizar un seguimiento sencillo de los experimentos.

from ultralytics import RTDETR, YOLO

# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")

# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")
Simplifica tu flujo de trabajo

La eficiencia del entrenamiento es fundamental en el aprendizaje automático. Los modelos de Ultralytics utilizan pesos preentrenados que convergen rápidamente. Para gestionar tus conjuntos de datos, ejecuciones de entrenamiento y endpoints de despliegue sin escribir código, explora Ultralytics Platform y disfruta de una experiencia MLOps integrada.

Aplicaciones en el mundo real#

La elección entre estas arquitecturas suele depender de las limitaciones específicas de despliegue de tu proyecto.

Dónde destaca RTDETRv2: La arquitectura troncal Transformer de RTDETRv2 resulta muy eficaz en escenarios con objetos densos y muy ocluidos que requieren contexto global. Suele evaluarse en investigación académica y en aplicaciones donde el presupuesto computacional preocupa menos que el mapeo puro de relaciones basado en la atención.

Dónde domina YOLO11: YOLO11 es el campeón indiscutible del despliegue práctico en el mundo real. Su reducida huella de memoria y sus velocidades de inferencia fulminantes lo hacen ideal para:

  • Fabricación inteligente: ejecutar la detección de defectos en tiempo real en líneas de producción mediante PC industriales.
  • Agricultura: desplegarlo en drones para supervisar en tiempo real el estado de los cultivos y utilizar robots de cosecha automatizada.
  • Análisis minorista: procesar simultáneamente múltiples flujos de cámaras para gestionar colas y hacer un seguimiento del inventario sin necesitar enormes granjas de servidores.

Casos de uso y recomendaciones#

La elección entre RT-DETR y YOLO11 depende de los requisitos específicos de tu proyecto, las limitaciones de despliegue y tus preferencias respecto al ecosistema.

Cuándo elegir RT-DETR#

RT-DETR es una buena opción para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir YOLO11#

YOLO11 se recomienda para:

  • Despliegue periférico en producción: aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
  • Aplicaciones de visión multitarea: proyectos que requieren detección, segmentación, estimación de pose y OBB dentro de un único framework unificado.
  • Prototipado y despliegue rápidos: equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la optimizada API de Python de Ultralytics.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

De cara al futuro: la llegada de YOLO26#

Si estás empezando un proyecto nuevo, también deberías considerar la próxima generación de IA para visión: Ultralytics YOLO26. Lanzado en enero de 2026, YOLO26 incorpora lo mejor de ambos mundos. Introduce un diseño de extremo a extremo sin NMS (presentado por primera vez en YOLOv10), eliminando por completo la latencia del posprocesamiento, al igual que RTDETRv2, pero con la velocidad inigualable de una CNN.

YOLO26 incorpora el optimizador MuSGD —inspirado en las innovaciones del entrenamiento de LLM— para lograr una convergencia increíblemente estable y rápida, y ofrece hasta un 43 % más de velocidad de inferencia en CPU al eliminar Distribution Focal Loss (DFL). Con sus funciones de pérdida especializadas ProgLoss + STAL, que mejoran enormemente el reconocimiento de objetos pequeños, YOLO26 es la recomendación definitiva para cualquier canal moderno de visión artificial.

Tanto si eliges YOLO11 por su versatilidad demostrada, RTDETRv2 por sus mecanismos de atención o el vanguardista YOLO26 para obtener el máximo rendimiento en dispositivos edge, la documentación de Ultralytics ofrece todos los recursos necesarios para alcanzar el éxito en tu trayectoria de visión artificial.

Comentarios