Ultralytics YOLO27:
Get Started

YOLO11 frente a RTDETRv2#

El panorama de la visión artificial se ha ampliado rápidamente y ofrece a los desarrolladores una gran variedad de opciones para crear aplicaciones de visión sólidas. En el ámbito de la detección de objetos en tiempo real, el debate entre las redes neuronales convolucionales (CNN) y los Transformers de visión (ViT) es más relevante que nunca. Esta comparativa técnica analiza en profundidad dos arquitecturas punteras: YOLO11, que representa la máxima expresión de los marcos CNN altamente optimizados, y RTDETRv2, una potente versión de la familia Detection Transformer.

Al analizar sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales, esta guía pretende ayudar a los ingenieros de aprendizaje automático a tomar decisiones fundamentadas. Aunque ambos modelos amplían los límites de la precisión, los modelos Ultralytics YOLO suelen ofrecer un equilibrio superior entre velocidad, compatibilidad con el ecosistema y facilidad de uso para la producción en el mundo real.

YOLO11: el referente en versatilidad para el mundo real#

Presentado por Ultralytics, YOLO11 se basa en años de investigación fundamental para ofrecer un modelo rápido, preciso e increíblemente versátil. Está diseñado para gestionar de forma nativa y fluida la detección de objetos, la segmentación de instancias, la clasificación de imágenes, la estimación de pose y la extracción de cajas delimitadoras orientadas (OBB).

Arquitectura y puntos fuertes#

YOLO11 incorpora una red troncal CNN refinada y pirámides avanzadas de características espaciales, que lo hacen excepcionalmente eficiente en el uso de recursos. Funciona especialmente bien en entornos con estrictas limitaciones de hardware y ocupa muy poca memoria tanto durante el entrenamiento como durante la inferencia. La plataforma Ultralytics ofrece compatibilidad nativa con YOLO11, lo que facilita la supervisión de modelos, la anotación de datos y el entrenamiento en la nube, sin necesidad de combinar distintas herramientas de MLOps.

Para los desarrolladores que trabajan con computación en el borde, YOLO11 ofrece una latencia ultrabaja. Su ligereza le permite ejecutarse de forma eficiente en dispositivos que van desde Raspberry Pi hasta móviles de consumo, lo que lo convierte en un estándar para el comercio minorista inteligente, el control de calidad en la fabricación y la gestión automatizada del tráfico.

RTDETRv2: Transformers en tiempo real de Baidu#

RTDETRv2 (Detection Transformer en tiempo real, versión 2) representa el esfuerzo de Baidu por hacer viables las arquitecturas basadas en Transformer para tareas en tiempo real. Se basa en el RT-DETR original e incorpora un enfoque de «bolsa de trucos» para mejorar la precisión de referencia sin aumentar la latencia de inferencia.

Más información sobre RTDETRv2

Arquitectura y puntos fuertes#

A diferencia de las CNN tradicionales, RTDETRv2 emplea una arquitectura codificador-decodificador con mecanismos de autoatención, lo que le permite captar el contexto global de una imagen. Esto resulta especialmente ventajoso en escenas concurridas, donde las oclusiones son frecuentes. RTDETRv2 elimina la necesidad de aplicar la supresión no máxima (NMS) durante el posprocesamiento y, en su lugar, utiliza el emparejamiento húngaro durante el entrenamiento para realizar un emparejamiento bipartito uno a uno.

Sin embargo, los modelos Transformer consumen mucha memoria VRAM y CUDA. Entrenar RTDETRv2 desde cero o ajustarlo con conjuntos de datos personalizados suele requerir clústeres de GPU de gama alta y gran capacidad, lo que puede suponer un obstáculo para los equipos pequeños y ágiles frente al reducido consumo de memoria durante el entrenamiento de los modelos de Ultralytics.

Análisis del rendimiento y las métricas#

Al evaluar estos modelos con el conjunto de datos COCO estándar, observamos claras compensaciones entre el número de parámetros, los FLOPs y la precisión bruta.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Análisis de los resultados#

Como muestra la tabla, YOLO11 ofrece una relación rendimiento-tamaño extraordinaria. YOLO11x alcanza un mAPval más alto (54,7) que RTDETRv2-x (54,3), con muchos menos parámetros (56,9 M frente a 76 M) y muchos menos FLOPs computacionales (195,3 B frente a 259 B).

Además, las velocidades de inferencia de YOLO11 con TensorRT en T4 son excepcionalmente altas. YOLO11s completa la inferencia en solo 2,5 ms, mientras que el RTDETRv2-s más pequeño tarda 5,03 ms. Por ello, YOLO11 es la opción definitiva para flujos de analítica de vídeo en tiempo real y alta velocidad, en los que el tiempo de procesamiento de los fotogramas es el principal cuello de botella.

El coste de los Transformers

Aunque RTDETRv2 logra una precisión excelente gracias a sus capas de atención, estos mecanismos escalan cuadráticamente con la resolución de imagen, lo que aumenta el consumo de memoria VRAM tanto durante el entrenamiento como durante la inferencia. YOLO11 evita este problema con sus bloques convolucionales de gran eficiencia.

Ecosistema de entrenamiento y facilidad de uso#

La principal ventaja de adoptar un modelo de Ultralytics reside en el ecosistema que lo rodea. Entrenar RTDETRv2 suele implicar desenvolverse en repositorios de investigación complejos, ajustar pesos de pérdida intrincados para el emparejamiento bipartito y gestionar un consumo de memoria considerable.

En cambio, Ultralytics se centra especialmente en la experiencia del desarrollador. La API Python unificada abstrae el código repetitivo, se integra perfectamente con herramientas como Weights & Biases para el seguimiento de experimentos y gestiona automáticamente los aumentos de datos.

Así de sencillo es entrenar y exportar un modelo con el paquete ultralytics:

from ultralytics import YOLO

# # Inicializa el modelo YOLO11 con pesos preentrenados
model = YOLO("yolo11n.pt")

# # Entrena el modelo de forma eficiente en una GPU local o una instancia en la nube
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # # Utiliza una GPU CUDA
)

# # Exporta el modelo entrenado a ONNX para su implementación generalizada
export_path = model.export(format="onnx")

Una vez entrenado, exportar un modelo YOLO11 a formatos como ONNX, OpenVINO o CoreML solo requiere un comando, lo que permite ampliar fácilmente tu flujo de visión a distintos backends de hardware.

Capacidades multitarea

Recuerda que RTDETRv2 se centra exclusivamente en la detección de cajas delimitadoras, mientras que la arquitectura YOLO11 admite de forma nativa la segmentación de instancias y la estimación de pose, lo que te permite consolidar varias tareas de visión en una sola familia de modelos.

Casos de uso y recomendaciones#

La elección entre YOLO11 y RT-DETR depende de los requisitos concretos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir YOLO11#

YOLO11 es una excelente opción para:

  • Despliegue periférico en producción: Aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
  • Aplicaciones de visión multitarea: Proyectos que requieren detección, segmentación, estimación de poses y OBB dentro de un único framework unificado.
  • Prototipado y despliegue rápidos: Equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la sencilla API de Python de Ultralytics.

Cuándo elegir RT-DETR#

RT-DETR está recomendado para:

  • Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
  • Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
  • Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

De cara al futuro: el potencial de YOLO26#

Aunque YOLO11 es una excelente opción para producción, los equipos que busquen la tecnología más avanzada deberían considerar seriamente YOLO26. Publicado en enero de 2026, YOLO26 salva la brecha arquitectónica al incorporar directamente en su núcleo una cabeza opcional integral y sin NMS (nms=False, pionera en YOLOv10), que elimina la latencia del posprocesamiento NMS y la complejidad de la lógica de implementación.

YOLO26 también incorpora varias características revolucionarias:

  • Optimizador MuSGD: Inspirado en las técnicas de entrenamiento de LLM de Kimi K2, de Moonshot AI, esta combinación de SGD y Muon garantiza un entrenamiento increíblemente estable y una convergencia mucho más rápida.
  • Eliminación de DFL: Se ha eliminado Distribution Focal Loss para simplificar y agilizar la exportación, y mejorar drásticamente la compatibilidad con dispositivos de borde de bajo consumo.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para la vigilancia con drones, la supervisión agrícola y los sensores IoT de borde.
  • Inferencia en CPU hasta un 43 % más rápida: Para las implementaciones que no disponen de GPU dedicadas, YOLO26 está optimizado específicamente para ejecutarse en CPU y supera con creces a las generaciones anteriores.

Si te interesa explorar una gama más amplia de arquitecturas, la documentación de Ultralytics también ofrece información sobre YOLOv8, el ampliamente adoptado YOLOv5 y modelos especializados como YOLO-World para aplicaciones de detección con vocabulario abierto. En definitiva, tanto si priorizas la estabilidad demostrada de YOLO11 como las innovaciones revolucionarias de YOLO26, el ecosistema de Ultralytics ofrece herramientas inigualables para hacer realidad tus soluciones de visión artificial.

Comentarios