Ultralytics YOLO27:

YOLO11 frente a RTDETRv2#

El panorama de la visión por computador se ha ampliado rápidamente, ofreciendo a los desarrolladores multitud de opciones para crear aplicaciones de visión robustas. En el ámbito de la detección de objetos en tiempo real, el debate entre las Redes neuronales convolucionales (CNNs) y los Transformers de visión (ViTs) es más relevante que nunca. Esta comparación técnica analiza dos arquitecturas líderes: YOLO11, que representa la cima de los frameworks CNN altamente optimizados, y RTDETRv2, una potente evolución de la familia Detection Transformer.

Al analizar sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales, esta guía pretende ayudar a los ingenieros de machine learning a tomar decisiones informadas. Aunque ambos modelos llevan la precisión al límite, los modelos de Ultralytics YOLO suelen ofrecer un equilibrio superior entre velocidad, compatibilidad con el ecosistema y facilidad de uso en producción real.

YOLO11: el referente de la versatilidad en el mundo real#

Presentado por Ultralytics, YOLO11 se basa en años de investigación fundamental para ofrecer un modelo rápido, preciso e increíblemente versátil. Está diseñado para gestionar de forma nativa detección de objetos, segmentación de instancias, clasificación de imágenes, estimación de poses y extracción de cajas delimitadoras orientadas (OBB).

Arquitectura y puntos fuertes#

YOLO11 cuenta con una columna vertebral CNN refinada y pirámides de características espaciales avanzadas, lo que lo hace excepcionalmente eficiente en el uso de recursos. Destaca en entornos con restricciones estrictas de hardware, ofreciendo una huella de memoria mínima tanto durante el entrenamiento como durante la inferencia. La Ultralytics Platform proporciona soporte nativo para YOLO11, permitiendo una monitorización de modelos optimizada, anotación de datos y entrenamiento en la nube sin necesidad de unir herramientas de MLOps dispares.

Para los desarrolladores que se dirigen a la computación en el edge, YOLO11 ofrece una latencia ultrabaja. Su naturaleza ligera le permite ejecutarse de forma eficiente en dispositivos que van desde Raspberry Pi hasta teléfonos móviles de consumo, lo que lo convierte en un estándar para el comercio minorista inteligente, el control de calidad en fabricación y la gestión automatizada del tráfico.

RTDETRv2: Transformers en tiempo real de Baidu#

RTDETRv2 (Transformer de detección en tiempo real, versión 2) representa el esfuerzo de Baidu por hacer viables las arquitecturas basadas en Transformers para tareas en tiempo real. Se basa en el RT-DETR original e incorpora un enfoque de «bag-of-freebies» para mejorar la precisión de referencia sin aumentar la latencia de inferencia.

Obtén más información sobre RT-DETR

Arquitectura y puntos fuertes#

A diferencia de las CNN tradicionales, RTDETRv2 emplea una arquitectura codificador-decodificador con mecanismos de autoatención, lo que le permite capturar el contexto global de una imagen. Esto resulta especialmente ventajoso en escenas concurridas, donde las oclusiones son frecuentes. RTDETRv2 elimina la necesidad de aplicar supresión no máxima (NMS) durante el posprocesamiento y utiliza, en su lugar, el emparejamiento húngaro durante el entrenamiento para realizar un emparejamiento bipartito uno a uno.

Sin embargo, los modelos Transformer son conocidos por su elevado consumo de memoria VRAM y CUDA. Entrenar RTDETRv2 desde cero o ajustarlo con datasets personalizados suele requerir clústeres de GPU de gama alta considerables, lo que puede suponer un obstáculo para equipos pequeños y ágiles frente a la ligera huella de entrenamiento de los modelos de Ultralytics.

Análisis del rendimiento y las métricas#

Al evaluar estos modelos con el dataset COCO estándar, observamos compensaciones claras entre el número de parámetros, los FLOPs y la precisión absoluta.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Desglose de los resultados#

Como se observa en la tabla, YOLO11 ofrece una increíble relación entre rendimiento y tamaño. YOLO11x alcanza un mAPval superior (54.7) al de RTDETRv2-x (54.3), utilizando muchos menos parámetros (56.9M frente a 76M) y una cantidad de FLOPs computacionales muy inferior (194.9B frente a 259B).

Además, las velocidades de inferencia de YOLO11 en T4 TensorRT son excepcionalmente rápidas. YOLO11s completa la inferencia en solo 2.5 ms, mientras que el RTDETRv2-s más pequeño tarda 5.03 ms. Esto convierte a YOLO11 en la opción definitiva para flujos de analítica de vídeo de alta velocidad y en tiempo real, donde el tiempo de procesamiento de cada fotograma es el principal cuello de botella.

El coste de los Transformers

Aunque RTDETRv2 logra una precisión excelente mediante sus capas de atención, estos mecanismos escalan cuadráticamente con la resolución de la imagen, lo que provoca un mayor consumo de VRAM tanto durante el entrenamiento como durante la inferencia. YOLO11 evita este problema con sus bloques convolucionales altamente eficientes.

Ecosistema de entrenamiento y facilidad de uso#

La principal ventaja de adoptar un modelo de Ultralytics reside en el ecosistema que lo rodea. Entrenar RTDETRv2 suele implicar navegar por repositorios complejos propios de la investigación, ajustar pesos intrincados de la función de pérdida de emparejamiento bipartito y gestionar una sobrecarga de memoria considerable.

Por el contrario, Ultralytics se centra especialmente en la experiencia del desarrollador. La API unificada de Python abstrae el código repetitivo, se integra perfectamente con herramientas como Weights & Biases para el seguimiento de experimentos y gestiona automáticamente los aumentos de datos.

Así de sencillo es entrenar y exportar un modelo utilizando el paquete ultralytics:

from ultralytics import YOLO

# Initialize YOLO11 model with pre-trained weights
model = YOLO("yolo11n.pt")

# Train the model efficiently on a local GPU or cloud instance
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Utilize CUDA GPU
)

# Export the trained model to ONNX for widespread deployment
export_path = model.export(format="onnx")

Una vez entrenado, exportar un modelo YOLO11 a formatos como ONNX, OpenVINO o CoreML solo requiere un comando, lo que garantiza que tu pipeline de visión pueda escalar sin esfuerzo en diversos backends de hardware.

Capacidades multitarea

Recuerda que, mientras que RTDETRv2 se centra exclusivamente en la detección de cajas delimitadoras, la arquitectura YOLO11 admite de forma nativa la estimación de poses y la segmentación de instancias, lo que te permite consolidar varias tareas de visión en una única familia de modelos.

Casos de uso y recomendaciones#

La elección entre YOLO11 y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias en cuanto al ecosistema.

Cuándo elegir YOLO11#

YOLO11 es una opción sólida para:

  • Despliegue periférico en producción: aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
  • Aplicaciones de visión multitarea: proyectos que requieren detección, segmentación, estimación de pose y OBB dentro de un único framework unificado.
  • Prototipado y despliegue rápidos: equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la optimizada API de Python de Ultralytics.

Cuándo elegir RT-DETR#

RT-DETR se recomienda para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

De cara al futuro: el potencial de YOLO26#

Aunque YOLO11 es una excelente opción para producción, los equipos que busquen lo último en innovación deberían considerar seriamente YOLO26. Lanzado en enero de 2026, YOLO26 cierra la brecha arquitectónica al incorporar directamente en su núcleo un diseño end-to-end sin NMS (desarrollado por primera vez en YOLOv10), eliminando por completo la latencia del posprocesamiento y la complejidad de la lógica de implementación.

YOLO26 también incorpora varias funciones revolucionarias:

  • Optimizador MuSGD: Inspirado en las técnicas de entrenamiento de LLM de Kimi K2, de Moonshot AI, este híbrido de SGD y Muon garantiza un entrenamiento increíblemente estable y una convergencia mucho más rápida.
  • Eliminación de DFL: Se ha eliminado Distribution Focal Loss para conseguir un proceso de exportación más limpio y sencillo, mejorando considerablemente la compatibilidad con dispositivos edge de bajo consumo.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños, un requisito fundamental para la vigilancia con drones, la supervisión agrícola y los sensores edge de IoT.
  • Hasta un 43 % más de velocidad en la inferencia con CPU: Para implementaciones que no dispongan de GPU dedicadas, YOLO26 está optimizado específicamente para ejecutarse en CPU y supera ampliamente a las generaciones anteriores.

Si te interesa explorar una gama más amplia de arquitecturas, la documentación de Ultralytics también ofrece información sobre YOLOv8, el ampliamente adoptado YOLOv5 y modelos especializados como YOLO-World para aplicaciones de detección con vocabulario abierto. En última instancia, tanto si priorizas la estabilidad demostrada de YOLO11 como las innovaciones revolucionarias de YOLO26, el ecosistema de Ultralytics proporciona herramientas excepcionales para dar vida a tus soluciones de visión por computador.

Comentarios