Ultralytics YOLO27:

YOLOv5 frente a RTDETRv2#

El panorama de la visión artificial se ha ampliado considerablemente en los últimos años, ofreciendo a los desarrolladores una amplia variedad de arquitecturas para abordar tareas visuales complejas. Entre los paradigmas más populares se encuentran las redes neuronales convolucionales (CNNs) y los transformadores de detección (DETRs).

Esta guía ofrece una comparación técnica exhaustiva entre dos modelos fundamentales de estas categorías: Ultralytics YOLOv5, un modelo basado en CNN muy eficiente y ampliamente adoptado, y RTDETRv2, un detector de objetos en tiempo real basado en Transformer de última generación.

Ultralytics YOLOv5: el estándar del sector en eficiencia#

Desde su lanzamiento, Ultralytics YOLOv5 se ha convertido en un pilar fundamental de la comunidad de IA, impulsando miles de aplicaciones comerciales y proyectos de investigación en todo el mundo. Desarrollado íntegramente sobre el framework PyTorch, priorizó una experiencia intuitiva para los desarrolladores sin comprometer el rendimiento en tiempo real.

Características principales:

Arquitectura y puntos fuertes#

YOLOv5 utiliza una arquitectura CNN optimizada, diseñada para maximizar la eficiencia de la extracción de características y mantener al mismo tiempo un consumo de memoria extremadamente bajo. Emplea un backbone CSPDarknet y un neck PANet, creando una potente combinación para la fusión de características a múltiples escalas.

Una de las principales ventajas de YOLOv5 es su equilibrio de rendimiento. Logra un equilibrio excepcional entre velocidad y precisión, lo que lo convierte en una opción ideal para el despliegue de modelos en hardware con recursos limitados, como los dispositivos NVIDIA Jetson y los smartphones.

Además, YOLOv5 destaca por su versatilidad incomparable. A diferencia de los modelos limitados estrictamente a las predicciones de cajas delimitadoras, YOLOv5 admite de forma nativa la clasificación de imágenes y la segmentación de instancias, proporcionando un framework unificado para diversas tareas visuales. Su eficiencia de entrenamiento también es notable, ya que requiere bastante menos memoria CUDA durante el entrenamiento que las arquitecturas basadas en Transformer.

Puntos débiles#

Al depender de un framework CNN más antiguo, YOLOv5 utiliza inherentemente la supresión no máxima (NMS) durante el posprocesamiento para eliminar cajas delimitadoras duplicadas. Aunque está muy optimizada dentro del framework Ultralytics, la NMS puede introducir ocasionalmente cuellos de botella de latencia en NPU de edge especializadas.

RTDETRv2: Transformers en tiempo real de Baidu#

RTDETRv2 (transformador de detección en tiempo real v2) representa un avance considerable en la aplicación de arquitecturas Transformer a la detección de objetos en tiempo real, ya que aborda las ineficiencias computacionales que históricamente afectaban a los DETR estándar.

Características principales:

Arquitectura y puntos fuertes#

RTDETRv2 se basa en su predecesor y utiliza un encoder híbrido y un diseño de decoder flexible para procesar imágenes. El mecanismo de autoatención del Transformer proporciona al modelo una comprensión global del contexto de la imagen, lo que le permite obtener un rendimiento excepcional en escenas complejas con una oclusión grave de los objetos.

Una característica definitoria de RTDETRv2 es su diseño de extremo a extremo sin NMS. Al predecir directamente las consultas de objetos sin requerir cajas ancla ni posprocesamiento con NMS, simplifica el pipeline de inferencia. Esta arquitectura alcanza un mAP (precisión media promedio) impresionante en conjuntos de datos de referencia como COCO.

Puntos débiles#

A pesar de sus capacidades en tiempo real, RTDETRv2 tiene unos requisitos de memoria notablemente superiores a los de los modelos YOLO. Los mecanismos de atención de los Transformer escalan cuadráticamente con la longitud de la secuencia, lo que puede provocar errores de memoria insuficiente durante el entrenamiento a alta resolución si no se utilizan clústeres de GPU de gran tamaño. Además, carece de la versatilidad inmediata del ecosistema Ultralytics, ya que se centra principalmente en la detección de objetos 2D sin compatibilidad nativa con la segmentación ni la estimación de pose.

Obtén más información sobre RT-DETR

Tabla comparativa de rendimiento#

Para evaluar objetivamente estas arquitecturas, hemos recopilado sus métricas de rendimiento. Los valores resaltados en negrita representan las métricas más eficientes o con mejor rendimiento en las escalas probadas.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Contexto del rendimiento

Aunque RTDETRv2-x alcanza el mAP absoluto más alto, requiere casi 30 veces más parámetros que YOLOv5n. Para aplicaciones de alta velocidad que se ejecutan en hardware limitado, los modelos de Ultralytics ofrecen sistemáticamente la mejor eficiencia computacional.

La ventaja del ecosistema de Ultralytics#

Al pasar un modelo de un cuaderno de investigación a un entorno de producción, el software que rodea al modelo es tan importante como la arquitectura de la red neuronal. El ecosistema bien mantenido que proporciona Ultralytics acelera drásticamente el ciclo de desarrollo.

Facilidad de uso incomparable#

Los modelos de Ultralytics priorizan una experiencia de usuario extraordinariamente sencilla. Tanto si quieres entrenar un modelo personalizado como ejecutar una validación o exportarlo a formatos específicos de hardware, como TensorRT u ONNX, la API de Python de Ultralytics te permite hacerlo con tan solo unas líneas de código.

Aquí tienes un ejemplo de código práctico que muestra lo sencillo que es entrenar y ejecutar inferencias con un modelo de Ultralytics:

from ultralytics import YOLO

# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
inference_results[0].show()

Esta API sencilla y unificada admite de forma nativa integraciones de seguimiento de experimentos con herramientas como Weights & Biases y Comet, lo que permite a los desarrolladores registrar métricas sin problemas y sin escribir código repetitivo complejo.

Casos de uso y recomendaciones#

La elección entre YOLOv5 y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOv5#

YOLOv5 es una buena opción para:

  • Sistemas de producción probados: Implementaciones existentes en las que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
  • Entrenamiento con recursos limitados: Entornos con recursos de GPU limitados en los que resultan ventajosos el eficiente flujo de entrenamiento de YOLOv5 y sus menores requisitos de memoria.
  • Amplia compatibilidad con formatos de exportación: Proyectos que requieren implementarse en muchos formatos, incluidos ONNX, TensorRT, CoreML y TFLite.

Cuándo elegir RT-DETR#

RT-DETR se recomienda para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

De cara al futuro: YOLO11 y YOLO26#

Si hoy vas a iniciar un proyecto nuevo de visión artificial, te recomendamos encarecidamente explorar las últimas generaciones de modelos de Ultralytics.

Aunque YOLOv5 sigue siendo increíblemente fiable, YOLO11 ofrece una precisión mejorada y un conjunto ampliado de tareas, incluida la detección de cajas delimitadoras orientadas (OBB).

Y, lo que es aún más importante, el vanguardista YOLO26 combina lo mejor de ambos mundos. Implementa un diseño de extremo a extremo sin NMS (desarrollado inicialmente en YOLOv10), eliminando la sobrecarga del posprocesamiento y manteniendo al mismo tiempo la eficiencia de una CNN. YOLO26 también introduce el optimizador MuSGD, inspirado en las innovaciones del entrenamiento de LLM, para lograr una convergencia más rápida. Con la eliminación de DFL (se elimina Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos edge y de bajo consumo), YOLO26 ofrece una inferencia en CPU hasta un 43 % más rápida, lo que lo convierte en la mejor opción para la IA en edge. Además, ProgLoss + STAL proporciona funciones de pérdida mejoradas, con avances notables en el reconocimiento de objetos pequeños, algo fundamental para el IoT, la robótica y las imágenes aéreas.

Conclusión#

La elección entre YOLOv5 y RTDETRv2 depende en gran medida de las limitaciones de tu despliegue. RTDETRv2 amplía los límites del mAP mediante potentes mecanismos de atención de Transformer, pero conlleva un coste elevado en memoria y sobrecarga computacional.

Por el contrario, Ultralytics YOLOv5 ofrece una solución probada, muy optimizada y versátil que funciona sin problemas en cualquier entorno, desde servidores en la nube hasta microcontroladores. Para los equipos que buscan la máxima precisión posible junto con herramientas de despliegue fluidas, actualizarse dentro del ecosistema Ultralytics a YOLO26 proporciona la solución de última generación definitiva para las aplicaciones modernas de IA de visión.

Comentarios