Ultralytics YOLO27:
Get Started

DAMO-YOLO frente a YOLOv5#

La evolución de la visión artificial ha estado marcada por la innovación continua en la detección de objetos en tiempo real. Hoy en día, los desarrolladores e investigadores cuentan con multitud de opciones arquitectónicas al diseñar procesos de visión. Esta completa comparación técnica analiza las diferencias entre DAMO-YOLO y Ultralytics YOLOv5, y destaca sus respectivas arquitecturas, metodologías de entrenamiento, métricas de rendimiento y escenarios de implementación ideales.

Introducción a DAMO-YOLO#

DAMO-YOLO, lanzado por Alibaba Group, introdujo varias técnicas novedosas destinadas a ampliar los límites de la velocidad y la precisión de detección.

Más información sobre DAMO-YOLO

Innovaciones arquitectónicas#

DAMO-YOLO se basa en la búsqueda de arquitecturas neuronales (NAS). Sus autores utilizaron MAE-NAS para diseñar automáticamente backbones que equilibran la latencia y la precisión. El modelo introduce Efficient RepGFPN (red piramidal de características generalizada reparametrizada), que mejora la fusión de características en distintas escalas. Además, DAMO-YOLO incorpora un diseño «ZeroHead», que elimina las complejas cabezas de predicción con múltiples ramas en favor de una estructura más sencilla y eficiente, basada en gran medida en la reparametrización durante la inferencia.

Para mejorar el entrenamiento, el modelo utiliza AlignedOTA para asignar etiquetas y un proceso intensivo de destilación, en el que un modelo «docente» más grande guía a otro «estudiante» más pequeño para que alcance una mayor precisión.

Introducción a Ultralytics YOLOv5#

Ultralytics YOLOv5 es una de las arquitecturas de visión más adoptadas del mundo, reconocida por su estabilidad, facilidad de uso y amplio ecosistema de implementación.

El estándar del ecosistema#

YOLOv5 redefinió el estándar del sector en cuanto a facilidad de uso. Desarrollado de forma nativa en PyTorch, utiliza un backbone CSPNet muy optimizado y un neck PANet para agregar características de forma robusta. Aunque apareció antes de la tendencia hacia los modelos sin anclajes que se observa en modelos posteriores, su enfoque basado en anclajes, muy perfeccionado y combinado con el aprendizaje automático de anclajes, garantiza un excelente rendimiento desde el primer momento.

La verdadera fortaleza de YOLOv5 reside en su ecosistema bien mantenido. Se integra a la perfección con herramientas de seguimiento como Comet y Weights & Biases, y admite exportaciones con un solo clic a formatos como ONNX, TensorRT y CoreML.

Primeros pasos con YOLOv5

Es muy fácil entrenar YOLOv5 con conjuntos de datos personalizados. Su API optimizada reduce las dificultades del paso del prototipo a producción, por lo que es uno de los favoritos de los equipos de ingeniería ágiles.

Comparativa de rendimiento y métricas#

Al comparar estos modelos, es fundamental tener en cuenta el equilibrio entre la precisión media (mAP), la velocidad de inferencia y el número de parámetros.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7

Análisis de las ventajas e inconvenientes#

DAMO-YOLO logra puntuaciones mAP impresionantes para su número de parámetros, en gran medida gracias a su fase de entrenamiento por destilación. Sin embargo, esto tiene un coste en eficiencia de entrenamiento. El proceso de destilación en varias etapas exige entrenar primero un modelo docente de gran tamaño, lo que aumenta considerablemente el tiempo de cómputo en GPU necesario y la VRAM requerida.

Por el contrario, YOLOv5 ofrece unos requisitos de memoria excelentes. Los modelos YOLO de Ultralytics son conocidos por consumir menos memoria durante el entrenamiento y la inferencia que los complejos procesos de destilación o los modelos basados en Transformer, como RT-DETR. Esto permite entrenar YOLOv5 de manera eficiente en hardware de consumo o en entornos de nube accesibles, como Google Colab.

Aplicaciones reales y versatilidad#

La elección de la arquitectura adecuada suele depender del entorno de implementación.

En qué destaca DAMO-YOLO#

DAMO-YOLO es exclusivamente un modelo de detección de objetos. Es una excelente opción para la investigación académica, especialmente para los equipos que estudian la búsqueda de arquitecturas neuronales o que buscan reproducir las técnicas de reparametrización detalladas en el artículo. Si un proyecto dispone de amplios recursos computacionales para ejecutar la fase de entrenamiento por destilación y se centra únicamente en exprimir hasta la última fracción de precisión en cajas delimitadoras 2D, DAMO-YOLO es una opción muy sólida.

La ventaja de Ultralytics#

Para la producción en el mundo real, la facilidad de uso y la versatilidad de los modelos de Ultralytics los convierten en la opción preferida. Aunque YOLOv5 sigue siendo un referente para la detección y la clasificación de imágenes, el ecosistema más amplio de Ultralytics permite a los desarrolladores cambiar de tarea sin esfuerzo.

Por ejemplo, las versiones más recientes de la familia Ultralytics admiten de forma nativa la segmentación de instancias, la estimación de poses y la detección de cajas delimitadoras orientadas (OBB). Esta capacidad multitarea permite a los equipos utilizar una única API de Python unificada para procesos complejos, como combinar el reconocimiento automático de matrículas con la segmentación de vehículos.

Casos de uso y recomendaciones#

La elección entre DAMO-YOLO y YOLOv5 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir DAMO-YOLO#

DAMO-YOLO es una buena opción para:

  • Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con FPS elevados en una infraestructura fija de GPU NVIDIA, donde el rendimiento con lotes de tamaño 1 es la métrica principal.
  • Líneas de fabricación industrial: Escenarios con estrictas limitaciones de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
  • Investigación sobre búsqueda de arquitecturas neuronales: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de las redes troncales reparametrizadas eficientes en el rendimiento de detección.

Cuándo elegir YOLOv5#

Se recomienda YOLOv5 para:

  • Sistemas de producción probados: despliegues existentes en los que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
  • Entrenamiento con recursos limitados: entornos con recursos de GPU limitados, donde el pipeline de entrenamiento eficiente de YOLOv5 y sus menores requisitos de memoria suponen una ventaja.
  • Amplia compatibilidad con formatos de exportación: proyectos que requieren despliegues en muchos formatos, como ONNX, TensorRT, CoreML y LiteRT.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

El futuro: dar el salto a YOLO26#

YOLOv5 es legendario y DAMO-YOLO ofrece interesantes perspectivas académicas, pero la tecnología de vanguardia ha evolucionado. Lanzado en enero de 2026, Ultralytics YOLO26 supone un gran salto adelante para la comunidad de visión artificial.

YOLO26 aborda los cuellos de botella tradicionales de la implementación en edge y la inestabilidad del entrenamiento:

  • Diseño integral sin NMS: La cabeza opcional de extremo a extremo de YOLO26 (nms=False) elimina el postprocesamiento de supresión no máxima. Este avance simplifica la lógica de implementación y reduce drásticamente la variabilidad de la latencia, por lo que resulta ideal para la robótica de alta velocidad y los sistemas autónomos.
  • Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de LLM (como Kimi K2 de Moonshot AI), YOLO26 utiliza el optimizador MuSGD (una combinación de SGD y Muon). Esto garantiza entrenamientos muy estables y una convergencia notablemente más rápida.
  • Inferencia en CPU hasta un 43 % más rápida: Al eliminar estratégicamente Distribution Focal Loss (DFL), YOLO26n funciona hasta un 43 % más rápido que YOLO11n en CPU con ONNX, y ofrece más velocidad en CPU y dispositivos edge que sus predecesores, como YOLO11 y YOLOv8.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental para analizar imágenes aéreas captadas por drones y datos de sensores IoT.

Ejemplo de código: la sencillez en acción#

El paquete de Ultralytics te permite entrenar e implementar modelos con solo unas pocas líneas de código. Tanto si utilizas YOLOv5 como si te pasas al recomendado YOLO26, la interfaz sigue siendo coherente e intuitiva.

from ultralytics import YOLO

# Carga el modelo pequeño YOLO26 de última generación
model = YOLO("yolo26s.pt")

# Entrena fácilmente con un conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Ejecuta la inferencia en una imagen y muestra los resultados
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# Exporta el modelo para implementarlo en dispositivos edge
model.export(format="onnx")

Conclusión#

Tanto DAMO-YOLO como YOLOv5 han contribuido significativamente al campo de la visión artificial. DAMO-YOLO demuestra el potencial de la búsqueda de arquitecturas neuronales y la destilación, por lo que resulta interesante para los investigadores. Sin embargo, YOLOv5 sigue siendo una herramienta práctica y potente gracias a su equilibrio entre rendimiento, sus bajos requisitos de memoria y su facilidad de uso sin igual.

Para los desarrolladores que hoy comienzan nuevos proyectos, la recomendación es aprovechar la Ultralytics Platform y adoptar YOLO26. Combina el apreciado ecosistema de YOLOv5, fácil de usar, con avances arquitectónicos revolucionarios, lo que garantiza una precisión de primer nivel y una inferencia rapidísima tanto para aplicaciones de IA en la nube como en edge. Según las limitaciones específicas del hardware antiguo, los desarrolladores también pueden explorar otros modelos eficientes, como YOLOv6 o YOLOX.

Comentarios