Ultralytics YOLO27:

Comparativa entre YOLOv5 y DAMO-YOLO#

El panorama de la visión artificial en tiempo real evoluciona continuamente, mientras investigadores e ingenieros buscan el equilibrio perfecto entre precisión, velocidad y usabilidad. Dos modelos destacados que han marcado este recorrido son Ultralytics YOLOv5 y DAMO-YOLO de Alibaba.

Esta guía ofrece un análisis técnico exhaustivo de sus arquitecturas, métricas de rendimiento y metodologías de entrenamiento para ayudarte a elegir el modelo adecuado para tu próximo despliegue.

Antecedentes de los modelos#

Antes de profundizar en los matices técnicos, es importante entender los orígenes y las principales filosofías de diseño de cada uno de estos influyentes modelos de visión.

Ultralytics YOLOv5#

Desarrollado por Glenn Jocher y el equipo de Ultralytics, YOLOv5 se ha convertido en un estándar del sector desde su lanzamiento. Creado de forma nativa sobre el framework PyTorch, priorizó una experiencia de desarrollo simplificada y sólidas capacidades de despliegue desde el primer momento.

DAMO-YOLO#

Creado por investigadores del Grupo Alibaba, DAMO-YOLO se centra especialmente en la Búsqueda de arquitectura neuronal (NAS) y en técnicas avanzadas de destilación. Amplía los límites teóricos del rendimiento específico del hardware y está especialmente orientado a entornos de investigación y edge que requieren un ajuste extremo.

Más información sobre DAMO-YOLO

Innovaciones arquitectónicas#

Ambos modelos aprovechan conceptos estructurales únicos para lograr su rendimiento en tiempo real, aunque sus enfoques difieren considerablemente.

YOLOv5: estabilidad y versatilidad#

YOLOv5 utiliza un backbone CSP modificado (Etapas parciales cruzadas), combinado con un neck PANet (Red de agregación de rutas). Esta estructura es muy eficiente y minimiza el uso de memoria de CUDA tanto durante el entrenamiento como durante la inferencia.

Una de las mayores fortalezas de YOLOv5 es su versatilidad en distintas tareas. Además de las predicciones de cajas delimitadoras, ofrece arquitecturas específicas para la segmentación de imágenes y la clasificación de imágenes, lo que permite a los desarrolladores estandarizar sus pipelines de visión en torno a un único framework cohesionado.

DAMO-YOLO: búsqueda automatizada de arquitectura#

La innovación principal de DAMO-YOLO es su MAE-NAS Backbone. Mediante una búsqueda guiada por máxima entropía, el equipo de Alibaba descubrió estructuras dorsales que equilibran dinámicamente la precisión de detección y la velocidad de inferencia.

Además, incorpora el neck Efficient RepGFPN para mejorar la fusión de características, algo muy beneficioso para las complejas variaciones de escala que suelen observarse en el análisis de imágenes satelitales. Su diseño ZeroHead simplifica las capas de predicción finales para reducir la latencia, aunque esta compleja generación estructural puede hacer que la arquitectura sea rígida y más difícil de modificar para aplicaciones personalizadas.

Requisitos de memoria

Las arquitecturas basadas en Transformer suelen tener problemas por su elevado consumo de VRAM. Tanto YOLOv5 como DAMO-YOLO utilizan diseños convolucionales eficientes para mantener bajo el consumo de memoria, pero los modelos de Ultralytics están notablemente optimizados para GPU de consumo, lo que los hace mucho más accesibles para investigadores independientes y startups.

Rendimiento y métricas#

Evaluar detectores de objetos en tiempo real requiere analizar una matriz de mAP (precisión media promedio), velocidad de inferencia y parámetros de tamaño del modelo.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Aunque DAMO-YOLO logra puntuaciones de mAP muy competitivas con ciertos números de parámetros, YOLOv5 demuestra sistemáticamente velocidades excepcionales con TensorRT y un número de parámetros increíblemente bajo en sus configuraciones nano y small. Este equilibrio de rendimiento garantiza que YOLOv5 funcione de forma eficiente en diversos escenarios de despliegue edge.

Eficiencia de entrenamiento y ecosistema#

La precisión teórica de un modelo solo es tan buena como su viabilidad práctica de implementación. Aquí es donde los modelos divergen considerablemente.

La complejidad de la destilación#

DAMO-YOLO depende en gran medida de una metodología de entrenamiento de múltiples etapas. Combina la asignación de etiquetas AlignedOTA con una técnica de destilación de conocimiento de profesor a alumno. Aunque esto extrae el máximo rendimiento del modelo alumno, requiere entrenar inicialmente un modelo profesor masivo. Esto incrementa drásticamente el tiempo de cálculo, los costes energéticos y el hardware necesario, lo que plantea un cuello de botella para los equipos de ML ágiles.

La ventaja de Ultralytics: facilidad de uso#

Por el contrario, el ecosistema de Ultralytics es mundialmente conocido por sus API intuitivas y su eficiencia de entrenamiento. Gracias al desarrollo activo y a una enorme comunidad de código abierto, los desarrolladores pueden entrenar, validar y desplegar modelos sin complicaciones.

from ultralytics import YOLO

# Load a pretrained YOLOv5 model
model = YOLO("yolov5s.pt")

# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export to ONNX format for deployment
model.export(format="onnx")

Ultralytics también ofrece compatibilidad integrada con el seguimiento de experimentos mediante herramientas como Weights & Biases y Comet ML, creando un flujo de trabajo sin fricciones.

Casos de uso reales#

  • YOLOv5 destaca en entornos de producción dinámicos. Su sencilla capacidad de exportación lo convierte en la opción principal para la analítica de comercios inteligentes, la detección de defectos de fabricación a alta velocidad y la integración en aplicaciones móviles mediante CoreML.
  • DAMO-YOLO es especialmente adecuado para pruebas comparativas académicas estrictas y escenarios en los que se dispone de abundantes recursos computacionales para ejecutar largos entrenamientos destilados, orientados a obtener mejoras fraccionales de mAP para objetivos de hardware específicos y fijos.

Casos de uso y recomendaciones#

La elección entre YOLOv5 y DAMO-YOLO depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOv5#

YOLOv5 es una buena opción para:

  • Sistemas de producción probados: Implementaciones existentes en las que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
  • Entrenamiento con recursos limitados: Entornos con recursos de GPU limitados en los que resultan ventajosos el eficiente flujo de entrenamiento de YOLOv5 y sus menores requisitos de memoria.
  • Amplia compatibilidad con formatos de exportación: Proyectos que requieren implementarse en muchos formatos, incluidos ONNX, TensorRT, CoreML y TFLite.

Cuándo elegir DAMO-YOLO#

DAMO-YOLO se recomienda para:

  • Análisis de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con un FPS elevado en una infraestructura GPU NVIDIA fija, donde el rendimiento con batch-1 es la métrica principal.
  • Líneas industriales de fabricación: Situaciones con estrictas restricciones de latencia GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
  • Investigación sobre búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de los backbones reparametrizados eficientes en el rendimiento de la detección.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La próxima evolución: YOLO26#

Si vas a iniciar un proyecto nuevo, te recomendamos encarecidamente mirar hacia el futuro. Ultralytics YOLO26 se basa en los sólidos cimientos de YOLOv5 e incorpora avances revolucionarios que redefinen la IA de visión de vanguardia.

¿Por qué actualizar a YOLO26?

Lanzado con una acogida unánime, YOLO26 es nativo de extremo a extremo. Incorpora un diseño de extremo a extremo sin NMS, que elimina por completo el posprocesamiento de supresión no máxima y permite un despliegue considerablemente más rápido y sencillo.

Entre las principales innovaciones de YOLO26 se incluyen:

  • Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de LLM, esta combinación híbrida de SGD y Muon garantiza un entrenamiento muy estable y una convergencia rápida.
  • Hasta un 43 % más rápido en inferencia con CPU: Está fuertemente optimizado para edge computing, por lo que resulta perfecto para dispositivos IoT que funcionan sin GPU dedicadas.
  • ProgLoss + STAL: Funciones de pérdida avanzadas que mejoran drásticamente el reconocimiento de objetos pequeños, algo fundamental para las imágenes aéreas de drones y la robótica.
  • Mejoras específicas por tarea: Desde una función de pérdida de ángulo especializada para las cajas delimitadoras orientadas (OBB) hasta la estimación de log-verosimilitud residual (RLE) para una estimación de la pose precisa, YOLO26 gestiona dominios complejos con facilidad.

Conclusión#

YOLOv5 y DAMO-YOLO se han consolidado en la historia de la detección de objetos. DAMO-YOLO sigue siendo un estudio fascinante sobre Búsqueda de arquitectura neuronal y destilación. Sin embargo, para las organizaciones que priorizan un ecosistema bien mantenido, la facilidad de uso y un camino rápido hacia producción, los modelos de Ultralytics siguen siendo incomparables.

Te recomendamos encarecidamente utilizar la Plataforma Ultralytics para anotar, entrenar y desplegar la próxima generación de modelos, como YOLO26, y garantizar que tu pipeline de visión artificial esté preparado para el futuro, sea rápido y ofrezca una precisión extraordinaria.

Lecturas adicionales#

  • Explora el RT-DETR basado en Transformer para aplicaciones de alta precisión.
  • Conoce el modelo de la generación anterior YOLO11.
  • Descubre cómo optimizar los despliegues con OpenVINO.

Comentarios