YOLOv5 frente a DAMO-YOLO#
El panorama de la visión artificial en tiempo real evoluciona continuamente, mientras investigadores e ingenieros buscan el equilibrio perfecto entre precisión, velocidad y facilidad de uso. Dos modelos destacados que han marcado este recorrido son Ultralytics YOLOv5 y DAMO-YOLO de Alibaba.
Esta guía ofrece un análisis técnico exhaustivo de sus arquitecturas, métricas de rendimiento y metodologías de entrenamiento para ayudarte a elegir el modelo adecuado para tu próximo despliegue.
Contexto de los modelos#
Antes de profundizar en los detalles técnicos, es importante comprender los orígenes y las principales filosofías de diseño de cada uno de estos influyentes modelos de visión.
Ultralytics YOLOv5#
Desarrollado por Glenn Jocher y el equipo de Ultralytics, YOLOv5 se ha convertido en un estándar del sector desde su lanzamiento. Creado de forma nativa en el framework PyTorch, priorizó desde el principio una experiencia de desarrollo sencilla y unas sólidas capacidades de despliegue.
- Autor: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Documentación: Documentación de Ultralytics YOLOv5
DAMO-YOLO#
Creado por investigadores de Alibaba Group, DAMO-YOLO se centra especialmente en la búsqueda de arquitecturas neuronales (NAS) y en técnicas avanzadas de destilación. Lleva al límite el rendimiento teórico específico del hardware y está especialmente orientado a la investigación y a entornos edge que requieren un ajuste extremo.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
Más información sobre DAMO-YOLO
Innovaciones arquitectónicas#
Ambos modelos aprovechan conceptos estructurales propios para lograr su rendimiento en tiempo real, aunque sus enfoques difieren considerablemente.
YOLOv5: estabilidad y versatilidad#
YOLOv5 utiliza una arquitectura troncal CSP modificada (parcial entre etapas), junto con un cuello PANet (red de agregación de rutas). Esta estructura es muy eficiente y minimiza el uso de memoria CUDA tanto durante el entrenamiento como durante la inferencia.
Una de las mayores ventajas de YOLOv5 es su versatilidad en distintas tareas. Además de predecir cuadros delimitadores, ofrece arquitecturas específicas para la segmentación de imágenes y la clasificación de imágenes, lo que permite a los desarrolladores estandarizar sus flujos de visión en torno a un único framework cohesionado.
DAMO-YOLO: búsqueda automatizada de arquitecturas#
La principal innovación de DAMO-YOLO es su arquitectura troncal MAE-NAS. Mediante una búsqueda guiada por la entropía máxima, el equipo de Alibaba descubrió arquitecturas troncales que equilibran dinámicamente la precisión de detección y la velocidad de inferencia.
Además, incorpora el cuello Efficient RepGFPN para mejorar la fusión de características, algo muy útil ante las complejas variaciones de escala que suelen encontrarse en el análisis de imágenes por satélite. Su diseño ZeroHead simplifica las capas finales de predicción para reducir la latencia, aunque esta compleja generación estructural puede volver la arquitectura rígida y más difícil de modificar para aplicaciones personalizadas.
Las arquitecturas basadas en Transformer suelen consumir mucha memoria VRAM. YOLOv5 y DAMO-YOLO utilizan diseños convolucionales eficientes para reducir el consumo de memoria, pero los modelos de Ultralytics están especialmente optimizados para GPU de consumo, lo que los hace mucho más accesibles para investigadores independientes y empresas emergentes.
Rendimiento y métricas#
Para evaluar los detectores de objetos en tiempo real, hay que tener en cuenta una combinación de mAP (precisión media promedio), velocidad de inferencia y parámetros de tamaño del modelo.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Aunque DAMO-YOLO logra puntuaciones de mAP muy competitivas con determinados números de parámetros, YOLOv5 ofrece sistemáticamente velocidades excepcionales con TensorRT y un número de parámetros increíblemente bajo en sus configuraciones nano y pequeñas. Este equilibrio de rendimiento permite que YOLOv5 funcione de forma eficiente en diversos escenarios de despliegue edge.
Eficiencia de entrenamiento y ecosistema#
La precisión teórica de un modelo solo es tan buena como su viabilidad práctica. Aquí es donde los modelos difieren considerablemente.
La complejidad de la destilación#
DAMO-YOLO depende en gran medida de una metodología de entrenamiento en varias etapas. Combina la asignación de etiquetas AlignedOTA con una técnica de destilación de conocimiento entre profesor y alumno. Aunque esto extrae el máximo rendimiento del modelo alumno, primero hay que entrenar un enorme modelo profesor. Esto aumenta drásticamente el tiempo de cálculo, los costes energéticos y los requisitos de hardware, lo que supone un cuello de botella para los equipos de ML ágiles.
La ventaja de Ultralytics: facilidad de uso#
En cambio, el ecosistema de Ultralytics es conocido en todo el mundo por sus API intuitivas y su eficiencia de entrenamiento. Gracias al desarrollo activo y a una enorme comunidad de código abierto, los desarrolladores pueden entrenar, validar y desplegar modelos sin complicaciones.
from ultralytics import YOLO
# Carga un modelo YOLOv5 preentrenado
model = YOLO("yolov5su.pt") # YOLOv5u: pesos de YOLOv5 sin anclajes para el paquete ultralytics
# Entrena fácilmente con un conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Exporta al formato ONNX para la implementación
model.export(format="onnx")Ultralytics también ofrece compatibilidad integrada con el seguimiento de experimentos mediante herramientas como Weights & Biases y Comet ML, lo que permite un flujo de trabajo sin fricciones.
Casos de uso reales#
- YOLOv5 destaca en entornos de producción dinámicos. Su sencilla exportación lo convierte en la opción ideal para la analítica del comercio minorista inteligente, la detección de defectos de fabricación a alta velocidad y la integración en aplicaciones móviles mediante CoreML.
- DAMO-YOLO es muy adecuado para evaluaciones comparativas académicas rigurosas y situaciones en las que se dispone de abundantes recursos computacionales para ejecutar largos entrenamientos con destilación, cuyo objetivo es obtener pequeñas mejoras de mAP para objetivos de hardware específicos y fijos.
Casos de uso y recomendaciones#
La elección entre YOLOv5 y DAMO-YOLO depende de los requisitos específicos de tu proyecto, las limitaciones de despliegue y tus preferencias de ecosistema.
Cuándo elegir YOLOv5#
YOLOv5 es una buena opción para:
- Sistemas de producción probados: despliegues existentes en los que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
- Entrenamiento con recursos limitados: entornos con recursos de GPU limitados, donde el pipeline de entrenamiento eficiente de YOLOv5 y sus menores requisitos de memoria suponen una ventaja.
- Amplia compatibilidad con formatos de exportación: proyectos que requieren despliegues en muchos formatos, como ONNX, TensorRT, CoreML y LiteRT.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO se recomienda para:
- Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con FPS elevados en una infraestructura fija de GPU NVIDIA, donde el rendimiento con lotes de tamaño 1 es la métrica principal.
- Líneas de fabricación industrial: Escenarios con estrictas limitaciones de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación sobre búsqueda de arquitecturas neuronales: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de las redes troncales reparametrizadas eficientes en el rendimiento de detección.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
La siguiente evolución: YOLO26#
Si empiezas un proyecto nuevo, te recomendamos encarecidamente que mires hacia el futuro. Ultralytics YOLO26 se basa en los extraordinarios cimientos de YOLOv5 e incorpora avances revolucionarios que redefinen la IA de visión de vanguardia.
Aclamado universalmente desde su lanzamiento, YOLO26 es nativamente integral. Incorpora un diseño integral sin NMS (nms=False) que omite el posprocesamiento de supresión no máxima para ofrecer un despliegue mucho más rápido y sencillo.
Entre las principales innovaciones de YOLO26 se incluyen:
- Optimizador MuSGD: Inspirada en innovaciones del entrenamiento de LLM, esta combinación de SGD y Muon garantiza entrenamientos muy estables y una convergencia rápida.
- Inferencia en CPU hasta un 43 % más rápida: Optimizado a fondo para la computación edge, es perfecto para dispositivos IoT que funcionan sin GPU dedicada.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran drásticamente el reconocimiento de objetos pequeños, algo fundamental para las imágenes aéreas captadas por drones y la robótica.
- Mejoras específicas para cada tarea: Desde una función de pérdida angular especializada para las cajas delimitadoras orientadas (OBB) hasta la estimación de verosimilitud logarítmica residual (RLE) para una estimación de pose precisa, YOLO26 gestiona con facilidad dominios complejos.
Conclusión#
YOLOv5 y DAMO-YOLO se han ganado un lugar en la historia de la detección de objetos. DAMO-YOLO sigue siendo un interesante caso de estudio sobre búsqueda de arquitecturas neuronales y destilación. Sin embargo, para las organizaciones que priorizan un ecosistema bien mantenido, la facilidad de uso y una vía rápida a producción, los modelos de Ultralytics siguen siendo incomparables.
Te recomendamos encarecidamente utilizar la plataforma Ultralytics para anotar, entrenar y desplegar la próxima generación de modelos, como YOLO26, y garantizar así que tu flujo de visión artificial esté preparado para el futuro, sea rápido y ofrezca una precisión extraordinaria.