DAMO-YOLO frente a YOLOv9#
El panorama de la detección de objetos en tiempo real sigue evolucionando a un ritmo vertiginoso. Mientras los equipos de ingeniería y los investigadores se esfuerzan por lograr el equilibrio perfecto entre precisión, velocidad de inferencia y eficiencia computacional, han surgido dos arquitecturas destacadas de la comunidad investigadora: DAMO-YOLO y YOLOv9. Ambos modelos introducen importantes innovaciones arquitectónicas destinadas a ampliar los límites de lo posible en visión artificial.
Esta guía técnica detallada ofrece un análisis exhaustivo de estos dos modelos y compara sus enfoques arquitectónicos únicos, sus metodologías de entrenamiento y sus capacidades de implementación en entornos reales. También analizaremos cómo el ecosistema de software más amplio desempeña un papel crucial en el desarrollo moderno de la IA, destacando las ventajas de plataformas integradas como Ultralytics Platform y de modelos de nueva generación como YOLO26.
Resumen ejecutivo: elige la arquitectura adecuada#
Aunque ambos modelos representan hitos importantes en la investigación del aprendizaje profundo, responden a filosofías de implementación ligeramente diferentes.
DAMO-YOLO destaca en entornos donde se puede utilizar una búsqueda intensiva de arquitecturas neuronales (NAS) para obtener perfiles de rendimiento específicos, lo que lo convierte en un objeto de estudio interesante para implementaciones personalizadas en el edge. Por el contrario, YOLOv9 se centra especialmente en resolver los cuellos de botella de información del aprendizaje profundo y ofrece una eficiencia de parámetros excepcionalmente alta.
Sin embargo, para implementaciones listas para producción, los equipos de ingeniería recomiendan constantemente aprovechar el ecosistema de Ultralytics unificado. Para proyectos nuevos, el modelo YOLO26 más reciente ofrece lo mejor de ambos mundos: precisión de última generación combinada con un diseño nativo de extremo a extremo que elimina la necesidad de un posprocesamiento complejo.
Aunque DAMO-YOLO y YOLOv9 son modelos académicos potentes, implementarlos en producción suele requerir una labor considerable de ingeniería personalizada. Usar Ultralytics YOLO26 proporciona acceso a un rendimiento de vanguardia mediante una API optimizada y fácil de mantener.
Especificaciones técnicas y autoría#
Comprender los orígenes y el enfoque de desarrollo de estos modelos proporciona un contexto esencial para entender sus respectivos puntos fuertes.
DAMO-YOLO#
Desarrollado por investigadores de Alibaba Group, DAMO-YOLO se centra especialmente en la generación automatizada de arquitecturas y en la fusión eficiente de características.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha de lanzamiento: 23 de noviembre de 2022
- Artículo de Arxiv: Artículo de investigación de DAMO-YOLO
- GitHub oficial: Repositorio de tinyvision/DAMO-YOLO
- Documentación: README de DAMO-YOLO
Más información sobre DAMO-YOLO
YOLOv9#
Presentado como una solución a la pérdida de información en las redes convolucionales profundas, YOLOv9 lleva al límite teórico la conservación de gradientes durante el entrenamiento.
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwan
- Fecha de lanzamiento: 21 de febrero de 2024
- Artículo de Arxiv: Artículo de investigación de YOLOv9
- GitHub oficial: Repositorio de WongKinYiu/yolov9
- Documentación: Documentación de YOLOv9 de Ultralytics
Innovaciones arquitectónicas#
DAMO-YOLO: impulsado por la búsqueda de arquitecturas neuronales#
DAMO-YOLO se diferencia por sus componentes altamente personalizados y generados por máquinas. Su backbone se genera mediante la búsqueda de arquitecturas neuronales (NAS), con un enfoque específico en la inferencia de baja latencia en distintos tipos de hardware.
La arquitectura incorpora una RepGFPN (red piramidal de características generalizada y reparametrizada) eficiente para la fusión de características, que mejora la detección de objetos a múltiples escalas sin aumentar excesivamente la sobrecarga computacional. Además, emplea un diseño ZeroHead para simplificar la cabeza de detección y utiliza AlignedOTA para la asignación de etiquetas, junto con un sofisticado proceso de mejora mediante destilación durante el entrenamiento. Aunque estas técnicas permiten una inferencia rápida, el proceso de destilación en varias fases suele requerir una cantidad considerable de VRAM y tiempos de entrenamiento prolongados.
YOLOv9: resolviendo el cuello de botella de información#
YOLOv9 aborda un problema fundamental de las redes profundas: la pérdida gradual de información de los datos de entrada a medida que atraviesan capas sucesivas.
Para combatir este problema, los autores introdujeron la información de gradiente programable (PGI), un marco de supervisión auxiliar diseñado para conservar detalles cruciales en las capas profundas y generar gradientes altamente fiables para actualizar los pesos. Junto con PGI se encuentra la arquitectura GELAN (red generalizada de agregación eficiente de capas). GELAN optimiza la eficiencia de los parámetros combinando los puntos fuertes de CSPNet y ELAN, maximizando el flujo de información y minimizando estrictamente las operaciones en coma flotante (FLOPs).
Análisis del rendimiento y métricas#
Al evaluar el rendimiento, ambos modelos demuestran una precisión media promedio (mAP) elevada en benchmarks estándar como COCO. YOLOv9 alcanza una mayor precisión absoluta en tamaños de modelo equivalentes, aprovechando su arquitectura PGI para mantener una alta fidelidad en conjuntos de datos difíciles.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Como se muestra arriba, YOLOv9-E alcanza la mayor precisión, mientras que las variantes más pequeñas de DAMO-YOLO y YOLOv9 mantienen velocidades de inferencia muy competitivas mediante optimizaciones de TensorRT.
Metodologías de entrenamiento y ecosistema#
Aunque la arquitectura subyacente es importante, la usabilidad y la eficiencia de entrenamiento que determina el ecosistema de un modelo son fundamentales para su aplicación en el mundo real.
La dependencia de DAMO-YOLO de la destilación de conocimiento suele requerir entrenar primero un modelo "profesor" engorroso antes de transferir el conocimiento al modelo "alumno" objetivo. Este enfoque de investigación tradicional aumenta considerablemente los requisitos de memoria y la duración de los ciclos de entrenamiento. Del mismo modo, el repositorio original de YOLOv9 requiere navegar por archivos de configuración complejos, lo que puede ralentizar el desarrollo ágil.
En cambio, integrar modelos en Ultralytics Platform transforma por completo la experiencia del desarrollador. El paquete de Python de Ultralytics abstrae el código repetitivo, lo que permite a los equipos gestionar el aumento de datos, el ajuste de hiperparámetros y la exportación de modelos sin esfuerzo.
Aplicaciones y casos de uso en el mundo real#
Las distintas arquitecturas destacan de forma natural en sectores específicos según sus requisitos de recursos y sus perfiles de precisión.
- DAMO-YOLO en Edge AI: Debido a sus backbones optimizados mediante NAS, DAMO-YOLO se explora frecuentemente en sistemas empotrados donde la re-parametrización específica de hardware es una necesidad estricta, como el despliegue de ASIC personalizados en el control de calidad de fabricación básico.
- YOLOv9 en análisis de precisión: Gracias a su alta eficiencia de parámetros y a la conservación de gradientes impulsada por PGI, YOLOv9 es excelente para escenarios de detección densa de objetos, como el análisis de imágenes aéreas o el seguimiento de objetos diminutos en entornos comerciales con mucha afluencia.
Casos de uso y recomendaciones#
La elección entre DAMO-YOLO y YOLOv9 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO es una buena opción para:
- Análisis de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con un FPS elevado en una infraestructura GPU NVIDIA fija, donde el rendimiento con batch-1 es la métrica principal.
- Líneas industriales de fabricación: Situaciones con estrictas restricciones de latencia GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación sobre búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de los backbones reparametrizados eficientes en el rendimiento de la detección.
Cuándo elegir YOLOv9#
YOLOv9 se recomienda para:
- Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
- Estudios de optimización del flujo de gradientes: Investigación centrada en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
- Evaluación comparativa de detección de alta precisión: Escenarios en los que se necesita el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO como punto de referencia para comparar arquitecturas.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics: avanza a YOLO26#
Para quienes comparan arquitecturas antiguas, pasar al ecosistema moderno de Ultralytics —en concreto, a los modelos YOLO26 más recientes— ofrece una ventaja incomparable.
YOLO26 transforma por completo el panorama de la implementación gracias a su diseño de extremo a extremo sin NMS. Al eliminar por completo el posprocesamiento de supresión no máxima (NMS), ofrece arquitecturas de implementación más rápidas y mucho más sencillas. Junto con la eliminación de la pérdida focal de distribución (DFL), YOLO26 proporciona una compatibilidad superior con dispositivos edge y de bajo consumo.
Además, YOLO26 incorpora el revolucionario optimizador MuSGD, una combinación híbrida del descenso de gradiente estocástico y las optimizaciones Muon, inspirada en las innovaciones del entrenamiento de LLM. Esto produce una convergencia de entrenamiento muy estable y mantiene un uso de memoria notablemente bajo en comparación con alternativas con un uso intensivo de Transformer.
Gracias a la API intuitiva de Ultralytics, puedes entrenar un modelo YOLO26 de última generación con seguimiento de experimentos integrado usando solo unas pocas líneas de Python.
from ultralytics import YOLO
# Load the latest NMS-free YOLO26 model
model = YOLO("yolo26n.pt")
# Train on your custom dataset efficiently
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained model to ONNX format
model.export(format="onnx")Tanto si necesitas segmentación de instancias avanzada como una estimación de poses muy precisa o una detección estándar de cuadros delimitadores, la versatilidad del framework de Ultralytics garantiza que tu equipo dedique menos tiempo a configurar entornos de aprendizaje profundo y más a implementar soluciones de IA robustas. Con mejoras específicas para tareas, como ProgLoss + STAL, que mejoran el reconocimiento de objetos pequeños, YOLO26 se posiciona como la opción principal para la próxima generación de aplicaciones de visión.