YOLOv9 frente a DAMO-YOLO#
La rápida evolución de la visión por ordenador ha producido un conjunto de arquitecturas potentes adaptadas a distintas limitaciones de despliegue y requisitos de precisión. Dos incorporaciones destacadas en este ámbito son YOLOv9, conocido por su sólido tratamiento de los cuellos de botella de información, y DAMO-YOLO, que se centra especialmente en la búsqueda de arquitecturas neuronales (NAS) y en pirámides de características eficientes.
Esta guía ofrece una comparación técnica y detallada de YOLOv9 y DAMO-YOLO, destacando sus diferencias arquitectónicas, metodologías de entrenamiento y escenarios de despliegue ideales. También analizaremos cómo el ecosistema de Ultralytics proporciona una transición fluida del desarrollo a la producción, y por qué los modelos modernos como YOLO26 se han convertido en el estándar recomendado para los proyectos nuevos.
Análisis exhaustivo de la arquitectura#
Comprender los mecanismos fundamentales que impulsan cada modelo permite entender por qué rinden de forma diferente según las distintas métricas.
YOLOv9: Información de gradiente programable#
YOLOv9 se diseñó para abordar directamente la pérdida de información que se produce cuando los datos fluyen a través de redes neuronales profundas.
- Autores: Chien-Yao Wang, Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Fecha: 21 de febrero de 2024
- Enlaces: Arxiv, GitHub, Documentación
YOLOv9 introduce la información de gradiente programable (PGI) y la red de agregación de capas eficiente generalizada (GELAN). PGI garantiza que la información espacial y semántica vital se conserve durante el proceso de propagación hacia delante, evitando la degradación de los gradientes utilizados para actualizar los pesos. GELAN complementa este enfoque maximizando la eficiencia de los parámetros, lo que permite al modelo alcanzar una precisión media (mAP) de vanguardia con menos FLOP que muchas CNN convencionales.
DAMO-YOLO: eficiencia impulsada por NAS#
Desarrollado por Alibaba Group, DAMO-YOLO adopta un enfoque diferente y aprovecha la búsqueda automatizada de arquitecturas para encontrar el equilibrio óptimo entre velocidad y precisión.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 23 de noviembre de 2022
- Enlaces: Arxiv, GitHub
Más información sobre DAMO-YOLO
DAMO-YOLO se basa en un backbone MAE-NAS (Maximum Entropy Neural Architecture Search) para generar automáticamente estructuras de red eficientes. Utiliza una RepGFPN (Reparameterized Generalized Feature Pyramid Network) para una fusión de características robusta y un diseño "ZeroHead" para minimizar la carga computacional de la cabeza de detección. Además, incorpora AlignedOTA para la asignación de etiquetas y la destilación de conocimientos con el fin de impulsar el rendimiento de sus variantes más pequeñas.
La búsqueda de arquitecturas neuronales (NAS) automatiza el diseño de redes neuronales artificiales. Aunque puede producir modelos muy eficientes como DAMO-YOLO, a menudo requiere enormes recursos computacionales para explorar el espacio de arquitecturas, en contraste con la filosofía de diseño más determinista de modelos como YOLOv9.
Comparación de rendimiento y métricas#
Al seleccionar un modelo de detección de objetos, es fundamental equilibrar la precisión, la velocidad y la huella computacional.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Análisis#
- Precisión frente a parámetros: YOLOv9 generalmente muestra una relación superior entre parámetros y precisión. Por ejemplo, YOLOv9c alcanza un 53,0 % de mAP con 25,3 M de parámetros, mientras que DAMO-YOLOl alcanza un 50,8 % de mAP, pero requiere muchos más parámetros (42,1 M).
- Velocidad de inferencia: la arquitectura de DAMO-YOLO ofrece velocidades de inferencia competitivas con TensorRT en GPU T4 y supera ligeramente a YOLOv9 en las gamas medias. Sin embargo, la eficiencia de YOLOv9 en FLOP y número de parámetros se traduce en una eficiencia excepcional de la memoria de la GPU.
- Requisitos de memoria: los modelos YOLO de Ultralytics, incluido YOLOv9, suelen presentar un menor uso de memoria tanto durante el entrenamiento como durante la inferencia en comparación con los modelos complejos generados mediante NAS o las arquitecturas pesadas basadas en Transformer, lo que facilita enormemente su despliegue en hardware periférico con recursos limitados.
La ventaja del ecosistema de Ultralytics#
Aunque las métricas teóricas son importantes, la implementación práctica determina en gran medida el éxito de un proyecto. En este aspecto, la plataforma de Ultralytics y su completo ecosistema de software superan a repositorios independientes como DAMO-YOLO.
Facilidad de uso y eficiencia del entrenamiento#
Entrenar un modelo YOLOv9 personalizado requiere muy poco código repetitivo. La API de Python de Ultralytics abstrae procesos complejos como el aumento de datos, el entrenamiento distribuido y la optimización del hardware.
from ultralytics import YOLO
# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate model performance
metrics = model.val()
# Export for production deployment
model.export(format="onnx")Por el contrario, utilizar DAMO-YOLO suele requerir recorrer archivos de configuración rígidos y cadenas complejas de dependencias específicas de su singular canalización de entrenamiento, lo que da lugar a una curva de aprendizaje más pronunciada.
Versatilidad entre tareas#
Una característica distintiva de los modelos de Ultralytics es su versatilidad inherente. Más allá de la detección estándar de cuadros delimitadores, el framework de Ultralytics admite sin problemas tareas como la segmentación de instancias, la estimación de poses, la clasificación de imágenes y la detección de cuadros delimitadores orientados (OBB). DAMO-YOLO está optimizado estrictamente para la detección de objetos 2D, por lo que requiere una reingeniería considerable para adaptarlo a otros paradigmas visuales.
Ultralytics simplifica la canalización de despliegue al ofrecer la exportación de modelos con un solo clic a formatos como TensorRT, OpenVINO y CoreML, garantizando el máximo rendimiento independientemente del hardware de destino.
Casos de uso y recomendaciones#
La elección entre YOLOv9 y DAMO-YOLO depende de los requisitos específicos de tu proyecto, las limitaciones de despliegue y tus preferencias en cuanto al ecosistema.
Cuándo elegir YOLOv9#
YOLOv9 es una buena opción para:
- Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
- Estudios de optimización del flujo de gradientes: Investigación centrada en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
- Evaluación comparativa de detección de alta precisión: Escenarios en los que se necesita el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO como punto de referencia para comparar arquitecturas.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO se recomienda para:
- Análisis de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con un FPS elevado en una infraestructura GPU NVIDIA fija, donde el rendimiento con batch-1 es la métrica principal.
- Líneas industriales de fabricación: Situaciones con estrictas restricciones de latencia GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación sobre búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de los backbones reparametrizados eficientes en el rendimiento de la detección.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
El futuro: pasar a YOLO26#
Aunque YOLOv9 y DAMO-YOLO representan importantes hitos históricos, la visión por ordenador moderna ha evolucionado hacia arquitecturas nativamente de extremo a extremo. Para cualquier desarrollo nuevo, YOLO26 es el estándar recomendado.
Lanzado en 2026, YOLO26 se basa en los logros de sus predecesores y ofrece un salto tanto en precisión como en simplicidad de despliegue.
Principales innovaciones de YOLO26#
- Diseño de extremo a extremo sin NMS: YOLO26 elimina por completo el postprocesamiento de supresión no máxima (NMS). Esto crea una canalización de despliegue optimizada y nativamente de extremo a extremo, una innovación cuyo desarrollo pionero comenzó con YOLOv10.
- Eliminación de DFL: se elimina la pérdida focal de distribución para simplificar la exportación y mejorar la compatibilidad con dispositivos periféricos y de bajo consumo.
- Inferencia en CPU hasta un 43 % más rápida: al eliminar el postprocesamiento complejo y optimizar las convoluciones principales, YOLO26 es especialmente adecuado para escenarios de edge computing sin GPU dedicadas.
- Optimizador MuSGD: inspirado en las innovaciones del entrenamiento de LLM, YOLO26 utiliza una combinación de SGD y Muon (MuSGD) para garantizar ejecuciones de entrenamiento más estables y tiempos de convergencia notablemente más rápidos.
- ProgLoss + STAL: estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, lo que convierte a YOLO26 en una opción ideal para imágenes aéreas de gran altitud y dispositivos IoT.
Si actualmente estás evaluando YOLO11 o YOLOv8 para tu próximo proyecto, actualizar a YOLO26 garantiza que utilices el framework de IA de visión más optimizado y avanzado disponible actualmente.
Resumen#
La elección del modelo adecuado depende de tus limitaciones operativas específicas:
- DAMO-YOLO ofrece una interesante visión de la optimización impulsada por NAS y proporciona velocidades competitivas para perfiles de hardware muy específicos en los que destaca su arquitectura RepGFPN.
- YOLOv9 es una excelente opción para investigadores centrados en conservar detalles visuales minuciosos, ya que aprovecha su arquitectura PGI para evitar la pérdida de información en redes profundas.
- YOLO26 de Ultralytics es la opción definitiva para aplicaciones empresariales y de investigación modernas. Su facilidad de uso incomparable, su arquitectura sin NMS y sus optimizaciones de entrenamiento MuSGD de vanguardia lo convierten en el modelo más fiable, preciso y fácil de desplegar del panorama de la visión por ordenador.