Ultralytics YOLO27:
Get Started

YOLOv9 frente a DAMO-YOLO#

La rápida evolución de la visión por computador ha dado lugar a numerosas arquitecturas potentes, adaptadas a distintas limitaciones de implementación y requisitos de precisión. Dos modelos destacados en este ámbito son YOLOv9, reconocido por gestionar eficazmente los cuellos de botella de información, y DAMO-YOLO, centrado en gran medida en la búsqueda de arquitecturas neuronales (NAS) y en pirámides de características eficientes.

Esta guía ofrece una comparativa técnica detallada de YOLOv9 y DAMO-YOLO, y destaca sus diferencias arquitectónicas, métodos de entrenamiento y situaciones de implementación ideales. También veremos cómo el ecosistema de Ultralytics facilita el paso del desarrollo a la producción y por qué modelos modernos como YOLO26 se han convertido en la opción recomendada para proyectos nuevos.

Análisis en profundidad de la arquitectura#

Comprender los mecanismos fundamentales de cada modelo permite entender por qué su rendimiento varía según las distintas métricas.

YOLOv9: información de gradiente programable#

YOLOv9 se diseñó para abordar directamente la pérdida de información que se produce cuando los datos fluyen por redes neuronales profundas.

  • Autores: Chien-Yao Wang, Hong-Yuan Mark Liao
  • Organización: Institute of Information Science, Academia Sinica, Taiwán
  • Fecha: 21 de febrero de 2024
  • Enlaces: Arxiv, GitHub, Documentación

Más información sobre YOLOv9

YOLOv9 introduce la información de gradiente programable (PGI) y la red generalizada de agregación eficiente de capas (GELAN). PGI garantiza que se conserve información espacial y semántica esencial durante el proceso de propagación hacia delante, lo que evita que se degraden los gradientes usados para actualizar los pesos. GELAN complementa este enfoque al maximizar la eficiencia de los parámetros, permitiendo al modelo alcanzar una precisión media promedio (mAP) de vanguardia con menos FLOPs que muchas CNN convencionales.

DAMO-YOLO: eficiencia basada en NAS#

Desarrollado por Alibaba Group, DAMO-YOLO adopta un enfoque distinto y aprovecha la búsqueda automatizada de arquitecturas para encontrar el equilibrio óptimo entre velocidad y precisión.

  • Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
  • Organización: Alibaba Group
  • Fecha: 23 de noviembre de 2022
  • Enlaces: Arxiv, GitHub

Más información sobre DAMO-YOLO

DAMO-YOLO utiliza un backbone MAE-NAS (búsqueda de arquitecturas neuronales de máxima entropía) para generar automáticamente estructuras de red eficientes. Emplea una RepGFPN (red piramidal de características generalizada reparametrizada) para fusionar características de forma robusta y un diseño «ZeroHead» para minimizar la carga computacional del cabezal de detección. Además, incorpora AlignedOTA para asignar etiquetas y la destilación de conocimiento para mejorar el rendimiento de sus variantes más pequeñas.

El papel de NAS en la visión por computador

La búsqueda de arquitecturas neuronales (NAS) automatiza el diseño de redes neuronales artificiales. Aunque puede generar modelos muy eficientes como DAMO-YOLO, suele requerir enormes recursos computacionales para explorar el espacio de arquitecturas, a diferencia de la filosofía de diseño más determinista de modelos como YOLOv9.

Comparativa de rendimiento y métricas#

Al seleccionar un modelo de detección de objetos, es fundamental encontrar el equilibrio entre precisión, velocidad y consumo computacional.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Análisis#

  • Precisión frente a parámetros: YOLOv9 suele ofrecer una relación entre parámetros y precisión superior. Por ejemplo, YOLOv9c alcanza un 53,0 % de mAP con 25,5 M de parámetros, mientras que DAMO-YOLOl alcanza un 50,8 % de mAP, pero necesita muchos más parámetros (42,1 M).
  • Velocidad de inferencia: La arquitectura de DAMO-YOLO ofrece velocidades de inferencia competitivas con TensorRT en GPU T4 y supera ligeramente a YOLOv9 en las categorías intermedias. Sin embargo, la eficiencia de YOLOv9 en FLOPs y número de parámetros se traduce en una eficiencia de memoria de GPU excepcional.
  • Requisitos de memoria: Los modelos Ultralytics YOLO, incluido YOLOv9, suelen consumir menos memoria durante el entrenamiento y la inferencia que los modelos complejos generados mediante NAS o las arquitecturas Transformer de gran tamaño, por lo que son muy accesibles para implementarlos en hardware de borde limitado.

La ventaja del ecosistema Ultralytics#

Aunque las métricas teóricas son importantes, la implementación práctica determina en gran medida el éxito de un proyecto. En este aspecto, la plataforma Ultralytics y su completo ecosistema de software superan a repositorios independientes como DAMO-YOLO.

Facilidad de uso y eficiencia del entrenamiento#

Entrenar un modelo YOLOv9 personalizado requiere muy poco código repetitivo. La API de Python de Ultralytics abstrae procesos complejos como el aumento de datos, el entrenamiento distribuido y la optimización del hardware.

from ultralytics import YOLO

# Carga un modelo YOLOv9 preentrenado
model = YOLO("yolov9c.pt")

# Entrena el modelo con tu conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valida el rendimiento del modelo
metrics = model.val()

# Expórtalo para desplegarlo en producción
model.export(format="onnx")

En cambio, utilizar DAMO-YOLO suele requerir navegar por archivos de configuración rígidos y cadenas de dependencias complejas, específicas de su exclusivo proceso de entrenamiento, lo que supone una curva de aprendizaje más pronunciada.

Versatilidad en distintas tareas#

Una característica distintiva de los modelos de Ultralytics es su versatilidad inherente. Además de la detección estándar de cuadros delimitadores, el framework de Ultralytics admite sin problemas tareas como la segmentación de instancias, la estimación de pose, la clasificación de imágenes y la detección de cuadros delimitadores orientados (OBB). DAMO-YOLO está estrictamente optimizado para la detección de objetos en 2D, por lo que requiere una importante reingeniería para adaptarse a otros paradigmas visuales.

Exportación a dispositivos periféricos

Ultralytics simplifica el proceso de despliegue al ofrecer la exportación de modelos con un solo clic a formatos como TensorRT, OpenVINO y CoreML, lo que garantiza el máximo rendimiento independientemente del hardware de destino.

Casos de uso y recomendaciones#

La elección entre YOLOv9 y DAMO-YOLO depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una buena opción para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.

Cuándo elegir DAMO-YOLO#

DAMO-YOLO se recomienda para:

  • Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con FPS elevados en una infraestructura fija de GPU NVIDIA, donde el rendimiento con lotes de tamaño 1 es la métrica principal.
  • Líneas de fabricación industrial: Escenarios con estrictas limitaciones de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
  • Investigación sobre búsqueda de arquitecturas neuronales: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de las redes troncales reparametrizadas eficientes en el rendimiento de detección.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

El futuro: dar el salto a YOLO26#

Aunque YOLOv9 y DAMO-YOLO representan importantes hitos históricos, la visión artificial moderna ha evolucionado hacia arquitecturas nativamente integrales. Para cualquier nuevo desarrollo, YOLO26 es el estándar recomendado.

Lanzado en 2026, YOLO26 se basa en los éxitos de sus predecesores y ofrece un salto en precisión y simplicidad de despliegue.

Principales innovaciones de YOLO26#

  • Diseño integral sin NMS: la cabeza opcional uno a uno de YOLO26 (nms=False) elimina por completo el posprocesamiento de supresión no máxima (NMS). Esto crea un proceso de despliegue optimizado y nativamente integral, un avance pionero introducido por primera vez en YOLOv10.
  • Eliminación de DFL: se elimina Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos periféricos y de bajo consumo.
  • Hasta un 43 % más rápido en inferencia con CPU: al eliminar DFL y optimizar las convoluciones principales, YOLO26 es especialmente adecuado para escenarios de computación periférica sin GPU dedicada.
  • Optimizador MuSGD: inspirado en las innovaciones del entrenamiento de LLM, YOLO26 utiliza una combinación híbrida de SGD y Muon (MuSGD) para garantizar entrenamientos más estables y una convergencia notablemente más rápida.
  • ProgLoss + STAL: estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, lo que convierte a YOLO26 en una opción ideal para imágenes aéreas de gran altitud y dispositivos IoT.

Si estás investigando YOLO11 o YOLOv8 para tu próximo proyecto, actualizar a YOLO26 te garantiza utilizar el framework de IA visual más optimizado y avanzado disponible actualmente.

Resumen#

La elección del modelo adecuado depende de tus limitaciones operativas específicas:

  • DAMO-YOLO ofrece una interesante visión de la optimización basada en NAS y proporciona velocidades competitivas para perfiles de hardware muy específicos en los que destaca su arquitectura RepGFPN.
  • YOLOv9 es una excelente opción para los investigadores que se centran en conservar los detalles visuales más sutiles y aprovechan su arquitectura PGI para evitar la pérdida de información en redes profundas.
  • Ultralytics YOLO26 es la opción definitiva para las aplicaciones empresariales y de investigación modernas. Su facilidad de uso inigualable, su arquitectura sin NMS y sus optimizaciones de entrenamiento MuSGD de vanguardia lo convierten en el modelo más fiable, preciso y fácil de desplegar del ámbito de la visión artificial.

Comentarios