Ultralytics YOLO27:
Get Started

DAMO-YOLO frente a YOLOv9#

El panorama de la detección de objetos en tiempo real sigue evolucionando a un ritmo vertiginoso. Mientras los equipos de ingeniería y los investigadores buscan el equilibrio perfecto entre precisión, velocidad de inferencia y eficiencia computacional, la comunidad investigadora ha desarrollado dos arquitecturas destacadas: DAMO-YOLO y YOLOv9. Ambos modelos incorporan importantes innovaciones arquitectónicas que amplían los límites de lo posible en visión artificial.

Esta guía técnica detallada ofrece un análisis exhaustivo de estos dos modelos y compara sus enfoques arquitectónicos particulares, metodologías de entrenamiento y capacidades de implementación en el mundo real. También veremos cómo el ecosistema de software en su conjunto desempeña un papel crucial en el desarrollo moderno de IA, y destacaremos las ventajas de plataformas integradas como Ultralytics Platform y de modelos de nueva generación como YOLO26.

Resumen ejecutivo: elige la arquitectura adecuada#

Aunque ambos modelos representan hitos importantes en la investigación del aprendizaje profundo, responden a filosofías de implementación algo distintas.

DAMO-YOLO destaca en entornos donde se puede recurrir intensivamente a la búsqueda de arquitecturas neuronales (NAS) para obtener perfiles de rendimiento específicos, lo que lo convierte en un objeto de estudio interesante para implementaciones periféricas personalizadas. En cambio, YOLOv9 se centra en resolver los cuellos de botella de información del aprendizaje profundo y ofrece una eficiencia de parámetros excepcionalmente alta.

Sin embargo, para implementaciones listas para producción, los equipos de ingeniería recomiendan sistemáticamente aprovechar el ecosistema unificado de Ultralytics. Para proyectos nuevos, el último modelo YOLO26 ofrece lo mejor de ambos mundos: precisión de vanguardia y un diseño integral opcional que elimina la necesidad de posprocesamiento complejo.

Prepara tu proceso de visión artificial para el futuro

Aunque DAMO-YOLO y YOLOv9 son potentes modelos académicos, su implementación en producción suele requerir una cantidad considerable de ingeniería personalizada. Con Ultralytics YOLO26, puedes acceder a un rendimiento de vanguardia mediante una API optimizada y fácil de mantener.

Especificaciones técnicas y autoría#

Comprender los orígenes y el enfoque de desarrollo de estos modelos aporta un contexto esencial para conocer sus respectivos puntos fuertes.

DAMO-YOLO#

Desarrollado por investigadores del Grupo Alibaba, DAMO-YOLO se centra especialmente en la generación automatizada de arquitecturas y la fusión eficiente de características.

Más información sobre DAMO-YOLO

YOLOv9#

Presentado como solución a la pérdida de información en las redes convolucionales profundas, YOLOv9 lleva al límite teórico la conservación del gradiente durante el entrenamiento.

Más información sobre YOLOv9

Innovaciones arquitectónicas#

DAMO-YOLO se distingue por sus componentes muy personalizados y generados por máquina. Su red troncal se genera mediante la búsqueda de arquitecturas neuronales (NAS), con el objetivo específico de lograr inferencias de baja latencia en distintos tipos de hardware.

La arquitectura incorpora una RepGFPN (red piramidal de características generalizada reparametrizada) eficiente para fusionar características, que mejora la detección de objetos a varias escalas sin aumentar excesivamente la carga computacional. Además, emplea un diseño ZeroHead para simplificar la cabeza de detección y utiliza AlignedOTA para asignar etiquetas, junto con un sofisticado proceso de mejora mediante destilación durante el entrenamiento. Aunque estas técnicas permiten inferencias rápidas, el proceso de destilación en varias etapas suele requerir mucha VRAM y entrenamientos prolongados.

YOLOv9: resolver el cuello de botella de información#

YOLOv9 aborda un problema fundamental de las redes profundas: la pérdida gradual de información de los datos de entrada a medida que estos atraviesan capas sucesivas.

Para combatir este problema, los autores introdujeron Información de gradiente programable (PGI), un marco de supervisión auxiliar diseñado para conservar detalles cruciales en las capas profundas y generar gradientes muy fiables para actualizar los pesos. Junto con PGI se presentó la arquitectura GELAN (red generalizada de agregación eficiente de capas). GELAN optimiza la eficiencia de los parámetros al combinar las ventajas de CSPNet y ELAN, maximizando el flujo de información y reduciendo al mínimo estricto las operaciones de coma flotante (FLOPs).

Análisis del rendimiento y métricas#

Al evaluar el rendimiento, ambos modelos demuestran una gran precisión media (mAP) en benchmarks estándar como COCO. YOLOv9 alcanza una mayor precisión con un número de parámetros comparable y la mayor precisión absoluta en general, gracias a su arquitectura PGI, que mantiene una alta fidelidad en conjuntos de datos difíciles.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Como se muestra arriba, YOLOv9-E alcanza la mayor precisión, mientras que DAMO-YOLO y las variantes más pequeñas de YOLOv9 mantienen velocidades de inferencia muy competitivas mediante las optimizaciones de TensorRT.

Metodologías de entrenamiento y ecosistema#

Aunque la arquitectura en sí es importante, la facilidad de uso y la eficiencia de entrenamiento que proporciona el ecosistema de un modelo son fundamentales para su aplicación en el mundo real.

La dependencia de DAMO-YOLO de la destilación de conocimiento suele exigir entrenar un engorroso modelo «profesor» antes de transferir el conocimiento al modelo «alumno» de destino. Este enfoque tradicional de investigación aumenta considerablemente los requisitos de memoria y la duración de los ciclos de entrenamiento. Del mismo modo, el repositorio original de YOLOv9 requiere navegar por complejos archivos de configuración, lo que puede ralentizar el desarrollo ágil.

En cambio, integrar modelos en la plataforma Ultralytics transforma por completo la experiencia de desarrollo. El paquete Python de Ultralytics abstrae el código repetitivo, lo que permite a los equipos gestionar sin esfuerzo el aumento de datos, el ajuste de hiperparámetros y la exportación de modelos.

Aplicaciones y casos de uso en el mundo real#

Cada arquitectura destaca de forma natural en determinados sectores, según sus requisitos de recursos y sus características de precisión.

  • DAMO-YOLO en la IA en el edge: Gracias a sus backbones optimizados mediante NAS, DAMO-YOLO se explora a menudo en sistemas integrados donde la reparametrización específica del hardware es imprescindible, como en la implementación de ASIC personalizados para el control de calidad en la fabricación básica.
  • YOLOv9 en el análisis de precisión: Gracias a su alta eficiencia de parámetros y a la conservación de gradientes impulsada por PGI, YOLOv9 es excelente para escenarios de detección de objetos densos, como el análisis de imágenes aéreas o el seguimiento de objetos diminutos en entornos comerciales concurridos.

Casos de uso y recomendaciones#

La elección entre DAMO-YOLO y YOLOv9 depende de los requisitos específicos de tu proyecto, las restricciones de implementación y las preferencias de ecosistema.

Cuándo elegir DAMO-YOLO#

DAMO-YOLO es una buena opción para:

  • Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con FPS elevados en una infraestructura fija de GPU NVIDIA, donde el rendimiento con lotes de tamaño 1 es la métrica principal.
  • Líneas de fabricación industrial: Escenarios con estrictas limitaciones de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
  • Investigación sobre búsqueda de arquitecturas neuronales: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de las redes troncales reparametrizadas eficientes en el rendimiento de detección.

Cuándo elegir YOLOv9#

YOLOv9 se recomienda para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

La ventaja de Ultralytics: el avance hacia YOLO26#

Para quienes comparan arquitecturas heredadas, pasarse al ecosistema moderno de Ultralytics —en concreto, a los modelos YOLO26 más recientes— ofrece una ventaja inigualable.

YOLO26 transforma por completo el panorama de la implementación con su diseño de extremo a extremo sin NMS. Su cabezal opcional de uno a uno (nms=False) elimina el posprocesamiento de supresión no máxima (NMS), lo que permite arquitecturas de implementación más rápidas y mucho más sencillas. Al eliminar también la pérdida focal de distribución (DFL), YOLO26 ofrece una compatibilidad superior con dispositivos edge y de bajo consumo.

Además, YOLO26 incorpora el revolucionario optimizador MuSGD, una combinación de descenso de gradiente estocástico y optimizaciones Muon, inspirada en las innovaciones del entrenamiento de LLM. Esto permite una convergencia del entrenamiento muy estable y mantiene un consumo de memoria notablemente bajo frente a las alternativas basadas en gran medida en Transformer.

Entrenamiento optimizado con YOLO26

Gracias a la intuitiva API de Ultralytics, puedes entrenar un modelo YOLO26 de vanguardia con seguimiento de experimentos integrado usando solo unas pocas líneas de Python.

from ultralytics import YOLO

# Carga el modelo YOLO26 más reciente
model = YOLO("yolo26n.pt")

# Entrena de forma eficiente con tu conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporta el modelo entrenado al formato ONNX
model.export(format="onnx")

Tanto si necesitas segmentación de instancias avanzada, estimación de pose de gran precisión o detección estándar mediante cajas delimitadoras, la versatilidad del marco de Ultralytics garantiza que tu equipo dedique menos tiempo a configurar entornos de aprendizaje profundo y más a implementar soluciones de IA robustas. Gracias a mejoras especializadas para las tareas, como ProgLoss + STAL, que mejoran el reconocimiento de objetos pequeños, YOLO26 es la opción líder para la próxima generación de aplicaciones de visión.

Comentarios