DAMO-YOLO frente a YOLOv7#
La rápida evolución de la visión por ordenador ha producido modelos de detección de objetos altamente eficientes, diseñados para equilibrar la precisión y el coste computacional. Dos modelos destacados introducidos en 2022 son DAMO-YOLO y YOLOv7. Aunque ambos pretenden ampliar los límites de las tareas de visión en tiempo real, consiguen sus resultados mediante paradigmas arquitectónicos y metodologías de entrenamiento muy diferentes.
Esta completa comparación técnica analiza los distintos enfoques de ambos modelos, examinando sus arquitecturas, su potencial de despliegue y sus métricas de rendimiento para ayudar a los ingenieros de machine learning a elegir la herramienta adecuada para sus aplicaciones de visión por ordenador específicas.
Orígenes y metadatos de los modelos#
Antes de profundizar en el análisis técnico, es esencial contextualizar el origen de estos dos modelos de visión por ordenador.
DAMO-YOLO#
Desarrollado por investigadores de Alibaba Group, DAMO-YOLO se introdujo para optimizar tanto la velocidad como la precisión mediante la búsqueda automatizada de arquitecturas y la destilación.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 23 de noviembre de 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
Más información sobre DAMO-YOLO
YOLOv7#
Presentado como el modelo más avanzado a mediados de 2022, YOLOv7 llevó aún más lejos la inferencia en tiempo real al introducir técnicas «bag-of-freebies» entrenables sin aumentar los costes de despliegue.
- Autores: Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwan
- Fecha: 6 de julio de 2022
- Arxiv: 2207.02696
- Documentación: Documentación de YOLOv7
YOLOv7 cuenta con soporte oficial en el ecosistema de Ultralytics, lo que permite entrenar, validar y exportar fácilmente mediante una API unificada.
Innovaciones arquitectónicas#
DAMO-YOLO: NAS y destilación#
DAMO-YOLO incorpora varias técnicas de vanguardia orientadas a maximizar la eficiencia:
- Backbones NAS: Utiliza la búsqueda de arquitectura neuronal (NAS) para diseñar automáticamente backbones óptimos (MAE-NAS) adaptados a entornos en los que la latencia es crítica.
- RepGFPN eficiente: Una red piramidal de características generalizada modificada que mejora significativamente la eficiencia de la fusión de características a múltiples escalas.
- ZeroHead y AlignedOTA: Incorpora una cabeza de detección ligera y una estrategia optimizada de asignación de etiquetas (AlignedOTA) para reducir la sobrecarga computacional.
- Mejora mediante destilación: Aprovecha ampliamente la destilación de conocimiento durante el entrenamiento para aumentar el rendimiento de las variantes de modelos más pequeñas sin incrementar su número de parámetros.
YOLOv7: E-ELAN y Bag-of-Freebies#
YOLOv7 adoptó un enfoque de ingeniería más estructural, centrado en la optimización de las rutas de gradiente y en estrategias de entrenamiento robustas.
- Arquitectura E-ELAN: La red extendida de agregación eficiente de capas permite al modelo aprender características más diversas controlando las rutas de gradiente más cortas y más largas, lo que garantiza una convergencia de aprendizaje eficaz.
- Escalado del modelo: Introduce un método de escalado compuesto adaptado a modelos basados en concatenación, que escala simultáneamente la profundidad y la anchura para mantener la alineación estructural.
- Bag-of-Freebies entrenables: Emplea técnicas como las convoluciones reparametrizadas (RepConv) sin conexiones de identidad y estrategias dinámicas de asignación de etiquetas, que mejoran la precisión durante el entrenamiento sin afectar a la velocidad de inferencia.
Análisis del rendimiento#
Al evaluar la precisión media promedio (mAP), la velocidad y la eficiencia, ambos modelos presentan métricas impresionantes, aunque se dirigen a segmentos ligeramente diferentes. YOLOv7 se centra especialmente en el despliegue en GPU con alta precisión, mientras que las estructuras derivadas de NAS de DAMO-YOLO están orientadas a un despliegue agresivo de baja latencia en CPU y dispositivos edge.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Como muestran las métricas, aunque DAMO-YOLO ofrece variantes extremadamente ligeras (como el modelo tiny, con tan solo 8,5 M de parámetros), YOLOv7 alcanza un pico de precisión general superior, y YOLOv7x logra unos impresionantes 53,1 mAP en el conjunto de datos COCO.
La ventaja del ecosistema de Ultralytics#
Aunque la arquitectura teórica es importante, la utilidad práctica de un modelo viene determinada por su ecosistema. Los modelos compatibles con Ultralytics, como YOLOv7, se benefician de un ecosistema bien mantenido y una facilidad de uso inigualable.
- Equilibrio de rendimiento: Los modelos de Ultralytics mantienen sistemáticamente un equilibrio óptimo entre la velocidad de inferencia y la precisión de detección, por lo que son ideales tanto para dispositivos edge como para el despliegue de modelos en la nube.
- Requisitos de memoria: A diferencia de los modelos más pesados basados en Transformer, los modelos YOLO de Ultralytics mantienen unos requisitos reducidos de memoria CUDA durante el entrenamiento. Esto permite utilizar tamaños de batch mayores y agiliza el proceso de entrenamiento incluso en hardware de consumo.
- Versatilidad: El framework de Ultralytics va más allá de la detección de objetos y admite tareas como la segmentación de instancias y la estimación de pose, ofreciendo a los desarrolladores un kit de herramientas completo para visión por ordenador.
El paquete de Ultralytics permite pasar fácilmente de los conjuntos de datos a un modelo completamente entrenado en cuestión de minutos, aprovechando cargadores de datos altamente optimizados y pesos preentrenados.
Ejemplo de código: entrenar YOLOv7 con Ultralytics#
Integrar YOLOv7 en tu pipeline de visión por ordenador es increíblemente sencillo mediante la API de Python de Ultralytics.
from ultralytics import YOLO
# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)El nuevo estándar: presentación de YOLO26#
Aunque YOLOv7 y DAMO-YOLO supusieron avances significativos en 2022, el campo de la IA de visión evoluciona rápidamente. Para los equipos que inicien nuevos proyectos hoy, el modelo recomendado es el vanguardista Ultralytics YOLO26, presentado en enero de 2026.
YOLO26 supone un salto generacional en rendimiento y usabilidad, e incorpora innovaciones de última generación:
- Diseño de extremo a extremo sin NMS: YOLO26 es nativamente de extremo a extremo. Al eliminar el posprocesamiento de supresión de no máximos (NMS), ofrece una lógica de despliegue más rápida y sencilla: un cambio de paradigma impulsado inicialmente por YOLOv10.
- Optimizador MuSGD: Inspirado en innovaciones de los modelos de lenguaje de gran tamaño como Kimi K2 de Moonshot AI, YOLO26 utiliza una combinación de SGD y Muon. Este optimizador garantiza una dinámica de entrenamiento muy estable y tasas de convergencia considerablemente más rápidas.
- Hasta un 43 % más rápida en inferencia en CPU: Gracias a la eliminación específica de Distribution Focal Loss (DFL) y a profundas mejoras estructurales, YOLO26 está altamente optimizado para la computación edge de bajo consumo y supera a las generaciones anteriores en hardware sin GPU.
- ProgLoss + STAL: Incorpora nuevas funciones de pérdida avanzadas que se centran explícitamente en mejorar el reconocimiento de objetos pequeños, una capacidad esencial para aplicaciones de imágenes aéreas, robótica y monitorización de seguridad.
- Mejoras específicas por tarea: Más allá de la detección estándar, YOLO26 ofrece mejoras adaptadas a diversas tareas, como la creación de prototipos multiescala para segmentación, RLE para estimación de pose y pérdidas de ángulo específicas para cajas delimitadoras orientadas (OBB).
Casos de uso ideales#
Elegir la arquitectura adecuada depende por completo de tu entorno de despliegue objetivo y de las restricciones del proyecto.
Cuándo elegir DAMO-YOLO:
- Trabajas en entornos edge muy restringidos y con recursos limitados, donde el número total de parámetros debe mantenerse extremadamente bajo (por ejemplo, en microcontroladores).
- Utilizas pipelines de machine learning automatizado integrados específicamente con los servicios en la nube propios de Alibaba.
Cuándo elegir YOLOv7:
- Tienes pipelines de GPU heredados ya optimizados para la inferencia basada en anchors y de alta precisión.
- Trabajas en entornos donde la precisión en tiempo real es primordial, como vehículos autónomos de alta velocidad o robótica avanzada.
Cuándo elegir YOLO26 (recomendado):
- Estás creando desde cero una nueva aplicación de visión por ordenador y necesitas lo último en precisión y velocidad de inferencia en CPU y dispositivos edge.
- Necesitas un despliegue rápido y sencillo (por ejemplo, exportando a CoreML o TensorRT) sin tener que lidiar con las limitaciones de los operadores de NMS.
- Quieres aprovechar todas las capacidades de la Ultralytics Platform para el entrenamiento en la nube, la gestión de conjuntos de datos y el despliegue automatizado.
Al aprovechar el sólido ecosistema de modelos de Ultralytics, los desarrolladores pueden reducir drásticamente el tiempo de ingeniería y, al mismo tiempo, obtener un rendimiento predictivo de primer nivel para sus aplicaciones del mundo real.