Ultralytics YOLO27:
Get Started

DAMO-YOLO frente a YOLOv7#

La rápida evolución de la visión artificial ha dado lugar a modelos de detección de objetos muy eficientes, diseñados para equilibrar la precisión y el coste computacional. Dos modelos destacados presentados en 2022 son DAMO-YOLO y YOLOv7. Aunque ambos buscan ampliar los límites de las tareas de visión en tiempo real, logran sus resultados mediante paradigmas arquitectónicos y metodologías de entrenamiento muy diferentes.

Esta comparación técnica exhaustiva analiza los enfoques diferenciados de ambos modelos y examina sus arquitecturas, potencial de implementación y métricas de rendimiento para ayudar a los ingenieros de aprendizaje automático a elegir la herramienta adecuada para sus aplicaciones de visión artificial específicas.

Orígenes y metadatos de los modelos#

Antes de profundizar en el análisis técnico, es esencial contextualizar los orígenes de estos dos modelos de visión artificial.

DAMO-YOLO#

Desarrollado por investigadores de Alibaba Group, DAMO-YOLO se presentó para optimizar tanto la velocidad como la precisión mediante la búsqueda automatizada de arquitecturas y la destilación.

Más información sobre DAMO-YOLO

YOLOv7#

Lanzado como modelo de vanguardia a mediados de 2022, YOLOv7 impulsó aún más la inferencia en tiempo real al introducir «bag-of-freebies» entrenables sin aumentar los costes de implementación.

Más información sobre YOLOv7

Compatibilidad con Ultralytics

Ultralytics no publica pesos ni archivos YAML de YOLOv7, por lo que YOLOv7 no se puede entrenar de forma nativa con el paquete Ultralytics. Los modelos YOLOv7 entrenados en el repositorio original se pueden exportar a ONNX o TensorRT y ejecutar para la inferencia con Ultralytics.

Innovaciones arquitectónicas#

DAMO-YOLO: NAS y destilación#

DAMO-YOLO incorpora varias técnicas de vanguardia orientadas a lograr la máxima eficiencia:

  • Backbones NAS: Utiliza la búsqueda de arquitecturas neuronales (NAS) para diseñar automáticamente backbones óptimos (MAE-NAS) adaptados a entornos donde la latencia es crítica.
  • RepGFPN eficiente: Una red piramidal de características generalizada modificada que mejora considerablemente la eficiencia de la fusión de características en varias escalas.
  • ZeroHead y AlignedOTA: Incorpora un cabezal de detección ligero y una estrategia optimizada de asignación de etiquetas (AlignedOTA) para reducir la carga computacional.
  • Mejora mediante destilación: Aprovecha ampliamente la destilación de conocimiento durante el entrenamiento para mejorar el rendimiento de las variantes de modelos más pequeños sin aumentar el número de parámetros.

YOLOv7: E-ELAN y bag-of-freebies#

YOLOv7 adoptó un enfoque más centrado en la ingeniería estructural, con especial atención a la optimización de las rutas de gradiente y a las estrategias de entrenamiento robustas.

  • Arquitectura E-ELAN: La red extendida de agregación eficiente de capas permite que el modelo aprenda características más diversas al controlar las rutas de gradiente más cortas y más largas, lo que garantiza una convergencia de aprendizaje eficaz.
  • Escalado del modelo: Introduce un método de escalado compuesto adaptado a los modelos basados en concatenación, que escala simultáneamente la profundidad y la anchura para lograr una alineación estructural.
  • Bag-of-freebies entrenable: Emplea técnicas como las convoluciones reparametrizadas (RepConv) sin conexiones de identidad y estrategias dinámicas de asignación de etiquetas, que mejoran la precisión durante el entrenamiento sin afectar a la velocidad de inferencia.

Análisis del rendimiento#

Al evaluar la precisión media (mAP), la velocidad y la eficiencia, ambos modelos muestran métricas impresionantes, aunque se dirigen a segmentos ligeramente distintos. YOLOv7 se centra especialmente en la implementación en GPU de alta precisión, mientras que las estructuras derivadas de NAS de DAMO-YOLO buscan una implementación agresiva de baja latencia en CPU y edge.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Como muestran las métricas, DAMO-YOLO ofrece variantes muy ligeras (como el modelo tiny, con solo 8,5 M de parámetros), mientras que YOLOv7 alcanza una precisión máxima general superior: YOLOv7x logra una impresionante mAP de 53,1 en el conjunto de datos COCO.

La ventaja del ecosistema Ultralytics#

Aunque la arquitectura teórica es importante, la utilidad práctica de un modelo depende de su ecosistema. Los modelos nativos de Ultralytics, como YOLO26, se benefician de un ecosistema bien mantenido y de una facilidad de uso inigualable.

  • Equilibrio del rendimiento: Los modelos de Ultralytics logran de forma sistemática un equilibrio óptimo entre la velocidad de inferencia y la precisión de detección, por lo que son ideales tanto para dispositivos edge como para la implementación de modelos en la nube.
  • Requisitos de memoria: A diferencia de los modelos más pesados basados en Transformer, los modelos YOLO de Ultralytics requieren poca memoria CUDA durante el entrenamiento. Esto permite usar tamaños de lote mayores y agiliza el proceso de entrenamiento incluso en hardware de consumo.
  • Versatilidad: El marco de Ultralytics va más allá de la detección de objetos y abarca tareas como la segmentación de instancias y la estimación de pose, lo que proporciona a los desarrolladores un conjunto completo de herramientas de visión artificial.
Eficiencia del entrenamiento

El paquete Ultralytics permite pasar fácilmente de los conjuntos de datos a un modelo completamente entrenado en cuestión de minutos, gracias a sus cargadores de datos muy optimizados y sus pesos preentrenados.

Ejemplo de código: ejecutar YOLOv7 con Ultralytics#

Tras convertir una exportación ONNX de YOLOv7 del repositorio original, tal como se describe en los ejemplos de uso de YOLOv7, puedes ejecutarla con la API Python de Ultralytics.

from ultralytics import YOLO

# Carga un modelo YOLOv7 ONNX convertido para Ultralytics
model = YOLO("yolov7-ultralytics.onnx", task="detect")

# Ejecutar inferencia
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)

El nuevo estándar: presentamos YOLO26#

Aunque YOLOv7 y DAMO-YOLO supusieron avances importantes en 2022, el campo de la IA para visión evoluciona rápidamente. Para los equipos que inicien nuevos proyectos hoy, el modelo recomendado es el vanguardista Ultralytics YOLO26, lanzado en enero de 2026.

YOLO26 supone un salto generacional en rendimiento y facilidad de uso, e incorpora innovaciones de vanguardia:

  • Diseño de extremo a extremo sin NMS: YOLO26 ofrece un cabezal nativo de extremo a extremo (nms=False). Al eliminar el posprocesamiento de supresión no máxima (NMS), permite una lógica de implementación más rápida y sencilla: un cambio de paradigma introducido inicialmente por YOLOv10.
  • Optimizador MuSGD: Inspirado en innovaciones de modelos de lenguaje grandes, como Kimi K2 de Moonshot AI, YOLO26 utiliza una combinación de SGD y Muon. Este optimizador garantiza una dinámica de entrenamiento muy estable y tasas de convergencia mucho más rápidas.
  • Inferencia en CPU hasta un 43 % más rápida: Al eliminar específicamente la pérdida focal de distribución (DFL) e introducir importantes mejoras estructurales, YOLO26 está muy optimizado para la computación edge de bajo consumo y supera a las generaciones anteriores en hardware sin GPU.
  • ProgLoss + STAL: Incorpora nuevas funciones de pérdida avanzadas que se centran explícitamente en mejorar el reconocimiento de objetos pequeños, una capacidad esencial para aplicaciones de imágenes aéreas, robótica y vigilancia de seguridad.
  • Mejoras específicas para cada tarea: Además de la detección estándar, YOLO26 incluye mejoras adaptadas a diversas tareas, como la creación de prototipos multiescala para la segmentación, RLE para la estimación de pose y pérdidas angulares específicas para las cajas delimitadoras orientadas (OBB).

Casos de uso ideales#

La elección de la arquitectura adecuada depende por completo del entorno de implementación de destino y de las restricciones del proyecto.

Cuándo elegir DAMO-YOLO:

  • Trabajas en entornos edge muy restringidos y con recursos limitados, donde el número de parámetros debe mantenerse extremadamente bajo (por ejemplo, en microcontroladores).
  • Utilizas procesos de aprendizaje automático automatizado integrados específicamente con los servicios en la nube propios de Alibaba.

Cuándo elegir YOLOv7:

  • Ya tienes procesos de GPU heredados optimizados para la inferencia de alta precisión basada en anchors.
  • Operas en entornos donde la precisión en tiempo real es primordial, como los vehículos autónomos de alta velocidad o la robótica avanzada.

Cuándo elegir YOLO26 (recomendado):

  • Estás desarrollando desde cero una aplicación de visión artificial y necesitas lo último en precisión y velocidad de inferencia en CPU y dispositivos edge.
  • Necesitas una implementación rápida y sencilla (por ejemplo, exportando a CoreML o TensorRT) sin tener que lidiar con las limitaciones de los operadores NMS.
  • Quieres aprovechar todas las capacidades de la Ultralytics Platform para entrenar en la nube, gestionar conjuntos de datos y automatizar la implementación.

Al aprovechar el sólido ecosistema de modelos de Ultralytics, los desarrolladores pueden reducir drásticamente el tiempo de ingeniería y, al mismo tiempo, garantizar un rendimiento predictivo de primer nivel en sus aplicaciones del mundo real.

Comentarios