Ultralytics YOLO27:

Comparativa entre YOLOv7 y DAMO-YOLO#

El panorama de la detección de objetos en tiempo real evoluciona continuamente, mientras investigadores e ingenieros se esfuerzan por encontrar el equilibrio óptimo entre velocidad y precisión. En esta comparativa técnica, analizaremos en profundidad dos arquitecturas destacadas de 2022: YOLOv7 y DAMO-YOLO. Ambos modelos introdujeron conceptos novedosos en la comunidad de visión por computador y abordaron distintos retos relacionados con el entrenamiento de modelos, el diseño arquitectónico y la implementación.

Contexto y detalles técnicos de los modelos#

Antes de profundizar en sus arquitecturas, es fundamental entender el origen de estos dos modelos. Ambos fueron desarrollados por grupos de investigación líderes e introdujeron metodologías avanzadas para ampliar los límites de la detección de objetos en tiempo real.

Detalles de YOLOv7#

Desarrollado como continuación de la familia YOLO, YOLOv7 introdujo el concepto de «bag-of-freebies» entrenables para mejorar significativamente la precisión sin aumentar el coste de inferencia.

Más información sobre YOLOv7

Detalles de DAMO-YOLO#

Creado por investigadores de Alibaba Group, DAMO-YOLO se centró especialmente en la búsqueda de arquitectura neuronal (NAS) y en la destilación avanzada de conocimiento para crear modelos muy eficientes para distintos tipos de hardware.

Más información sobre DAMO-YOLO

Innovaciones arquitectónicas#

YOLOv7: análisis de las rutas de gradiente y reparametrización#

YOLOv7 se centra especialmente en las redes de agregación de capas eficientes ampliadas (E-ELAN). Los autores diseñaron E-ELAN analizando las rutas de gradiente de la red para garantizar que esta pueda aprender continuamente sin degradar la ruta de gradiente original. Además, YOLOv7 utiliza eficazmente la reparametrización del modelo durante la inferencia, fusionando capas de forma fluida para reducir FLOPs y acelerar los tiempos de ejecución. Esto lo hace especialmente capaz de realizar inferencia en tiempo real en GPU modernas.

DAMO-YOLO: búsqueda de arquitectura neuronal y RepGFPN#

DAMO-YOLO diverge al aprovechar intensamente la Neural Architecture Search (NAS) bajo restricciones de latencia. Utiliza un marco llamado MAE-NAS para descubrir esqueletos óptimos adaptados a hardware específico, como dispositivos móviles o aceleradores de borde específicos. Para su cuello, introduce un RepGFPN (Red de Pirámide de Características Generalizada Re-parametrizada) eficiente, y emplea un diseño ZeroHead para minimizar la carga computacional en las cabezas de predicción.

Diferencias en la destilación

Mientras que YOLOv7 se basa en sólidas optimizaciones arquitectónicas inherentes, DAMO-YOLO depende en gran medida de un complejo proceso de destilación de conocimiento en varias etapas. Requiere entrenar un modelo profesor grande para destilar el conocimiento en un modelo alumno más pequeño, lo que puede resultar costoso desde el punto de vista computacional durante la fase de entrenamiento.

Comparación de rendimiento y métricas#

Al comparar estos modelos, es fundamental fijarse en mAP (precisión media promedio), la velocidad de inferencia y la complejidad del modelo.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

La tabla anterior demuestra que YOLOv7 escala bien hacia dominios de alta precisión (YOLOv7x), mientras que DAMO-YOLO ofrece modelos pequeños muy optimizados para entornos con recursos limitados.

Eficiencia del entrenamiento y requisitos de memoria#

Una diferencia importante entre ambas arquitecturas reside en sus metodologías de entrenamiento. La dependencia de DAMO-YOLO de la destilación implica que entrenar un modelo nuevo desde cero o realizar un ajuste fino en un conjunto de datos personalizado de visión por computador suele exigir mucha más VRAM y tiempo de computación de GPU.

En cambio, los modelos integrados en el ecosistema de Ultralytics, como YOLOv7 y versiones posteriores, están muy optimizados para los requisitos de memoria. Permiten a los desarrolladores utilizar tamaños de lote mayores en hardware de consumo sin encontrarse con errores de falta de memoria, lo que simplifica el proceso de seguimiento de experimentos e iteración.

La ventaja de Ultralytics#

Aunque tanto YOLOv7 como DAMO-YOLO ofrecen características atractivas, implementar modelos dentro del ecosistema de Ultralytics proporciona una experiencia de desarrollo inigualable.

  • Facilidad de uso: El paquete de Python de Ultralytics ofrece una API unificada y sencilla. Puedes cambiar rápidamente entre arquitecturas de modelos, iniciar bucles de entrenamiento o ejecutar inferencias con unas pocas líneas de código.
  • Ecosistema bien mantenido: Ultralytics ofrece actualizaciones frecuentes, lo que garantiza la compatibilidad nativa con las versiones más recientes de PyTorch y los controladores de CUDA. También simplifica la exportación de modelos a formatos como ONNX, TensorRT y OpenVINO.
  • Versatilidad: A diferencia de DAMO-YOLO, que es estrictamente un detector de objetos, el ecosistema de Ultralytics admite de forma nativa diversas tareas. Los modelos de la familia Ultralytics pueden realizar detección estándar mediante cajas delimitadoras, estimación de pose, segmentación de instancias y cajas delimitadoras orientadas (OBB).

Ejemplo de código: primeros pasos rápidos#

Así de fácil es cargar modelos de Ultralytics, entrenarlos y ejecutar inferencias con ellos:

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model (or newer models like yolo26n.pt)
model = YOLO("yolov7.pt")

# Train the model on the COCO8 dataset with automated hyperparameter handling
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX format for deployment
model.export(format="onnx")
Exportación de modelos

Con Ultralytics, exportar tus pesos entrenados a distintos formatos acelerados por hardware (como TensorRT o CoreML) se gestiona mediante un único argumento en el comando de exportación, lo que ahorra horas de configuraciones complejas de scripts.

La nueva generación: YOLO26#

Aunque YOLOv7 sigue siendo una arquitectura heredada sólida, el campo ha avanzado rápidamente. Para nuevas implementaciones, Ultralytics YOLO26 (publicado en enero de 2026) es el estándar recomendado y supera a las generaciones anteriores en prácticamente todas las métricas.

  • Diseño de extremo a extremo sin NMS: YOLO26, introducido por primera vez en YOLOv10, elimina de forma nativa el posprocesamiento de supresión no máxima (NMS). Esto garantiza una inferencia determinista y con una latencia ultrabaja, fundamental para la robótica y las tecnologías de conducción autónoma.
  • Optimizador MuSGD: Inspirado en técnicas avanzadas de entrenamiento de LLM (como Kimi K2 de Moonshot AI), este optimizador híbrido combina SGD y Muon para ofrecer un entrenamiento muy estable y una convergencia más rápida en distintos conjuntos de datos.
  • Hasta un 43 % más de velocidad en la inferencia en CPU: Al eliminar estratégicamente la pérdida focal de distribución (DFL), YOLO26 mejora significativamente el rendimiento en plataformas de computación periférica y CPU.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran sustancialmente la detección de objetos pequeños, lo que hace que YOLO26 sea especialmente adecuado para imágenes aéreas y tareas de vigilancia detallada.

Casos de uso ideales#

Cuándo elegir DAMO-YOLO#

  • Investigación académica sobre NAS: Si tu organización está muy centrada en estudiar metodologías de búsqueda de arquitectura neuronal.
  • Latencia extremadamente restringida en hardware específico: Si dispones de recursos para ejecutar búsquedas NAS exhaustivas con el fin de encontrar un backbone adaptado a un chip acelerador de IA personalizado.

Cuándo elegir YOLOv7#

  • Pipelines de GPU existentes: Para equipos que mantienen pipelines de producción heredados profundamente optimizados en torno a la arquitectura E-ELAN específica de YOLOv7 en hardware NVIDIA de gama alta.

Por qué migrar a los modelos modernos de Ultralytics (YOLO11 / YOLO26)#

Para la gran mayoría de las aplicaciones empresariales —desde la analítica minorista y la fabricación inteligente hasta la atención sanitaria—, los modelos modernos de Ultralytics no tienen rival. La integración con la plataforma de Ultralytics proporciona un pipeline de ML completo, con facilidad de uso, documentación superior, un sólido apoyo de la comunidad y versatilidad para múltiples tareas. Tanto si realizas el seguimiento del inventario en una Raspberry Pi como si ejecutas análisis intensivos en la nube, modelos como YOLO26 ofrecen el equilibrio de rendimiento ideal para el futuro de la visión por computador.

Comentarios