DAMO-YOLO frente a YOLO11#
Al elegir una arquitectura de detección de objetos en tiempo real para tu próximo proyecto de visión por ordenador, es fundamental comprender las diferencias entre los principales modelos. Esta guía exhaustiva ofrece un análisis técnico detallado que compara DAMO-YOLO y Ultralytics YOLO11, y explora sus arquitecturas, métricas de rendimiento, metodologías de entrenamiento y escenarios ideales de implementación en el mundo real.
Detalles de DAMO-YOLO:
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- Documentación: Documentación de DAMO-YOLO
Detalles de YOLO11:
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: ultralytics/ultralytics
- Documentación: Documentación de YOLO11
Filosofía de diseño arquitectónico#
La arquitectura subyacente de un modelo de detección de objetos determina su velocidad de inferencia, precisión y adaptabilidad en diversos entornos de hardware.
DAMO-YOLO introduce varias innovaciones académicas y depende en gran medida de la Búsqueda de Arquitectura Neuronal (NAS) para diseñar automáticamente su backbone. Utiliza una RepGFPN (Red Piramidal de Características Generalizada Reparametrizada) eficiente para mejorar la fusión de características y un diseño ZeroHead que reduce considerablemente la pesada cabeza de predicción habitual en arquitecturas anteriores. Aunque este enfoque basado en NAS permite a DAMO-YOLO alcanzar eficiencias específicas en determinadas GPU, las arquitecturas resultantes a veces carecen de la flexibilidad necesaria para generalizarse sin problemas en diversos dispositivos edge.
En cambio, YOLO11 se basa en años de investigación fundamental para ofrecer una arquitectura optimizada y diseñada manualmente. Se centra en un backbone simplificado y un neck muy eficiente que reduce los cálculos redundantes. Una de las principales ventajas de YOLO11 es la eficiencia refinada de sus parámetros: logra una representación de características de alta calidad sin los elevados requisitos de VRAM habituales en modelos basados en Transformer como RT-DETR. Esto hace que YOLO11 sea excepcionalmente versátil y pueda ejecutarse con fluidez en GPU de consumo, dispositivos móviles y aceleradores edge especializados.
Rendimiento y métricas#
Evaluar el rendimiento requiere mirar más allá de la precisión general y tener en cuenta el equilibrio entre velocidad, tamaño del modelo y carga computacional (FLOPs).
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Como demuestra la tabla, YOLO11 logra un equilibrio de rendimiento muy favorable. La variante YOLO11s, por ejemplo, supera a DAMO-YOLOs en precisión y mantiene al mismo tiempo una huella de parámetros considerablemente menor. Esta reducción de los requisitos de memoria se traduce directamente en menores costes de implementación y un rendimiento más ágil en dispositivos edge.
Metodologías de entrenamiento y usabilidad#
La canalización de entrenamiento es donde los desarrolladores pasan la mayor parte del tiempo, por lo que la eficiencia del entrenamiento es una cuestión primordial.
DAMO-YOLO emplea un proceso de entrenamiento en varias etapas que depende en gran medida de la destilación de conocimiento. Utiliza AlignedOTA (Asignación de Transporte Óptimo) para la asignación de etiquetas y a menudo requiere entrenar un modelo «teacher» más grande para destilar conocimiento en modelos «student» más pequeños. Esta metodología aumenta considerablemente la huella de memoria de CUDA y el tiempo de cálculo total necesario para lograr una convergencia óptima.
Por el contrario, el ecosistema de Ultralytics abstrae la complejidad del entrenamiento de modelos. YOLO11 está diseñado para ofrecer una facilidad de uso excepcional, con una API de Python simplificada e interfaces CLI completas que permiten a los ingenieros iniciar el entrenamiento con conjuntos de datos personalizados mediante un único comando. La canalización de entrenamiento es eficiente en cuanto a recursos por diseño y minimiza los picos de memoria, de modo que incluso los modelos más grandes pueden entrenarse en hardware estándar.
Entrenar un modelo de Ultralytics no requiere código repetitivo. Las canalizaciones integradas de carga de datos, aumento y cálculo de pérdidas están completamente optimizadas desde el primer momento.
Aquí tienes un ejemplo rápido de lo sencillo que es entrenar e implementar un modelo de Ultralytics:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Export the trained model to ONNX for seamless deployment
model.export(format="onnx")Aplicaciones en el mundo real y versatilidad#
La elección entre estas arquitecturas suele depender de la amplitud de las tareas necesarias en tu entorno de implementación.
Cuándo encaja DAMO-YOLO#
DAMO-YOLO es estrictamente un marco de detección de objetos. Destaca en entornos de investigación académica donde los equipos exploran la reparametrización o reproducen experimentos específicos de búsqueda de arquitectura neuronal. También se puede implementar en entornos industriales muy restringidos donde un acelerador de GPU muy específico coincide perfectamente con el 'backbone' generado por la NAS.
La ventaja de Ultralytics#
Los modelos de Ultralytics, incluido YOLO11, brillan en aplicaciones comerciales del mundo real debido a su versatilidad sin igual y a su ecosistema bien mantenido. A diferencia de DAMO-YOLO, el marco de Ultralytics admite múltiples tareas de forma nativa. Desde la Segmentación de instancias en imágenes médicas hasta la Estimación de poses para análisis biomecánico en deportes, una sola base de código unificada se encarga de todo.
Entre las industrias que utilizan YOLO11 se incluyen:
- Agricultura inteligente: uso de la detección de objetos para supervisar el estado de los cultivos y automatizar la maquinaria de recolección.
- Analítica del comercio minorista: implementación de la videovigilancia inteligente para analizar el tráfico de clientes y automatizar la gestión del inventario.
- Logística y cadena de suministro: detección de códigos de barras y paquetes a alta velocidad mediante cajas delimitadoras orientadas (OBB) en cintas transportadoras de movimiento rápido.
Casos de uso y recomendaciones#
La elección entre DAMO-YOLO y YOLO11 depende de los requisitos específicos de tu proyecto, las restricciones de implementación y tus preferencias en cuanto al ecosistema.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO es una buena opción para:
- Análisis de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con un FPS elevado en una infraestructura GPU NVIDIA fija, donde el rendimiento con batch-1 es la métrica principal.
- Líneas industriales de fabricación: Situaciones con estrictas restricciones de latencia GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación sobre búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de los backbones reparametrizados eficientes en el rendimiento de la detección.
Cuándo elegir YOLO11#
YOLO11 se recomienda para:
- Despliegue periférico en producción: aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
- Aplicaciones de visión multitarea: proyectos que requieren detección, segmentación, estimación de pose y OBB dentro de un único framework unificado.
- Prototipado y despliegue rápidos: equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la optimizada API de Python de Ultralytics.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La próxima generación: presentamos YOLO26#
Aunque YOLO11 sigue siendo una opción potente y fiable, el panorama de la visión por ordenador evoluciona rápidamente. Para los desarrolladores que inician nuevos proyectos, el modelo YOLO26 más reciente representa el nuevo estado del arte.
Lanzado en enero de 2026, YOLO26 introduce varios avances revolucionarios:
- Diseño de extremo a extremo sin NMS: al eliminar el postprocesamiento de supresión de no máximos, YOLO26 garantiza tiempos de inferencia más rápidos y deterministas, y simplifica considerablemente las canalizaciones de implementación.
- Hasta un 43 % más de velocidad de inferencia en CPU: gracias a la eliminación de Distribution Focal Loss (DFL), el modelo es especialmente adecuado para dispositivos edge y de bajo consumo que carecen de GPU dedicadas.
- Optimizador MuSGD: al integrar innovaciones del entrenamiento de LLM (inspiradas en Moonshot AI), este optimizador híbrido garantiza una convergencia estable y rápida durante el entrenamiento.
- Funciones de pérdida avanzadas: mediante ProgLoss + STAL, YOLO26 muestra mejoras notables en el reconocimiento de objetos pequeños, algo crucial para las imágenes aéreas y la robótica.
Conclusión#
Tanto DAMO-YOLO como YOLO11 han contribuido significativamente al avance de la visión por ordenador rápida y precisa. Mientras que DAMO-YOLO ofrece interesantes perspectivas académicas sobre la búsqueda de arquitecturas y la destilación, Ultralytics YOLO11 (y el revolucionario YOLO26) proporciona una experiencia de desarrollo superior.
Con menores requisitos de memoria, documentación amplia, capacidades multitarea e integración con la potente Ultralytics Platform, los modelos de Ultralytics siguen siendo la principal recomendación para investigadores e ingenieros de empresas que buscan crear soluciones de IA robustas y escalables. Para quienes exploran otras arquitecturas avanzadas, comparar YOLO26 frente a RT-DETR ofrece información adicional sobre alternativas basadas en Transformer.