Ultralytics YOLO27:

DAMO-YOLO frente a YOLO26#

El panorama de la visión por ordenador evoluciona constantemente, impulsado por la necesidad de arquitecturas que equilibren una alta precisión con una inferencia de baja latencia. Esta comparación profundiza en las complejidades técnicas de DAMO-YOLO y Ultralytics YOLO26, y analiza sus innovaciones arquitectónicas, metodologías de entrenamiento y casos de uso ideales.

Tanto si implementas modelos de visión en dispositivos periféricos como si creas canalizaciones de alto rendimiento en la nube, comprender las diferencias entre estos modelos es crucial para tomar decisiones arquitectónicas fundamentadas en el desarrollo moderno de la IA.

DAMO-YOLO: búsqueda de arquitectura neuronal a gran escala#

DAMO-YOLO, desarrollado por Alibaba Group, se publicó el 23 de noviembre de 2022. Diseñado por Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun, el modelo se centra especialmente en el descubrimiento automatizado de arquitecturas eficientes mediante la Búsqueda de arquitecturas neuronales (NAS).

Puedes consultar la investigación original en su artículo de ArXiv o explorar el código fuente en el repositorio de DAMO-YOLO en GitHub.

Características arquitectónicas principales#

DAMO-YOLO introduce varias innovaciones técnicas diseñadas para ampliar los límites de la detección de objetos en tiempo real:

  • Backbones MAE-NAS: DAMO-YOLO utiliza una búsqueda guiada por entropía máxima para encontrar backbones óptimos. Este enfoque de NAS descubre arquitecturas que equilibran estrictamente la precisión de detección con la velocidad de inferencia en hardware específico.
  • RepGFPN eficiente: Un diseño de neck pesado que mejora significativamente la fusión de características, lo que resulta muy beneficioso al analizar escenas complejas como las que aparecen en las imágenes aéreas.
  • Diseño ZeroHead: Un head de detección muy simplificado que minimiza la complejidad computacional de las capas de predicción finales.
  • AlignedOTA y destilación: DAMO-YOLO emplea la Asignación de transporte óptimo alineado (AlignedOTA) para resolver las ambigüedades en la asignación de etiquetas, junto con una estrategia sólida de mejora mediante destilación de conocimiento para aumentar la precisión de modelos estudiante más pequeños utilizando redes profesor de mayor tamaño.

Más información sobre DAMO-YOLO

La ventaja de Ultralytics: YOLO26#

Lanzado el 14 de enero de 2026 por Glenn Jocher y Jing Qiu en Ultralytics, YOLO26 representa la cúspide de la IA de visión accesible y de alto rendimiento. Construido sobre el legado de YOLO11 y YOLOv10, YOLO26 está diseñado desde cero para el despliegue orientado al borde, la versatilidad multitarea y una facilidad de uso incomparable.

Innovaciones de YOLO26#

Ultralytics YOLO26 introduce varias funcionalidades revolucionarias que lo convierten en la opción definitiva para las aplicaciones modernas de visión por ordenador:

  • Diseño de extremo a extremo sin NMS: YOLO26 elimina de forma nativa el posprocesamiento de Supresión no máxima (NMS). Este enfoque de extremo a extremo, introducido inicialmente en YOLOv10, simplifica drásticamente las canalizaciones de implementación y garantiza una inferencia determinista y de baja latencia.
  • Hasta un 43 % más de velocidad en la inferencia en CPU: Optimizado arquitectónicamente para la computación periférica, YOLO26 ofrece una velocidad excepcional en dispositivos periféricos y CPU estándar, por lo que es perfecto para dispositivos IoT alimentados por batería.
  • Optimizador MuSGD: Inspirado en el entrenamiento de LLM (como Kimi K2 de Moonshot AI), YOLO26 incorpora una combinación de SGD y Muon. Esto aporta la estabilidad del entrenamiento de modelos de lenguaje grandes a la visión por ordenador, lo que se traduce en una convergencia más rápida y fiable.
  • Eliminación de DFL: Al eliminar Distribution Focal Loss, se simplifica el grafo del modelo, lo que permite exportarlo sin complicaciones a formatos como ONNX y TensorRT.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, una característica crítica para las operaciones con drones y la agricultura.
Mejoras específicas para cada tarea

YOLO26 incluye mejoras especializadas para múltiples modalidades: un proto multiescala para la segmentación de instancias, la Estimación residual de log-verosimilitud (RLE) para la estimación de poses y una pérdida angular avanzada para mitigar los problemas de los límites en la detección de cuadros delimitadores orientados (OBB).

Comparación de rendimiento#

Al evaluar estos modelos, el equilibrio entre la precisión (mAP) y la eficiencia computacional (velocidad/FLOPs) es fundamental. La tabla siguiente destaca cómo se comparan estos modelos utilizando el conjunto de datos COCO, el estándar del sector.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Como se observa arriba, YOLO26 ofrece sistemáticamente una mayor precisión con muchos menos parámetros y FLOPs, lo que da lugar a una arquitectura mucho más eficiente tanto para el entrenamiento como para la inferencia.

Eficiencia y facilidad de uso del entrenamiento#

Las complejidades de DAMO-YOLO#

Aunque DAMO-YOLO logra una precisión competitiva, su metodología de entrenamiento es muy compleja. La dependencia de la Búsqueda de arquitecturas neuronales (NAS) y de una intensa destilación de conocimiento implica que entrenar un modelo personalizado suele requerir recursos de GPU considerables y conocimientos especializados. Este proceso de varias etapas —entrenar un modelo profesor enorme para destilarlo en un modelo estudiante más pequeño— puede convertirse en un cuello de botella para los equipos de ingeniería ágiles que intentan iterar rápidamente con conjuntos de datos personalizados.

La experiencia optimizada de Ultralytics#

Por el contrario, Ultralytics YOLO26 está diseñado para ofrecer una facilidad de uso «de cero a experto». Todo el ciclo de vida de entrenamiento, validación e implementación se abstrae mediante una API y una CLI de Python limpias y unificadas. Además, YOLO26 requiere mucha menos memoria de CUDA durante el entrenamiento que los modelos basados en Transformer, como RT-DETR, lo que permite a los investigadores entrenar modelos de última generación en hardware de consumo.

Este es un ejemplo de lo sencillo que es entrenar, evaluar y exportar un modelo YOLO26 utilizando el SDK de Ultralytics:

from ultralytics import YOLO

# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Evaluate the model's performance on the validation set
metrics = model.val()

# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export the model to ONNX format for deployment
model.export(format="onnx")

Para los equipos que prefieren un entorno sin código, Ultralytics Platform proporciona una interfaz intuitiva para anotar conjuntos de datos, entrenar en la nube y realizar implementaciones sin complicaciones.

Aplicaciones en el mundo real#

Elegir la arquitectura adecuada depende en gran medida del entorno de implementación objetivo y de las limitaciones del hardware.

Control de calidad industrial#

Para la automatización de la fabricación de alta velocidad, DAMO-YOLO puede rendir bien en hardware de GPU dedicado. Sin embargo, YOLO26 es la opción preferida para las líneas de montaje modernas. Su diseño de extremo a extremo sin NMS garantiza una latencia determinista y sin fluctuaciones, algo esencial al sincronizar datos visuales con actuadores robóticos en tiempo real.

IA periférica y dispositivos móviles#

Implementar visión por ordenador en dispositivos alimentados por batería requiere una eficiencia extrema. Mientras que DAMO-YOLO depende de necks RepGFPN específicos, YOLO26n (Nano) está optimizado específicamente para la computación periférica. La eliminación de DFL y su 43 % más de velocidad en la inferencia en CPU lo convierten en la solución definitiva para cámaras inteligentes, aplicaciones móviles y sistemas de alarma de seguridad.

Requisitos de proyectos multitarea#

Si un proyecto exige algo más que la detección de objetos —como analizar la mecánica de los jugadores en deportes mediante la estimación de poses o extraer límites exactos a nivel de píxel mediante la segmentación de instancias—, YOLO26 ofrece compatibilidad nativa con todas estas tareas dentro de una única base de código unificada. DAMO-YOLO está estrictamente limitado a la detección de cuadros delimitadores.

Casos de uso y recomendaciones#

Elegir entre DAMO-YOLO y YOLO26 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir DAMO-YOLO#

DAMO-YOLO es una buena opción para:

  • Análisis de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con un FPS elevado en una infraestructura GPU NVIDIA fija, donde el rendimiento con batch-1 es la métrica principal.
  • Líneas industriales de fabricación: Situaciones con estrictas restricciones de latencia GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
  • Investigación sobre búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de los backbones reparametrizados eficientes en el rendimiento de la detección.

Cuándo elegir YOLO26#

YOLO26 se recomienda para:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

Conclusión#

Ambas arquitecturas representan logros importantes en el campo del aprendizaje profundo. DAMO-YOLO ofrece una perspectiva fascinante sobre el potencial de la Búsqueda de arquitecturas neuronales y las técnicas de destilación adaptadas a benchmarks de hardware específicos.

Sin embargo, para los desarrolladores, investigadores y empresas que buscan una solución lista para producción, Ultralytics YOLO26 destaca como la opción superior. Su combinación de un diseño de extremo a extremo sin NMS, ganancias masivas en la inferencia de CPU, versatilidad multitarea y la integración en el ecosistema de Ultralytics bien mantenido hace de Ultralytics YOLO26 la herramienta más robusta y práctica para resolver desafíos de visión artificial del mundo real hoy en día.

Para los usuarios interesados en explorar otros modelos del ecosistema de Ultralytics, hay documentación completa disponible para YOLO11, YOLOv8 y el modelo basado en Transformer RT-DETR.

Comentarios