Ultralytics YOLO27:
Get Started

DAMO-YOLO frente a YOLO26#

El panorama de la visión artificial evoluciona constantemente, impulsado por la necesidad de arquitecturas que equilibren una alta precisión con una inferencia de baja latencia. Esta comparativa profundiza en los aspectos técnicos de DAMO-YOLO y Ultralytics YOLO26 y explora sus innovaciones arquitectónicas, metodologías de entrenamiento y casos de uso ideales.

Tanto si implementas modelos de visión en dispositivos de borde como si creas cadenas de procesamiento en la nube de alto rendimiento, comprender los matices entre estos modelos es fundamental para tomar decisiones arquitectónicas fundamentadas en el desarrollo de IA moderno.

DAMO-YOLO: búsqueda de arquitecturas neuronales a gran escala#

DAMO-YOLO, desarrollado por Alibaba Group, se lanzó el 23 de noviembre de 2022. Diseñado por Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun, el modelo se centra en gran medida en el descubrimiento automatizado de arquitecturas eficientes mediante la búsqueda de arquitecturas neuronales (NAS).

Puedes consultar la investigación original en su artículo de ArXiv o explorar el código fuente en el repositorio de DAMO-YOLO en GitHub.

Características arquitectónicas principales#

DAMO-YOLO introduce varias innovaciones técnicas diseñadas para ampliar los límites de la detección de objetos en tiempo real:

  • Redes troncales MAE-NAS: DAMO-YOLO utiliza una búsqueda guiada por la entropía máxima para encontrar redes troncales óptimas. Este enfoque NAS descubre arquitecturas que equilibran estrictamente la precisión de detección y la velocidad de inferencia en hardware específico.
  • RepGFPN eficiente: Un diseño de cuello pesado que mejora considerablemente la fusión de características, algo muy útil para analizar escenas complejas como las de las imágenes aéreas.
  • Diseño ZeroHead: Una cabeza de detección muy simplificada que minimiza la complejidad computacional de las capas de predicción finales.
  • AlignedOTA y destilación: DAMO-YOLO emplea la asignación alineada de transporte óptimo (AlignedOTA) para resolver las ambigüedades en la asignación de etiquetas, junto con una sólida estrategia de mejora mediante destilación de conocimiento para aumentar la precisión de los modelos estudiante pequeños utilizando redes profesor más grandes.

Más información sobre DAMO-YOLO

La ventaja de Ultralytics: YOLO26#

Lanzado el 14 de enero de 2026 por Glenn Jocher y Jing Qiu en Ultralytics, YOLO26 representa la cumbre de la IA visual accesible y de alto rendimiento. Sobre los cimientos de YOLO11 y YOLOv10, YOLO26 se ha diseñado desde cero para priorizar la implementación en el borde, ofrecer versatilidad multitarea y facilitar el uso como ningún otro.

Innovaciones de YOLO26#

Ultralytics YOLO26 introduce varias funciones revolucionarias que lo convierten en la opción definitiva para las aplicaciones modernas de visión artificial:

  • Diseño integral sin NMS: La cabeza nativa uno a uno de YOLO26 (nms=False) elimina el posprocesamiento de supresión no máxima (NMS). Este enfoque integral, introducido inicialmente en YOLOv10, simplifica enormemente las cadenas de implementación y garantiza una inferencia determinista y de baja latencia.
  • Inferencia en CPU hasta un 43 % más rápida: YOLO26, optimizado arquitectónicamente para la computación en el borde, ofrece una velocidad excepcional en dispositivos de borde y CPU convencionales, por lo que es perfecto para dispositivos IoT alimentados por batería.
  • Optimizador MuSGD: Inspirado en el entrenamiento de LLM (como Kimi K2 de Moonshot AI), YOLO26 incorpora una combinación híbrida de SGD y Muon. Esto aporta a la visión artificial la estabilidad del entrenamiento de los grandes modelos de lenguaje, lo que se traduce en una convergencia más rápida y fiable.
  • Eliminación de DFL: Al eliminar la pérdida focal de distribución, se simplifica el grafo del modelo y se facilita la exportación a formatos como ONNX y TensorRT.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, una característica fundamental para las operaciones con drones y la agricultura.
Mejoras específicas por tarea

YOLO26 incorpora mejoras especializadas en distintas modalidades: un prototipo multiescala para la segmentación de instancias, la estimación residual de log-verosimilitud (RLE) para la estimación de pose y una función de pérdida angular avanzada para mitigar los problemas de límites en la detección de cajas delimitadoras orientadas (OBB).

Comparativa de rendimiento#

Al evaluar estos modelos, el equilibrio entre precisión (mAP) y eficiencia computacional (velocidad/FLOPs) es primordial. La tabla siguiente destaca las diferencias entre estos modelos con el conjunto de datos COCO, el estándar del sector.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4

Como se muestra arriba, YOLO26 ofrece sistemáticamente una mayor precisión con muchos menos parámetros y FLOPs, lo que da lugar a una arquitectura mucho más eficiente tanto para el entrenamiento como para la inferencia.

Eficiencia y facilidad de uso del entrenamiento#

La complejidad de DAMO-YOLO#

Aunque DAMO-YOLO alcanza una precisión competitiva, su metodología de entrenamiento es muy compleja. La dependencia de la búsqueda de arquitecturas neuronales (NAS) y de una destilación de conocimiento intensiva hace que entrenar un modelo personalizado suela requerir importantes recursos de GPU y conocimientos especializados. Este proceso de varias etapas —entrenar un enorme modelo profesor para destilarlo en un modelo estudiante más pequeño— puede frenar a los equipos de ingeniería ágiles que intentan iterar rápidamente con conjuntos de datos personalizados.

La experiencia optimizada de Ultralytics#

Por el contrario, Ultralytics YOLO26 está diseñado para que cualquiera pueda pasar de cero a experto. Todo el ciclo de vida del entrenamiento, la validación y la implementación se articula mediante una API de Python y una CLI limpias y unificadas. Además, YOLO26 requiere mucha menos memoria CUDA durante el entrenamiento que los modelos basados en Transformer, como RT-DETR, lo que permite a los investigadores entrenar modelos de vanguardia en hardware de consumo.

Este es un ejemplo de lo sencillo que es entrenar, evaluar y exportar un modelo YOLO26 con el SDK de Ultralytics:

from ultralytics import YOLO

# Carga el modelo nano YOLO26 más reciente
model = YOLO("yolo26n.pt")

# Entrena el modelo con el conjunto de datos COCO8 durante 50 épocas
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Evalúa el rendimiento del modelo con el conjunto de validación
metrics = model.val()

# Ejecuta la inferencia en una imagen de muestra
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Exporta el modelo al formato ONNX para implementarlo
model.export(format="onnx")

Para los equipos que prefieren un entorno sin código, la plataforma Ultralytics ofrece una interfaz intuitiva para anotar conjuntos de datos, entrenar en la nube e implementar modelos sin complicaciones.

Aplicaciones en el mundo real#

Elegir la arquitectura adecuada depende en gran medida del entorno de implementación de destino y de las limitaciones del hardware.

Control de calidad industrial#

Para la automatización de la fabricación a alta velocidad, DAMO-YOLO puede ofrecer buenos resultados en hardware con GPU dedicada. Sin embargo, YOLO26 es la opción preferida para las líneas de montaje modernas. Su diseño integral sin NMS garantiza una latencia determinista y sin fluctuaciones, algo esencial para sincronizar datos visuales con actuadores robóticos en tiempo real.

IA de borde y dispositivos móviles#

Implementar visión artificial en dispositivos alimentados por batería requiere una eficiencia extrema. Mientras que DAMO-YOLO depende de cuellos RepGFPN específicos, YOLO26n (Nano) está optimizado específicamente para la computación en el borde. La eliminación de DFL y una inferencia en CPU un 43 % más rápida lo convierten en la solución definitiva para cámaras inteligentes, aplicaciones móviles y sistemas de alarma de seguridad.

Requisitos de proyectos multitarea#

Si un proyecto requiere algo más que detección de objetos —por ejemplo, analizar la mecánica de los jugadores en deportes mediante la estimación de pose o extraer límites exactos a nivel de píxel mediante la segmentación de instancias—, YOLO26 ofrece compatibilidad nativa con todas estas tareas en una única base de código unificada. DAMO-YOLO se limita estrictamente a la detección de cajas delimitadoras.

Casos de uso y recomendaciones#

La elección entre DAMO-YOLO y YOLO26 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir DAMO-YOLO#

DAMO-YOLO es una buena opción para:

  • Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con FPS elevados en una infraestructura fija de GPU NVIDIA, donde el rendimiento con lotes de tamaño 1 es la métrica principal.
  • Líneas de fabricación industrial: Escenarios con estrictas limitaciones de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
  • Investigación sobre búsqueda de arquitecturas neuronales: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de las redes troncales reparametrizadas eficientes en el rendimiento de detección.

Cuándo elegir YOLO26#

Se recomienda YOLO26 para:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

Conclusión#

Ambas arquitecturas representan logros importantes en el campo del aprendizaje profundo. DAMO-YOLO ofrece una interesante muestra del potencial de la búsqueda de arquitecturas neuronales y de las técnicas de destilación adaptadas a pruebas de rendimiento de hardware específicas.

Sin embargo, para los desarrolladores, investigadores y empresas que buscan una solución lista para producción, Ultralytics YOLO26 destaca como la opción superior. La combinación de un diseño integral sin NMS, grandes mejoras en la inferencia en CPU, versatilidad multitarea e integración en el ecosistema de Ultralytics, bien mantenido, lo convierte en la herramienta más sólida y práctica para resolver hoy los retos reales de la visión artificial.

Los usuarios interesados en explorar otros modelos del ecosistema Ultralytics tienen a su disposición documentación completa sobre YOLO11, YOLOv8 y RT-DETR, basado en Transformer.

Comentarios