Ultralytics YOLO27:

DAMO-YOLO frente a YOLOX#

El panorama de la visión artificial en tiempo real evoluciona constantemente. Dos hitos destacados de este recorrido son DAMO-YOLO y YOLOX, cada uno de los cuales aporta innovaciones únicas al problema de la detección de objetos de alta velocidad y precisión. Aunque ambos modelos han contribuido significativamente a la comunidad de código abierto, comprender sus diferencias arquitectónicas, metodologías de entrenamiento y escenarios de implementación ideales es crucial para los ingenieros de machine learning.

Esta guía exhaustiva explora los matices técnicos de ambos modelos y destaca por qué las alternativas modernas, como la plataforma Ultralytics YOLO26, ofrecen un rendimiento y una facilidad de uso superiores para los entornos de producción actuales.

Descripción general de los modelos#

Detalles de DAMO-YOLO#

Desarrollado por un equipo de investigadores del Grupo Alibaba, DAMO-YOLO se presentó como un método de detección de objetos altamente eficiente que aprovecha el descubrimiento automatizado de arquitecturas.

Más información sobre DAMO-YOLO

Detalles de YOLOX#

Creado por investigadores de Megvii, YOLOX pretendía cerrar la brecha entre las comunidades de investigación y las industriales cambiando la serie YOLO a un diseño sin anclajes, simplificando drásticamente la arquitectura y logrando un mejor rendimiento en ese momento.

Aprende más sobre YOLOX

Análisis arquitectónico#

Arquitectura de DAMO-YOLO#

DAMO-YOLO depende en gran medida de la búsqueda de arquitectura neuronal (NAS). Sus componentes principales incluyen:

  • Troncos MAE-NAS: Utiliza una búsqueda guiada por máxima entropía para descubrir troncos que proporcionan el equilibrio óptimo entre la velocidad de inferencia y la precisión.
  • Efficient RepGFPN: Un diseño de neck pesado adaptado para la fusión de características, que ayuda al modelo a mantener una alta precisión con objetos de distintas escalas.
  • ZeroHead: Una cabeza de detección simplificada y ligera que reduce la sobrecarga computacional en las capas de predicción finales.

Arquitectura de YOLOX#

YOLOX adoptó un enfoque diferente, centrado en la simplicidad estructural y en un diseño sin anchors:

  • Mecanismo sin anchors: Al predecir directamente las coordenadas de las cajas delimitadoras sin anchors predefinidos, YOLOX reduce el número de parámetros de diseño y los ajustes heurísticos necesarios.
  • Cabeza desacoplada: Separa las tareas de clasificación y regresión en distintas ramas de características, lo que mejora la velocidad de convergencia y la precisión general.
  • Asignación de etiquetas SimOTA: Una estrategia avanzada de asignación de etiquetas que asigna dinámicamente muestras positivas a las verdades de terreno, mejorando la eficiencia del entrenamiento.
Filosofías de diseño

Mientras que DAMO-YOLO utiliza búsquedas NAS impulsadas por máquinas para encontrar arquitecturas óptimas bajo restricciones estrictas, YOLOX aprovecha simplificaciones elegantes diseñadas por personas (como las cabezas sin anchors) para agilizar el flujo de trabajo de detección de objetos.

Comparación de rendimiento#

La evaluación de estos modelos requiere analizar la precisión media promedio (mAP), las velocidades de inferencia y el número de parámetros. A continuación se muestra una tabla comparativa detallada de las variantes estándar y ligeras de ambas arquitecturas.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Aunque YOLOXx logra la mAP absoluta más alta, de 51.1, DAMO-YOLOl ofrece una mAP de 50.8 muy competitiva con menos de la mitad de parámetros (42.1M frente a 99.1M) y una ejecución de TensorRT significativamente más rápida.

Metodologías de entrenamiento#

Entrenamiento de DAMO-YOLO#

DAMO-YOLO utiliza una compleja mejora mediante destilación durante el entrenamiento. A menudo, primero se entrena un modelo grande, el «teacher», y su conocimiento se destila en modelos más pequeños, los «student». También emplea AlignedOTA para la asignación dinámica de etiquetas. Aunque este proceso de entrenamiento en varias etapas es muy eficaz, aumenta drásticamente el tiempo de cómputo de GPU y la sobrecarga de memoria necesarios.

Entrenamiento de YOLOX#

YOLOX depende de estrategias potentes de aumento de datos, como MixUp y Mosaic. Sin embargo, los autores descubrieron que desactivar estos aumentos intensivos durante las 15 últimas épocas permite al modelo reducir la brecha con la realidad, mejorando significativamente las métricas de precisión finales.

Casos de uso ideales#

  • DAMO-YOLO: Es más adecuado para implementaciones industriales críticas en las que se puedan admitir pipelines de destilación en el servidor y en las que el hardware de destino (como determinadas GPU de NVIDIA) se beneficie directamente de su arquitectura NAS con un neck pesado.
  • YOLOX: Excelente para desarrolladores que buscan un enfoque completamente sin anchors. El YOLOXnano, extremadamente ligero, resulta viable para dispositivos Android antiguos, la computación en el edge y sensores IoT muy limitados en los que el número de parámetros es el principal cuello de botella.

La ventaja de Ultralytics: llega YOLO26#

Aunque DAMO-YOLO y YOLOX representan hitos excelentes, los desarrolladores actuales exigen soluciones más completas, versátiles y fáciles de usar. Aquí es donde destacan la Ultralytics Platform y la recién lanzada Ultralytics YOLO26.

Lanzado en enero de 2026, YOLO26 es el modelo recomendado definitivo para todas las tareas de visión artificial. Introduce una serie de avances que superan a las arquitecturas anteriores:

  • Diseño de extremo a extremo sin NMS: YOLO26 elimina de forma nativa el posprocesamiento de supresión no máxima (NMS). Esto permite una implementación mucho más sencilla y rápida, evitando los cuellos de botella de latencia inherentes a las cabezas de detección tradicionales.
  • Hasta un 43 % más de velocidad de inferencia en CPU: Al eliminar estratégicamente Distribution Focal Loss (DFL) y optimizar las capas, YOLO26 ofrece velocidades incomparables en CPU y hardware edge.
  • Optimizador MuSGD: Inspirado en las técnicas de entrenamiento de los modelos de lenguaje grandes (LLM), YOLO26 introduce el optimizador MuSGD (una combinación híbrida de SGD y Muon), lo que da lugar a ejecuciones de entrenamiento muy estables y a una convergencia mucho más rápida en comparación con las configuraciones antiguas de YOLOX.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas producen mejoras notables en el reconocimiento de objetos pequeños, lo que hace que YOLO26 sea muy superior para imágenes capturadas por drones y aplicaciones de robótica.
  • Versatilidad: A diferencia de DAMO-YOLO, que se limita estrictamente a la detección de objetos, YOLO26 gestiona de forma nativa la segmentación de instancias, la estimación de pose, la clasificación y las cajas delimitadoras orientadas (OBB) dentro del mismo ecosistema, que recibe un mantenimiento continuo.

Facilidad de uso con Ultralytics#

La API de Python de Ultralytics agiliza la experiencia de desarrollo. Entrenar un modelo YOLO26 de última generación requiere mucho menos código repetitivo y evita los complejos pipelines de destilación de DAMO-YOLO. Además, los modelos de Ultralytics presentan unos requisitos de memoria CUDA excepcionalmente bajos durante el entrenamiento en comparación con los modelos pesados basados en Transformer.

from ultralytics import YOLO

# Load the latest Ultralytics YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset with one line of code
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run fast, NMS-free inference on an image
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")
Entrenamiento e implementación en la nube

Puedes anotar, entrenar e implementar modelos automáticamente en el edge mediante la Ultralytics Platform, que se encarga de todo el control de versiones de los datos y del aprovisionamiento de GPU en la nube.

Conclusión#

La elección entre DAMO-YOLO y YOLOX depende de restricciones específicas: DAMO-YOLO ofrece relaciones excepcionales entre velocidad y precisión en determinadas GPU mediante NAS, mientras que YOLOX proporciona un diseño limpio y sin anchors, ideal para escenarios edge ligeros.

Sin embargo, para los equipos que buscan una solución moderna, preparada para el futuro y respaldada por una comunidad activa, la arquitectura Ultralytics YOLO26 es la opción definitiva. Su diseño sin NMS, su rápida inferencia en CPU y su API unificada para tareas de detección, segmentación y pose la hacen incomparable para pasar sin problemas de la investigación a una producción sólida en el mundo real.

Para los desarrolladores interesados en explorar otras arquitecturas modernas, también recomendamos consultar Ultralytics YOLO11 o modelos basados en Transformer, como RT-DETR, disponibles en la documentación completa de Ultralytics.

Comentarios