DAMO-YOLO frente a YOLOX#
El panorama de la visión artificial en tiempo real evoluciona constantemente. Dos hitos destacados de esta evolución son DAMO-YOLO y YOLOX, que aportan innovaciones únicas al reto de la detección de objetos rápida y precisa. Aunque ambos modelos han contribuido significativamente a la comunidad de código abierto, para los ingenieros de aprendizaje automático es fundamental comprender sus diferencias arquitectónicas, sus metodologías de entrenamiento y sus escenarios de despliegue ideales.
Esta guía exhaustiva explora los matices técnicos de ambos modelos y explica por qué las alternativas modernas, como la plataforma Ultralytics YOLO26, ofrecen un rendimiento y una facilidad de uso superiores en los entornos de producción actuales.
Descripción general de los modelos#
Detalles de DAMO-YOLO#
Desarrollado por un equipo de investigadores de Alibaba Group, DAMO-YOLO se presentó como un método muy eficiente de detección de objetos que aprovecha el descubrimiento automatizado de arquitecturas.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang y Xiuyu Sun
- Organización: Alibaba Group
- Fecha: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
- Documentación: Documentación de DAMO-YOLO
Más información sobre DAMO-YOLO
Detalles de YOLOX#
Creado por investigadores de Megvii, YOLOX buscaba tender puentes entre los ámbitos académico e industrial al pasar la serie YOLO a un diseño sin anclajes. Esto simplificó drásticamente la arquitectura y mejoró el rendimiento de la época.
- Autores: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun
- Organización: Megvii
- Fecha: 2021-07-18
- Arxiv: https://arxiv.org/abs/2107.08430
- GitHub: https://github.com/Megvii-BaseDetection/YOLOX
- Documentación: Documentación de YOLOX
Análisis de la arquitectura#
Arquitectura de DAMO-YOLO#
DAMO-YOLO se basa en gran medida en la búsqueda de arquitectura neuronal (NAS). Sus componentes principales son:
- Backbones MAE-NAS: Utilizan una búsqueda guiada por entropía máxima para descubrir backbones que ofrecen el equilibrio óptimo entre velocidad de inferencia y precisión.
- RepGFPN eficiente: Un diseño de neck pesado adaptado a la fusión de características, que ayuda al modelo a mantener una precisión alta con objetos de distintas escalas.
- ZeroHead: Un cabezal de detección sencillo y ligero que reduce la carga computacional de las capas de predicción finales.
Arquitectura de YOLOX#
YOLOX adoptó un enfoque diferente, centrado en la simplicidad estructural y en un diseño sin anclajes:
- Mecanismo sin anclajes: Al predecir directamente las coordenadas de las cajas delimitadoras sin anclajes predefinidos, YOLOX reduce el número de parámetros de diseño y los ajustes heurísticos necesarios.
- Cabezal desacoplado: Separa las tareas de clasificación y regresión en distintas ramas de características, lo que mejora la velocidad de convergencia y la precisión general.
- Asignación de etiquetas SimOTA: Una estrategia avanzada de asignación de etiquetas que distribuye dinámicamente las muestras positivas entre las anotaciones de referencia y mejora la eficiencia del entrenamiento.
DAMO-YOLO utiliza búsquedas NAS automatizadas para encontrar arquitecturas óptimas bajo restricciones estrictas, mientras que YOLOX aprovecha simplificaciones elegantes diseñadas por personas —como los cabezales sin anclajes— para optimizar el pipeline de detección de objetos.
Comparativa de rendimiento#
Para evaluar estos modelos hay que tener en cuenta la precisión media (mAP), la velocidad de inferencia y el número de parámetros. A continuación se muestra una tabla comparativa detallada de las variantes estándar y ligeras de ambas arquitecturas.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
Aunque YOLOXx alcanza el mAP absoluto más alto, con 51,1, DAMO-YOLOl obtiene un mAP muy competitivo de 50,8 con menos de la mitad de parámetros (42,1 M frente a 99,1 M) y una ejecución TensorRT significativamente más rápida.
Metodologías de entrenamiento#
Entrenamiento de DAMO-YOLO#
DAMO-YOLO utiliza técnicas complejas de mejora mediante destilación durante el entrenamiento. A menudo, primero se entrena un modelo «profesor» grande y después se destila su conocimiento en los modelos «estudiante» más pequeños. También emplea AlignedOTA para la asignación dinámica de etiquetas. Aunque resulta muy eficaz, este proceso de entrenamiento en varias etapas aumenta drásticamente el tiempo de cómputo en GPU y la sobrecarga de memoria necesarios.
Entrenamiento de YOLOX#
YOLOX se basa en estrategias de aumento de datos potentes como MixUp y Mosaic. Sin embargo, sus autores descubrieron que desactivar estos aumentos intensos durante las 15 últimas épocas permite al modelo reducir la brecha con la realidad y mejorar significativamente las métricas de precisión finales.
Casos de uso ideales#
- DAMO-YOLO: Es más adecuado para despliegues industriales críticos en los que se pueden mantener pipelines de destilación en el servidor y el hardware objetivo (como determinadas GPU NVIDIA) aprovecha directamente su arquitectura NAS con neck pesado.
- YOLOX: Excelente para los desarrolladores que buscan un enfoque totalmente sin anclajes. Su gran ligereza, gracias a
YOLOXnano, lo hace viable en dispositivos Android antiguos, computación periférica y sensores IoT con recursos muy limitados, donde el número de parámetros es el principal cuello de botella.
La ventaja de Ultralytics: llega YOLO26#
Aunque DAMO-YOLO y YOLOX son hitos excelentes, hoy los desarrolladores necesitan soluciones más completas, versátiles y fáciles de usar. Aquí es donde destacan la plataforma Ultralytics y el recién lanzado Ultralytics YOLO26.
Lanzado en enero de 2026, YOLO26 es el modelo recomendado por excelencia para todas las tareas de visión artificial. Incorpora una serie de avances que superan a las arquitecturas anteriores:
- Diseño de extremo a extremo sin NMS: El cabezal opcional uno a uno de YOLO26 (
nms=False) omite el posprocesamiento de supresión no máxima (NMS). Esto permite un despliegue mucho más sencillo y rápido al evitar los cuellos de botella de latencia propios de los cabezales de detección tradicionales. - Inferencia en CPU hasta un 43 % más rápida: Al eliminar estratégicamente Distribution Focal Loss (DFL) y optimizar las capas, YOLO26 ofrece velocidades excepcionales en CPU y hardware periférico.
- Optimizador MuSGD: Inspirado en las técnicas de entrenamiento de modelos de lenguaje grandes (LLM), YOLO26 incorpora el optimizador MuSGD, un híbrido de SGD y Muon que ofrece entrenamientos muy estables y una convergencia mucho más rápida que las configuraciones heredadas de YOLOX.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, por lo que YOLO26 es muy superior para imágenes de drones y robótica.
- Versatilidad: A diferencia de DAMO-YOLO, dedicado exclusivamente a la detección de objetos, YOLO26 gestiona de forma nativa la segmentación de instancias, la estimación de pose, la clasificación y las cajas delimitadoras orientadas (OBB) dentro del mismo ecosistema, que se mantiene activamente.
Facilidad de uso con Ultralytics#
La API de Python de Ultralytics agiliza la experiencia de desarrollo. Entrenar un modelo YOLO26 de última generación requiere mucho menos código repetitivo y evita los complejos pipelines de destilación de DAMO-YOLO. Además, los modelos de Ultralytics necesitan muy poca memoria CUDA durante el entrenamiento en comparación con los modelos pesados basados en transformers.
from ultralytics import YOLO
# Carga el modelo nano más reciente de Ultralytics YOLO26
model = YOLO("yolo26n.pt")
# Entrena el modelo con tu conjunto de datos personalizado en una sola línea de código
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Ejecuta una inferencia rápida y sin NMS en una imagen
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Exporta a ONNX o TensorRT sin complicaciones
model.export(format="onnx")Puedes anotar, entrenar y desplegar modelos automáticamente en dispositivos periféricos con la plataforma Ultralytics, que se encarga del control de versiones de los datos y del aprovisionamiento de GPU en la nube.
Conclusión#
La elección entre DAMO-YOLO y YOLOX depende de las restricciones concretas: DAMO-YOLO ofrece una relación velocidad-precisión excepcional en determinadas GPU gracias a NAS, mientras que YOLOX ofrece un diseño limpio y sin anclajes, ideal para escenarios periféricos ligeros.
Sin embargo, para los equipos que buscan una solución moderna, preparada para el futuro y respaldada por una comunidad activa, la arquitectura Ultralytics YOLO26 es la opción definitiva. Su inferencia opcional sin NMS, su rápida inferencia en CPU y su API unificada para tareas de detección, segmentación y pose la convierten en una solución inigualable para pasar sin problemas de la investigación a una producción robusta en el mundo real.
Si te interesa explorar otras arquitecturas modernas, también recomendamos echar un vistazo a Ultralytics YOLO11 o a modelos basados en transformers como RT-DETR, disponibles en la documentación completa de Ultralytics.