YOLOX frente a DAMO-YOLO#
La evolución de la detección de objetos en tiempo real ha experimentado numerosos cambios de paradigma, desde arquitecturas basadas en anclajes hasta arquitecturas sin anclajes, y desde backbones diseñados manualmente hasta la búsqueda automatizada de arquitecturas neuronales (NAS). En esta completa comparación técnica, analizaremos dos hitos importantes de este recorrido: YOLOX y DAMO-YOLO. Exploraremos sus innovaciones arquitectónicas, metodologías de entrenamiento y compromisos de rendimiento, y destacaremos también cómo la moderna Ultralytics YOLO26 ofrece una alternativa sin parangón para los desarrolladores actuales.
YOLOX: pionero del paradigma sin anclajes#
Lanzado el 18 de julio de 2021 por Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun en Megvii, YOLOX marcó un punto de inflexión decisivo al integrar con éxito un diseño sin anclajes en la familia YOLO. Tal como se describe en su detallado informe técnico en ArXiv, YOLOX pretendía reducir la distancia entre la investigación académica y la implementación industrial.
Innovaciones arquitectónicas clave#
YOLOX introdujo varios cambios estructurales fundamentales que mejoraron drásticamente sus predecesores:
- Mecanismo sin anclajes: Al predecir directamente el centro de un objeto y las dimensiones de su cuadro delimitador, YOLOX redujo el número de heurísticas de diseño y simplificó los complejos procesos de agrupación de anclajes. Esto lo hace muy adaptable a distintos escenarios de visión artificial.
- Cabeza desacoplada: Los modelos YOLO tradicionales utilizaban una única cabeza acoplada para la clasificación y la regresión. YOLOX implementó una cabeza desacoplada que procesa la clasificación y la localización por separado, lo que permitió una convergencia mucho más rápida y mejoró la precisión.
- Asignación de etiquetas SimOTA: Se utilizó una versión simplificada de la asignación por transporte óptimo (OTA) para asignar muestras positivas de forma dinámica, reduciendo los tiempos de entrenamiento y resolviendo las ambigüedades de las asignaciones basadas en puntos centrales.
El diseño de cabeza desacoplada de YOLOX influyó considerablemente en las generaciones posteriores de detectores de objetos y se convirtió en una característica estándar de muchos modelos modernos.
DAMO-YOLO: búsqueda automatizada de arquitecturas a escala#
Desarrollado por Xianzhe Xu y un equipo de investigadores de Alibaba Group, DAMO-YOLO se presentó el 23 de noviembre de 2022. Tal como se detalla en su publicación en ArXiv, el modelo utilizó ampliamente la búsqueda de arquitecturas neuronales (NAS) para ampliar la frontera de Pareto entre velocidad y precisión.
Innovaciones arquitectónicas clave#
La estrategia de DAMO-YOLO se basó en automatizar el diseño de estructuras eficientes:
- Backbones MAE-NAS: Utilizando una búsqueda guiada por entropía máxima, DAMO-YOLO descubrió backbones altamente eficientes adaptados a presupuestos de latencia específicos, en particular al exportar a frameworks como TensorRT.
- Efficient RepGFPN: Un diseño de cuello pesado que mejora considerablemente la fusión de características entre distintas resoluciones espaciales, lo que resulta muy beneficioso para el análisis de imágenes aéreas y la detección de objetos a distintas escalas.
- ZeroHead: Una cabeza de predicción simplificada que elimina la redundancia computacional sin sacrificar la precisión media promedio (mAP) general del modelo.
- AlignedOTA y destilación: Incorpora una asignación avanzada de etiquetas y destilación de conocimiento profesor-alumno para extraer el máximo rendimiento de modelos alumno más pequeños.
Más información sobre DAMO-YOLO
Comparación de rendimiento y métricas#
Al comparar estos dos modelos, debemos fijarnos en su número de parámetros, los FLOPs necesarios y sus perfiles de latencia. A continuación se muestran los datos de referencia que comparan YOLOX y DAMO-YOLO en varias escalas.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Aunque ambos modelos logran resultados impresionantes, presentan ciertas limitaciones. YOLOX requiere un ajuste minucioso de su cabeza desacoplada, mientras que la gran dependencia de DAMO-YOLO de la destilación hace que su reentrenamiento con conjuntos de datos personalizados consuma muchos recursos y requiera grandes cantidades de memoria de GPU.
Casos de uso y recomendaciones#
La elección entre YOLOX y DAMO-YOLO depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias dentro del ecosistema.
Cuándo elegir YOLOX#
YOLOX es una buena opción para:
- Investigación sobre detección sin anchors: Investigación académica que utiliza la arquitectura limpia y sin anchors de YOLOX como línea base para experimentar con nuevas cabezas de detección o funciones de pérdida.
- Dispositivos edge ultraligeros: Implementaciones en microcontroladores o hardware móvil antiguo donde sea fundamental el tamaño extremadamente reducido de la variante YOLOX-Nano (0.91M de parámetros).
- Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO se recomienda para:
- Análisis de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con un FPS elevado en una infraestructura GPU NVIDIA fija, donde el rendimiento con batch-1 es la métrica principal.
- Líneas industriales de fabricación: Situaciones con estrictas restricciones de latencia GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación sobre búsqueda de arquitectura neuronal: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de los backbones reparametrizados eficientes en el rendimiento de la detección.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics: presentamos YOLO26#
Aunque YOLOX y DAMO-YOLO representan hitos históricos importantes, los desarrolladores actuales necesitan una solución que combine una precisión de vanguardia con una facilidad de uso sin parangón. Aquí es donde Ultralytics YOLO26 transforma el panorama. Lanzado en enero de 2026, YOLO26 se basa en el legado de los modelos sin NMS para ofrecer el equilibrio definitivo entre velocidad, precisión y experiencia del desarrollador.
¿Por qué elegir YOLO26?#
El ecosistema integrado de Ultralytics supera a los repositorios académicos fragmentados al ofrecer:
- Diseño integral sin NMS: YOLO26 elimina de forma nativa la supresión de no máximos (NMS) durante la inferencia. Esto se traduce en una latencia increíblemente rápida y predecible, fundamental para las implementaciones en el edge y los vehículos autónomos.
- Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 simplifica los procesos de exportación a dispositivos edge y reduce drásticamente los requisitos de memoria de las aplicaciones ligeras.
- Optimizador MuSGD: YOLO26 incorpora innovaciones del entrenamiento de LLM con su optimizador híbrido SGD y Muon, lo que garantiza una estabilidad de entrenamiento sólida como una roca y una convergencia ultrarrápida.
- Inferencia en CPU hasta un 43 % más rápida: Gracias a profundas optimizaciones estructurales, YOLO26 funciona a gran velocidad en CPU sin necesidad de hardware GPU costoso.
- Funciones de pérdida avanzadas: La integración de ProgLoss + STAL mejora enormemente el reconocimiento de objetos pequeños, lo que lo hace ideal para tareas como las inspecciones con drones y la monitorización de IoT.
- Versatilidad: A diferencia de DAMO-YOLO, que es estrictamente un detector, YOLO26 admite de forma nativa tareas de segmentación de instancias, estimación de poses, clasificación de imágenes y cuadros delimitadores orientados (OBB) en un único framework unificado.
Con la API de Python de Ultralytics, no necesitas configurar manualmente complejos pipelines de destilación ni escribir cientos de líneas de código C++ para implementar tu modelo.
from ultralytics import YOLO
# Load the cutting-edge YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model effortlessly on a custom dataset
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run ultra-fast, NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX or OpenVINO with a single command
model.export(format="openvino")Otros modelos que puedes considerar#
El ecosistema de la visión artificial es muy amplio. Dependiendo de tus limitaciones específicas, también puedes explorar otras arquitecturas totalmente compatibles con el ecosistema de Ultralytics:
- YOLO11: El predecesor de YOLO26, muy capaz y conocido por su robustez en la analítica minorista y el control de calidad industrial.
- YOLOv8: Un modelo sin anclajes legendario y muy estable que popularizó ampliamente la implementación en el edge.
- RT-DETR: Un Transformer de detección en tiempo real desarrollado por Baidu que ofrece una excelente alternativa para tareas que se benefician enormemente de los mecanismos de atención global, aunque a costa de unos requisitos de memoria de entrenamiento más elevados.
Conclusión#
Tanto YOLOX como DAMO-YOLO aportaron conceptos fundamentales a la evolución del deep learning: YOLOX validó el enfoque desacoplado y sin anclajes, mientras que DAMO-YOLO demostró el potencial de la búsqueda automatizada de arquitecturas. Sin embargo, en entornos de producción reales, la complejidad de sus bases de código de investigación originales puede ralentizar a los equipos ágiles.
Al aprovechar la completa Ultralytics Platform, los desarrolladores pueden evitar estos obstáculos. Con el diseño integral de YOLO26, sus velocidades superiores en CPU y su extensa documentación, lograr una IA de visión de vanguardia es más accesible que nunca. Tanto si estás desarrollando infraestructura para ciudades inteligentes como sistemas de diagnóstico sanitario o robótica avanzada, Ultralytics ofrece la ruta más eficiente desde los datos sin procesar hasta una implementación sólida en el mundo real.