YOLOX frente a DAMO-YOLO#
La evolución de la detección de objetos en tiempo real ha experimentado numerosos cambios de paradigma: de las arquitecturas basadas en anchors a las que prescinden de ellos, y de las redes troncales diseñadas manualmente a la búsqueda automatizada de arquitecturas neuronales (NAS). En esta comparativa técnica exhaustiva, analizaremos dos hitos importantes de esta evolución: YOLOX y DAMO-YOLO. Examinaremos sus innovaciones arquitectónicas, métodos de entrenamiento y compromisos de rendimiento, y también destacaremos cómo la moderna Ultralytics YOLO26 ofrece una alternativa sin igual para los desarrolladores actuales.
YOLOX: pionero del paradigma sin anclajes#
Presentado el 18 de julio de 2021 por Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun en Megvii, YOLOX marcó un punto de inflexión al integrar con éxito un diseño sin anchors en la familia YOLO. Tal como se describe en su detallado informe técnico en ArXiv, YOLOX pretendía salvar la distancia entre la investigación académica y la implementación industrial.
Innovaciones arquitectónicas clave#
YOLOX introdujo varios cambios estructurales fundamentales que mejoraron notablemente sus predecesores:
- Mecanismo sin anchors: Al predecir directamente el centro de un objeto y las dimensiones de su cuadro delimitador, YOLOX redujo el número de heurísticas de diseño y simplificó los complejos procesos de agrupación de anchors. Esto permite que el modelo se adapte muy bien a distintos escenarios de visión artificial.
- Cabezal desacoplado: Los modelos YOLO tradicionales utilizaban un único cabezal acoplado para la clasificación y la regresión. YOLOX implementó un cabezal desacoplado que procesa por separado la clasificación y la localización, lo que aceleró mucho la convergencia y mejoró la precisión.
- Asignación de etiquetas SimOTA: Se utilizó una versión simplificada de la asignación por transporte óptimo (OTA) para asignar dinámicamente muestras positivas, reducir los tiempos de entrenamiento y resolver las ambigüedades de las asignaciones basadas en el punto central.
El diseño de cabezal desacoplado de YOLOX influyó enormemente en las generaciones posteriores de detectores de objetos y se convirtió en una característica estándar de muchos modelos modernos.
DAMO-YOLO: búsqueda automatizada de arquitecturas a gran escala#
Desarrollado por Xianzhe Xu y un equipo de investigadores de Alibaba Group, DAMO-YOLO se presentó el 23 de noviembre de 2022. Tal como se detalla en su publicación en ArXiv, el modelo recurrió ampliamente a la búsqueda de arquitectura neuronal (NAS) para ampliar la frontera de Pareto entre velocidad y precisión.
Innovaciones arquitectónicas clave#
La estrategia de DAMO-YOLO se basaba en automatizar el diseño de estructuras eficientes:
- Redes troncales MAE-NAS: Mediante una búsqueda guiada por la entropía máxima, DAMO-YOLO descubrió redes troncales muy eficientes, adaptadas a presupuestos de latencia específicos, especialmente al exportarlas a frameworks como TensorRT.
- RepGFPN eficiente: Un diseño de cuello pesado que mejora considerablemente la fusión de características en distintas resoluciones espaciales, algo muy útil para el análisis de imágenes aéreas y la detección de objetos a distintas escalas.
- ZeroHead: Un cabezal de predicción simplificado que reduce la redundancia computacional sin sacrificar la precisión media promedio (mAP) del modelo.
- AlignedOTA y destilación: Incorpora métodos avanzados de asignación de etiquetas y destilación de conocimiento de profesor a alumno para extraer el máximo rendimiento de modelos alumno más pequeños.
Más información sobre DAMO-YOLO
Comparativa de rendimiento y métricas#
Al comparar estos dos modelos, debemos tener en cuenta el número de parámetros, los FLOPs necesarios y los perfiles de latencia. A continuación se muestran los datos de referencia que comparan YOLOX y DAMO-YOLO en varias escalas.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Aunque ambos modelos ofrecen resultados impresionantes, tienen algunas limitaciones. YOLOX requiere ajustar cuidadosamente su cabezal desacoplado, mientras que la gran dependencia de DAMO-YOLO de la destilación hace que volver a entrenarlo con conjuntos de datos personalizados consuma muchos recursos y requiera grandes cantidades de memoria de GPU.
Casos de uso y recomendaciones#
La elección entre YOLOX y DAMO-YOLO depende de los requisitos concretos de tu proyecto, las restricciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOX#
YOLOX es una buena opción para:
- Investigación sobre detección sin anclajes: Investigación académica que utiliza la arquitectura limpia y sin anclajes de YOLOX como base para experimentar con nuevos cabezales de detección o funciones de pérdida.
- Dispositivos de borde ultraligeros: Implementación en microcontroladores o hardware móvil heredado, donde el tamaño extremadamente reducido de la variante YOLOX-Nano (0,91 M de parámetros) es fundamental.
- Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.
Cuándo elegir DAMO-YOLO#
DAMO-YOLO se recomienda para:
- Analítica de vídeo de alto rendimiento: Procesamiento de flujos de vídeo con FPS elevados en una infraestructura fija de GPU NVIDIA, donde el rendimiento con lotes de tamaño 1 es la métrica principal.
- Líneas de fabricación industrial: Escenarios con estrictas limitaciones de latencia de GPU en hardware dedicado, como la inspección de calidad en tiempo real en líneas de montaje.
- Investigación sobre búsqueda de arquitecturas neuronales: Estudio de los efectos de la búsqueda automatizada de arquitecturas (MAE-NAS) y de las redes troncales reparametrizadas eficientes en el rendimiento de detección.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
La ventaja de Ultralytics: descubre YOLO26#
Aunque YOLOX y DAMO-YOLO representan hitos históricos importantes, los desarrolladores actuales necesitan una solución que combine precisión de vanguardia con una facilidad de uso sin igual. Aquí es donde Ultralytics YOLO26 transforma el panorama. Presentado en enero de 2026, YOLO26 se basa en el legado de los modelos sin NMS para ofrecer el equilibrio definitivo entre velocidad, precisión y experiencia de desarrollo.
¿Por qué elegir YOLO26?#
El ecosistema integrado de Ultralytics supera a los repositorios académicos fragmentados al ofrecer:
- Diseño integral sin NMS: El cabezal opcional uno a uno de YOLO26 (
nms=False) elimina la supresión no máxima (NMS) durante la inferencia. Esto proporciona una latencia extraordinariamente rápida y predecible, fundamental para las implementaciones en el edge y los vehículos autónomos. - Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 simplifica los procesos de exportación a dispositivos edge y reduce drásticamente los requisitos de memoria de las aplicaciones ligeras.
- Optimizador MuSGD: YOLO26 incorpora innovaciones del entrenamiento de LLM gracias a su optimizador híbrido SGD y Muon, que garantiza una estabilidad de entrenamiento sólida y una convergencia ultrarrápida.
- Hasta un 43 % más rápido en inferencia con CPU: Gracias a sus profundas optimizaciones estructurales, YOLO26 funciona a gran velocidad en CPU sin necesidad de costosos equipos con GPU.
- Funciones de pérdida avanzadas: La integración de ProgLoss + STAL mejora enormemente el reconocimiento de objetos pequeños, por lo que resulta ideal para tareas como las inspecciones con drones y la supervisión del IoT.
- Versatilidad: A diferencia de DAMO-YOLO, que es exclusivamente un detector, YOLO26 admite de forma nativa tareas de segmentación de instancias, estimación de pose, clasificación de imágenes y cuadros delimitadores orientados (OBB) en un único framework unificado.
Con la API de Python de Ultralytics, no necesitas configurar manualmente complejos flujos de destilación ni escribir cientos de líneas de código C++ para implementar tu modelo.
from ultralytics import YOLO
# Carga el modelo nano YOLO26 más avanzado
model = YOLO("yolo26n.pt")
# Entrena el modelo fácilmente con un conjunto de datos personalizado
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Ejecuta inferencias ultrarrápidas sin NMS
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Exporta a ONNX o OpenVINO con un solo comando
model.export(format="openvino")Otros modelos que puedes tener en cuenta#
El ecosistema de visión artificial es amplio. En función de tus restricciones específicas, quizá también quieras explorar otras arquitecturas totalmente compatibles con el ecosistema Ultralytics:
- YOLO11: El predecesor de YOLO26, muy capaz y conocido por su robustez en analítica de comercio minorista y control de calidad en la fabricación.
- YOLOv8: Un modelo sin anchors legendario y muy estable que popularizó ampliamente la implementación en dispositivos edge.
- RT-DETR: Un Transformer de detección en tiempo real desarrollado por Baidu, que ofrece una alternativa excelente para tareas que se benefician mucho de los mecanismos de atención global, aunque requiere más memoria de entrenamiento.
Conclusión#
YOLOX y DAMO-YOLO aportaron conceptos esenciales a la evolución del aprendizaje profundo: YOLOX validó el enfoque desacoplado y sin anchors, y DAMO-YOLO demostró el potencial de la búsqueda automatizada de arquitecturas. Sin embargo, en entornos de producción reales, la complejidad de sus bases de código de investigación originales puede ralentizar a los equipos ágiles.
Al aprovechar la completa Plataforma Ultralytics, los desarrolladores pueden superar estos obstáculos. Gracias al diseño integral de YOLO26, su mayor velocidad con CPU y su extensa documentación, acceder a la IA de visión más avanzada es ahora más fácil que nunca. Tanto si desarrollas infraestructuras para ciudades inteligentes como sistemas de diagnóstico sanitario o robótica avanzada, Ultralytics ofrece la vía más eficiente desde los datos sin procesar hasta una implementación robusta en el mundo real.