YOLOX frente a YOLO26#
El campo de la visión artificial ha experimentado transformaciones increíbles durante la última década. Dos hitos importantes de esta evolución son el lanzamiento de YOLOX, que popularizó las arquitecturas sin anchors, y la reciente introducción de Ultralytics YOLO26, que redefine por completo el rendimiento en tiempo real con un diseño nativo de extremo a extremo y sin NMS. Esta comparativa exhaustiva analiza sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales para ayudar a los desarrolladores a tomar decisiones informadas para su próximo proyecto de IA.
Descripción general de los modelos#
Comprender los orígenes y los principales objetivos de diseño de cada modelo proporciona un contexto esencial para sus respectivos logros técnicos.
YOLOX#
- Autores: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun
- Organización: Megvii
- Fecha: 2021-07-18
- Arxiv: 2107.08430
- GitHub: Megvii-BaseDetection/YOLOX
- Documentación: Documentación de YOLOX en GitHub
Presentado a mediados de 2021, YOLOX supuso un cambio importante al adoptar un diseño sin anchors junto con una cabeza desacoplada y la avanzada estrategia de asignación de etiquetas conocida como SimOTA. Al alejarse de los mecanismos tradicionales de anchor boxes que dominaban las arquitecturas anteriores, YOLOX logró reducir la distancia entre la investigación académica y la aplicación industrial, ofreciendo un marco elegante y muy eficaz para la detección de objetos.
YOLO26#
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2026-01-14
- GitHub: ultralytics/ultralytics
- Plataforma: Ultralytics Platform
Lanzado a principios de 2026, YOLO26 es la culminación de años de mejoras iterativas, con un fuerte enfoque en la implementación en el edge y en la simplificación de los flujos de entrenamiento. Introduce un diseño de extremo a extremo sin NMS, eliminando por completo el paso tradicional de posprocesamiento de supresión de no máximos. Este avance simplifica drásticamente la implementación del modelo en distintos tipos de hardware. Además, al eliminar el módulo Distribution Focal Loss (DFL), YOLO26 consigue una latencia considerablemente menor, consolidándose como la opción principal para las modernas aplicaciones de visión artificial.
Innovaciones arquitectónicas#
Las arquitecturas de estos dos modelos ponen de manifiesto la rápida evolución de las metodologías de aprendizaje profundo, especialmente en lo relativo a las funciones de pérdida y el posprocesamiento.
El enfoque de YOLOX#
YOLOX desacopló las tareas de clasificación y regresión en su cabeza de predicción, lo que aceleró considerablemente la convergencia durante el entrenamiento. Su naturaleza sin anchors redujo el número de parámetros de diseño y minimizó la necesidad de ajustar anchors complejos antes del entrenamiento. Junto con el algoritmo de asignación de etiquetas SimOTA, YOLOX consiguió resultados de vanguardia para su época, especialmente en benchmarks estándar como el dataset COCO.
La ventaja de YOLO26#
YOLO26 lleva la eficiencia arquitectónica al siguiente nivel. La eliminación de NMS no solo reduce la latencia de inferencia, sino que también garantiza tiempos de ejecución coherentes y deterministas, un factor crítico para los vehículos autónomos y la robótica.
Entre las principales innovaciones de YOLO26 se incluyen:
- Optimizador MuSGD: Inspirado en las técnicas de entrenamiento de los modelos de lenguaje grandes (LLM), esta combinación híbrida de SGD y Muon garantiza ejecuciones de entrenamiento excepcionalmente estables y una convergencia más rápida.
- Hasta un 43 % más rápido en inferencia con CPU: Al eliminar DFL y optimizar la arquitectura de la red, YOLO26 está altamente optimizado para dispositivos edge con recursos limitados, desde simples sensores del IoT hasta placas Raspberry Pi.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental para analizar imágenes aéreas y realizar un control de calidad preciso en la automatización industrial.
Si tu proyecto está dirigido a sistemas embebidos o aplicaciones móviles sin GPU dedicadas, el rendimiento optimizado de YOLO26 en CPU ofrece una enorme ventaja, ya que requiere una carga computacional considerablemente menor que los modelos de generaciones anteriores.
Rendimiento y benchmarks#
Al evaluar modelos para entornos de producción, es fundamental analizar el equilibrio entre precisión, velocidad y complejidad computacional. A continuación se muestra una comparativa detallada de modelos estándar evaluados con un tamaño de imagen de 640 píxeles (y de 416 para las variantes nano/tiny).
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Como muestra la tabla, la serie YOLO26 ofrece un equilibrio de rendimiento superior. Por ejemplo, YOLO26x alcanza unos impresionantes 57,5 mAP utilizando casi la mitad de parámetros que el modelo YOLOXx, lo que se traduce directamente en tiempos de inferencia en GPU más rápidos (11,8 ms frente a 16,1 ms) y una flexibilidad de implementación muy superior.
Experiencia de entrenamiento y ecosistema#
Una de las diferencias más importantes entre estas arquitecturas reside en su facilidad de uso y la compatibilidad con el ecosistema.
Aunque YOLOX sigue siendo un repositorio de referencia para los investigadores que estudian el flujo de gradientes y los mecanismos sin anchors, su configuración puede ser compleja y a menudo requiere configurar manualmente las dependencias y los operadores. En cambio, el ecosistema de Ultralytics define el estándar del sector en facilidad de uso.
Al utilizar la API unificada de Python, los desarrolladores pueden inicializar, entrenar e implementar modelos YOLO26 con una sencillez incomparable. El sistema gestiona de forma nativa la descarga de datasets, el ajuste de hiperparámetros y la exportación fluida a formatos como ONNX, TensorRT y OpenVINO.
from ultralytics import YOLO
# Initialize the cutting-edge, end-to-end YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model efficiently with built-in MuSGD optimization
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model's performance on the validation set
metrics = model.val()
# Export the optimized model for edge deployment
model.export(format="onnx")Además, los modelos YOLO de Ultralytics requieren mucha menos memoria durante el entrenamiento que las alternativas pesadas basadas en Transformer, lo que permite a los ingenieros entrenar con tamaños de batch mayores incluso en hardware de consumo.
Aplicaciones en el mundo real#
En última instancia, elegir entre YOLOX y YOLO26 depende de tus limitaciones de implementación y de tus requisitos multitarea.
Dónde destaca YOLOX#
YOLOX sigue siendo una opción viable para determinados benchmarks académicos y sistemas heredados estrechamente integrados con el framework MegEngine. Su importancia histórica lo convierte en una baseline popular para investigar detectores sin anchors y estrategias de asignación personalizadas.
En qué destaca YOLO26#
YOLO26 está diseñado específicamente para aplicaciones industriales modernas. Como admite de forma nativa la segmentación de instancias, la estimación de poses y las cajas delimitadoras orientadas (OBB), es mucho más versátil que los motores de detección estándar.
- Retail inteligente e inventario: El diseño sin NMS garantiza que los sistemas de pago automatizado procesen las señales de vídeo con una latencia ultrabaja y reconozcan los productos sin el cuello de botella de los bucles de posprocesamiento.
- Análisis con drones y aéreo: La función de pérdida angular especializada para OBB y la integración de ProgLoss + STAL hacen que YOLO26 no tenga rival a la hora de detectar objetos rotados y artefactos diminutos en imágenes satelitales de gran extensión.
- Sistemas de seguridad edge: Con una inferencia en CPU un 43 % más rápida, YOLO26 permite a las empresas implementar análisis de seguridad robustos directamente en hardware local económico, sin necesidad de recurrir a una costosa computación en la nube.
Casos de uso y recomendaciones#
Elegir entre YOLOX y YOLO26 depende de los requisitos específicos de tu proyecto, tus limitaciones de implementación y tus preferencias respecto al ecosistema.
Cuándo elegir YOLOX#
YOLOX es una buena opción para:
- Investigación sobre detección sin anchors: Investigación académica que utiliza la arquitectura limpia y sin anchors de YOLOX como línea base para experimentar con nuevas cabezas de detección o funciones de pérdida.
- Dispositivos edge ultraligeros: Implementaciones en microcontroladores o hardware móvil antiguo donde sea fundamental el tamaño extremadamente reducido de la variante YOLOX-Nano (0.91M de parámetros).
- Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.
Cuándo elegir YOLO26#
YOLO26 se recomienda para:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
Explora otros modelos de Ultralytics#
Si estás explorando la evolución de la visión artificial, merece la pena investigar otros modelos muy capaces de la familia Ultralytics:
- YOLO11: El predecesor inmediato de YOLO26, que ofrece un rendimiento sólido y un amplio respaldo de la comunidad para entornos de producción estables.
- YOLOv8: Una arquitectura ampliamente probada en escenarios reales que estableció el estándar de facilidad de uso y flexibilidad en miles de implementaciones.
En conclusión, aunque YOLOX introdujo conceptos fundamentales en el ámbito de la detección de objetos, el nuevo YOLO26 ofrece un salto generacional en velocidad, precisión y sencillez de implementación, lo que lo convierte en la opción definitiva para desarrolladores y empresas con visión de futuro.