YOLOX frente a YOLOv8#
En los últimos años, el campo de la visión por ordenador ha sido testigo de avances extraordinarios en la detección de objetos en tiempo real. A medida que investigadores e ingenieros amplían continuamente los límites de la precisión y la velocidad, orientarse entre los modelos disponibles puede resultar complicado. Esta guía exhaustiva ofrece una comparativa técnica en profundidad de dos arquitecturas muy influyentes: YOLOX y Ultralytics YOLOv8.
Al analizar sus arquitecturas, metodologías de entrenamiento y capacidades de despliegue, los desarrolladores pueden tomar decisiones fundamentadas al elegir el marco óptimo para sus proyectos de inteligencia artificial.
YOLOX: conectar la investigación y la industria#
YOLOX surgió como un modelo clave que logró salvar la distancia entre la investigación académica y la aplicación industrial. Introdujo un cambio hacia un diseño sin anclajes, que redujo considerablemente el número de parámetros de diseño y los ajustes heurísticos necesarios en los detectores basados en anclajes anteriores.
Detalles del modelo:
- Autor: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun
- Organización: Megvii
- Fecha: 2021-07-18
- Arxiv: YOLOX: supera a la serie YOLO en 2021
- GitHub: Megvii-BaseDetection/YOLOX
- Documentación: Documentación de YOLOX
Aspectos arquitectónicos destacados#
YOLOX integra varias modificaciones clave que lo distinguen de sus predecesores. La más destacada es la cabeza desacoplada, que separa las tareas de clasificación y regresión de cuadros delimitadores en vías distintas. Esta decisión arquitectónica resuelve el conflicto inherente entre la alineación espacial necesaria para la regresión y la invariancia a la traslación requerida para la clasificación, lo que acelera la convergencia durante el entrenamiento.
Además, YOLOX utiliza la estrategia de asignación de etiquetas SimOTA. Este método de asignación dinámica plantea la correspondencia entre los objetos de referencia y las predicciones como un problema de transporte óptimo, lo que reduce eficazmente el tiempo de entrenamiento y mejora la precisión media promedio (mAP). El modelo también utiliza técnicas potentes de aumento de datos, como MixUp y Mosaic, aunque las desactiva durante las últimas épocas para estabilizar las características aprendidas.
YOLOv8: el estándar de un ecosistema versátil#
Fruto de años de investigación continua, Ultralytics YOLOv8 representa una importante evolución de los modelos de visión por ordenador más avanzados. Se diseñó desde cero no solo como detector de objetos, sino también como un marco integral multitarea capaz de abordar una amplia variedad de retos de reconocimiento visual mediante una API muy accesible.
Detalles del modelo:
- Autor: Glenn Jocher, Ayush Chaurasia y Jing Qiu
- Organización: Ultralytics
- Fecha: 2023-01-10
- GitHub: ultralytics/ultralytics
- Documentación: Documentación de YOLOv8
Avances arquitectónicos#
YOLOv8 introduce una arquitectura optimizada que sustituye el módulo C3 por el módulo C2f, más eficiente, lo que mejora el flujo de gradientes y la extracción de características sin aumentar demasiado el número de parámetros. Al igual que YOLOX, YOLOv8 utiliza un diseño sin anclajes y una cabeza desacoplada; sin embargo, refina el cálculo de la pérdida incorporando la pérdida focal de distribución (DFL) y la pérdida CIoU, lo que da lugar a predicciones de cajas delimitadoras mucho más precisas, especialmente para objetos pequeños o superpuestos.
Una de las mayores fortalezas de YOLOv8 es su profunda integración en el ecosistema de Ultralytics. Tanto si utilizas la API unificada de Python como la interfaz visual de la plataforma de Ultralytics, la transición del entrenamiento a la implementación es fluida y admite de forma nativa formatos que van desde ONNX hasta TensorRT.
Además de la detección de objetos estándar, YOLOv8 admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de poses y las cajas delimitadoras orientadas (OBB). Esta versatilidad multitarea lo convierte en una opción muy atractiva para entornos de producción complejos en los que hay que mantener varios tipos de modelos.
Comparativa de rendimiento y métricas#
Al comparar estos modelos, los desarrolladores deben tener en cuenta el equilibrio entre precisión, latencia de inferencia y sobrecarga computacional. La tabla siguiente muestra los resultados de referencia de ambas familias de modelos.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
YOLOv8 demuestra sistemáticamente un mAP superior en tamaños de parámetros comparables, al tiempo que mantiene una excelente velocidad en GPU. Además, los modelos de Ultralytics son conocidos por sus menores requisitos de memoria durante el entrenamiento. Esta es una ventaja crucial al aumentar el tamaño de los lotes en hardware de consumo, sobre todo en comparación con arquitecturas Transformer que consumen muchos recursos, como RT-DETR, que utiliza mucha más memoria CUDA.
Experiencia de desarrollo e implementación#
Trabajar con bases de código de investigación heredadas suele requerir configurar entornos complejos y escribir código repetitivo personalizado para la inferencia. En cambio, la API de Ultralytics lo reduce a unas pocas líneas de Python.
from ultralytics import YOLO
# Inicializa el modelo pequeño YOLOv8
model = YOLO("yolov8s.pt")
# Entrena el modelo fácilmente con un conjunto de datos personalizado
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Valida la precisión del modelo
metrics = model.val()
# Ejecuta la inferencia en una imagen de prueba
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()Esta interfaz unificada es un rasgo distintivo del ecosistema de Ultralytics, bien mantenido, y garantiza que los desarrolladores dediquen menos tiempo a depurar problemas del entorno y más a iterar sobre sus soluciones de visión artificial.
Casos de uso y recomendaciones#
Elegir entre YOLOX y YOLOv8 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias en cuanto al ecosistema.
Cuándo elegir YOLOX#
YOLOX es una buena opción para:
- Investigación sobre detección sin anclajes: Investigación académica que utiliza la arquitectura limpia y sin anclajes de YOLOX como base para experimentar con nuevos cabezales de detección o funciones de pérdida.
- Dispositivos de borde ultraligeros: Implementación en microcontroladores o hardware móvil heredado, donde el tamaño extremadamente reducido de la variante YOLOX-Nano (0,91 M de parámetros) es fundamental.
- Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.
Cuándo elegir YOLOv8#
Se recomienda YOLOv8 para:
- Implementaciones versátiles y multitarea: Proyectos que necesitan un modelo probado para detección, segmentación, clasificación y estimación de pose dentro del ecosistema Ultralytics.
- Sistemas de producción consolidados: Entornos de producción existentes basados en la arquitectura YOLOv8, con canalizaciones de implementación estables y bien probadas.
- Amplio respaldo de la comunidad y del ecosistema: Aplicaciones que se benefician de los numerosos tutoriales de YOLOv8, las integraciones de terceros y los recursos de una comunidad activa.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
De cara al futuro: la arquitectura YOLO26#
Aunque YOLOv8 ofrece un equilibrio y una facilidad de uso excepcionales, la inteligencia artificial sigue avanzando rápidamente. Lanzado en enero de 2026, YOLO26 representa el estándar definitivo para la implementación moderna en el borde y en la nube, ya que parte de los conceptos fundamentales de las generaciones anteriores y los optimiza sin descanso.
YOLO26 introduce un diseño integral sin NMS: su cabeza opcional uno a uno (nms=False) omite el paso heurístico de posprocesamiento de supresión no máxima. Este avance garantiza una latencia estable y determinista en diversos destinos de implementación. Además, al eliminar deliberadamente el módulo de pérdida focal de distribución (DFL), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo convierte en la mejor opción para sistemas integrados y aplicaciones móviles.
YOLO26 también revoluciona la estabilidad del entrenamiento al integrar el novedoso optimizador MuSGD, un híbrido de SGD y Muon que acelera la convergencia. Junto con las nuevas funciones de pérdida ProgLoss + STAL, YOLO26 mejora notablemente el reconocimiento de objetos pequeños, algo fundamental para la cartografía con drones y los sistemas de alarma de seguridad.
Conclusiones y recomendaciones#
Al comparar marcos de trabajo antiguos con soluciones modernas, la tendencia está clara. Aunque YOLOX fue un paso decisivo en la transición a metodologías sin anclajes, la falta de un ecosistema multitarea integrado limita su utilidad en entornos de producción de ritmo acelerado.
Para los desarrolladores que priorizan una experiencia fluida, compatibilidad con diversas tareas y el respaldo de una comunidad sólida, YOLOv8 sigue siendo una opción muy robusta. Sin embargo, para quienes buscan maximizar el rendimiento de la computación en el borde, eliminar los cuellos de botella de NMS y lograr la máxima precisión posible con las últimas innovaciones en entrenamiento, YOLO26 es, con diferencia, el modelo recomendado para cualquier nuevo proyecto de visión artificial.
Si te interesa explorar otros modelos de la gama Ultralytics, también puedes consultar las características de rendimiento de YOLO11 o leer sobre los conceptos pioneros sin NMS que se probaron originalmente en YOLOv10.