YOLOv8 frente a YOLOX#
El panorama de la visión por ordenador ha estado profundamente marcado por la evolución continua de las arquitecturas de detección de objetos en tiempo real. Dos hitos destacados de este recorrido son Ultralytics YOLOv8 y YOLOX. Aunque ambos modelos adoptan un paradigma de diseño sin anclajes para agilizar las predicciones de cuadros delimitadores, representan distintas épocas y filosofías en la investigación del aprendizaje profundo y el desarrollo de ecosistemas de implementación.
Esta completa comparación técnica analiza sus respectivas arquitecturas, metodologías de entrenamiento y métricas de rendimiento en situaciones reales para ayudar a desarrolladores e investigadores a elegir la solución óptima para sus aplicaciones de IA para visión.
Antecedentes de los modelos#
Comprender los orígenes y objetivos de diseño de cada framework proporciona un contexto fundamental para sus diferencias arquitectónicas y la madurez de sus ecosistemas.
Ultralytics YOLOv8#
Desarrollado por Glenn Jocher, Ayush Chaurasia y Jing Qiu en Ultralytics, y publicado el 10 de enero de 2023, YOLOv8 supuso un salto significativo en el ecosistema de Ultralytics. Basándose en el enorme éxito de YOLOv5, YOLOv8 introdujo una arquitectura de última generación muy refinada, capaz de gestionar de forma nativa una amplia variedad de tareas, como la detección de objetos, la segmentación de instancias, la clasificación de imágenes y la estimación de poses.
Su principal ventaja reside en el ecosistema de Ultralytics, bien mantenido, que proporciona una experiencia fluida de «cero a experto» con una API de Python unificada, documentación extensa e integraciones nativas con herramientas de MLOps como Weights & Biases y Comet.
YOLOX#
Presentado por Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun, de Megvii, el 18 de julio de 2021, YOLOX tenía como objetivo reducir la brecha entre la investigación académica y las aplicaciones industriales. Detallado en su artículo de Arxiv, YOLOX causó un gran impacto al orientar la familia YOLO hacia un diseño sin anclajes e integrar una cabeza desacoplada, lo que mejoró la estabilidad y la convergencia del entrenamiento.
Aunque tuvo una gran influencia en 2021, el repositorio de YOLOX en GitHub sigue siendo principalmente una base de código centrada en la investigación. Carece de la amplia versatilidad de tareas y de las pulidas canalizaciones de implementación presentes en los frameworks modernos, por lo que requiere más configuración manual para la implementación en producción.
Innovaciones arquitectónicas#
Ambos modelos utilizan un enfoque sin anclajes, lo que elimina la necesidad de agrupar cuadros de anclaje específicos para cada conjunto de datos antes del entrenamiento. Esto reduce el número de parámetros de ajuste heurístico y simplifica la cabeza de detección.
Cabezas desacopladas y extracción de características#
YOLOX fue pionero en la integración de una cabeza desacoplada en la serie YOLO. Tradicionalmente, las tareas de clasificación y regresión se realizaban en una única cabeza unificada, lo que a menudo provocaba gradientes enfrentados durante el entrenamiento. Al separar las ramas de clasificación y localización, YOLOX logró una convergencia más rápida.
YOLOv8 adoptó y refinó considerablemente este concepto. Utiliza un módulo C2f (cuello de botella de parcialidad entre etapas con dos convoluciones) de última generación en su backbone, en sustitución del módulo C3 anterior. Esto mejora el flujo de gradientes y la representación de características sin añadir una sobrecarga computacional significativa. Además, YOLOv8 implementa una cabeza de detección avanzada sin anclajes mediante Task-Aligned Assigner, que empareja dinámicamente las muestras positivas basándose en una combinación de puntuaciones de clasificación y la intersección sobre unión (IoU), lo que se traduce en una precisión superior.
Los modelos YOLO de Ultralytics están diseñados para ofrecer una eficiencia de memoria excepcional. En comparación con las arquitecturas basadas en Transformer o las bases de código de investigación no optimizadas, YOLOv8 requiere mucha menos memoria CUDA durante el entrenamiento, lo que permite utilizar tamaños de lote mayores en hardware de consumo estándar.
Comparación de rendimiento#
Al evaluar modelos para su implementación en situaciones reales, es fundamental equilibrar la precisión (mAP) con la latencia de inferencia y la complejidad del modelo. La tabla siguiente destaca las métricas de rendimiento en el conjunto de datos COCO.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
Como se observa, los modelos YOLOv8 superan sistemáticamente a sus equivalentes YOLOX con el mismo número de parámetros. Por ejemplo, YOLOv8m alcanza un mAP del 50,2 %, frente al 46,9 % de YOLOXm, lo que demuestra un salto sustancial en precisión, manteniendo velocidades competitivas de inferencia en GPU mediante TensorRT.
Ventajas del entrenamiento y del ecosistema#
Una de las diferencias más evidentes entre estas dos soluciones es la experiencia del desarrollador. Entrenar YOLOX suele requerir configuraciones de entorno complejas, modificaciones manuales de scripts y conocimientos profundos de los entresijos de PyTorch para depurar fugas de memoria o problemas de exportación.
Por el contrario, el ecosistema de Ultralytics abstrae esta complejidad y proporciona una API de Python y una interfaz de línea de comandos (CLI) muy intuitivas.
API de Python simplificada#
Entrenar un modelo YOLOv8 de última generación con un conjunto de datos personalizado solo requiere unas pocas líneas de código:
from ultralytics import YOLO
# Load a pre-trained YOLOv8 model for object detection
model = YOLO("yolov8n.pt")
# Train the model on the COCO8 example dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Easily validate the model
metrics = model.val()
# Export seamlessly to ONNX for production
model.export(format="onnx")Esta API estandariza los flujos de trabajo de las tareas de detección, segmentación y cuadros delimitadores orientados (OBB), lo que reduce drásticamente el tiempo de comercialización de las aplicaciones de producción. Además, las funcionalidades de exportación integradas permiten convertir fácilmente a ONNX, OpenVINO y CoreML sin escribir operadores personalizados de C++.
Casos de uso ideales#
La elección entre estas arquitecturas depende de las restricciones de tu proyecto, aunque YOLOv8 proporciona una base mucho más flexible.
- Análisis en el edge de alta velocidad: Para el procesamiento en tiempo real en dispositivos como NVIDIA Jetson, YOLOv8 ofrece un equilibrio inigualable entre velocidad y precisión, y se puede implementar fácilmente mediante su integración nativa con TensorRT.
- Investigación académica: YOLOX sigue siendo una herramienta educativa valiosa para investigadores que estudian la transición de las metodologías basadas en anclajes a las metodologías sin anclajes dentro de PyTorch.
- Aplicaciones complejas multitarea: Las aplicaciones que requieren el seguimiento simultáneo de objetos y la segmentación de instancias preferirán claramente YOLOv8, ya que estas capacidades están integradas directamente en la biblioteca de Ultralytics.
De cara al futuro: modelos alternativos#
Aunque YOLOv8 supone una enorme mejora respecto a YOLOX, el campo de la IA avanza a una velocidad extraordinaria. Para quienes comiencen nuevos proyectos, recomendamos encarecidamente evaluar Ultralytics YOLO26. Publicado en enero de 2026, YOLO26 representa el nuevo estándar de oro para la IA para visión.
YOLO26 incorpora un revolucionario diseño de extremo a extremo sin NMS, que elimina por completo el posprocesamiento de supresión de máximos no supuestos para simplificar las canalizaciones de implementación. Junto con el novedoso optimizador MuSGD y la eliminación de la pérdida focal de distribución (DFL), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida que YOLOv8. También introduce las funciones de pérdida ProgLoss + STAL, que ofrecen mejoras drásticas en el reconocimiento de objetos pequeños, algo fundamental para las imágenes aéreas y la robótica.
Como alternativa, también puedes considerar YOLO11, otro predecesor sólido y bien respaldado dentro del ecosistema de Ultralytics, que ofrece un rendimiento robusto en diversas tareas.
Conclusión#
YOLOX demostró eficazmente el potencial de las cabezas desacopladas y del diseño sin anclajes en la familia YOLO. Sin embargo, Ultralytics YOLOv8 tomó estos conceptos, refinó la arquitectura y los integró en un ecosistema listo para producción que sigue siendo inigualable en facilidad de uso y versatilidad de tareas. Al elegir un modelo de Ultralytics, los desarrolladores obtienen acceso a un rendimiento superior, un entrenamiento eficiente en cuanto a memoria y un sólido conjunto de herramientas de implementación que facilita la transición de la experimentación al impacto en el mundo real.