YOLOX frente a YOLOv5#
Elegir el modelo de detección de objetos adecuado es una decisión fundamental que determina el éxito de cualquier proyecto de visión artificial. Esta guía ofrece una comparación técnica exhaustiva entre dos modelos clave del panorama de la IA: YOLOX, de Megvii, y Ultralytics YOLOv5. Al analizar sus arquitecturas, métricas de rendimiento y ecosistemas de entrenamiento, nuestro objetivo es ayudar a desarrolladores e investigadores a tomar una decisión fundamentada para sus entornos de implementación específicos.
Introducción a los modelos#
Ambos modelos surgieron durante un periodo de rápido avance en la detección de objetos en tiempo real, pero adoptaron filosofías arquitectónicas distintas para alcanzar su rendimiento.
YOLOX: un enfoque sin anchors#
Publicado por los investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun en Megvii el 18 de julio de 2021, YOLOX introdujo un cambio significativo al alejarse de las cajas anchor tradicionales. Documentado en su informe técnico de Arxiv, YOLOX combinó un diseño sin anchors con una cabeza desacoplada y la estrategia de asignación de etiquetas SimOTA. Este diseño pretendía reducir la brecha entre la investigación académica y la aplicación industrial, ofreciendo un rendimiento sólido en conjuntos de datos estándar.
YOLOv5: el estándar para la IA de visión en producción#
Desarrollado por Glenn Jocher y publicado por Ultralytics el 26 de junio de 2020, YOLOv5 se convirtió rápidamente en el estándar del sector para la visión artificial en producción. Desarrollado de forma nativa sobre el framework PyTorch, democratizó la IA más avanzada al ofrecer una facilidad de uso sin igual, un entrenamiento excepcionalmente rápido y un repositorio muy pulido. La arquitectura de YOLOv5 se centró en lograr un equilibrio perfecto entre velocidad, precisión y facilidad de implementación, lo que lo convirtió en una opción favorita para todo tipo de usos, desde dispositivos periféricos hasta grandes implementaciones en la nube.
Diferencias arquitectónicas#
Comprender las diferencias mecánicas fundamentales entre estas redes aclara por qué rinden de forma distinta en diversas tareas.
Sin anchors frente a con anchors#
La diferencia más característica es el mecanismo sin anchors de YOLOX. Los modelos tradicionales, como YOLOv5, se basan en cajas anchor predefinidas para predecir cajas delimitadoras, lo que requiere analizar agrupaciones en el conjunto de datos de entrenamiento para determinar los tamaños de anchor óptimos. YOLOX prescinde de ellas y predice directamente las coordenadas de las cajas delimitadoras en cada ubicación espacial. Aunque el enfoque sin anchors reduce el número de parámetros de diseño y los ajustes heurísticos, el enfoque refinado de YOLOv5 basado en anchors, con la ayuda de su funcionalidad de auto-anchor, garantiza una convergencia del entrenamiento muy estable y predecible desde el primer momento.
Cabeza desacoplada frente a cabeza acoplada#
YOLOX utiliza una cabeza desacoplada, es decir, las tareas de clasificación y regresión se separan en ramas distintas de la red neuronal. Los autores sostenían que esto resuelve los conflictos entre el aprendizaje de características espaciales y semánticas. En cambio, YOLOv5 utilizaba una cabeza acoplada muy optimizada (en sus primeras versiones), que maximizaba la eficiencia computacional y reducía la latencia de inferencia, algo crucial para la computación periférica en tiempo real.
Estrategia de asignación de etiquetas#
YOLOX utiliza SimOTA para asignar etiquetas y plantea la asociación de objetos reales con las predicciones como un problema de transporte óptimo. Esta asignación dinámica mejora el tratamiento de escenas concurridas. YOLOv5 emplea una asignación robusta basada en reglas de forma, lo que garantiza que se proporcionen muestras positivas de alta calidad a la función de pérdida de forma sistemática y contribuye a su legendaria estabilidad de entrenamiento.
Rendimiento y pruebas de referencia#
El equilibrio entre velocidad y precisión es la prueba definitiva para estas arquitecturas. La tabla siguiente muestra el rendimiento de distintos tamaños de modelo en benchmarks estándar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Aunque YOLOX consigue puntuaciones de mAP competitivas, especialmente en sus variantes más grandes, YOLOv5 mantiene una ventaja notable en la velocidad de inferencia con TensorRT en todos los tamaños. Por ejemplo, el modelo YOLOv5s ofrece una excepcional relación entre velocidad y precisión, por lo que resulta muy atractivo para aplicaciones en tiempo real donde cada milisegundo cuenta.
La ventaja de Ultralytics: entrenamiento y facilidad de uso#
Al pasar de la investigación a la producción, el ecosistema que rodea a un modelo suele ser tan importante como el propio modelo. En este sentido, las ventajas del ecosistema de Ultralytics son evidentes.
Experiencia de usuario optimizada#
YOLOv5 recibe elogios generalizados por su experiencia de desarrollo, que permite pasar de cero a experto. La API de Python de Ultralytics y la CLI permiten cargar, entrenar e implementar modelos con una sola línea de código. En cambio, ejecutar YOLOX desde el repositorio de GitHub de Megvii requiere configurar manualmente más variables de entorno, preparar rutas de Python complejas y superar una curva de aprendizaje más pronunciada, propia de los repositorios de código de investigación académica.
Eficiencia del entrenamiento y requisitos de memoria#
Los modelos de Ultralytics están diseñados meticulosamente para minimizar el uso de memoria durante el entrenamiento. YOLOv5 requiere bastante menos memoria CUDA que los modelos Transformer con muchos parámetros, como RT-DETR, o que los modelos de investigación sin optimizar. Esto permite a los desarrolladores entrenar con lotes más grandes en hardware de consumo y acelerar el ciclo de desarrollo iterativo.
Versatilidad en distintas tareas#
Aunque YOLOX es estrictamente un framework de detección de objetos, el ecosistema de Ultralytics ha evolucionado YOLOv5 para admitir varias tareas de visión. De serie, puedes realizar clasificación de imágenes, segmentación de instancias y detección de objetos con la misma sintaxis de API.
Si necesitas tareas aún más avanzadas, como la estimación de pose o la detección de cajas delimitadoras orientadas (OBB), te recomendamos encarecidamente actualizar a la arquitectura más reciente, Ultralytics YOLO26, que admite todas estas tareas de forma nativa y con una precisión de vanguardia.
Comparativa de código#
La diferencia de facilidad de uso se aprecia mejor con código.
Entrenamiento con YOLOv5:
from ultralytics import YOLO
# Carga un modelo YOLOv5s preentrenado
model = YOLO("yolov5su.pt") # YOLOv5u: pesos de YOLOv5 sin anclajes para el paquete ultralytics
# Entrena el modelo con el conjunto de datos de ejemplo COCO8
model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Ejecuta la inferencia en una imagen
results = model("https://ultralytics.com/images/zidane.jpg")
# Mostrar resultados
results[0].show()Entrenamiento con YOLOX: (Requiere clonar manualmente el repositorio, instalar setup.py y utilizar argumentos complejos de la CLI)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oEl enfoque de Ultralytics elimina obstáculos y te permite centrarte en tu conjunto de datos y en la lógica de la aplicación, en lugar de depurar archivos de configuración. Además, el seguimiento de experimentos es sencillo gracias a las integraciones integradas con Weights & Biases y Comet ML.
Casos de uso ideales y aplicaciones reales#
La elección entre estos modelos depende del entorno operativo de tu proyecto.
Dónde destaca YOLOX#
YOLOX sigue siendo una buena opción en entornos académicos donde los investigadores estudian expresamente los paradigmas sin anchors o las estrategias de asignación de etiquetas. También resulta útil en situaciones en las que la detección de escenas concurridas es la métrica prioritaria y la velocidad de implementación en dispositivos periféricos es secundaria.
Dónde destaca YOLOv5#
YOLOv5 es el campeón indiscutible de la implementación práctica.
- Fabricación de alta velocidad: Para la detección de defectos en líneas de montaje, la latencia de inferencia mínima de YOLOv5 en GPU periféricas garantiza la inspección de los productos sin ralentizar la cinta.
- Drones e imágenes aéreas: Su eficiente uso de memoria permite ejecutarlo en ordenadores auxiliares ligeros instalados en drones para tareas como la supervisión agrícola y el seguimiento de la fauna.
- Comercio minorista inteligente: Desde el pago automatizado hasta la gestión de inventario, YOLOv5 se exporta fácilmente a TensorRT y ONNX para implementarlo a gran escala en miles de cámaras de tiendas.
Perspectivas: las ventajas de YOLO26#
Aunque YOLOv5 es un modelo legendario, el campo de la IA avanza rápidamente. Si hoy vas a iniciar un proyecto, te recomendamos encarecidamente que explores la generación más reciente de modelos de Ultralytics.
Lanzado en 2026, Ultralytics YOLO26 supone un enorme avance. Incluye un diseño opcional de extremo a extremo sin NMS (nms=False), que elimina la necesidad del posprocesamiento de supresión de no máximos y simplifica drásticamente la lógica de implementación. Al eliminar Distribution Focal Loss (DFL) y utilizar el avanzado optimizador MuSGD, YOLO26 consigue una inferencia en CPU hasta un 43 % más rápida que las generaciones anteriores, al tiempo que mantiene una mayor precisión, especialmente con objetos pequeños gracias a ProgLoss + STAL (pérdida progresiva y asignación de etiquetas adaptada a objetos pequeños).
Tanto si eliges la fiabilidad de eficacia probada de YOLOv5 como el rendimiento de vanguardia de YOLO26, la plataforma Ultralytics te ofrece las mejores herramientas para llevar tus soluciones de visión artificial de la idea a la producción sin complicaciones. Explora la completa documentación de Ultralytics para aprovechar todo el potencial de tu flujo de trabajo de IA.