YOLOX frente a YOLOv5#
Seleccionar el modelo de detección de objetos adecuado es una decisión crítica que determina el éxito de cualquier proyecto de visión artificial. Esta guía ofrece una comparación técnica exhaustiva entre dos modelos fundamentales del panorama de la IA: YOLOX, de Megvii, y Ultralytics YOLOv5. Mediante el análisis de sus arquitecturas, métricas de rendimiento y ecosistemas de entrenamiento, queremos ayudar a desarrolladores e investigadores a tomar una decisión informada para sus entornos de despliegue específicos.
Introducción a los modelos#
Ambos modelos surgieron durante un periodo de rápidos avances en la detección de objetos en tiempo real, pero adoptaron filosofías arquitectónicas diferentes para lograr su rendimiento.
YOLOX: un enfoque sin anclajes#
Publicado por los investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun de Megvii el 18 de julio de 2021, YOLOX introdujo un cambio significativo al alejarse de los anchor boxes tradicionales. Documentado en su informe técnico de Arxiv, YOLOX integró un diseño sin anclajes con una cabeza desacoplada y la estrategia de asignación de etiquetas SimOTA. Este diseño pretendía reducir la brecha entre la investigación académica y la aplicación industrial, ofreciendo un sólido rendimiento en conjuntos de datos estándar.
YOLOv5: el estándar para la IA de visión en producción#
Creado por Glenn Jocher y publicado por Ultralytics el 26 de junio de 2020, YOLOv5 se convirtió rápidamente en el estándar del sector para la visión artificial desplegada. Basado de forma nativa en el framework PyTorch, democratizó la IA de vanguardia al ofrecer una facilidad de uso incomparable, un entrenamiento excepcionalmente rápido y un repositorio muy cuidado. La arquitectura de YOLOv5 se centró en lograr un equilibrio perfecto entre velocidad, precisión y facilidad de despliegue, lo que lo convirtió en una opción favorita para todo tipo de aplicaciones, desde dispositivos periféricos hasta grandes despliegues en la nube.
Diferencias arquitectónicas#
Comprender las diferencias mecánicas fundamentales entre estas redes aclara por qué rinden de forma distinta en diversas tareas.
Sin anclajes frente a basada en anclajes#
El contraste más definitorio es el mecanismo sin anclajes de YOLOX. Los modelos tradicionales, como YOLOv5, dependen de anchor boxes predefinidos para predecir BBox, lo que requiere un análisis de agrupamiento en el conjunto de datos de entrenamiento para determinar los tamaños óptimos de los anclajes. YOLOX elimina este proceso y predice directamente las coordenadas de BBox en cada ubicación espacial. Aunque el enfoque sin anclajes reduce el número de parámetros de diseño y el ajuste heurístico, el enfoque basado en anclajes perfeccionado de YOLOv5, con la ayuda de su funcionalidad auto-anchor, garantiza una convergencia del entrenamiento increíblemente estable y predecible desde el primer momento.
Cabeza desacoplada frente a cabeza acoplada#
YOLOX emplea una cabeza desacoplada, lo que significa que las tareas de clasificación y regresión se separan en ramas distintas de la red neuronal. Los autores sostenían que esto resuelve los conflictos entre el aprendizaje de características espaciales y semánticas. Por el contrario, YOLOv5 utilizaba una cabeza acoplada altamente optimizada (en sus primeras versiones) que maximizaba la eficiencia computacional y reducía la latencia de inferencia, algo crucial para la computación periférica en tiempo real.
Estrategia de asignación de etiquetas#
YOLOX utiliza SimOTA para la asignación de etiquetas, formulando la correspondencia entre los objetos reales y las predicciones como un problema de transporte óptimo. Esta asignación dinámica mejora el tratamiento de escenas abarrotadas. YOLOv5 emplea una asignación sólida basada en reglas de forma, lo que garantiza que las muestras positivas de alta calidad se introduzcan de forma constante en la función de pérdida y contribuye a su legendaria estabilidad de entrenamiento.
Rendimiento y benchmarks#
El equilibrio entre velocidad y precisión es la prueba definitiva para estas arquitecturas. La tabla siguiente muestra el rendimiento de varios tamaños de modelo en benchmarks estándar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Aunque YOLOX logra puntuaciones de mAP competitivas, especialmente en sus variantes más grandes, YOLOv5 mantiene una ventaja notable en velocidad de inferencia con TensorRT en todos los casos. El modelo YOLOv5s, por ejemplo, ofrece una relación velocidad-precisión excepcional, lo que lo hace muy atractivo para aplicaciones en tiempo real donde cada milisegundo cuenta.
La ventaja de Ultralytics: entrenamiento y usabilidad#
Al pasar de la investigación a la producción, el ecosistema que rodea a un modelo suele ser tan importante como el propio modelo. En este aspecto, las ventajas del ecosistema de Ultralytics resultan evidentes.
Experiencia de usuario optimizada#
YOLOv5 recibe elogios generalizados por su experiencia de desarrollo «de cero a héroe». La API de Python de Ultralytics y la CLI permiten cargar, entrenar y desplegar modelos con una sola línea de código. En cambio, ejecutar YOLOX desde el repositorio de GitHub de Megvii requiere configurar manualmente más variables de entorno, establecer rutas complejas de Python y afrontar una curva de aprendizaje más pronunciada, típica de las bases de código de investigación académica.
Eficiencia del entrenamiento y requisitos de memoria#
Los modelos de Ultralytics están diseñados meticulosamente para minimizar el uso de memoria durante el entrenamiento. YOLOv5 requiere bastante menos memoria CUDA que los modelos Transformer con muchos parámetros, como RT-DETR, o los modelos de investigación sin optimizar. Esto permite a los desarrolladores entrenar con tamaños de lote mayores en hardware de consumo, acelerando el ciclo de desarrollo iterativo.
Versatilidad entre tareas#
Mientras que YOLOX es estrictamente un framework de detección de objetos, el ecosistema de Ultralytics ha evolucionado YOLOv5 para admitir múltiples tareas de visión. De serie, puedes realizar clasificación de imágenes, segmentación de instancias y detección de objetos utilizando exactamente la misma sintaxis de API.
Si necesitas tareas aún más avanzadas, como la estimación de pose o la detección de Bounding Box orientados (OBB), te recomendamos encarecidamente actualizar a la arquitectura más reciente de Ultralytics YOLO26, que admite todas estas tareas de forma nativa con una precisión de vanguardia.
Comparación de código#
La diferencia de usabilidad se demuestra mejor con código.
Entrenamiento con YOLOv5:
from ultralytics import YOLO
# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")
# Display results
results[0].show()Entrenamiento con YOLOX: (Requiere clonar manualmente el repositorio, instalar mediante setup.py y utilizar argumentos de CLI complejos)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oEl enfoque de Ultralytics elimina obstáculos y te permite centrarte en tu conjunto de datos y en la lógica de tu aplicación, en lugar de depurar archivos de configuración. Además, realizar el seguimiento de tus experimentos es sencillo gracias a las integraciones integradas con Weights & Biases y Comet ML.
Casos de uso ideales y aplicaciones reales#
La elección entre estos modelos depende del entorno operativo de tu proyecto.
Dónde destaca YOLOX#
YOLOX sigue siendo una opción sólida en entornos académicos donde los investigadores estudian explícitamente los paradigmas sin anclajes o las estrategias de asignación de etiquetas. También resulta útil en situaciones donde la detección en escenas abarrotadas es la métrica prioritaria y la velocidad de despliegue en dispositivos periféricos es secundaria.
Donde destaca YOLOv5#
YOLOv5 es el campeón indiscutible del despliegue práctico.
- Fabricación de alta velocidad: Para la detección de defectos en líneas de ensamblaje, la latencia de inferencia mínima de YOLOv5 en GPU periféricas garantiza que los productos se inspeccionen sin ralentizar la cinta.
- Drones e imágenes aéreas: Su uso eficiente de la memoria permite ejecutarlo en ordenadores complementarios ligeros instalados en drones para tareas como la supervisión agrícola y el seguimiento de fauna.
- Comercio minorista inteligente: Desde el pago automatizado hasta la gestión de inventario, YOLOv5 se exporta fácilmente a TensorRT y ONNX para desplegarlo a gran escala en miles de cámaras de establecimientos.
Una mirada al futuro: la ventaja de YOLO26#
Aunque YOLOv5 es un modelo legendario, el campo de la IA avanza rápidamente. Si hoy comienzas un proyecto nuevo, te recomendamos encarecidamente que eches un vistazo a la última generación de modelos de Ultralytics.
Publicado en 2026, Ultralytics YOLO26 representa un enorme salto adelante. Incorpora un diseño de extremo a extremo sin NMS, que elimina por completo la necesidad del postprocesamiento de supresión de no máximos y simplifica drásticamente la lógica de despliegue. Al eliminar Distribution Focal Loss (DFL) y utilizar el vanguardista optimizador MuSGD, YOLO26 logra una inferencia en CPU hasta un 43 % más rápida que las generaciones anteriores, manteniendo una mayor precisión, especialmente en objetos pequeños, gracias a las nuevas funciones de pérdida ProgLoss + STAL.
Tanto si eliges la fiabilidad probada de YOLOv5 como el rendimiento de vanguardia de YOLO26, la plataforma de Ultralytics garantiza que dispones de las mejores herramientas para llevar tus soluciones de visión artificial del concepto a producción sin complicaciones. No olvides explorar la documentación completa de Ultralytics para aprovechar todo el potencial de tu pipeline de IA.