YOLO Vision 2026:

YOLOX frente a YOLOv5#

Seleccionar el modelo de detección de objetos adecuado es una decisión fundamental que determina el éxito de cualquier proyecto de visión por computadora. Esta guía ofrece una comparación técnica exhaustiva entre dos modelos cruciales en el panorama de la IA: YOLOX de Megvii y Ultralytics YOLOv5. Mediante el análisis de sus arquitecturas, métricas de rendimiento y ecosistemas de entrenamiento, pretendemos ayudar a desarrolladores e investigadores a tomar una decisión informada para sus entornos de despliegue específicos.

Introducción a los modelos#

Ambos modelos surgieron durante un período de rápido avance en la detección de objetos en tiempo real, aunque adoptaron diferentes filosofías arquitectónicas para lograr su rendimiento.

YOLOX: Un enfoque sin anclas#

Lanzado por los investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun en Megvii el 18 de julio de 2021, YOLOX introdujo un cambio significativo al prescindir de las tradicionales cajas delimitadoras (anchor boxes). Documentado en su informe técnico de Arxiv, YOLOX integró un diseño sin anclajes (anchor-free) con una cabeza desacoplada y la estrategia de asignación de etiquetas SimOTA. Este diseño buscaba reducir la brecha entre la investigación académica y la aplicación industrial, ofreciendo un sólido rendimiento en conjuntos de datos estándar.

Más información sobre YOLOX

YOLOv5: El estándar para la IA de visión en producción#

Creado por Glenn Jocher y lanzado por Ultralytics el 26 de junio de 2020, YOLOv5 se convirtió rápidamente en el estándar de la industria para la visión por computadora desplegada. Construido de forma nativa sobre el framework PyTorch, democratizó la IA de vanguardia al ofrecer una facilidad de uso inigualable, un entrenamiento excepcionalmente rápido y un repositorio altamente pulido. La arquitectura de YOLOv5 se centró en un equilibrio perfecto entre velocidad, precisión y facilidad de despliegue, convirtiéndose en el favorito para todo tipo de aplicaciones, desde dispositivos edge hasta despliegues masivos en la nube.

Más información sobre YOLOv5

Diferencias arquitectónicas#

Comprender las diferencias mecánicas fundamentales entre estas redes aclara por qué funcionan de manera distinta en diversas tareas.

Sin anclas frente a basado en anclas#

El contraste más definitorio es el mecanismo sin anclas de YOLOX. Los modelos tradicionales como YOLOv5 dependen de cajas de anclaje predefinidas para predecir cajas delimitadoras, lo cual requiere un análisis de agrupamiento en el conjunto de datos de entrenamiento para determinar los tamaños de ancla óptimos. YOLOX elimina esto, prediciendo las coordenadas de la caja delimitadora directamente en cada ubicación espacial. Aunque el enfoque sin anclas reduce el número de parámetros de diseño y el ajuste heurístico, el enfoque refinado basado en anclas de YOLOv5, ayudado por su funcionalidad de auto-anclaje, garantiza una convergencia de entrenamiento increíblemente estable y predecible desde el primer momento.

Cabeza desacoplada frente a cabeza acoplada#

YOLOX emplea una cabeza desacoplada, lo que significa que las tareas de clasificación y regresión se separan en ramas distintas de la red neuronal. Los autores argumentaron que esto resuelve conflictos entre el aprendizaje de características espaciales y semánticas. Por el contrario, YOLOv5 utilizó una cabeza acoplada altamente optimizada (en sus versiones anteriores) que maximizaba la eficiencia computacional y reducía la latencia de inferencia, lo cual es crucial para la computación en el borde en tiempo real.

Evolución arquitectónica

Aunque YOLOX abogó por la cabeza desacoplada en 2021, Ultralytics adoptó y perfeccionó posteriormente arquitecturas desacopladas en modelos posteriores como YOLOv8 y el vanguardista YOLO26, combinando lo mejor de ambos mundos.

Estrategia de asignación de etiquetas#

YOLOX utiliza SimOTA para la asignación de etiquetas, lo que formula el emparejamiento de objetos de la verdad fundamental con las predicciones como un problema de transporte óptimo. Esta asignación dinámica mejora el manejo de escenas concurridas. YOLOv5 emplea una asignación robusta basada en reglas de forma, garantizando que muestras positivas de alta calidad se alimenten constantemente a la función de pérdida, lo que contribuye a su legendaria estabilidad de entrenamiento.

Rendimiento y benchmarks#

El compromiso entre velocidad y precisión es la prueba definitiva para estas arquitecturas. La tabla a continuación ilustra el rendimiento de varios tamaños de modelo en puntos de referencia estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Aunque YOLOX logra puntuaciones mAP competitivas, especialmente en sus variantes más grandes, YOLOv5 mantiene una ventaja notable en la velocidad de inferencia de TensorRT en todos los ámbitos. El modelo YOLOv5s, por ejemplo, proporciona relaciones velocidad-precisión excepcionales, lo que lo hace altamente deseable para aplicaciones en tiempo real donde cada milisegundo cuenta.

La ventaja de Ultralytics: Entrenamiento y usabilidad#

Al realizar la transición de la investigación a la producción, el ecosistema que rodea a un modelo suele ser tan importante como el modelo mismo. Aquí, las ventajas del ecosistema de Ultralytics se vuelven claramente evidentes.

Experiencia de usuario optimizada#

YOLOv5 es universalmente elogiado por su experiencia de desarrollo "de cero a héroe". La API de Python de Ultralytics y la CLI te permiten cargar, entrenar y desplegar modelos con unas pocas líneas de código. En contraste, ejecutar YOLOX desde el repositorio de GitHub de Megvii requiere una configuración más manual de las variables de entorno, configuraciones complejas de rutas de Python y una curva de aprendizaje más pronunciada, típica de los códigos de investigación académica.

Eficiencia de entrenamiento y requisitos de memoria#

Los modelos de Ultralytics están meticulosamente diseñados para minimizar el uso de memoria durante el entrenamiento. YOLOv5 requiere mucha menos memoria CUDA en comparación con los modelos de transformadores fuertemente parametrizados como RT-DETR o modelos de investigación no optimizados. Esto permite a los desarrolladores entrenar tamaños de lote más grandes en hardware de consumo, acelerando el ciclo de desarrollo iterativo.

Versatilidad en todas las tareas#

Aunque YOLOX es estrictamente un framework de detección de objetos, el ecosistema de Ultralytics ha evolucionado YOLOv5 para admitir múltiples tareas de visión. De serie, puedes realizar Clasificación de Imágenes, Segmentación de Instancias y detección de objetos utilizando exactamente la misma sintaxis de la API.

Innovación continua

Si necesitas tareas aún más avanzadas como Estimación de Pose o detección de Caja Delimitadora Orientada (OBB), te recomendamos encarecidamente actualizar a la última arquitectura Ultralytics YOLO26, que admite todas ellas de forma nativa con una precisión de vanguardia.

Comparación de código#

La diferencia en usabilidad se demuestra mejor mediante código.

Entrenamiento con YOLOv5:

from ultralytics import YOLO

# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display results
results[0].show()

Entrenamiento con YOLOX: (Requiere clonación manual del repositorio, instalación con setup.py y argumentos de CLI complejos)

# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -o

El enfoque de Ultralytics elimina los obstáculos, permitiéndote centrarte en tu conjunto de datos y en la lógica de tu aplicación en lugar de depurar archivos de configuración. Además, realizar un seguimiento de tus experimentos resulta fluido gracias a las integraciones integradas para Weights & Biases y Comet ML.

Casos de uso ideales y aplicaciones en el mundo real#

Elegir entre estos modelos depende del entorno operativo de tu proyecto.

Donde YOLOX destaca#

YOLOX sigue siendo un fuerte candidato en entornos académicos donde los investigadores estudian explícitamente paradigmas sin anclas o estrategias de asignación de etiquetas. También es útil en escenarios donde la detección en escenas concurridas es la métrica principal absoluta y las velocidades de despliegue en el borde son secundarias.

Donde destaca YOLOv5#

YOLOv5 es el campeón indiscutible del despliegue práctico.

  • Fabricación de alta velocidad: Para la detección de defectos en líneas de montaje, la mínima latencia de inferencia de YOLOv5 en GPUs edge garantiza que los productos se inspeccionen sin ralentizar la cinta.
  • Drones e imágenes aéreas: Su eficiente huella de memoria le permite ejecutarse en ordenadores auxiliares ligeros a bordo de drones para tareas como el seguimiento de la agricultura y la fauna salvaje.
  • Comercio minorista inteligente: Desde el pago automatizado hasta la gestión de inventario, YOLOv5 se exporta fácilmente a TensorRT y ONNX para un despliegue masivo en miles de cámaras de tiendas.

Mirando hacia el futuro: La ventaja de YOLO26#

Aunque YOLOv5 es un modelo legendario, el campo de la IA avanza rápidamente. Si estás comenzando un nuevo proyecto hoy, te aconsejamos encarecidamente que mires la última generación de modelos de Ultralytics.

Lanzado en 2026, Ultralytics YOLO26 representa un gran salto adelante. Presenta un diseño de extremo a extremo sin NMS, eliminando por completo la necesidad de postprocesamiento de supresión de no máximos (Non-Maximum Suppression), lo que simplifica drásticamente la lógica de despliegue. Al eliminar la pérdida focal de distribución (DFL) y utilizar el optimizador de vanguardia MuSGD Optimizer, YOLO26 logra una inferencia en CPU hasta un 43% más rápida que las generaciones anteriores, manteniendo al mismo tiempo una mayor precisión, especialmente en objetos pequeños gracias a las nuevas funciones de pérdida ProgLoss + STAL.

Ya sea que elijas la probada fiabilidad de YOLOv5 o el rendimiento puntero de YOLO26, la Plataforma Ultralytics te garantiza disponer de las mejores herramientas para llevar tus soluciones de visión por computadora desde el concepto hasta la producción de manera fluida. Asegúrate de explorar la completa documentación de Ultralytics para desbloquear todo el potencial de tu pipeline de IA.

Colaboradores

Comentarios