YOLOv5 frente a YOLOX#
La evolución de la visión artificial en tiempo real ha alcanzado numerosos hitos, con distintas arquitecturas que amplían los límites de la velocidad y la precisión. Dos modelos muy influyentes en este ámbito son YOLOv5 y YOLOX. Aunque ambos son conocidos por su alto rendimiento en la detección de objetos, adoptan enfoques arquitectónicos fundamentalmente distintos.
Esta guía ofrece un análisis técnico exhaustivo de estos dos modelos y compara sus arquitecturas, métricas de rendimiento, metodologías de entrenamiento y escenarios de implementación ideales para ayudar a desarrolladores e investigadores a elegir la herramienta adecuada para sus proyectos de IA de visión.
Descripción general de los modelos y diferencias arquitectónicas#
Ultralytics YOLOv5#
- Autor: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: Repositorio de Ultralytics YOLOv5
- Documentación: Documentación oficial de YOLOv5
Presentado por Ultralytics, YOLOv5 se convirtió rápidamente en un estándar del sector gracias a su excepcional equilibrio entre rendimiento, facilidad de uso y eficiencia de memoria. Desarrollado de forma nativa sobre el framework PyTorch, YOLOv5 utiliza una arquitectura basada en anchors. Se basa en formas predefinidas de cajas delimitadoras para predecir la ubicación de los objetos, lo que lo hace muy eficaz para tareas estándar de detección de objetos.
Una de las mayores ventajas de YOLOv5 es su ecosistema bien mantenido. Cuenta con una documentación extensa, una API de Python increíblemente sencilla e integración nativa con Ultralytics Platform. Esto permite a los desarrolladores pasar sin problemas del etiquetado de datasets al entrenamiento y la exportación a formatos como ONNX y TensorRT.
Los modelos YOLO de Ultralytics normalmente requieren mucha menos memoria de GPU durante el entrenamiento que las alternativas complejas basadas en Transformer. Esta reducida huella de memoria hace que YOLOv5 sea muy accesible para investigadores que trabajan con hardware de consumo.
Megvii YOLOX#
- Autores: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun
- Organización: Megvii
- Fecha: 2021-07-18
- Arxiv: YOLOX: Superando a la serie YOLO en 2021
- GitHub: Repositorio de Megvii YOLOX
- Documentación: Documentación de YOLOX en GitHub
Desarrollado por investigadores de Megvii, YOLOX siguió un camino diferente al introducir un diseño sin anchors en la familia YOLO. Al eliminar las anchor boxes, YOLOX simplifica el head de detección y reduce significativamente el número de parámetros heurísticos que deben ajustarse manualmente durante el entrenamiento.
YOLOX también incorpora un head desacoplado —que separa las tareas de clasificación y regresión en distintas ramas de la red— y utiliza la estrategia de asignación de etiquetas SimOTA. Estas innovaciones reducen la distancia entre la investigación académica y las aplicaciones industriales, lo que hace que YOLOX sea especialmente eficaz en entornos con escalas de objetos muy variadas.
Rendimiento y métricas#
Al evaluar modelos de visión artificial, la relación entre la precisión media promedio (mAP) y la velocidad de inferencia es fundamental. Ambos modelos ofrecen una variedad de tamaños (de Nano a Extra-Large) para adaptarse a distintas limitaciones de hardware.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
Aunque YOLOXx alcanza una precisión máxima ligeramente superior (51.1 mAP), YOLOv5 proporciona una canalización de implementación mucho más sólida y probada exhaustivamente en hardware CPU y GPU. Las velocidades de TensorRT para YOLOv5 ponen de relieve su profunda optimización para dispositivos de computación en el edge, lo que lo convierte en una opción muy fiable para el análisis de vídeo en tiempo real.
Metodologías de entrenamiento y usabilidad#
La experiencia de desarrollo varía significativamente entre estas dos arquitecturas.
El enfoque de YOLOX#
El entrenamiento de YOLOX normalmente requiere clonar el repositorio original, gestionar dependencias específicas y ejecutar scripts complejos de línea de comandos. Aunque es compatible con funciones avanzadas como el entrenamiento con precisión mixta y las configuraciones multinodo mediante MegEngine, la curva de aprendizaje puede ser pronunciada para los desarrolladores que necesitan crear prototipos rápidamente.
La ventaja de Ultralytics#
En cambio, Ultralytics prioriza una experiencia de usuario excepcionalmente sencilla. Con el paquete de Python ultralytics, los desarrolladores pueden cargar, entrenar y validar un modelo con un código auxiliar mínimo. Ultralytics gestiona automáticamente las aumentaciones de datos complejas, la evolución de hiperparámetros y la programación de la tasa de aprendizaje.
from ultralytics import YOLO
# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model's performance
metrics = model.val()Además, la versatilidad de YOLOv5 va más allá de la detección de objetos estándar, ya que ofrece compatibilidad sólida con la clasificación de imágenes y la segmentación de instancias dentro de la misma API cohesiva.
Cuando hayas terminado el entrenamiento, exportar un modelo YOLOv5 a CoreML, TFLite u OpenVINO es tan sencillo como ejecutar model.export(format="onnx"). Esto elimina la necesidad de utilizar scripts de conversión de terceros que suelen requerir los repositorios orientados a la investigación.
Aplicaciones en el mundo real#
La elección entre estos modelos depende de tu entorno de implementación y de tus requisitos técnicos:
- Comercio minorista y gestión de inventario: Para aplicaciones que requieren reconocimiento de productos en tiempo real en dispositivos edge como NVIDIA Jetson, YOLOv5 es especialmente adecuado. Su reducida huella de memoria y sus rápidas velocidades de inferencia con TensorRT permiten realizar el seguimiento con varias cámaras sin perder fotogramas.
- Investigación académica y arquitecturas personalizadas: YOLOX goza de un gran reconocimiento en la comunidad investigadora. Su head desacoplado y su naturaleza sin anchors lo convierten en una excelente base para ingenieros que quieran experimentar con estrategias novedosas de asignación de etiquetas o que trabajen con datasets en los que las anchor boxes tradicionales no logran generalizar.
- IA agrícola: Para tareas de agricultura de precisión, como la detección de frutas o la identificación de malas hierbas mediante drones, la facilidad para entrenar e implementar modelos YOLOv5 usando Ultralytics Platform permite a los expertos del sector desarrollar soluciones de IA sin necesidad de contar con una formación avanzada en ingeniería de machine learning.
Casos de uso y recomendaciones#
La elección entre YOLOv5 y YOLOX depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias respecto al ecosistema.
Cuándo elegir YOLOv5#
YOLOv5 es una buena opción para:
- Sistemas de producción probados: Implementaciones existentes en las que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
- Entrenamiento con recursos limitados: Entornos con recursos de GPU limitados en los que resultan ventajosos el eficiente flujo de entrenamiento de YOLOv5 y sus menores requisitos de memoria.
- Amplia compatibilidad con formatos de exportación: Proyectos que requieren implementarse en muchos formatos, incluidos ONNX, TensorRT, CoreML y TFLite.
Cuándo elegir YOLOX#
YOLOX se recomienda para:
- Investigación sobre detección sin anchors: Investigación académica que utiliza la arquitectura limpia y sin anchors de YOLOX como línea base para experimentar con nuevas cabezas de detección o funciones de pérdida.
- Dispositivos edge ultraligeros: Implementaciones en microcontroladores o hardware móvil antiguo donde sea fundamental el tamaño extremadamente reducido de la variante YOLOX-Nano (0.91M de parámetros).
- Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
El futuro de la IA de visión: llega YOLO26#
Aunque YOLOv5 y YOLOX se han consolidado en la historia de la visión artificial, el sector avanza rápidamente. Para los desarrolladores que hoy comienzan nuevos proyectos, Ultralytics recomienda encarecidamente explorar su modelo insignia más reciente, YOLO26.
Lanzado en enero de 2026, YOLO26 representa un enorme salto adelante tanto en rendimiento como en usabilidad. Introduce un revolucionario diseño de extremo a extremo sin NMS, que elimina por completo el postprocesamiento de supresión de no máximos. Esto reduce significativamente la variabilidad de la latencia y simplifica la lógica de implementación en dispositivos de bajo consumo.
Además, YOLO26 utiliza el novedoso optimizador MuSGD —un híbrido de SGD y Muon inspirado en las innovaciones del entrenamiento de LLM— para lograr una convergencia increíblemente estable y rápida. Con la eliminación de DFL (se elimina Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos edge y de bajo consumo), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, consolidando su posición como el modelo definitivo para la computación edge moderna, la robótica y las aplicaciones de IoT. Además, ProgLoss + STAL proporciona funciones de pérdida mejoradas, con avances notables en el reconocimiento de objetos pequeños, algo fundamental para IoT, la robótica y las imágenes aéreas. Los usuarios interesados en generaciones anteriores también pueden consultar YOLO11, aunque YOLO26 es, sin discusión, la opción más avanzada del estado del arte.
Conclusión#
YOLOv5 y YOLOX ofrecen capacidades extraordinarias de detección de objetos. YOLOX amplió los límites arquitectónicos al demostrar en 2021 que los diseños sin anchors podían competir con los métodos tradicionales y superarlos. Sin embargo, YOLOv5 sigue siendo una fuerza dominante gracias a su facilidad de uso inigualable, su amplio ecosistema y sus menores requisitos de memoria durante el entrenamiento.
Para la gran mayoría de las aplicaciones comerciales, el ecosistema de Ultralytics ofrece la ruta más rápida desde un dataset sin procesar hasta un modelo de producción implementado. Tanto si utilizas el probado YOLOv5 como si actualizas al vanguardista YOLO26, los desarrolladores se benefician de un framework diseñado para hacer que la IA de visión sea accesible, eficiente y de alto rendimiento.