Ultralytics YOLO27:
Get Started

YOLOv5 frente a YOLOX#

La evolución de la visión artificial en tiempo real ha alcanzado numerosos hitos, con distintas arquitecturas que amplían los límites de la velocidad y la precisión. Dos modelos muy influyentes en este ámbito son YOLOv5 y YOLOX. Aunque ambos son conocidos por su alto rendimiento en la detección de objetos, adoptan enfoques arquitectónicos fundamentalmente distintos.

Esta guía ofrece un análisis técnico exhaustivo de estos dos modelos y compara sus arquitecturas, métricas de rendimiento, metodologías de entrenamiento y escenarios de despliegue ideales para ayudar a desarrolladores e investigadores a elegir la herramienta adecuada para sus proyectos de IA de visión.

Resumen de los modelos y diferencias arquitectónicas#

Ultralytics YOLOv5#

Presentado por Ultralytics, YOLOv5 se convirtió rápidamente en un estándar del sector gracias a su excepcional equilibrio entre rendimiento, facilidad de uso y eficiencia de memoria. Desarrollado de forma nativa sobre el framework PyTorch, YOLOv5 utiliza una arquitectura basada en anclajes. Se basa en formas predefinidas de cuadros delimitadores para predecir la ubicación de los objetos, lo que lo hace muy eficaz para tareas habituales de detección de objetos.

Uno de los puntos fuertes de YOLOv5 es su ecosistema bien mantenido. Cuenta con documentación exhaustiva, una API de Python muy sencilla e integración nativa con la Plataforma Ultralytics. Esto permite a los desarrolladores pasar fácilmente del etiquetado de conjuntos de datos al entrenamiento y la exportación a formatos como ONNX y TensorRT.

Ventaja del ecosistema

Los modelos Ultralytics YOLO suelen necesitar mucha menos memoria GPU durante el entrenamiento que las complejas alternativas basadas en Transformer. Esta baja huella de memoria hace que YOLOv5 sea muy accesible para los investigadores que trabajan con hardware de consumo.

YOLOX de Megvii#

Desarrollado por investigadores de Megvii, YOLOX siguió un camino diferente al introducir un diseño sin anclajes en la familia YOLO. Al eliminar los cuadros de anclaje, YOLOX simplifica la cabeza de detección y reduce considerablemente el número de parámetros heurísticos que deben ajustarse manualmente durante el entrenamiento.

YOLOX también incorpora una cabeza desacoplada —que separa las tareas de clasificación y regresión en distintas ramas de la red— y utiliza la estrategia de asignación de etiquetas SimOTA. Estas innovaciones tienden un puente entre la investigación académica y las aplicaciones industriales, lo que hace que YOLOX sea especialmente eficaz en entornos con objetos de escalas muy variadas.

Más información sobre YOLOX

Rendimiento y métricas#

Al evaluar modelos de visión artificial, es fundamental tener en cuenta el equilibrio entre la precisión media (mAP) y la velocidad de inferencia. Ambos modelos ofrecen distintos tamaños (de Nano a Extra-Large) para adaptarse a diferentes limitaciones de hardware.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Aunque YOLOXx alcanza una precisión máxima ligeramente superior (51,1 mAP), YOLOv5 ofrece una canalización de despliegue mucho más robusta y probada exhaustivamente en CPU y GPU. Las velocidades de TensorRT de YOLOv5 ponen de manifiesto su profunda optimización para dispositivos de computación perimetral, lo que lo convierte en una opción muy fiable para el análisis de vídeo en tiempo real.

Metodologías de entrenamiento y facilidad de uso#

La experiencia de desarrollo varía considerablemente entre estas dos arquitecturas.

El enfoque de YOLOX#

Para entrenar YOLOX, normalmente hay que clonar el repositorio original, gestionar dependencias específicas y ejecutar scripts complejos desde la línea de comandos. Aunque admite funciones avanzadas como el entrenamiento de precisión mixta y las configuraciones multinodo mediante MegEngine, la curva de aprendizaje puede ser pronunciada para los desarrolladores que necesitan crear prototipos rápidamente.

La ventaja de Ultralytics#

En cambio, Ultralytics prioriza una experiencia de usuario excepcionalmente sencilla. Con el paquete de Python ultralytics, los desarrolladores pueden cargar, entrenar y validar un modelo con un código mínimo. Ultralytics gestiona automáticamente las complejas ampliaciones de datos, la evolución de hiperparámetros y la programación de la tasa de aprendizaje.

from ultralytics import YOLO

# Carga un modelo YOLOv5 pequeño preentrenado
model = YOLO("yolov5su.pt")  # YOLOv5u: pesos de YOLOv5 sin anclajes para el paquete ultralytics

# Entrena el modelo con el conjunto de datos COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valida el rendimiento del modelo
metrics = model.val()

Además, la versatilidad de YOLOv5 va más allá de la detección de objetos estándar: ofrece compatibilidad sólida con la clasificación de imágenes y la segmentación de instancias en la misma API unificada.

Implementación simplificada

Cuando termines el entrenamiento, exportar un modelo YOLOv5 a ONNX, CoreML, LiteRT u OpenVINO es tan sencillo como ejecutar una única llamada, por ejemplo, model.export(format="onnx"). Así se evita tener que recurrir a los scripts de conversión de terceros que suelen necesitar los repositorios centrados en la investigación.

Aplicaciones en el mundo real#

La elección entre estos modelos depende de tu entorno de despliegue y de tus requisitos técnicos:

  • Comercio minorista y gestión de inventario: Para aplicaciones que requieren reconocer productos en tiempo real en dispositivos perimetrales como NVIDIA Jetson, YOLOv5 es especialmente adecuado. Su reducida huella de memoria y la rápida inferencia con TensorRT permiten realizar el seguimiento con varias cámaras sin perder fotogramas.
  • Investigación académica y arquitecturas personalizadas: YOLOX goza de gran prestigio en la comunidad investigadora. Su cabeza desacoplada y su diseño sin anclajes lo convierten en una excelente base para los ingenieros que quieran experimentar con nuevas estrategias de asignación de etiquetas o que trabajen con conjuntos de datos en los que los cuadros de anclaje tradicionales no se generalizan bien.
  • IA agrícola: Para tareas de agricultura de precisión, como detectar fruta o identificar malas hierbas mediante drones, la facilidad para entrenar e implementar modelos YOLOv5 con la Plataforma Ultralytics permite a los expertos del sector desarrollar soluciones de IA sin necesidad de tener conocimientos profundos de ingeniería de aprendizaje automático.

Casos de uso y recomendaciones#

La elección entre YOLOv5 y YOLOX depende de los requisitos concretos de tu proyecto, las limitaciones de despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOv5#

YOLOv5 es una buena opción para:

  • Sistemas de producción probados: despliegues existentes en los que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
  • Entrenamiento con recursos limitados: entornos con recursos de GPU limitados, donde el pipeline de entrenamiento eficiente de YOLOv5 y sus menores requisitos de memoria suponen una ventaja.
  • Amplia compatibilidad con formatos de exportación: proyectos que requieren despliegues en muchos formatos, como ONNX, TensorRT, CoreML y LiteRT.

Cuándo elegir YOLOX#

Se recomienda YOLOX para:

  • Investigación sobre detección sin anclajes: Investigación académica que utiliza la arquitectura limpia y sin anclajes de YOLOX como base para experimentar con nuevos cabezales de detección o funciones de pérdida.
  • Dispositivos de borde ultraligeros: Implementación en microcontroladores o hardware móvil heredado, donde el tamaño extremadamente reducido de la variante YOLOX-Nano (0,91 M de parámetros) es fundamental.
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

El futuro de la IA visual: llega YOLO26#

Aunque YOLOv5 y YOLOX ya ocupan un lugar destacado en la historia de la visión artificial, el campo avanza rápidamente. Para los desarrolladores que empiezan hoy nuevos proyectos, Ultralytics recomienda encarecidamente explorar su modelo insignia más reciente, YOLO26.

Lanzado en enero de 2026, YOLO26 supone un gran avance tanto en rendimiento como en facilidad de uso. Introduce un innovador diseño integral sin NMS (seleccionado con nms=False) que elimina el posprocesamiento de supresión no máxima. Esto reduce considerablemente la variabilidad de la latencia y simplifica la lógica de despliegue en dispositivos de baja potencia.

Además, YOLO26 utiliza el novedoso optimizador MuSGD —una combinación de SGD y Muon inspirada en las innovaciones del entrenamiento de LLM— para lograr una convergencia increíblemente estable y rápida. Gracias a la eliminación de DFL (se elimina Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos perimetrales y de baja potencia), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que consolida su posición como el modelo definitivo para la computación perimetral moderna, la robótica y las aplicaciones de IoT. Además, ProgLoss + STAL ofrece funciones de pérdida mejoradas que permiten reconocer objetos pequeños con mayor precisión, algo fundamental para IoT, robótica e imágenes aéreas. Quienes tengan interés en generaciones anteriores también pueden consultar YOLO11, aunque YOLO26 es, sin duda, la opción más avanzada.

Conclusión#

YOLOv5 y YOLOX ofrecen unas capacidades de detección de objetos extraordinarias. En 2021, YOLOX llevó la arquitectura un paso más allá al demostrar que los diseños sin anclajes podían competir con los métodos tradicionales e incluso superarlos. Sin embargo, YOLOv5 sigue siendo una fuerza dominante gracias a su incomparable facilidad de uso, su amplio ecosistema y sus menores requisitos de memoria durante el entrenamiento.

Para la gran mayoría de las aplicaciones comerciales, el ecosistema Ultralytics ofrece la vía más rápida para pasar de un conjunto de datos sin procesar a un modelo listo para producción. Tanto si usan el fiable YOLOv5 como si se pasan al vanguardista YOLO26, los desarrolladores se benefician de un framework diseñado para que la IA visual sea accesible, eficiente y de alto rendimiento.

Comentarios