Ultralytics YOLO27:

YOLOX frente a YOLOv7#

La evolución de la detección de objetos en tiempo real se ha visto impulsada por avances arquitectónicos continuos. Dos hitos importantes de este recorrido son YOLOX y YOLOv7. Publicados con un año de diferencia, ambos modelos introdujeron enfoques innovadores en el paradigma estándar de detección de objetos, mejorando significativamente el equilibrio entre velocidad y precisión.

Esta página ofrece un análisis técnico exhaustivo de YOLOX y YOLOv7, comparando sus arquitecturas, métricas de rendimiento y casos de uso ideales para ayudar a los desarrolladores a elegir la herramienta adecuada para sus implementaciones de visión por ordenador.

YOLOX: pionero en la detección sin anclajes#

Presentado por investigadores de Megvii en julio de 2021, YOLOX supuso un cambio importante al alejarse de los diseños tradicionales basados en anclajes. Al reducir la distancia entre la investigación académica y la aplicación industrial, YOLOX simplificó la cabeza de detección y mejoró el rendimiento general.

Detalles clave del modelo:

Innovaciones arquitectónicas#

YOLOX introdujo un enfoque sin anclajes, que redujo drásticamente el número de parámetros de diseño y de ajustes heurísticos necesarios para conjuntos de datos personalizados. Implementó una cabeza desacoplada que separa las tareas de clasificación y regresión, lo que mejoró la velocidad de convergencia y la precisión. Además, YOLOX utilizó estrategias avanzadas de aumento de datos, como MixUp y Mosaic, para mejorar la robustez del modelo.

Más información sobre YOLOX

Ventaja de no usar anclajes

Al eliminar las cajas de anclaje, YOLOX reduce la sobrecarga computacional de calcular la intersección sobre la unión (IoU) entre las predicciones y las verdades de referencia durante el entrenamiento, lo que se traduce en unos requisitos menores de memoria CUDA y tiempos de entrenamiento más rápidos.

YOLOv7: conjunto de ventajas entrenables#

Publicado en julio de 2022 por investigadores del Institute of Information Science de la Academia Sinica de Taiwán, YOLOv7 amplió aún más los límites de la detección de objetos en tiempo real. Introdujo el concepto de una «bolsa de trucos entrenable» y estableció nuevas referencias del estado del arte en el conjunto de datos MS COCO tras su lanzamiento.

Detalles clave del modelo:

Innovaciones arquitectónicas#

La arquitectura de YOLOv7 se basa en la red de agregación de capas eficientes ampliada (E-ELAN), que permite al modelo aprender continuamente características más diversas sin degradar la ruta del gradiente. Además, YOLOv7 utilizó técnicas de reparametrización del modelo, lo que permitió simplificar las complejas redes de entrenamiento de múltiples ramas en redes más rápidas de una sola ruta durante la inferencia.

Más información sobre YOLOv7

Comparación de rendimiento#

Al evaluar estos modelos para aplicaciones reales, es fundamental comprender su rendimiento a distintas escalas. La tabla siguiente compara las métricas estándar de varios tamaños de YOLOX y YOLOv7.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Análisis#

  • Precisión: YOLOv7 suele lograr un mAP superior al de los modelos YOLOX equivalentes. Por ejemplo, YOLOv7x alcanza 53.1 mAP, frente a los 51.1 de YOLOXx.
  • Velocidad: Aunque ambos modelos están muy optimizados para ejecutarse en GPU mediante TensorRT, la arquitectura E-ELAN de YOLOv7 proporciona un rendimiento ligeramente superior en aplicaciones de gama alta, mientras que YOLOX mantiene una latencia excelente en dispositivos edge más pequeños.
  • Versatilidad: YOLOv7 amplió sus capacidades más allá de las cajas delimitadoras al proporcionar de forma nativa pesos para la segmentación de instancias y la estimación de poses, lo que lo hace más versátil que el repositorio base de YOLOX.

Aplicaciones en el mundo real#

La elección entre estos modelos suele depender de tu entorno de implementación específico.

Computación perimetral e IoT#

Para dispositivos edge con recursos limitados, como Raspberry Pi, o para procesadores móviles antiguos, YOLOX-Nano y YOLOX-Tiny son opciones muy atractivas. Su reducido número de parámetros y su naturaleza sin anclajes facilitan su implementación en entornos de bajo consumo para tareas como el seguimiento básico del movimiento o las aplicaciones de videoporteros inteligentes.

Análisis de vídeo de alta fidelidad#

Para procesar flujos de alta resolución en la detección de defectos industriales o la supervisión de tráfico denso, YOLOv7 es superior. Su sólida agregación de características le permite mantener una precisión elevada incluso cuando los objetos están parcialmente ocluidos o varían mucho de escala.

Casos de uso y recomendaciones#

La elección entre YOLOX y YOLOv7 depende de los requisitos específicos de tu proyecto, las limitaciones de la implementación y tus preferencias dentro del ecosistema.

Cuándo elegir YOLOX#

YOLOX es una buena opción para:

  • Investigación sobre detección sin anchors: Investigación académica que utiliza la arquitectura limpia y sin anchors de YOLOX como línea base para experimentar con nuevas cabezas de detección o funciones de pérdida.
  • Dispositivos edge ultraligeros: Implementaciones en microcontroladores o hardware móvil antiguo donde sea fundamental el tamaño extremadamente reducido de la variante YOLOX-Nano (0.91M de parámetros).
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir YOLOv7#

YOLOv7 se recomienda para:

  • Evaluación comparativa académica: reproducir resultados del estado del arte de la época de 2022 o estudiar los efectos de E-ELAN y de las técnicas de conjunto entrenable de técnicas gratuitas.
  • Investigación sobre reparametrización: investigar convoluciones reparametrizadas planificadas y estrategias de escalado compuesto de modelos.
  • Pipelines personalizados existentes: proyectos con pipelines muy personalizados construidos en torno a la arquitectura específica de YOLOv7 que no se pueden refactorizar fácilmente.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La ventaja de Ultralytics#

Aunque YOLOX y YOLOv7 son implementaciones de investigación potentes, pasar de un repositorio de investigación a un entorno de producción escalable puede resultar abrumador. Aquí es donde destaca la Plataforma de Ultralytics.

Los modelos de Ultralytics proporcionan una API de Python unificada que trata el entrenamiento, la validación y la implementación del modelo como tareas simplificadas y estandarizadas. Evitas el quebradero de cabeza de gestionar dependencias complejas de terceros u operadores personalizados de C++, habituales en arquitecturas antiguas.

Además, los modelos YOLO de Ultralytics requieren mucha menos memoria CUDA durante el entrenamiento que los detectores basados en Transformer, como RT-DETR. Esto permite utilizar tamaños de lote mayores, estabilizar el entrenamiento y acelerar la convergencia en conjuntos de datos personalizados.

Integraciones compatibles

Ultralytics admite de forma nativa la exportación de modelos a formatos estándar del sector, como ONNX, OpenVINO y CoreML, mediante un sencillo indicador booleano, lo que simplifica enormemente el proceso de implementación del modelo.

Ejemplo de código: entrenamiento con Ultralytics#

El ecosistema de Ultralytics permite cargar, entrenar y ejecutar inferencias fácilmente con YOLOv7 o arquitecturas más recientes usando solo unas pocas líneas de código.

from ultralytics import YOLO

# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on a custom dataset (e.g., COCO8)
# The API handles data loading, augmentation, and memory management automatically
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on a test image
predictions = model("path/to/image.jpg")
predictions[0].show()

El futuro: Ultralytics YOLO26#

Aunque YOLOv7 y YOLOX representan pasos históricos importantes, el estado del arte avanza rápidamente. Publicado en enero de 2026, YOLO26 de Ultralytics introduce paradigmas innovadores que superan a los modelos anteriores.

  • Diseño integral sin NMS: YOLO26 elimina de forma nativa el posprocesamiento de supresión no máxima (NMS). Esto reduce drásticamente los cuellos de botella de latencia y garantiza tiempos de ejecución deterministas en distintas configuraciones de hardware.
  • Inferencia en CPU hasta un 43 % más rápida: Al eliminar la pérdida focal de distribución (DFL) y optimizar la profundidad de la red, YOLO26 está especialmente adaptado para dispositivos edge sin hardware GPU dedicado.
  • Optimizador MuSGD: Inspirado en técnicas avanzadas de entrenamiento de LLM, el optimizador MuSGD (un híbrido de SGD y Muon) ofrece una estabilidad de entrenamiento excepcional y una convergencia más rápida.
  • Detección mejorada de objetos pequeños: La integración de las funciones de pérdida ProgLoss + STAL proporciona mejoras significativas en el reconocimiento de objetos pequeños y lejanos, algo fundamental para la cartografía con drones y la videovigilancia.
  • Compatibilidad nativa con tareas: YOLO26 admite de forma integral las cajas delimitadoras orientadas (OBB), la segmentación de instancias y la estimación de poses de forma nativa dentro de la misma API simplificada.

Para cualquier desarrollador moderno que inicie hoy un nuevo proyecto de visión por ordenador, evaluar Ultralytics YOLO26 en la Plataforma es el camino recomendado para lograr el mejor equilibrio posible entre velocidad, precisión y simplicidad de implementación. Si actualizas desde generaciones anteriores, como YOLO11 o YOLOv8, solo tienes que cambiar la cadena del modelo para desbloquear al instante capacidades superiores.

Colaboradores

Comentarios