Ultralytics YOLO27:
Get Started

YOLOX frente a YOLOv7#

La evolución de la detección de objetos en tiempo real se ha impulsado mediante continuos avances arquitectónicos. Dos hitos importantes de esta trayectoria son YOLOX y YOLOv7. Lanzados con menos de un año de diferencia, ambos modelos introdujeron nuevos enfoques del paradigma estándar de detección de objetos y mejoraron significativamente el equilibrio entre velocidad y precisión.

Esta página ofrece un análisis técnico exhaustivo de YOLOX y YOLOv7, en el que compara sus arquitecturas, métricas de rendimiento y casos de uso ideales para ayudar a los desarrolladores a elegir la herramienta adecuada para sus implementaciones de visión artificial.

YOLOX: pionero en la detección sin anclajes#

Presentado por investigadores de Megvii en julio de 2021, YOLOX supuso un gran cambio al alejarse de los diseños tradicionales basados en anclajes. Al tender un puente entre la investigación académica y las aplicaciones industriales, YOLOX simplificó la cabeza de detección y mejoró el rendimiento general.

Detalles principales del modelo:

Innovaciones arquitectónicas#

YOLOX introdujo un enfoque sin anclajes que redujo drásticamente el número de parámetros de diseño y los ajustes heurísticos necesarios para los conjuntos de datos personalizados. Implementó una cabeza desacoplada que separa las tareas de clasificación y regresión, lo que mejoró la velocidad de convergencia y la precisión. Además, YOLOX utilizó estrategias avanzadas de aumento de datos, como MixUp y Mosaic, para mejorar la robustez del modelo.

Descubre más sobre YOLOX

Ventajas de la detección sin anclajes

Al eliminar las cajas de anclaje, YOLOX reduce la sobrecarga computacional del cálculo de la intersección sobre la unión (IoU) entre las predicciones y los valores de referencia durante el entrenamiento, lo que reduce los requisitos de memoria CUDA y acelera el entrenamiento.

YOLOv7: conjunto de técnicas gratuitas entrenables#

Lanzado en julio de 2022 por investigadores del Instituto de Ciencias de la Información de la Academia Sinica de Taiwán, YOLOv7 amplió aún más los límites de la detección de objetos en tiempo real. Introdujo el concepto de «bolsa de trucos entrenable» y, tras su lanzamiento, estableció nuevos resultados de referencia de vanguardia en el conjunto de datos MS COCO.

Detalles principales del modelo:

Innovaciones arquitectónicas#

La arquitectura de YOLOv7 se basa en la red extendida de agregación eficiente de capas (E-ELAN), que permite que el modelo aprenda continuamente características más diversas sin degradar la ruta del gradiente. Además, YOLOv7 utilizó técnicas de reparametrización del modelo que permiten simplificar redes de entrenamiento complejas con varias ramas y convertirlas en redes más rápidas de una sola ruta durante la inferencia.

Más información sobre YOLOv7

Comparativa de rendimiento#

Al evaluar estos modelos para aplicaciones reales, es fundamental comprender su rendimiento en distintas escalas. La tabla siguiente compara las métricas estándar de los distintos tamaños de YOLOX y YOLOv7.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

Análisis#

  • Precisión: YOLOv7 suele alcanzar un mAP superior al de los modelos YOLOX equivalentes. Por ejemplo, YOLOv7x alcanza 53,1 mAP frente a los 51,1 de YOLOXx.
  • Velocidad: Aunque ambos modelos están muy optimizados para ejecutarse en GPU mediante TensorRT, la arquitectura E-ELAN de YOLOv7 ofrece un rendimiento ligeramente superior en aplicaciones de gama alta, aunque YOLOX mantiene una latencia excelente en dispositivos de borde más pequeños.
  • Versatilidad: YOLOv7 amplió sus capacidades más allá de las cajas delimitadoras al ofrecer de forma nativa pesos para la segmentación de instancias y la estimación de poses, lo que lo hace más versátil que el repositorio base de YOLOX.

Aplicaciones en el mundo real#

La elección entre estos modelos suele depender del entorno de implementación específico.

Computación perimetral e IoT#

Para dispositivos de borde con recursos limitados, como Raspberry Pi, o para procesadores móviles antiguos, YOLOX-Nano y YOLOX-Tiny son opciones muy atractivas. Su reducido número de parámetros y su diseño sin anclajes facilitan la implementación en entornos de bajo consumo para tareas como el seguimiento básico del movimiento o las aplicaciones de timbres inteligentes.

Analítica de vídeo de alta fidelidad#

Para procesar fuentes de alta resolución en la detección de defectos industriales o la monitorización de tráfico denso, YOLOv7 es superior. Su sólida agregación de características le permite mantener una precisión alta incluso cuando los objetos están parcialmente ocluidos o varían mucho de escala.

Casos de uso y recomendaciones#

Elegir entre YOLOX y YOLOv7 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias en cuanto al ecosistema.

Cuándo elegir YOLOX#

YOLOX es una buena opción para:

  • Investigación sobre detección sin anclajes: Investigación académica que utiliza la arquitectura limpia y sin anclajes de YOLOX como base para experimentar con nuevos cabezales de detección o funciones de pérdida.
  • Dispositivos de borde ultraligeros: Implementación en microcontroladores o hardware móvil heredado, donde el tamaño extremadamente reducido de la variante YOLOX-Nano (0,91 M de parámetros) es fundamental.
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir YOLOv7#

Se recomienda YOLOv7 para:

  • Evaluación comparativa académica: reproducir resultados de vanguardia de 2022 o estudiar los efectos de E-ELAN y las técnicas de conjunto de técnicas gratuitas entrenables.
  • Investigación sobre reparametrización: estudiar convoluciones reparametrizadas planificadas y estrategias de escalado compuesto de modelos.
  • Flujos personalizados existentes: proyectos con flujos muy personalizados basados en la arquitectura específica de YOLOv7 que no se puedan refactorizar fácilmente.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

La ventaja de Ultralytics#

Aunque YOLOX y YOLOv7 son implementaciones de investigación potentes, pasar de un repositorio de investigación a un entorno de producción escalable puede ser abrumador. Aquí es donde destaca la plataforma de Ultralytics.

Los modelos de Ultralytics ofrecen una API unificada de Python que convierte el entrenamiento, la validación y la implementación de modelos en tareas optimizadas y estandarizadas. Así evitas los quebraderos de cabeza de gestionar dependencias complejas de terceros u operadores personalizados de C++, habituales en las arquitecturas más antiguas.

Además, los modelos YOLO de Ultralytics necesitan mucha menos memoria CUDA durante el entrenamiento que los detectores basados en Transformer, como RT-DETR. Esto permite utilizar tamaños de lote mayores, estabilizar el entrenamiento y acelerar la convergencia en conjuntos de datos personalizados.

Integraciones compatibles

Ultralytics admite de forma nativa la exportación de modelos a formatos estándar del sector, como ONNX, OpenVINO y CoreML, con un único argumento format, lo que simplifica enormemente el proceso de implementación del modelo.

Ejemplo de código: entrenamiento con Ultralytics#

El paquete Python de Ultralytics no permite entrenar ni ejecutar de forma nativa puntos de control .pt de YOLOv7 (la documentación de YOLOv7 explica cómo ejecutar modelos exportados a ONNX o TensorRT), pero es posible cargar, entrenar y ejecutar arquitecturas más recientes, como YOLO26, con solo unas pocas líneas de código.

from ultralytics import YOLO

# Carga un modelo YOLO26 preentrenado
model = YOLO("yolo26n.pt")

# Entrena el modelo con un conjunto de datos personalizado (p. ej., COCO8)
# La API se encarga automáticamente de cargar los datos, aplicar aumentos y gestionar la memoria
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Ejecuta la inferencia en una imagen de prueba
predictions = model("path/to/image.jpg")
predictions[0].show()

El futuro: Ultralytics YOLO26#

Aunque YOLOv7 y YOLOX representan hitos históricos importantes, la tecnología de vanguardia avanza rápidamente. Lanzado en enero de 2026, Ultralytics YOLO26 introduce paradigmas revolucionarios que superan a los modelos anteriores.

  • Diseño integral sin NMS: la cabeza opcional uno a uno de YOLO26 (nms=False) omite el posprocesamiento de supresión no máxima (NMS). Esto reduce drásticamente los cuellos de botella de latencia y garantiza tiempos de ejecución deterministas en distintas configuraciones de hardware.
  • Inferencia en CPU hasta un 43 % más rápida: al eliminar la pérdida focal de distribución (DFL) y optimizar la profundidad de la red, YOLO26 está especialmente diseñado para dispositivos de borde sin hardware GPU dedicado.
  • Optimizador MuSGD: inspirado en técnicas avanzadas de entrenamiento de LLM, el optimizador MuSGD —un híbrido de SGD y Muon— ofrece una estabilidad de entrenamiento excepcional y una convergencia más rápida.
  • Mejora en la detección de objetos pequeños: la integración de las funciones de pérdida ProgLoss + STAL mejora significativamente el reconocimiento de objetos pequeños y lejanos, una capacidad fundamental para la cartografía con drones y la vigilancia de seguridad.
  • Compatibilidad nativa con tareas: YOLO26 admite de forma integral las cajas delimitadoras orientadas (OBB), la segmentación de instancias y la estimación de poses, todo de forma nativa en la misma API optimizada.

Para cualquier desarrollador que hoy empiece un nuevo proyecto de visión artificial, se recomienda evaluar Ultralytics YOLO26 en la plataforma para lograr el mejor equilibrio posible entre velocidad, precisión y facilidad de implementación. Si actualizas desde generaciones anteriores, como YOLO11 o YOLOv8, solo tienes que cambiar el nombre del modelo para desbloquear al instante capacidades superiores.

Colaboradores

Comentarios