Ultralytics YOLO27:

YOLOX frente a YOLO11#

La evolución de la visión por computador ha estado impulsada en gran medida por la búsqueda de frameworks de detección de objetos en tiempo real que equilibren una alta precisión con la velocidad de inferencia. Entre los hitos más destacados de este recorrido se encuentran YOLOX y Ultralytics YOLO11. Aunque ambos modelos han contribuido significativamente al campo, sus arquitecturas subyacentes, filosofías de diseño y ecosistemas para desarrolladores difieren sustancialmente.

Esta comparación técnica exhaustiva analiza sus arquitecturas, métricas de rendimiento, metodologías de entrenamiento y escenarios de implementación ideales para ayudarte a tomar una decisión informada para tu próximo proyecto de inteligencia artificial.

Descripción general de YOLOX#

Presentado por los investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun, de Megvii, el 18 de julio de 2021, YOLOX supuso un cambio significativo en la serie YOLO. Consiguió tender un puente entre la investigación académica y la aplicación industrial al introducir un diseño sin anchors.

Para obtener más información técnica, puedes consultar el artículo original de YOLOX en Arxiv.

Características arquitectónicas principales#

YOLOX se apartó de la detección tradicional basada en anchors al adoptar una head desacoplada y un mecanismo sin anchors. Este diseño redujo el número de parámetros de diseño y mejoró el rendimiento del modelo en diversos benchmarks. Además, introdujo estrategias avanzadas de asignación de etiquetas, como SimOTA, para acelerar el proceso de entrenamiento y mejorar la convergencia.

Aunque YOLOX ofrece una precisión excelente para su época, se centra principalmente en la detección de objetos mediante cajas delimitadoras y no ofrece compatibilidad nativa con otras tareas complejas de visión listas para usar.

Aprende más sobre YOLOX

Diseño sin anchors

Al eliminar las cajas anchor predefinidas, YOLOX redujo drásticamente el ajuste heurístico necesario para distintos conjuntos de datos, lo que lo convirtió en una sólida referencia para la investigación sobre metodologías sin anchors.

Descripción general de Ultralytics YOLO11#

Lanzado el 27 de septiembre de 2024 por Glenn Jocher y Jing Qiu, de Ultralytics, YOLO11 es un modelo de vanguardia que redefine la versatilidad y la facilidad de uso en visión por computador. Basado en años de investigación fundamental, ofrece una solución muy refinada y lista para producción que destaca en una multitud de tareas.

La ventaja de Ultralytics#

YOLO11 no es solo un detector de objetos; es un framework unificado compatible con la segmentación de instancias, la clasificación de imágenes, la estimación de poses y la detección de cajas delimitadoras orientadas (OBB). Cuenta con una arquitectura muy eficiente que prioriza un equilibrio fluido entre velocidad, número de parámetros y precisión.

Además, YOLO11 está totalmente integrado en la Ultralytics Platform, que proporciona un ecosistema optimizado para la anotación de datos, el entrenamiento de modelos y la implementación.

Comparación de rendimiento y métricas#

Al comparar estos modelos, el equilibrio de rendimiento queda claro. YOLO11 alcanza una mayor precisión media promedio (mAP), con muchos menos parámetros y FLOPs en la mayoría de las categorías de tamaño que sus equivalentes de YOLOX.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

Como se ha demostrado, los modelos YOLO11 superan sistemáticamente a YOLOX en precisión, manteniendo al mismo tiempo una huella de parámetros menor. Por ejemplo, YOLO11m alcanza un 51.5 mAP con solo 20.1M parámetros, mientras que YOLOXx logra un 51.1 mAP similar, pero necesita la enorme cantidad de 99.1M parámetros. Esta eficiencia de memoria durante el entrenamiento y la inferencia hace que YOLO11 sea especialmente adecuado para implementarse en dispositivos periféricos de IA, evitando los elevados requisitos de memoria CUDA habituales en modelos antiguos o basados en Transformer, como RT-DETR.

Entrenamiento eficiente

Los modelos de Ultralytics requieren mucha menos memoria GPU durante el entrenamiento que YOLOX y las arquitecturas basadas en Transformer, lo que permite a los investigadores entrenar modelos potentes con hardware de consumo estándar.

Ecosistema y facilidad de uso#

Una de las diferencias más destacadas entre ambos frameworks es la experiencia del desarrollador.

YOLOX suele requerir clonar repositorios, configurar entornos complejos y ejecutar argumentos de línea de comandos extensos para entrenar y exportar modelos a formatos como ONNX o TensorRT.

En cambio, Ultralytics YOLO11 ofrece una API de Python y una CLI increíblemente sencillas. La biblioteca de Ultralytics gestiona automáticamente el aumento de datos, el ajuste de hiperparámetros y la exportación.

from ultralytics import YOLO

# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")

# Train the model effortlessly on custom data
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained model to TensorRT for optimized deployment
model.export(format="engine")

Este ecosistema bien mantenido cuenta con una documentación exhaustiva y una integración fluida con herramientas como Weights & Biases para el seguimiento de experimentos.

Casos de uso ideales#

La elección entre estos modelos suele depender de las características específicas del entorno de implementación.

Cuándo usar YOLOX#

  • Sistemas heredados: Si tienes un pipeline consolidado creado específicamente en torno al framework MegEngine o a los paradigmas de detección de objetos de principios de 2021.
  • Referencias académicas: Cuando realices investigaciones que requieran comparar directamente con arquitecturas fundacionales sin anchors de la época de 2021.

Cuándo usar YOLO11#

  • Implementaciones en producción: Para aplicaciones comerciales de comercio minorista inteligente o sistemas de alarma de seguridad, donde un código sólido y mantenido, además de una alta precisión, son requisitos innegociables.
  • Pipelines multitarea: Cuando un proyecto requiera realizar el seguimiento de objetos, estimar poses humanas y segmentar instancias mediante un único framework unificado.
  • Dispositivos periféricos con recursos limitados: Gracias a su bajo número de parámetros y su alto rendimiento, YOLO11 es ideal para implementarse en Raspberry Pi o en nodos periféricos móviles mediante CoreML y NCNN.

De cara al futuro: la ventaja de YOLO26#

Aunque YOLO11 representa un enorme salto adelante con respecto a YOLOX, el campo de la visión por computador avanza rápidamente. Para los desarrolladores que comiencen nuevos proyectos hoy, Ultralytics YOLO26 es la recomendación definitiva.

Lanzado en enero de 2026, YOLO26 aprovecha la brillantez arquitectónica de YOLO11 e introduce varias características revolucionarias:

  • Diseño de extremo a extremo sin NMS: YOLO26 elimina el postprocesamiento de supresión no máxima (NMS) para lograr flujos de trabajo de despliegue más rápidos y sencillos (un concepto explorado por primera vez en YOLOv10).
  • Hasta un 43 % más rápido en inferencia en CPU: Al eliminar la pérdida focal de distribución (DFL), YOLO26 es mucho más eficiente en CPU y en dispositivos periféricos de bajo consumo.
  • Optimizador MuSGD: Inspirado en las innovaciones de entrenamiento de LLM de Moonshot AI, el optimizador MuSGD garantiza ejecuciones de entrenamiento muy estables y una convergencia rápida.
  • Funciones de pérdida avanzadas: Mediante ProgLoss + STAL, YOLO26 logra mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para las imágenes tomadas por drones y la robótica autónoma.

Para la gran mayoría de las tareas modernas de visión por computador, actualizar tu pipeline para aprovechar YOLO26 te proporcionará el mejor equilibrio posible entre velocidad, precisión y sencillez de implementación.

Comentarios