Ultralytics YOLO27:
Get Started

YOLOX frente a YOLO11#

La evolución de la visión artificial ha estado impulsada en gran medida por la búsqueda de frameworks de detección de objetos en tiempo real que equilibren una alta precisión con la velocidad de inferencia. Entre los hitos más destacados de esta evolución se encuentran YOLOX y Ultralytics YOLO11. Aunque ambos modelos han contribuido significativamente al campo, sus arquitecturas, filosofías de diseño y ecosistemas para desarrolladores presentan diferencias sustanciales.

Esta comparativa técnica exhaustiva analiza sus arquitecturas, métricas de rendimiento, metodologías de entrenamiento y escenarios de implementación ideales para ayudarte a tomar una decisión fundamentada para tu próximo proyecto de inteligencia artificial.

Descripción general de YOLOX#

Presentado por los investigadores Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun, de Megvii, el 18 de julio de 2021, YOLOX supuso un cambio importante en la serie YOLO. Logró tender un puente entre la investigación académica y las aplicaciones industriales al introducir un diseño sin anclajes.

Para obtener más información técnica, puedes consultar el artículo original de YOLOX en arXiv.

Características arquitectónicas principales#

YOLOX se apartó de la detección tradicional basada en anclajes al adoptar una cabeza desacoplada y un mecanismo sin anclajes. Este diseño redujo el número de parámetros de diseño y mejoró el rendimiento del modelo en diversos benchmarks. Además, introdujo estrategias avanzadas de asignación de etiquetas, como SimOTA, para acelerar el proceso de entrenamiento y mejorar la convergencia.

Aunque YOLOX ofrece una precisión excelente para su época, se centra principalmente en la detección de objetos mediante cajas delimitadoras y no incluye compatibilidad nativa con otras tareas complejas de visión.

Descubre más sobre YOLOX

Diseño sin anclajes

Al eliminar las cajas de anclaje predefinidas, YOLOX redujo drásticamente el ajuste heurístico necesario para distintos conjuntos de datos, lo que lo convirtió en una sólida referencia para investigar metodologías sin anclajes.

Descripción general de Ultralytics YOLO11#

Lanzado el 27 de septiembre de 2024 por Glenn Jocher y Jing Qiu, de Ultralytics, YOLO11 es un modelo de vanguardia que redefine la versatilidad y la facilidad de uso en visión artificial. Basado en años de investigación fundamental, ofrece una solución muy perfeccionada y lista para producción que destaca en numerosas tareas.

La ventaja de Ultralytics#

YOLO11 no es solo un detector de objetos: es un framework unificado compatible con la segmentación de instancias, la clasificación de imágenes, la estimación de poses y la detección mediante cajas delimitadoras orientadas (OBB). Cuenta con una arquitectura muy eficiente que prioriza un equilibrio fluido entre velocidad, número de parámetros y precisión.

Además, YOLO11 está totalmente integrado en la plataforma Ultralytics, que ofrece un ecosistema optimizado para el etiquetado de datos, el entrenamiento de modelos y su implementación.

Comparativa de rendimiento y métricas#

Al comparar estos modelos, queda claro cuál ofrece un mejor equilibrio de rendimiento. YOLO11 alcanza una precisión media promedio (mAP) superior con muchos menos parámetros y FLOPs en la mayoría de las categorías de tamaño que sus equivalentes YOLOX.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

Como se muestra, los modelos YOLO11 superan sistemáticamente a YOLOX en precisión y, al mismo tiempo, requieren menos parámetros. Por ejemplo, YOLO11m alcanza un 51.5 mAP con solo 20.1M de parámetros, mientras que YOLOXx consigue un 51.1 mAP similar, pero requiere la enorme cifra de 99.1M de parámetros. Esta eficiencia de memoria durante el entrenamiento y la inferencia hace que YOLO11 sea muy adecuado para implementarlo en dispositivos de IA edge, sin los elevados requisitos de memoria CUDA habituales en modelos antiguos o basados en Transformer, como RT-DETR.

Entrenamiento eficiente

Durante el entrenamiento, los modelos Ultralytics requieren mucha menos memoria GPU que YOLOX y las arquitecturas basadas en Transformer, lo que permite a los investigadores entrenar modelos potentes en hardware de consumo estándar.

Ecosistema y facilidad de uso#

Una de las diferencias más notables entre ambos frameworks es la experiencia de desarrollo.

YOLOX suele requerir clonar repositorios, configurar entornos complejos y ejecutar comandos largos en la línea de comandos para entrenar y exportar modelos a formatos como ONNX o TensorRT.

En cambio, Ultralytics YOLO11 ofrece una API de Python y una CLI increíblemente sencillas. La biblioteca Ultralytics gestiona automáticamente la ampliación de datos, el ajuste de hiperparámetros y la exportación.

from ultralytics import YOLO

# Carga un modelo YOLO11 preentrenado
model = YOLO("yolo11n.pt")

# Entrena el modelo fácilmente con datos personalizados
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporta el modelo entrenado a TensorRT para optimizar su implementación
model.export(format="engine")

Este ecosistema, con un mantenimiento sólido, cuenta con una amplia documentación y se integra perfectamente con herramientas como Weights & Biases para el seguimiento de experimentos.

Casos de uso ideales#

La elección entre estos modelos suele depender de las características del entorno de implementación.

Cuándo usar YOLOX#

  • Sistemas heredados: Si tienes un flujo de trabajo establecido y basado explícitamente en el código original de YOLOX o en los paradigmas de detección de objetos de principios de 2021.
  • Referencias académicas: Para realizar investigaciones que requieran una evaluación comparativa directa con arquitecturas sin anclajes fundamentales de la época de 2021.

Cuándo usar YOLO11#

  • Implementaciones en producción: Para aplicaciones comerciales de comercio minorista inteligente o sistemas de alarma de seguridad, donde el código robusto y mantenido y la alta precisión son imprescindibles.
  • Flujos de trabajo multitarea: Cuando un proyecto requiere hacer seguimiento de objetos, estimar poses humanas y segmentar instancias usando un único framework unificado.
  • Dispositivos edge con recursos limitados: Gracias a su bajo número de parámetros y su alto rendimiento, YOLO11 es ideal para implementarlo en Raspberry Pi o nodos edge móviles mediante CoreML y NCNN.

Perspectivas de futuro: las ventajas de YOLO26#

Aunque YOLO11 supone un gran avance respecto a YOLOX, el campo de la visión por ordenador avanza rápidamente. Para los desarrolladores que empiezan hoy nuevos proyectos, Ultralytics YOLO26 es la recomendación definitiva.

Lanzado en enero de 2026, YOLO26 toma la brillante arquitectura de YOLO11 e introduce varias características revolucionarias:

  • Diseño integral sin NMS: la cabeza opcional uno a uno de YOLO26 (nms=False) elimina el posprocesamiento de supresión no máxima (NMS) para crear flujos de despliegue más rápidos y sencillos (un concepto explorado por primera vez en YOLOv10).
  • Hasta un 43 % más rápido en inferencia en CPU: al eliminar Distribution Focal Loss (DFL), YOLO26 es mucho más eficiente en CPU y dispositivos periféricos de bajo consumo.
  • Optimizador MuSGD: inspirado en las innovaciones de Moonshot AI para el entrenamiento de LLM, el optimizador MuSGD garantiza entrenamientos muy estables y una convergencia rápida.
  • Funciones de pérdida avanzadas: gracias a ProgLoss + STAL, YOLO26 mejora notablemente el reconocimiento de objetos pequeños, algo fundamental para las imágenes tomadas con drones y la robótica autónoma.

Para la gran mayoría de las tareas modernas de visión por ordenador, actualizar tu flujo de trabajo para aprovechar YOLO26 te proporcionará el mejor equilibrio posible entre velocidad, precisión y sencillez de despliegue.

Comentarios