Ultralytics YOLO27:
Get Started

YOLOX frente a YOLOv10#

La evolución de los modelos de visión por ordenador en tiempo real se ha caracterizado por importantes avances arquitectónicos. Dos hitos fundamentales de esta evolución son YOLOX y YOLOv10. Lanzado en 2021, YOLOX logró salvar la distancia entre la investigación académica y la aplicación industrial gracias a un diseño sin anclajes muy eficaz. Tres años después, YOLOv10 revolucionó el campo al eliminar la necesidad de aplicar supresión no máxima (NMS) durante el posprocesamiento, ampliando los límites de la eficiencia y la velocidad.

Esta comparativa técnica exhaustiva explora las arquitecturas, las métricas de rendimiento y los casos de uso ideales de ambos modelos, y ofrece información para ayudarte a elegir la herramienta adecuada para tu próximo proyecto de detección de objetos.

Orígenes y metadatos de los modelos#

Conocer el origen de estos modelos permite entender sus decisiones arquitectónicas y los entornos de despliegue previstos.

Detalles de YOLOX

Más información sobre YOLOX

Detalles de YOLOv10

Más información sobre YOLOv10

Innovaciones arquitectónicas#

Las principales diferencias entre YOLOX y YOLOv10 radican en cómo gestionan las predicciones de los cuadros delimitadores y el posprocesamiento.

YOLOX: pionero del diseño sin anclajes#

YOLOX causó sensación al llevar a la familia YOLO a una arquitectura sin anclajes. Al predecir el centro de un objeto en lugar de depender de cuadros de anclaje predefinidos, YOLOX redujo drásticamente el número de parámetros de diseño y los ajustes heurísticos necesarios para los conjuntos de datos personalizados. Además, introdujo una cabeza desacoplada que separaba las tareas de clasificación y regresión en vías distintas. Este enfoque resolvió el conflicto entre identificar qué es un objeto y determinar dónde está, lo que propició una mejora notable en la velocidad de convergencia y la precisión.

YOLOv10: la revolución sin NMS#

Aunque YOLOX simplificó la cabeza de detección, seguía dependiendo de NMS para filtrar las predicciones redundantes de cuadros delimitadores. YOLOv10 abordó este cuello de botella fundamental. Gracias a asignaciones duales coherentes durante el entrenamiento, YOLOv10 logra una detección integral nativa. Durante el entrenamiento, emplea una cabeza uno a muchos para garantizar señales de supervisión abundantes, mientras que en la inferencia utiliza una cabeza uno a uno para generar directamente las predicciones finales. Este diseño integral, que equilibra eficiencia y precisión, elimina por completo NMS y reduce considerablemente la latencia de inferencia en chips integrados.

El impacto de eliminar NMS

La supresión no máxima suele ser una operación compleja de acelerar en las unidades de procesamiento neuronal (NPUs). Al eliminarla, YOLOv10 permite que todo el grafo del modelo se ejecute sin interrupciones en hardware especializado, lo que mejora drásticamente la compatibilidad con marcos de optimización como OpenVINO y TensorRT.

Métricas de rendimiento y comparativa#

Al evaluar modelos para producción, es fundamental equilibrar la precisión con la carga computacional. La siguiente tabla muestra las ventajas y desventajas de las distintas escalas de YOLOX y YOLOv10.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv10n64038.5-1.842.36.7
YOLOv10s64046.3-2.497.221.6
YOLOv10m64051.1-4.7415.459.1
YOLOv10b64052.5-5.7419.192.0
YOLOv10l64053.2-7.2824.4120.3
YOLOv10x64054.4-10.7029.5160.4

Análisis de los datos#

Las métricas demuestran claramente el salto generacional de YOLOv10. Por ejemplo, YOLOv10-S alcanza una precisión media promedio del 46,3 %, frente al 46,9 % de YOLOX-m, pero lo consigue con menos de un tercio de los parámetros (7,2 M frente a 25,3 M) y muchos menos FLOPs. Además, el modelo de gama alta YOLOv10-X eleva el mAP al 54,4 %, lo que lo convierte en una opción muy competitiva para tareas que requieren una gran precisión, a la vez que supera en velocidad a la arquitectura anterior YOLOX-x.

La ventaja del ecosistema Ultralytics#

Aunque YOLOX sigue siendo una implementación de investigación de código abierto sólida, adoptar YOLOv10 te da acceso inmediato al ecosistema bien mantenido de Ultralytics. Elegir un modelo compatible con Ultralytics garantiza una experiencia de usuario optimizada, caracterizada por una API sencilla y una documentación exhaustiva.

Los desarrolladores se benefician enormemente de los bajos requisitos de memoria del marco: el entrenamiento de modelos de Ultralytics suele consumir mucha menos memoria CUDA que las alternativas basadas en Transformer más pesadas, como RT-DETR. Esta eficiencia en el uso de memoria permite utilizar tamaños de lote mayores en hardware de consumo y acelerar el proceso desde la recopilación de datos hasta el despliegue del modelo. Además, el marco ofrece una versatilidad inigualable y permite cambiar fácilmente entre la detección de objetos, la segmentación de instancias y la estimación de pose con cambios mínimos en el código.

Ejemplo de entrenamiento e inferencia#

La API unificada permite validar ideas con gran rapidez. El siguiente fragmento muestra lo fácil que es entrenar y desplegar un modelo YOLOv10 con el backend PyTorch:

from ultralytics import YOLO

# Carga un modelo nano YOLOv10 preentrenado
model = YOLO("yolov10n.pt")

# Entrena el modelo con el conjunto de datos COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Ejecuta la inferencia en una imagen de muestra
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Exporta el modelo para implementarlo en dispositivos edge
model.export(format="engine", quantize=16)

Gracias a las rutinas de exportación integradas, convertir modelos a formatos como TensorRT u ONNX requiere una sola línea de código y evita por completo las complejas dificultades de compilación.

Casos de uso ideales y escenarios de despliegue#

La elección entre estas arquitecturas depende en gran medida de las limitaciones de tu hardware y de los requisitos específicos de tu ámbito.

Análisis de vídeo en tiempo real#

Para aplicaciones que requieren una latencia ultrabaja, como la conducción autónoma o la monitorización del tráfico en tiempo real, YOLOv10 es la mejor opción. Su diseño integral sin NMS garantiza tiempos de ejecución deterministas, algo fundamental para los sistemas de seguridad, que no pueden tolerar una latencia variable en el posprocesamiento. Los modelos alcanzan fácilmente altas tasas de fotogramas en dispositivos como la serie NVIDIA Jetson.

Microcontroladores de referencia académica y periféricos#

YOLOX sigue siendo útil en entornos académicos donde los investigadores quieren una referencia limpia con cabeza desacoplada para experimentar con estrategias de asignación de etiquetas. Además, el YOLOX-Nano, excepcionalmente pequeño (menos de un millón de parámetros), puede adaptarse a dispositivos periféricos con recursos muy limitados, siempre que el hardware admita operaciones de convolución estándar.

El estándar definitivo: Ultralytics YOLO26#

Aunque YOLOv10 supuso un gran avance al eliminar NMS, el campo de la visión por ordenador avanza rápidamente. Para los desarrolladores que buscan implementar hoy el mejor rendimiento del mercado, recomendamos encarecidamente explorar YOLO26.

Lanzado como el estándar más reciente en IA visual, YOLO26 toma las ideas fundamentales de sus predecesores y las lleva mucho más lejos. Ofrece el equilibrio definitivo de rendimiento y admite de forma nativa la detección, la segmentación, la pose y los cuadros delimitadores orientados.

Estas son las razones por las que YOLO26 es la opción recomendada para los flujos de trabajo modernos de visión por ordenador:

  • Diseño integral sin NMS: a partir de los avances de YOLOv10, YOLO26 admite la inferencia integral nativa (nms=False) y ofrece tiempos de inferencia más rápidos y deterministas, sin los cuellos de botella del posprocesamiento con NMS.
  • Hasta un 43 % más rápido en inferencia en CPU: está optimizado específicamente para la computación periférica, lo que garantiza un rendimiento excepcional en procesadores móviles y dispositivos sin GPU dedicada.
  • Optimizador MuSGD: inspirado en el entrenamiento de modelos de lenguaje grandes (en concreto, Kimi K2 de Moonshot AI), YOLO26 combina SGD y Muon para lograr entrenamientos muy estables y una convergencia rápida.
  • ProgLoss + STAL: estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental en ámbitos exigentes como las imágenes aéreas y la navegación con drones.
  • Eliminación de DFL: al eliminar Distribution Focal Loss, YOLO26 simplifica el grafo del modelo y facilita la exportación a dispositivos periféricos y de bajo consumo.
  • Mejoras específicas para cada tarea: tanto si utilizas Residual Log-Likelihood Estimation (RLE) para la estimación de pose como si recurres a una función de pérdida angular especializada para OBB, YOLO26 está optimizado para todas las principales tareas de visión.

Para los desarrolladores que quieran actualizar sus flujos de trabajo con las herramientas de entrenamiento y despliegue más eficientes disponibles, pasarse a la plataforma Ultralytics y aprovechar YOLO26 garantiza que sigas a la vanguardia de la inteligencia artificial. Quienes estén interesados en arquitecturas anteriores pero estables también pueden consultar YOLO11 o YOLOv8, que cuentan con un amplio respaldo de la comunidad y una solidez demostrada.

Comentarios