Ultralytics YOLO27:

YOLOX frente a YOLOv10#

La evolución de los modelos de visión artificial en tiempo real ha estado marcada por importantes saltos arquitectónicos. Dos hitos fundamentales de este recorrido son YOLOX y YOLOv10. Lanzado en 2021, YOLOX logró reducir la brecha entre la investigación académica y la aplicación industrial al introducir un diseño sin anchors muy eficaz. Tres años después, YOLOv10 revolucionó el campo al eliminar la necesidad de la supresión de no máximos (NMS) durante el postprocesamiento, ampliando los límites de la eficiencia y la velocidad.

Esta comparación técnica exhaustiva analiza las arquitecturas, las métricas de rendimiento y los casos de uso ideales de ambos modelos, y ofrece información para ayudarte a elegir la herramienta adecuada para tu próximo proyecto de detección de objetos.

Orígenes y metadatos de los modelos#

Comprender los orígenes de estos modelos ayuda a contextualizar sus decisiones arquitectónicas y los entornos de implementación previstos.

Detalles de YOLOX

Aprende más sobre YOLOX

Detalles de YOLOv10

Más información sobre YOLOv10

Innovaciones arquitectónicas#

Las diferencias principales entre YOLOX y YOLOv10 radican en cómo gestionan las predicciones de las cajas delimitadoras y el postprocesamiento.

YOLOX: diseño pionero sin anchors#

YOLOX causó sensación al trasladar la familia YOLO a una arquitectura sin anchors. Al predecir el centro de un objeto en lugar de depender de cajas anchor predefinidas, YOLOX redujo drásticamente el número de parámetros de diseño y de ajustes heurísticos necesarios para conjuntos de datos personalizados. Además, introdujo una cabeza desacoplada que separa las tareas de clasificación y regresión en rutas diferenciadas. Este enfoque resolvió el conflicto entre identificar qué es un objeto y determinar dónde está, lo que dio lugar a una mejora notable en la velocidad de convergencia y la precisión.

YOLOv10: la revolución sin NMS#

Aunque YOLOX simplificó la cabeza de detección, seguía dependiendo de NMS para filtrar las predicciones redundantes de las cajas delimitadoras. YOLOv10 abordó este cuello de botella fundamental. Al utilizar asignaciones duales coherentes durante el entrenamiento, YOLOv10 consigue una detección nativa de extremo a extremo. Emplea una cabeza de uno a muchos durante el entrenamiento para garantizar señales de supervisión abundantes, mientras que utiliza una cabeza de uno a uno durante la inferencia para generar directamente las predicciones finales. Este diseño integral, orientado a la eficiencia y la precisión, elimina por completo NMS y reduce significativamente la latencia de inferencia en chips integrados.

El impacto de eliminar NMS

La supresión de no máximos suele ser una operación compleja de acelerar en las unidades de procesamiento neuronal (NPUs). Al eliminarla, YOLOv10 permite que todo el grafo del modelo se ejecute sin problemas en hardware especializado, mejorando drásticamente la compatibilidad con frameworks de optimización como OpenVINO y TensorRT.

Métricas de rendimiento y comparación#

Al evaluar modelos para producción, es fundamental equilibrar la precisión con la sobrecarga computacional. La tabla siguiente ilustra las ventajas y desventajas entre distintas escalas de YOLOX y YOLOv10.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Análisis de los datos#

Las métricas demuestran claramente el salto generacional de YOLOv10. Por ejemplo, YOLOv10-S alcanza una precisión media promedio del 46,7 %, frente al 46,9 % de YOLOX-m, pero lo hace utilizando menos de un tercio de los parámetros (7,2 M frente a 25,3 M) y muchos menos FLOPs. Además, el modelo YOLOv10-X de gama alta eleva el mAP hasta el 54,4 %, lo que lo hace muy competitivo para tareas que exigen una gran precisión, a la vez que sigue siendo más rápido que la arquitectura YOLOX-x anterior.

La ventaja del ecosistema de Ultralytics#

Aunque YOLOX sigue siendo una implementación de investigación de código abierto sólida, adoptar YOLOv10 proporciona acceso inmediato al ecosistema bien mantenido de Ultralytics. Elegir un modelo compatible con Ultralytics garantiza una experiencia de usuario optimizada, caracterizada por una API sencilla y una documentación extensa.

Los desarrolladores se benefician enormemente de los requisitos de memoria del framework; entrenar modelos de Ultralytics suele consumir mucha menos memoria CUDA que alternativas pesadas basadas en Transformer, como RT-DETR. Esta huella de entrenamiento eficiente permite utilizar tamaños de lote mayores en hardware de consumo, acelerando el proceso desde la recopilación de datos hasta la implementación del modelo. Además, el framework ofrece una versatilidad inigualable, ya que permite cambiar sin problemas entre detección de objetos, segmentación de instancias y estimación de poses con cambios mínimos en el código.

Ejemplo de entrenamiento e inferencia#

La API unificada hace que validar ideas sea increíblemente rápido. El siguiente fragmento muestra lo fácil que es entrenar e implementar un modelo YOLOv10 utilizando el backend de PyTorch:

from ultralytics import YOLO

# Load a pre-trained YOLOv10 nano model
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on a sample image
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Export the model for edge deployment
model.export(format="engine", quantize=16)

Al aprovechar las rutinas de exportación integradas, convertir modelos a formatos como TensorRT u ONNX requiere solo una línea de código, evitando por completo las complejidades de la compilación.

Casos de uso ideales y escenarios de despliegue#

La elección entre estas arquitecturas depende en gran medida de las limitaciones de tu hardware y de los requisitos específicos de tu ámbito.

Análisis de vídeo en tiempo real#

Para aplicaciones que requieren una latencia ultrabaja, como la conducción autónoma o la supervisión del tráfico en tiempo real, YOLOv10 es la opción superior. Su diseño de extremo a extremo sin NMS garantiza tiempos de ejecución deterministas, algo fundamental para los sistemas de seguridad en los que no se puede tolerar una latencia variable de postprocesamiento. Los modelos alcanzan fácilmente altas tasas de fotogramas en dispositivos como la serie NVIDIA Jetson.

Líneas base académicas y microcontroladores periféricos#

YOLOX sigue siendo valioso en entornos académicos donde los investigadores buscan una línea base limpia con cabeza desacoplada para experimentar con estrategias de asignación de etiquetas. Además, el excepcionalmente pequeño YOLOX-Nano (con menos de 1 millón de parámetros) puede integrarse en microcontroladores periféricos con recursos muy limitados, donde la memoria se mide en kilobytes, siempre que el hardware admita operaciones de convolución estándar.

El estándar definitivo: Ultralytics YOLO26#

Aunque YOLOv10 supuso un enorme avance al eliminar NMS, el campo de la visión artificial evoluciona rápidamente. Para los desarrolladores que quieran implementar hoy un rendimiento absolutamente líder en su categoría, recomendamos encarecidamente explorar YOLO26.

Lanzado como el estándar más reciente en IA para visión, YOLO26 toma las ideas fundamentales de sus predecesores y las lleva mucho más lejos. Ofrece el equilibrio de rendimiento definitivo y admite de forma nativa la detección, la segmentación, la estimación de poses y las cajas delimitadoras orientadas.

Estas son las razones por las que YOLO26 es la opción recomendada para los pipelines modernos de visión artificial:

  • Diseño de extremo a extremo sin NMS: Basándose en los avances de YOLOv10, YOLO26 es nativo de extremo a extremo, lo que garantiza tiempos de inferencia más rápidos y deterministas sin cuellos de botella de postprocesamiento.
  • Hasta un 43 % más rápido en inferencia en CPU: Está optimizado específicamente para la computación periférica, lo que garantiza un rendimiento excepcional en procesadores móviles y dispositivos sin GPU discretas.
  • Optimizador MuSGD: Inspirado en el entrenamiento de modelos de lenguaje grandes (concretamente, en Kimi K2 de Moonshot AI), YOLO26 utiliza una combinación de SGD y Muon para lograr un entrenamiento extremadamente estable y una convergencia rápida.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños, algo fundamental en ámbitos exigentes como las imágenes aéreas y la navegación de drones.
  • Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 simplifica el grafo del modelo para permitir una exportación fluida a dispositivos periféricos y de bajo consumo.
  • Mejoras específicas por tarea: Tanto si utilizas la estimación de log-verosimilitud residual (RLE) para la estimación de poses como una función de pérdida angular especializada para OBB, YOLO26 está optimizado para las principales tareas de visión.

Para los desarrolladores que estén preparados para actualizar sus pipelines con las herramientas de entrenamiento e implementación más eficientes disponibles, pasar a la Ultralytics Platform y aprovechar YOLO26 garantiza que te mantengas a la vanguardia de la inteligencia artificial. Los usuarios interesados en arquitecturas anteriores pero estables también pueden consultar YOLO11 o YOLOv8 para disfrutar de un amplio apoyo de la comunidad y una solidez demostrada.

Comentarios