Ultralytics YOLO27:

YOLOX frente a RTDETRv2#

Elegir la arquitectura óptima para aplicaciones de visión artificial requiere equilibrar cuidadosamente la precisión, la velocidad de inferencia y la viabilidad del despliegue. En este análisis técnico exhaustivo, exploramos las diferencias fundamentales entre YOLOX, una arquitectura CNN sin anchors de gran éxito, y RTDETRv2, un Transformer de detección en tiempo real de última generación.

Aunque ambos modelos han contribuido significativamente al campo de la detección de objetos, los desarrolladores que crean aplicaciones listas para producción suelen comprobar que alternativas modernas como Ultralytics YOLO26 ofrecen una mayor eficiencia de entrenamiento, menores requisitos de memoria y un ecosistema de despliegue más sólido.

YOLOX: tendiendo puentes entre la investigación y la industria#

YOLOX surgió como una adaptación sin anchors muy popular de la serie YOLO, con un diseño simplificado que ofrecía mejoras de rendimiento impresionantes en el momento de su lanzamiento.

Innovaciones arquitectónicas#

YOLOX llevó la familia YOLO a un paradigma sin anchors, integrando una cabeza desacoplada y la avanzada estrategia de asignación de etiquetas SimOTA. Al eliminar las cajas anchor, la arquitectura redujo significativamente el número de parámetros de diseño y mejoró la generalización en distintos conjuntos de datos de referencia. Sus versiones ligeras, YOLOX-Nano y YOLOX-Tiny, se convirtieron en opciones populares para desplegar aplicaciones de IA de visión en dispositivos periféricos.

Consideraciones sobre modelos heredados

Aunque YOLOX aportó avances notables, su dependencia de pipelines de aumento de datos pesados y de rutinas antiguas de posprocesamiento (como el NMS tradicional) puede provocar una latencia mayor en comparación con los modelos nativos de extremo a extremo.

Aprende más sobre YOLOX

RTDETRv2: avances en los Transformers de visión en tiempo real#

A partir de los fundamentos de su predecesor, RTDETRv2 aprovecha la potencia de los Transformers de visión (ViTs) para lograr una precisión muy competitiva sin sacrificar velocidades de inferencia en tiempo real.

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
  • Organización: Baidu
  • Fecha: 2024-07-24
  • Enlaces: Arxiv, GitHub

Innovaciones arquitectónicas#

RTDETRv2 replantea por completo el pipeline de detección mediante una arquitectura basada en Transformer que evita de forma nativa la supresión de no máximos (NMS). Esto se consigue mediante un codificador híbrido y una selección de consultas consciente del IoU, lo que mejora la inicialización de las consultas de objetos. El modelo gestiona eficazmente las características multiescala, lo que le permite capturar detalles complejos en entornos difíciles, como la detección de tráfico en vídeo nocturno.

Sin embargo, los Transformers requieren muchos recursos por naturaleza. Entrenar RTDETRv2 suele exigir bastante más memoria de GPU y ciclos de cómputo que las alternativas basadas en CNN, lo que puede suponer un obstáculo para los equipos que trabajan con presupuestos estrictos o que necesitan realizar ajustes frecuentes del modelo.

Obtén más información sobre RT-DETR

Tabla comparativa de rendimiento#

Para evaluar objetivamente estas arquitecturas, examinamos su rendimiento en el conjunto de datos COCO. La tabla siguiente ilustra las ventajas y desventajas entre la precisión (mAP), el número de parámetros y la complejidad computacional.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Aunque RTDETRv2 logra una precisión impresionante, YOLOX mantiene una ventaja en perfiles con pocos parámetros, especialmente con sus variantes Nano y Tiny.

Casos de uso y recomendaciones#

La elección entre YOLOX y RT-DETR depende de los requisitos específicos de tu proyecto, las restricciones de despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOX#

YOLOX es una buena opción para:

  • Investigación sobre detección sin anchors: Investigación académica que utiliza la arquitectura limpia y sin anchors de YOLOX como línea base para experimentar con nuevas cabezas de detección o funciones de pérdida.
  • Dispositivos edge ultraligeros: Implementaciones en microcontroladores o hardware móvil antiguo donde sea fundamental el tamaño extremadamente reducido de la variante YOLOX-Nano (0.91M de parámetros).
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir RT-DETR#

RT-DETR se recomienda para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La ventaja de Ultralytics: YOLO26#

Aunque YOLOX y RTDETRv2 ofrecen fortalezas diferenciadas, el recién lanzado Ultralytics YOLO26 redefine el estado del arte de la IA de visión al resolver las compensaciones históricas entre velocidad, precisión y facilidad de despliegue.

1. Arquitectura de extremo a extremo sin NMS#

Inspirado en los modelos Transformer, pero conservando la eficiencia de las CNN, YOLO26 incorpora un diseño nativo de extremo a extremo sin NMS. Al eliminar la supresión de no máximos como paso de posprocesamiento, YOLO26 simplifica drásticamente los pipelines de despliegue y garantiza una latencia de inferencia uniforme en diversos dispositivos periféricos, sin la sobrecarga de ajustar umbrales complejos.

2. Inferencia en CPU hasta un 43 % más rápida#

A diferencia de las arquitecturas Transformer, como RTDETRv2, que dependen en gran medida de GPU de alta gama, YOLO26 está optimizado específicamente para entornos de edge computing. Gracias a la eliminación de Distribution Focal Loss (DFL), YOLO26 agiliza la exportación del modelo y logra una inferencia en CPU hasta un 43 % más rápida, lo que lo convierte en la opción ideal para integrarlo en hardware como Raspberry Pi o en dispositivos móviles estándar.

3. Eficiencia de entrenamiento con MuSGD#

Entrenar modelos Transformer suele provocar un consumo excesivo de memoria CUDA y tiempos de entrenamiento prolongados. YOLO26 introduce el novedoso optimizador MuSGD, una combinación del descenso de gradiente estocástico y el optimizador Muon inspirado en los LLM. Esta innovación ofrece un entrenamiento excepcionalmente estable y una convergencia más rápida, reduciendo significativamente los requisitos de hardware en comparación con RTDETRv2.

4. Ecosistema y versatilidad incomparables#

El ecosistema de Ultralytics proporciona una experiencia de desarrollo intuitiva y simplificada. Con documentación exhaustiva, soporte activo de la comunidad y la Ultralytics Platform basada en la nube, gestionar todo el ciclo de vida de la IA nunca había sido tan fácil. Además, YOLO26 es muy versátil. Mientras que RTDETRv2 se centra en la detección de objetos, YOLO26 admite de forma nativa segmentación de instancias, estimación de pose, clasificación de imágenes y tareas de cajas delimitadoras orientadas (OBB). Gracias a las nuevas funciones de pérdida ProgLoss + STAL, YOLO26 también destaca en el reconocimiento de objetos pequeños, una característica fundamental para las imágenes aéreas y la detección de defectos industriales.

Otros modelos compatibles

El framework de Ultralytics también admite YOLO11 y YOLOv8, de la generación anterior, para que puedas evaluar fácilmente su rendimiento y migrar pipelines heredados.

Integración fluida con Ultralytics#

Desplegar modelos no debería obligarte a lidiar con bases de código complejas y fragmentadas. La API de Python de Ultralytics te permite cargar, entrenar y exportar modelos de última generación con solo unas líneas de código.

from ultralytics import YOLO

# Load the latest YOLO26 nano model for optimal edge performance
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset with minimal memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate the model's performance
metrics = model.val()

# Export seamlessly to ONNX or TensorRT for deployment
model.export(format="onnx", optimize=True)

Al aprovechar Ultralytics, evitas las complicadas configuraciones de entorno asociadas habitualmente a los repositorios de investigación y aceleras tu llegada al mercado.

Conclusión#

YOLOX y RTDETRv2 representan hitos importantes en la evolución de la detección de objetos en tiempo real. YOLOX demostró la viabilidad de las CNN sin anchors altamente eficientes, mientras que RTDETRv2 adaptó con éxito los Transformers a las restricciones del tiempo real.

Sin embargo, para aplicaciones modernas que van desde la analítica minorista inteligente hasta la robótica integrada, Ultralytics YOLO26 ofrece la solución definitiva. Al combinar una inferencia sin NMS con velocidades de CPU incomparables, un menor consumo de memoria y el sólido respaldo de Ultralytics Platform, YOLO26 permite a los desarrolladores crear la próxima generación de sistemas de visión artificial fiables y de alto rendimiento.

Comentarios