YOLOX frente a RTDETRv2#
Elegir la arquitectura óptima para las aplicaciones de visión artificial requiere equilibrar cuidadosamente la precisión, la velocidad de inferencia y la viabilidad de la implementación. En este análisis técnico exhaustivo, exploramos las diferencias fundamentales entre YOLOX, una exitosa arquitectura CNN sin anchors, y RTDETRv2, un Transformer de detección en tiempo real de última generación.
Aunque ambos modelos han contribuido de forma significativa al campo de la detección de objetos, los desarrolladores que crean aplicaciones listas para producción suelen comprobar que alternativas modernas como Ultralytics YOLO26 ofrecen una mayor eficiencia de entrenamiento, menos requisitos de memoria y un ecosistema de implementación más sólido.
YOLOX: cerrar la brecha entre la investigación y la industria#
YOLOX surgió como una adaptación sin anchors muy popular de la serie YOLO y presentó un diseño simplificado que, en el momento de su lanzamiento, ofrecía mejoras de rendimiento impresionantes.
- Autores: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun
- Organización: Megvii
- Fecha: 18 de julio de 2021
- Enlaces: Arxiv, GitHub, Documentación
Innovaciones arquitectónicas#
YOLOX llevó la familia YOLO al paradigma sin anchors e incorporó una cabeza desacoplada y la avanzada estrategia de asignación de etiquetas SimOTA. Al eliminar las cajas anchor, la arquitectura redujo considerablemente el número de parámetros de diseño y mejoró la generalización en distintos conjuntos de datos de benchmark. Sus versiones ligeras, YOLOX-Nano y YOLOX-Tiny, se hicieron populares para implementar aplicaciones de IA de visión en dispositivos periféricos.
Aunque YOLOX introdujo avances notables, su dependencia de complejos procesos de aumento de datos y rutinas de posprocesamiento antiguas (como la NMS tradicional) puede generar una latencia mayor que la de los modelos nativos de extremo a extremo.
RTDETRv2: avances en los Transformers de visión en tiempo real#
Sobre la base de su predecesor, RTDETRv2 aprovecha la potencia de los Transformers de visión (ViT) para conseguir una precisión muy competitiva sin renunciar a velocidades de inferencia en tiempo real.
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Enlaces: Arxiv, GitHub
Innovaciones arquitectónicas#
RTDETRv2 replantea por completo el proceso de detección mediante una arquitectura basada en Transformer que evita de forma nativa la supresión de no máximos (NMS). Para ello, utiliza un codificador híbrido y una selección de consultas basada en IoU, que mejora la inicialización de las consultas de objetos. El modelo gestiona eficazmente las características multiescala y puede captar detalles complejos en entornos difíciles, como la detección de tráfico en vídeos nocturnos.
Sin embargo, los Transformer requieren muchos recursos por naturaleza. El entrenamiento de RTDETRv2 suele necesitar bastante más memoria GPU y capacidad de cálculo que las alternativas basadas en CNN, lo que puede suponer un obstáculo para los equipos con presupuestos limitados o que necesitan ajustar modelos con frecuencia.
Más información sobre RTDETRv2
Tabla comparativa del rendimiento#
Para evaluar objetivamente estas arquitecturas, analizamos su rendimiento en el conjunto de datos COCO. La tabla siguiente muestra el equilibrio entre precisión (mAP), número de parámetros y complejidad computacional.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Aunque RTDETRv2 consigue una precisión impresionante, YOLOX mantiene una ventaja en cuanto a perfiles de parámetros ligeros, especialmente con sus variantes Nano y Tiny.
Casos de uso y recomendaciones#
La elección entre YOLOX y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOX#
YOLOX es una buena opción para:
- Investigación sobre detección sin anclajes: Investigación académica que utiliza la arquitectura limpia y sin anclajes de YOLOX como base para experimentar con nuevos cabezales de detección o funciones de pérdida.
- Dispositivos de borde ultraligeros: Implementación en microcontroladores o hardware móvil heredado, donde el tamaño extremadamente reducido de la variante YOLOX-Nano (0,91 M de parámetros) es fundamental.
- Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.
Cuándo elegir RT-DETR#
RT-DETR está recomendado para:
- Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
- Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
- Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
La ventaja de Ultralytics: YOLO26#
Aunque YOLOX y RTDETRv2 ofrecen ventajas distintas, el recién lanzado Ultralytics YOLO26 redefine el estado del arte en IA de visión y resuelve los compromisos históricos entre velocidad, precisión y facilidad de implementación.
1. Arquitectura de extremo a extremo sin NMS#
Inspirado en los modelos Transformer, pero conservando la eficiencia de las CNN, YOLO26 incluye un diseño opcional de extremo a extremo sin NMS (nms=False). Al eliminar la supresión de no máximos como paso de posprocesamiento, YOLO26 simplifica enormemente los procesos de implementación y garantiza una latencia de inferencia uniforme en distintos dispositivos periféricos, sin necesidad de ajustar umbrales complejos.
2. Inferencia en CPU hasta un 43 % más rápida#
A diferencia de arquitecturas Transformer como RTDETRv2, que dependen en gran medida de GPU de alta gama, YOLO26 está optimizado específicamente para entornos de computación periférica. Al eliminar Distribution Focal Loss (DFL), YOLO26 agiliza la exportación de modelos y consigue una inferencia en CPU hasta un 43 % más rápida, por lo que es la opción ideal para integrarlo en hardware como Raspberry Pi o en dispositivos móviles estándar.
3. Eficiencia de entrenamiento con MuSGD#
El entrenamiento de modelos Transformer suele provocar un consumo excesivo de memoria CUDA y prolongar los tiempos de entrenamiento. YOLO26 incorpora el novedoso optimizador MuSGD, una combinación del descenso de gradiente estocástico y el optimizador Muon, inspirado en los LLM. Esta innovación ofrece un entrenamiento excepcionalmente estable y una convergencia más rápida, además de reducir considerablemente los requisitos de hardware en comparación con RTDETRv2.
4. Ecosistema y versatilidad sin igual#
El ecosistema de Ultralytics ofrece una experiencia de desarrollo intuitiva y ágil. Gracias a la documentación exhaustiva, el apoyo activo de la comunidad y la plataforma Ultralytics basada en la nube, nunca había sido tan fácil gestionar todo el ciclo de vida de la IA. Además, YOLO26 es muy versátil. Mientras que RTDETRv2 se centra en la detección de objetos, YOLO26 admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de pose y las tareas de cajas delimitadoras orientadas (OBB). Gracias a ProgLoss + STAL, la nueva función de pérdida progresiva y asignación de etiquetas adaptada a objetos pequeños, YOLO26 también destaca en el reconocimiento de objetos pequeños, una característica fundamental para las imágenes aéreas y la detección de defectos industriales.
Integración sencilla con Ultralytics#
Implementar modelos no debería obligarte a lidiar con bases de código complejas y fragmentadas. La API de Python de Ultralytics te permite cargar, entrenar y exportar modelos de última generación con solo unas pocas líneas de código.
from ultralytics import YOLO
# Cargar el último modelo YOLO26 nano para obtener un rendimiento óptimo en dispositivos periféricos
model = YOLO("yolo26n.pt")
# Entrenar el modelo con tu conjunto de datos personalizado y un consumo mínimo de memoria
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Valida el rendimiento del modelo
metrics = model.val()
# Exportar fácilmente a ONNX o TensorRT para la implementación
model.export(format="onnx")Al utilizar Ultralytics, evitas las complicadas configuraciones de entorno que suelen asociarse a los repositorios de investigación y aceleras la llegada de tu producto al mercado.
Conclusión#
YOLOX y RTDETRv2 representan hitos importantes en la evolución de la detección de objetos en tiempo real. YOLOX demostró la viabilidad de las CNN sin anchors muy eficientes, mientras que RTDETRv2 adaptó con éxito los Transformer a las limitaciones del tiempo real.
Sin embargo, para aplicaciones modernas que van desde el análisis del comercio minorista inteligente hasta la robótica integrada, Ultralytics YOLO26 es la solución definitiva. Al combinar inferencia sin NMS con velocidades de CPU sin igual, una menor huella de memoria y el sólido respaldo de la plataforma Ultralytics, YOLO26 permite a los desarrolladores crear la próxima generación de sistemas de visión artificial fiables y de alto rendimiento.