RTDETRv2 frente a YOLOX#
El panorama de la visión por ordenador ha evolucionado rápidamente, ofreciendo a desarrolladores e investigadores una amplia variedad de arquitecturas entre las que elegir al crear sistemas basados en visión. Dos hitos destacables de este recorrido son el RTDETRv2 basado en Transformer y el YOLOX basado en CNN. Aunque ambos modelos han contribuido notablemente al campo de la detección de objetos en tiempo real, representan enfoques fundamentalmente distintos para resolver problemas de reconocimiento visual.
Esta guía exhaustiva explora los matices arquitectónicos, las métricas de rendimiento y los escenarios de implementación ideales para ambos modelos. Además, examinaremos cómo alternativas modernas como el vanguardista Ultralytics YOLO26 se basan en estos fundamentos para ofrecer mayor precisión, eficiencia y facilidad de uso.
RTDETRv2: Transformers de detección en tiempo real#
Presentado como sucesor del RT-DETR original, RTDETRv2 aprovecha la arquitectura Transformer para lograr una detección de objetos en tiempo real de alto rendimiento. Al eliminar la necesidad de la supresión no máxima (NMS), simplifica el flujo de inferencia.
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
- Organización: Baidu
- Fecha: 2024-07-24
- Enlaces: Artículo de Arxiv, GitHub oficial, Documentación
Arquitectura y diseño#
RTDETRv2 depende en gran medida de los mecanismos de autoatención inherentes a los Transformer, lo que permite al modelo capturar el contexto global de una imagen completa. Esta comprensión holística le permite predecir directamente las cajas delimitadoras y las probabilidades de clase. Introduce características de detección multiescala que mejoran su capacidad para reconocer objetos pequeños en entornos con mucho desorden visual.
Aunque los Transformer destacan en la captura del contexto global, sus mecanismos de autoatención escalan cuadráticamente con la longitud de la secuencia, lo que suele provocar un consumo de memoria CUDA considerablemente mayor durante el entrenamiento en comparación con las CNN tradicionales.
Puntos fuertes y débiles#
La principal fortaleza de RTDETRv2 reside en su diseño nativo de extremo a extremo. Al omitir NMS, evita los picos de latencia que suelen asociarse a las predicciones densas superpuestas. Sin embargo, la elevada carga computacional de sus bloques Transformer implica que necesita recursos de GPU considerables tanto para el entrenamiento como para la implementación. Esto lo hace menos adecuado para dispositivos edge con recursos limitados o hardware móvil antiguo.
YOLOX: evolución de las CNN sin anchors#
Desarrollado para tender un puente entre la investigación académica y la aplicación industrial, YOLOX introdujo una cabeza desacoplada y un diseño sin anchors en la popular familia de modelos YOLO.
- Autores: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun
- Organización: Megvii
- Fecha: 18 de julio de 2021
- Enlaces: Artículo de Arxiv, GitHub oficial, Documentación
Arquitectura y diseño#
YOLOX se aparta de los detectores tradicionales basados en anchors al predecir directamente las ubicaciones de los objetos sin cajas anchor predefinidas. Esto simplifica el diseño de la red y reduce el número de parámetros de ajuste heurístico necesarios para lograr un rendimiento óptimo. Además, YOLOX emplea una cabeza desacoplada que separa las tareas de clasificación y regresión, lo que mejora la velocidad de convergencia durante el entrenamiento.
Puntos fuertes y débiles#
La naturaleza sin anchors de YOLOX lo hace muy adaptable a diversas tareas de visión por ordenador y más sencillo de entrenar con conjuntos de datos personalizados. Sus variantes más ligeras, como YOLOX-Nano, son adecuadas para implementarse en microcontroladores y dispositivos IoT de bajo consumo. Sin embargo, como YOLOX es anterior a la revolución de los modelos sin NMS, sigue dependiendo del posprocesamiento tradicional, lo que puede dificultar la implementación y aumentar la latencia en escenas densas.
Comparación de rendimiento y métricas#
Al comparar estos modelos, es fundamental evaluar su velocidad, precisión y eficiencia en cuanto al número de parámetros para determinar cuál se adapta mejor a tu caso de uso concreto. La tabla siguiente muestra el rendimiento de distintos tamaños de modelo en el conjunto de datos COCO estándar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
Como muestran los datos, RTDETRv2 alcanza una precisión máxima superior (54,3 mAP) en su variante más grande que YOLOXx. Sin embargo, YOLOX ofrece variantes considerablemente más pequeñas y rápidas, como YOLOXs, que cuenta con menos parámetros y mayores velocidades de inferencia en GPU NVIDIA T4.
La ventaja de Ultralytics: llega YOLO26#
Aunque RTDETRv2 y YOLOX ofrecen ventajas únicas, los desarrolladores actuales suelen necesitar una solución unificada que combine lo mejor de ambos mundos: alta precisión, inferencia extremadamente rápida y un ecosistema accesible. El recién lanzado Ultralytics YOLO26 representa la culminación de esta evolución.
Innovaciones clave de YOLO26#
- Diseño de extremo a extremo sin NMS: Basándose en conceptos desarrollados inicialmente en YOLOv10, YOLO26 funciona de forma nativa sin NMS. Esto ofrece la inferencia fluida de RTDETRv2 sin los enormes requisitos de memoria de los Transformer.
- Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de modelos de lenguaje de gran tamaño, el optimizador híbrido MuSGD (que combina SGD y Muon) estabiliza el proceso de entrenamiento y acelera drásticamente la convergencia.
- Hasta un 43 % más de velocidad de inferencia en CPU: Al eliminar estratégicamente el módulo Distribution Focal Loss (DFL), YOLO26 está optimizado específicamente para la computación edge y los dispositivos de bajo consumo, por lo que es considerablemente más rápido en CPU que iteraciones anteriores como YOLO11.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños y abordan un problema habitual en las imágenes aéreas y las aplicaciones de robótica.
Versatilidad y ecosistema incomparables#
Más allá del rendimiento bruto, la Ultralytics Platform ofrece un ecosistema integral, desde cero hasta producción. A diferencia de los repositorios académicos estáticos, los modelos de Ultralytics reciben mantenimiento activo y admiten sin problemas múltiples tareas desde una única API intuitiva. Tanto si realizas segmentación de instancias, como si haces seguimiento de poses mediante estimación de poses o trabajas con objetos girados mediante cajas delimitadoras orientadas (OBB), el flujo de trabajo sigue siendo idéntico.
Además, los modelos de Ultralytics son conocidos por sus bajos requisitos de memoria tanto durante el entrenamiento como durante la inferencia, lo que permite a los investigadores ejecutar tamaños de lote mayores en hardware de consumo, en marcado contraste con la elevada huella de las arquitecturas basadas en Transformer.
Ejemplo de código de entrenamiento#
La potencia del ecosistema de Ultralytics se demuestra mejor a través de su sencillez. Entrenar un modelo YOLO26 de última generación solo requiere unas pocas líneas de código, abstrayendo por completo las complejidades de la carga de datos y la configuración de hiperparámetros.
from ultralytics import YOLO
# Initialize the natively NMS-free YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the standard COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16)
# Validate the model's performance seamlessly
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")
# Export to ONNX or TensorRT for rapid deployment
model.export(format="engine", device=0)Aplicaciones en el mundo real y casos de uso ideales#
La elección de la arquitectura adecuada depende por completo de tus restricciones de implementación y de la disponibilidad de hardware.
Procesamiento en la nube de alta fidelidad#
Si tu aplicación se ejecuta en GPU de servidor de gama alta y da prioridad a la máxima precisión —por ejemplo, al analizar escenas con mucha afluencia de personas o procesar imágenes médicas de alta resolución—, los sólidos mecanismos de atención de RTDETRv2 pueden resultar muy eficaces.
Implementación edge en sistemas antiguos#
Para implementaciones en teléfonos móviles antiguos o microcontroladores con restricciones importantes, donde un número mínimo de FLOPs es imprescindible, el YOLOX-Nano ultraligero sigue siendo una alternativa viable gracias a su sencilla arquitectura CNN.
El estándar moderno: AIoT y robótica#
Para la gran mayoría de los casos de uso actuales —desde la infraestructura de ciudades inteligentes y la analítica minorista hasta la navegación autónoma—, Ultralytics YOLO26 es la opción definitiva. Su inferencia en CPU un 43 % más rápida lo hace incomparable para la computación edge, mientras que su diseño sin NMS garantiza una latencia baja y constante. Combinado con la documentación integral y el apoyo activo de la comunidad del ecosistema de Ultralytics, permite a los equipos pasar de la anotación del conjunto de datos a la implementación global más rápido que nunca.
¿Preparado para llevar tus proyectos de visión por ordenador al siguiente nivel? Explora las completas capacidades de Ultralytics Platform para gestionar datos sin esfuerzo, entrenar modelos en la nube e implementar aplicaciones inteligentes a escala.
Si eres desarrollador y quieres explorar otras arquitecturas del ecosistema de Ultralytics, también puedes consultar YOLOv8 para acceder a integraciones comunitarias muy consolidadas o YOLOv5 para disfrutar de una estabilidad incomparable en flujos de trabajo heredados. Sin embargo, para ampliar los límites de lo posible en 2026, YOLO26 sigue siendo el estándar del sector.