Ultralytics YOLO27:
Get Started

RTDETRv2 frente a YOLOX#

El panorama de la visión artificial ha evolucionado rápidamente y ofrece a desarrolladores e investigadores toda una variedad de arquitecturas entre las que elegir para crear sistemas de visión. Dos hitos destacados de esta evolución son RTDETRv2, basado en Transformer, y YOLOX, basado en CNN. Aunque ambos modelos han contribuido significativamente al campo de la detección de objetos en tiempo real, representan enfoques fundamentalmente distintos para resolver problemas de reconocimiento visual.

Esta guía completa analiza los matices arquitectónicos, las métricas de rendimiento y los escenarios de despliegue ideales de ambos modelos. Además, veremos cómo las alternativas modernas, como el vanguardista Ultralytics YOLO26, aprovechan estas bases para ofrecer más precisión, eficiencia y facilidad de uso.

RTDETRv2: transformadores de detección en tiempo real#

Presentado como sucesor del RT-DETR original, RTDETRv2 aprovecha la arquitectura Transformer para lograr una detección de objetos en tiempo real de alto rendimiento. Al eliminar la necesidad de supresión no máxima (NMS), simplifica la canalización de inferencia.

Arquitectura y diseño#

RTDETRv2 depende en gran medida de los mecanismos de autoatención propios de los Transformer, que permiten al modelo captar el contexto global de toda una imagen. Esta comprensión integral le permite predecir directamente cuadros delimitadores y probabilidades de clase. Incorpora características de detección multiescala que mejoran su capacidad para reconocer objetos pequeños en entornos desordenados.

Cuellos de botella de los Transformer

Aunque los Transformer destacan por captar el contexto global, sus mecanismos de autoatención crecen de forma cuadrática con la longitud de la secuencia, lo que suele provocar un consumo de memoria CUDA considerablemente mayor durante el entrenamiento que el de las CNN tradicionales.

Puntos fuertes y débiles#

La principal ventaja de RTDETRv2 reside en su diseño nativo integral. Al omitir NMS, evita los picos de latencia que suelen asociarse a las predicciones densas y superpuestas. Sin embargo, el elevado coste computacional de sus bloques Transformer hace que necesite muchos recursos de GPU tanto para el entrenamiento como para el despliegue. Por ello, es menos adecuado para dispositivos edge con recursos limitados o hardware móvil antiguo.

Más información sobre RTDETRv2

YOLOX: avances en las CNN sin anclajes#

Desarrollado para reducir la brecha entre la investigación académica y la aplicación industrial, YOLOX incorporó una cabeza desacoplada y un diseño sin anclajes a la popular familia de modelos YOLO.

Arquitectura y diseño#

YOLOX se aleja de los detectores tradicionales basados en anclajes al predecir directamente la ubicación de los objetos, sin cuadros de anclaje predefinidos. Esto simplifica el diseño de la red y reduce el número de parámetros de ajuste heurístico necesarios para obtener un rendimiento óptimo. Además, YOLOX utiliza una cabeza desacoplada que separa las tareas de clasificación y regresión, lo que mejora la velocidad de convergencia durante el entrenamiento.

Puntos fuertes y débiles#

La naturaleza de YOLOX sin anclajes lo hace muy adaptable a distintas tareas de visión artificial y facilita su entrenamiento con conjuntos de datos personalizados. Sus variantes más ligeras, como YOLOX-Nano, son adecuadas para su despliegue en microcontroladores y dispositivos IoT de bajo consumo. Sin embargo, como YOLOX es anterior a la revolución de los modelos sin NMS, sigue dependiendo del posprocesamiento tradicional, lo que puede complicar el despliegue y aumentar la latencia en escenas con gran densidad de objetos.

Más información sobre YOLOX

Comparativa de rendimiento y métricas#

Al comparar estos modelos, es fundamental evaluar su velocidad, precisión y eficiencia en cuanto al número de parámetros para determinar cuál se adapta mejor a tu caso de uso concreto. La tabla siguiente muestra el rendimiento de varios tamaños de modelo en el conjunto de datos COCO estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Como muestran los datos, RTDETRv2 alcanza una precisión máxima superior (54,3 mAP) en su variante más grande frente a YOLOXx. Sin embargo, YOLOX ofrece variantes considerablemente más pequeñas y rápidas, como YOLOXs, que tiene menos parámetros y ofrece velocidades de inferencia superiores en las GPU NVIDIA T4.

La ventaja de Ultralytics: llega YOLO26#

Aunque RTDETRv2 y YOLOX ofrecen ventajas únicas, los desarrolladores actuales suelen necesitar una solución unificada que combine lo mejor de ambos mundos: gran precisión, inferencia rapidísima y un ecosistema accesible. El recién lanzado Ultralytics YOLO26 representa la culminación de esta evolución.

Innovaciones clave de YOLO26#

  • Diseño integral sin NMS: Basándose en conceptos introducidos por primera vez en YOLOv10, YOLO26 ofrece una cabeza opcional sin NMS (nms=False). Esto proporciona una inferencia fluida como la de RTDETRv2, sin los enormes requisitos de memoria de los Transformer.
  • Optimizador MuSGD: Inspirado en las innovaciones del entrenamiento de modelos de lenguaje grandes, el optimizador híbrido MuSGD (que combina SGD y Muon) estabiliza el proceso de entrenamiento y acelera drásticamente la convergencia.
  • Inferencia en CPU hasta un 43 % más rápida: Al eliminar estratégicamente el módulo Distribution Focal Loss (DFL), YOLO26 está optimizado específicamente para la computación edge y los dispositivos de bajo consumo, por lo que es sustancialmente más rápido en CPU que versiones anteriores, como YOLO11.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños y abordan un problema habitual en las imágenes aéreas y las aplicaciones robóticas.

Versatilidad y ecosistema incomparables#

Más allá del rendimiento bruto, la Plataforma Ultralytics ofrece un ecosistema integral que lleva los proyectos desde cero hasta producción. A diferencia de los repositorios académicos estáticos, los modelos de Ultralytics se mantienen activamente y admiten sin fisuras múltiples tareas desde una única API intuitiva. Tanto si realizas segmentación de instancias, como si sigues poses mediante la estimación de pose o procesas objetos girados con cuadros delimitadores orientados (OBB), el flujo de trabajo es el mismo.

Además, los modelos de Ultralytics son conocidos por sus bajos requisitos de memoria tanto durante el entrenamiento como durante la inferencia, lo que permite a los investigadores ejecutar lotes de mayor tamaño en hardware de consumo; un marcado contraste con la gran huella de las arquitecturas basadas en Transformer.

Ejemplo de código de entrenamiento#

La potencia del ecosistema Ultralytics se demuestra mejor por su sencillez. Entrenar un modelo YOLO26 de última generación solo requiere unas pocas líneas de código, que abstraen por completo la complejidad de la carga de datos y la configuración de hiperparámetros.

from ultralytics import YOLO

# Initialize the YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the standard COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16)

# Validate the model's performance seamlessly
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")

# Export to ONNX or TensorRT for rapid deployment
model.export(format="engine", device=0)

Aplicaciones reales y casos de uso ideales#

La elección de la arquitectura adecuada depende por completo de las restricciones de despliegue y del hardware disponible.

Procesamiento en la nube de alta fidelidad#

Si tu aplicación se ejecuta en GPU de servidor de gama alta y da prioridad a la máxima precisión —por ejemplo, para analizar escenas con grandes multitudes o procesar imágenes médicas de alta resolución—, los sólidos mecanismos de atención de RTDETRv2 pueden ser muy eficaces.

Implementación heredada en dispositivos edge#

Para despliegues en móviles antiguos o microcontroladores con grandes restricciones, donde es imprescindible reducir al mínimo los FLOPs, el ultraligero YOLOX-Nano sigue siendo una alternativa viable gracias a su sencilla arquitectura CNN.

El estándar actual: AIoT y robótica#

Para la gran mayoría de los casos de uso actuales —desde la infraestructura de ciudades inteligentes y la analítica del comercio minorista hasta la navegación autónoma—, Ultralytics YOLO26 es la opción definitiva. Su inferencia en CPU un 43 % más rápida lo hace incomparable para la computación edge, mientras que su cabeza opcional sin NMS ofrece una latencia baja y constante. Combinado con la completa documentación y el apoyo activo de la comunidad del ecosistema Ultralytics, permite a los equipos pasar de la anotación de conjuntos de datos al despliegue global más rápido que nunca.

Optimiza tu flujo de trabajo

¿Listo para llevar tus proyectos de visión artificial al siguiente nivel? Explora las completas capacidades de la Plataforma Ultralytics para gestionar datos fácilmente, entrenar modelos en la nube y desplegar aplicaciones inteligentes a gran escala.

Si quieres explorar otras arquitecturas del ecosistema Ultralytics, también puedes echar un vistazo a YOLOv8, que cuenta con integraciones comunitarias muy consolidadas, o a YOLOv5, que ofrece una estabilidad incomparable en canalizaciones antiguas. Sin embargo, para ampliar los límites de lo posible en 2026, YOLO26 sigue siendo el estándar del sector.

Comentarios