Ultralytics YOLO27:

RTDETRv2 frente a YOLOv7#

El panorama de la visión por ordenador se ha expandido enormemente en los últimos años, impulsado por las innovaciones continuas tanto en las redes neuronales convolucionales (CNNs) como en los Transformers de visión (ViTs). Elegir la arquitectura adecuada para tu implementación requiere comprender las diferencias sutiles entre velocidad, precisión y sobrecarga computacional. Esta guía explora las diferencias técnicas entre dos arquitecturas muy valoradas: RTDETRv2 y YOLOv7, y también destaca los avances modernos disponibles en el nuevo YOLO26 de Ultralytics.

RTDETRv2: el enfoque Transformer para la detección en tiempo real#

RTDETRv2 (Transformador de detección en tiempo real, versión 2) se basa en los cimientos de su predecesor para demostrar que las arquitecturas basadas en Transformers pueden competir eficazmente en escenarios en tiempo real sin depender de pasos tradicionales de posprocesamiento.

Aspectos destacados de la arquitectura#

RTDETRv2 utiliza una arquitectura con un codificador híbrido y un decodificador Transformer. Al aprovechar los mecanismos de autoatención, el modelo procesa la imagen completa de forma holística, lo que le permite comprender mejor las relaciones espaciales complejas que los kernels convolucionales estrictamente localizados. Una de sus características más definitorias es su diseño nativamente libre de NMS. Al eliminar la supresión no máxima (NMS), RTDETRv2 elimina un cuello de botella habitual que introduce una latencia de inferencia variable durante la implementación.

Puntos fuertes y limitaciones#

La principal fortaleza de RTDETRv2 reside en su capacidad para gestionar objetos densos y superpuestos en escenas complejas. El contexto global proporcionado por las capas de atención Transformer lo hace muy preciso, especialmente en escenarios donde las oclusiones son frecuentes.

Sin embargo, esto tiene un coste computacional. Tradicionalmente, los modelos Transformer requieren más memoria durante el entrenamiento y la inferencia que las CNNs. Además, RTDETRv2 suele necesitar más épocas para converger durante el entrenamiento distribuido, lo que da lugar a ciclos de iteración más largos para los desarrolladores que ajustan conjuntos de datos personalizados.

Aprende más sobre RTDETRv2

YOLOv7: una referencia CNN para la velocidad#

Publicado un año antes que RTDETRv2, YOLOv7 introdujo varias optimizaciones estructurales en el marco YOLO clásico, estableciendo en el momento de su publicación un sólido referente para los detectores en tiempo real basados en CNN.

Aspectos destacados de la arquitectura#

La arquitectura de YOLOv7 se basa en el concepto de Red de agregación de capas eficiente extendida (E-ELAN). Este enfoque optimiza la ruta del gradiente, lo que permite al modelo aprender de forma más eficaz sin aumentar significativamente la complejidad computacional. Los autores también introdujeron un «conjunto entrenable de ventajas gratuitas», un conjunto de métodos que mejoran la precisión del modelo durante el entrenamiento sin afectar a la velocidad de inferencia en dispositivos edge.

Puntos fuertes y limitaciones#

YOLOv7 sigue siendo un modelo muy capaz para tareas estándar de detección de objetos, con velocidades de procesamiento excelentes en GPUs de consumo. Al ser una CNN, normalmente requiere menos memoria CUDA durante el entrenamiento que los modelos basados en Transformers, como RTDETRv2.

A pesar de estas ventajas, YOLOv7 sigue dependiendo de NMS para el posprocesamiento. En entornos con una alta densidad de predicciones, el paso de NMS puede provocar fluctuaciones en el tiempo de procesamiento, lo que dificulta ofrecer garantías estrictas de tiempo real. Además, en comparación con los frameworks modernos, el proceso de gestionar tareas variadas como la segmentación de instancias y la estimación de poses puede estar fragmentado.

Más información sobre YOLOv7

Comparación de rendimiento#

Evaluar estos modelos requiere analizar el delicado equilibrio entre la precisión media promedio (mAP), el número de parámetros y la velocidad de inferencia.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Contexto del rendimiento

Aunque RTDETRv2-x alcanza el mAP más alto, también tiene el mayor número de parámetros y FLOPs. Las variantes más pequeñas, como RTDETRv2-s, ofrecen una velocidad competitiva en TensorRT, pero los usuarios que se dirigen a entornos de bajo consumo sin GPUs dedicadas deben evaluar detenidamente las capacidades de inferencia de la CPU.

La solución moderna: llega YOLO26#

Aunque RTDETRv2 y YOLOv7 fueron fundamentales para ampliar los límites de las aplicaciones de visión por ordenador, el panorama de la IA evoluciona rápidamente. Publicado en enero de 2026, YOLO26 sintetiza los mejores aspectos de la eficiencia de las CNN y de las arquitecturas similares a Transformer libres de NMS.

Para los desarrolladores e investigadores que crean sistemas nuevos, la Ultralytics Platform integrada y el ecosistema Python ofrecen una experiencia unificada que reduce significativamente la deuda técnica.

Innovaciones clave de YOLO26#

  • Diseño de extremo a extremo libre de NMS: YOLO26 es nativamente de extremo a extremo y elimina el posprocesamiento NMS para permitir una implementación más rápida y sencilla. Este enfoque revolucionario se introdujo por primera vez en YOLOv10, garantizando una latencia estable independientemente de la densidad de objetos.
  • Hasta un 43 % más de velocidad de inferencia en CPU: Está optimizado específicamente para la computación en el edge y los dispositivos sin GPUs, por lo que resulta mucho más versátil para implementaciones en campo que los pesados modelos Transformer.
  • Optimizador MuSGD: Una combinación de SGD y Muon (inspirada en Kimi K2 de Moonshot AI) que incorpora innovaciones del entrenamiento de LLM a la visión por ordenador para lograr un entrenamiento más estable y una convergencia más rápida.
  • Eliminación de DFL: Se ha eliminado Distribution Focal Loss, lo que da lugar a un grafo computacional simplificado para una exportación más fluida a NPU integradas y entornos TensorRT.
  • ProgLoss + STAL: Las funciones de pérdida mejoradas proporcionan mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para la robótica, el IoT y el análisis de imágenes aéreas.
  • Mejoras específicas para cada tarea: YOLO26 no sirve únicamente para la detección. Incluye prototipos multiescala para la segmentación, estimación residual de log-verosimilitud (RLE) para el seguimiento de poses y una pérdida de ángulo especializada que aborda los problemas de límites de las cajas delimitadoras orientadas (OBB).

Una experiencia de desarrollo optimizada#

La verdadera ventaja de elegir un modelo de Ultralytics como YOLO26 (o el muy popular YOLO11) es su ecosistema bien mantenido. Entrenar un conjunto de datos personalizado requiere muy poco código repetitivo:

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)

Casos de uso y aplicaciones ideales#

La elección entre estas arquitecturas depende en gran medida del hardware objetivo y de los requisitos operativos específicos.

Cuándo considerar RTDETRv2#

RTDETRv2 es muy eficaz en entornos de procesamiento en servidor equipados con GPUs potentes. Su mecanismo de atención global lo hace adecuado para comprender escenas complejas, como la monitorización de eventos muy concurridos o las imágenes médicas especializadas en las que las características superpuestas requieren un análisis contextual profundo.

Cuándo considerar YOLOv7#

YOLOv7 suele mantenerse en la investigación académica heredada como modelo de referencia para comparaciones. También se encuentra en implementaciones industriales antiguas cuyos pipelines existentes están codificados de forma rígida para versiones específicas de PyTorch y no requieren la flexibilidad multitarea de los frameworks más recientes.

Por qué YOLO26 es el estándar recomendado#

Para infraestructuras modernas de ciudades inteligentes, la navegación de drones y la fabricación de alta velocidad, YOLO26 ofrece un equilibrio inigualable. Sus menores requisitos de memoria hacen que el ajuste de hiperparámetros y el entrenamiento sean accesibles en hardware de consumo, mientras que su inferencia libre de NMS garantiza una ejecución rápida en dispositivos edge con recursos limitados, como la Raspberry Pi o NVIDIA Jetson.

Explora más comparativas

¿Te interesa saber cómo se comparan estos modelos con otras arquitecturas? Consulta nuestras guías detalladas sobre YOLO11 vs. RT-DETR y YOLOv8 vs. YOLOv7 para encontrar la opción ideal para tu proyecto de visión artificial.

Comentarios