Ultralytics YOLO27:
Get Started

RTDETRv2 frente a YOLOv7#

El panorama de la visión artificial se ha ampliado enormemente en los últimos años, gracias a las continuas innovaciones tanto en las redes neuronales convolucionales (CNNs) como en los Transformer de visión (ViTs). Para elegir la arquitectura adecuada para tu despliegue, debes comprender las sutiles compensaciones entre velocidad, precisión y carga computacional. Esta guía analiza las diferencias técnicas entre dos arquitecturas muy valoradas, RTDETRv2 y YOLOv7, y también destaca los avances modernos disponibles en el más reciente YOLO26 de Ultralytics.

RTDETRv2: el enfoque Transformer para la detección en tiempo real#

RTDETRv2 (Transformer de detección en tiempo real, versión 2) se basa en los fundamentos de su predecesor y demuestra que las arquitecturas basadas en Transformer pueden competir eficazmente en escenarios en tiempo real sin depender de las etapas tradicionales de posprocesamiento.

Aspectos arquitectónicos destacados#

RTDETRv2 utiliza una arquitectura de codificador híbrido y decodificador Transformer. Gracias a los mecanismos de autoatención, el modelo procesa la imagen completa de forma holística, lo que le permite comprender mejor las relaciones espaciales complejas que los núcleos convolucionales estrictamente localizados. Una de sus características más definitorias es su diseño sin NMS nativo. Al eliminar la supresión no máxima (NMS), RTDETRv2 elimina un cuello de botella habitual que introduce una latencia de inferencia variable durante el despliegue.

Puntos fuertes y limitaciones#

La principal fortaleza de RTDETRv2 reside en su capacidad para gestionar objetos densos y superpuestos en escenas complejas. El contexto global que aportan las capas de atención Transformer le confiere una gran precisión, sobre todo en situaciones con oclusiones frecuentes.

Sin embargo, esto tiene un coste computacional. En comparación con las CNN, los modelos Transformer suelen necesitar más memoria durante el entrenamiento y la inferencia. Además, RTDETRv2 suele requerir más épocas para converger durante el entrenamiento distribuido, lo que alarga los ciclos de iteración de los desarrolladores que ajustan conjuntos de datos personalizados.

Más información sobre RTDETRv2

YOLOv7: una base CNN para la velocidad#

Lanzado dos años antes que RTDETRv2, YOLOv7 incorporó varias optimizaciones estructurales al marco YOLO clásico y, en el momento de su publicación, estableció un sólido referente para los detectores en tiempo real basados en CNN.

Aspectos arquitectónicos destacados#

La arquitectura de YOLOv7 se basa en el concepto de red de agregación de capas extendida y eficiente (E-ELAN). Este enfoque optimiza la ruta del gradiente y permite que el modelo aprenda con mayor eficacia sin aumentar significativamente la complejidad computacional. Los autores también introdujeron el conjunto de técnicas «trainable bag-of-freebies», que mejoran la precisión del modelo durante el entrenamiento sin afectar a la velocidad de inferencia en dispositivos periféricos.

Puntos fuertes y limitaciones#

YOLOv7 sigue siendo un modelo muy competente para tareas estándar de detección de objetos y ofrece excelentes velocidades de procesamiento en GPU de consumo. Al ser una CNN, normalmente necesita menos memoria CUDA durante el entrenamiento que los modelos basados en Transformer, como RTDETRv2.

A pesar de estas ventajas, YOLOv7 sigue dependiendo de NMS para el posprocesamiento. En entornos con una alta densidad de predicciones, la etapa de NMS puede causar fluctuaciones en el tiempo de procesamiento y dificultar las garantías estrictas de tiempo real. Además, en comparación con los marcos modernos, la gestión de diversas tareas como la segmentación de instancias y la estimación de pose puede estar fragmentada.

Más información sobre YOLOv7

Comparativa de rendimiento#

Para evaluar estos modelos, hay que analizar el delicado equilibrio entre la precisión media promedio (mAP), el número de parámetros y la velocidad de inferencia.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Contexto del rendimiento

Aunque RTDETRv2-x alcanza el mAP más alto, también tiene el mayor número de parámetros y FLOPs. Las variantes más pequeñas, como RTDETRv2-s, ofrecen una velocidad competitiva en TensorRT, pero los usuarios que se dirijan a entornos de bajo consumo sin GPU dedicada deben evaluar cuidadosamente las capacidades de inferencia en CPU.

La solución moderna: llega YOLO26#

Aunque RTDETRv2 y YOLOv7 fueron fundamentales para ampliar los límites de las aplicaciones de visión artificial, el panorama de la IA evoluciona rápidamente. Lanzado en enero de 2026, YOLO26 combina los mejores aspectos de la eficiencia de las CNN y de las arquitecturas Transformer sin NMS.

Para los desarrolladores e investigadores que crean sistemas nuevos, la plataforma Ultralytics integrada y el ecosistema de Python ofrecen una experiencia unificada que reduce considerablemente la deuda técnica.

Innovaciones clave de YOLO26#

  • Diseño integral sin NMS: YOLO26 es integral de forma nativa y omite el posprocesamiento NMS mediante su cabeza opcional uno a uno (nms=False), lo que permite un despliegue más rápido y sencillo. Este enfoque revolucionario se introdujo por primera vez en YOLOv10 y garantiza una latencia estable independientemente de la densidad de objetos.
  • Inferencia en CPU hasta un 43 % más rápida: Está optimizado específicamente para la computación en el borde y los dispositivos sin GPU, por lo que es mucho más versátil para despliegues sobre el terreno que los modelos Transformer pesados.
  • Optimizador MuSGD: Combinación de SGD y Muon, inspirada en Kimi K2 de Moonshot AI, que lleva las innovaciones de entrenamiento de los LLM a la visión artificial para lograr un entrenamiento más estable y una convergencia más rápida.
  • Eliminación de DFL: Se ha eliminado Distribution Focal Loss, lo que da lugar a un grafo computacional simplificado que facilita la exportación a NPU integradas y entornos TensorRT.
  • ProgLoss + STAL: Las funciones de pérdida mejoradas ofrecen mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para la robótica, el IoT y el análisis de imágenes aéreas.
  • Mejoras específicas para cada tarea: YOLO26 no se limita a la detección. Incorpora prototipos a varias escalas para la segmentación, estimación residual de verosimilitud logarítmica (RLE) para la estimación de pose y una función de pérdida angular especializada que aborda los problemas de límites de las cajas delimitadoras orientadas (OBB).

Una experiencia de desarrollo más sencilla#

La verdadera ventaja de elegir un modelo de Ultralytics como YOLO26 (o el popular YOLO11) es su ecosistema bien mantenido. Para entrenar un conjunto de datos personalizado se necesita muy poco código repetitivo:

from ultralytics import YOLO

# Inicializa el modelo YOLO26 de última generación
model = YOLO("yolo26s.pt")

# Entrena el modelo con el conjunto de datos COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporta sin complicaciones para la implementación en dispositivos periféricos
model.export(format="onnx", dynamic=True)

Casos de uso y aplicaciones ideales#

La elección entre estas arquitecturas depende en gran medida del hardware de destino y de los requisitos operativos específicos.

Cuándo considerar RTDETRv2#

RTDETRv2 es muy eficaz en entornos de procesamiento en servidor equipados con GPU potentes. Su mecanismo de atención global lo hace adecuado para comprender escenas complejas, por ejemplo, para supervisar eventos con grandes aglomeraciones o para aplicaciones especializadas de diagnóstico por imagen en las que las características superpuestas requieren un análisis contextual profundo.

Cuándo plantearse usar YOLOv7#

YOLOv7 suele mantenerse en la investigación académica heredada como modelo de referencia para comparativas. También se encuentra en despliegues industriales antiguos, donde los flujos de trabajo existentes están codificados para versiones específicas de PyTorch y no requieren la flexibilidad multitarea de los marcos más recientes.

Para infraestructuras modernas de ciudades inteligentes, navegación de drones y fabricación de alta velocidad, YOLO26 ofrece un equilibrio inigualable. Sus menores requisitos de memoria permiten realizar ajustes de hiperparámetros y entrenar con hardware de consumo, mientras que su inferencia sin NMS garantiza una ejecución rápida en dispositivos periféricos limitados como Raspberry Pi o NVIDIA Jetson.

Descubre más comparativas

¿Quieres saber cómo se comparan estos modelos con otras arquitecturas? Consulta nuestras guías detalladas sobre YOLO11 frente a RT-DETR y YOLOv8 frente a YOLOv7 para encontrar la opción ideal para tu proyecto de IA visual.

Comentarios