Ultralytics YOLO27:

YOLOv7 frente a RTDETRv2#

El panorama de la visión por ordenador sigue evolucionando rápidamente, muy influido por la competencia entre las Redes neuronales convolucionales (CNNs) y los Transformers de visión (ViTs). Esta comparación técnica analiza en profundidad dos arquitecturas de gran envergadura: YOLOv7, un detector de objetos basado en CNN altamente optimizado, y RTDETRv2, un Transformer de detección en tiempo real de última generación.

Al analizar sus diferencias arquitectónicas, métricas de rendimiento y escenarios de implementación ideales, los desarrolladores pueden tomar decisiones fundamentadas al integrar estos modelos de IA para visión en sus pipelines de producción.

YOLOv7: la arquitectura CNN basada en «bag-of-freebies»#

YOLOv7 introdujo varias optimizaciones estructurales que cambiaron el paradigma de la familia YOLO tradicional, llevando al límite la detección de objetos en tiempo real mediante una serie de «bag-of-freebies entrenables».

Características principales:

Arquitectura y puntos fuertes#

YOLOv7 destaca gracias a su arquitectura Extended Efficient Layer Aggregation Network (E-ELAN). Este diseño estructural permite al modelo aprender características más diversas sin destruir la ruta de gradiente original. Además, incorpora convoluciones reparametrizadas planificadas, que optimizan la velocidad de inferencia sin degradar la precisión. Su enfoque de «bag-of-freebies entrenables» le permite lograr compensaciones impresionantes entre velocidad y precisión, lo que lo hace especialmente adecuado para tareas de detección de objetos en tiempo real en GPUs de categoría servidor.

YOLOv7 también es muy versátil. Además de la detección estándar de cuadros delimitadores, el repositorio ofrece ramas para la estimación de pose y la segmentación de instancias, lo que demuestra su adaptabilidad.

Limitaciones#

Como muchos modelos CNN heredados, YOLOv7 depende de la Supresión no máxima (NMS) para el posprocesamiento. NMS introduce una latencia variable, especialmente en escenas concurridas, lo que puede complicar las garantías estrictas de tiempo real en dispositivos periféricos.

Más información sobre YOLOv7

RTDETRv2: avances en Transformers en tiempo real#

RTDETRv2 se basa en el framework RT-DETR original y demuestra aún más que los Transformers pueden competir con las arquitecturas YOLO en latencia en tiempo real, manteniendo al mismo tiempo una alta precisión espacial.

Características principales:

Arquitectura y puntos fuertes#

RTDETRv2 representa un avance significativo para los Transformers de visión. Utiliza un proceso flexible de selección de consultas y un codificador híbrido eficiente para procesar rápidamente características a varias escalas. Al introducir una nueva «bag-of-freebies» adaptada específicamente para Transformers de detección (DETRs), lleva el razonamiento espacial al límite. Al no necesitar NMS de forma nativa, proporciona tiempos de inferencia deterministas, una característica fundamental para aplicaciones rigurosas de ciudades inteligentes y conducción autónoma.

Limitaciones#

A pesar de sus avances, RTDETRv2 arrastra las limitaciones tradicionales de las arquitecturas basadas en Transformers. Requiere mucha más memoria CUDA durante el entrenamiento y la inferencia que las CNN. Además, sus tiempos de convergencia del entrenamiento son notablemente más largos, por lo que necesita grandes cantidades de datos anotados de alta calidad, como el conjunto de datos COCO, y abundantes recursos computacionales.

Aprende más sobre RTDETRv2

Comparación de rendimiento#

Al comparar estos modelos, debemos analizar una perspectiva global que abarque la precisión, la velocidad de inferencia bruta y la huella computacional. A continuación se muestra una tabla de comparación directa.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Interpretación de los benchmarks

Aunque RTDETRv2-x afirma tener el mAPval absoluto más alto, del 54,3 %, requiere la enorme cantidad de 259 mil millones de FLOPs. Por el contrario, las arquitecturas YOLOv7 ofrecen una excelente línea base, pero sufren la sobrecarga de NMS heredada, que no queda completamente reflejada en las métricas de latencia pura de la red.

La ventaja de Ultralytics: ecosistema y evolución#

Aunque YOLOv7 y RTDETRv2 ofrecen capacidades sólidas, implementarlos en entornos de producción suele revelar dificultades logísticas. Aquí es donde destaca el ecosistema de Ultralytics. Diseñado para una integración fluida de extremo a extremo, el framework de Ultralytics proporciona a los desarrolladores una API unificada que abstrae las complejidades habituales de los pipelines de visión por ordenador.

Versatilidad y eficiencia de memoria incomparables#

A diferencia de los modelos Transformer rígidos que consumen enormes cantidades de VRAM, los modelos YOLO de Ultralytics mantienen una estricta eficiencia de memoria. Esto permite realizar un entrenamiento rápido de modelos con hardware accesible. El ecosistema admite de forma inherente múltiples tareas de visión por ordenador desde una única base de código, incluida la clasificación de imágenes y la detección de cuadros delimitadores orientados (OBB), ofreciendo una flexibilidad de la que RTDETRv2 carece actualmente.

Implementación sin complicaciones#

Pasar de la investigación a la producción requiere opciones de implementación sólidas. La API de Ultralytics gestiona de forma nativa la exportación de modelos con un solo clic a formatos estándar del sector. Tanto si quieres usar ONNX para lograr compatibilidad multiplataforma como TensorRT para maximizar la aceleración de la GPU, el pipeline está completamente automatizado y es fiable.

La actualización definitiva: Ultralytics YOLO26#

Para los desarrolladores que dudan entre YOLOv7 y RTDETRv2, el camino óptimo es en realidad el nuevo estándar de la IA para visión: Ultralytics YOLO26. Lanzado en enero de 2026, YOLO26 cierra la brecha entre la velocidad de las CNN y el razonamiento sofisticado de los Transformers, eliminando por completo sus respectivas debilidades.

YOLO26 introduce innovaciones revolucionarias adaptadas tanto a implementaciones en servidores como en dispositivos periféricos:

  • Diseño de extremo a extremo sin NMS: introducido por primera vez en YOLOv10, YOLO26 elimina de forma nativa el posprocesamiento NMS. Esto garantiza la latencia determinista de RTDETRv2 sin la pesada sobrecarga computacional de un Transformer.
  • Optimizador MuSGD: inspirado en técnicas de entrenamiento de modelos de lenguaje de gran tamaño, como Kimi K2 de Moonshot AI, YOLO26 utiliza una combinación híbrida de SGD y Muon. Esto proporciona una estabilidad de entrenamiento sin precedentes y tiempos de convergencia considerablemente más rápidos que las implementaciones estándar de AdamW utilizadas por los ViTs.
  • ProgLoss + STAL: estas funciones de pérdida avanzadas ofrecen mejoras notables en el reconocimiento de objetos pequeños, compitiendo directamente con las ventajas de las características multiescala de RTDETRv2, algo fundamental para la automatización robótica.
  • Optimización en dispositivos periféricos y eliminación de DFL: Al eliminar la pérdida focal de distribución (DFL), YOLO26 simplifica la cabecera de salida, lo que permite una inferencia en CPU hasta un 43 % más rápida y hace que sea infinitamente más fácil de desplegar en dispositivos periféricos que los pesados modelos Transformer.

Ejemplo de entrenamiento con Ultralytics#

La simplicidad de la API de Ultralytics para Python te permite entrenar el modelo YOLO26 de última generación con solo unas pocas líneas de código:

from ultralytics import YOLO

# Load the highly efficient YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
# The framework automatically manages data augmentation and hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Effortlessly export to TensorRT for deployment
model.export(format="engine", dynamic=True)

Casos de uso ideales#

Elegir la arquitectura adecuada depende en gran medida de las limitaciones de la implementación y de la disponibilidad de hardware:

Cuándo considerar YOLOv7:

  • Proyectos de investigación heredados en los que YOLOv7 es una línea base consolidada.
  • Entornos en los que la aceleración bruta de la GPU es abundante y la variabilidad de la latencia de NMS resulta aceptable.

Cuándo considerar RTDETRv2:

  • Implementaciones en servidores de alta gama que requieren el mAP máximo absoluto.
  • Escenarios en los que se necesita estrictamente una latencia de inferencia determinista (sin NMS), siempre que dispongas de la VRAM necesaria para admitir su backbone Transformer.

Cuándo elegir Ultralytics YOLO26:

  • Casi siempre. Ofrece el determinismo sin NMS de RTDETRv2, supera la velocidad y precisión de YOLOv7, utiliza mucha menos VRAM y está completamente integrado en la Ultralytics Platform para gestionar conjuntos de datos, entrenamiento e implementación sin esfuerzo.
Explora más modelos

¿Te interesa saber cómo se comparan otras arquitecturas? Explora nuestros análisis detallados de generaciones anteriores, como YOLO11 y YOLOv8, o aprende a utilizar el ajuste de hiperparámetros para maximizar la precisión de tu proyecto.

Comentarios