Ultralytics YOLO27:

RTDETRv2 frente a YOLOv9#

El campo de la visión por computador ha sido testigo de una fascinante divergencia de filosofías arquitectónicas, principalmente entre las redes neuronales convolucionales (CNNs) y los modelos basados en Transformer. Al comparar RTDETRv2 y YOLOv9, los desarrolladores evalúan esencialmente las ventajas y desventajas de los mecanismos de atención global frente a la información de gradiente programable. Ambos modelos representan la cima de sus respectivos paradigmas y amplían los límites de la detección de objetos en tiempo real.

Introducción a los modelos#

RTDETRv2: Transformer de detección en tiempo real#

Desarrollado por investigadores de Baidu, RTDETRv2 se basa en el RT-DETR original e introduce un «Bag-of-Freebies» para mejorar el Transformer de detección en tiempo real de referencia. Aborda el cuello de botella tradicional de los Transformer —la velocidad de inferencia— y los hace viables para aplicaciones en tiempo real.

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
  • Organización: Baidu
  • Fecha: 2024-07-24
  • Enlaces: Arxiv, GitHub

Una característica definitoria de RTDETRv2 es su diseño nativo de extremo a extremo sin NMS. Al eliminar por completo la supresión no máxima (NMS) durante el posprocesamiento, el modelo estabiliza la latencia de inferencia y simplifica la canalización de despliegue. El mecanismo de atención global permite al modelo destacar en la comprensión de escenas complejas y de multitudes densas, ya que evalúa simultáneamente el contexto de toda la imagen.

Aprende más sobre RTDETRv2

YOLOv9: Información de gradiente programable#

YOLOv9, una arquitectura basada en CNN altamente eficiente, aborda el problema del cuello de botella de información inherente a las redes neuronales profundas. Introduce la información de gradiente programable (PGI) y la red de agregación de capas eficiente generalizada (GELAN).

YOLOv9 se basa en los sólidos fundamentos de una red neuronal convolucional, pero maximiza la eficiencia de los parámetros. Al conservar la información crucial durante el proceso feed-forward, garantiza actualizaciones fiables de los pesos, lo que da como resultado un modelo increíblemente ligero y muy preciso. Sin embargo, a diferencia de RTDETRv2, YOLOv9 sigue dependiendo del posprocesamiento NMS estándar.

Más información sobre YOLOv9

Rendimiento y eficiencia de recursos#

Al evaluar estos modelos para producción, es fundamental equilibrar la precisión media promedio (mAP) con el coste computacional. La tabla siguiente muestra su rendimiento en el conjunto de datos MS COCO.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Requisitos de memoria y eficiencia de entrenamiento#

Los Transformer como RTDETRv2 requieren notoriamente mucha memoria durante el entrenamiento y suelen necesitar una cantidad considerable de memoria CUDA y programas de entrenamiento más largos para converger por completo. Por el contrario, las arquitecturas CNN como YOLOv9 y otros modelos Ultralytics YOLO ofrecen un consumo de memoria excepcionalmente menor, lo que permite a los desarrolladores entrenar con tamaños de lote más grandes en hardware de consumo.

Entrenamiento eficiente

Para maximizar el aprovechamiento del hardware, considera utilizar Ultralytics Platform para agilizar el entrenamiento en la nube. Gestiona automáticamente la configuración del entorno y el tamaño óptimo del lote.

La ventaja de Ultralytics: ecosistema y facilidad de uso#

Aunque investigar repositorios independientes, como las páginas oficiales de GitHub de RTDETRv2 o YOLOv9, puede resultar muy educativo, los entornos de producción exigen estabilidad, facilidad de uso y un ecosistema bien mantenido. Integrar estos modelos mediante la API de Python de Ultralytics ofrece una experiencia de desarrollo fluida.

API unificada y versatilidad#

El framework de Ultralytics abstrae las complejidades de la carga de datos, los aumentos y el entrenamiento distribuido. Además, mientras que el RTDETRv2 original se centra estrictamente en la detección, el ecosistema de Ultralytics permite a los usuarios cambiar fácilmente entre detección de objetos, segmentación de instancias y estimación de poses.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model on custom data
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# Easily switch to RT-DETR for complex scene evaluation
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# Export to production-ready formats like TensorRT
model_yolo.export(format="engine")

Con documentación sólida, seguimiento automático de experimentos y capacidades de exportación fluidas a formatos como ONNX, TensorRT y OpenVINO, Ultralytics reduce drásticamente el tiempo entre el prototipo y la producción.

Casos de uso ideales#

Cuándo destaca RTDETRv2#

Gracias a su mecanismo de atención global, RTDETRv2 es una herramienta excepcional para el procesamiento en el lado del servidor y los entornos en los que el contexto global es primordial. Destaca en:

  • Imágenes médicas: Identificación de anomalías sutiles en las que el contexto circundante es fundamental.
  • Vigilancia aérea: Detección de objetos pequeños en imágenes de drones de alta resolución sin los sesgos espaciales de las convoluciones CNN tradicionales.
  • Análisis de multitudes densas: Seguimiento de personas en situaciones en las que una oclusión grave suele confundir a los modelos basados en anclajes.

Cuándo destaca YOLOv9#

YOLOv9 es un referente en despliegues periféricos con recursos limitados. Su eficiencia computacional lo hace ideal para:

  • Robótica: Navegación en tiempo real y evitación de obstáculos cuando se necesita una latencia mínima.
  • IoT para ciudades inteligentes: Despliegue en dispositivos periféricos como NVIDIA Jetson para la monitorización del tráfico.
  • Inspección industrial: Control de calidad en líneas de montaje de alta velocidad que requiere una alta tasa de fotogramas por segundo (FPS).

El futuro: llega Ultralytics YOLO26#

Aunque YOLOv9 y RTDETRv2 representan grandes avances, el panorama ha evolucionado rápidamente. Para los despliegues modernos, el recién lanzado Ultralytics YOLO26 representa la máxima sinergia entre ambas filosofías arquitectónicas.

Al combinar los mejores aspectos de los Transformer y las CNN, YOLO26 establece un nuevo estándar:

  • Diseño de extremo a extremo sin NMS: Al igual que RTDETRv2, YOLO26 es nativo de extremo a extremo y elimina por completo el posprocesamiento NMS para ofrecer canalizaciones de despliegue más rápidas, sencillas y altamente predecibles.
  • Optimizador MuSGD: Inspirado en técnicas de entrenamiento de modelos de lenguaje de gran tamaño (LLM), como las de Kimi K2 de Moonshot AI, YOLO26 utiliza una combinación híbrida de SGD y Muon. Esto aporta una estabilidad de entrenamiento sin precedentes y una convergencia rápida a la visión por computador.
  • Hasta un 43 % más de velocidad en la inferencia en CPU: A diferencia de los Transformer pesados, YOLO26 está altamente optimizado para la computación periférica y los dispositivos sin GPU.
  • Eliminación de DFL: Eliminar la pérdida focal de distribución simplifica drásticamente el grafo del modelo, lo que garantiza una exportación impecable a dispositivos periféricos de bajo consumo y unidades de procesamiento neuronal (NPUs) embebidas.
  • ProgLoss + STAL: Estas funciones de pérdida mejoradas aumentan drásticamente el reconocimiento de objetos pequeños, una característica fundamental para los conjuntos de datos de IoT y aéreos.

Para los equipos que quieran iniciar un nuevo proyecto de visión por computador, recomendamos encarecidamente evaluar YOLO26. Ofrece la elegancia sin NMS de un Transformer, junto con la velocidad extrema y la eficiencia de entrenamiento de una arquitectura YOLO altamente optimizada.

Resumen#

La elección entre RTDETRv2 y YOLOv9 depende en gran medida del hardware de despliegue y de tus necesidades específicas de precisión. RTDETRv2 proporciona una precisión y una comprensión del contexto de última generación para aplicaciones respaldadas por servidores, mientras que YOLOv9 ofrece una eficiencia excepcional para dispositivos periféricos.

Sin embargo, al aprovechar el ecosistema consolidado de Ultralytics, los desarrolladores pueden experimentar fácilmente con ambos. Además, con la introducción de modelos más recientes como YOLO11 y el YOLO26 nativo de extremo a extremo, nunca ha sido tan fácil encontrar el equilibrio perfecto entre inferencia de alta velocidad, compatibilidad versátil con tareas y bajo consumo de memoria.

Comentarios