Ultralytics YOLO27:
Get Started

RTDETRv2 frente a EfficientDet#

Elegir la arquitectura de red neuronal óptima es una decisión determinante para cualquier proyecto de visión artificial. Esta comparativa técnica exhaustiva analiza dos influyentes modelos de detección de objetos: RTDETRv2, un detector basado en Transformer de última generación, y EfficientDet, una red neuronal convolucional altamente escalable. Evaluaremos sus distintas arquitecturas, métricas de rendimiento, metodologías de entrenamiento y escenarios de despliegue ideales para ayudarte a tomar decisiones fundamentadas en datos para tus canalizaciones de IA.

RTDETRv2: el Transformer de detección en tiempo real#

A partir del éxito del RT-DETR original, RTDETRv2 perfecciona el paradigma de la detección de objetos basada en Transformer. Al optimizar las estructuras del codificador y del decodificador, ofrece una gran precisión y mantiene velocidades de inferencia en tiempo real, lo que reduce eficazmente la brecha entre las CNN tradicionales y los Transformer de visión.

Detalles del modelo

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
  • Organización: Baidu
  • Fecha: 2024-07-24
  • Enlaces: Arxiv, GitHub, Documentación

Arquitectura y puntos fuertes principales#

RTDETRv2 utiliza una arquitectura híbrida que combina una potente red troncal CNN (a menudo ResNet o HGNet) con un decodificador Transformer eficiente. La característica más distintiva de RTDETRv2 es su capacidad nativa para prescindir de la supresión no máxima (NMS). Los detectores tradicionales necesitan NMS para filtrar los cuadros delimitadores duplicados, lo que añade una latencia de inferencia variable durante el posprocesamiento. RTDETRv2 plantea la detección como un problema de predicción directa de conjuntos y utiliza emparejamiento bipartito para generar predicciones únicas.

Este modelo destaca en despliegues en servidores con abundante memoria GPU. Su mecanismo de atención global ofrece una conciencia contextual excepcional y lo hace muy eficaz a la hora de separar objetos superpuestos en entornos densos y desordenados, como los sistemas automatizados de alarma de seguridad o la vigilancia de multitudes numerosas.

Limitaciones#

Aunque son potentes, las arquitecturas Transformer requieren por naturaleza más memoria CUDA durante el entrenamiento que las CNN estándar. Además, el ajuste fino de RTDETRv2 puede requerir tiempos de convergencia prolongados con los datos de entrenamiento, por lo que la creación rápida de prototipos consume algo más de recursos.

Más información sobre RTDETRv2

EfficientDet: CNN escalables y eficientes#

EfficientDet introdujo una familia de modelos de detección de objetos optimizados tanto para la precisión como para la eficiencia, en un amplio abanico de restricciones de recursos. Sigue siendo un ejemplo clásico de diseño escalable de visión artificial.

Detalles del modelo

Arquitectura y puntos fuertes principales#

La innovación de EfficientDet se basa en dos aspectos clave: la red piramidal de características bidireccional (BiFPN) y un método de escalado compuesto. BiFPN permite una extracción de características multiescala sencilla y rápida al introducir pesos aprendibles para determinar la importancia de distintas características de entrada, mientras aplica repetidamente la fusión multiescala de características de arriba abajo y de abajo arriba. El método de escalado compuesto escala de forma uniforme y simultánea la resolución, la profundidad y la anchura de la red.

Los modelos EfficientDet van desde el D0 ultraligero hasta el enorme D7. Esto los hace muy versátiles para despliegues de IA edge en los que los desarrolladores deben equilibrar presupuestos computacionales limitados y requisitos de precisión, como ocurría en las primeras aplicaciones móviles de realidad aumentada.

Limitaciones#

EfficientDet es una arquitectura antigua que depende en gran medida de los cuadros de anclaje y de la canalización tradicional de posprocesamiento NMS. El proceso de generación de anclajes requiere un ajuste cuidadoso de los hiperparámetros, y la etapa NMS puede limitar el rendimiento del despliegue en hardware integrado, como una Raspberry Pi. Tampoco ofrece compatibilidad nativa con tareas modernas, como la estimación de pose o los cuadros delimitadores orientados (OBB).

Más información sobre EfficientDet

Comparativa de rendimiento y métricas#

Para comprender las diferencias exactas entre estos modelos, hay que analizar su rendimiento y eficiencia en cuanto al número de parámetros. La tabla siguiente muestra cómo se compara la moderna serie RTDETRv2 con la escalable familia EfficientDet.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Como se muestra arriba, RTDETRv2 iguala o supera la precisión media promedio (mAP) de modelos EfficientDet de tamaño similar y funciona mucho más rápido en GPU (por ejemplo, 53,4 mAP en 9,76 ms para RTDETRv2-l frente a 52,6 mAP en 89,29 ms para EfficientDet-d6), aprovechando intensamente su arquitectura Transformer para aumentar la precisión.

Casos de uso y recomendaciones#

La elección entre RT-DETR y EfficientDet depende de los requisitos específicos de tu proyecto, las restricciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir RT-DETR#

RT-DETR es una excelente opción para:

  • Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
  • Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
  • Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir EfficientDet#

Se recomienda EfficientDet para:

  • Google Cloud y canalizaciones con TPU: Sistemas profundamente integrados con las API de Google Cloud Vision o con infraestructura TPU, donde EfficientDet cuenta con optimización nativa.
  • Investigación sobre el escalado compuesto: Evaluaciones comparativas académicas centradas en estudiar los efectos del escalado equilibrado de la profundidad, la anchura y la resolución de la red.
  • Implementación móvil mediante LiteRT: Proyectos que requieren específicamente exportar a LiteRT (antes TensorFlow Lite) para Android o dispositivos Linux integrados.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

La alternativa de Ultralytics: avances en el estado del arte#

Aunque tanto RTDETRv2 como EfficientDet tienen grandes ventajas, el desarrollo moderno de IA exige frameworks que ofrezcan una experiencia de desarrollo fluida junto con un rendimiento de vanguardia. El ecosistema Ultralytics proporciona un enfoque mucho más ágil para las tareas de visión artificial.

Si estás explorando la detección más avanzada, el recién lanzado Ultralytics YOLO26 combina lo mejor de las CNN y los transformers.

¿Por qué elegir YOLO26?

YOLO26 implementa un diseño opcional de extremo a extremo sin NMS (nms=False), que aporta a la arquitectura YOLO ultr eficiente la sencillez de despliegue de RTDETRv2. Además, incorpora el optimizador MuSGD, inspirado en las innovaciones del entrenamiento de LLM, para ofrecer una estabilidad superior durante el entrenamiento. Gracias a la eliminación de DFL (se elimina la pérdida focal de distribución para simplificar la exportación y mejorar la compatibilidad con dispositivos periféricos y de bajo consumo), YOLO26 ofrece una inferencia en CPU hasta un 43 % más rápida que las generaciones anteriores, por lo que es una opción excepcional para la computación en el borde frente a modelos más pesados. Además, ProgLoss + STAL ofrece funciones de pérdida mejoradas que aumentan notablemente el reconocimiento de objetos pequeños, algo fundamental para el IoT, la robótica y las imágenes aéreas.

La facilidad de uso que ofrece el paquete Python de Ultralytics no tiene parangón. Los desarrolladores pueden entrenar, validar y exportar modelos mediante una API intuitiva que abstrae el código repetitivo que suelen exigir los repositorios de investigación.

from ultralytics import RTDETR

# Carga un modelo RT-DETR preentrenado del ecosistema Ultralytics
model = RTDETR("rtdetr-l.pt")

# Entrena el modelo con el conjunto de datos COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporta para optimizar la inferencia en TensorRT
model.export(format="engine")

Los modelos de Ultralytics admiten de forma nativa varias tareas, como la segmentación de instancias y la clasificación de imágenes, y ofrecen un conjunto de herramientas versátil para satisfacer diversas necesidades del sector. Además, la eliminación de la pérdida focal de distribución (DFL) en los modelos modernos de Ultralytics simplifica el grafo computacional y garantiza una exportación más fluida a NPU y TPU integradas.

Para facilitar la anotación de datos y la gestión de modelos, la plataforma Ultralytics ofrece un entorno integral en la nube para supervisar todo el ciclo de vida del aprendizaje automático, lo que la convierte en la mejor opción para desplegar en producción soluciones sólidas de visión artificial.

Comentarios