Ultralytics YOLO27:

RTDETRv2 frente a EfficientDet#

Seleccionar la arquitectura de red neuronal óptima es una decisión determinante para cualquier proyecto de visión por ordenador. Esta completa comparación técnica analiza en profundidad dos influyentes modelos de detección de objetos: RTDETRv2, un detector basado en Transformer de última generación, y EfficientDet, una red neuronal convolucional altamente escalable. Evaluaremos sus distintas arquitecturas, métricas de rendimiento, metodologías de entrenamiento y escenarios de implementación ideales para ayudarte a tomar decisiones basadas en datos para tus pipelines de IA.

RTDETRv2: el Transformer de detección en tiempo real#

Basándose en el éxito del RT-DETR original, RTDETRv2 perfecciona el paradigma de detección de objetos basado en Transformer. Al optimizar las estructuras del codificador y el decodificador, ofrece una gran precisión manteniendo velocidades de inferencia en tiempo real, lo que permite salvar eficazmente la distancia entre las CNN tradicionales y los Transformers de visión.

Detalles del modelo

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang y Yi Liu
  • Organización: Baidu
  • Fecha: 2024-07-24
  • Enlaces: Arxiv, GitHub, Documentación

Arquitectura y puntos fuertes principales#

RTDETRv2 utiliza una arquitectura híbrida que combina un potente backbone CNN (normalmente ResNet o HGNet) con un decodificador Transformer eficiente. La característica más destacada de RTDETRv2 es su capacidad nativa para prescindir de la supresión no máxima (NMS). Los detectores tradicionales necesitan NMS para filtrar los cuadros delimitadores duplicados, lo que añade una latencia de inferencia variable durante el posprocesamiento. RTDETRv2 formula la detección como un problema de predicción directa de conjuntos y utiliza una correspondencia bipartita para generar predicciones únicas.

Este modelo destaca en implementaciones en servidores donde la memoria de la GPU es abundante. Su mecanismo de atención global proporciona una conciencia contextual excepcional, lo que lo hace especialmente eficaz para separar objetos superpuestos en entornos densos y saturados, como los sistemas automatizados de alarma de seguridad o la monitorización de grandes multitudes.

Limitaciones#

Aunque son potentes, las arquitecturas Transformer requieren intrínsecamente más memoria CUDA durante el entrenamiento que las CNN estándar. Además, ajustar RTDETRv2 puede requerir tiempos de convergencia más largos con los datos de entrenamiento, lo que hace que la creación rápida de prototipos consuma ligeramente más recursos.

Aprende más sobre RTDETRv2

EfficientDet: CNN escalables y eficientes#

EfficientDet introdujo una familia de modelos de detección de objetos optimizados tanto para la precisión como para la eficiencia en un amplio abanico de limitaciones de recursos. Sigue siendo un ejemplo clásico de diseño de visión artificial escalable.

Detalles del modelo

Arquitectura y puntos fuertes principales#

La innovación de EfficientDet se basa en dos áreas clave: la red piramidal de características bidireccional (BiFPN) y un método de escalado compuesto. BiFPN permite una extracción de características multiescala sencilla y rápida mediante la introducción de pesos aprendibles que determinan la importancia de las distintas características de entrada, al tiempo que aplica repetidamente una fusión de características multiescala de arriba abajo y de abajo arriba. El método de escalado compuesto ajusta simultáneamente y de forma uniforme la resolución, la profundidad y la anchura de la red.

Los modelos EfficientDet van desde el D0 ultraligero hasta el enorme D7. Esto los hace muy versátiles para implementaciones de IA en el edge, donde los desarrolladores deben equilibrar presupuestos computacionales ajustados con requisitos de precisión, como en las primeras aplicaciones móviles de realidad aumentada.

Limitaciones#

EfficientDet es una arquitectura más antigua que depende en gran medida de los anchor boxes y del pipeline tradicional de posprocesamiento NMS. El proceso de generación de anchors requiere un ajuste cuidadoso de hiperparámetros, y la etapa NMS puede convertirse en un cuello de botella al implementar el modelo en hardware integrado como una Raspberry Pi. Además, carece de compatibilidad nativa con tareas modernas como la estimación de poses o los cuadros delimitadores orientados (OBB).

Más información sobre EfficientDet

Comparación de rendimiento y métricas#

Para comprender las ventajas y desventajas exactas entre estos modelos, es necesario analizar su rendimiento y la eficiencia de sus parámetros. La tabla siguiente muestra cómo se compara la moderna serie RTDETRv2 con la familia escalable EfficientDet.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Como se muestra arriba, RTDETRv2 alcanza una precisión media promedio (mAP) significativamente mayor con un número de parámetros comparable al de los modelos EfficientDet de gama media, gracias en gran medida al uso de su arquitectura Transformer para aumentar la precisión.

Casos de uso y recomendaciones#

La elección entre RT-DETR y EfficientDet depende de los requisitos específicos de tu proyecto, las limitaciones de la implementación y tus preferencias de ecosistema.

Cuándo elegir RT-DETR#

RT-DETR es una buena opción para:

  • Investigación sobre detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos de extremo a extremo sin NMS.
  • Escenarios de alta precisión con latencia flexible: Aplicaciones en las que la precisión de detección es la máxima prioridad y se acepta una latencia de inferencia ligeramente superior.
  • Detección de objetos grandes: Escenas compuestas principalmente por objetos medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir EfficientDet#

EfficientDet se recomienda para:

  • Pipelines de Google Cloud y TPU: Sistemas profundamente integrados con las API de Google Cloud Vision o con infraestructuras TPU en las que EfficientDet cuenta con optimización nativa.
  • Investigación sobre escalado compuesto: Evaluaciones académicas centradas en estudiar los efectos de escalar de forma equilibrada la profundidad, la anchura y la resolución de la red.
  • Implementación móvil mediante TFLite: Proyectos que requieren específicamente exportar a TensorFlow Lite para Android o dispositivos Linux integrados.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La alternativa de Ultralytics: avances de última generación#

Aunque tanto RTDETRv2 como EfficientDet ofrecen ventajas importantes, el desarrollo moderno de IA exige frameworks que proporcionen una experiencia de desarrollo fluida junto con un rendimiento de vanguardia. El ecosistema de Ultralytics ofrece un enfoque mucho más optimizado para las tareas de visión por ordenador.

Si estás explorando la detección de última generación, el recién publicado Ultralytics YOLO26 sintetiza los mejores aspectos de las CNN y los Transformers.

¿Por qué elegir YOLO26?

YOLO26 implementa un diseño de extremo a extremo sin NMS, incorporando la sencillez de implementación de RTDETRv2 a la arquitectura YOLO ultr eficiente. Además, introduce el optimizador MuSGD, inspirado en las innovaciones del entrenamiento de LLM, para lograr una mayor estabilidad durante el entrenamiento. Gracias a la eliminación de DFL (se elimina Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos edge y de bajo consumo), YOLO26 ofrece hasta un 43 % más de velocidad de inferencia en CPU que las generaciones anteriores, lo que lo convierte en una opción excepcional para la computación en el edge frente a modelos más pesados. Además, ProgLoss + STAL proporciona funciones de pérdida mejoradas, con avances notables en el reconocimiento de objetos pequeños, algo fundamental para IoT, la robótica y las imágenes aéreas.

La facilidad de uso que ofrece el paquete Python de Ultralytics no tiene rival. Los desarrolladores pueden entrenar, validar y exportar modelos mediante una API intuitiva que abstrae el código repetitivo que normalmente requieren los repositorios de investigación.

from ultralytics import RTDETR

# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export for optimized inference on TensorRT
model.export(format="engine")

Los modelos de Ultralytics admiten de forma nativa varias tareas, entre ellas la segmentación de instancias y la clasificación de imágenes, lo que proporciona un kit de herramientas versátil para las distintas necesidades del sector. Además, la eliminación de Distribution Focal Loss (DFL) en los modelos modernos de Ultralytics simplifica el grafo computacional y garantiza una exportación más fluida a NPU y TPU integradas.

Para una anotación de datos y una gestión de modelos fluidas, la plataforma de Ultralytics proporciona un entorno integral en la nube para supervisar todo el ciclo de vida del machine learning, lo que la convierte en la opción principal para implementar soluciones sólidas de visión por ordenador en producción.

Comentarios