Ultralytics YOLO27:
Get Started

EfficientDet frente a RTDETRv2#

Elegir la arquitectura óptima para proyectos de visión artificial exige orientarse en un panorama diverso de redes neuronales. Esta guía presenta una comparación técnica detallada de dos enfoques distintos: EfficientDet, una familia de redes neuronales convolucionales (CNN) muy escalable, y RTDETRv2, un modelo Transformer de última generación para tiempo real. Evaluamos sus diferencias estructurales, metodologías de entrenamiento y adecuación para la implementación en diversos entornos de hardware.

Al comprender el equilibrio entre la eficiencia de las arquitecturas heredadas y las capacidades de los Transformer modernos, los desarrolladores pueden tomar decisiones fundamentadas. Además, analizaremos cómo alternativas modernas como el nuevo Ultralytics YOLO26 reducen las diferencias al ofrecer una velocidad, precisión y facilidad de uso inigualables.

Comprender EfficientDet#

EfficientDet revolucionó la detección de objetos al introducir un enfoque fundamentado para escalar modelos.

Arquitectura y conceptos básicos#

En esencia, EfficientDet utiliza EfficientNet como red troncal e introduce la red piramidal de características bidireccional (BiFPN). BiFPN facilita una fusión de características multiescala rápida y sencilla mediante pesos aprendibles que determinan la importancia de las distintas características de entrada. Esto se combina con un método de escalado compuesto que escala uniformemente y al mismo tiempo la resolución, la profundidad y la anchura de todas las redes troncales, de características y de predicción de cajas y clases.

Puntos fuertes y limitaciones#

La principal ventaja de EfficientDet es la eficiencia en el uso de parámetros. Cuando se lanzó, modelos como EfficientDet-D0 alcanzaban mayor precisión con menos parámetros y FLOPs que las versiones anteriores de YOLO. Esto lo hacía muy atractivo para entornos con estrictas limitaciones computacionales.

Sin embargo, EfficientDet recurre a la supresión de no máximos estándar (NMS) durante el posprocesamiento para filtrar los cuadros delimitadores superpuestos, lo que puede generar cuellos de botella de latencia en flujos de trabajo en tiempo real. Además, aunque el proceso de entrenamiento está bien documentado, ajustar EfficientDet puede resultar complicado en comparación con la experiencia de desarrollo muy optimizada que ofrecen las herramientas modernas.

Más información sobre EfficientDet

Compatibilidad con sistemas antiguos

Aunque EfficientDet allanó el camino para las redes escalables, implementar estos modelos en NPU modernas suele requerir una amplia optimización manual. Para simplificar las implementaciones, los nuevos modelos Ultralytics ofrecen la función de exportación con un solo clic.

Análisis de RTDETRv2#

RTDETRv2 representa la evolución de las arquitecturas basadas en Transformer y se aleja de los CNN tradicionales basados en anclajes.

Avances en los Transformer#

RTDETRv2 se basa en el modelo de referencia Real-Time Detection Transformer (RT-DETR). Utiliza mecanismos de atención global que permiten al modelo comprender contextos de escena complejos sin las limitaciones localizadas de las convoluciones estándar. Su ventaja arquitectónica más destacada es su diseño nativo sin NMS. Al predecir los objetos directamente a partir de la imagen de entrada, simplifica el flujo de inferencia y evita el ajuste heurístico que requiere el posprocesamiento con NMS.

Puntos fuertes y débiles#

RTDETRv2 destaca en entornos con alta densidad, donde los objetos superpuestos confunden a los CNN tradicionales. Ofrece una gran precisión con conjuntos de datos como COCO, que presentan escenas complejas.

A pesar de su precisión, los modelos Transformer requieren de forma natural una cantidad considerable de memoria. Su eficiencia de entrenamiento es notablemente inferior: necesitan muchas más épocas y una mayor cantidad de memoria CUDA para converger que los CNN. Esto hace que RTDETRv2 sea menos adecuado para desarrolladores con presupuestos limitados para la nube o que necesiten crear prototipos rápidamente.

Más información sobre RTDETRv2

Limitaciones de memoria de los Transformer

Entrenar modelos Transformer como RTDETRv2 suele requerir GPU de gama alta. Si se producen errores por falta de memoria (OOM), plantéate usar modelos que necesiten menos memoria durante el entrenamiento, como los de la serie Ultralytics YOLO.

Comparación de pruebas de rendimiento#

Comprender las métricas de rendimiento sin procesar es esencial para elegir un modelo. La tabla siguiente compara EfficientDet y RTDETRv2 en distintos tamaños.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Casos de uso y recomendaciones#

La elección entre EfficientDet y RT-DETR depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir EfficientDet#

EfficientDet es una buena opción para:

  • Google Cloud y canalizaciones con TPU: Sistemas profundamente integrados con las API de Google Cloud Vision o con infraestructura TPU, donde EfficientDet cuenta con optimización nativa.
  • Investigación sobre el escalado compuesto: Evaluaciones comparativas académicas centradas en estudiar los efectos del escalado equilibrado de la profundidad, la anchura y la resolución de la red.
  • Implementación móvil mediante LiteRT: Proyectos que requieren específicamente exportar a LiteRT (antes TensorFlow Lite) para Android o dispositivos Linux integrados.

Cuándo elegir RT-DETR#

RT-DETR está recomendado para:

  • Investigación en detección basada en Transformer: Proyectos que exploran mecanismos de atención y arquitecturas Transformer para la detección de objetos integral sin NMS.
  • Casos que requieren gran precisión y admiten una latencia flexible: Aplicaciones en las que la precisión de detección es prioritaria y se acepta una latencia de inferencia algo mayor.
  • Detección de objetos grandes: Escenas con objetos principalmente medianos o grandes, en las que el mecanismo de atención global de los Transformer ofrece una ventaja natural.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

La ventaja de Ultralytics: descubre YOLO26#

Aunque EfficientDet y RTDETRv2 ya ocupan un lugar destacado en la historia de la visión artificial, los entornos de producción modernos exigen un equilibrio perfecto entre velocidad, precisión y una experiencia de desarrollo excepcional. Ultralytics YOLO26, lanzado recientemente, combina las mejores características de estas arquitecturas tan distintas.

YOLO26 destaca por combinar los mecanismos internos revolucionarios con el ecosistema optimizado por el que se conoce a Ultralytics.

¿Por qué elegir YOLO26 frente a la competencia?#

  • Diseño de extremo a extremo sin NMS: Inspirado en Transformer como RTDETRv2, YOLO26 ofrece un cabezal opcional de extremo a extremo (nms=False) que elimina el posprocesamiento con NMS y garantiza flujos de implementación más rápidos y sencillos, sin el enorme aumento de parámetros propio de los Transformer puros.
  • Optimizador MuSGD: Inspirado en las innovaciones de entrenamiento de modelos de lenguaje de gran tamaño (como Kimi K2 de Moonshot AI), YOLO26 utiliza una combinación de SGD y Muon. Esto proporciona una estabilidad de entrenamiento sin precedentes y una convergencia mucho más rápida que los prolongados programas de entrenamiento que requiere RTDETRv2.
  • Optimizado para el edge: Con una inferencia en CPU hasta un 43 % más rápida, YOLO26 está diseñado para la IA en el edge. Supera con facilidad a los pesados modelos Transformer en hardware con recursos limitados, como móviles y cámaras inteligentes.
  • Eliminación de DFL: La eliminación de Distribution Focal Loss simplifica el grafo del modelo y facilita exportaciones fluidas a TensorRT y ONNX.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños y resuelven un cuello de botella habitual en imágenes aéreas y robótica.
  • Versatilidad: A diferencia de RTDETRv2, que se centra principalmente en la detección, YOLO26 admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de poses y las cajas delimitadoras orientadas (OBB), con mejoras específicas para cada tarea, como RLE para la estimación de poses y una función de pérdida angular especializada para OBB.
Ecosistema integrado

Con la plataforma Ultralytics, puedes gestionar tus conjuntos de datos, entrenar modelos como YOLO26 o YOLO11 en la nube e implementarlos sin complicaciones mediante API flexibles.

Simplicidad del código con Ultralytics#

La API de Python de Ultralytics, que se mantiene al día, facilita enormemente el entrenamiento y la inferencia de modelos. Los desarrolladores pueden comparar fácilmente modelos o iniciar scripts de entrenamiento con muy poco código repetitivo.

from ultralytics import YOLO

# Carga el modelo YOLO26 más avanzado
model = YOLO("yolo26n.pt")

# Entrena el modelo con tu conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Ejecuta la inferencia en una imagen de prueba
predictions = model.predict("image.jpg")

Para quienes gestionan infraestructuras heredadas, el aclamado Ultralytics YOLOv8 sigue siendo una opción estable y potente, y demuestra la fiabilidad a largo plazo del ecosistema Ultralytics. Tanto si ejecutas algoritmos complejos de seguimiento en tiempo real como si detectas defectos sencillos, actualizar a YOLO26 garantiza que tu sistema esté preparado para el futuro, sea muy preciso y consuma poca memoria.

Comentarios