EfficientDet frente a YOLO11#
Elegir la arquitectura de red neuronal óptima es la base de cualquier aplicación de visión artificial de éxito. Esta guía exhaustiva ofrece una comparación técnica en profundidad entre EfficientDet, de Google, y Ultralytics YOLO11, y analiza sus diferencias arquitectónicas, métricas de rendimiento y escenarios de implementación ideales.
Tanto si buscas una latencia de milisegundos en dispositivos de IA en el perímetro como si necesitas una precisión escalable para la inferencia en la nube, es fundamental entender los matices de estos modelos.
Perfiles de los modelos y detalles técnicos#
Comprender el linaje y la filosofía de diseño subyacente de cada arquitectura ayuda a contextualizar su rendimiento en tareas reales de detección de objetos.
EfficientDet#
Desarrollado por investigadores de Google Brain, EfficientDet presentó un enfoque fundamentado para escalar redes de detección de objetos, junto con la novedosa BiFPN (red piramidal de características bidireccional).
- Autores: Mingxing Tan, Ruoming Pang y Quoc V. Le
- Organización: Google
- Fecha: 2019-11-20
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: https://github.com/google/automl/tree/master/efficientdet
- Documentación: https://github.com/google/automl/tree/master/efficientdet#readme
Más información sobre EfficientDet
YOLO11#
YOLO11 supone una evolución significativa en el ecosistema de Ultralytics y amplía los límites del rendimiento en tiempo real, la eficiencia de los parámetros y el aprendizaje multitarea.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: https://docs.ultralytics.com/models/yolo11
Comparativa arquitectónica#
Las diferencias arquitectónicas entre estos dos modelos ponen de relieve la divergencia entre sus estrategias de diseño a lo largo de los años.
EfficientDet aprovecha la arquitectura troncal EfficientNet e incorpora BiFPN, que permite fusionar características multiescala de arriba abajo y de abajo arriba. Utiliza un método de escalado compuesto que escala uniformemente y de forma simultánea la resolución, la profundidad y la anchura de la arquitectura troncal, la red de características y las redes de predicción de cajas y clases. Aunque resulta muy eficaz para maximizar la precisión media promedio (mAP), el complejo enrutamiento de BiFPN puede limitar en ocasiones el ancho de banda de memoria durante la inferencia.
YOLO11, por su parte, utiliza un módulo C3k2 optimizado y una cabeza de detección avanzada sin anclajes. Este enfoque optimizado reduce la sobrecarga durante la extracción de características. Ultralytics diseñó YOLO11 para maximizar el aprovechamiento del hardware GPU, lo que reduce significativamente los requisitos de memoria tanto durante el entrenamiento como durante la inferencia en comparación con arquitecturas más antiguas o modelos pesados basados en Transformer.
Mientras que EfficientDet es exclusivamente un detector de objetos, YOLO11 destaca por su enorme versatilidad. Una única arquitectura YOLO11 admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de pose y las cajas delimitadoras orientadas (OBB).
Pruebas de rendimiento#
La tabla siguiente compara el rendimiento de ambas familias de modelos a distintas escalas en el conjunto de datos COCO.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Análisis equilibrado: puntos fuertes y débiles#
Aceleración por GPU: YOLO11 domina en entornos con GPU. Por ejemplo, YOLO11m alcanza un mAP del 51,5 % en unos rapidísimos 4,7 ms en una GPU T4 con TensorRT. EfficientDet-d5 tarda 67,86 ms en alcanzar una precisión comparable: más de 14 veces más. Esto pone de relieve el equilibrio entre rendimiento superior de los modelos de Ultralytics para aplicaciones en tiempo real.
Entornos con CPU: las variantes más pequeñas de EfficientDet (como d0 y d1) ofrecen velocidades de inferencia en CPU muy optimizadas con ONNX. Sin embargo, su precisión escala mal y, en las variantes mayores, como d7, se producen grandes penalizaciones de latencia en GPU.
Metodología de entrenamiento y ecosistema#
La experiencia de desarrollo suele ser tan importante como las capacidades teóricas del modelo. Es aquí donde destaca el ecosistema de Ultralytics.
EfficientDet depende en gran medida del antiguo ecosistema de TensorFlow y de complejas bibliotecas de AutoML. Configurar un flujo de entrenamiento personalizado implica una curva de aprendizaje pronunciada, una gestión intrincada de dependencias y la configuración manual de anclajes y funciones de pérdida.
En cambio, Ultralytics ofrece una facilidad de uso sin parangón. Gracias a un ecosistema PyTorch bien mantenido, entrenar un modelo YOLO solo requiere unas pocas líneas de código. El framework gestiona automáticamente, de serie, los aumentos de datos avanzados y la programación de la tasa de aprendizaje, e incluye ajuste de hiperparámetros integrado.
Ejemplo de código: primeros pasos con Ultralytics#
Este fragmento robusto y listo para producción muestra lo sencillo que es entrenar y ejecutar inferencias con la API de Python.
from ultralytics import YOLO
# Carga un modelo YOLO11 pequeño preentrenado
model = YOLO("yolo11s.pt")
# Entrena el modelo con tu conjunto de datos personalizado
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Ejecuta inferencias rápidamente sobre una imagen
results = model.predict("https://ultralytics.com/images/bus.jpg")
results[0].show()Casos de uso ideales#
Cuándo usar EfficientDet: EfficientDet sigue siendo una opción viable para entornos de investigación muy arraigados en flujos de TensorFlow o con limitaciones específicas de CPU, donde las primeras arquitecturas, como d0, ofrecen un rendimiento adecuado.
Cuándo usar YOLO11: YOLO11 es la opción definitiva para las implementaciones empresariales modernas. Su velocidad excepcional lo hace perfecto para los vehículos autónomos, el análisis deportivo en tiempo real y la detección de defectos de fabricación de alto rendimiento. Además, su menor uso de memoria permite implementarlo con flexibilidad en hardware con recursos limitados, como NVIDIA Jetson.
De cara al futuro: la actualización a YOLO26#
Aunque YOLO11 es excepcionalmente capaz, los desarrolladores que empiecen proyectos nuevos deberían evaluar otras arquitecturas de Ultralytics, como la consolidada YOLOv8 o la recién publicada YOLO26. Publicada a principios de 2026, YOLO26 parte de los fundamentos de YOLO11 e incorpora varias innovaciones revolucionarias:
- Diseño integral sin NMS: Basándose en el legado de YOLOv10, YOLO26 puede omitir por completo el posprocesamiento de supresión no máxima (NMS) gracias a su cabeza opcional uno a uno (
nms=False), lo que reduce la latencia y simplifica los flujos de implementación. - Optimizador MuSGD: Un optimizador híbrido que combina SGD estándar con Muon (inspirado en el entrenamiento de modelos de lenguaje de gran tamaño) para mejorar drásticamente la estabilidad del entrenamiento.
- Inferencia en CPU hasta un 43 % más rápida: Las optimizaciones específicas hacen que YOLO26 sea extremadamente eficaz en dispositivos de borde sin GPU dedicada.
- ProgLoss + STAL: Funciones de pérdida avanzadas que mejoran notablemente la detección de objetos pequeños, algo fundamental para las imágenes aéreas y la robótica.
Explora el panorama más amplio de las arquitecturas de visión, incluidos detectores basados en Transformer como RT-DETR, en nuestra documentación completa de Ultralytics.