EfficientDet frente a YOLOv5#
Elegir la arquitectura de red neuronal óptima es un paso decisivo en cualquier iniciativa de visión artificial. El equilibrio entre la latencia de inferencia, la eficiencia en el uso de parámetros y la precisión de detección determina el rendimiento real del modelo. Esta guía técnica exhaustiva analiza en profundidad dos marcos de detección de objetos muy influyentes: EfficientDet de Google y YOLOv5 de Ultralytics.
Al comparar sus innovaciones arquitectónicas, metodologías de entrenamiento y capacidades de implementación, los desarrolladores pueden tomar decisiones fundamentadas para sus entornos específicos, tanto si escalan en servidores en la nube como si ejecutan los modelos en dispositivos edge con recursos limitados.
EfficientDet: arquitectura escalable con BiFPN#
EfficientDet, presentado por Google Research, se diseñó para escalar sistemáticamente tanto la red troncal como la red de características y lograr una gran precisión con menos parámetros que los modelos anteriores de última generación.
Detalles del modelo#
- Autores: Mingxing Tan, Ruoming Pang y Quoc V. Le
- Organización: Google Research
- Fecha: 20 de noviembre de 2019
- Arxiv: EfficientDet: detección de objetos escalable y eficiente
- GitHub: google/automl/efficientdet
Innovaciones arquitectónicas#
EfficientDet utiliza el modelo de clasificación EfficientNet como red troncal y aplica un método de escalado compuesto que escala uniformemente la anchura, la profundidad y la resolución de la red. Su contribución más destacada a la detección de objetos es la introducción de la red piramidal de características bidireccional (BiFPN). A diferencia de las redes piramidales de características estándar, que simplemente agregan características de arriba abajo, BiFPN permite conexiones complejas y bidireccionales entre escalas e incorpora pesos aprendibles para determinar la importancia de las distintas características de entrada.
Aunque es muy preciso, EfficientDet depende en gran medida del ecosistema TensorFlow y de bibliotecas específicas de AutoML. Esta dependencia puede dificultar la integración en flujos de implementación personalizados y ligeros, o en entornos que favorecen los grafos computacionales dinámicos.
Más información sobre EfficientDet
Ultralytics YOLOv5: democratizar la IA en tiempo real#
Lanzado poco después de EfficientDet, Ultralytics YOLOv5 revolucionó el sector al ofrecer una implementación nativa de la arquitectura YOLO en PyTorch, muy accesible. Estableció un nuevo estándar de experiencia de desarrollo, eficiencia de entrenamiento y flexibilidad de implementación en tiempo real.
Detalles del modelo#
- Autores: Glenn Jocher
- Organización: Ultralytics
- Fecha: 26 de junio de 2020
- GitHub: ultralytics/yolov5
- Documentación: Documentación de YOLOv5
Innovaciones arquitectónicas#
YOLOv5 incorporó importantes mejoras respecto a sus predecesores, con una red troncal CSPDarknet (parcial entre etapas) que mejora considerablemente el flujo del gradiente y reduce el número total de parámetros. Además, YOLOv5 incorpora cajas de anclaje de aprendizaje automático que calculan automáticamente las cajas delimitadoras previas óptimas a partir de tus datos de entrenamiento personalizados, lo que elimina la necesidad de ajustar los hiperparámetros manualmente.
YOLOv5 también utiliza ampliamente el aumento de datos Mosaic, que combina cuatro imágenes distintas en un único mosaico de entrenamiento. Esto mejora enormemente la capacidad del modelo para detectar objetos pequeños y generalizar la comprensión del contexto, lo que le confiere una gran robustez en entornos diversos.
Rendimiento y pruebas de referencia#
Evaluar modelos con pruebas de referencia estándar, como el conjunto de datos COCO, es fundamental para comprender el equilibrio entre precisión y velocidad. La tabla siguiente muestra el rendimiento de distintos tamaños de EfficientDet y YOLOv5 en condiciones estandarizadas.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Análisis de las compensaciones#
EfficientDet-d7 alcanza una impresionante mAP máxima de 53,7, pero sufre una latencia de inferencia considerable en hardware GPU frente a las arquitecturas YOLO. En cambio, YOLOv5 destaca en aceleración por hardware. La variante YOLOv5n logra un tiempo de inferencia extraordinariamente rápido de 1,12 ms en una GPU T4 con NVIDIA TensorRT, por lo que es muy superior para aplicaciones en tiempo real, como la conducción autónoma o las líneas de fabricación de alta velocidad.
Además, los modelos YOLOv5 requieren mucha menos memoria CUDA durante el entrenamiento que las redes complejas con escalado compuesto o los grandes modelos Transformer. Esta reducida huella de memoria democratiza el acceso a la IA de última generación y permite a los investigadores entrenar modelos robustos en hardware de consumo estándar.
Para obtener el máximo de fotogramas por segundo (FPS) de tu modelo YOLOv5 en dispositivos edge, exporta tus pesos de PyTorch a TensorRT para GPU NVIDIA o a OpenVINO para CPU Intel. Este paso puede duplicar la velocidad de inferencia.
Ecosistema de entrenamiento y experiencia de desarrollo#
La verdadera ventaja del ecosistema Ultralytics reside en su experiencia de usuario optimizada. Mientras que EfficientDet requiere un conocimiento profundo de la API de detección de objetos de TensorFlow, YOLOv5 ofrece una API de Python sencilla y coherente.
El ecosistema Ultralytics, que se mantiene activamente, garantiza que los desarrolladores tengan acceso a actualizaciones frecuentes, asistencia de una comunidad activa e integraciones fluidas con herramientas de seguimiento de experimentos como Weights & Biases y ClearML.
Ejemplo de código: primeros pasos con YOLOv5#
Para ejecutar inferencias con un modelo YOLOv5 preentrenado solo necesitas unas pocas líneas de código con el paquete Ultralytics de Python:
from ultralytics import YOLO
# Carga el modelo YOLOv5s de gran eficiencia
model = YOLO("yolov5su.pt") # YOLOv5u: pesos de YOLOv5 sin anclajes para el paquete ultralytics
# Ejecuta la inferencia en una imagen
results = model("https://ultralytics.com/images/zidane.jpg")
# Muestra los cuadros delimitadores detectados
results[0].show()Versatilidad y aplicaciones reales#
EfficientDet es exclusivamente un marco de detección de objetos, lo que limita su utilidad en flujos de trabajo complejos de visión artificial. En cambio, YOLOv5 ha evolucionado para admitir varias tareas de visión artificial. Las versiones modernas del modelo ofrecen compatibilidad con la segmentación de instancias de gran precisión y la clasificación de imágenes, lo que permite a los desarrolladores consolidar su conjunto de herramientas de aprendizaje automático.
Casos de uso ideales#
- EfficientDet: Es más adecuado para el procesamiento sin conexión, la investigación académica y el análisis en la nube, donde se prioriza la precisión máxima frente a la latencia y se dispone de TPU de nivel servidor o GPU con mucha memoria.
- YOLOv5: La opción definitiva para implementaciones de IA edge. La combinación de baja latencia, una huella de parámetros reducida y gran precisión lo hace ideal para el análisis con drones, la automatización del comercio minorista en tiempo real y las aplicaciones móviles mediante CoreML o LiteRT.
La próxima generación: actualización a YOLO26#
Aunque YOLOv5 sigue siendo un modelo robusto y muy utilizado, el campo de la IA evoluciona rápidamente. Para los equipos que empiezan proyectos nuevos o buscan el máximo rendimiento actual, Ultralytics ha presentado YOLO26, lanzado en enero de 2026.
YOLO26 redefine la frontera de Pareto entre velocidad y precisión con cambios arquitectónicos revolucionarios que facilitan la implementación y aceleran la inferencia.
Principales avances de YOLO26#
- Diseño de extremo a extremo sin NMS: El cabezal opcional de extremo a extremo de YOLO26 (
nms=False) elimina el posprocesamiento de supresión de no máximos. Esto simplifica enormemente la lógica de implementación y reduce las variaciones de latencia; se trata de un enfoque revolucionario perfeccionado a partir de los primeros experimentos con YOLOv10. - Hasta un 43 % más de velocidad de inferencia en CPU: Diseñado específicamente para la computación edge y los dispositivos IoT de bajo consumo que funcionan sin GPU dedicada.
- Optimizador MuSGD: Inspirada en las técnicas de entrenamiento de modelos de lenguaje de gran tamaño (como Kimi K2 de Moonshot AI), esta combinación de SGD y Muon traslada las innovaciones de los LLM a la visión artificial y permite una convergencia más rápida y una dinámica de entrenamiento muy estable.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental para la imagen aérea y la robótica.
- Eliminación de DFL: Al eliminar Distribution Focal Loss, se simplifica enormemente el cabezal del modelo y mejora la compatibilidad al exportarlo a hardware edge heredado o muy limitado.
Para los equipos que implementan flujos de trabajo con varias tareas, YOLO26 también incorpora mejoras específicas, como proto multiescala para la segmentación y una función de pérdida angular especializada para los cuadros delimitadores orientados (OBB). También puedes consultar YOLO11 o la arquitectura YOLOv8 para explorar otras alternativas modernas del ecosistema.
Conclusión#
La elección entre EfficientDet y YOLOv5 depende en gran medida del destino de implementación. EfficientDet ofrece un enfoque de escalado matemáticamente elegante, adecuado para la inferencia en la nube. Sin embargo, la mejor experiencia de desarrollo de YOLOv5, sus ciclos de entrenamiento en PyTorch extremadamente rápidos y sus capacidades de implementación edge muy optimizadas lo convierten en la opción preferida para la gran mayoría de aplicaciones reales en tiempo real. Al aprovechar el completo conjunto de herramientas de Ultralytics, los equipos pueden acelerar su llegada al mercado y crear sistemas de IA muy reactivos.