YOLO11 frente a EfficientDet#
Seleccionar la red neuronal óptima para proyectos de visión artificial requiere un conocimiento profundo de las arquitecturas disponibles. Esta guía ofrece una comparación técnica exhaustiva entre Ultralytics YOLO11 y EfficientDet de Google. Analizaremos sus diferencias arquitectónicas, métricas de rendimiento, eficiencias de entrenamiento y escenarios de implementación ideales para ayudarte a tomar una decisión informada para tus cargas de trabajo de aprendizaje automático.
Contexto y especificaciones de los modelos#
Ambos modelos han tenido un impacto significativo en el ámbito del aprendizaje profundo, aunque proceden de filosofías de diseño y épocas diferentes del desarrollo de la IA.
Detalles de YOLO11#
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: https://docs.ultralytics.com/models/yolo11
Detalles de EfficientDet#
- Autores: Mingxing Tan, Ruoming Pang y Quoc V. Le
- Organización: Google
- Fecha: 20-11-2019
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: https://github.com/google/automl/tree/master/efficientdet
- Documentación: https://github.com/google/automl/tree/master/efficientdet#readme
Más información sobre EfficientDet
Al trabajar con modelos de visión artificial, el ecosistema que los rodea es tan importante como el propio modelo. El ecosistema de Ultralytics ofrece una experiencia de desarrollo incomparable, con documentación extensa, asistencia activa de la comunidad y capacidades de exportación fluidas a formatos como ONNX y TensorRT.
Innovaciones arquitectónicas#
EfficientDet: BiFPN y escalado compuesto#
Presentado a finales de 2019, EfficientDet tenía como objetivo maximizar la precisión y minimizar el coste computacional. Lo consigue principalmente mediante dos mecanismos. En primer lugar, utiliza un backbone EfficientNet que escala de forma conjunta la profundidad, la anchura y la resolución. En segundo lugar, introdujo la red piramidal de características bidireccional (BiFPN), que permite realizar una fusión de características multiescala de forma sencilla y rápida.
Aunque era muy eficiente para su época, la dependencia de EfficientDet de la biblioteca AutoML de TensorFlow puede hacerlo rígido. A los investigadores a menudo les resulta complicado realizar la poda de modelos y modificaciones personalizadas en comparación con los frameworks modernos y modulares basados en PyTorch.
YOLO11: extracción de características mejorada y versatilidad#
YOLO11 representa un avance significativo en las arquitecturas de detección de objetos. Se basa en los logros de sus predecesores e incorpora bloques C3k2 refinados y un módulo de Spatial Pyramid Pooling mejorado. Estas mejoras dan lugar a una extracción de características superior, lo que permite a YOLO11 capturar patrones visuales complejos con una claridad excepcional.
Una de las principales ventajas de YOLO11 es su versatilidad. Mientras que EfficientDet es estrictamente un modelo de detección de objetos, YOLO11 admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de poses y las cajas delimitadoras orientadas (OBB). Además, YOLO11 presume de unos requisitos de memoria increíblemente bajos tanto durante el entrenamiento como durante la inferencia, lo que lo hace muy superior a los modelos antiguos y a los voluminosos transformadores de visión al implementarlo en entornos de IA en el edge con recursos limitados.
Rendimiento y benchmarks#
El equilibrio entre precisión, medida mediante la precisión media promedio (mAP), y velocidad de inferencia es el factor decisivo para las implementaciones en el mundo real. La tabla siguiente muestra el rendimiento bruto de ambas familias de modelos en el conjunto de datos COCO estándar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Como se muestra, YOLO11 logra un equilibrio de rendimiento muy favorable. YOLO11x alcanza la mayor precisión general (54.7 mAP), mientras que las variantes más pequeñas de YOLO11 dominan por completo en velocidad de inferencia en GPU (hasta solo 1,5 ms en una T4 usando TensorRT).
Eficiencia de entrenamiento y ecosistema#
Una de las características distintivas de los modelos de Ultralytics es su facilidad de uso. Entrenar un modelo EfficientDet suele requerir navegar por configuraciones complejas de grafos de TensorFlow y gestionar cadenas de dependencias intrincadas. En marcado contraste, YOLO11 se basa en una base de PyTorch limpia y plenamente moderna.
Este ecosistema bien mantenido permite a los desarrolladores instalar el paquete, cargar un modelo preentrenado y empezar a entrenarlo con un conjunto de datos personalizado usando tan solo unas pocas líneas de código.
Ejemplo de código Python#
A continuación tienes un ejemplo totalmente ejecutable que demuestra la sencillez de la API de Ultralytics. Este script descarga un modelo YOLO11 preentrenado, lo entrena y ejecuta una predicción rápida.
from ultralytics import YOLO
# Initialize a pretrained YOLO11 nano model
model = YOLO("yolo11n.pt")
# Train the model efficiently using the integrated PyTorch engine
# Training efficiency is high, requiring less VRAM than legacy models
results = model.train(data="coco8.yaml", epochs=10, imgsz=640, device="cpu")
# Run real-time inference on a sample image
prediction = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the output bounding boxes
prediction[0].show()De cara al futuro: la ventaja de YOLO26#
Aunque YOLO11 es excepcionalmente potente, los equipos que comiencen proyectos nuevos desde cero deberían considerar seriamente Ultralytics YOLO26, publicado en enero de 2026. YOLO26 representa un cambio de paradigma en la sencillez de implementación y el rendimiento en el edge.
Entre las principales innovaciones de YOLO26 se incluyen:
- Diseño de extremo a extremo sin NMS: Al eliminar la supresión de no máximos (NMS) durante el posprocesamiento, YOLO26 garantiza una latencia ultrabaja y uniforme, algo crucial para la robótica de alta velocidad y la conducción autónoma.
- Hasta un 43 % más de velocidad de inferencia en CPU: Para las implementaciones que no disponen de GPU dedicadas, YOLO26 está optimizado específicamente para maximizar el rendimiento en procesadores estándar.
- Optimizador MuSGD: Inspirado en Kimi K2 de Moonshot AI, este optimizador híbrido aporta estabilidad del entrenamiento de LLM a la visión artificial y permite una convergencia más rápida.
- ProgLoss + STAL: Estas funciones de pérdida mejoradas aumentan drásticamente el reconocimiento de objetos pequeños, que suele ser un punto problemático en el análisis de imágenes por satélite y las imágenes capturadas por drones.
- Eliminación de DFL: La eliminación de Distribution Focal Loss agiliza el proceso de exportación del modelo a dispositivos edge.
Casos de uso y recomendaciones#
La elección entre YOLO11 y EfficientDet depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLO11#
YOLO11 es una opción sólida para:
- Despliegue periférico en producción: aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
- Aplicaciones de visión multitarea: proyectos que requieren detección, segmentación, estimación de pose y OBB dentro de un único framework unificado.
- Prototipado y despliegue rápidos: equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la optimizada API de Python de Ultralytics.
Cuándo elegir EfficientDet#
EfficientDet se recomienda para:
- Pipelines de Google Cloud y TPU: Sistemas profundamente integrados con las API de Google Cloud Vision o con infraestructuras TPU en las que EfficientDet cuenta con optimización nativa.
- Investigación sobre escalado compuesto: Evaluaciones académicas centradas en estudiar los efectos de escalar de forma equilibrada la profundidad, la anchura y la resolución de la red.
- Implementación móvil mediante TFLite: Proyectos que requieren específicamente exportar a TensorFlow Lite para Android o dispositivos Linux integrados.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
Conclusión#
EfficientDet fue una arquitectura pionera que demostró la viabilidad del escalado compuesto en la detección de objetos. Sin embargo, el rápido ritmo de la investigación en IA ha dado lugar a modelos sencillamente más capaces, fáciles de integrar y rápidos de ejecutar.
Gracias a sus sólidas capacidades multitarea, sus increíbles velocidades de inferencia en GPU y una API posiblemente de las más fáciles de usar para desarrolladores del sector, YOLO11 es el claro ganador para los pipelines modernos de visión. Para quienes buscan la tecnología más avanzada, especialmente en implementaciones centradas en el edge, actualizar a YOLO26 ofrece la combinación definitiva de velocidad sin NMS y una precisión inigualable.