YOLOv10 frente a EfficientDet#
Seleccionar la red neuronal óptima para la detección de objetos es una decisión crítica que determina el éxito de los sistemas modernos de visión por ordenador. Dos arquitecturas destacadas que han influido significativamente en este campo son YOLOv10 y EfficientDet. Aunque ambas aspiran a maximizar la precisión y minimizar la sobrecarga computacional, adoptan enfoques arquitectónicos muy diferentes para lograr estos objetivos.
Esta guía completa profundiza en sus diseños únicos, metodologías de entrenamiento y características de despliegue, ayudando a desarrolladores e ingenieros de ML a tomar decisiones basadas en datos para aplicaciones de IA para visión. Analizaremos su rendimiento en hardware que va desde dispositivos de IA en el edge integrados hasta potentes GPU en la nube.
YOLOv10: el pionero sin NMS#
Desarrollado para superar los límites de la latencia en tiempo real, YOLOv10 abordó uno de los cuellos de botella más persistentes de la familia YOLO: la supresión no máxima (NMS). Al eliminar este paso de posprocesamiento, el modelo consigue una latencia altamente predecible, algo fundamental para los vehículos autónomos y la robótica de alta velocidad.
Innovaciones arquitectónicas#
YOLOv10 introduce asignaciones duales coherentes para el entrenamiento sin NMS. Durante el entrenamiento, aprovecha asignaciones de etiquetas de uno a muchos y de uno a uno, lo que permite a la red aprender representaciones enriquecidas y, al mismo tiempo, generar de forma nativa una única caja delimitadora óptima por objeto durante la inferencia. La arquitectura también incorpora un diseño integral orientado a la eficiencia y la precisión, simplificando la cabeza de clasificación y reduciendo la redundancia computacional presente en iteraciones anteriores.
Detalles del modelo#
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 2024-05-23
- Artículo: YOLOv10: Detección de objetos de extremo a extremo en tiempo real
- GitHub: THU-MIG/yolov10
- Documentación: Documentación de YOLOv10
Como YOLOv10 elimina el paso de NMS, resulta intrínsecamente más fácil exportarlo a formatos como el formato ONNX y NVIDIA TensorRT sin depender de plugins de ejecución personalizados para filtrar cajas delimitadoras.
Ventajas:
- Inferencia predecible: La eliminación de NMS garantiza tiempos de inferencia coherentes independientemente del número de objetos presentes en la escena.
- Menor uso de memoria: En comparación con modelos basados en Transformer como RT-DETR, YOLOv10 requiere mucha menos memoria tanto durante el entrenamiento como durante la inferencia.
- Excelente equilibrio entre velocidad y precisión: Está optimizado específicamente para escenarios de baja latencia sin sacrificar las métricas de rendimiento.
Desventajas:
- Enfoque en una única tarea: A diferencia del ecosistema de Ultralytics, el repositorio original de YOLOv10 se centra principalmente en la detección y carece de compatibilidad nativa con la segmentación de instancias o la estimación de poses.
EfficientDet: escalable y equilibrado#
Presentado por Google Brain, EfficientDet aborda la detección de objetos desde la perspectiva del escalado sistemático de redes. Se basa en el backbone de clasificación de imágenes EfficientNet e introduce un novedoso mecanismo de fusión de características.
Innovaciones arquitectónicas#
El núcleo de EfficientDet es la red piramidal de características bidireccional (BiFPN), que permite fusionar características multiescala de forma sencilla y rápida. A diferencia de las FPN tradicionales, que solo suman características de arriba abajo, BiFPN introduce conexiones bidireccionales entre escalas y pesos entrenables para aprender la importancia de las distintas características de entrada. Además, EfficientDet utiliza un método de escalado compuesto que escala uniformemente la resolución, la profundidad y la anchura de todas las redes de backbone, de características y de predicción de cajas/clases.
Detalles del modelo#
- Autores: Mingxing Tan, Ruoming Pang y Quoc V. Le
- Organización: Google Brain
- Fecha: 20-11-2019
- Artículo: EfficientDet: Detección de objetos escalable y eficiente
- GitHub: Google AutoML EfficientDet
Ventajas:
- Alta eficiencia: Excelente relación entre parámetros y precisión, lo que hace que las variantes más pequeñas, de
-d0a-d2, sean muy ligeras. - Escalado fundamentado: El escalado compuesto permite elegir fácilmente un tamaño de modelo que se ajuste exactamente a tu presupuesto computacional.
Desventajas:
- Integración con frameworks heredados: La implementación original depende en gran medida de versiones antiguas de TensorFlow, lo que puede complicar las canalizaciones de despliegue modernas.
- Entrenamiento más lento: Entrenar EfficientDet desde cero es conocido por ser muy lento y requiere un ajuste cuidadoso de los hiperparámetros en comparación con la rápida convergencia de las arquitecturas YOLO.
- Velocidad de inferencia: Aunque es eficiente en cuanto al número de parámetros, las complejas operaciones de BiFPN suelen dar lugar a velocidades de inferencia más lentas en situaciones reales sobre hardware estándar que las de los modelos YOLO altamente optimizados.
Más información sobre EfficientDet
Rendimiento y benchmarks#
La verdadera prueba de estos modelos reside en su rendimiento empírico en benchmarks estándar como el conjunto de datos COCO. La tabla siguiente ilustra las diferencias críticas en el número de parámetros, las operaciones de coma flotante (FLOPs) y la latencia de inferencia en GPU NVIDIA T4.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
Como se muestra arriba, YOLOv10 mantiene una ventaja significativa en velocidad de inferencia bruta. Por ejemplo, YOLOv10-S alcanza 46,7 mAP con una latencia de TensorRT de tan solo 2,66 ms, mientras que EfficientDet-d3 consigue un mAP similar de 47,5, pero tarda casi 20 ms, lo que hace que YOLOv10 sea muy superior para la transmisión de vídeo en tiempo real o las líneas de producción de alta velocidad.
Casos de uso y recomendaciones#
La elección entre YOLOv10 y EfficientDet depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una opción sólida para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección integral sin supresión de no máximos, reduciendo la complejidad del despliegue.
- Equilibrios entre velocidad y precisión: Proyectos que requieren un equilibrio sólido entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia coherente: Situaciones de despliegue en las que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir EfficientDet#
EfficientDet se recomienda para:
- Pipelines de Google Cloud y TPU: Sistemas profundamente integrados con las API de Google Cloud Vision o con infraestructuras TPU en las que EfficientDet cuenta con optimización nativa.
- Investigación sobre escalado compuesto: Evaluaciones académicas centradas en estudiar los efectos de escalar de forma equilibrada la profundidad, la anchura y la resolución de la red.
- Implementación móvil mediante TFLite: Proyectos que requieren específicamente exportar a TensorFlow Lite para Android o dispositivos Linux integrados.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
El estándar moderno: llega Ultralytics YOLO26#
Aunque YOLOv10 introdujo el revolucionario paradigma sin NMS y EfficientDet demostró las ventajas del escalado fundamentado, el panorama de la visión por ordenador ha seguido evolucionando. Para los desarrolladores que comienzan nuevos proyectos hoy, Ultralytics YOLO26 representa el estado del arte indiscutible. Lanzado en enero de 2026, combina lo mejor de todos los enfoques en un paquete muy pulido y listo para producción dentro de Ultralytics Platform.
Por qué YOLO26 supera a la competencia#
- Diseño de extremo a extremo sin NMS: YOLO26 adopta de forma nativa la arquitectura de extremo a extremo sin NMS, cuyo pionero fue YOLOv10, simplificando el despliegue y acelerando la inferencia.
- Hasta un 43 % más de velocidad en la inferencia en CPU: Para dispositivos edge sin aceleradores dedicados, YOLO26 está optimizado específicamente para ejecutarse de forma eficiente en CPU estándar.
- Optimizador MuSGD avanzado: Inspirado en las innovaciones del entrenamiento de LLM, YOLO26 utiliza una combinación híbrida de SGD y Muon para lograr un entrenamiento extremadamente estable y una convergencia rápida, mejorando enormemente la eficiencia del entrenamiento frente a EfficientDet.
- ProgLoss + STAL: Estas funciones de pérdida mejoradas ofrecen mejoras notables en el reconocimiento de objetos pequeños, un punto débil tradicional tanto de YOLOv10 como de EfficientDet.
- Eliminación de DFL: Al eliminar Distribution Focal Loss, YOLO26 se exporta sin problemas a prácticamente cualquier formato de hardware, incluidos OpenVINO y CoreML.
Además, YOLO26 ofrece una versatilidad inigualable. Mientras que EfficientDet y YOLOv10 son estrictamente modelos de detección, YOLO26 gestiona sin problemas cajas delimitadoras orientadas, la clasificación de imágenes y la segmentación de instancias utilizando el mismo e intuitivo paquete Python de Ultralytics.
Facilidad de uso con Ultralytics#
El ecosistema bien mantenido que ofrece Ultralytics garantiza una experiencia de desarrollo fluida. Entrenar un modelo, validarlo y exportarlo a la integración con TensorRT solo requiere unas pocas líneas de código.
from ultralytics import YOLO
# Load a pre-trained YOLOv10 model (or upgrade to YOLO26 natively)
model = YOLO("yolov10n.pt")
# Train the model efficiently on a custom dataset
model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference and immediately visualize results
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Export for rapid deployment
model.export(format="engine", quantize=16)Conclusión#
Al comparar YOLOv10 y EfficientDet, la elección depende en gran medida de tus preferencias de framework y tus requisitos de velocidad. EfficientDet ofrece un enfoque estructurado para escalar modelos dentro del ecosistema de TensorFlow. Sin embargo, YOLOv10 proporciona un rendimiento superior en tiempo real, un menor uso de memoria y una ruta de despliegue más sencilla gracias a su arquitectura sin NMS.
Para conseguir el mejor equilibrio absoluto entre rendimiento, facilidad de uso y versatilidad multitarea, recomendamos encarecidamente actualizar a Ultralytics Platform y utilizar YOLO26. Toma las innovaciones sin NMS de YOLOv10, aplica técnicas de entrenamiento de vanguardia como el optimizador MuSGD y las integra en un framework robusto y de código abierto respaldado por una enorme comunidad global.