Ultralytics YOLO27:

Comparativa entre EfficientDet y YOLOv9#

El panorama de la visión por ordenador se ha visto impulsado por avances continuos en el diseño de redes neuronales. Encontrar el equilibrio adecuado entre la eficiencia computacional y la precisión de detección es fundamental al seleccionar un modelo. El EfficientDet de Google estableció un sólido referente en 2019 al introducir arquitecturas escalables, mientras que YOLOv9, lanzado en 2024, amplió los límites de la detección de objetos mediante la Información de gradiente programable (PGI).

Esta guía ofrece una comparación técnica exhaustiva entre estos dos modelos e introduce el moderno framework Ultralytics YOLO26, que proporciona una solución sólida e integral optimizada para entornos de producción.

Arquitecturas e innovaciones de los modelos#

Comprender los mecanismos subyacentes de EfficientDet y YOLOv9 es esencial para determinar sus casos de uso óptimos.

EfficientDet: escalado compuesto y BiFPN#

Desarrollado por Google Research, EfficientDet se centra en el escalado sistemático y la fusión eficiente de características. Utiliza EfficientNet como backbone e introduce una novedosa arquitectura de red de características.

  • Autores: Mingxing Tan, Ruoming Pang y Quoc V. Le
  • Organización: Google
  • Fecha: 20 de noviembre de 2019
  • Enlaces: Arxiv, GitHub

Características arquitectónicas clave: EfficientDet depende en gran medida de una Red piramidal de características bidireccional (BiFPN), que permite fusionar características multiescala de forma sencilla y rápida. Además, utiliza un método de escalado compuesto que escala uniformemente la resolución, la profundidad y la anchura de la red. Aunque fue muy preciso en su época, EfficientDet está estrechamente ligado a entornos antiguos de TensorFlow, lo que complica las canalizaciones de despliegue modernas.

Más información sobre EfficientDet

YOLOv9: resolviendo el cuello de botella de información#

Desarrollado por investigadores de Academia Sinica, YOLOv9 aborda la degradación de la información a medida que los datos atraviesan redes neuronales profundas.

  • Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
  • Organización: Institute of Information Science, Academia Sinica
  • Fecha: 21 de febrero de 2024
  • Enlaces: Arxiv, GitHub, Documentación

Características arquitectónicas clave: YOLOv9 introduce la Información de gradiente programable (PGI) para proporcionar supervisión auxiliar y garantizar que los datos cruciales se conserven para actualizar los pesos de la red de forma fiable. También incorpora la Red generalizada de agregación eficiente de capas (GELAN) para maximizar la eficiencia de los parámetros. A pesar de estos avances, YOLOv9 todavía requiere la supresión no máxima (NMS) durante el posprocesamiento, lo que añade latencia.

Más información sobre YOLOv9

Comparación de rendimiento#

Al evaluar estos modelos, analizar datos empíricos ayuda a determinar qué arquitectura ofrece la mejor compensación para tus requisitos de hardware específicos.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Análisis crítico#

YOLOv9 ofrece un salto generacional en velocidad. Por ejemplo, YOLOv9e alcanza un 55.6% de mAP con una latencia de TensorRT de 16.77ms. En marcado contraste, EfficientDet-d7 ofrece un mAP inferior, del 53.7 %, pero sufre una latencia enorme (128.07ms), lo que dificulta enormemente su despliegue para flujos de vídeo en tiempo real.

Exportación de modelos para producción

Exportar tu arquitectura a formatos optimizados como TensorRT u OpenVINO reduce drásticamente los tiempos de inferencia en comparación con las ejecuciones directas en PyTorch.

Casos de uso y recomendaciones#

La elección entre EfficientDet y YOLOv9 depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir EfficientDet#

EfficientDet es una buena opción para:

  • Pipelines de Google Cloud y TPU: Sistemas profundamente integrados con las API de Google Cloud Vision o con infraestructuras TPU en las que EfficientDet cuenta con optimización nativa.
  • Investigación sobre escalado compuesto: Evaluaciones académicas centradas en estudiar los efectos de escalar de forma equilibrada la profundidad, la anchura y la resolución de la red.
  • Implementación móvil mediante TFLite: Proyectos que requieren específicamente exportar a TensorFlow Lite para Android o dispositivos Linux integrados.

Cuándo elegir YOLOv9#

YOLOv9 se recomienda para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradientes: Investigación centrada en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Escenarios en los que se necesita el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO como punto de referencia para comparar arquitecturas.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

La ventaja de Ultralytics: elige YOLO26#

Aunque YOLOv9 y EfficientDet allanaron el camino, los desarrolladores que buscan un framework verdaderamente moderno y listo para producción deberían considerar los modelos Ultralytics YOLO, concretamente el recién lanzado YOLO26.

La plataforma Ultralytics ofrece una facilidad de uso sin parangón, combinando potentes scripts de entrenamiento local con una interfaz habilitada para la nube. YOLO26 representa una revisión completa del diseño de modelos, dejando obsoletas las arquitecturas antiguas para muchas aplicaciones comerciales.

Aspectos técnicos destacados de YOLO26#

  • Diseño integral sin NMS: YOLO26 elimina por completo los cuellos de botella del posprocesamiento. Al eliminar la supresión no máxima, los grafos de despliegue se unifican y son intrínsecamente más rápidos en chips de IA periférica.
  • Hasta un 43 % más rápido en inferencia con CPU: Está ampliamente optimizado para dispositivos integrados, por lo que es considerablemente más rápido que YOLOv9 y EfficientDet cuando no hay GPU disponibles.
  • Optimizador MuSGD: Al integrar innovaciones de los LLM en la IA de visión, este optimizador híbrido estabiliza las ejecuciones de entrenamiento y permite que los modelos converjan más rápido con menos recursos.
  • Bajos requisitos de memoria: A diferencia de las arquitecturas con muchos Transformer o las CNN sin optimizar, YOLO26 minimiza el consumo de memoria CUDA durante el entrenamiento, lo que te permite utilizar tamaños de lote mayores en hardware de consumo.
  • ProgLoss + STAL: Un diseño superior de la función de pérdida aumenta drásticamente la precisión al detectar objetos pequeños, lo que convierte a YOLO26 en una opción ideal para imágenes aéreas y redes IoT.
  • Eliminación de DFL: El diseño estructural simplificado permite convertir sin complicaciones a formatos de despliegue móvil.

Otras opciones sólidas del ecosistema Ultralytics son YOLO11 y YOLOv8, que también ofrecen versatilidad multitarea, como la segmentación de instancias y la estimación de poses.

Entrenamiento simplificado con el SDK de Python#

Los modelos de Ultralytics priorizan la experiencia del desarrollador. Entrenar un modelo de última generación se reduce a unas pocas líneas de Python.

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26n.pt")

# Train with optimized memory usage and built-in augmentations
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate the model's performance easily
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")

Aplicaciones en el mundo real#

La elección entre estas arquitecturas depende en gran medida de tu objetivo de despliegue.

  • Despliegues en la nube heredados: EfficientDet era popular para el procesamiento por lotes sin conexión basado en la nube, cuando se necesitaba una gran precisión y no existían limitaciones estrictas de tiempo real.
  • Investigación académica: YOLOv9 sigue siendo una opción interesante para investigadores que amplían los límites teóricos de las CNN y analizan los flujos de gradiente a través de las capas de la red.
  • Computación periférica e IoT: YOLO26 domina las aplicaciones del mundo real. Su canalización sin NMS y sus capacidades de caja delimitadora orientada (OBB) lo convierten en la opción superior para el análisis del tráfico en ciudades inteligentes, la supervisión del inventario minorista y la inspección mediante drones, ya que ofrece un equilibrio insuperable entre una alta precisión y velocidades de inferencia rápidas.
Colaboradores

Comentarios