Ultralytics YOLO27:

YOLOv9 frente a EfficientDet#

El campo de la visión por ordenador ha experimentado una rápida evolución en la detección de objetos en tiempo real, mientras los investigadores amplían continuamente los límites de la precisión y la eficiencia. Al crear sistemas de visión robustos, seleccionar la arquitectura óptima es una decisión crucial. Dos modelos muy debatidos en este ámbito son YOLOv9, una iteración avanzada de la familia YOLO centrada en la información de gradiente, y EfficientDet, un marco escalable desarrollado por Google.

Esta guía ofrece un análisis técnico exhaustivo que compara estas dos arquitecturas, examinando sus mecanismos subyacentes, sus métricas de rendimiento y sus escenarios de implementación ideales para ayudarte a tomar una decisión informada para tu próximo proyecto de IA.

Orígenes y especificaciones técnicas de los modelos#

Comprender la trayectoria y la filosofía de diseño de un modelo proporciona un contexto valioso sobre sus decisiones estructurales y aplicaciones prácticas.

YOLOv9: maximización del flujo de información#

Desarrollado para abordar el «cuello de botella de información» del aprendizaje profundo, YOLOv9 introduce métodos novedosos para garantizar que los datos no se pierdan al atravesar redes neuronales profundas.

  • Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
  • Organización: Institute of Information Science, Academia Sinica, Taiwán
  • Fecha: 21 de febrero de 2024
  • Enlaces: Publicación en ArXiv, GitHub oficial

YOLOv9 introduce información de gradiente programable (PGI), un marco de supervisión auxiliar que garantiza que la información de gradiente se conserve de forma fiable en las capas profundas. Esto se combina con la red de agregación de capas eficiente generalizada (GELAN), que optimiza la eficiencia de los parámetros combinando las ventajas de CSPNet y ELAN. Esto permite a YOLOv9 lograr una gran precisión manteniendo una huella ligera adecuada para el procesamiento perimetral en tiempo real.

Más información sobre YOLOv9

EfficientDet: escalado compuesto y BiFPN#

Introducido por Google Brain, EfficientDet aborda la detección de objetos escalando sistemáticamente las dimensiones de la red para equilibrar velocidad y precisión.

EfficientDet se basa en una red troncal EfficientNet combinada con una red piramidal de características bidireccional (BiFPN). BiFPN permite fusionar características multiescala de forma sencilla y rápida. La arquitectura utiliza un método de escalado compuesto que escala uniformemente y de forma simultánea la resolución, la profundidad y la anchura de todas las redes troncales, de características y de predicción de cajas/clases.

Más información sobre EfficientDet

Elige el framework adecuado

Aunque las arquitecturas teóricas son importantes, el ecosistema de software suele determinar el éxito de un proyecto. Ultralytics proporciona una experiencia de usuario optimizada y herramientas de implementación robustas que reducen significativamente el tiempo de comercialización frente a bases de código complejas y orientadas a la investigación.

Comparación de rendimiento y métricas#

Al analizar el rendimiento de los modelos, es esencial equilibrar la precisión con la latencia de inferencia y el coste computacional. La tabla siguiente ilustra las ventajas y desventajas de los distintos tamaños de YOLOv9 y EfficientDet.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Análisis crítico de las métricas#

  1. Umbrales de precisión: YOLOv9e logra la mayor precisión general, con un impresionante 55,6 % de mAP (precisión media promedio), superando al modelo EfficientDet-d7 más pesado (53,7 %) y manteniendo velocidades superiores con TensorRT.
  2. Velocidad en tiempo real: YOLOv9t solo necesita 2,3 ms en una GPU T4 mediante TensorRT, lo que pone de relieve la eficiencia de la arquitectura GELAN para flujos de vídeo de alta velocidad. EfficientDet-d0 funciona rápidamente, pero sacrifica una cantidad considerable de mAP para alcanzar esas velocidades.
  3. Complejidad computacional: EfficientDet escala considerablemente en número de parámetros y FLOPs a medida que aumenta el factor compuesto. La variante d7 alcanza una latencia de 128 ms, lo que la hace más de 10 veces más lenta que los modelos YOLO modernos comparables y restringe considerablemente su uso en entornos de inferencia en tiempo real.

Eficiencia de entrenamiento y ecosistema#

Elegir un modelo implica evaluar el ecosistema de desarrollo. El ecosistema de Ultralytics ofrece una ventaja incomparable en eficiencia de entrenamiento, flexibilidad de implementación y versatilidad general.

La ventaja de Ultralytics#

Los modelos compatibles con el marco de Ultralytics, incluidos YOLOv9, YOLOv8 y YOLO11, se benefician de unos requisitos de memoria drásticamente menores durante el entrenamiento en comparación con las arquitecturas basadas en Transformer o las más antiguas de TensorFlow como EfficientDet. El robusto backend de PyTorch garantiza una convergencia rápida y estabilidad.

Ejemplo de implementación#

Entrenar un modelo avanzado de visión por ordenador no debería requerir cientos de líneas de código repetitivo. Así de fácil es iniciar el entrenamiento con el paquete Python de Ultralytics:

from ultralytics import YOLO

# Load an official Ultralytics model (e.g., YOLO11 or YOLO26)
model = YOLO("yolo11n.pt")

# Train the model natively on a custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained model to ONNX format for deployment
model.export(format="onnx")

Casos de uso ideales y aplicaciones reales#

Los distintos paradigmas estructurales hacen que estos modelos sean adecuados para escenarios diferentes.

Cuándo usar EfficientDet: EfficientDet sigue siendo una opción viable en sistemas heredados profundamente integrados en el ecosistema de TensorFlow, donde migrar a PyTorch no resulta factible. También tiene relevancia histórica en la investigación de análisis de imágenes médicas, donde es aceptable procesar sin conexión y de forma más lenta escaneos de alta resolución.

Cuándo usar YOLOv9: YOLOv9 destaca en entornos que requieren extraer la máxima precisión de las capas profundas sin disparar el número de parámetros. Aplicaciones como la gestión inteligente del tráfico urbano y la supervisión de multitudes de alta densidad se benefician enormemente de la capacidad de PGI para conservar la integridad de las características.

Preparación para el futuro: la próxima generación de IA para visión#

Aunque YOLOv9 y EfficientDet son potentes, los desarrolladores que buscan el equilibrio definitivo entre la velocidad de la computación perimetral, la estabilidad del entrenamiento y la sencillez de implementación deberían prestar atención a las innovaciones más recientes.

Lanzado en enero de 2026, Ultralytics YOLO26 representa el estado del arte actual. Mejora las generaciones anteriores (incluidos YOLO11 y YOLOv8) con varios avances fundamentales:

  • Diseño integral sin NMS: YOLO26 elimina por completo la supresión no máxima, un concepto pionero de YOLOv10, lo que da lugar a una implementación de modelos considerablemente más rápida y sencilla.
  • Eliminación de DFL: se elimina la pérdida focal de distribución para simplificar la exportación y mejorar la compatibilidad con dispositivos periféricos y de bajo consumo.
  • Hasta un 43 % más de velocidad en inferencia con CPU: Perfectamente optimizado para dispositivos IoT y entornos sin GPU dedicadas.
  • Optimizador MuSGD: Una combinación híbrida revolucionaria de SGD y Muon (inspirada en las innovaciones del entrenamiento de LLM), que garantiza una convergencia más rápida y ejecuciones de entrenamiento extraordinariamente estables.
  • ProgLoss + STAL: Funciones de pérdida avanzadas que mejoran drásticamente la detección de objetos pequeños, un factor crítico para las imágenes aéreas captadas por drones y la robótica robusta.

Al aprovechar la completa plataforma de Ultralytics, los equipos pueden gestionar conjuntos de datos, realizar un seguimiento de los experimentos e implementar modelos como YOLO26 fácilmente en diversos ecosistemas de hardware, garantizando que sus flujos de trabajo de visión por ordenador se mantengan a la vanguardia y listos para producción.

Colaboradores

Comentarios