YOLO Vision 2026:

YOLOv9 vs YOLOv5#

El campo de la visión por ordenador ha experimentado un crecimiento tremendo, con la detección de objetos como pilar fundamental para innumerables aplicaciones industriales y de investigación. Elegir la arquitectura adecuada suele requerir una evaluación minuciosa de la precisión media (mAP), la velocidad de inferencia y el consumo de memoria. En esta comparación, exploramos dos modelos de gran influencia: YOLOv9, aclamado por sus avances arquitectónicos en la retención de información de gradiente, y Ultralytics YOLOv5, el estándar de la industria contrastado en combate, conocido por su increíble facilidad de uso y su versatilidad de despliegue sin igual.

Innovaciones arquitectónicas y orígenes técnicos#

Comprender la mecánica subyacente de estos dos modelos proporciona un contexto crítico para sus respectivos perfiles de rendimiento.

YOLOv9: información de gradiente programable#

Desarrollado por los investigadores Chien-Yao Wang y Hong-Yuan Mark Liao en el Instituto de Ciencias de la Información de la Academia Sinica en Taiwán, YOLOv9 se lanzó el 21 de febrero de 2024. El modelo introduce dos conceptos innovadores para abordar el cuello de botella de información común en las redes neuronales profundas: Programmable Gradient Information (PGI) y la red Generalized Efficient Layer Aggregation Network (GELAN).

Al utilizar PGI, YOLOv9 garantiza que la información vital se conserve durante todo el proceso de propagación hacia adelante, lo que da lugar a actualizaciones de gradiente sumamente precisas. Por su parte, la arquitectura GELAN maximiza la eficiencia de los parámetros, permitiendo que el modelo alcance una precisión de vanguardia con un coste computacional sorprendentemente bajo. Puedes explorar los detalles técnicos en el artículo de arXiv de YOLOv9 oficial o consultar el repositorio de GitHub de YOLOv9.

Aprende más sobre YOLOv9

Ultralytics YOLOv5: El estándar de producción#

Creado por Glenn Jocher y lanzado por Ultralytics el 26 de junio de 2020, YOLOv5 revolucionó la accesibilidad de la visión por ordenador. Al ser uno de los primeros modelos de detección de objetos construidos de forma nativa sobre el framework PyTorch, eludió las complejidades del antiguo framework C de Darknet. YOLOv5 aprovecha un backbone CSPNet altamente optimizado y un cuello PANet, priorizando un equilibrio fluido entre velocidad y precisión.

Sin embargo, su mayor logro es su integración en el ecosistema más amplio de Ultralytics. YOLOv5 está altamente optimizado para una rápida eficiencia de entrenamiento y entornos de baja memoria, lo que lo hace increíblemente estable para despliegues en el edge.

Más información sobre YOLOv5

Eficiencia de memoria

Al evaluar modelos para dispositivos de borde, recuerda que los modelos Ultralytics YOLO normalmente exigen una memoria GPU significativamente menor tanto durante el entrenamiento como en la inferencia en comparación con las arquitecturas pesadas basadas en Transformer.

Análisis de rendimiento: Velocidad vs. Precisión#

Al diseñar un pipeline de visión por ordenador, los desarrolladores deben sopesar las compensaciones entre precisión y latencia. La siguiente tabla ilustra las diferencias de rendimiento en el conjunto de datos COCO estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Análisis de las compensaciones#

YOLOv9 establece un dominio absoluto en precisión pura. El modelo YOLOv9e lleva los límites del mAP hasta el 55,6%, utilizando sus capas GELAN para preservar los detalles de grano fino. Esto lo convierte en una opción excepcional para imagen médica o situaciones que exigen una precisión rigurosa en objetos pequeños.

Por el contrario, YOLOv5 destaca por su velocidad de despliegue en bruto y su flexibilidad de hardware. El YOLOv5n (Nano) es famoso por su ligereza, ya que ejecuta inferencias en apenas 1,12 ms en una GPU T4 mediante TensorRT. Si vas a realizar despliegues en dispositivos IoT con limitaciones, teléfonos móviles o Raspberry Pi, la huella de memoria de YOLOv5 lo hace extraordinariamente fiable.

La ventaja del ecosistema Ultralytics#

Una consideración importante al seleccionar un modelo es el ecosistema de software que lo rodea. Aunque YOLOv9 proporciona referencias de investigación de primer nivel, utilizar ambos modelos a través de la moderna API de Python de Ultralytics acorta distancias, ofreciendo a los desarrolladores una experiencia unificada y optimizada.

Facilidad de uso y exportación#

Ultralytics abstrae los obstáculos de ingeniería complejos. Funciones como la aumento de datos automática y el ajuste de hiperparámetros se gestionan de forma nativa. Llevar los modelos a producción resulta igual de trivial, gracias a los comandos de exportación integrados para convertir modelos a los formatos ONNX, OpenVINO o TFLite.

Versatilidad de tareas#

Aunque ambos modelos sobresalen en la detección de objetos, los modelos modernos de Ultralytics están diseñados para afrontar una gran variedad de retos de visión por ordenador. El framework ampliado proporciona compatibilidad nativa con clasificación de imágenes, segmentación de instancias, estimación de pose y cajas delimitadoras orientadas (OBB), lo que permite a los desarrolladores resolver múltiples problemas de visión sin cambiar de base de código.

Casos de uso y recomendaciones#

Elegir entre YOLOv9 y YOLOv5 depende de los requisitos específicos de tu proyecto, las restricciones de implementación y las preferencias del ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una opción sólida para:

  • Investigación del cuello de botella de información: proyectos académicos que estudian arquitecturas de información de gradiente programable (PGI) y redes de agregación de capas eficientes generalizadas (GELAN).
  • Estudios de optimización del flujo de gradiente: investigación enfocada en comprender y mitigar la pérdida de información en capas de red profundas durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: escenarios donde el sólido rendimiento de YOLOv9 en el benchmark COCO es necesario como punto de referencia para comparaciones arquitectónicas.

Cuándo elegir YOLOv5#

YOLOv5 se recomienda para:

  • Sistemas de producción probados: Despliegues existentes donde se valora la larga trayectoria de estabilidad, la extensa documentación y el enorme soporte de la comunidad de YOLOv5.
  • Entrenamiento con recursos limitados: Entornos con recursos de GPU limitados donde la eficiente canalización de entrenamiento de YOLOv5 y sus menores requisitos de memoria son ventajosos.
  • Amplio soporte de formatos de exportación: Proyectos que requieren despliegue en muchos formatos, incluidos ONNX, TensorRT, CoreML y TFLite.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia de desarrollo:

  • Implementación en el borde sin NMS: Aplicaciones que requieren una inferencia consistente y de baja latencia sin la complejidad del posprocesamiento de supresión de no máximos.
  • Entornos solo de CPU: Dispositivos sin aceleración de GPU dedicada, donde la inferencia en CPU hasta un 43% más rápida de YOLO26 proporciona una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios desafiantes como la aerial drone imagery o el análisis con sensores IoT donde ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

Ejemplo de implementación#

La belleza del ecosistema Ultralytics es que puedes cambiar entre un modelo YOLOv5 y un modelo YOLOv9 simplemente cambiando la cadena de pesos.

from ultralytics import YOLO

# Load a pretrained YOLOv9 model (swap to "yolov5s.pt" to use YOLOv5)
model = YOLO("yolov9c.pt")

# Train the model efficiently on a custom dataset
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on new images
predictions = model.predict("https://ultralytics.com/images/zidane.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

Explorando arquitecturas más nuevas#

Si bien YOLOv5 y YOLOv9 son excelentes modelos con ventajas distintas, el campo continúa avanzando. Los usuarios que exploren nuevos proyectos también pueden querer evaluar las últimas iteraciones de Ultralytics.

  • YOLO11: Una evolución potente y refinada de la línea YOLOv8 que ofrece un excelente equilibrio entre velocidad y precisión en todas las tareas de visión.
  • YOLO26: Lanzado en 2026, YOLO26 es la recomendación definitiva para pipelines modernos. Introduce un diseño de extremo a extremo sin NMS, eliminando por completo los cuellos de botella de procesamiento posterior. Con la eliminación de DFL (se elimina la pérdida focal de distribución para una exportación simplificada y una mejor compatibilidad con dispositivos edge y de bajo consumo), alcanza una inferencia en CPU hasta un 43% más rápida. La estabilidad del entrenamiento se ve potenciada gracias al nuevo optimizador MuSGD, y ProgLoss + STAL proporciona funciones de pérdida mejoradas con notables mejoras en el reconocimiento de objetos pequeños, algo fundamental para IoT, robótica e imágenes aéreas, convirtiéndolo en la arquitectura más robusta tanto para despliegues en el edge como en la nube.

Para los equipos que gestionan grandes conjuntos de datos y complejos pipelines de despliegue, utilizar la plataforma de Ultralytics ofrece una solución sin código para entrenar, realizar un seguimiento y desplegar estos modelos de vanguardia sin esfuerzo.

Colaboradores

Comentarios