Ultralytics YOLO27:
Get Started

YOLOv9 frente a YOLOv5#

El campo de la visión artificial ha experimentado un crecimiento enorme, y la detección de objetos es la base de innumerables aplicaciones industriales y de investigación. Elegir la arquitectura adecuada suele requerir una evaluación cuidadosa de la precisión media promedio (mAP), la velocidad de inferencia y el consumo de memoria. En esta comparativa analizamos dos modelos muy influyentes: YOLOv9, reconocido por sus avances arquitectónicos en la conservación de información de gradiente, y Ultralytics YOLOv5, el estándar del sector, probado en producción y conocido por su extraordinaria facilidad de uso y su versatilidad de despliegue incomparable.

Innovaciones arquitectónicas y orígenes técnicos#

Comprender los mecanismos internos de estos dos modelos proporciona un contexto fundamental para entender sus respectivos perfiles de rendimiento.

YOLOv9: información de gradiente programable#

Desarrollado por los investigadores Chien-Yao Wang y Hong-Yuan Mark Liao en el Instituto de Ciencias de la Información de Academia Sinica, en Taiwán, YOLOv9 se publicó el 21 de febrero de 2024. El modelo introduce dos conceptos revolucionarios para abordar el cuello de botella de información habitual en las redes neuronales profundas: la información de gradiente programable (PGI) y la red de agregación de capas eficiente generalizada (GELAN).

Gracias a PGI, YOLOv9 garantiza que la información esencial se conserve durante todo el proceso de propagación hacia delante, lo que permite actualizar los gradientes con gran precisión. Por su parte, la arquitectura GELAN maximiza la eficiencia de los parámetros y permite al modelo alcanzar una precisión de vanguardia con una sobrecarga computacional sorprendentemente baja. Puedes consultar los detalles técnicos en el artículo oficial de YOLOv9 en Arxiv o visitar el repositorio de YOLOv9 en GitHub.

Más información sobre YOLOv9

Ultralytics YOLOv5: el estándar de producción#

Creado por Glenn Jocher y publicado por Ultralytics el 26 de junio de 2020, YOLOv5 revolucionó la accesibilidad de la visión artificial. Como uno de los primeros modelos de detección de objetos desarrollados de forma nativa con el marco PyTorch, evitó las complejidades del antiguo marco C Darknet. YOLOv5 utiliza una red troncal CSPNet muy optimizada y una capa de agregación PANet, priorizando un equilibrio fluido entre velocidad y precisión.

Sin embargo, su mayor logro es su integración en el ecosistema más amplio de Ultralytics. YOLOv5 está muy optimizado para un entrenamiento eficiente y entornos con poca memoria, lo que le aporta una gran estabilidad en los despliegues edge.

Eficiencia de memoria

Al evaluar modelos para dispositivos edge, recuerda que los modelos YOLO de Ultralytics suelen necesitar mucha menos memoria GPU tanto durante el entrenamiento como durante la inferencia que las arquitecturas pesadas basadas en Transformer.

Análisis del rendimiento: velocidad frente a precisión#

Al diseñar una cadena de trabajo de visión artificial, los desarrolladores deben sopesar el equilibrio entre precisión y latencia. La tabla siguiente muestra las diferencias de rendimiento en el conjunto de datos COCO estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7

Análisis de las ventajas e inconvenientes#

YOLOv9 domina claramente en precisión bruta. YOLOv9e lleva el mAP hasta el 55,6 % y aprovecha sus capas GELAN para conservar los detalles más sutiles. Esto lo convierte en una opción excepcional para el diagnóstico por imagen o para situaciones que exigen una gran precisión en objetos pequeños.

Por el contrario, YOLOv5 destaca por su velocidad de despliegue bruta y su flexibilidad de hardware. YOLOv5n (Nano) es famoso por su ligereza y ejecuta inferencias en tan solo 1,12 ms en una GPU T4 mediante TensorRT. Si vas a desplegarlo en dispositivos IoT con recursos limitados, teléfonos móviles o Raspberry Pi, el reducido consumo de memoria de YOLOv5 lo convierte en una opción extraordinariamente fiable.

La ventaja del ecosistema Ultralytics#

Un aspecto importante al elegir un modelo es el ecosistema de software que lo rodea. Aunque YOLOv9 ofrece resultados de investigación de primer nivel, utilizar ambos modelos mediante la moderna API Python de Ultralytics reduce las diferencias y ofrece a los desarrolladores una experiencia unificada y ágil.

Facilidad de uso y exportación#

Ultralytics abstrae los complejos retos de ingeniería. Funciones como la ampliación automática de datos y el ajuste de hiperparámetros están disponibles desde el primer momento. Pasar los modelos a producción también es muy sencillo: basta con utilizar los comandos de exportación integrados para convertirlos a formatos como ONNX, OpenVINO o LiteRT.

Versatilidad en las tareas#

Aunque ambos modelos destacan en la detección de objetos, los modelos modernos de Ultralytics están diseñados para abordar una gran variedad de retos de visión artificial. El marco más amplio ofrece compatibilidad nativa con la clasificación de imágenes, la segmentación de instancias, la estimación de pose y los cuadros delimitadores orientados (OBB), lo que permite a los desarrolladores resolver distintos problemas de visión sin cambiar de base de código.

Casos de uso y recomendaciones#

La elección entre YOLOv9 y YOLOv5 depende de los requisitos específicos del proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una buena opción para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.

Cuándo elegir YOLOv5#

Se recomienda YOLOv5 para:

  • Sistemas de producción probados: despliegues existentes en los que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
  • Entrenamiento con recursos limitados: entornos con recursos de GPU limitados, donde el pipeline de entrenamiento eficiente de YOLOv5 y sus menores requisitos de memoria suponen una ventaja.
  • Amplia compatibilidad con formatos de exportación: proyectos que requieren despliegues en muchos formatos, como ONNX, TensorRT, CoreML y LiteRT.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

Ejemplo de implementación#

Una de las ventajas del ecosistema de Ultralytics es que puedes cambiar entre un modelo YOLOv5 y uno YOLOv9 con solo modificar la cadena de pesos.

from ultralytics import YOLO

# Carga un modelo YOLOv9 preentrenado (cámbialo por "yolov5su.pt" para usar YOLOv5u)
model = YOLO("yolov9c.pt")

# Entrena el modelo de forma eficiente con un conjunto de datos personalizado
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Ejecuta la inferencia en imágenes nuevas
predictions = model.predict("https://ultralytics.com/images/zidane.jpg")

# Exporta a ONNX para una implementación fluida
model.export(format="onnx")

Descubre arquitecturas más recientes#

Aunque YOLOv5 y YOLOv9 son modelos excelentes con ventajas distintas, el campo sigue avanzando. Si estás explorando nuevos proyectos, quizá también quieras evaluar las últimas versiones de Ultralytics.

  • YOLO11: Una evolución potente y refinada de la línea YOLOv8 que ofrece un equilibrio excelente entre velocidad y precisión en todas las tareas de visión.
  • YOLO26: Publicado en 2026, YOLO26 es la recomendación definitiva para las cadenas de trabajo modernas. Incorpora un diseño opcional de extremo a extremo sin NMS (nms=False) que elimina los cuellos de botella del posprocesamiento de NMS. Gracias a la eliminación de DFL (Distribution Focal Loss se elimina para simplificar la exportación y mejorar la compatibilidad con dispositivos edge y de bajo consumo), alcanza hasta un 43 % más de velocidad de inferencia en CPU. El nuevo optimizador MuSGD aumenta la estabilidad del entrenamiento, y ProgLoss + STAL (pérdida progresiva y asignación de etiquetas con reconocimiento de objetivos pequeños) mejoran notablemente el reconocimiento de objetos pequeños, algo fundamental para el IoT, la robótica y las imágenes aéreas. Así, se convierte en la arquitectura más sólida tanto para despliegues edge como en la nube.

Para los equipos que gestionan grandes conjuntos de datos y cadenas de despliegue complejas, la plataforma Ultralytics ofrece una solución sin código para entrenar, hacer seguimiento y desplegar fácilmente estos modelos de vanguardia.

Comentarios