YOLOv9 frente a YOLOv8#
El panorama de la visión artificial en tiempo real ha evolucionado de forma notable en los últimos años, y cada nuevo modelo amplía los límites teóricos de lo que es posible tanto en dispositivos de borde como en servidores en la nube. Al comparar la arquitectura más reciente de YOLOv9 con el popular marco de trabajo Ultralytics YOLOv8, los desarrolladores suelen tener que elegir entre rutas de gradiente teóricas de vanguardia y un ecosistema ampliamente probado y listo para producción.
Esta guía completa compara estos dos pesos pesados: analiza sus innovaciones arquitectónicas, métricas de rendimiento y escenarios de despliegue ideales para ayudarte a elegir el modelo adecuado para tu próximo proyecto de inteligencia artificial.
Especificaciones técnicas y autoría#
Comprender el linaje de estos modelos aporta un contexto esencial para entender sus respectivas decisiones de diseño.
YOLOv9 Creado por Chien-Yao Wang y Hong-Yuan Mark Liao en el Instituto de Ciencias de la Información de la Academia Sinica de Taiwán, YOLOv9 se lanzó el 21 de febrero de 2024. La investigación se centra principalmente en resolver el cuello de botella de información de las redes neuronales profundas. Puedes consultar el artículo de investigación original de YOLOv9 en arXiv o ver el código fuente en el repositorio oficial de YOLOv9 en GitHub.
Ultralytics YOLOv8 Desarrollado por Glenn Jocher, Ayush Chaurasia y Jing Qiu en Ultralytics, YOLOv8 se lanzó el 10 de enero de 2023. Se consolidó como un estándar del sector por su versatilidad y ofrece una API unificada para una gran variedad de tareas de visión. El código fuente se mantiene en el repositorio principal de Ultralytics en GitHub, lo que garantiza actualizaciones continuas y estabilidad a largo plazo.
Innovaciones arquitectónicas#
YOLOv9: información de gradiente programable#
La característica distintiva de YOLOv9 es la incorporación de la información de gradiente programable (PGI) y la red de agregación de capas eficiente generalizada (GELAN). A medida que las redes neuronales convolucionales se hacen más profundas, suelen perder información esencial de las características durante el proceso de propagación hacia delante. PGI aborda este cuello de botella de información conservando gradientes precisos para actualizar los pesos y garantizar una extracción fiable de características. Esta arquitectura maximiza la eficiencia de los parámetros y permite que YOLOv9 alcance una gran precisión con menos operaciones de coma flotante (FLOPs).
YOLOv8: el modelo versátil y todoterreno#
YOLOv8 introdujo un mecanismo de detección optimizado y sin anclajes que reduce el número de predicciones de cajas y acelera la supresión no máxima (NMS) durante el posprocesamiento. Su módulo C2f (cuello de botella parcial entre etapas con dos convoluciones) mejora el flujo de gradientes por la red en comparación con los modelos anteriores. Y lo que es más importante, YOLOv8 se diseñó pensando en la versatilidad y admite de forma nativa la detección de objetos, la segmentación de instancias, la estimación de poses, la clasificación de imágenes y la extracción de cajas delimitadoras orientadas (OBB), todo ello de serie.
Aunque YOLOv9 ofrece métricas de detección excepcionales sin ajustes adicionales, integrarlo de forma nativa en flujos de trabajo complejos puede ser difícil. Utilizar YOLOv9 a través del marco de trabajo de Ultralytics resuelve este problema y permite acceder a nuestras sólidas herramientas de exportación y despliegue.
Equilibrio de rendimiento y benchmarks#
La relación entre velocidad y precisión es el factor más importante al desplegar modelos de visión. A continuación se muestra una comparativa detallada del tamaño de los modelos, la latencia y la precisión media promedio, evaluada en el conjunto de datos estándar COCO.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
Al analizar las métricas, YOLOv9 destaca por su relación entre parámetros y precisión. El modelo YOLOv9c alcanza un impresionante 53,0 % de mAP con solo 25,5 millones de parámetros. Sin embargo, YOLOv8 aventaja claramente a YOLOv9 en requisitos de memoria y velocidad de inferencia en aceleradores de hardware; en particular, la variante YOLOv8n registra 1,47 ms en una configuración con NVIDIA TensorRT.
La ventaja del ecosistema Ultralytics#
Al elegir una arquitectura, hay que tener muy en cuenta la facilidad de uso y el ecosistema de software que la rodea. Gestionar dependencias, escribir cargadores de datos personalizados y ocuparse de scripts de exportación complejos puede ralentizar el desarrollo. El ecosistema integrado de Ultralytics se encarga de estas complejidades.
Tanto si eliges YOLOv8 como YOLOv9 (totalmente compatible con la biblioteca de Ultralytics), contarás con una API unificada, técnicas de aumento de datos automáticas y una exportación simplificada al formato ONNX. Además, las arquitecturas de Ultralytics suelen ofrecer una eficiencia de entrenamiento muy optimizada y evitan el enorme consumo de memoria CUDA que suele asociarse a los modelos grandes basados en Transformer.
Ejemplo de código de entrenamiento#
Entrenar cualquiera de los dos modelos con la API de Python es sencillo y solo requiere unas pocas líneas de código.
from ultralytics import YOLO
# Cargar el modelo preferido (cambia 'yolov9c.pt' por 'yolov8n.pt' según sea necesario)
model = YOLO("yolov8n.pt")
# Entrena el modelo con tu conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validar las métricas de rendimiento del modelo
metrics = model.val()
# Exportar a ONNX para el despliegue en producción
model.export(format="onnx")Casos de uso y recomendaciones#
La elección entre YOLOv9 y YOLOv8 depende de los requisitos específicos de tu proyecto, las limitaciones de despliegue y tus preferencias de ecosistema.
Cuándo elegir YOLOv9#
YOLOv9 es una buena opción para:
- Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
- Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
- Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.
Cuándo elegir YOLOv8#
Se recomienda YOLOv8 para:
- Implementaciones versátiles y multitarea: Proyectos que necesitan un modelo probado para detección, segmentación, clasificación y estimación de pose dentro del ecosistema Ultralytics.
- Sistemas de producción consolidados: Entornos de producción existentes basados en la arquitectura YOLOv8, con canalizaciones de implementación estables y bien probadas.
- Amplio respaldo de la comunidad y del ecosistema: Aplicaciones que se benefician de los numerosos tutoriales de YOLOv8, las integraciones de terceros y los recursos de una comunidad activa.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
Perspectivas de futuro: llega YOLO26#
Aunque YOLOv8 y YOLOv9 son modelos muy capaces, el panorama de la visión artificial evoluciona rápidamente. Para los despliegues modernos, te recomendamos encarecidamente utilizar Ultralytics YOLO26, lanzado en enero de 2026.
YOLO26 supone un cambio de paradigma en el funcionamiento de los detectores de objetos en producción. Incorpora un diseño integral sin NMS nativo (opcional mediante nms=False), que elimina la latencia y el comportamiento no determinista del posprocesamiento. Para ofrecer una mejor compatibilidad con dispositivos de borde y de bajo consumo, YOLO26 incorpora la eliminación completa de DFL (Distribution Focal Loss), lo que simplifica enormemente las exportaciones para móviles.
Además, YOLO26 utiliza el innovador optimizador MuSGD, una combinación de SGD y Muon que aporta a las tareas de visión una estabilidad de entrenamiento propia de los LLM y permite converger mucho más rápido. Con una inferencia en CPU hasta un 43 % más rápida y la integración de ProgLoss + STAL para mejorar ampliamente el reconocimiento de objetos pequeños, YOLO26 es la opción indiscutible para nuevas iniciativas empresariales.
Según las limitaciones de tu hardware, también puede interesarte comparar estos modelos con Ultralytics YOLO11 para tareas generales equilibradas, o explorar modelos basados en Transformer como RT-DETR para investigaciones especializadas que exijan una alta fidelidad.
Aplicaciones y casos de uso en el mundo real#
La elección entre YOLOv8 y YOLOv9 depende en gran medida de las limitaciones de tu proyecto y del hardware de destino.
- Sanidad e imágenes médicas: Cuando cada píxel cuenta, como en los sistemas de detección de tumores, la arquitectura GELAN de YOLOv9 conserva excepcionalmente bien los detalles más precisos y reduce los falsos negativos en diagnósticos críticos.
- Comercio minorista y análisis de inventario: Para los sistemas inteligentes de supermercado que supervisan estanterías densamente abarrotadas, YOLOv9 ofrece el mAP necesario para distinguir con fiabilidad los artículos superpuestos.
- Ciudades inteligentes y supervisión del tráfico: En el dinámico ámbito de la gestión de logística y tráfico, la latencia ultrabaja y la robustez probada de YOLOv8 lo hacen ideal para seguir vehículos simultáneamente en varios flujos de cámara.
- Despliegues en el borde: Si vas a desplegar el modelo en dispositivos con recursos limitados, como una Raspberry Pi, o en hardware móvil, los bloques C2f muy optimizados de YOLOv8 (y las optimizaciones para CPU de YOLO26) ofrecen un flujo de inferencia mucho más fluido y eficiente con la batería.