YOLOv5 frente a YOLOv9#
El panorama de la visión por ordenador y la detección de objetos en tiempo real ha experimentado avances extraordinarios en los últimos años. Para los ingenieros de machine learning, es habitual tener que elegir entre modelos consolidados y probados en batalla y arquitecturas de investigación más recientes. Esta guía ofrece una comparación técnica exhaustiva entre dos modelos muy influyentes de la familia YOLO: YOLOv5 y YOLOv9.
Tanto si implementas modelos en dispositivos edge con recursos limitados como si investigas la extracción de características de alta fidelidad o desarrollas pipelines complejos de detección de objetos, es fundamental comprender las particularidades arquitectónicas, las métricas de rendimiento y las diferencias entre los ecosistemas de estos modelos.
Descripción general de los modelos#
Antes de profundizar en las comparaciones arquitectónicas, conviene comprender el origen y los objetivos principales de cada modelo.
Ultralytics YOLOv5#
Desarrollado por Glenn Jocher y publicado por Ultralytics el 26 de junio de 2020, YOLOv5 supuso un cambio de paradigma en la forma en que los desarrolladores interactuaban con los modelos de visión. Al adoptar plenamente el framework PyTorch, YOLOv5 sustituyó los complejos pasos de compilación de los modelos anteriores basados en Darknet por una experiencia de usuario intuitiva centrada en Python.
- Autor: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: Repositorio de YOLOv5
- Documentación: Documentación de YOLOv5
YOLOv5 es conocido por su facilidad de uso y su rendimiento estable en diversos entornos de hardware. No solo admite la detección, sino también la clasificación de imágenes y la segmentación de instancias.
YOLOv9#
Presentado por Chien-Yao Wang y Hong-Yuan Mark Liao, del Institute of Information Science de Academia Sinica (Taiwán), YOLOv9 se centra especialmente en la teoría arquitectónica para mitigar los problemas de cuello de botella de información en las redes neuronales profundas.
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Fecha: 2024-02-21
- Arxiv: 2402.13616
- GitHub: Repositorio de YOLOv9
- Documentación: Documentación de YOLOv9
El núcleo de YOLOv9 se basa en dos innovaciones teóricas principales: la información de gradiente programable (PGI) y la red de agregación de capas eficiente generalizada (GELAN). Estos conceptos ayudan al modelo a conservar características espaciales críticas a través de las capas profundas de la red.
Aunque YOLOv5 y YOLOv9 son potentes, el recién lanzado YOLO26 representa el equilibrio definitivo entre velocidad y precisión. Gracias a su diseño de extremo a extremo sin NMS y a una inferencia en CPU hasta un 43 % más rápida, YOLO26 es muy recomendable para la computación edge moderna y las implementaciones en producción.
Diferencias arquitectónicas y técnicas#
Comprender qué impulsa internamente estos modelos de visión es fundamental para optimizar las estrategias de implementación de modelos.
Extracción de características y retención de información#
YOLOv5 utiliza una red parcial entre etapas (CSPNet) como backbone, lo que reduce eficazmente la sobrecarga computacional y mantiene un flujo de gradientes preciso durante la retropropagación. Este diseño está muy optimizado para las operaciones de GPU tradicionales y garantiza unos requisitos de memoria menores durante el entrenamiento en comparación con las alternativas basadas en Transformer de mayor tamaño.
YOLOv9 introduce GELAN, una arquitectura genérica que amplía los principios de CSPNet. Junto con PGI —una rama auxiliar reversible—, YOLOv9 garantiza que las capas profundas no pierdan los datos semánticos necesarios para unas funciones objetivo precisas. Esto permite a YOLOv9 alcanzar una precisión elevada, especialmente con objetos pequeños, aunque las complejas ramas auxiliares pueden complicar en ocasiones los pipelines de exportación a hardware edge con recursos muy limitados.
Requisitos de memoria y eficiencia de entrenamiento#
En lo que respecta a la eficiencia del entrenamiento, YOLOv5 sigue siendo extraordinariamente robusto. El ecosistema de Ultralytics, bien mantenido, garantiza que los modelos YOLOv5 consuman mucha menos memoria CUDA, lo que permite a los investigadores maximizar los tamaños de lote en GPU de consumo. Aunque YOLOv9 logra una excelente eficiencia en el uso de parámetros —una precisión elevada en relación con su tamaño—, su proceso de entrenamiento puede consumir más recursos si no se utilizan frameworks optimizados. Por suerte, integrar YOLOv9 en la API de Ultralytics lo acerca a la paridad con la gestión optimizada de recursos de YOLOv5.
Rendimiento y métricas#
Para evaluar objetivamente estas arquitecturas, comparamos su rendimiento en conjuntos de datos estándar como COCO. A continuación se desglosan métricas como mAP (precisión media promedio), la velocidad de inferencia y el número de parámetros.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Como muestra la tabla, YOLOv9 alcanza una mayor precisión bruta en niveles equivalentes, lo que refleja su arquitectura más reciente. Sin embargo, YOLOv5n mantiene una latencia de TensorRT extraordinariamente baja, de 1,12 ms, lo que pone de relieve su solidez duradera para aplicaciones de computación edge localizadas y de alta velocidad.
Metodologías de entrenamiento y facilidad de uso#
La verdadera ventaja de aprovechar la visión por ordenador hoy en día reside en la accesibilidad de la cadena de herramientas.
La ventaja de Ultralytics#
Aunque los repositorios de investigación originales de modelos como YOLOv9 son fundamentales, a menudo incluyen matrices de dependencias complejas y scripts repetitivos. La API de Python de Ultralytics abstrae por completo esta complejidad. Con el ecosistema de Ultralytics, puedes entrenar, evaluar y exportar YOLOv5 y YOLOv9 con una sintaxis idéntica y unificada.
from ultralytics import YOLO
# Load a pre-trained YOLOv5 model for fast deployment
model_v5 = YOLO("yolov5s.pt")
# Or leverage a YOLOv9 model for high-fidelity accuracy
model_v9 = YOLO("yolov9c.pt")
# Train seamlessly on custom data with automatic MLflow logging
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)
# Export the trained model to ONNX
model_v9.export(format="onnx")Este enfoque de una única API ofrece una enorme versatilidad y admite no solo la detección, sino también la estimación de poses y las cajas delimitadoras orientadas (OBB), según el modelo elegido. Además, las sólidas integraciones con herramientas como Comet ML y Weights & Biases están incorporadas directamente en el bucle de entrenamiento.
Casos de uso ideales y aplicaciones reales#
La elección entre estas arquitecturas depende en gran medida de las limitaciones de tu hardware y de la precisión que requiera tu ámbito de aplicación.
Cuándo elegir YOLOv5#
YOLOv5 es un veterano probado en batalla que destaca en implementaciones que priorizan la estabilidad, un consumo reducido de memoria y una compatibilidad de exportación excepcional.
- Implementaciones móviles: Exportar YOLOv5 a TFLite o CoreML para realizar inferencias en el dispositivo en smartphones antiguos resulta extraordinariamente sencillo.
- Hardware edge antiguo: En dispositivos como Raspberry Pi o los NVIDIA Jetson Nano de primera generación, las convoluciones directas de YOLOv5 garantizan frecuencias de fotogramas constantes para aplicaciones como la gestión inteligente de aparcamientos.
- Prototipado rápido: La amplia disponibilidad de tutoriales de la comunidad, pesos preentrenados personalizados y compatibilidad con enormes conjuntos de datos lo convierten en la forma más rápida de validar una prueba de concepto.
Cuándo elegir YOLOv9#
YOLOv9 es ideal para situaciones en las que capturar detalles complejos y minimizar los falsos negativos es absolutamente fundamental, aunque requiera algo más de recursos computacionales.
- Imágenes aéreas y por satélite: El framework PGI es especialmente eficaz para mantener la fidelidad de los objetos pequeños, lo que hace que YOLOv9 sea excelente para la monitorización agrícola basada en drones.
- Diagnóstico mediante imágenes médicas: Al detectar anomalías o lesiones diminutas en exploraciones de alta resolución, el flujo de gradientes preciso de GELAN proporciona una ventaja necesaria en sensibilidad.
- Análisis avanzado del comercio minorista: El seguimiento de productos superpuestos en estanterías densamente ocupadas se beneficia notablemente de las capacidades superiores de YOLOv9 para retener características.
Amplía tus horizontes#
Aunque comparar YOLOv5 y YOLOv9 ofrece una visión clara de cómo han evolucionado las arquitecturas entre 2020 y 2024, el campo de la IA avanza más rápido que nunca. Se recomienda encarecidamente a los desarrolladores que busquen la frontera absoluta del rendimiento explorar los últimos modelos YOLO26. Al sustituir la supresión no máxima tradicional por un diseño nativo de extremo a extremo sin NMS y utilizar el avanzado optimizador MuSGD, YOLO26 reduce la distancia entre la precisión propia de la investigación y la velocidad de producción. Gracias a la eliminación de DFL (se elimina Distribution Focal Loss para simplificar la exportación y mejorar la compatibilidad con dispositivos edge y de bajo consumo), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo hace ideal para la computación edge. Además, ProgLoss + STAL proporciona funciones de pérdida mejoradas, con mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para IoT, la robótica y las imágenes aéreas.
También puede interesarte comparar estas arquitecturas con otros modelos de vanguardia, como RT-DETR o el muy competente YOLO11. Utilizar el framework unificado de Ultralytics garantiza que, elijas el modelo que elijas, tu pipeline de desarrollo se mantenga limpio, eficiente y preparado para escalar.