YOLO Vision 2026:

YOLOv5 frente a YOLOv9#

El panorama de la visión artificial y la detección de objetos en tiempo real ha experimentado avances notables en los últimos años. Navegar entre la elección de modelos establecidos y probados en batalla frente a arquitecturas de investigación más recientes es un reto común para los ingenieros de aprendizaje automático. Esta guía ofrece una comparación técnica exhaustiva entre dos modelos de gran influencia en la familia YOLO: YOLOv5 y YOLOv9.

Ya sea que despliegues en dispositivos perimetrales con recursos limitados, investigues la extracción de características de alta fidelidad o construyas complejos flujos de trabajo de object detection, es fundamental comprender los matices arquitectónicos, las métricas de rendimiento y las diferencias del ecosistema de estos modelos.

Resumen de modelos#

Antes de profundizar en las comparaciones arquitectónicas, resulta útil comprender los orígenes y los objetivos principales de cada modelo.

Ultralytics YOLOv5#

Desarrollado por Glenn Jocher y lanzado por Ultralytics el 26 de junio de 2020, YOLOv5 marcó un cambio de paradigma en la forma en que los desarrolladores interactúan con los modelos de visión. Al adoptar por completo el marco de PyTorch, YOLOv5 cambió los complejos pasos de compilación de los modelos anteriores basados en Darknet por una experiencia de usuario intuitiva y centrada en Python.

YOLOv5 es reconocido por su facilidad de uso y su rendimiento estable en diversos entornos de hardware. No solo admite la detección, sino también la image classification y la instance segmentation.

Más información sobre YOLOv5

YOLOv9#

Presentado por Chien-Yao Wang y Hong-Yuan Mark Liao del Instituto de Ciencias de la Información de la Academia Sinica, Taiwán, YOLOv9 se centra intensamente en la teoría arquitectónica para mitigar los problemas de cuello de botella de información en las redes neuronales profundas.

El núcleo de YOLOv9 se basa en dos innovaciones teóricas principales: Información de Gradiente Programable (PGI) y la Red de Agregación de Capas Eficiente Generalizada (GELAN). Estos conceptos ayudan al modelo a retener características espaciales críticas a través de capas profundas de la red.

Aprende más sobre YOLOv9

Prepara tus implementaciones para el futuro

Si bien YOLOv5 y YOLOv9 son potentes, el recién lanzado YOLO26 representa el equilibrio definitivo entre velocidad y precisión. Con un diseño de extremo a extremo sin NMS y una inferencia en CPU hasta un 43 % más rápida, YOLOv26 es muy recomendable para la informática de borde moderna y los despliegues de producción.

Diferencias arquitectónicas y técnicas#

Comprender qué impulsa a estos modelos de visión en su interior es vital para optimizar las estrategias de model deployment.

Extracción de características y retención de información#

YOLOv5 utiliza un espina dorsal Cross Stage Partial Network (CSPNet), lo que reduce eficazmente la sobrecarga de cálculo mientras mantiene un flujo de gradiente preciso durante la propagación hacia atrás. Este diseño está altamente optimizado para las GPU operations tradicionales y garantiza menores requisitos de memoria durante el entrenamiento en comparación con las alternativas pesadas de Transformer.

YOLOv9 introduce GELAN, una arquitectura genérica que amplía los principios de CSPNet. Junto con PGI, una rama reversible auxiliar, YOLOv9 garantiza que las capas profundas no pierdan los datos semánticos necesarios para unas funciones objetivo precisas. Esto le permite a YOLOv9 alcanzar una gran accuracy, especialmente en objetos más pequeños, aunque la compleja ramificación auxiliar a veces puede complicar los flujos de trabajo de exportación a hardware perimetral profundamente limitado.

Requisitos de memoria y eficiencia de entrenamiento#

En lo que respecta a la eficiencia del entrenamiento, YOLOv5 sigue siendo increíblemente robusto. El Ultralytics ecosystem, que cuenta con un excelente mantenimiento, garantiza que los modelos YOLOv5 consuman mucha menos memoria CUDA, lo que permite a los investigadores maximizar los batch sizes en GPU de gama de consumo. Si bien YOLOv9 logra una excelente eficiencia de parámetros (alta precisión en relación con su tamaño), su proceso de entrenamiento puede requerir más recursos si no se utilizan marcos optimizados. Afortunadamente, integrar YOLOv9 en la API de Ultralytics lo acerca a la paridad con la gestión de recursos simplificada de YOLOv5.

Rendimiento y métricas#

Para evaluar objetivamente estas arquitecturas, comparamos su rendimiento en conjuntos de datos estándar como COCO. A continuación, se presenta un desglose detallado de métricas como mAP (Precisión Media), velocidad de inferencia y recuento de parámetros.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Como muestra la tabla, YOLOv9 alcanza una mayor precisión bruta en niveles equivalentes, lo que refleja su arquitectura más nueva. Sin embargo, YOLOv5n mantiene una latencia de TensorRT increíblemente baja de 1,12 ms, lo que destaca su resistencia duradera para aplicaciones de edge computing localizadas y de alta velocidad.

Metodologías de entrenamiento y facilidad de uso#

La verdadera ventaja de aprovechar la computer vision hoy en día radica en la accesibilidad de la cadena de herramientas.

La ventaja de Ultralytics#

Si bien los repositorios de investigación originales para modelos como YOLOv9 son fundamentales, a menudo vienen con matrices de dependencias complejas y scripts repetitivos. La Ultralytics Python API abstrae por completo esta complejidad. Con el ecosistema de Ultralytics, puedes entrenar, evaluar y exportar tanto YOLOv5 como YOLOv9 con una sintaxis idéntica y unificada.

from ultralytics import YOLO

# Load a pre-trained YOLOv5 model for fast deployment
model_v5 = YOLO("yolov5s.pt")

# Or leverage a YOLOv9 model for high-fidelity accuracy
model_v9 = YOLO("yolov9c.pt")

# Train seamlessly on custom data with automatic MLflow logging
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export the trained model to ONNX
model_v9.export(format="onnx")

Este enfoque de una sola API proporciona una inmensa versatilidad, ya que no solo admite la detección, sino también la pose estimation y las oriented bounding boxes (OBB) según el modelo elegido. Además, las integraciones sólidas con herramientas como Comet ML y Weights & Biases están integradas directamente en el bucle de entrenamiento.

Casos de uso ideales y aplicaciones en el mundo real#

La elección entre estas arquitecturas depende en gran medida de las limitaciones de tu hardware y de la precisión requerida por tu dominio de aplicación.

Cuándo elegir YOLOv5#

YOLOv5 es un veterano probado en batalla que destaca en implementaciones que priorizan la estabilidad, la baja huella de memoria y una compatibilidad de exportación extrema.

  • Despliegues móviles: Exportar YOLOv5 a TFLite o CoreML para la inferencia en el dispositivo en teléfonos inteligentes más antiguos es sumamente sencillo.
  • Hardware perimetral heredado: Para dispositivos como Raspberry Pi o las primeras generaciones de NVIDIA Jetson Nano, las convoluciones directas de YOLOv5 garantizan velocidades de cuadro constantes para aplicaciones como la smart parking management.
  • Prototipado rápido: La amplia disponibilidad de tutoriales de la comunidad, pre-trained weights personalizados y la compatibilidad con conjuntos de datos masivos hacen que sea la forma más rápida de validar una prueba de concepto.

Cuándo elegir YOLOv9#

YOLOv9 es ideal para escenarios donde capturar detalles intrincados y minimizar los falsos negativos es absolutamente crítico, incluso si requiere un poco más de sobrecarga de computación.

  • Imágenes aéreas y por satélite: El marco PGI es sumamente hábil para mantener la fidelidad de los objetos pequeños, lo que hace que YOLOv9 sea excelente para la agricultural monitoring basada en drones.
  • Diagnóstico por imagen médica: Al detectar anomalías o lesiones diminutas en escaneos de alta resolución, el flujo de gradiente preciso de GELAN proporciona una ventaja necesaria en la recuperación.
  • Análisis minorista de gama alta: El seguimiento de productos superpuestos en estanterías densas se beneficia significativamente de las capacidades superiores de retención de características de YOLOv9.

Expandiendo tus horizontes#

Si bien comparar YOLOv5 y YOLOv9 ofrece una visión clara de cómo han evolucionado las arquitecturas desde 2020 hasta 2024, el campo de la IA avanza más rápido que nunca. Para los desarrolladores que buscan la frontera absoluta del rendimiento, se recomienda encarecidamente explorar los últimos YOLO26 models. Al reemplazar la supresión de no máximos tradicional con un diseño nativo End-to-End NMS-Free Design y utilizar el avanzado MuSGD Optimizer, YOLO26 puentea la brecha entre la precisión a nivel de investigación y la velocidad a nivel de producción. Con la DFL Removal (eliminación de Distribution Focal Loss para una exportación simplificada y una mejor compatibilidad con dispositivos perimetrales y de bajo consumo), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo hace ideal para la informática de borde. Además, ProgLoss + STAL proporciona funciones de pérdida mejoradas con notables mejoras en el reconocimiento de objetos pequeños, algo fundamental para el IoT, la robótica y las imágenes aéreas.

También te puede interesar comparar estas arquitecturas con otros modelos de vanguardia como RT-DETR o el sumamente capaz YOLO11. Utilizar el marco unificado de Ultralytics garantiza que, sin importar el modelo que elijas, tu flujo de trabajo de desarrollo se mantenga limpio, eficiente y listo para escalar.

Comentarios