Ultralytics YOLO27:
Get Started

YOLOv5 frente a YOLOv9#

El panorama de la visión artificial y la detección de objetos en tiempo real ha experimentado avances notables en los últimos años. Elegir entre modelos consolidados y probados en la práctica y arquitecturas de investigación más recientes es un reto habitual para los ingenieros de aprendizaje automático. Esta guía ofrece una comparación técnica exhaustiva de dos modelos muy influyentes de la familia YOLO: YOLOv5 y YOLOv9.

Tanto si vas a implementar modelos en dispositivos edge con recursos limitados, investigar la extracción de características de alta fidelidad o crear complejas canalizaciones de detección de objetos, es fundamental que conozcas las particularidades arquitectónicas, las métricas de rendimiento y las diferencias entre los ecosistemas de estos modelos.

Descripción general de los modelos#

Antes de profundizar en las comparaciones arquitectónicas, conviene conocer los orígenes y los objetivos principales de cada modelo.

Ultralytics YOLOv5#

Desarrollado por Glenn Jocher y publicado por Ultralytics el 26 de junio de 2020, YOLOv5 supuso un cambio de paradigma en la forma en que los desarrolladores interactuaban con los modelos de visión. Al adoptar plenamente el framework PyTorch, YOLOv5 sustituyó los complejos pasos de compilación de los modelos anteriores basados en Darknet por una experiencia intuitiva que prioriza Python.

YOLOv5 es conocido por su facilidad de uso y su rendimiento estable en diversos entornos de hardware. No solo admite la detección, sino también la clasificación de imágenes y la segmentación de instancias.

YOLOv9#

Presentado por Chien-Yao Wang y Hong-Yuan Mark Liao, del Instituto de Ciencias de la Información de la Academia Sinica de Taiwán, YOLOv9 se centra especialmente en la teoría arquitectónica para mitigar los problemas de cuello de botella de información en las redes neuronales profundas.

YOLOv9 se basa en dos innovaciones teóricas principales: la información de gradiente programable (PGI) y la red generalizada de agregación eficiente de capas (GELAN). Estos conceptos ayudan al modelo a conservar características espaciales esenciales a través de las capas profundas de la red.

Más información sobre YOLOv9

Prepara tus implementaciones para el futuro

Aunque YOLOv5 y YOLOv9 son potentes, el recién publicado YOLO26 representa el equilibrio definitivo entre velocidad y precisión. Con inferencia opcional de extremo a extremo sin NMS y hasta un 43 % más de velocidad de inferencia en CPU, YOLO26 es muy recomendable para la computación edge moderna y las implementaciones en producción.

Diferencias arquitectónicas y técnicas#

Comprender qué impulsa estos modelos de visión es esencial para optimizar las estrategias de implementación de modelos.

Extracción de características y conservación de la información#

YOLOv5 utiliza un backbone de red de etapas parciales cruzadas (CSPNet), que reduce eficazmente la carga computacional y mantiene un flujo de gradientes preciso durante la retropropagación. Este diseño está muy optimizado para las operaciones de GPU tradicionales y garantiza menores requisitos de memoria durante el entrenamiento que las alternativas basadas en Transformer de gran tamaño.

YOLOv9 introduce GELAN, una arquitectura genérica que amplía los principios de CSPNet. Combinado con PGI —una rama auxiliar reversible—, YOLOv9 garantiza que las capas profundas no pierdan los datos semánticos necesarios para las funciones objetivo precisas. Esto permite que YOLOv9 alcance una precisión elevada, especialmente con objetos pequeños, aunque las complejas ramificaciones auxiliares a veces pueden complicar las canalizaciones de exportación a hardware edge con recursos muy limitados.

Requisitos de memoria y eficiencia del entrenamiento#

En cuanto a la eficiencia del entrenamiento, YOLOv5 sigue siendo increíblemente robusto. El ecosistema Ultralytics, bien mantenido, garantiza que los modelos YOLOv5 consuman mucha menos memoria CUDA, lo que permite a los investigadores maximizar los tamaños de lote en GPU de consumo. Aunque YOLOv9 ofrece una excelente eficiencia en el uso de parámetros (alta precisión en relación con su tamaño), su entrenamiento puede consumir más recursos si no se utilizan frameworks optimizados. Por suerte, integrar YOLOv9 en la API de Ultralytics lo acerca a la gestión optimizada de recursos de YOLOv5.

Rendimiento y métricas#

Para evaluar objetivamente estas arquitecturas, comparamos su rendimiento en conjuntos de datos estándar, como COCO. A continuación se desglosan métricas como mAP (precisión media promedio), la velocidad de inferencia y el número de parámetros.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Como muestra la tabla, YOLOv9 alcanza una mayor precisión bruta en categorías equivalentes, lo que refleja su arquitectura más reciente. Sin embargo, YOLOv5n mantiene una latencia TensorRT increíblemente baja, de 1,12 ms, lo que pone de manifiesto su duradera eficacia en aplicaciones de computación edge local de alta velocidad.

Metodologías de entrenamiento y facilidad de uso#

Hoy, la verdadera ventaja de aprovechar la visión artificial reside en la accesibilidad de las herramientas.

La ventaja de Ultralytics#

Aunque los repositorios de investigación originales de modelos como YOLOv9 son fundamentales, a menudo incluyen matrices de dependencias complejas y scripts repetitivos. La API de Python de Ultralytics abstrae por completo esta complejidad. Con el ecosistema Ultralytics, puedes entrenar, evaluar y exportar tanto YOLOv5 como YOLOv9 con una sintaxis unificada e idéntica.

from ultralytics import YOLO

# Carga un modelo YOLOv5 preentrenado para una implementación rápida
model_v5 = YOLO("yolov5su.pt")  # YOLOv5u: pesos de YOLOv5 sin anclajes para el paquete ultralytics

# O aprovecha un modelo YOLOv9 para obtener una precisión de alta fidelidad
model_v9 = YOLO("yolov9c.pt")

# Entrena fácilmente con datos personalizados
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)

# Exporta el modelo entrenado a ONNX
model_v9.export(format="onnx")

Este enfoque de API única ofrece una gran versatilidad: admite no solo la detección, sino también la estimación de pose y las cajas delimitadoras orientadas (OBB), según el modelo elegido. Además, incorpora integraciones robustas con herramientas como Comet ML y Weights & Biases directamente en el ciclo de entrenamiento.

Casos de uso ideales y aplicaciones reales#

La elección entre estas arquitecturas depende principalmente de las limitaciones de tu hardware y de la precisión que requiera tu ámbito de aplicación.

Cuándo elegir YOLOv5#

YOLOv5 es un veterano curtido en mil batallas que destaca en implementaciones donde priman la estabilidad, el bajo consumo de memoria y la máxima compatibilidad de exportación.

  • Implementaciones móviles: Exportar YOLOv5 a LiteRT o CoreML para ejecutar inferencias en el dispositivo en smartphones antiguos es increíblemente sencillo.
  • Hardware edge heredado: En dispositivos como Raspberry Pi o los primeros NVIDIA Jetson Nano, las convoluciones sencillas de YOLOv5 garantizan una frecuencia de fotogramas estable en aplicaciones como la gestión inteligente de aparcamientos.
  • Prototipado rápido: La gran disponibilidad de tutoriales de la comunidad, pesos preentrenados personalizados y compatibilidad con numerosos conjuntos de datos hace que sea la forma más rápida de validar una prueba de concepto.

Cuándo elegir YOLOv9#

YOLOv9 es ideal para situaciones en las que es absolutamente esencial captar detalles complejos y minimizar los falsos negativos, aunque requiera algo más de capacidad de cálculo.

  • Imágenes aéreas y satelitales: El framework PGI conserva muy bien la fidelidad de los objetos pequeños, por lo que YOLOv9 es excelente para la supervisión agrícola con drones.
  • Diagnóstico por imagen médica: Al detectar anomalías o lesiones diminutas en exploraciones de alta resolución, el flujo de gradientes preciso de GELAN ofrece una ventaja necesaria en la exhaustividad.
  • Análisis minorista de gama alta: El seguimiento de productos superpuestos en estantes abarrotados se beneficia notablemente de la mayor capacidad de YOLOv9 para conservar características.

Amplía tus horizontes#

Aunque comparar YOLOv5 y YOLOv9 permite ver claramente cómo han evolucionado las arquitecturas entre 2020 y 2024, el campo de la IA avanza más rápido que nunca. Recomendamos encarecidamente a los desarrolladores que busquen el máximo rendimiento que exploren los últimos modelos YOLO26. Al ofrecer un diseño integral sin NMS nativo (nms=False) como alternativa a la supresión no máxima tradicional y utilizar el avanzado optimizador MuSGD, YOLO26 acorta la distancia entre la precisión propia de la investigación y la velocidad de producción. Gracias a la eliminación de DFL (se elimina la pérdida focal de distribución para simplificar la exportación y mejorar la compatibilidad con dispositivos edge y de bajo consumo), YOLO26 consigue hasta un 43 % más de velocidad de inferencia en CPU, por lo que es ideal para la computación edge. Además, ProgLoss + STAL proporciona funciones de pérdida mejoradas, con mejoras notables en el reconocimiento de objetos pequeños, algo esencial para el IoT, la robótica y las imágenes aéreas.

También puede interesarte comparar estas arquitecturas con otros modelos de última generación, como RT-DETR o el potente YOLO11. El framework unificado de Ultralytics garantiza que, independientemente del modelo que elijas, tu canalización de desarrollo siga siendo clara, eficiente y esté preparada para crecer.

Comentarios