YOLOv5 frente a YOLOv7#
El panorama de la visión por ordenador ha evolucionado rápidamente en los últimos años, impulsado por la necesidad de detectar objetos en tiempo real de forma más rápida y precisa. Al elegir la arquitectura adecuada para tu proyecto de visión por ordenador, es crucial comprender las diferencias entre modelos populares como Ultralytics YOLOv5 y YOLOv7. Esta comparación técnica exhaustiva analiza sus arquitecturas, metodologías de entrenamiento, métricas de rendimiento y escenarios de implementación ideales para ayudarte a tomar una decisión informada.
De un vistazo: origen de los modelos#
Comprender el origen y las filosofías de diseño de estos modelos proporciona el contexto necesario para sus decisiones arquitectónicas.
Detalles de YOLOv5:
- Autores: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: Repositorio de YOLOv5
- Documentación: Documentación de YOLOv5
Detalles de YOLOv7:
- Autores: Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwan
- Fecha: 2022-07-06
- Arxiv: Artículo de YOLOv7
- GitHub: Repositorio de YOLOv7
- Documentación: Documentación de YOLOv7
¿Te interesa saber cómo se comparan estos modelos con otros? Consulta nuestras comparativas, como YOLOv5 frente a YOLO11 o YOLOv7 frente a EfficientDet, para ampliar tus conocimientos sobre el ecosistema de detección de objetos.
Innovaciones y diferencias arquitectónicas#
YOLOv5: el estándar de accesibilidad#
Presentado por Ultralytics en 2020, YOLOv5 supuso un cambio de paradigma al utilizar de forma nativa el framework PyTorch, reduciendo significativamente la barrera de entrada para investigadores y desarrolladores. Su arquitectura se basa en un backbone CSPDarknet53 modificado e integra redes de etapas parciales cruzadas (CSP) para reducir el número de parámetros manteniendo el flujo de gradientes.
Una de sus mayores fortalezas son sus Requisitos de memoria. En comparación con los detectores de dos etapas más antiguos o con modelos Transformer pesados como RT-DETR, YOLOv5 necesita mucha menos memoria CUDA durante el entrenamiento, lo que permite utilizar tamaños de lote mayores en GPU de consumo estándar. Además, su Versatilidad integrada de forma nativa permite realizar sin problemas clasificación de imágenes, detección de objetos y segmentación de imágenes.
YOLOv7: llevando al límite la precisión en tiempo real#
Lanzado a mediados de 2022, YOLOv7 se centró en ampliar los límites del estado del arte en detección en tiempo real utilizando las métricas de MS COCO. Sus autores introdujeron la red de agregación de capas eficiente extendida (E-ELAN), que mejora la capacidad de aprendizaje de la red sin destruir la ruta de gradientes original.
YOLOv7 también es famoso por su «bag-of-freebies entrenable», especialmente por sus técnicas de reparametrización durante el entrenamiento, que convierten varios módulos en una única capa convolucional para la inferencia, aumentando la velocidad sin sacrificar precisión. Sin embargo, esta compleja metodología de entrenamiento suele dar lugar a curvas de aprendizaje más pronunciadas y a procesos de exportación menos sencillos en comparación con el ecosistema nativo de Ultralytics.
Comparación de rendimiento#
Al evaluar estos modelos, el Equilibrio de rendimiento entre velocidad, precisión y coste computacional es fundamental. A continuación se muestra una comparación detallada de sus métricas de rendimiento basada en el conjunto de datos val2017 de MS COCO.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Aunque YOLOv7 logra puntuaciones mAP absolutas más altas en sus variantes de mayor tamaño, YOLOv5 ofrece un espectro de modelos sin igual: desde Nano (YOLOv5n), ultraligero para dispositivos edge extremos, hasta Extra-Large (YOLOv5x), destinado a la inferencia en la nube.
La ventaja del ecosistema de Ultralytics#
La utilidad de un modelo va más allá de su arquitectura básica; el ecosistema que lo rodea determina la rapidez con la que puede implementarse en producción. Aquí es donde destacan los modelos de Ultralytics.
- Facilidad de uso: Ultralytics Platform y su API unificada de Python proporcionan una experiencia de usuario simplificada, una sintaxis sencilla y una documentación extensa. Entrenar un conjunto de datos personalizado no requiere código repetitivo.
- Ecosistema bien mantenido: Ultralytics se beneficia de un desarrollo activo, actualizaciones frecuentes y un sólido respaldo de la comunidad. Las integraciones con herramientas como Comet ML y Weights & Biases vienen incorporadas.
- Eficiencia del entrenamiento: Los cargadores de datos, la caché inteligente y la compatibilidad con varias GPU hacen que los modelos de Ultralytics sean especialmente eficientes de entrenar. Los pesos preentrenados disponibles aceleran considerablemente el aprendizaje por transferencia.
Ejemplo de código: primeros pasos#
Con Ultralytics, implementar un modelo solo requiere unas pocas líneas de código. El siguiente fragmento de Python muestra lo sencillo que es cargar, entrenar y ejecutar la inferencia utilizando el paquete recomendado ultralytics.
from ultralytics import YOLO
# Load a pretrained YOLOv5s model
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 example dataset
# Ultralytics automatically handles data downloading and augmentation
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a sample image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Display the predictions
predictions[0].show()En cambio, utilizar el repositorio original de YOLOv7 suele implicar clonar repositorios complejos, gestionar manualmente las dependencias y utilizar argumentos de línea de comandos largos.
Aplicaciones en el mundo real y casos de uso ideales#
Cuándo elegir YOLOv7#
YOLOv7 sigue siendo una opción sólida para la evaluación comparativa académica o para determinados procesos heredados con GPU en los que el objetivo exclusivo es maximizar mAP y el sistema ya está adaptado a sus tensores de salida basados en anchors. Los investigadores que analizan las rutas de gradientes suelen utilizar YOLOv7 como referencia.
Cuándo elegir YOLOv5#
YOLOv5 es muy apreciado en entornos de producción por su excepcional estabilidad. Es la opción preferida para:
- Computación móvil y edge: Implementar YOLOv5n en iOS mediante CoreML o en Android mediante TFLite.
- Startups ágiles: Los equipos que necesitan ciclos de iteración rápidos se benefician de la integración fluida con Ultralytics Platform para la gestión de conjuntos de datos y el entrenamiento en la nube.
- Entornos multitarea: Sistemas que requieren detección de objetos, clasificación y segmentación simultáneas.
El futuro: pasar a YOLO26#
Aunque comparar YOLOv5 y YOLOv7 es un ejercicio excelente para comprender la evolución de la IA para visión por ordenador, el estado del arte ha seguido avanzando. Lanzado en enero de 2026, Ultralytics YOLO26 representa un salto adelante monumental, que deja obsoletas en gran medida las arquitecturas anteriores para proyectos nuevos.
Para los desarrolladores que buscan el máximo rendimiento, YOLO26 ofrece varias ventajas revolucionarias frente a YOLOv5 y YOLOv7:
- Diseño de extremo a extremo sin NMS: Al eliminar el posprocesamiento de supresión no máxima, YOLO26 ofrece una implementación mucho más sencilla y una latencia más rápida y constante.
- Optimizador MuSGD: Inspirado en las innovaciones de LLM de Moonshot AI, este optimizador híbrido proporciona un entrenamiento muy estable y una convergencia rápida.
- Velocidad edge sin precedentes: Optimizada específicamente para entornos edge, la variante nano ofrece hasta un 43 % más de rapidez en la inferencia en CPU al eliminar la pérdida focal de distribución (DFL).
- Precisión superior: Las nuevas funciones de pérdida, como ProgLoss + STAL, mejoran significativamente el reconocimiento de objetos pequeños, por lo que YOLO26 es ideal para imágenes captadas por drones y aplicaciones de robótica.
Tanto si mantienes un proceso existente con YOLOv5 como si quieres implementar YOLO26, la tecnología más avanzada, Ultralytics Platform proporciona todas las herramientas necesarias para triunfar en la visión por ordenador moderna.