YOLO Vision 2026:

YOLOv7 frente a YOLOv5#

Al construir pipelines modernos de computer vision, seleccionar la arquitectura de detección de objetos adecuada es fundamental para equilibrar la precisión, la velocidad de inferencia y la utilización de recursos. Esta exhaustiva comparación examina dos modelos altamente influyentes en el espacio de la computer vision: YOLOv7 y Ultralytics YOLOv5.

Mediante el análisis de sus diferencias arquitectónicas, métricas de rendimiento y escenarios de despliegue ideales, nuestro objetivo es ayudar a desarrolladores e investigadores a elegir el mejor modelo para sus requisitos específicos.

Antecedentes y orígenes de los modelos#

Comprender los orígenes de estos modelos proporciona contexto sobre sus filosofías de diseño y casos de uso previstos.

YOLOv5#

Lanzado por Glenn Jocher y el equipo de Ultralytics el 26 de junio de 2020, YOLOv5 revolucionó el sector al proporcionar una implementación nativa de PyTorch que priorizaba la usabilidad sin sacrificar el rendimiento. Rápidamente se convirtió en un estándar de la industria debido a su ecosistema increíblemente optimizado y a su dinámica de entrenamiento fiable. Puedes explorar el código fuente en el YOLOv5 GitHub repository o acceder al modelo directamente a través de la Ultralytics Platform.

Más información sobre YOLOv5

YOLOv7#

Presentado por Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao del Instituto de Ciencias de la Información, Academia Sinica, Taiwán, el 6 de julio de 2022. YOLOv7 se centró fuertemente en innovaciones arquitectónicas como las Redes de Agregación de Capas Eficientes Extendidas (E-ELAN) y una "bolsa de obsequios" (bag-of-freebies) entrenable para impulsar el estado del arte en precisión. Los detalles se pueden encontrar en su official Arxiv paper y en el YOLOv7 GitHub repository. Para una integración fluida, consulta la Ultralytics YOLOv7 documentation.

Más información sobre YOLOv7

Experimentación fluida

Ambos modelos están totalmente integrados en el paquete de Python de Ultralytics, lo que te permite cambiar entre ellos simplemente modificando la cadena del modelo en tu código.

Innovaciones arquitectónicas#

Diseño de Ultralytics YOLOv5#

YOLOv5 utiliza un backbone CSPDarknet53 modificado combinado con un cuello Path Aggregation Network (PANet). Este diseño está altamente optimizado para la feature extraction rápida y la eficiencia de memoria. A diferencia de las arquitecturas más antiguas o los modelos pesados basados en Transformer, YOLOv5 requiere mucha menos memoria CUDA durante el entrenamiento, lo que permite batch sizes más grandes en GPUs estándar de consumo. Además, el framework de Ultralytics admite de forma inherente una amplia variedad de tareas más allá de las bounding boxes estándar, incluyendo el image segmentation y el image classification.

Diseño de YOLOv7#

YOLOv7 introdujo varias reparametrizaciones estructurales y la arquitectura E-ELAN, que permite a la red aprender características más diversas sin destruir la ruta de gradiente original. También implementa una cabeza auxiliar para la supervisión intermedia durante el entrenamiento. Aunque estos avances producen un mean Average Precision (mAP) elevado, a menudo introducen estructuras de tensores complejas que pueden hacer que la exportación a formatos perimetrales como ONNX o TensorRT sea ligeramente más desafiante en comparación con las exportaciones optimizadas nativas de los modelos de Ultralytics.

Análisis de rendimiento#

Al comparar estos modelos, los desarrolladores deben equilibrar el mAPval, la velocidad de inferencia y la complejidad computacional (FLOPs). La siguiente tabla demuestra el rendimiento de ambas arquitecturas evaluadas en el COCO dataset.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

Puntos clave#

  • Techo de precisión: YOLOv7x logra la mayor precisión general con un impresionante 53.1 mAPval, lo que lo hace altamente competitivo para escenarios donde maximizar el rendimiento de la detección es el objetivo principal.
  • Velocidad y eficiencia: Ultralytics YOLOv5n es una maravilla de la eficiencia, ya que ofrece una inference latency ultrarrápida (1,12 ms en T4 TensorRT) con una huella de memoria diminuta de solo 2,6M de parámetros. Esto lo convierte en una opción inigualable para despliegues perimetrales altamente restringidos.
  • Equilibrio de rendimiento: La serie YOLOv5 proporciona un gradiente excepcional de modelos. YOLOv5l ofrece un punto medio fantástico, situándose ligeramente por detrás de YOLOv7l en margen de precisión pero ofreciendo un pipeline de despliegue altamente maduro.

La ventaja del ecosistema Ultralytics#

La arquitectura de un modelo es solo la mitad de la ecuación; el ecosistema que lo rodea dicta su viabilidad en el mundo real. Aquí es donde los modelos de Ultralytics realmente brillan.

Facilidad de uso: Ultralytics proporciona una API de Python unificada y altamente intuitiva. Puedes entrenar, validar y desplegar modelos con el mínimo código repetitivo, respaldado por una exhaustiva official documentation. Ecosistema bien mantenido: El desarrollo activo garantiza actualizaciones constantes, correcciones de errores y una integración fluida con herramientas de seguimiento modernas como Weights & Biases. Eficiencia de entrenamiento: Mediante el uso de cargadores de datos optimizados y smart caching, YOLOv5 reduce drásticamente los tiempos de entrenamiento. Además, los pesos preentrenados listos para usar aceleran el aprendizaje por transferencia en varios dominios.

Ejemplo de código: Entrenamiento simplificado#

Con el paquete de Ultralytics, iniciar una ejecución de entrenamiento es prácticamente idéntico independientemente de la arquitectura que elijas.

from ultralytics import YOLO

# Load a pre-trained YOLOv5 model (can easily swap to "yolov7.pt")
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 example dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained model to ONNX format for deployment
success = model.export(format="onnx")

Casos de uso ideales#

Cuándo elegir YOLOv7#

  • Benchmarking académico: Perfecto para investigadores que necesitan comparar técnicas novedosas con una línea base de 2022 bien documentada.
  • Procesamiento en la nube con GPU de gama alta: Al desplegar en servidores potentes donde lograr el mAP absoluto más alto en escenas densas compensa la simplicidad de exportación.

Cuándo elegir YOLOv5#

  • Despliegues en producción: Ideal para aplicaciones comerciales que requieren una gran estabilidad, model deployment options sencillas y una amplia compatibilidad multiplataforma.
  • Dispositivos de borde: Las variantes más pequeñas (YOLOv5n y YOLOv5s) funcionan excepcionalmente bien en teléfonos móviles y sistemas integrados.
  • Requisitos de múltiples tareas: Si tu proyecto necesita evolucionar desde una simple detección hasta la pose estimation o la segmentación utilizando un framework unificado.
Explorando otras arquitecturas

¿Buscas iteraciones más recientes? Considera explorar Ultralytics YOLOv8 o Ultralytics YOLO11 para obtener más avances en la detección sin anclajes y en las capacidades de aprendizaje multitarea.

La próxima generación: Ultralytics YOLO26#

Aunque YOLOv5 y YOLOv7 ocupan lugares vitales en la historia de la IA de visión, el panorama evoluciona constantemente. Lanzado en enero de 2026, Ultralytics YOLO26 representa la tecnología de vanguardia absoluta en detección de objetos, superando a generaciones anteriores en todas las métricas.

Más información sobre YOLO26

YOLO26 introduce varias características que cambian el paradigma:

  • Diseño integral sin NMS: Sobre la base de conceptos iniciados en iteraciones anteriores, YOLO26 es nativamente integral. Esto elimina por completo el postprocesamiento de supresión no máxima (NMS), reduciendo los cuellos de botella de latencia y simplificando drásticamente la lógica de despliegue.
  • Optimizador MuSGD: Inspirado en Kimi K2 de Moonshot AI, este revolucionario optimizador combina la estabilidad del SGD estándar con el momento acelerado de Muon, incorporando innovaciones avanzadas de entrenamiento de LLM directamente en la visión artificial.
  • Velocidad de CPU mejorada: Al eliminar estratégicamente la pérdida focal de distribución (DFL), YOLO26 logra hasta un 43% más de rapidez en la inferencia de CPU, convirtiéndose en el campeón indiscutible para el despliegue en el borde y dispositivos IoT de bajo consumo.
  • ProgLoss + STAL: Estas funciones de pérdida avanzadas producen mejoras masivas en el reconocimiento de objetos pequeños, lo cual es crítico para la fotografía aérea y la robótica de precisión.
  • Mejoras específicas de tareas: Incluye pérdida de segmentación semántica para la generación de máscaras, Estimación de Log-Verosimilitud Residual (RLE) para el seguimiento de poses y una pérdida de ángulo especializada para resolver problemas complicados en los límites de Oriented Bounding Box (OBB).

Conclusión#

Tanto YOLOv5 como YOLOv7 ofrecen soluciones sólidas para la detección de objetos en tiempo real. YOLOv7 sigue siendo una opción fuerte para la precisión pura en hardware de alta computación, mientras que YOLOv5 destaca como la herramienta definitiva orientada al desarrollador, ofreciendo un equilibrio excepcional de velocidad, eficiencia y un ecosistema de clase mundial.

Sin embargo, para los desarrolladores que buscan preparar sus pipelines para el futuro y lograr la combinación definitiva de velocidad, simplicidad y precisión de vanguardia, recomendamos encarecidamente migrar a Ultralytics YOLO26. Encapsula la legendaria facilidad de uso de la plataforma Ultralytics a la vez que ofrece innovaciones arquitectónicas revolucionarias.

Colaboradores

Comentarios