Ultralytics YOLO27:
Get Started

YOLOv7 frente a YOLOv9#

El panorama de la detección de objetos en tiempo real ha evolucionado rápidamente, y cada nueva versión amplía los límites de lo posible tanto en dispositivos edge como en servidores en la nube. Al evaluar arquitecturas para proyectos de visión artificial, los desarrolladores suelen comparar las referencias consolidadas con las innovaciones más recientes. Esta guía completa compara dos hitos fundamentales de la familia YOLO: YOLOv7 y YOLOv9.

Analizaremos sus avances arquitectónicos, métricas de rendimiento y escenarios de despliegue ideales para ayudarte a elegir el modelo adecuado para tu aplicación. También veremos cómo la plataforma Ultralytics y la API Python facilitan el entrenamiento, la validación y el despliegue de modelos compatibles como YOLOv9.

Linaje de los modelos y especificaciones técnicas#

Comprender los orígenes y las filosofías de diseño de estos modelos aporta un contexto esencial para conocer sus capacidades. Ambos comparten un linaje de investigación, pero se centran en distintos cuellos de botella arquitectónicos.

YOLOv7: pionero en técnicas gratuitas#

Publicado a mediados de 2022, YOLOv7 se consolidó como una arquitectura muy fiable y altamente optimizada. Introdujo la reparametrización estructural y el enfoque de «bolsa de ventajas entrenable» para mantener altas velocidades de inferencia sin comprometer la precisión media promedio (mAP).

Innovaciones arquitectónicas: YOLOv7 incorpora la red extendida de agregación eficiente de capas (E-ELAN), que permite al modelo aprender características más diversas mediante la expansión, reorganización y combinación de la cardinalidad. Este diseño ofrece una utilización excelente de la GPU y una latencia de inferencia reducida. Sin embargo, en comparación con las versiones modernas, puede requerir mucha memoria durante entrenamientos complejos.

Más información sobre YOLOv7

YOLOv9: resolver el cuello de botella de información#

Presentado a principios de 2024 por el mismo equipo de investigación, YOLOv9 aborda el «cuello de botella de información» propio de las redes neuronales profundas. A medida que los datos atraviesan capas profundas, suelen perderse detalles cruciales. YOLOv9 mitiga este problema con diseños de capas fundamentalmente nuevos.

Innovaciones arquitectónicas: YOLOv9 incorpora la información de gradiente programable (PGI) y la red generalizada de agregación eficiente de capas (GELAN). PGI garantiza que se conserven gradientes fiables y se utilicen para actualizar los pesos con precisión. GELAN maximiza la eficiencia de los parámetros y permite que YOLOv9 alcance una alta precisión con muchos menos FLOPs que sus predecesores.

Más información sobre YOLOv9

Análisis del rendimiento#

Al elegir entre arquitecturas, los ingenieros de IA deben equilibrar la precisión, la velocidad de inferencia y el coste computacional. La siguiente tabla muestra las diferencias de rendimiento entre estos modelos en el conjunto de datos COCO estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Conclusiones clave#

  • Eficiencia de parámetros: YOLOv9m iguala la precisión de YOLOv7l (51,4 % de mAP) utilizando aproximadamente un 45 % menos de parámetros (20,1 M frente a 36,9 M). Esta drástica reducción facilita mucho el despliegue de YOLOv9m en dispositivos de IA en el edge con memoria limitada.
  • Microdespliegues: La incorporación de la variante YOLOv9t (tiny) ofrece velocidades extraordinarias (2,3 ms en una T4 con TensorRT) para entornos en los que las restricciones de tiempo real son absolutas.
  • Precisión máxima: En aplicaciones en las que la precisión es primordial, YOLOv9e eleva la precisión de detección al 55,6 % de mAP, superando ampliamente a YOLOv7x.
Preparar tus proyectos de visión artificial para el futuro

Aunque YOLOv7 y YOLOv9 son potentes, el recién lanzado YOLO26 supone un avance definitivo. YOLO26 incorpora un diseño nativo de extremo a extremo sin NMS (opcional mediante nms=False), que evita el posprocesamiento complejo y ofrece una inferencia en CPU hasta un 43 % más rápida. Gracias al novedoso optimizador MuSGD y a las funciones de pérdida mejoradas ProgLoss + STAL, YOLO26 ofrece una estabilidad de entrenamiento y una precisión de detección de objetos pequeños sin igual.

La ventaja de Ultralytics#

Elegir una arquitectura de modelo es solo el primer paso. El ecosistema de software que la rodea determina la rapidez con la que puedes pasar del prototipo a producción. Integrar modelos compatibles como YOLOv9 mediante la API de Python de Ultralytics ofrece importantes ventajas a desarrolladores e investigadores.

Facilidad de uso y eficiencia del entrenamiento#

Históricamente, entrenar YOLOv7 requería preparar los datos de forma compleja y usar scripts muy personalizados. El framework de Ultralytics abstrae estas complejidades del aprendizaje profundo. Los desarrolladores pueden cambiar fácilmente de arquitectura, experimentar con el ajuste de hiperparámetros y utilizar flujos de aumento de datos inteligentes con muy poco código.

Además, Ultralytics optimiza el uso de memoria durante el entrenamiento y la inferencia. A diferencia de los modelos Transformer pesados, como RT-DETR, las arquitecturas YOLO de Ultralytics se entrenan mucho más rápido y necesitan mucha menos memoria CUDA, por lo que son ideales para GPU de consumo.

Ejemplo de código: entrenamiento simplificado#

Entrenar modelos de última generación es muy sencillo en el ecosistema de Ultralytics. Aquí tienes un ejemplo totalmente ejecutable que muestra cómo entrenar y validar un modelo YOLOv9:

from ultralytics import YOLO

# Inicializa el modelo (puedes sustituir 'yolov9c.pt' por 'yolo26n.pt')
model = YOLO("yolov9c.pt")

# Entrena el modelo con el conjunto de datos de muestra COCO8
train_results = model.train(
    data="coco8.yaml",
    epochs=50,
    imgsz=640,
    device="0",  # Usa la GPU 0 si está disponible
    batch=16,  # Tamaño del lote optimizado para ahorrar memoria
)

# Valida el rendimiento del modelo con el conjunto de validación
metrics = model.val()

# Exporta el modelo entrenado al formato ONNX para implementarlo
model.export(format="onnx")

Versatilidad inigualable en distintas tareas#

Un ecosistema bien mantenido da acceso a diversas tareas de visión artificial. Aunque YOLOv7 se diseñó principalmente para la detección de objetos (con bifurcaciones experimentales posteriores para otras tareas), los modelos modernos de Ultralytics se crean desde el principio para ser versátiles. Sin configuración adicional, puedes realizar segmentación de instancias, estimación de pose, clasificación de imágenes y detección con cajas delimitadoras orientadas (OBB) con total facilidad.

Casos de uso y aplicaciones ideales#

La elección entre YOLOv7 y YOLOv9 suele depender de las limitaciones concretas de tu sector y del hardware disponible.

Cuándo utilizar YOLOv7#

  • Despliegues heredados en el edge: Si tu entorno de hardware ya está muy ajustado y optimizado para la arquitectura E-ELAN de YOLOv7, sigue siendo una opción sólida para el IoT industrial.
  • Supervisión del tráfico: La alta frecuencia de fotogramas y la estabilidad demostrada de YOLOv7 lo hacen excelente para infraestructuras de ciudades inteligentes y la gestión del tráfico en tiempo real.
  • Integración en robótica: Para desenvolverse en entornos dinámicos se necesita un procesamiento de baja latencia, un escenario en el que las variantes de YOLOv7 se han probado exhaustivamente.

Cuándo utilizar YOLOv9#

  • Diagnóstico por imagen médica: La arquitectura PGI de YOLOv9 destaca por conservar los detalles más sutiles en las capas profundas, algo esencial al abordar tareas complejas de análisis de imágenes médicas, como la detección de tumores.
  • Analítica minorista en entornos densos: Para rastrear y contar artículos muy juntos en estanterías, la integración de características de YOLOv9 ofrece una precisión superior y reduce los falsos negativos.
  • Imágenes aéreas y de drones: La eficiencia en el uso de parámetros de YOLOv9m permite procesar imágenes de alta resolución con drones, lo que ayuda a la conservación de la fauna y a la supervisión agrícola sin agotar la batería.

Conclusión#

Tanto YOLOv7 como YOLOv9 se han ganado un lugar en la historia de la visión artificial. YOLOv7 introdujo optimizaciones esenciales para el procesamiento en tiempo real, mientras que YOLOv9 abordó los cuellos de botella estructurales del aprendizaje profundo para maximizar la eficiencia de los parámetros.

Sin embargo, si hoy empiezas un proyecto nuevo, aprovechar el ecosistema de Ultralytics —en concreto, modelos de nueva generación como YOLO11 y YOLO26— ofrece el mejor equilibrio entre velocidad, precisión y experiencia de desarrollo. Gracias a innovaciones como el optimizador MuSGD y a la eliminación de Distribution Focal Loss (DFL) para ampliar la compatibilidad con el hardware, Ultralytics sigue ofreciendo las herramientas más accesibles y potentes para los profesionales de la IA aplicada a la visión.

Comentarios