YOLOv7 frente a YOLO11#
El panorama de la visión por ordenador ha evolucionado rápidamente durante los últimos años. Para los desarrolladores e investigadores que eligen el framework adecuado de detección de objetos, comprender las diferencias arquitectónicas y prácticas entre modelos que definen una generación es fundamental. Esta guía ofrece una comparación técnica detallada entre el avance académico de YOLOv7 y el Ultralytics YOLO11, altamente refinado y listo para producción.
Orígenes de los modelos y filosofías arquitectónicas#
YOLOv7, publicado el 6 de julio de 2022 por los autores Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao, del Institute of Information Science at Academia Sinica, introdujo varios conceptos novedosos en el campo. Detallado en su artículo de investigación de YOLOv7 publicado en arXiv, el modelo se centra especialmente en un enfoque de «bolsa de ventajas entrenable» y en las redes de agregación de capas eficientes extendidas (E-ELAN). Estas decisiones arquitectónicas se diseñaron específicamente para maximizar la eficiencia de las rutas de gradiente, lo que lo convierte en una herramienta potente para la evaluación comparativa académica en GPU de alta gama.
YOLO11, desarrollado por Glenn Jocher y Jing Qiu en Ultralytics, se publicó el 27 de septiembre de 2024. YOLO11 desplaza el foco de la complejidad arquitectónica pura hacia un ecosistema integral centrado en el desarrollador. Disponible en el repositorio de Ultralytics en GitHub, YOLO11 incorpora un diseño optimizado sin anchors que reduce drásticamente el consumo de memoria tanto durante el entrenamiento como durante la inferencia. Está integrado de forma nativa en la Ultralytics Platform, ofreciendo una facilidad de uso inigualable, desde la anotación de datasets hasta el despliegue en el edge.
Mientras que los repositorios independientes suelen quedar abandonados después de la publicación de un artículo académico, los modelos de Ultralytics se benefician de actualizaciones continuas, lo que garantiza una compatibilidad a largo plazo con los stacks modernos de machine learning, como las últimas versiones de PyTorch, y con aceleradores de hardware especializados.
Métricas de rendimiento y eficiencia#
Al desplegar modelos en aplicaciones del mundo real, la precisión bruta debe equilibrarse con la velocidad de inferencia y la sobrecarga computacional. A continuación se muestra una comparación directa de las variantes de YOLOv7 y YOLO11 evaluadas según los benchmarks estándar del dataset COCO.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Nota: La ausencia de velocidades de CPU para YOLOv7 indica entornos de prueba antiguos que no estandarizaban los benchmarks de CPU con ONNX. Se destacan los mejores valores de niveles comparables.
Análisis de los resultados#
Los datos ilustran una clara evolución en eficiencia. El modelo YOLO11l (Grande) alcanza un mAPval superior, del 53,4 %, frente al 51,4 % de YOLOv7l, utilizando a la vez muchos menos parámetros (25,3 M frente a 36,9 M) y muchos menos FLOPs (86,9 B frente a 104,7 B). Esta reducción de la complejidad computacional permite que YOLO11 se ejecute más rápido en implementaciones de NVIDIA TensorRT y requiere menos VRAM, lo que lo hace mucho más adecuado para entornos con recursos de hardware limitados.
Usabilidad y flujos de trabajo de entrenamiento#
La experiencia del desarrollador es uno de los principales puntos de divergencia entre ambos frameworks.
Entrenamiento de YOLOv7#
El uso del código fuente abierto original de YOLOv7 suele requerir clonar el repositorio, resolver las dependencias manualmente y utilizar argumentos de línea de comandos muy detallados. Gestionar distintas tareas o exportar a formatos móviles implica con frecuencia modificar scripts del código fuente o recurrir a forks de terceros.
Entrenamiento de YOLO11#
YOLO11 está profundamente integrado en el paquete de ultralytics para Python, lo que simplifica el ciclo de vida del machine learning. Entrenar un modelo de detección de objetos solo requiere unas pocas líneas de código, y el framework gestiona de forma nativa la descarga de datos, el ajuste de hiperparámetros y el almacenamiento en caché.
from ultralytics import YOLO
# Load a pretrained YOLO11 Nano model for maximum speed
model = YOLO("yolo11n.pt")
# Train the model on the COCO8 example dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Export the trained model to ONNX format for deployment
export_path = model.export(format="onnx")Además, YOLO11 ofrece una versatilidad extraordinaria. Con solo cambiar el sufijo del modelo, los desarrolladores pueden pasar al instante de la detección al mapeo de la segmentación de instancias, al seguimiento de la estimación de pose o al reconocimiento de cajas delimitadoras orientadas (OBB), un nivel de compatibilidad nativa con múltiples tareas del que YOLOv7 carece.
Exportar YOLO11 a formatos edge como Apple CoreML o frameworks Intel OpenVINO solo requiere un comando .export(), evitando la compleja cirugía de grafos que suelen necesitar los modelos de generaciones anteriores.
Escenarios de despliegue ideales#
Comprender los puntos fuertes de cada modelo ayuda a determinar sus casos de uso más adecuados.
- Reproducción de benchmarks heredados: YOLOv7 sigue siendo útil para investigadores académicos que necesitan reproducir benchmarks específicos de 2022 o estudiar los efectos de las técnicas de reparametrización en redes basadas en anchors.
- Entornos de producción comercial: YOLO11 es la opción clara para los sistemas empresariales. Su estabilidad, mantenimiento activo e integración con la interfaz basada en la nube de Ultralytics Platform lo hacen ideal para gestionar analítica minorista a gran escala, supervisión de seguridad y control de calidad industrial.
- Computación edge con recursos limitados: La variante YOLO11n, increíblemente ligera, está diseñada específicamente para dispositivos edge de bajo consumo, y funciona de forma eficiente en un sistema Raspberry Pi o en módulos NVIDIA Jetson.
De cara al futuro: el cambio de paradigma de YOLO26#
Aunque YOLO11 representa una solución de vanguardia muy refinada, el campo del machine learning avanza sin descanso. Para los usuarios que comiencen hoy proyectos de visión completamente nuevos, se recomienda encarecidamente explorar el recién publicado Ultralytics YOLO26.
Publicado en enero de 2026, YOLO26 introduce varias funcionalidades revolucionarias que superan tanto a YOLOv7 como a YOLO11:
- Arquitectura nativamente sin NMS: YOLO26 elimina la necesidad del postprocesamiento de supresión de no máximos. Este diseño de extremo a extremo simplifica las canalizaciones de despliegue y reduce drásticamente la variabilidad de la latencia.
- Hasta un 43 % más rápido en inferencia con CPU: Al eliminar estratégicamente el módulo de pérdida focal de distribución (DFL), YOLO26 está altamente optimizado para dispositivos edge y entornos sin GPU dedicadas.
- Integración del optimizador MuSGD: Inspirado en técnicas avanzadas de entrenamiento de LLM de Moonshot AI, este optimizador híbrido garantiza una estabilidad de entrenamiento sin precedentes y tasas de convergencia más rápidas.
- Detección superior de objetos pequeños: La introducción de las funciones de pérdida ProgLoss y STAL proporciona mejoras críticas de precisión para identificar detalles diminutos, lo que resulta perfecto para analizar imágenes aéreas captadas por drones y datos complejos de sensores IoT.
Para los usuarios interesados en arquitecturas basadas en Transformer o en paradigmas alternativos, la documentación de Ultralytics también cubre modelos como el detector Transformer RT-DETR y el modelo de vocabulario abierto YOLO-World.