YOLO11 frente a YOLOv7#
El panorama de la visión artificial sigue evolucionando a un ritmo acelerado, y la detección de objetos en tiempo real continúa a la vanguardia de las aplicaciones de IA. Elegir la arquitectura adecuada para tu proyecto requiere gestionar un complejo equilibrio entre velocidad, precisión y facilidad de implementación. En esta guía, ofrecemos una comparación técnica exhaustiva entre dos arquitecturas destacadas: Ultralytics YOLO11 y YOLOv7.
Antecedentes y detalles técnicos de los modelos#
Ambos modelos han tenido un impacto significativo en la comunidad del aprendizaje profundo, pero proceden de filosofías y épocas de desarrollo diferentes.
Detalles de YOLO11:
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: https://docs.ultralytics.com/models/yolo11
Detalles de YOLOv7:
- Autores: Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwan
- Fecha: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- Documentación: https://docs.ultralytics.com/models/yolov7
Diferencias arquitectónicas#
Al analizar los mecanismos internos, ambos detectores utilizan conceptos de vanguardia, pero sus fundamentos estructurales difieren.
YOLOv7 introdujo el concepto de redes de agregación de capas eficientes extendidas (E-ELAN). Esta arquitectura se diseñó para mejorar continuamente la capacidad de aprendizaje de la red sin destruir la ruta de gradiente original, un avance crucial descrito en su artículo de investigación. YOLOv7 depende en gran medida de la reparametrización estructural y de una sólida metodología de «bag-of-freebies» durante el entrenamiento, lo que mejora la precisión general en el conjunto de datos COCO sin aumentar los costes de inferencia.
En cambio, YOLO11 se basa en la arquitectura de Ultralytics, altamente optimizada. Hace hincapié en una canalización de extracción de características más refinada con menos parámetros, lo que reduce el uso de memoria durante el entrenamiento. YOLO11 logra un equilibrio de rendimiento muy favorable, utilizando menos recursos computacionales (FLOPs) y alcanzando o superando al mismo tiempo la precisión de detección de modelos más pesados. Además, YOLO11 admite de forma nativa una mayor variedad de tareas, por lo que es una opción muy versátil para las aplicaciones modernas de visión artificial.
Una de las características más destacadas de los modelos Ultralytics YOLO es que requieren menos memoria durante el entrenamiento que otros modelos de vanguardia, lo que permite a los desarrolladores entrenar redes potentes en hardware PyTorch de consumo.
Comparación de rendimiento y métricas#
Para evaluar con precisión la viabilidad en el mundo real, es esencial analizar métricas como la precisión media promedio (mAP), la velocidad de inferencia, los parámetros del modelo y la complejidad computacional (FLOPs). La siguiente tabla muestra cómo se comparan las variantes de escala de YOLO11 con los modelos YOLOv7 de mayor tamaño.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Como se observa, un modelo como YOLO11x alcanza un 54.7 mAP superior al 53.1 mAP de YOLOv7x, utilizando a la vez muchos menos parámetros (56.9M frente a 71.3M). Esto pone de manifiesto la mayor eficiencia arquitectónica de YOLO11.
Eficiencia del entrenamiento y usabilidad del ecosistema#
Una de las características más determinantes que diferencia estas dos arquitecturas es la experiencia del desarrollador y el ecosistema que las rodea.
YOLOv7 es fundamentalmente un repositorio de investigación académica. El entrenamiento de modelos suele requerir configuraciones complejas del entorno, la gestión manual de dependencias y el uso de argumentos extensos en la línea de comandos. Aunque permite realizar experimentos de vanguardia, adaptar el código del repositorio de YOLOv7 en GitHub a entornos de producción personalizados puede llevar mucho tiempo.
YOLO11 redefine por completo la facilidad de uso. Está totalmente integrado en la plataforma de Ultralytics, un ecosistema completo y bien mantenido que ofrece flujos de trabajo integrales fluidos. Desde la anotación de datos y el entrenamiento local hasta la implementación, la API unificada de Python y la sencilla interfaz de línea de comandos agilizan todo el proceso.
Comparación de código#
Entrenar un modelo de detección de objetos con YOLO11 solo requiere unas pocas líneas de código, lo que reduce considerablemente la barrera de entrada:
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model effortlessly using the unified API
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Quickly export to ONNX format
model.export(format="onnx")En cambio, un comando de entrenamiento típico de YOLOv7 tiene este aspecto y requiere configurar cuidadosamente las rutas, los archivos de configuración y los scripts de bash:
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'YOLO11 también ofrece una enorme versatilidad. Mientras que YOLOv7 requiere bases de código completamente diferentes o modificaciones importantes para admitir tareas más allá de la detección, como la estimación de poses o la segmentación, YOLO11 gestiona la detección de objetos, la segmentación de instancias, la clasificación de imágenes, la estimación de poses y la detección de cajas delimitadoras orientadas (OBB) mediante un único marco de trabajo cohesionado.
Aplicaciones en el mundo real y casos de uso ideales#
Elegir entre YOLOv7 y YOLO11 depende por completo del alcance del proyecto y de las limitaciones de implementación.
Cuándo considerar YOLOv7:
- Evaluación comparativa de modelos antiguos: Los investigadores académicos que exploren diseños de rutas de gradiente pueden utilizar YOLOv7 como referencia para evaluar nuevas redes neuronales convolucionales.
- Canalizaciones personalizadas existentes: Equipos con canalizaciones de C++ o CUDA muy personalizadas y creadas específicamente en torno a la lógica exclusiva de YOLOv7 para decodificar cajas delimitadoras.
Cuándo elegir YOLO11:
- Producción comercial: Las aplicaciones de comercio minorista inteligente o diagnóstico sanitario se benefician enormemente de la base de código mantenida y la gran estabilidad de YOLO11.
- Entornos con recursos limitados: La reducida huella de YOLO11n lo hace especialmente adecuado para su implementación en dispositivos móviles y periféricos mediante ONNX.
- Proyectos multitarea: Si una aplicación necesita identificar a una persona, mapear su esqueleto (pose) y segmentar un objeto que sostiene, YOLO11 ofrece una solución unificada.
La vanguardia: avanzar con YOLO26#
Aunque YOLO11 es una opción muy sólida, la innovación en inteligencia artificial nunca se detiene. Para los ingenieros que comiencen nuevos proyectos hoy, es muy recomendable explorar Ultralytics YOLO26.
Lanzado en enero de 2026, YOLO26 introduce un diseño integral sin NMS, que elimina por completo los cuellos de botella de latencia asociados al posprocesamiento de supresión no máxima. Además, YOLO26 incorpora el revolucionario optimizador MuSGD, inspirado en las metodologías de entrenamiento de los LLM, para garantizar una convergencia más rápida. Con mejoras específicas de la función de pérdida mediante ProgLoss + STAL y una inferencia en CPU hasta un 43 % más rápida gracias a la eliminación de DFL, YOLO26 está optimizado específicamente para la computación periférica y representa actualmente la cima de la IA de visión.
Para los usuarios interesados en estructuras alternativas especializadas, explorar los modelos RT-DETR basados en Transformer o los modelos dinámicos de vocabulario abierto YOLO-World también puede ofrecer resultados beneficiosos en implementaciones diversas de visión artificial.