YOLO11 frente a YOLOv7#
El campo de la visión artificial sigue evolucionando a gran velocidad, y la detección de objetos en tiempo real continúa a la vanguardia de las aplicaciones de IA. Elegir la arquitectura adecuada para tu proyecto exige encontrar un equilibrio complejo entre velocidad, precisión y facilidad de despliegue. En esta guía ofrecemos una comparativa técnica exhaustiva de dos arquitecturas destacadas: Ultralytics YOLO11 y YOLOv7.
Antecedentes del modelo y detalles técnicos#
Ambos modelos han tenido un impacto considerable en la comunidad del aprendizaje profundo, pero proceden de filosofías y épocas de desarrollo distintas.
Detalles de YOLO11:
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- Documentación: https://docs.ultralytics.com/models/yolo11
Detalles de YOLOv7:
- Autores: Chien-Yao Wang, Alexey Bochkovskiy y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Fecha: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: https://github.com/WongKinYiu/yolov7
- Documentación: https://docs.ultralytics.com/models/yolov7
Diferencias arquitectónicas#
Al analizar los mecanismos internos, ambos detectores utilizan conceptos de última generación, aunque sus fundamentos estructurales son distintos.
YOLOv7 introdujo el concepto de redes de agregación de capas eficientes extendidas (E-ELAN). Esta arquitectura se diseñó para mejorar continuamente la capacidad de aprendizaje de la red sin destruir la ruta original del gradiente, un avance fundamental descrito en su artículo de investigación. YOLOv7 depende en gran medida de la reparametrización estructural y de una sólida metodología de «bag-of-freebies» durante el entrenamiento, lo que mejora la precisión general en el conjunto de datos COCO sin aumentar el coste de inferencia.
En cambio, YOLO11 se basa en la arquitectura Ultralytics, altamente optimizada. Su canalización de extracción de características es más refinada y utiliza menos parámetros, lo que reduce el consumo de memoria durante el entrenamiento. YOLO11 logra un equilibrio de rendimiento muy favorable: utiliza menos recursos computacionales (FLOPs) y, al mismo tiempo, iguala o supera la precisión de detección de modelos más grandes. Además, YOLO11 admite de forma nativa una mayor variedad de tareas, por lo que es una opción muy versátil para las aplicaciones modernas de visión artificial.
Una de las características más destacadas de los modelos YOLO de Ultralytics es que requieren menos memoria durante el entrenamiento que otros modelos de última generación, lo que permite a los desarrolladores entrenar redes potentes en hardware de consumo con PyTorch.
Comparativa de rendimiento y métricas#
Para evaluar con precisión la viabilidad en situaciones reales, es fundamental analizar métricas como la precisión media promedio (mAP), la velocidad de inferencia, los parámetros del modelo y la complejidad computacional (FLOPs). La siguiente tabla muestra cómo se comparan las variantes de YOLO11 con distintas escalas frente a los modelos YOLOv7 de mayor tamaño.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Como se observa, un modelo como YOLO11x alcanza una mAP de 54.7, superior a la mAP de 53.1 de YOLOv7x, y utiliza muchos menos parámetros (56.9M frente a 71.3M). Esto pone de manifiesto la mayor eficiencia arquitectónica de YOLO11.
Eficiencia de entrenamiento y facilidad de uso del ecosistema#
Una de las diferencias más determinantes entre estas dos arquitecturas es la experiencia de desarrollo y el ecosistema que las rodea.
YOLOv7 es, en esencia, un repositorio de investigación académica. Entrenar modelos suele requerir configuraciones de entorno complejas, gestionar dependencias manualmente y utilizar argumentos de línea de comandos extensos. Aunque permite experimentar con técnicas de vanguardia, adaptar el código del repositorio de YOLOv7 en GitHub a entornos de producción personalizados puede llevar mucho tiempo.
YOLO11 redefine por completo la facilidad de uso. Está totalmente integrado en la plataforma Ultralytics, un ecosistema completo y bien mantenido que ofrece flujos de trabajo integrales y sencillos. Desde el etiquetado de datos y el entrenamiento local hasta el despliegue, la API unificada de Python y la sencilla interfaz de línea de comandos agilizan todo el proceso.
Comparativa de código#
Entrenar un modelo de detección de objetos con YOLO11 solo requiere unas pocas líneas de código, lo que reduce considerablemente las barreras de entrada:
from ultralytics import YOLO
# Carga un modelo YOLO11 pequeño preentrenado
model = YOLO("yolo11s.pt")
# Entrena el modelo fácilmente con la API unificada
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Expórtalo rápidamente al formato ONNX
model.export(format="onnx")En cambio, un comando habitual para entrenar YOLOv7 tiene este aspecto y requiere configurar cuidadosamente las rutas, los archivos de configuración y los scripts bash:
python train.py --workers 8 --device 0 --batch-size 32 --data data/coco.yaml --img 640 640 --cfg cfg/training/yolov7.yaml --weights 'yolov7_training.pt'YOLO11 también ofrece una gran versatilidad. Mientras que YOLOv7 requiere bases de código completamente distintas o modificaciones importantes para admitir tareas distintas de la detección, como la estimación de poses o la segmentación, YOLO11 gestiona la detección de objetos, la segmentación de instancias, la clasificación de imágenes, la estimación de poses y la detección mediante cajas delimitadoras orientadas (OBB) en un único marco de trabajo coherente.
Aplicaciones reales y casos de uso ideales#
La elección entre YOLOv7 y YOLO11 depende por completo del alcance del proyecto y de las limitaciones de despliegue.
Cuándo tener en cuenta YOLOv7:
- Evaluación comparativa de modelos antiguos: Los investigadores académicos que exploren diseños de rutas de gradiente pueden utilizar YOLOv7 como referencia para evaluar nuevas redes neuronales convolucionales.
- Canalizaciones personalizadas existentes: Equipos con canalizaciones en C++ o CUDA muy personalizadas, creadas específicamente en torno a la lógica exclusiva de decodificación de cajas delimitadoras de YOLOv7.
Cuándo elegir YOLO11:
- Producción comercial: Las aplicaciones de comercio minorista inteligente o diagnóstico sanitario se benefician enormemente de una base de código bien mantenida y de la gran estabilidad de YOLO11.
- Entornos con recursos limitados: El reducido tamaño de YOLO11n lo hace especialmente adecuado para desplegarlo en dispositivos móviles y edge mediante ONNX.
- Proyectos multitarea: Si una aplicación debe identificar a una persona, representar su esqueleto (pose) y segmentar un objeto que tenga en las manos, YOLO11 ofrece una solución unificada.
A la vanguardia: avanzar con YOLO26#
Aunque YOLO11 es una opción muy robusta, la innovación en inteligencia artificial no se detiene. Para los ingenieros que empiezan proyectos nuevos hoy, recomendamos encarecidamente explorar Ultralytics YOLO26.
Lanzado en enero de 2026, YOLO26 incorpora un diseño integral sin NMS (nms=False) que elimina los cuellos de botella de latencia asociados al posprocesamiento de la supresión no máxima. Además, YOLO26 incorpora el revolucionario optimizador MuSGD, inspirado en metodologías de entrenamiento de LLM, para garantizar una convergencia más rápida. Gracias a las mejoras específicas de las funciones de pérdida ProgLoss + STAL y a unas inferencias en CPU hasta un 43 % más rápidas al eliminar DFL, YOLO26 está específicamente optimizado para la computación en el edge y representa actualmente la cumbre de la IA visual.
Si te interesan estructuras alternativas especializadas, explorar RT-DETR, basado en Transformer, o los modelos dinámicos de vocabulario abierto YOLO-World también puede ofrecer buenos resultados en distintas implementaciones de visión artificial.