YOLOv5 frente a YOLO11#
Al elegir la arquitectura de visión artificial adecuada para un proyecto nuevo, es fundamental comprender la evolución de los modelos más avanzados. El paso de las primeras arquitecturas a los frameworks unificados modernos refleja avances importantes tanto en eficiencia algorítmica como en la experiencia de desarrollo. Esta guía ofrece una comparación técnica detallada de dos modelos emblemáticos desarrollados por Ultralytics: el pionero YOLOv5 y el altamente perfeccionado YOLO11.
Introducción a los modelos#
Ambas arquitecturas representan hitos importantes en la detección de objetos en tiempo real y ofrecen ventajas distintas en función del entorno de despliegue y de los requisitos heredados.
YOLOv5: el caballo de batalla del sector#
Lanzado en el verano de 2020, YOLOv5 se convirtió rápidamente en un estándar del sector gracias a su implementación nativa en PyTorch, que redujo drásticamente las barreras de entrada al entrenamiento y al despliegue. Se alejó de los complejos frameworks C de Darknet de sus predecesores y ofreció un enfoque de desarrollo de modelos propio de Python.
- Autores: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: ultralytics/yolov5
- Documentación: Documentación de YOLOv5
YOLOv5 estableció una sólida referencia en facilidad de uso e introdujo métodos de entrenamiento potentes, como la ampliación avanzada de datos con mosaicos y el autoanclaje. Sigue siendo muy popular entre los investigadores que trabajan con una base de código bien documentada y probada a fondo.
YOLO11: el framework unificado de visión#
A partir de años de comentarios e investigación arquitectónica, YOLO11 se presentó como parte de un framework unificado capaz de gestionar de forma nativa varias tareas de visión. Se diseñó desde cero para ofrecer la máxima versatilidad y eficiencia, más allá de los cuadros delimitadores.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: ultralytics/ultralytics
- Documentación: Documentación de YOLO11
YOLO11 ofrece una experiencia de usuario simplificada mediante el paquete de Python ultralytics, con una API sencilla que unifica la detección de objetos, la segmentación de instancias, la clasificación, la estimación de pose y los cuadros delimitadores orientados (OBB). Logra un equilibrio muy favorable entre velocidad y precisión, por lo que resulta ideal para diversos escenarios de despliegue reales.
Ambos modelos aprovechan el ecosistema de la plataforma Ultralytics, que cuenta con un sólido mantenimiento. Este entorno integrado simplifica la anotación de conjuntos de datos, el entrenamiento en la nube y la exportación de modelos para distintos tipos de hardware.
Comparativa de rendimiento y métricas#
Una comparación directa de estos modelos muestra cómo las mejoras arquitectónicas se traducen en ganancias de rendimiento tangibles. La siguiente tabla muestra la precisión media promedio (mAP) evaluada en el conjunto de datos COCO, junto con las velocidades de inferencia en CPU y GPU y el número de parámetros.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Análisis de los resultados#
Las métricas destacan el claro salto en el equilibrio de rendimiento alcanzado por YOLO11. Por ejemplo, el modelo YOLO11n (nano) logra un 39,5 % de mAP frente al 28,0 % de YOLOv5n: una mejora de 11,5 puntos con solo 0,7 M de parámetros adicionales. Además, YOLO11 requiere mucha menos memoria durante el entrenamiento que los modelos basados en Transformer de gran tamaño, por lo que resulta muy accesible para desplegarlo en hardware de consumo y dispositivos periféricos.
Diferencias arquitectónicas#
Las mejoras de rendimiento de YOLO11 se deben a varios avances arquitectónicos clave. Mientras que YOLOv5 utilizaba un backbone CSPNet estándar con módulos C3, los modelos más recientes de Ultralytics introdujeron bloques de extracción de características más eficientes, como C2f (YOLOv8) y C3k2 (YOLO11), que optimizan el flujo del gradiente y reducen la carga computacional.
YOLO11 también cuenta con un cabezal muy perfeccionado. Las arquitecturas más recientes de Ultralytics abandonan el diseño basado en anclajes de los modelos antiguos y adoptan un enfoque sin anclajes. Esto reduce el número de predicciones de cuadros, agiliza la canalización de posprocesamiento y mejora la capacidad de generalización del modelo en distintas escalas y relaciones de aspecto. Además, estos modelos ofrecen una mayor eficiencia de entrenamiento y pesos preentrenados disponibles que aceleran la convergencia de los conjuntos de datos ajustados.
Implementación y ejemplos de código#
Una de las características más destacadas del ecosistema Ultralytics es su sencillez. Aunque YOLOv5 popularizó el uso de torch.hub para realizar inferencias rápidamente, YOLO11 va un paso más allá con el paquete unificado de Python ultralytics.
Entrenamiento con YOLO11#
Cargar, entrenar y validar un modelo requiere muy poco código repetitivo. La API gestiona sin problemas el ajuste de hiperparámetros y la administración de modelos.
from ultralytics import YOLO
# Carga un modelo YOLO11 preentrenado
model = YOLO("yolo11s.pt")
# # Entrena con un conjunto de datos personalizado durante 50 épocas
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# # Ejecuta una inferencia rápida y muestra los resultados
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# # Exporta fácilmente el modelo a TensorRT para acelerar el hardware
model.export(format="engine")Inferencia heredada con YOLOv5#
Si mantienes una canalización antigua, YOLOv5 se integra directamente con el mecanismo de carga nativo de PyTorch, por lo que resulta muy sencillo incorporarlo a los scripts de inferencia existentes.
import torch
# # Carga desde PyTorch Hub un modelo YOLOv5 personalizado o preentrenado
model = torch.hub.load("ultralytics/yolov5", "yolov5s")
# # Realiza inferencias sobre la URL de una imagen
results = model("https://ultralytics.com/images/zidane.jpg")
# # Muestra los detalles de la predicción en la consola
results.print()Ambos modelos admiten numerosos formatos de exportación. Tanto si te diriges a una NVIDIA Jetson con TensorRT como a una aplicación de iOS con CoreML, el proceso de despliegue está ampliamente documentado y cuenta con el respaldo de la comunidad.
Casos de uso ideales#
La elección entre estos modelos depende en gran medida de la fase del ciclo de vida del proyecto y de sus requisitos específicos.
Cuándo elegir YOLOv5#
- Mantenimiento de bases de código heredadas: si tu entorno de producción está muy personalizado en torno a la estructura del repositorio de YOLOv5 o a técnicas específicas de evolución de hiperparámetros.
- Referencias académicas: cuando publiques investigaciones que requieran una comparación directa con los estándares de visión artificial establecidos entre 2020 y 2022.
Cuándo elegir YOLO11#
- Proyectos con varias tareas: cuando tu aplicación requiera combinar tareas como la estimación de pose y la segmentación de instancias mediante una única API unificada.
- Despliegues en el borde: para escenarios de computación en el borde en los que sea fundamental maximizar el mAP con un presupuesto computacional determinado (FLOPs).
- Soluciones comerciales de IA: ideal para aplicaciones empresariales en los sectores del comercio minorista y la seguridad, con el sólido respaldo de la plataforma Ultralytics.
La próxima generación: Ultralytics YOLO26#
Aunque YOLO11 ofrece un equilibrio fantástico entre velocidad y precisión, el campo de la inteligencia artificial evoluciona rápidamente. Si vas a empezar un proyecto nuevo hoy, te recomendamos encarecidamente que explores el estándar más reciente de IA visual: Ultralytics YOLO26.
Lanzado en enero de 2026, YOLO26 incorpora avances revolucionarios diseñados específicamente para las necesidades de despliegue actuales:
- Diseño integral sin NMS: a partir de conceptos que YOLOv10 introdujo por primera vez, YOLO26 ofrece un diseño integral nativo. Su cabezal opcional uno a uno (
nms=False) elimina la necesidad de aplicar la supresión de no máximos (NMS) en el posprocesamiento, lo que simplifica notablemente las canalizaciones de despliegue y reduce la latencia. - Optimizador MuSGD: inspirado en las innovaciones de entrenamiento de LLM de modelos como Kimi K2 de Moonshot AI, esta combinación de SGD y Muon garantiza un entrenamiento muy estable y una convergencia mucho más rápida.
- Velocidad de CPU sin precedentes: al eliminar la pérdida focal de distribución (DFL), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, por lo que es la mejor opción para dispositivos periféricos y entornos sin GPU dedicada.
- Funciones de pérdida avanzadas: la integración de ProgLoss y STAL mejora notablemente el reconocimiento de objetos pequeños, algo fundamental para el análisis con drones, IoT y robótica.
- Mejoras específicas para cada tarea: introduce optimizaciones especializadas, como la estimación de log-verosimilitud residual (RLE) para la estimación de pose y una función de pérdida angular especializada para los cuadros delimitadores orientados, lo que garantiza un rendimiento superior en todas las tareas de visión artificial.
Si te interesan arquitecturas especializadas que vayan más allá de la detección de objetos estándar, también puedes explorar modelos como RT-DETR para la detección basada en Transformer o YOLO-World para el seguimiento y la detección con vocabulario abierto. El uso de estas herramientas optimizadas y con un sólido mantenimiento permite que tus canalizaciones de visión artificial sigan siendo eficientes, escalables y vanguardistas.