YOLO11 frente a YOLOv5#
Elegir la arquitectura de red neuronal adecuada es una decisión fundamental para cualquier iniciativa de visión artificial. A medida que evoluciona el panorama de la inteligencia artificial, también lo hacen las herramientas disponibles para desarrolladores e investigadores. Esta guía completa ofrece una comparativa técnica en profundidad de dos modelos emblemáticos del ecosistema de Ultralytics: el aclamado YOLOv5 y el avanzado YOLO11.
Tanto si vas a implementar modelos ligeros para aplicaciones de IA en el borde como si vas a procesar secuencias de vídeo de alta resolución en GPU en la nube, comprender los matices arquitectónicos, las métricas de rendimiento y los casos de uso ideales de estos modelos te permitirá tomar una decisión basada en datos que se ajuste a tus requisitos de implementación específicos.
Linaje de los modelos y detalles técnicos#
Ambos modelos reflejan el compromiso de Ultralytics con la colaboración de código abierto, un rendimiento sólido y una facilidad de uso excepcional, lo que los convierte en opciones muy apreciadas por la comunidad mundial de aprendizaje automático.
Detalles de YOLO11#
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: ultralytics/ultralytics
- Documentación: Documentación de YOLO11
Detalles de YOLOv5#
- Autores: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- GitHub: ultralytics/yolov5
- Documentación: Documentación de YOLOv5
Diferencias arquitectónicas#
La evolución de YOLOv5 a YOLO11 introduce varios cambios arquitectónicos importantes, diseñados para optimizar la precisión y la eficiencia de los parámetros.
YOLOv5 fue pionero en el ecosistema PyTorch, al introducir una red troncal CSPNet (red parcial entre etapas) altamente optimizada y un cuello PANet (red de agregación de rutas). Se basaba en la detección mediante anclajes, que requería cajas de anclaje predefinidas para predecir los límites de los objetos. Aunque era muy eficaz, ajustar estos anclajes para conjuntos de datos de visión artificial personalizados podía resultar engorroso.
En cambio, YOLO11 adopta un paradigma de detección sin anclajes más moderno. Esto elimina la necesidad de ajustar manualmente las cajas de anclaje, agiliza el proceso de entrenamiento y mejora la generalización en conjuntos de datos diversos, como el conjunto de datos COCO. Además, YOLO11 incorpora una cabeza desacoplada, es decir, las tareas de clasificación y regresión de cajas delimitadoras se procesan en ramas separadas. Esta separación mejora significativamente la velocidad de convergencia y la precisión media promedio (mAP), especialmente en escenarios complejos de detección de objetos.
Métricas de rendimiento y pruebas de referencia#
La tabla siguiente compara las métricas clave de distintos tamaños de modelo. Los modelos de Ultralytics son conocidos por sus bajos requisitos de memoria y suelen consumir menos memoria CUDA durante el entrenamiento que las alternativas pesadas basadas en Transformer, lo que reduce drásticamente los requisitos de hardware para empezar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
Como se observa, YOLO11 ofrece un equilibrio de rendimiento muy favorable y obtiene sistemáticamente puntuaciones mAP más altas con un número de parámetros similar al de sus equivalentes YOLOv5.
Metodologías de entrenamiento y facilidad de uso#
Un principio fundamental de la filosofía de Ultralytics es ofrecer una facilidad de uso excepcional, respaldada por un ecosistema bien mantenido y un amplio apoyo de la comunidad.
Históricamente, YOLOv5 se basaba en sólidos scripts de interfaz de línea de comandos (CLI) (train.py, detect.py) para su ejecución. Aunque eran potentes, integrar estos scripts directamente en aplicaciones Python personalizadas solía requerir soluciones alternativas.
YOLO11 se basa en el paquete Python optimizado ultralytics (introducido con YOLOv8). Esta API unificada gestiona de forma nativa todo el proceso, desde el entrenamiento hasta la exportación de modelos a formatos como ONNX, OpenVINO y TensorRT.
Para trabajar sin código, los desarrolladores pueden utilizar la plataforma Ultralytics para anotar datos, entrenar modelos en la nube e implementarlos fácilmente en dispositivos de borde.
Comparativa de código#
Entrenar un modelo de Ultralytics hoy en día es increíblemente eficiente. Así puedes entrenar YOLO11 con su API Python nativa:
from ultralytics import YOLO
# Carga un modelo YOLO11 pequeño preentrenado
model = YOLO("yolo11s.pt")
# # Entrena el modelo con datos personalizados
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# # Exporta el modelo a ONNX para implementarlo
model.export(format="onnx")Para los sistemas heredados que utilizan YOLOv5, el entrenamiento mediante CLI sería así:
# Clone the repository and run the training script
git clone https://github.com/ultralytics/yolov5
cd yolov5
pip install -r requirements.txt
python train.py --img 640 --batch 16 --epochs 50 --data coco128.yaml --weights yolov5s.ptCasos de uso ideales y aplicaciones reales#
Ambos modelos tienen puntos fuertes distintos, adaptados a diferentes entornos operativos.
Cuándo utilizar YOLOv5#
Pese a pertenecer a una generación anterior, YOLOv5 sigue siendo una opción muy potente. Se recomienda especialmente para:
- Integración con sistemas heredados: Entornos profundamente integrados con las estructuras tensoriales específicas de YOLOv5 o con flujos de implementación que no se pueden refactorizar fácilmente.
- Referencias académicas: Para investigadores que necesitan referencias consolidadas y de larga trayectoria para estudios académicos reproducibles en análisis de imágenes médicas.
Cuándo utilizar YOLO11#
YOLO11 es la opción ideal para los flujos de producción modernos gracias a su increíble versatilidad:
- Entornos con varias tareas: A diferencia de YOLOv5, que es principalmente un detector (al que se añadieron funciones de segmentación posteriormente), YOLO11 admite de forma nativa la segmentación de instancias, la clasificación de imágenes, la estimación de pose y la detección de cajas delimitadoras orientadas (OBB), sin necesidad de configuraciones adicionales.
- Analítica de vídeo de alta densidad: Ideal para sistemas de tráfico inteligentes o la gestión de inventario en comercios, donde es fundamental extraer la máxima precisión de escenas complejas.
De cara al futuro: la arquitectura YOLO26#
Aunque YOLO11 es un modelo excepcional, la frontera de la visión artificial sigue avanzando rápidamente. Los desarrolladores que busquen la máxima eficiencia también deberían considerar el nuevo Ultralytics YOLO26 (publicado en enero de 2026).
YOLO26 supone un enorme salto adelante y se ha diseñado expresamente tanto para la optimización en el borde como para la escala empresarial. Entre sus principales innovaciones se incluyen:
- Diseño integral sin NMS: YOLO26 admite inferencia nativa integral y omite el posprocesamiento de supresión no máxima (NMS) con
nms=False, lo que permite una implementación más rápida y sencilla. - Eliminación de DFL: Se ha eliminado Distribution Focal Loss para simplificar la exportación de modelos y mejorar la compatibilidad con dispositivos de bajo consumo.
- Optimizador MuSGD: Una innovadora combinación de SGD y Muon que aporta a la visión artificial la estabilidad del entrenamiento de LLM para lograr una convergencia más rápida.
- Inferencia en CPU hasta un 43 % más rápida: Se ha optimizado exhaustivamente para implementaciones de IoT y dispositivos sin GPU dedicadas.
- ProgLoss + STAL: Funciones de pérdida muy mejoradas que ofrecen avances notables en el reconocimiento de objetos pequeños, algo esencial para las imágenes aéreas captadas por drones.
Resumen#
La elección entre YOLO11 y YOLOv5 depende, en última instancia, de la fase del ciclo de vida de tu proyecto. El legado de YOLOv5 es innegable: ofrece una estabilidad excepcional y el respaldo de una comunidad enorme. Sin embargo, para cualquier proyecto nuevo, se recomienda encarecidamente YOLO11 frente a las generaciones anteriores. Combina una precisión de vanguardia, una API Python excepcionalmente elegante y un menor consumo de memoria durante el entrenamiento, lo que consolida la posición de Ultralytics a la vanguardia de la innovación en IA. Si quieres ir aún más lejos, explorar el avanzado YOLO26 en la plataforma Ultralytics te permitirá obtener resultados inigualables.