YOLOv8 frente a YOLO11#
La rápida evolución de la visión artificial se ha visto impulsada en gran medida por los continuos avances en los frameworks de detección de objetos en tiempo real. Para los desarrolladores e investigadores que se mueven en el panorama actual, elegir el modelo adecuado es fundamental para equilibrar la precisión, la velocidad y la eficiencia de los recursos. En esta comparación técnica, exploraremos las diferencias entre dos modelos fundamentales del ecosistema de Ultralytics: Ultralytics YOLOv8 y Ultralytics YOLO11.
Ambos modelos presentan las características distintivas de las arquitecturas de Ultralytics: facilidad de uso, un ecosistema bien mantenido y una eficiencia de entrenamiento inigualable con pocos requisitos de memoria. Veamos en detalle sus diseños arquitectónicos, resultados de rendimiento y escenarios de implementación ideales.
Descripción general de los modelos#
Antes de comparar sus ventajas técnicas específicas, conviene conocer los orígenes y las especificaciones principales de ambos modelos.
Ultralytics YOLOv8#
Lanzado a principios de 2023 como un gran avance, YOLOv8 introdujo la detección sin anclajes y mejoras importantes en las funciones de pérdida, y rápidamente se convirtió en el estándar de referencia para una amplia variedad de tareas de aprendizaje automático.
- Autores: Glenn Jocher, Ayush Chaurasia y Jing Qiu
- Organización: Ultralytics
- Fecha: 2023-01-10
- GitHub: ultralytics/ultralytics
Ultralytics YOLO11#
A partir del éxito de sus predecesores, YOLO11 perfeccionó la arquitectura principal para ampliar aún más la frontera de Pareto entre precisión y latencia, con un número de parámetros altamente optimizado sin sacrificar la capacidad predictiva.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: ultralytics/ultralytics
Si estás explorando otros enfoques, Ultralytics también admite modelos basados en Transformer, como RT-DETR, y detectores de vocabulario abierto de disparo cero, como YOLO-World. Sin embargo, para lograr una latencia y una eficiencia de memoria óptimas, las arquitecturas YOLO estándar suelen seguir siendo la opción preferida.
Diferencias arquitectónicas y metodológicas#
El paso de YOLOv8 a YOLO11 representa una evolución cuidada del diseño de redes neuronales, no una renovación completa, lo que garantiza la estabilidad del ecosistema bien mantenido que rodea a los modelos.
Optimizaciones del backbone y el neck#
YOLOv8 introdujo un backbone CNN simplificado que prescindía de las cajas de anclaje y planteaba la detección de objetos como un problema de predicción de puntos centrales. Este enfoque sin anclajes redujo considerablemente la complejidad de la regresión de cajas delimitadoras. YOLO11 partió de estos cimientos e incorporó una red piramidal de características (FPN) optimizada, además de modificar los bloques C2f para convertirlos en módulos C3k2. Esta modificación permite a YOLO11 extraer características espaciales más ricas, lo que mejora la precisión con objetos pequeños, habituales en el conjunto de datos COCO.
Requisitos de memoria y eficiencia del entrenamiento#
Una de las ventajas más destacadas de YOLOv8 y YOLO11 son sus bajos requisitos de memoria durante el entrenamiento. A diferencia de los pesados Transformer de visión, que pueden agotar rápidamente la VRAM del hardware de consumo, estos modelos están optimizados para entrenar fácilmente con PyTorch en GPU estándar. YOLO11 reduce considerablemente el número total de parámetros: hasta un 42 % menos en la variante grande (L) que YOLOv8, y al mismo tiempo aumenta la precisión media promedio (mAP). Esto se traduce en épocas más rápidas y una menor huella de carbono durante el entrenamiento del modelo.
Métricas de rendimiento#
Para evaluar de verdad el equilibrio de rendimiento de estos modelos, debemos fijarnos en resultados objetivos. La tabla siguiente compara YOLOv8 y YOLO11 en las variantes de escala estándar, desde nano hasta extragrande.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Como se muestra, YOLO11 supera sistemáticamente a YOLOv8 en precisión y utiliza menos parámetros y FLOPs. La velocidad de inferencia en CPU, medida con ONNX Runtime, pone de manifiesto la mayor eficiencia de YOLO11 para las implementaciones en el edge. Al exportar los modelos a NVIDIA TensorRT, ambos ofrecen latencias excepcionales inferiores a 15 ms, esenciales para analizar flujos de vídeo en situaciones reales.
Ecosistema y facilidad de uso#
Ambos modelos se benefician enormemente del paquete unificado de Python ultralytics. Esta facilidad de uso permite a los ingenieros cambiar fácilmente de YOLOv8 a YOLO11. El entrenamiento, la validación y la exportación se completan con solo unas pocas líneas de código.
from ultralytics import YOLO
# Carga un modelo YOLO11 preentrenado (puedes cambiarlo fácilmente por "yolov8n.pt")
model = YOLO("yolo11n.pt")
# Entrena el modelo de forma eficiente con un conjunto de datos local
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Exporta el modelo optimizado a ONNX
model.export(format="onnx")La integración fluida también se extiende a la plataforma de Ultralytics, que simplifica el entrenamiento en la nube, la supervisión de modelos y la implementación sin necesidad de conocimientos avanzados de DevOps.
Versatilidad y aplicaciones reales#
Una de las características principales del framework de Ultralytics es su versatilidad inherente. Tanto YOLOv8 como YOLO11 admiten una amplia variedad de tareas de visión artificial, además de la detección de objetos estándar:
- Segmentación de instancias: máscaras de gran precisión a nivel de píxel, útiles para la obtención de imágenes médicas y la conducción autónoma.
- Estimación de poses: detección de puntos clave adaptada al análisis deportivo y a la interacción entre personas y ordenadores.
- Clasificación de imágenes: clasificación ligera mediante backbones entrenados con ImageNet.
- Cajas delimitadoras orientadas (OBB): fundamentales para identificar objetos girados en imágenes satelitales.
YOLOv8 lleva más tiempo disponible, por lo que cuenta con una enorme colección de tutoriales de la comunidad e implementaciones empresariales ampliamente probadas. Si estás integrándolo en procesos heredados que requieren específicamente las formas de tensor de YOLOv8, sigue siendo una opción muy fiable. Sin embargo, para proyectos nuevos que priorizan la máxima eficiencia —como la implementación en dispositivos periféricos integrados como Raspberry Pi—, YOLO11 es claramente superior en la práctica gracias a su mejor relación entre velocidad y número de parámetros.
Casos de uso y recomendaciones#
La elección entre YOLOv8 y YOLO11 depende de los requisitos concretos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOv8#
YOLOv8 es una buena opción para:
- Implementaciones versátiles y multitarea: Proyectos que necesitan un modelo probado para detección, segmentación, clasificación y estimación de pose dentro del ecosistema Ultralytics.
- Sistemas de producción consolidados: Entornos de producción existentes basados en la arquitectura YOLOv8, con canalizaciones de implementación estables y bien probadas.
- Amplio respaldo de la comunidad y del ecosistema: Aplicaciones que se benefician de los numerosos tutoriales de YOLOv8, las integraciones de terceros y los recursos de una comunidad activa.
Cuándo elegir YOLO11#
Se recomienda YOLO11 para:
- Despliegue periférico en producción: Aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
- Aplicaciones de visión multitarea: Proyectos que requieren detección, segmentación, estimación de poses y OBB dentro de un único framework unificado.
- Prototipado y despliegue rápidos: Equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la sencilla API de Python de Ultralytics.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
La vanguardia: la ventaja de YOLO26#
Aunque YOLOv8 y YOLO11 son arquitecturas extraordinarias, el panorama de la IA no deja de evolucionar. Para los desarrolladores que buscan lo último en tecnología en 2026, Ultralytics YOLO26 representa el siguiente gran salto.
YOLO26 replantea por completo el proceso de implementación. Incorpora un diseño integral sin NMS, un enfoque revolucionario introducido por primera vez en YOLOv10 que, con nms=False, elimina los complejos pasos de posprocesamiento. Además, la eliminación de DFL (pérdida focal de distribución) simplifica enormemente la lógica de exportación y mejora la compatibilidad con dispositivos periféricos de bajo consumo, lo que permite una inferencia en CPU hasta un 43 % más rápida que la de sus predecesores.
El innovador optimizador MuSGD, inspirado en técnicas de entrenamiento de LLM, mejora drásticamente la estabilidad del entrenamiento y la velocidad de convergencia. Además, nuevas formulaciones de pérdida, como ProgLoss + STAL, mejoran notablemente el reconocimiento de objetos pequeños, un problema histórico en el IoT y la robótica. Gracias a mejoras específicas para cada tarea, como RLE para la estimación de poses y el proto multiescala para la segmentación, YOLO26 no tiene rival.
Empieza con YOLOv8 si necesitas un amplio respaldo de la comunidad para proyectos heredados. Pásate a YOLO11 para disfrutar de un equilibrio muy refinado entre velocidad y un menor número de parámetros. Da el salto a YOLO26 para adoptar la arquitectura del futuro, optimizada para dispositivos periféricos y sin NMS.
Conclusión#
La elección entre YOLOv8 y YOLO11 depende, en última instancia, del calendario de tu proyecto y de las limitaciones del hardware. YOLOv8 es un referente consolidado y probado en el sector, que ofrece una estabilidad inigualable. En cambio, YOLO11 perfecciona esa arquitectura y proporciona un mAP superior con menos parámetros, por lo que resulta muy atractivo para aplicaciones en el edge con recursos limitados. Elijas el modelo que elijas, la fluida API de Python de Ultralytics garantiza un flujo de trabajo de desarrollo ágil, eficiente y con un amplio respaldo. Y cuando estés listo para llevar al límite lo que se puede hacer en dispositivos periféricos, YOLO26 te estará esperando.