YOLOv8 frente a YOLO11#
La rápida evolución de la visión artificial se ha visto impulsada en gran medida por los avances continuos en los frameworks de detección de objetos en tiempo real. Para desarrolladores e investigadores que se desenvuelven en el panorama actual, elegir el modelo adecuado es fundamental para equilibrar precisión, velocidad y eficiencia de recursos. En esta comparación técnica, exploraremos las diferencias entre dos modelos fundamentales del ecosistema de Ultralytics: Ultralytics YOLOv8 y Ultralytics YOLO11.
Ambos modelos presentan las características distintivas de las arquitecturas de Ultralytics: facilidad de uso, un ecosistema bien mantenido y una eficiencia de entrenamiento incomparable con bajos requisitos de memoria. Analicemos en profundidad sus diseños arquitectónicos, benchmarks de rendimiento y escenarios de implementación ideales.
Descripción general de los modelos#
Antes de comparar sus méritos técnicos específicos, resulta útil establecer los orígenes y las especificaciones principales de ambos modelos.
Ultralytics YOLOv8#
Lanzado como un gran salto adelante a principios de 2023, YOLOv8 introdujo la detección sin anclajes y mejoras significativas en las funciones de pérdida, convirtiéndose rápidamente en el estándar de referencia para una amplia variedad de tareas de aprendizaje automático.
- Autores: Glenn Jocher, Ayush Chaurasia y Jing Qiu
- Organización: Ultralytics
- Fecha: 2023-01-10
- GitHub: ultralytics/ultralytics
Ultralytics YOLO11#
Basándose en el éxito de sus predecesores, YOLO11 perfeccionó la arquitectura principal para ampliar aún más la frontera de Pareto de precisión y latencia, introduciendo un número de parámetros altamente optimizado sin sacrificar la capacidad predictiva.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2024-09-27
- GitHub: ultralytics/ultralytics
Si estás explorando enfoques alternativos, Ultralytics también admite modelos basados en Transformer como RT-DETR y detectores de vocabulario abierto zero-shot como YOLO-World. Sin embargo, para obtener una latencia y una eficiencia de memoria óptimas, las arquitecturas YOLO estándar suelen seguir siendo la opción preferida.
Diferencias arquitectónicas y metodológicas#
El cambio de YOLOv8 a YOLO11 representa una evolución meditada en el diseño de redes neuronales, no una renovación completa, lo que garantiza que el ecosistema bien mantenido en torno a los modelos siga siendo estable.
Optimizaciones del backbone y el neck#
YOLOv8 introdujo un backbone CNN optimizado que se alejó de las anchor boxes tradicionales y trató la detección de objetos exclusivamente como un problema de predicción del punto central. Este enfoque sin anclajes redujo significativamente la complejidad de la regresión de BBox. YOLO11 tomó esta base e introdujo una red piramidal de características (FPN) optimizada, además de modificar los bloques C2f para convertirlos en módulos C3k2. Esta modificación permite a YOLO11 extraer características espaciales más ricas, lo que se traduce en una mayor precisión con objetos pequeños, habituales en el conjunto de datos COCO.
Requisitos de memoria y eficiencia de entrenamiento#
Una de las ventajas más destacadas de YOLOv8 y YOLO11 son sus bajos requisitos de memoria durante el entrenamiento. A diferencia de los Transformer de visión pesados, que pueden agotar fácilmente la VRAM en hardware de consumo, estos modelos están optimizados para el entrenamiento accesible con PyTorch en GPU estándar. YOLO11 logra una reducción sustancial del número total de parámetros —hasta un 42 % menos de parámetros en la variante grande (L) en comparación con YOLOv8— y, al mismo tiempo, aumenta su precisión media promedio (mAP). Esto se traduce en épocas más rápidas y una menor huella de carbono durante el entrenamiento del modelo.
Métricas de rendimiento#
Para evaluar realmente el equilibrio de rendimiento de estos modelos, debemos consultar benchmarks objetivos. La tabla siguiente compara YOLOv8 y YOLO11 en las variantes de escala estándar (de nano a extragrande).
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Como se muestra, YOLO11 supera constantemente a YOLOv8 en precisión, al tiempo que utiliza menos parámetros y FLOPs. La velocidad de inferencia en CPU, medida con ONNX Runtime, destaca la mayor eficiencia de YOLO11 para implementaciones en el edge. Al exportarse a NVIDIA TensorRT, ambos modelos ofrecen latencias excepcionales inferiores a 15 ms, esenciales para el análisis de streams de vídeo en situaciones reales.
Ecosistema y facilidad de uso#
Ambos modelos se benefician enormemente del paquete unificado de Python ultralytics. Esta facilidad de uso permite a los ingenieros cambiar sin problemas entre YOLOv8 y YOLO11. El entrenamiento, la validación y la exportación pueden realizarse con tan solo unas líneas de código.
from ultralytics import YOLO
# Load a pre-trained YOLO11 model (you can simply swap to "yolov8n.pt")
model = YOLO("yolo11n.pt")
# Train the model efficiently on a local dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# Export the optimized model to ONNX
model.export(format="onnx")La integración fluida se extiende a Ultralytics Platform, que simplifica el entrenamiento en la nube, la monitorización de modelos y la implementación sin necesidad de conocimientos avanzados de DevOps.
Versatilidad y aplicaciones en el mundo real#
Una de las principales características del framework Ultralytics es su versatilidad inherente. YOLOv8 y YOLO11 admiten una amplia variedad de tareas de visión artificial más allá de la detección de objetos estándar:
- Segmentación de instancias: Máscaras a nivel de píxel muy precisas, útiles para la obtención de imágenes médicas y la conducción autónoma.
- Estimación de pose: Detección de puntos clave adaptada a la analítica deportiva y la interacción persona-ordenador.
- Clasificación de imágenes: Categorización ligera mediante backbones entrenados con ImageNet.
- Cajas delimitadoras orientadas (OBB): Fundamentales para identificar objetos girados en imágenes de satélite.
YOLOv8, al llevar más tiempo disponible, cuenta con un repositorio enorme de tutoriales de la comunidad y numerosas implementaciones empresariales ampliamente probadas. Si estás integrando pipelines heredados que esperan estrictamente las formas de tensor de YOLOv8, sigue siendo una opción muy fiable. Sin embargo, para proyectos nuevos que prioricen la máxima eficiencia —como la implementación en dispositivos edge integrados, por ejemplo una Raspberry Pi—, YOLO11 es el claro ganador operativo gracias a su mejor relación entre velocidad y número de parámetros.
Casos de uso y recomendaciones#
La elección entre YOLOv8 y YOLO11 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOv8#
YOLOv8 es una buena opción para:
- Implementación multitarea versátil: Proyectos que requieren un modelo probado para detección, segmentación, clasificación y estimación de pose dentro del ecosistema de Ultralytics.
- Sistemas de producción consolidados: Entornos de producción existentes ya creados sobre la arquitectura YOLOv8, con canalizaciones de implementación estables y bien probadas.
- Amplio respaldo de la comunidad y el ecosistema: Aplicaciones que se benefician de los numerosos tutoriales de YOLOv8, integraciones de terceros y recursos activos de la comunidad.
Cuándo elegir YOLO11#
YOLO11 se recomienda para:
- Despliegue periférico en producción: aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
- Aplicaciones de visión multitarea: proyectos que requieren detección, segmentación, estimación de pose y OBB dentro de un único framework unificado.
- Prototipado y despliegue rápidos: equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la optimizada API de Python de Ultralytics.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La vanguardia: la ventaja de YOLO26#
Aunque YOLOv8 y YOLO11 son arquitecturas extraordinarias, el panorama de la IA nunca deja de evolucionar. Para los desarrolladores que buscan lo más avanzado del estado del arte en 2026, Ultralytics YOLO26 representa el siguiente salto monumental.
YOLO26 replantea por completo el pipeline de implementación. Cuenta con un diseño end-to-end sin NMS, un enfoque revolucionario desarrollado por primera vez en YOLOv10 que elimina los complejos pasos de posprocesamiento. Además, la eliminación de DFL (Distribution Focal Loss) simplifica enormemente la lógica de exportación y mejora la compatibilidad con dispositivos edge de bajo consumo, lo que se traduce en una inferencia en CPU hasta un 43 % más rápida en comparación con sus predecesores.
La estabilidad del entrenamiento y la velocidad de convergencia mejoran drásticamente gracias al novedoso optimizador MuSGD, un método híbrido inspirado en las técnicas de entrenamiento de los LLM. Además, nuevas formulaciones de pérdida como ProgLoss + STAL mejoran significativamente el reconocimiento de objetos pequeños, un problema histórico en IoT y robótica. Con mejoras específicas para cada tarea, como RLE para la estimación de pose y proto multiescala para la segmentación, YOLO26 no tiene rival.
Comienza tu recorrido con YOLOv8 si necesitas un amplio soporte de la comunidad para sistemas heredados. Pásate a YOLO11 para obtener un equilibrio muy refinado entre velocidad y un menor número de parámetros. Da el salto a YOLO26 para disfrutar de la arquitectura del futuro, optimizada para el edge y sin NMS.
Conclusión#
En última instancia, la elección entre YOLOv8 y YOLO11 se reduce al calendario de tu proyecto y a las limitaciones del hardware. YOLOv8 es un titán del sector, probado en numerosas situaciones, que ofrece una estabilidad incomparable. Por otro lado, YOLO11 perfecciona esa arquitectura y proporciona una mAP mayor con menos parámetros, lo que lo hace increíblemente atractivo para aplicaciones edge con recursos limitados. Independientemente de tu elección, la API de Python fluida de Ultralytics garantiza que tu flujo de desarrollo siga siendo ágil, eficiente y cuente con un amplio soporte. Y cuando estés preparado para ampliar los límites de lo posible en dispositivos edge, YOLO26 estará listo.