YOLOv10 frente a YOLO11#
El panorama de la visión artificial evoluciona constantemente, y nuevas arquitecturas amplían los límites de lo posible en el procesamiento en tiempo real. Para los desarrolladores e investigadores que se adentran en este campo de rápida evolución, es fundamental entender los matices entre los modelos más avanzados. Esta comparativa detallada analiza las diferencias técnicas, las concesiones de rendimiento y los casos de uso idóneos de YOLOv10 y Ultralytics YOLO11, dos marcos de detección de objetos muy capaces.
Aunque ambos modelos obtienen resultados notables en conjuntos de datos de referencia, sus filosofías de diseño y sus integraciones en el ecosistema subyacentes difieren significativamente. Al examinar sus arquitecturas, podemos identificar qué solución se adapta mejor a las limitaciones de implementación y los objetivos de tu proyecto.
YOLOv10: pionero en detección integral sin NMS#
Lanzado en la primavera de 2024, YOLOv10 introdujo un enfoque novedoso para el flujo de trabajo tradicional de detección de objetos, al abordar directamente la latencia adicional asociada al posprocesamiento.
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 23 de mayo de 2024
- Artículo de investigación: arXiv:2405.14458
- Código fuente: THU-MIG/yolov10 en GitHub
- Documentación: Documentación de YOLOv10
La innovación más destacada de YOLOv10 es su estrategia coherente de asignación dual, que permite entrenar sin NMS. Los detectores de objetos tradicionales dependen en gran medida de la supresión no máxima (NMS) para filtrar las predicciones redundantes de cajas delimitadoras. Al eliminar este paso, YOLOv10 consigue una detección integral real, reduce la latencia de inferencia y simplifica la implementación en aceleradores de hardware como las unidades de procesamiento neuronal (NPUs), en las que las operaciones NMS personalizadas son notoriamente difíciles de optimizar.
YOLO11: versatilidad y rendimiento impulsados por el ecosistema#
Lanzado más tarde ese mismo año, YOLO11 representa la mejora continua de la familia de modelos de Ultralytics, con especial atención al equilibrio óptimo entre velocidad, precisión y experiencia de desarrollo.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 27 de septiembre de 2024
- Código fuente: Ultralytics en GitHub
- Integración con la plataforma: Plataforma Ultralytics
YOLO11 está diseñado para producción. Aunque destaca en la detección estándar de cajas delimitadoras, su verdadera fortaleza reside en la versatilidad. A diferencia de YOLOv10, que se centra principalmente en la detección de objetos, YOLO11 admite de forma nativa tareas de segmentación de instancias, estimación de pose, clasificación de imágenes y cajas delimitadoras orientadas (OBB) mediante una arquitectura unificada. Destaca por sus requisitos de memoria notablemente bajos durante el entrenamiento, lo que lo hace muy accesible para los equipos que trabajan con GPU de consumo, en comparación con arquitecturas más pesadas basadas en Transformer.
Comparativa de rendimiento y métricas#
Al comparar estos modelos directamente, es fundamental analizar su rendimiento en distintas variantes de tamaño en pruebas de referencia estándar como el conjunto de datos COCO.
La siguiente tabla destaca las diferencias de rendimiento. YOLO11 suele superar ligeramente a YOLOv10 en mAP en la mayoría de las categorías de tamaño, al tiempo que mantiene velocidades de inferencia muy competitivas con TensorRT.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
Para reproducir localmente estas rápidas velocidades de inferencia, asegúrate de exportar los modelos a formatos optimizados como OpenVINO para CPU de Intel o TensorRT para GPU de NVIDIA.
Análisis en profundidad de la arquitectura#
Metodología y eficiencia del entrenamiento#
La arquitectura de YOLOv10 pone el foco en reducir la redundancia computacional. Al optimizar los diseños del backbone y del neck mediante una estrategia integral que busca la eficiencia y la precisión, los autores de la Universidad de Tsinghua consiguieron reducir significativamente el número de parámetros de los modelos de gama media (como YOLOv10m) en comparación con las versiones anteriores.
Sin embargo, la eficiencia del entrenamiento es una característica clave de los modelos de Ultralytics. YOLO11 utiliza el paquete de Python ultralytics, muy perfeccionado, que abstrae la compleja optimización de hiperparámetros. Este marco gestiona automáticamente las técnicas avanzadas de aumento de datos, la planificación de la tasa de aprendizaje y el entrenamiento distribuido en varias GPU desde el primer momento. La arquitectura de YOLO11 también ofrece un flujo de gradientes excelente, lo que se traduce en una convergencia más rápida y un menor uso de VRAM durante el entrenamiento.
Facilidad de uso y ventajas del ecosistema#
Un factor fundamental para la adopción empresarial es contar con un ecosistema bien mantenido. Los repositorios de investigación, aunque sean innovadores, suelen quedar abandonados tras la publicación inicial del artículo. El ecosistema de Ultralytics, que respalda YOLO11, ofrece una experiencia de desarrollo integral y fluida.
Gracias a su integración fluida con herramientas como Weights & Biases para el seguimiento de experimentos y Roboflow para la gestión de conjuntos de datos, YOLO11 acelera la transición del prototipo a producción. La facilidad de uso queda patente en una API simplificada que permite a los desarrolladores entrenar y exportar modelos con solo unas pocas líneas de código.
from ultralytics import YOLO
# Inicializa el modelo YOLO11 pequeño
model = YOLO("yolo11s.pt")
# Entrena el modelo de forma eficiente con una gestión optimizada de la memoria
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="0")
# Expórtalo al formato ONNX para facilitar su implementación
model.export(format="onnx")Casos de uso y recomendaciones#
Elegir entre YOLOv10 y YOLO11 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una buena opción para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección de extremo a extremo sin supresión no máxima, lo que reduce la complejidad de la implementación.
- Equilibrio entre velocidad y precisión: Proyectos que necesitan un buen equilibrio entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia constante: Escenarios de implementación en los que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir YOLO11#
Se recomienda YOLO11 para:
- Despliegue periférico en producción: Aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
- Aplicaciones de visión multitarea: Proyectos que requieren detección, segmentación, estimación de poses y OBB dentro de un único framework unificado.
- Prototipado y despliegue rápidos: Equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la sencilla API de Python de Ultralytics.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
Exploración de otras arquitecturas#
Aunque YOLOv10 y YOLO11 son opciones excelentes, tu caso de uso concreto podría beneficiarse de otras arquitecturas disponibles en la documentación. Para el razonamiento basado en secuencias, los modelos Transformer como RT-DETR ofrecen una gran precisión, aunque suelen requerir más memoria. En cambio, si necesitas capacidades de zero-shot para identificar clases nuevas sin volver a entrenar, YOLO-World ofrece un enfoque de vocabulario abierto basado en instrucciones en lenguaje natural.
La próxima generación: YOLO26#
Para los equipos que buscan lo más avanzado, la recién lanzada Ultralytics YOLO26 combina las mejores características de ambos modelos mencionados. Lanzado en enero de 2026, YOLO26 es la recomendación definitiva para los escenarios de implementación actuales.
Sobre la base de sus predecesores, YOLO26 incorpora de forma nativa un diseño integral opcional sin NMS (nms=False), que elimina eficazmente los cuellos de botella del posprocesamiento que YOLOv10 abordó por primera vez, pero dentro del sólido marco de Ultralytics. Además, YOLO26 elimina DFL (pérdida focal de distribución), lo que simplifica enormemente los grafos de exportación del modelo y mejora la compatibilidad con dispositivos edge y dispositivos IoT de bajo consumo.
La estabilidad del entrenamiento también ha dado un salto generacional con la introducción del optimizador MuSGD, un enfoque híbrido inspirado en las metodologías de entrenamiento de los LLM que garantiza una convergencia increíblemente rápida. Combinado con funciones de pérdida avanzadas como ProgLoss + STAL, YOLO26 mejora notablemente el reconocimiento de objetos pequeños. Para su implementación en dispositivos edge estándar, estas mejoras arquitectónicas permiten una inferencia en CPU hasta un 43 % más rápida, lo que convierte a YOLO26 en una opción inigualable para todas las tareas de visión artificial.