YOLOv10 frente a YOLO11#
El panorama de la visión por ordenador evoluciona constantemente, con nuevas arquitecturas que amplían los límites de lo posible en el procesamiento en tiempo real. Para desarrolladores e investigadores que se desenvuelven en este campo, que avanza a gran velocidad, comprender las diferencias entre los modelos más avanzados es fundamental. Esta comparación detallada explora las diferencias técnicas, las concesiones de rendimiento y los casos de uso ideales de YOLOv10 y Ultralytics YOLO11, dos marcos de detección de objetos muy capaces.
Aunque ambos modelos logran resultados extraordinarios en conjuntos de datos de referencia, sus filosofías de diseño subyacentes y sus integraciones con el ecosistema difieren considerablemente. Al examinar sus arquitecturas, podemos identificar qué solución se adapta mejor a tus limitaciones de implementación y a los objetivos de tu proyecto.
YOLOv10: detección pionera de extremo a extremo sin NMS#
Lanzado en la primavera de 2024, YOLOv10 introdujo un enfoque novedoso para la canalización tradicional de detección de objetos al abordar directamente la sobrecarga de latencia asociada al posprocesamiento.
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 23 de mayo de 2024
- Artículo de investigación: arXiv:2405.14458
- Código fuente: THU-MIG/yolov10 en GitHub
- Documentación: Documentación de YOLOv10
La innovación más destacada de YOLOv10 es su estrategia coherente de asignaciones duales, que permite el entrenamiento sin NMS. Los detectores de objetos tradicionales dependen en gran medida de la supresión de no máximos (NMS) para filtrar las predicciones redundantes de cuadros delimitadores. Al eliminar este paso, YOLOv10 logra una detección real de extremo a extremo, reduciendo la latencia de inferencia y simplificando la implementación en aceleradores de hardware como las unidades de procesamiento neuronal (NPUs), en los que las operaciones NMS personalizadas son especialmente difíciles de optimizar.
YOLO11: versatilidad y rendimiento impulsados por el ecosistema#
Lanzado más tarde ese mismo año, YOLO11 representa el perfeccionamiento continuo de la familia de modelos de Ultralytics, centrado en lograr un equilibrio óptimo entre velocidad, precisión y experiencia del desarrollador.
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 27 de septiembre de 2024
- Código fuente: Ultralytics en GitHub
- Integración con la plataforma: Ultralytics Platform
YOLO11 está diseñado para producción. Aunque destaca en la detección estándar de cuadros delimitadores, su verdadera fortaleza reside en su versatilidad. A diferencia de YOLOv10, centrado principalmente en la detección de objetos, YOLO11 admite de forma nativa tareas de segmentación de instancias, estimación de poses, clasificación de imágenes y cuadros delimitadores orientados (OBB) mediante una arquitectura unificada. Requiere muy poca memoria durante el entrenamiento, lo que lo hace muy accesible para equipos que trabajan con GPU de consumo en comparación con arquitecturas más pesadas basadas en Transformer.
Comparación de rendimiento y métricas#
Al comparar estos modelos directamente, es esencial observar su rendimiento en las distintas variantes de escala de benchmarks estándar como el conjunto de datos COCO.
La tabla siguiente destaca las diferencias de rendimiento. YOLO11 suele superar a YOLOv10 en mAP en la mayoría de las categorías de tamaño, manteniendo velocidades de inferencia TensorRT muy competitivas.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
Para reproducir localmente estas rápidas velocidades de inferencia, asegúrate de exportar tus modelos a formatos optimizados como OpenVINO para CPU Intel o TensorRT para GPU NVIDIA.
Análisis exhaustivo de la arquitectura#
Metodología y eficiencia del entrenamiento#
La arquitectura de YOLOv10 hace hincapié en reducir la redundancia computacional. Al optimizar los diseños del backbone y del neck mediante una estrategia integral orientada a la eficiencia y la precisión, los autores de la Universidad de Tsinghua lograron reducir considerablemente el número de parámetros en los modelos de gama media, como YOLOv10m, en comparación con las iteraciones anteriores.
Sin embargo, la Eficiencia del entrenamiento es una de las principales características de los modelos de Ultralytics. YOLO11 utiliza el paquete de ultralytics Python, altamente perfeccionado, que abstrae la complejidad del ajuste de hiperparámetros. Este marco gestiona automáticamente las técnicas avanzadas de aumento de datos, la programación de la tasa de aprendizaje y el entrenamiento distribuido con varias GPU desde el primer momento. La arquitectura de YOLO11 también presenta un flujo de gradientes excelente, lo que se traduce en una convergencia más rápida y un menor uso de VRAM durante la fase de entrenamiento.
Facilidad de uso y ventaja del ecosistema#
Un factor fundamental para la adopción empresarial es un ecosistema bien mantenido. Los repositorios de investigación, aunque son innovadores, a menudo quedan abandonados después de la publicación inicial del artículo. El ecosistema de Ultralytics, que respalda YOLO11, proporciona una experiencia de desarrollador fluida y de extremo a extremo.
Gracias a su integración fluida con herramientas como Weights & Biases para el seguimiento de experimentos y Roboflow para la gestión de conjuntos de datos, YOLO11 acelera la transición del prototipo a producción. La facilidad de uso resulta evidente en la API simplificada, que permite a los desarrolladores entrenar y exportar modelos con solo unas pocas líneas de código.
from ultralytics import YOLO
# Initialize the YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model efficiently with optimized memory handling
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="0")
# Export to ONNX format for deployment flexibility
model.export(format="onnx")Casos de uso y recomendaciones#
La elección entre YOLOv10 y YOLO11 depende de los requisitos específicos de tu proyecto, tus limitaciones de implementación y tus preferencias respecto al ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una opción sólida para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección integral sin supresión de no máximos, reduciendo la complejidad del despliegue.
- Equilibrios entre velocidad y precisión: Proyectos que requieren un equilibrio sólido entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia coherente: Situaciones de despliegue en las que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir YOLO11#
YOLO11 se recomienda para:
- Despliegue periférico en producción: aplicaciones comerciales en dispositivos como Raspberry Pi o NVIDIA Jetson, donde la fiabilidad y el mantenimiento activo son fundamentales.
- Aplicaciones de visión multitarea: proyectos que requieren detección, segmentación, estimación de pose y OBB dentro de un único framework unificado.
- Prototipado y despliegue rápidos: equipos que necesitan pasar rápidamente de la recopilación de datos a producción mediante la optimizada API de Python de Ultralytics.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
Exploración de otras arquitecturas#
Aunque YOLOv10 y YOLO11 son opciones excelentes, tu caso de uso específico podría beneficiarse de otras arquitecturas disponibles en la documentación. Para el razonamiento basado en secuencias, los modelos Transformer como RT-DETR ofrecen una gran precisión, aunque normalmente requieren más memoria. Por el contrario, si necesitas capacidades de zero-shot para identificar clases nuevas sin volver a entrenar, YOLO-World ofrece un enfoque de vocabulario abierto impulsado por indicaciones en lenguaje natural.
La nueva generación: YOLO26#
Para los equipos que buscan lo último en tecnología, el recién lanzado Ultralytics YOLO26 combina las mejores características de ambos modelos mencionados anteriormente. Lanzado en enero de 2026, YOLO26 es la recomendación definitiva para los escenarios de implementación modernos.
Sobre la base de los cimientos de sus predecesores, YOLO26 incorpora de forma nativa un diseño de extremo a extremo sin NMS, eliminando eficazmente los cuellos de botella del posprocesamiento que YOLOv10 abordó por primera vez, pero haciéndolo dentro del sólido marco de Ultralytics. Además, YOLO26 incorpora la eliminación de DFL (pérdida focal de distribución), lo que simplifica drásticamente los grafos de exportación del modelo y mejora la compatibilidad con dispositivos IoT periféricos y de bajo consumo.
La estabilidad del entrenamiento también ha experimentado un salto generacional con la introducción del optimizador MuSGD, un enfoque híbrido inspirado en las metodologías de entrenamiento de los LLM que garantiza una convergencia increíblemente rápida. Junto con funciones de pérdida avanzadas como ProgLoss + STAL, YOLO26 ofrece mejoras notables en el reconocimiento de objetos pequeños. Para la implementación en dispositivos periféricos estándar, estos perfeccionamientos arquitectónicos se traducen en una inferencia en CPU hasta un 43 % más rápida, lo que convierte a YOLO26 en una opción incomparable para todas las tareas de visión por ordenador.