YOLOv10 frente a YOLO26#
El panorama de la visión artificial ha experimentado avances notables en los últimos años, pasando de arquitecturas complejas que dependen en gran medida del posprocesamiento a modelos integrales optimizados. Esta comparación técnica analiza dos hitos importantes de esa evolución: el avance académico de YOLOv10 y el vanguardista YOLO26, preparado para el entorno empresarial. Al examinar sus arquitecturas, metodologías de entrenamiento y capacidades de implementación en el mundo real, los desarrolladores pueden tomar decisiones informadas al crear su próxima aplicación de IA visual.
YOLOv10: pionero en la detección integral de objetos#
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 2024-05-23
- Enlaces: Artículo de arXiv | Repositorio de GitHub
Lanzado a mediados de 2024, YOLOv10 supuso un importante avance en la investigación académica de visión artificial al abordar uno de los cuellos de botella más persistentes de la detección de objetos en tiempo real: la supresión no máxima (NMS). Los detectores de objetos tradicionales dependían en gran medida de NMS para filtrar las cajas delimitadoras redundantes, lo que añadía una latencia variable durante la inferencia y complicaba la implementación en el borde.
El equipo de la Universidad de Tsinghua introdujo una estrategia de asignación dual coherente para el entrenamiento sin NMS. Esto permitió que el modelo predijera cajas delimitadoras con precisión sin necesitar una etapa de filtrado de posprocesamiento, lo que mejoró directamente la latencia de inferencia y redujo las barreras para la implementación en aceleradores de hardware. Aunque es muy eficiente para las tareas de detección estándar, el modelo se centraba principalmente en predecir cajas delimitadoras y carecía de compatibilidad nativa con tareas más complejas, como la segmentación de instancias o la estimación de pose.
YOLO26: el nuevo estándar para la IA visual en el borde y la nube#
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2026-01-14
- Enlaces: Repositorio de GitHub | Plataforma de Ultralytics
Basado en los conceptos sin NMS desarrollados anteriormente, el recién lanzado YOLO26 representa la cumbre del rendimiento y la versatilidad. Diseñado tanto para la investigación académica como para implementaciones empresariales, ofrece un diseño integral sin NMS mediante un cabezal opcional uno a uno (nms=False) que omite el posprocesamiento de NMS para permitir una implementación más rápida y sencilla en todo el hardware compatible.
YOLO26 introduce varias mejoras arquitectónicas revolucionarias. La eliminación de la pérdida focal de distribución (DFL) simplifica significativamente el proceso de exportación del modelo y mejora la compatibilidad con dispositivos de borde de bajo consumo. Junto con estos cambios estructurales, YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo convierte en una opción excepcional para aplicaciones de IoT y robótica en las que puede no haber aceleración por GPU.
La estabilidad del entrenamiento y la velocidad de convergencia también han mejorado radicalmente gracias al uso del optimizador MuSGD, un híbrido de SGD y Muon inspirado en las técnicas de entrenamiento de los LLM. Combinado con funciones de pérdida avanzadas como ProgLoss + STAL, YOLO26 ofrece mejoras notables en el reconocimiento de objetos pequeños. También incorpora mejoras específicas para cada tarea, como la creación de prototipos multiescala para la segmentación, la estimación residual de máxima verosimilitud (RLE) para la estimación de pose y una función de pérdida angular especializada que resuelve los problemas de límites en la detección de cajas delimitadoras orientadas (OBB).
Para los equipos que quieran ampliar sus flujos de trabajo de visión artificial, la Plataforma de Ultralytics ofrece una integración sencilla con YOLO26, con anotación de datos intuitiva, entrenamiento automatizado en la nube y opciones de implementación con un solo clic, sin necesidad de una infraestructura MLOps extensa.
Comparación del rendimiento técnico#
Al evaluar estos modelos, es fundamental equilibrar la precisión, el tamaño del modelo y la velocidad de inferencia. La tabla siguiente destaca el rendimiento de ambas familias de modelos en distintas escalas, evaluadas en el conjunto de datos COCO estándar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Los datos demuestran claramente la ventaja evolutiva de la arquitectura más reciente. YOLO26 alcanza un mAP (precisión media promedio) más alto en todos los tamaños, a la vez que mantiene velocidades de inferencia muy competitivas. La eliminación de DFL en YOLO26 contribuye especialmente a su excepcional rendimiento de ONNX en CPU, un aspecto que solía plantear dificultades a las generaciones anteriores.
Metodologías de entrenamiento y ecosistema#
La utilidad de un modelo depende de la calidad del ecosistema que lo respalda. YOLOv10 ofrecía una excelente implementación académica basada en PyTorch, pero a menudo requiere configuración manual para tareas que van más allá de la detección básica.
En cambio, YOLO26 está totalmente integrado en el ecosistema de Ultralytics, bien mantenido. Esto garantiza unos requisitos de memoria durante el entrenamiento mucho menores que los de modelos basados en Transformer como RT-DETR, lo que permite a los investigadores entrenar redes de vanguardia con hardware de consumo. Su facilidad de uso es inigualable: ofrece una API unificada que gestiona automáticamente el aumento de datos, el ajuste de hiperparámetros y el registro.
Ejemplo de código: entrenamiento de YOLO26#
Para entrenar un modelo versátil y muy preciso solo necesitas unas pocas líneas de código Python:
from ultralytics import YOLO
# Carga el modelo YOLO26 pequeño y altamente optimizado
model = YOLO("yolo26s.pt")
# Entrena el modelo de forma eficiente con gestión automática de memoria
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
)
# Exporta a TensorRT el cabezal uno a uno sin NMS
model.export(format="engine", nms=False)Aplicaciones y casos de uso en el mundo real#
Elegir la arquitectura adecuada depende por completo de las limitaciones de implementación.
Computación de alto rendimiento en el edge#
Para aplicaciones que requieren una implementación rápida en microcontroladores, robótica o dispositivos móviles antiguos, la inferencia en CPU hasta un 43 % más rápida de YOLO26 lo convierte en la opción definitiva. Su arquitectura sin NMS ni DFL se convierte sin problemas a formatos como OpenVINO y TensorRT, ideales para el análisis de vídeo en tiempo real en infraestructuras de ciudades inteligentes.
Visión avanzada para múltiples tareas#
Aunque YOLOv10 destaca en la detección pura de cajas delimitadoras, los proyectos que requieren una comprensión visual detallada deben confiar en YOLO26. Desde la segmentación de instancias en imágenes médicas hasta la estimación de pose de precisión para el análisis deportivo, YOLO26 ofrece funciones de pérdida específicas para cada tarea que garantizan una precisión superior en distintos ámbitos.
Si tu proyecto requiere una detección robusta con vocabulario abierto, considera explorar YOLO-World. Para quienes mantienen flujos de trabajo antiguos, YOLO11 sigue siendo una alternativa potente y totalmente compatible dentro del marco de Ultralytics.
Casos de uso y recomendaciones#
Elegir entre YOLOv10 y YOLO26 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una buena opción para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección de extremo a extremo sin supresión no máxima, lo que reduce la complejidad de la implementación.
- Equilibrio entre velocidad y precisión: Proyectos que necesitan un buen equilibrio entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia constante: Escenarios de implementación en los que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir YOLO26#
Se recomienda YOLO26 para:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
Conclusión#
La transición de YOLOv10 a YOLO26 pone de manifiesto un cambio fundamental: de una prueba de concepto académica a soluciones empresariales listas para producción. Al adoptar el innovador diseño sin NMS y mejorarlo con el optimizador MuSGD, ProgLoss y una compatibilidad simplificada con dispositivos edge, YOLO26 establece un nuevo referente para lo que es posible en la visión artificial en tiempo real. Para los desarrolladores que buscan el mejor equilibrio entre velocidad, precisión y facilidad de uso, YOLO26 es la recomendación definitiva.