YOLOv10 frente a YOLOv8#
La evolución de la detección de objetos en tiempo real ha experimentado una rápida sucesión de arquitecturas revolucionarias, cada una de ellas intentando ampliar los límites de la precisión, la velocidad de inferencia y la eficiencia computacional. En esta guía técnica exhaustiva, comparamos dos hitos importantes del campo de la visión artificial: YOLOv10 y Ultralytics YOLOv8. Mientras que YOLOv8 estableció un estándar muy versátil y listo para producción, YOLOv10 introdujo cambios arquitectónicos específicamente orientados a eliminar los cuellos de botella del posprocesamiento.
Comprender las ventajas, arquitecturas y métricas de rendimiento específicas de estos modelos es fundamental para desarrolladores e investigadores que quieran implementar soluciones de IA para visión de última generación en situaciones reales.
Especificaciones técnicas y autoría#
Para evaluar estos modelos de forma eficaz, resulta útil comprender sus orígenes y el enfoque principal de sus respectivos equipos de investigación.
YOLOv10: eficiencia de extremo a extremo#
Desarrollado por investigadores de la Universidad de Tsinghua, YOLOv10 se diseñó para abordar la sobrecarga computacional introducida por los pasos de posprocesamiento de generaciones anteriores.
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 2024-05-23
- Arxiv: 2405.14458
- GitHub: THU-MIG/yolov10
- Documentación: Documentación de YOLOv10
Ultralytics YOLOv8: el estándar versátil#
Lanzado a principios de 2023, YOLOv8 se convirtió rápidamente en un referente del sector gracias a su sólida arquitectura y a su integración sin precedentes en el ecosistema más amplio del aprendizaje automático.
- Autores: Glenn Jocher, Ayush Chaurasia y Jing Qiu
- Organización: Ultralytics
- Fecha: 2023-01-10
- GitHub: ultralytics/ultralytics
Innovaciones arquitectónicas#
Ambos modelos aportan mejoras significativas a la arquitectura YOLO tradicional, aunque se centran en aspectos ligeramente diferentes del flujo de trabajo.
Arquitectura de YOLOv10#
La característica más destacada de YOLOv10 es su estrategia de entrenamiento sin NMS. Tradicionalmente, los detectores de objetos dependen de la supresión de no máximos (NMS) durante la inferencia para filtrar las cajas delimitadoras superpuestas. Este paso puede introducir latencia y complicar la implementación de extremo a extremo. YOLOv10 emplea asignaciones duales coherentes durante el entrenamiento, lo que permite al modelo predecir de forma nativa una única caja delimitadora precisa por objeto. Además, utiliza un diseño del modelo basado en un enfoque integral de eficiencia y precisión, optimizando diversos componentes para reducir considerablemente los FLOP y el número de parámetros.
Arquitectura de YOLOv8#
YOLOv8 introdujo una cabeza de detección sin anclajes, alejándose de los enfoques basados en anclajes de sus predecesores. Esto reduce el número de predicciones de cajas y acelera las operaciones de NMS. Además, YOLOv8 incorpora el módulo C2f (cuello de botella de parcialidad entre etapas con dos convoluciones), que mejora el flujo de gradientes y permite a la red aprender representaciones de características más ricas sin aumentar drásticamente el coste computacional. Su estructura de cabeza desacoplada separa las tareas de objetualidad, clasificación y regresión, lo que conduce a una convergencia más rápida y a una mayor precisión general.
Rendimiento y benchmarks#
Al implementar modelos en dispositivos periféricos o servidores en la nube, el equilibrio entre velocidad y precisión es fundamental. La tabla siguiente ofrece una comparación directa de ambos modelos en varios tamaños.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
Nota: las celdas vacías indican métricas que no se han comunicado oficialmente en condiciones de prueba idénticas.
Como muestran los datos, YOLOv10 presenta una eficiencia excepcional en cuanto a parámetros y, a menudo, iguala o supera el mAP de sus equivalentes YOLOv8 utilizando menos parámetros y FLOP. Sin embargo, YOLOv8 sigue siendo extremadamente competitivo, ya que ofrece una integración de TensorRT muy optimizada que garantiza una latencia de inferencia mínima en las GPU modernas.
Al orientarse a entornos de producción, utilizar formatos como ONNX o TensorRT puede mejorar drásticamente las velocidades de inferencia. Tanto YOLOv8 como YOLOv10 admiten la exportación fluida a estos formatos de grafo altamente optimizados.
Ecosistema, eficiencia del entrenamiento y versatilidad#
Elegir un modelo va más allá de los benchmarks teóricos; la experiencia del desarrollador y el ecosistema que lo rodea son igual de importantes.
La ventaja de Ultralytics#
Una de las principales fortalezas de YOLOv8 es su estrecha integración en el ecosistema de Ultralytics. Este entorno ofrece una experiencia de «cero a héroe», caracterizada por una API de Python muy intuitiva y una documentación extensa. A diferencia de los repositorios centrados en la investigación, que pueden requerir configuraciones complejas del entorno, los modelos de Ultralytics son conocidos por su facilidad de uso.
Además, YOLOv8 es inherentemente versátil. Mientras que YOLOv10 está estrictamente optimizado para la detección de objetos, el framework de Ultralytics permite a los desarrolladores cambiar sin problemas entre tareas de detección de objetos, segmentación de instancias, clasificación de imágenes, estimación de poses y cajas delimitadoras orientadas (OBB) dentro de la misma biblioteca y estructura de API.
Requisitos de memoria y entrenamiento#
Los modelos YOLO de Ultralytics están diseñados con especial atención a la eficiencia del entrenamiento. Por lo general, presentan un menor uso de memoria durante el entrenamiento y la inferencia en comparación con los complejos modelos Transformer, lo que permite a los desarrolladores entrenar modelos de última generación en hardware de consumo o instancias estándar en la nube sin agotar la memoria de CUDA. La gestión automática del ajuste de hiperparámetros y del aumento de datos garantiza una convergencia rápida.
Este es un ejemplo práctico de lo sencillo que es entrenar y validar un modelo mediante la API de Python de Ultralytics:
from ultralytics import YOLO
# Load a pretrained model (YOLOv8 recommended for general tasks)
model = YOLO("yolov8n.pt")
# Train the model on the COCO8 dataset with automatic memory management
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Run inference on a test image
predictions = model("https://ultralytics.com/images/zidane.jpg")
predictions[0].show()La nueva generación: YOLO26#
Aunque YOLOv8 y YOLOv10 representan hitos excepcionales, el campo del aprendizaje automático avanza constantemente. Para los desarrolladores que comiencen nuevos proyectos, recomendamos encarecidamente utilizar YOLO26, el modelo insignia más reciente de Ultralytics, lanzado en enero de 2026.
YOLO26 combina los mejores avances arquitectónicos de los últimos años en un único framework altamente optimizado. Hereda el diseño de extremo a extremo sin NMS desarrollado inicialmente por modelos como YOLOv10, lo que simplifica los flujos de implementación y reduce la variabilidad de la latencia. Además, YOLO26 introduce el optimizador MuSGD, un método híbrido inspirado en la estabilidad del entrenamiento de LLM que garantiza una convergencia más rápida y estable.
Las mejoras principales de YOLO26 incluyen:
- Inferencia en CPU hasta un 43 % más rápida: optimizada intensivamente para dispositivos periféricos mediante la eliminación de Distribution Focal Loss (DFL).
- ProgLoss + STAL: funciones de pérdida avanzadas que mejoran drásticamente el reconocimiento de objetos pequeños, algo fundamental para las imágenes captadas por drones y los sensores del IoT.
- Mejoras específicas para cada tarea: arquitecturas especializadas para la segmentación, la estimación de poses y OBB, que garantizan un rendimiento de primer nivel en todos los ámbitos de la visión artificial.
Casos de uso ideales y estrategias de despliegue#
Al decidir entre estas arquitecturas, ten en cuenta las necesidades específicas de tu entorno de implementación:
- Elige YOLOv10 si: trabajas en un flujo de detección de objetos puro en el que es fundamental aprovechar al máximo la eficiencia de los parámetros y quieres experimentar con las primeras implementaciones de arquitecturas sin NMS.
- Elige Ultralytics YOLOv8 si: necesitas un modelo muy estable y listo para producción, compatible con la sólida plataforma de Ultralytics. Es la opción ideal si tu proyecto requiere varias tareas (por ejemplo, detectar objetos y después segmentarlos) mediante un código unificado y fácil de mantener.
- Elige YOLO26 (recomendado) si: quieres el equilibrio definitivo entre una precisión de última generación, una eficiencia nativa de extremo a extremo sin NMS y las velocidades más rápidas posibles en CPU y hardware periférico.
Si estás explorando el panorama más amplio, también puede interesarte comparar estos modelos con YOLO11 o consultar integraciones específicas para la implementación en dispositivos periféricos, como Intel OpenVINO, para acelerar aún más tus aplicaciones de IA para visión. Al aprovechar las herramientas unificadas de Ultralytics, implementar soluciones sólidas de visión artificial nunca había sido tan accesible.