YOLOv10 frente a YOLOv5#
Elegir la arquitectura de red neuronal adecuada es fundamental para implementar correctamente canalizaciones de visión por ordenador en producción. Esta página ofrece un análisis técnico exhaustivo que compara YOLOv10 y YOLOv5, dos modelos muy influyentes en la evolución de la detección de objetos en tiempo real. Aunque ambos modelos han tenido un impacto significativo en la comunidad de la IA, representan distintas épocas y filosofías en el diseño de arquitecturas de aprendizaje profundo.
Esta guía evalúa estas arquitecturas en función de la precisión media promedio (mAP), la latencia de inferencia, la eficiencia de los parámetros y la compatibilidad del ecosistema, para ayudarte a elegir el mejor modelo según tus necesidades de implementación.
Descripción general de los modelos#
YOLOv10: detección de objetos integral en tiempo real#
Desarrollado por investigadores de la Universidad de Tsinghua, YOLOv10 introdujo un enfoque innovador para la detección de objetos al eliminar la necesidad de posprocesamiento.
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Fecha: 2024-05-23
- Artículo de investigación: arXiv:2405.14458
- Código fuente: Repositorio de YOLOv10 en GitHub
El avance decisivo de YOLOv10 es su diseño de extremo a extremo sin NMS. Históricamente, los modelos YOLO dependían de la supresión no máxima (NMS) para filtrar las BBox redundantes. YOLOv10 utiliza asignaciones duales coherentes para el entrenamiento sin NMS, lo que reduce drásticamente la variabilidad de la latencia de inferencia y simplifica la lógica de implementación. Además, la arquitectura presenta un diseño integral orientado a la eficiencia y la precisión que optimiza a fondo diversos componentes para reducir la redundancia computacional.
YOLOv5: el estándar del sector en facilidad de uso#
Lanzado poco después de la creación del repositorio PyTorch de Ultralytics, YOLOv5 redefinió lo que los desarrolladores esperaban de un framework de IA de visión de código abierto. Sigue siendo una de las arquitecturas más implementadas del mundo.
- Autor: Glenn Jocher
- Organización: Ultralytics
- Fecha: 2020-06-26
- Código fuente: Repositorio de YOLOv5 en GitHub
YOLOv5 es conocido por su facilidad de uso y su ecosistema muy bien mantenido. Escrito íntegramente en PyTorch, ofrecía una experiencia fluida de «principiante a experto», con compatibilidad inmediata para el entrenamiento, la validación y la exportación a formatos como ONNX y TensorRT. A diferencia de YOLOv10, que se centra principalmente en la detección pura de objetos, YOLOv5 demuestra una versatilidad excepcional al admitir la segmentación de instancias y la clasificación de imágenes dentro de la misma API unificada de Python.
Comparación de rendimiento y métricas#
Visualizar la relación entre velocidad y precisión es esencial para identificar los modelos que ofrecen la mejor precisión con una determinada limitación de velocidad. Comprender estas métricas de rendimiento es fundamental para seleccionar un modelo que se ajuste a las limitaciones específicas de tu hardware.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
Análisis técnico#
- Precisión (mAP): YOLOv10 demuestra una clara ventaja generacional en precisión. Por ejemplo, el modelo YOLOv10-X alcanza un 54,4 % de mAPval, superando a YOLOv5x (50,7 % de mAP). Este salto se debe en gran medida a la estrategia de entrenamiento sin NMS y a las mejoras arquitectónicas introducidas en 2024.
- Latencia de inferencia: Aunque los modelos YOLOv5 son excepcionalmente rápidos en benchmarks sin procesar de T4 TensorRT (por ejemplo, YOLOv5n a 1,12 ms), YOLOv10 elimina por completo el paso de posprocesamiento NMS. En implementaciones prácticas de extremo a extremo, el diseño sin NMS de YOLOv10 proporciona una latencia más uniforme y determinista, algo fundamental para aplicaciones en tiempo real como los vehículos autónomos y la robótica.
- Eficiencia de los parámetros: Los modelos YOLOv10 mantienen un equilibrio de rendimiento muy competitivo. YOLOv10-S alcanza un 46,7 % de mAP con solo 7,2 M de parámetros, mientras que YOLOv5s alcanza un 37,4 % de mAP con 9,1 M de parámetros.
Al implementar en dispositivos de IA en el edge, como NVIDIA Jetson, los modelos sin lógica NMS, como YOLOv10 y YOLO26, suelen compilarse mejor en TensorRT y evitan operaciones alternativas en la CPU.
Casos de uso y recomendaciones#
La elección entre YOLOv10 y YOLOv5 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias en cuanto al ecosistema.
Cuándo elegir YOLOv10#
YOLOv10 es una opción sólida para:
- Detección en tiempo real sin NMS: Aplicaciones que se benefician de la detección integral sin supresión de no máximos, reduciendo la complejidad del despliegue.
- Equilibrios entre velocidad y precisión: Proyectos que requieren un equilibrio sólido entre la velocidad de inferencia y la precisión de detección en distintas escalas de modelo.
- Aplicaciones con latencia coherente: Situaciones de despliegue en las que los tiempos de inferencia predecibles son fundamentales, como la robótica o los sistemas autónomos.
Cuándo elegir YOLOv5#
YOLOv5 se recomienda para:
- Sistemas de producción probados: Implementaciones existentes en las que se valoran la larga trayectoria de estabilidad de YOLOv5, su amplia documentación y el enorme apoyo de la comunidad.
- Entrenamiento con recursos limitados: Entornos con recursos de GPU limitados en los que resultan ventajosos el eficiente flujo de entrenamiento de YOLOv5 y sus menores requisitos de memoria.
- Amplia compatibilidad con formatos de exportación: Proyectos que requieren implementarse en muchos formatos, incluidos ONNX, TensorRT, CoreML y TFLite.
Cuándo elegir Ultralytics (YOLO26)#
Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
La ventaja de Ultralytics#
Aunque YOLOv10 ofrece excelentes capacidades de detección, depender de repositorios académicos puede complicar a veces las canalizaciones de producción. Al utilizar el paquete oficial de Python de Ultralytics, obtienes acceso a un ecosistema unificado compatible tanto con YOLOv5 como con YOLOv10, además de funciones avanzadas.
- Eficiencia del entrenamiento: Las arquitecturas YOLO de Ultralytics están profundamente optimizadas para reducir los requisitos de memoria durante el entrenamiento. A diferencia de los pesados modelos Transformer, como RT-DETR, que requieren una enorme cantidad de memoria CUDA, puedes entrenar cómodamente YOLOv5 y YOLOv10 en GPU de consumo estándar.
- Integración del ecosistema: La integración con la plataforma de Ultralytics permite a los desarrolladores gestionar visualmente los conjuntos de datos, realizar el seguimiento de experimentos mediante Weights & Biases y ajustar automáticamente los hiperparámetros.
Ejemplo de código: entrenamiento fluido#
Con la biblioteca de Ultralytics, cambiar entre estas arquitecturas es tan sencillo como modificar la cadena del modelo. La canalización de entrenamiento gestiona automáticamente el aumento de datos, el escalado y la configuración del optimizador.
from ultralytics import YOLO
# To use YOLOv5:
# model = YOLO("yolov5s.pt")
# To use YOLOv10:
model = YOLO("yolov10s.pt")
# Train the model on a custom dataset
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
batch=16,
device=0, # Use GPU 0
)
# Export the trained model to ONNX format
path = model.export(format="onnx")La próxima generación: Ultralytics YOLO26#
Si hoy vas a iniciar un proyecto nuevo de aprendizaje automático, te recomendamos encarecidamente evaluar la última versión, Ultralytics YOLO26. Lanzado en enero de 2026, representa el estado del arte absoluto al combinar las mejores innovaciones de los últimos cinco años.
YOLO26 incorpora de forma nativa el diseño de extremo a extremo sin NMS desarrollado por YOLOv10, lo que garantiza una implementación rápida y determinista. Además, YOLO26 introduce varios avances fundamentales:
- Hasta un 43 % más de velocidad en la inferencia en CPU: Al eliminar el módulo Distribution Focal Loss (DFL), YOLO26 logra enormes aumentos de velocidad en CPU estándar, lo que lo convierte en la opción principal para la implementación móvil y los sensores IoT de bajo consumo.
- Optimizador MuSGD: Inspirado en técnicas de entrenamiento de Large Language Model (LLM), como Kimi K2 de Moonshot AI, YOLO26 utiliza una combinación de SGD y Muon. Esto garantiza ejecuciones de entrenamiento muy estables y una convergencia mucho más rápida en comparación con los optimizadores AdamW utilizados en YOLOv10.
- ProgLoss + STAL: Estas funciones de pérdida avanzadas producen mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para las imágenes capturadas por drones y las aplicaciones de seguridad aérea.
- Dominio específico de cada tarea: Mientras que YOLOv10 es estrictamente un detector de BBox, YOLO26 ofrece mejoras arquitectónicas específicas para todas las tareas, incluida la Residual Log-Likelihood Estimation (RLE) para Pose y funciones de pérdida de ángulo especializadas para Oriented Bounding Boxes (OBB).
Si estás explorando el panorama más amplio de la detección de objetos, también puede interesarte comparar estas arquitecturas con otros frameworks. Consulta nuestros análisis detallados sobre YOLO11 frente a EfficientDet o RT-DETR frente a YOLOv8 para obtener benchmarks más exhaustivos.
Tanto si confías en la sólida trayectoria de YOLOv5, en la innovación sin NMS de YOLOv10 o en el rendimiento puntero incomparable de YOLO26, el ecosistema de Ultralytics proporciona las herramientas necesarias para dar vida a tus aplicaciones de IA de visión de forma rápida y eficiente.