YOLOv9 frente a YOLOv10#
El panorama de la visión artificial en tiempo real ha experimentado enormes avances, impulsados en gran medida por investigadores que amplían continuamente los límites del rendimiento y la eficiencia. Al analizar la evolución de los modelos de visión más avanzados, YOLOv9 y YOLOv10 representan dos hitos fundamentales. Ambos modelos, publicados a principios de 2024, introdujeron diseños arquitectónicos que cambiaron las reglas del juego para abordar problemas persistentes de las redes neuronales profundas, desde los cuellos de botella de información hasta la latencia del posprocesamiento.
Esta completa comparativa técnica explora sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales para ayudarte a desenvolverte en la complejidad de los ecosistemas modernos de detección de objetos.
Orígenes de los modelos e innovaciones arquitectónicas#
Comprender el linaje y los fundamentos teóricos de estos modelos es esencial para elegir la arquitectura adecuada para tu proyecto específico de visión artificial.
YOLOv9: dominar el flujo de información#
Presentado el 21 de febrero de 2024, YOLOv9 aborda el problema teórico de la pérdida de información a medida que los datos pasan por redes neuronales profundas.
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Referencia: artículo de YOLOv9 en arXiv
- Repositorio: YOLOv9 en GitHub
YOLOv9 introduce la red de agregación de capas eficiente generalizada (GELAN), que maximiza el aprovechamiento de los parámetros al combinar las ventajas de CSPNet y ELAN. Además, emplea la información de gradiente programable (PGI), un mecanismo de supervisión auxiliar que garantiza que las capas profundas conserven información espacial esencial. Esto hace que YOLOv9 sea excepcionalmente eficaz en tareas que requieren una alta fidelidad de las características, como el análisis de imágenes médicas o la vigilancia a distancia.
YOLOv10: eficiencia integral en tiempo real#
Lanzado poco después, el 23 de mayo de 2024, YOLOv10 replantea el proceso de despliegue al eliminar uno de los cuellos de botella de latencia más conocidos de la detección de objetos: la supresión no máxima (NMS).
- Autores: Ao Wang, Hui Chen, Lihao Liu, et al.
- Organización: Universidad de Tsinghua
- Referencia: artículo de YOLOv10 en arXiv
- Repositorio: YOLOv10 en GitHub
YOLOv10 utiliza asignaciones duales coherentes durante el entrenamiento, lo que permite un diseño sin NMS de forma nativa. Esto elimina la sobrecarga del posprocesamiento durante la inferencia y reduce drásticamente la latencia. Combinado con un diseño de modelo integral que equilibra eficiencia y precisión, YOLOv10 logra un equilibrio extraordinario, reduce la carga computacional (FLOPs) y mantiene una precisión competitiva, por lo que resulta muy atractivo para aplicaciones de computación en el borde.
Comparativa de rendimiento y métricas#
Al comparar estos dos modelos punteros en el conjunto de datos estándar MS COCO, se observan distintas compensaciones entre la precisión pura y la latencia de inferencia.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
Análisis de los datos#
- Latencia frente a precisión: Los modelos YOLOv10 suelen ofrecer mayores velocidades de inferencia. Por ejemplo, YOLOv10s alcanza un 46,3 % de mAP en solo 2,49 ms con TensorRT, mientras que YOLOv9s necesita 3,54 ms para lograr un mAP similar del 46,8 %.
- Precisión de primer nivel: Para escenarios de investigación que exigen la máxima precisión de detección, YOLOv9e sigue siendo una opción formidable, con un impresionante 55,6 % de mAP. Su arquitectura PGI garantiza una extracción fiable de características sutiles.
- Eficiencia: YOLOv10 destaca por su eficiencia en FLOPs. Esto se traduce directamente en un menor consumo energético, una métrica crucial para los dispositivos con batería que ejecutan modelos de IA de visión.
Si vas a desplegar el modelo en CPU o en hardware de borde con recursos limitados, como una Raspberry Pi, la arquitectura de YOLOv10 sin NMS suele ofrecer un flujo de procesamiento más fluido al eliminar los pasos de posprocesamiento no deterministas.
La ventaja de Ultralytics: entrenamiento y ecosistema#
Aunque las diferencias arquitectónicas son importantes, el ecosistema de software que las rodea determina en gran medida el éxito de un proyecto. Tanto YOLOv9 como YOLOv10 están totalmente integrados en el ecosistema de Ultralytics, que ofrece una experiencia de desarrollo inigualable.
Facilidad de uso y eficiencia de memoria#
A diferencia de las complejas arquitecturas basadas en Transformer, que sufren un enorme consumo de memoria, los modelos YOLO de Ultralytics están diseñados para optimizar el uso de la memoria de la GPU. Esto permite a los investigadores utilizar tamaños de lote mayores en hardware de consumo y hace accesible la IA más avanzada.
La API unificada de Python abstrae las complejidades del aumento de datos y el ajuste de hiperparámetros. Puedes cambiar fácilmente de arquitectura con solo modificar la cadena del archivo de pesos.
from ultralytics import YOLO
# Cargar un modelo YOLOv10 (cámbialo fácilmente por "yolov9c.pt" para usar YOLOv9)
model = YOLO("yolov10n.pt")
# Entrena el modelo con el conjunto de datos COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Valida el rendimiento del modelo
metrics = model.val()
# Exporta el modelo entrenado al formato ONNX para implementarlo
model.export(format="onnx")Tanto si necesitas registrar métricas en MLflow como exportar a TensorRT para desplegar el modelo en hardware de alta velocidad, el paquete de Python de Ultralytics lo hace de forma nativa.
Casos de uso ideales#
La elección entre estos modelos depende de tus limitaciones de despliegue:
- Elige YOLOv9 si: trabajas en tareas de detección de objetos pequeños, como el análisis de imágenes aéreas captadas por drones o la detección de tumores pequeños, donde la conservación de características de la arquitectura GELAN ofrece la máxima fidelidad.
- Elige YOLOv10 si: tu objetivo principal es la inferencia en tiempo real en dispositivos de borde. El diseño sin NMS es ideal para la robótica autónoma, la supervisión del tráfico en tiempo real y la videovigilancia inteligente.
Prepararse para el futuro: el salto a YOLO26#
Aunque YOLOv8, YOLOv9 y YOLOv10 son modelos excelentes, los desarrolladores que quieran crear soluciones de IA modernas deberían considerar Ultralytics YOLO26, lanzado en enero de 2026.
YOLO26 representa la síntesis definitiva de las generaciones anteriores y combina lo mejor de la precisión de YOLOv9 y la eficiencia de YOLOv10.
Principales innovaciones de YOLO26#
- Diseño integral sin NMS: Basándose en los cimientos establecidos por YOLOv10, la cabeza opcional uno a uno de YOLO26 (
nms=False) omite el posprocesamiento NMS para simplificar el despliegue. - Optimizador MuSGD: Una combinación de SGD y Muon que incorpora a la visión artificial innovaciones de entrenamiento avanzado de LLM para lograr una convergencia increíblemente estable y rápida.
- Inferencia en CPU hasta un 43 % más rápida: Optimizado específicamente para la computación en el borde y los dispositivos sin GPU dedicada.
- Eliminación de DFL: Se ha eliminado Distribution Focal Loss para simplificar la exportación de modelos y mejorar la compatibilidad con dispositivos de bajo consumo.
- ProgLoss + STAL: Estas funciones de pérdida mejoradas ofrecen mejoras notables en el reconocimiento de objetos pequeños, igualando o superando las capacidades de YOLOv9.
Para los investigadores que evalúan arquitecturas anteriores, RT-DETR y YOLO11 también son alternativas bien documentadas dentro del ecosistema de Ultralytics. Sin embargo, para obtener la máxima versatilidad en todas las tareas de visión, dar el salto a YOLO26 en la plataforma de Ultralytics te permite aprovechar lo último en IA de visión de código abierto.