Ultralytics YOLO27:

Comparativa entre YOLOv9 y YOLOv10#

El panorama de la visión artificial en tiempo real ha experimentado enormes avances, impulsados en gran medida por investigadores que amplían continuamente los límites entre rendimiento y eficiencia. Al analizar la evolución de los modelos de visión más avanzados, YOLOv9 y YOLOv10 representan dos hitos fundamentales. Ambos modelos, publicados a principios de 2024, introdujeron diseños arquitectónicos que cambiaron el paradigma para abordar desafíos persistentes de las redes neuronales profundas, desde los cuellos de botella de información hasta la latencia del posprocesamiento.

Esta completa comparación técnica explora sus arquitecturas, métricas de rendimiento y escenarios de implementación ideales para ayudarte a desenvolverte en las complejidades de los ecosistemas modernos de detección de objetos.

Orígenes de los modelos y avances arquitectónicos#

Comprender el linaje y los fundamentos teóricos de estos modelos es crucial para seleccionar la arquitectura adecuada para tu proyecto específico de visión artificial.

YOLOv9: dominio del flujo de información#

Presentado el 21 de febrero de 2024, YOLOv9 aborda el problema teórico de la pérdida de información a medida que los datos atraviesan redes neuronales profundas.

YOLOv9 introduce la red generalizada de agregación eficiente de capas (GELAN), que maximiza el aprovechamiento de los parámetros al combinar las ventajas de CSPNet y ELAN. Además, emplea la información de gradiente programable (PGI), un mecanismo de supervisión auxiliar que garantiza que las capas profundas conserven información espacial crítica. Esto hace que YOLOv9 sea especialmente potente para tareas que exigen una alta fidelidad de las características, como el análisis de imágenes médicas o la vigilancia a distancia.

Más información sobre YOLOv9

YOLOv10: eficiencia integral en tiempo real#

Publicado poco después, el 23 de mayo de 2024, YOLOv10 replantea la canalización de implementación al eliminar uno de los cuellos de botella de latencia más conocidos de la detección de objetos: la supresión de no máximos (NMS).

YOLOv10 utiliza asignaciones duales coherentes durante el entrenamiento, lo que permite un diseño nativo sin NMS. Esto elimina la sobrecarga del posprocesamiento durante la inferencia y reduce drásticamente la latencia. Combinado con un diseño del modelo orientado holísticamente a la eficiencia y la precisión, YOLOv10 logra un equilibrio excepcional: reduce la carga computacional (FLOPs) y mantiene una precisión competitiva, por lo que resulta muy atractivo para aplicaciones de computación en el borde.

Más información sobre YOLOv10

Comparación de rendimiento y métricas#

Al comparar el rendimiento de estos dos modelos punteros en el conjunto de datos estándar MS COCO, aparecen diferencias claras entre la precisión pura y la latencia de inferencia.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLOv10n64039.5-1.562.36.7
YOLOv10s64046.7-2.667.221.6
YOLOv10m64051.3-5.4815.459.1
YOLOv10b64052.7-6.5424.492.0
YOLOv10l64053.3-8.3329.5120.3
YOLOv10x64054.4-12.256.9160.4

Análisis de los datos#

  1. Latencia frente a precisión: Los modelos YOLOv10 suelen ofrecer velocidades de inferencia superiores. Por ejemplo, YOLOv10s alcanza un 46,7 % de mAP en tan solo 2,66 ms con TensorRT, frente a YOLOv9s, que necesita 3,54 ms para obtener un mAP casi idéntico del 46,8 %.
  2. Precisión de primer nivel: Para escenarios de investigación que exigen la máxima precisión de detección, YOLOv9e sigue siendo una opción formidable, ya que alcanza un impresionante 55,6 % de mAP. Su arquitectura PGI garantiza que las características sutiles se extraigan de forma fiable.
  3. Eficiencia: YOLOv10 destaca por su eficiencia en FLOPs. Esto se traduce directamente en un menor consumo energético, una métrica crucial para dispositivos alimentados por batería que ejecutan modelos de IA de visión.
Consejo de implementación

Si implementas el modelo en CPU o en hardware periférico con recursos limitados, como una Raspberry Pi, la arquitectura sin NMS de YOLOv10 normalmente proporcionará una canalización más fluida al eliminar los pasos de posprocesamiento no deterministas.

La ventaja de Ultralytics: entrenamiento y ecosistema#

Aunque las diferencias arquitectónicas son fundamentales, el ecosistema de software que las rodea determina en gran medida el éxito de un proyecto. Tanto YOLOv9 como YOLOv10 están totalmente integrados en el ecosistema de Ultralytics, lo que proporciona una experiencia de desarrollo inigualable.

Facilidad de uso y eficiencia de memoria#

A diferencia de las complejas arquitecturas basadas en Transformer, que sufren un consumo excesivo de memoria, los modelos YOLO de Ultralytics están diseñados para optimizar el uso de la memoria de la GPU. Esto permite a los investigadores utilizar tamaños de lote mayores en hardware de consumo y hace accesible la IA más avanzada.

La API unificada de Python abstrae las complejidades del aumento de datos y el ajuste de hiperparámetros. Puedes cambiar de arquitectura sin complicaciones simplemente modificando la cadena del archivo de pesos.

from ultralytics import YOLO

# Load a YOLOv10 model (Easily swap to "yolov9c.pt" for YOLOv9)
model = YOLO("yolov10n.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)

# Validate the model's performance
metrics = model.val()

# Export the trained model to ONNX format for deployment
model.export(format="onnx")

Tanto si necesitas registrar métricas en MLflow como exportar a TensorRT para implementar el modelo en hardware de alta velocidad, la plataforma de Ultralytics lo gestiona de forma nativa.

Casos de uso ideales#

La elección entre estos modelos depende de tus restricciones de implementación:

Preparación para el futuro: el cambio a YOLO26#

Aunque YOLOv8, YOLOv9 y YOLOv10 son modelos excelentes, los desarrolladores que quieran crear soluciones de IA modernas deberían considerar Ultralytics YOLO26, publicado en enero de 2026.

YOLO26 representa la síntesis definitiva de las generaciones anteriores, ya que combina los mejores aspectos de la precisión de YOLOv9 y la eficiencia de YOLOv10.

Principales innovaciones de YOLO26#

  • Diseño integral sin NMS: Basándose en los cimientos establecidos por YOLOv10, YOLO26 elimina de forma nativa el posprocesamiento NMS para simplificar la implementación.
  • Optimizador MuSGD: Un híbrido de SGD y Muon que incorpora innovaciones avanzadas del entrenamiento de LLM a la visión artificial para lograr una convergencia increíblemente estable y rápida.
  • Inferencia en CPU hasta un 43 % más rápida: Optimizada específicamente para la computación en el borde y dispositivos sin GPU dedicada.
  • Eliminación de DFL: Se eliminó la pérdida focal de distribución para simplificar la exportación del modelo y mejorar la compatibilidad con dispositivos de bajo consumo.
  • ProgLoss + STAL: Estas funciones de pérdida mejoradas aportan mejoras notables en el reconocimiento de objetos pequeños, igualando o superando las capacidades de YOLOv9.

Para los investigadores que evalúan arquitecturas antiguas, RT-DETR y YOLO11 también son alternativas bien documentadas dentro del ecosistema de Ultralytics. Sin embargo, para lograr la máxima versatilidad en todas las tareas de visión, migrar a YOLO26 en la plataforma de Ultralytics garantiza que aproveches al máximo la IA de visión de código abierto.

Comentarios