Ultralytics YOLO27:
Get Started

YOLOv9 frente a YOLOX#

El campo de la visión artificial ha sido testigo de una rápida evolución de las arquitecturas de detección de objetos en tiempo real. Esta guía ofrece una comparativa exhaustiva entre YOLOv9 y YOLOX, en la que analiza sus innovaciones arquitectónicas, métricas de rendimiento y metodologías de entrenamiento. Tanto si estás desarrollando aplicaciones inteligentes para la IA en la fabricación como si exploras la modelización predictiva, comprender estos modelos te ayudará a tomar decisiones fundamentadas para tu próximo despliegue.

Innovaciones arquitectónicas#

YOLOv9: información de gradiente programable#

YOLOv9 introdujo un cambio de paradigma al abordar el problema del cuello de botella de información inherente a las redes neuronales profundas. Entre sus innovaciones principales se incluyen la información de gradiente programable (PGI) y la red generalizada de agregación eficiente de capas (GELAN).

  • Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
  • Organización: Institute of Information Science, Academia Sinica, Taiwán
  • Fecha: 21 de febrero de 2024
  • Arxiv: 2402.13616
  • GitHub: WongKinYiu/yolov9

Al conservar datos de características cruciales durante el proceso de propagación hacia delante, YOLOv9 garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación sigan siendo precisos. Esta arquitectura destaca en la extracción de características, lo que le permite detectar objetos pequeños en entornos complejos, como los de las imágenes aéreas y las exploraciones médicas detalladas.

Más información sobre YOLOv9

YOLOX: conectar la investigación y la industria#

Lanzado a mediados de 2021, YOLOX orientó la serie YOLO hacia un diseño sin anclajes. Introdujo una cabeza desacoplada, que separa las tareas de clasificación y localización, y utilizó la estrategia de asignación de etiquetas SimOTA para mejorar la convergencia del entrenamiento.

Aunque YOLOX fue revolucionario en su época, logró una excelente precisión media promedio (mAP) y eliminó el ajuste de hiperparámetros de los cuadros de anclaje, pero las redes modernas han superado desde entonces su arquitectura subyacente al equilibrar mejor el número de parámetros y la conservación de características.

Más información sobre YOLOX

Evolución sin anclajes

Tanto YOLOX como los modelos más recientes de Ultralytics adoptan diseños sin anclajes, lo que reduce la complejidad del ajuste de hiperparámetros y mejora la capacidad de generalización en conjuntos de datos diversos.

Análisis del rendimiento#

Al comparar estos modelos en el benchmark MS COCO, los avances de YOLOv9 resultan evidentes. YOLOv9 logra sistemáticamente un mejor equilibrio entre precisión y FLOPs.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Aunque YOLOX ofrece variantes ligeras como YOLOX-Nano para casos extremos de computación periférica, las variantes de YOLOv9 superan sistemáticamente a los modelos YOLOX de tamaño similar en precisión pura. Por ejemplo, YOLOv9m alcanza un 51,4 % de mAP frente al 49,7 % de YOLOXl, pese a tener menos de la mitad de parámetros (20,1 M frente a 54,2 M).

La ventaja de Ultralytics#

Elegir un modelo implica algo más que la teoría arquitectónica: el ecosistema que lo rodea determina la velocidad de desarrollo y el éxito del despliegue. Utilizar YOLOv9 dentro del ecosistema de Ultralytics ofrece una facilidad de uso inigualable y un sólido apoyo de la comunidad.

A diferencia de los antiguos repositorios de investigación originales, el framework de Ultralytics ofrece una API unificada de Python que simplifica los procesos complejos. El entrenamiento requiere mucha menos memoria de GPU que muchas alternativas y ofrece una eficiencia de entrenamiento excepcional.

from ultralytics import YOLO

# Inicializa el modelo YOLOv9c
model = YOLO("yolov9c.pt")

# Entrena el modelo sin complicaciones con tu conjunto de datos personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valida el rendimiento del modelo
metrics = model.val()

# Exporta el modelo optimizado al formato TensorRT
model.export(format="engine")

Gracias a la compatibilidad integrada con varias tareas, como la detección de objetos, la segmentación de instancias y la estimación de pose, puedes adaptar rápidamente tus soluciones de visión artificial sin cambiar todo el código base.

Exportación sencilla

¿Vas a desplegar el modelo en dispositivos periféricos? Ultralytics facilita la exportación de tus modelos entrenados a formatos muy optimizados como ONNX, TensorRT y OpenVINO con un solo comando.

Aplicaciones en el mundo real#

Las ventajas específicas de estos modelos los hacen adecuados para distintas aplicaciones del mundo real:

Análisis de comercios minoristas de alta velocidad#

YOLOv9 destaca en los entornos comerciales modernos que requieren reconocer productos en tiempo real. Su capacidad para conservar detalles complejos de las características lo hace ideal para aplicaciones de IA en el comercio minorista en las que es necesario distinguir productos visualmente similares en una estantería abarrotada.

Despliegues heredados en dispositivos periféricos#

En situaciones sujetas a estrictas limitaciones de hardware o que utilizan NPU especializadas con dificultades para procesar bloques de agregación más recientes, YOLOX-Nano puede encontrar ocasionalmente un nicho. Sus patrones de convolución básicos y reducidos a veces son preferibles para microcontroladores con recursos extremadamente limitados.

Robótica autónoma#

En la navegación robótica, pasar por alto objetos pequeños puede tener consecuencias catastróficas. La arquitectura GELAN de YOLOv9 garantiza que las características de los obstáculos pequeños y lejanos no se pierdan en las capas profundas de la red, por lo que supera a los modelos más antiguos en entornos críticos para la seguridad, como las aplicaciones de IA en la automoción.

Casos de uso y recomendaciones#

La elección entre YOLOv9 y YOLOX depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias de ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una buena opción para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.

Cuándo elegir YOLOX#

Se recomienda YOLOX para:

  • Investigación sobre detección sin anclajes: Investigación académica que utiliza la arquitectura limpia y sin anclajes de YOLOX como base para experimentar con nuevos cabezales de detección o funciones de pérdida.
  • Dispositivos de borde ultraligeros: Implementación en microcontroladores o hardware móvil heredado, donde el tamaño extremadamente reducido de la variante YOLOX-Nano (0,91 M de parámetros) es fundamental.
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

El futuro: llega YOLO26#

Aunque YOLOv9 representa un hito impresionante, las exigencias de los entornos de producción amplían constantemente los límites. El recién lanzado YOLO26 es el estándar definitivo para la IA visual moderna.

YOLO26 renueva por completo el proceso de despliegue con un diseño integral sin NMS opcional. Al eliminar la necesidad de aplicar una compleja supresión no máxima durante el posprocesamiento con nms=False, reduce notablemente la latencia de inferencia.

Además, YOLO26 incorpora el revolucionario optimizador MuSGD, una combinación híbrida de SGD y Muon que aprovecha innovaciones del entrenamiento de LLM para ofrecer una convergencia increíblemente estable y rápida. Al eliminar Distribution Focal Loss (DFL), YOLO26 logra una inferencia con CPU hasta un 43 % más rápida que sus predecesores, lo que lo convierte en la mejor opción para dispositivos periféricos y despliegues empresariales. Con mejoras notables en el reconocimiento de objetos pequeños gracias a ProgLoss y STAL, YOLO26 supera eficazmente tanto a YOLOX como a YOLOv9.

A los ingenieros que exploran arquitecturas modernas también les recomendamos YOLO11 y RT-DETR como alternativas potentes dentro de la gama de Ultralytics. Prepara tu proyecto para el futuro aprovechando el rendimiento inigualable de los modelos más recientes en la plataforma de Ultralytics.

Comentarios