YOLO Vision 2026:

YOLOv9 vs YOLOX#

El campo de la visión artificial ha sido testigo de una rápida evolución en las arquitecturas de detección de objetos en tiempo real. Esta guía ofrece una comparación exhaustiva entre YOLOv9 y YOLOX, analizando sus innovaciones arquitectónicas, métricas de rendimiento y metodologías de entrenamiento. Tanto si estás creando aplicaciones inteligentes para IA en la fabricación como si exploras el modelado predictivo, comprender estos modelos te ayudará a tomar decisiones informadas para tu próximo despliegue.

Innovaciones arquitectónicas#

YOLOv9: información de gradiente programable#

YOLOv9 introdujo un cambio de paradigma al abordar el problema del cuello de botella de información inherente a las redes neuronales profundas. Sus innovaciones principales incluyen la Información de Gradiente Programable (PGI) y la Red de Agregación de Capas Eficiente Generalizada (GELAN).

  • Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
  • Organización: Instituto de Ciencias de la Información, Academia Sinica, Taiwán
  • Fecha: 21 de febrero de 2024
  • Arxiv: 2402.13616
  • GitHub: WongKinYiu/yolov9

Al retener datos de características cruciales durante el proceso de propagación hacia adelante, YOLOv9 garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación sigan siendo precisos. Esta arquitectura destaca en la extracción de características, lo que la hace sumamente capaz de detectar objetos pequeños en entornos complejos, como los que se encuentran en la fotografía aérea y en exploraciones médicas detalladas.

Aprende más sobre YOLOv9

YOLOX: Tendiendo un puente entre la investigación y la industria#

Lanzado a mediados de 2021, YOLOX orientó la serie YOLO hacia un diseño sin anclas (anchor-free). Introdujo una cabeza desacoplada, que separa las tareas de clasificación y localización, y utilizó la estrategia de asignación de etiquetas SimOTA para mejorar la convergencia del entrenamiento.

Aunque YOLOX fue pionero en su época, logrando una excelente precisión media (mAP) y eliminando el ajuste de hiperparámetros de las cajas de anclaje, su arquitectura subyacente ha sido superada desde entonces por redes modernas que equilibran mejor el recuento de parámetros y la retención de características.

Más información sobre YOLOX

Evolución sin anclas

Tanto YOLOX como los modelos más recientes de Ultralytics adoptan diseños sin anclas, lo que reduce la complejidad del ajuste de hiperparámetros y mejora la generalización en diversos conjuntos de datos.

Análisis de rendimiento#

Al comparar estos modelos en el conjunto de datos de referencia MS COCO, los avances en YOLOv9 se hacen evidentes. YOLOv9 logra sistemáticamente una mejor relación de compromiso entre la precisión y los FLOPs.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Aunque YOLOX ofrece variantes ligeras como YOLOX-Nano para casos límite extremos, las variantes de YOLOv9 superan sistemáticamente a los modelos YOLOX de tamaño similar en pura precisión. Por ejemplo, YOLOv9m alcanza un mAP del 51.4% frente al 49.7% de YOLOXl, a pesar de tener menos de la mitad de los parámetros (20.0M frente a 54.2M).

La ventaja de Ultralytics#

Elegir un modelo implica algo más que la teoría arquitectónica; el ecosistema que lo rodea dicta la velocidad de desarrollo y el éxito del despliegue. Utilizar YOLOv9 dentro del ecosistema Ultralytics proporciona una facilidad de uso inigualable y un sólido soporte de la comunidad.

A diferencia de los antiguos repositorios de investigación originales, el framework de Ultralytics proporciona una API de Python unificada que simplifica los pipelines complejos. El entrenamiento requiere drásticamente menos memoria de GPU que muchas alternativas, ofreciendo una increíble eficiencia de entrenamiento.

from ultralytics import YOLO

# Initialize the YOLOv9c model
model = YOLO("yolov9c.pt")

# Train the model on your custom dataset seamlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate the model's performance
metrics = model.val()

# Export the optimized model to TensorRT format
model.export(format="engine")

Con soporte integrado para múltiples tareas, incluyendo detección de objetos, segmentación de instancias y estimación de poses, puedes pivotar rápidamente tus soluciones de visión artificial sin cambiar toda tu base de código.

Exportación fluida

¿Desplegando en el edge? Ultralytics facilita la exportación de tus modelos entrenados a formatos altamente optimizados como ONNX, TensorRT y OpenVINO con un solo comando.

Aplicaciones en el mundo real#

Las fortalezas específicas de estos modelos los adaptan a distintas aplicaciones del mundo real:

Analítica minorista de alta velocidad#

Para entornos minoristas modernos que requieren reconocimiento de productos en tiempo real, YOLOv9 sobresale. Su capacidad para retener detalles complejos de las características lo hace perfectamente idóneo para despliegues de IA en el comercio minorista donde es necesario distinguir entre productos visualmente similares en un estante abarrotado.

Implementaciones en el borde heredadas#

En situaciones gobernadas por estrictas limitaciones de hardware o NPU especializadas que tienen dificultades con bloques de agregación más nuevos, YOLOX-Nano puede encontrar ocasionalmente un nicho. Sus patrones de convolución puros y simplificados a veces se prefieren para microcontroladores con recursos extremadamente limitados.

Robótica autónoma#

Para la navegación en robótica, pasar por alto objetos pequeños puede ser catastrófico. La arquitectura GELAN dentro de YOLOv9 garantiza que las características de los obstáculos pequeños y distantes no se pierdan en las capas profundas de la red, superando a los modelos anteriores en entornos críticos para la seguridad como aplicaciones de IA en automoción.

Casos de uso y recomendaciones#

Elegir entre YOLOv9 y YOLOX depende de los requisitos específicos de tu proyecto, las restricciones de implementación y tus preferencias de ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una opción sólida para:

  • Investigación del cuello de botella de información: proyectos académicos que estudian arquitecturas de información de gradiente programable (PGI) y redes de agregación de capas eficientes generalizadas (GELAN).
  • Estudios de optimización del flujo de gradiente: investigación enfocada en comprender y mitigar la pérdida de información en capas de red profundas durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: escenarios donde el sólido rendimiento de YOLOv9 en el benchmark COCO es necesario como punto de referencia para comparaciones arquitectónicas.

Cuándo elegir YOLOX#

YOLOX se recomienda para:

  • Investigación en detección sin anclas: Investigación académica que utiliza la arquitectura limpia y sin anclas de YOLOX como base para experimentar con nuevas cabeceras de detección o funciones de pérdida.
  • Dispositivos de borde ultraligeros: Despliegue en microcontroladores o hardware móvil antiguo donde la huella extremadamente pequeña de la variante YOLOX-Nano (0.91M de parámetros) es crítica.
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que investigan estrategias de asignación de etiquetas basadas en transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia de desarrollo:

  • Implementación en el borde sin NMS: Aplicaciones que requieren una inferencia consistente y de baja latencia sin la complejidad del posprocesamiento de supresión de no máximos.
  • Entornos solo de CPU: Dispositivos sin aceleración de GPU dedicada, donde la inferencia en CPU hasta un 43% más rápida de YOLO26 proporciona una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios desafiantes como la aerial drone imagery o el análisis con sensores IoT donde ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

El futuro: llega YOLO26#

Aunque YOLOv9 representa un hito impresionante, las demandas de los entornos de producción empujan constantemente los límites. El recién lanzado YOLO26 representa el estándar definitivo para la IA de visión moderna.

YOLO26 revitaliza por completo el pipeline de despliegue con un diseño nativo de extremo a extremo sin NMS. Al eliminar la necesidad de una supresión de no máximos compleja durante el postprocesamiento, ofrece una latencia de inferencia significativamente menor.

Además, YOLO26 incorpora el revolucionario optimizador MuSGD, un híbrido de SGD y Muon que toma prestadas innovaciones del entrenamiento de modelos de lenguaje (LLM) para proporcionar una convergencia increíblemente estable y rápida. Al eliminar la pérdida focal de distribución (DFL), YOLO26 logra hasta un 43% más de rapidez en la inferencia por CPU en comparación con sus predecesores, lo que lo convierte en la mejor opción absoluta para dispositivos de borde e implementaciones empresariales. Con notables mejoras en el reconocimiento de objetos pequeños a través de ProgLoss y STAL, YOLO26 reemplaza efectivamente tanto a YOLOX como a YOLOv9.

Para los ingenieros que exploran arquitecturas modernas, también recomendamos echar un vistazo a YOLO11 y RT-DETR como alternativas potentes dentro de la suite de Ultralytics. Asegúrate de que tu proyecto esté preparado para el futuro aprovechando el rendimiento inigualable de los modelos más recientes en la plataforma de Ultralytics.

Comentarios