Ultralytics YOLO27:

YOLOv9 frente a YOLOX#

El campo de la visión por computador ha experimentado una rápida evolución de las arquitecturas de detección de objetos en tiempo real. Esta guía ofrece una comparación exhaustiva entre YOLOv9 y YOLOX, y analiza sus innovaciones arquitectónicas, métricas de rendimiento y metodologías de entrenamiento. Tanto si estás desarrollando aplicaciones inteligentes para la IA en la fabricación como si estás explorando el modelado predictivo, comprender estos modelos te ayudará a tomar decisiones fundamentadas para tu próxima implementación.

Innovaciones arquitectónicas#

YOLOv9: Información de gradiente programable#

YOLOv9 introdujo un cambio de paradigma al abordar el problema del cuello de botella de la información inherente a las redes neuronales profundas. Entre sus innovaciones principales se incluyen la Información de gradiente programable (PGI) y la Red generalizada de agregación eficiente de capas (GELAN).

  • Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
  • Organización: Institute of Information Science, Academia Sinica, Taiwán
  • Fecha: 21 de febrero de 2024
  • Arxiv: 2402.13616
  • GitHub: WongKinYiu/yolov9

Al conservar los datos de características cruciales durante el proceso de propagación hacia delante, YOLOv9 garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación sigan siendo precisos. Esta arquitectura destaca en la extracción de características, lo que le permite detectar objetos pequeños en entornos complejos, como los presentes en las imágenes aéreas y en exploraciones médicas detalladas.

Más información sobre YOLOv9

YOLOX: conectando la investigación y la industria#

Lanzado a mediados de 2021, YOLOX orientó la serie YOLO hacia un diseño sin anclajes. Introdujo una cabeza desacoplada que separa las tareas de clasificación y localización, y utilizó la estrategia de asignación de etiquetas SimOTA para mejorar la convergencia del entrenamiento.

Aunque YOLOX fue revolucionario en su momento, al lograr una excelente precisión media promedio (mAP) y eliminar el ajuste de hiperparámetros de las cajas de anclaje, desde entonces su arquitectura subyacente ha sido superada por redes modernas que equilibran mejor el número de parámetros y la conservación de características.

Más información sobre YOLOX

Evolución sin anclajes

Tanto YOLOX como los modelos más recientes de Ultralytics adoptan diseños sin anclajes, lo que reduce la complejidad del ajuste de hiperparámetros y mejora la generalización en conjuntos de datos diversos.

Análisis del rendimiento#

Al comparar estos modelos en el benchmark MS COCO, los avances de YOLOv9 resultan evidentes. YOLOv9 logra sistemáticamente un mejor equilibrio entre precisión y FLOPs.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

Aunque YOLOX ofrece variantes ligeras como YOLOX-Nano para casos extremos en dispositivos edge, las variantes de YOLOv9 superan sistemáticamente a los modelos YOLOX de tamaño similar en precisión pura. Por ejemplo, YOLOv9m logra un 51,4 % de mAP frente al 49,7 % de YOLOXl, a pesar de tener menos de la mitad de parámetros (20,0 M frente a 54,2 M).

La ventaja de Ultralytics#

Elegir un modelo implica algo más que teoría arquitectónica; el ecosistema que lo rodea determina la velocidad de desarrollo y el éxito de la implementación. Utilizar YOLOv9 dentro del ecosistema de Ultralytics proporciona una facilidad de uso inigualable y un sólido apoyo de la comunidad.

A diferencia de los repositorios de investigación originales más antiguos, el framework de Ultralytics proporciona una API Python unificada que simplifica las canalizaciones complejas. El entrenamiento requiere mucha menos memoria GPU que muchas alternativas, lo que ofrece una eficiencia de entrenamiento extraordinaria.

from ultralytics import YOLO

# Initialize the YOLOv9c model
model = YOLO("yolov9c.pt")

# Train the model on your custom dataset seamlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate the model's performance
metrics = model.val()

# Export the optimized model to TensorRT format
model.export(format="engine")

Con compatibilidad integrada para múltiples tareas, como la detección de objetos, la segmentación de instancias y la estimación de poses, puedes adaptar rápidamente tus soluciones de visión por computador sin cambiar toda tu base de código.

Exportación sin complicaciones

¿Quieres implementar en dispositivos edge? Ultralytics facilita la exportación de tus modelos entrenados a formatos altamente optimizados como ONNX, TensorRT y OpenVINO con un solo comando.

Aplicaciones en el mundo real#

Las fortalezas específicas de estos modelos los adaptan a distintas aplicaciones del mundo real:

Analítica minorista de alta velocidad#

Para entornos minoristas modernos que requieren reconocimiento de productos en tiempo real, YOLOv9 destaca. Su capacidad para conservar detalles intrincados de las características lo hace ideal para implementaciones de IA en el comercio minorista en las que es necesario distinguir entre productos visualmente similares en una estantería abarrotada.

Implementaciones edge heredadas#

En situaciones regidas por limitaciones estrictas de hardware o por NPU especializadas que tienen dificultades con los bloques de agregación más recientes, YOLOX-Nano puede encontrar ocasionalmente un nicho. Sus patrones convolucionales puros y simplificados se prefieren a veces para microcontroladores con recursos extremadamente limitados.

Robótica autónoma#

En la navegación robótica, no detectar objetos pequeños puede tener consecuencias catastróficas. La arquitectura GELAN de YOLOv9 garantiza que las características de los obstáculos pequeños y distantes no se pierdan en las capas profundas de la red, superando a los modelos antiguos en entornos críticos para la seguridad, como las aplicaciones de IA en automoción.

Casos de uso y recomendaciones#

La elección entre YOLOv9 y YOLOX depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una buena opción para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradientes: Investigación centrada en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Escenarios en los que se necesita el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO como punto de referencia para comparar arquitecturas.

Cuándo elegir YOLOX#

YOLOX se recomienda para:

  • Investigación sobre detección sin anchors: Investigación académica que utiliza la arquitectura limpia y sin anchors de YOLOX como línea base para experimentar con nuevas cabezas de detección o funciones de pérdida.
  • Dispositivos edge ultraligeros: Implementaciones en microcontroladores o hardware móvil antiguo donde sea fundamental el tamaño extremadamente reducido de la variante YOLOX-Nano (0.91M de parámetros).
  • Estudios de asignación de etiquetas SimOTA: Proyectos de investigación que analizan estrategias de asignación de etiquetas basadas en el transporte óptimo y su impacto en la convergencia del entrenamiento.

Cuándo elegir Ultralytics (YOLO26)#

Para la mayoría de los proyectos nuevos, Ultralytics YOLO26 ofrece la mejor combinación de rendimiento y experiencia para desarrolladores:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

El futuro: llega YOLO26#

Aunque YOLOv9 representa un hito impresionante, las exigencias de los entornos de producción amplían constantemente los límites. El recién lanzado YOLO26 representa el estándar definitivo para la IA de visión moderna.

YOLO26 revitaliza por completo la canalización de implementación con un diseño nativo de extremo a extremo sin NMS. Al eliminar la necesidad de aplicar una supresión compleja de valores no máximos durante el posprocesamiento, ofrece una latencia de inferencia significativamente menor.

Además, YOLO26 incorpora el innovador optimizador MuSGD, un híbrido de SGD y Muon que toma innovaciones del entrenamiento de LLM para proporcionar una convergencia increíblemente estable y rápida. Al eliminar Distribution Focal Loss (DFL), YOLO26 logra una inferencia en CPU hasta un 43 % más rápida que sus predecesores, lo que lo convierte en la mejor opción para dispositivos edge e implementaciones empresariales. Gracias a las notables mejoras en el reconocimiento de objetos pequeños mediante ProgLoss y STAL, YOLO26 sustituye eficazmente tanto a YOLOX como a YOLOv9.

Para los ingenieros que exploran arquitecturas modernas, también recomendamos echar un vistazo a YOLO11 y RT-DETR como alternativas potentes dentro del conjunto de Ultralytics. Asegúrate de que tu proyecto esté preparado para el futuro aprovechando el rendimiento inigualable de los modelos más recientes en Ultralytics Platform.

Comentarios