Ultralytics YOLO27:
Get Started

YOLOX frente a YOLOv9#

El panorama de la visión por ordenador se ha definido por continuos avances arquitectónicos que equilibran la eficiencia computacional con una gran precisión. Al evaluar modelos de detección de objetos en tiempo real, la comparación entre YOLOX, de Megvii, y YOLOv9, de Academia Sinica, pone de manifiesto dos filosofías distintas de desarrollo del aprendizaje profundo. Mientras que uno fue pionero en un paradigma simplificado sin anclajes, el otro introdujo técnicas avanzadas de encaminamiento de gradientes para maximizar la retención de información.

Esta guía técnica explora sus particularidades arquitectónicas, los benchmarks de rendimiento y los casos de uso ideales, y muestra cómo soluciones modernas como la plataforma Ultralytics y el recién lanzado modelo YOLO26 ofrecen alternativas superiores para despliegues listos para producción.

YOLOX: pionero del paradigma sin anclajes#

Lanzado a mediados de 2021, YOLOX supuso un gran avance para salvar la distancia entre la investigación académica y la aplicación industrial. Al eliminar la necesidad de cuadros de anclaje predefinidos, simplificó drásticamente los ajustes heurísticos necesarios para los conjuntos de datos personalizados.

Innovaciones arquitectónicas#

YOLOX introdujo varios cambios clave en el flujo de detección estándar. Implementó una cabeza desacoplada que separaba las tareas de clasificación y regresión, lo que redujo considerablemente el conflicto entre identificar un objeto y localizar sus límites. Además, YOLOX adoptó SimOTA, una estrategia avanzada de asignación de etiquetas que asignaba dinámicamente muestras positivas durante el entrenamiento, lo que permitió converger más rápido y mejorar el rendimiento general en los conjuntos de datos de referencia estándar.

Puntos fuertes y limitaciones#

La principal fortaleza de YOLOX reside en su diseño simplificado. El mecanismo sin anclajes reduce el tiempo que los desarrolladores dedican a ejecutar algoritmos de agrupamiento para encontrar los tamaños de anclaje óptimos para sus datos. Sin embargo, al ser una arquitectura antigua, creada sin los avances recientes en autoatención o encaminamiento de gradientes, tiene dificultades para igualar la eficiencia de parámetros de las redes más nuevas. Tampoco admite de forma nativa tareas avanzadas como la segmentación de instancias y la estimación de pose en una API unificada.

Más información sobre YOLOX

YOLOv9: maximización de la información de gradiente#

Avanzamos hasta 2024, cuando YOLOv9 introdujo un enfoque muy teórico para resolver el problema del cuello de botella de información inherente a las redes neuronales convolucionales profundas.

Innovaciones arquitectónicas#

La característica distintiva de YOLOv9 es Programmable Gradient Information (PGI), que garantiza que los datos semánticos cruciales no se pierdan al atravesar las distintas capas de la red. Junto con Generalized Efficient Layer Aggregation Network (GELAN), YOLOv9 logra una relación entre parámetros y precisión excepcional. Esto permite al modelo conservar gradientes precisos para actualizar los pesos, lo que lo hace muy eficaz incluso en sus variantes ligeras.

Puntos fuertes y limitaciones#

YOLOv9 destaca por llevar al límite teórico la precisión del modelo. Obtiene excelentes puntuaciones de mAP en COCO, por lo que es uno de los favoritos de los investigadores. Sin embargo, a pesar de su eficiencia, YOLOv9 sigue dependiendo de la supresión no máxima (NMS) tradicional para el posprocesamiento, lo que provoca picos de latencia durante la inferencia. Para los ingenieros centrados en desplegar IA en dispositivos periféricos, gestionar la lógica de NMS añade una complejidad innecesaria al flujo de despliegue.

Más información sobre YOLOv9

Cuellos de botella en el posprocesamiento

Los modelos tradicionales como YOLOX y YOLOv9 requieren supresión no máxima (NMS) para filtrar los cuadros delimitadores duplicados. Este paso es intrínsecamente secuencial y a menudo genera un cuello de botella en las CPU, lo que pone de manifiesto la necesidad de las arquitecturas integrales nativas de los modelos más recientes de Ultralytics.

Comparativa de rendimiento#

Al comparar las métricas computacionales brutas de estas arquitecturas, queda claro que YOLOv9 ofrece una referencia más moderna, mientras que YOLOX sigue siendo una opción ligera para configuraciones heredadas. A continuación se desglosan en detalle sus modelos estándar.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Aunque YOLOv9 demuestra una precisión superior con un número comparable de parámetros, los desarrolladores que busquen el mejor equilibrio entre velocidad, precisión y facilidad de uso deberían tener en cuenta los últimos avances de Ultralytics.

La ventaja de Ultralytics: descubre YOLO26#

Aunque evaluar modelos históricos como YOLOX y YOLOv9 aporta un contexto valioso, el estado actual de la técnica lo define Ultralytics YOLO26. Lanzado a principios de 2026, YOLO26 rediseña por completo el flujo de detección para los entornos empresariales modernos.

Innovaciones arquitectónicas sin igual#

YOLO26 resuelve los cuellos de botella de posprocesamiento de sus predecesores con un diseño opcional integral sin NMS (nms=False), que simplifica el despliegue en cualquier hardware. Además, al eliminar Distribution Focal Loss (DFL) e integrar el novedoso optimizador MuSGD —una combinación de Stochastic Gradient Descent y Muon—, YOLO26 logra una estabilidad de entrenamiento sin precedentes.

Para los desarrolladores que despliegan en entornos con recursos limitados, como Raspberry Pi, YOLO26 ofrece una inferencia en CPU hasta un 43 % más rápida. También incorpora ProgLoss + STAL (pérdida progresiva y asignación de etiquetas con conciencia de objetos pequeños), que mejora drásticamente el reconocimiento de objetos pequeños, algo fundamental para las imágenes aéreas y el análisis con drones.

Ecosistema de desarrollo optimizado#

A diferencia de los repositorios de investigación independientes, el ecosistema de Ultralytics ofrece una experiencia para desarrolladores inigualable. Con la API de Python de Ultralytics, los ingenieros pueden reducir drásticamente el código repetitivo. Además, los requisitos de memoria están muy optimizados, por lo que puedes entrenar modelos robustos con menos VRAM de GPU que con arquitecturas que dependen en gran medida de la atención.

from ultralytics import YOLO

# Carga el modelo pequeño YOLO26, muy optimizado y sin NMS
model = YOLO("yolo26s.pt")

# Entrena con un conjunto de datos personalizado y un uso mínimo de memoria
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporta fácilmente a formatos de despliegue optimizados
model.export(format="engine", quantize=16)  # Se exporta a TensorRT

Además de la detección, YOLO26 admite sin problemas multitud de tareas dentro del mismo marco. Tanto si necesitas cuadros delimitadores orientados (OBB) precisos para imágenes de satélite como máscaras de píxeles detalladas para aplicaciones de imagen médica, el flujo de trabajo es el mismo. Los equipos que sigan trabajando con flujos de generaciones anteriores también disponen de Ultralytics YOLO11, con soporte completo.

Casos de uso ideales y estrategias de despliegue#

La elección de la arquitectura adecuada depende por completo del entorno de despliegue de destino y de los requisitos del proyecto.

Computación periférica y robótica#

En dispositivos de bajo consumo, depender de modelos que requieren un posprocesamiento intensivo puede hundir el rendimiento. Aunque YOLOX-Nano es increíblemente pequeño, su precisión suele ser insuficiente para tareas críticas para la seguridad. YOLO26 es la opción definitiva en este caso: su cabeza sin DFL y su inferencia opcional sin NMS le permiten ejecutarse sin problemas en hilos de CPU directamente, por lo que es perfecto para la robótica autónoma o la gestión inteligente de aparcamientos.

Evaluación comparativa académica#

Si el único objetivo es analizar el flujo de gradientes y estudiar los cuellos de botella de las redes profundas, YOLOv9 sigue siendo un excelente objeto de estudio. Su marco PGI ofrece información fascinante sobre cómo se conservan las características en las capas de las redes neuronales profundas, por lo que es una herramienta valiosa para investigadores universitarios que estudian la teoría de las redes convolucionales.

Análisis de vídeo empresarial#

En tareas de procesamiento de vídeo a gran escala, como los sistemas de alarma de seguridad o la monitorización del tráfico, la velocidad y la versatilidad de exportación son fundamentales. Las herramientas de exportación nativas del marco de Ultralytics permiten a los equipos compilar YOLO26 directamente a TensorRT o OpenVINO con un solo comando, lo que reduce drásticamente el tiempo de comercialización.

Al aprovechar las completas funcionalidades del ecosistema de Ultralytics, los equipos de aprendizaje automático pueden evitar las complejidades de las bases de código de investigación sin procesar y centrarse directamente en crear aplicaciones de IA escalables para el mundo real.

Colaboradores

Comentarios