YOLOX frente a YOLOv9#
El panorama de la visión por computador se ha visto marcado por avances arquitectónicos continuos que equilibran la eficiencia computacional con una alta precisión. Al evaluar modelos de detección de objetos en tiempo real, la comparación entre YOLOX, de Megvii, y YOLOv9, de Academia Sinica, pone de manifiesto dos filosofías distintas en el desarrollo del aprendizaje profundo. Mientras que uno fue pionero en un paradigma simplificado sin anclajes, el otro introdujo técnicas avanzadas de encaminamiento de gradientes para maximizar la retención de información.
Esta guía técnica explora sus particularidades arquitectónicas, sus resultados de rendimiento y sus casos de uso ideales, y también muestra cómo soluciones modernas como Ultralytics Platform y el modelo recién publicado YOLO26 ofrecen alternativas superiores para implementaciones listas para producción.
YOLOX: pionero del paradigma sin anclajes#
Publicado a mediados de 2021, YOLOX supuso un gran paso adelante para estrechar la brecha entre la investigación académica y la aplicación industrial. Al eliminar la necesidad de cajas de anclaje predefinidas, simplificó drásticamente el ajuste heurístico necesario para conjuntos de datos personalizados.
- Autores: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li y Jian Sun
- Organización: Megvii
- Fecha de publicación: 18 de julio de 2021
- Referencia: Artículo de Arxiv
- Código fuente: Repositorio de YOLOX en GitHub
- Documentación: Documentación oficial de YOLOX
Innovaciones arquitectónicas#
YOLOX introdujo varios cambios clave en el flujo de detección estándar. Implementó una cabecera desacoplada que separa las tareas de clasificación y regresión, lo que redujo significativamente el conflicto entre identificar un objeto y localizar sus límites. Además, YOLOX adoptó SimOTA, una estrategia avanzada de asignación de etiquetas que asignaba dinámicamente muestras positivas durante el entrenamiento, lo que dio lugar a una convergencia más rápida y un mejor rendimiento general en conjuntos de datos de referencia estándar.
Puntos fuertes y limitaciones#
La principal fortaleza de YOLOX reside en su diseño simplificado. El mecanismo sin anclajes hace que los desarrolladores dediquen menos tiempo a ejecutar algoritmos de clustering para encontrar tamaños de anclaje óptimos para sus datos específicos. Sin embargo, al ser una arquitectura más antigua creada originalmente sin avances recientes en autoatención ni en encaminamiento de gradientes, tiene dificultades para igualar la eficiencia de parámetros de las redes más modernas. Tampoco ofrece compatibilidad nativa con tareas avanzadas como la segmentación de instancias y la estimación de pose dentro de una API unificada.
YOLOv9: maximización de la información de gradiente#
En 2024, YOLOv9 introdujo un enfoque altamente teórico para resolver el problema del cuello de botella de información inherente a las redes neuronales convolucionales profundas.
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica
- Fecha de lanzamiento: 21 de febrero de 2024
- Referencia: Artículo de Arxiv
- Código fuente: Repositorio de YOLOv9 en GitHub
- Documentación: Documentación de Ultralytics sobre YOLOv9
Innovaciones arquitectónicas#
La característica definitoria de YOLOv9 es la Información de Gradiente Programable (PGI), que garantiza que los datos semánticos cruciales no se pierdan al pasar por múltiples capas de la red. Junto con la Red Generalizada de Agregación Eficiente de Capas (GELAN), YOLOv9 consigue una relación excepcional entre parámetros y precisión. Esto permite al modelo conservar gradientes precisos para actualizar los pesos, lo que lo hace muy eficaz incluso en sus variantes ligeras.
Puntos fuertes y limitaciones#
YOLOv9 destaca por ampliar los límites teóricos de la precisión del modelo. Obtiene excelentes puntuaciones de mAP en COCO, lo que lo convierte en uno de los favoritos de los investigadores. Sin embargo, a pesar de su eficiencia, YOLOv9 sigue dependiendo de la Supresión no máxima (NMS) tradicional para el posprocesamiento, lo que introduce picos de latencia durante la inferencia. Para los ingenieros centrados en implementar IA en dispositivos periféricos, gestionar la lógica de NMS añade complejidad innecesaria al flujo de implementación.
Los modelos tradicionales como YOLOX y YOLOv9 requieren la Supresión no máxima (NMS) para filtrar las cajas delimitadoras duplicadas. Este paso es inherentemente secuencial y suele crear un cuello de botella en las CPU, lo que pone de relieve la necesidad de las arquitecturas nativas integrales presentes en los modelos más recientes de Ultralytics.
Comparación de rendimiento#
Al comparar las métricas computacionales sin procesar de estas arquitecturas, queda claro que YOLOv9 ofrece una línea base más moderna, mientras que YOLOX sigue siendo una opción ligera para configuraciones heredadas. A continuación se desglosan detalladamente sus modelos estándar.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Aunque YOLOv9 demuestra una precisión superior con cantidades de parámetros comparables, los desarrolladores que busquen el equilibrio definitivo entre velocidad, precisión y facilidad de uso deberían considerar los últimos avances de Ultralytics.
La ventaja de Ultralytics: conoce YOLO26#
Aunque evaluar modelos históricos como YOLOX y YOLOv9 aporta un contexto valioso, el estado actual de la técnica lo define Ultralytics YOLO26. Publicado a principios de 2026, YOLO26 rediseña fundamentalmente el flujo de detección para los entornos empresariales modernos.
Innovaciones arquitectónicas incomparables#
YOLO26 resuelve por completo los cuellos de botella del posprocesamiento de sus predecesores con un diseño nativo integral sin NMS, lo que garantiza una implementación más sencilla en todo tipo de hardware. Además, al eliminar la Pérdida Focal de Distribución (DFL) e integrar el novedoso optimizador MuSGD —un híbrido del Descenso de Gradiente Estocástico y Muon—, YOLO26 consigue una estabilidad de entrenamiento sin precedentes.
Para los desarrolladores que implementan soluciones en entornos con recursos limitados, como Raspberry Pi, YOLO26 ofrece una inferencia en CPU hasta un 43 % más rápida. También introduce las funciones de pérdida ProgLoss + STAL, que se traducen en mejoras drásticas en el reconocimiento de objetos pequeños, algo fundamental para las imágenes aéreas y la analítica con drones.
Ecosistema de desarrollo optimizado#
A diferencia de los repositorios de investigación independientes, el ecosistema de Ultralytics ofrece una experiencia de desarrollo incomparable. Mediante la API de Python de Ultralytics, los ingenieros pueden reducir drásticamente el código repetitivo. Además, los requisitos de memoria están muy optimizados, por lo que puedes entrenar modelos robustos utilizando menos VRAM de GPU que con arquitecturas basadas intensivamente en mecanismos de atención.
from ultralytics import YOLO
# Load the highly optimized, NMS-free YOLO26 small model
model = YOLO("yolo26s.pt")
# Train on a custom dataset with minimal memory footprint
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Easily export to optimized deployment formats
model.export(format="engine", quantize=16) # Exports to TensorRTMás allá de la detección, YOLO26 admite sin problemas multitud de tareas dentro exactamente del mismo marco de trabajo. Tanto si necesitas cajas delimitadoras orientadas (OBB) precisas para imágenes por satélite como máscaras de píxeles detalladas para aplicaciones de diagnóstico por imagen, el flujo de trabajo sigue siendo idéntico. Para los equipos que hayan invertido en flujos de trabajo de generaciones anteriores, Ultralytics YOLO11 también está disponible y cuenta con compatibilidad completa.
Casos de uso ideales y estrategias de despliegue#
La elección de la arquitectura adecuada depende por completo del entorno de implementación de destino y de los requisitos del proyecto.
Computación periférica y robótica#
En dispositivos de bajo consumo, depender de modelos que requieren un posprocesamiento intensivo puede hundir el rendimiento. Aunque YOLOX-Nano es increíblemente pequeño, su precisión suele ser insuficiente para tareas críticas para la seguridad. YOLO26 es la opción definitiva en este caso: al no utilizar DFL ni NMS, puede ejecutarse sin problemas en hilos de CPU sin procesar, lo que lo hace perfecto para la robótica autónoma o la gestión inteligente de aparcamientos.
Evaluación comparativa académica#
Si el único objetivo es analizar el flujo de gradientes y estudiar los cuellos de botella de las redes profundas, YOLOv9 sigue siendo un objeto de estudio excelente. Su marco de PGI ofrece información fascinante sobre cómo se conservan las características a través de las capas profundas de las redes neuronales, lo que lo convierte en una herramienta valiosa para los investigadores universitarios que exploran la teoría convolucional.
Analítica de vídeo empresarial#
Para tareas de procesamiento de vídeo a gran escala, como los sistemas de alarma de seguridad o la supervisión del tráfico, la velocidad y las versátiles capacidades de exportación son fundamentales. Las herramientas de exportación nativas del marco de Ultralytics permiten a los equipos compilar YOLO26 directamente a TensorRT o OpenVINO con un solo comando, reduciendo drásticamente el tiempo de comercialización.
Al aprovechar las completas funciones del ecosistema de Ultralytics, los equipos de aprendizaje automático pueden evitar las complejidades de las bases de código de investigación sin procesar y centrarse directamente en crear aplicaciones de IA escalables y del mundo real.