YOLOv9 frente a YOLO26#
El panorama de la detección de objetos en tiempo real ha evolucionado considerablemente en los últimos años. A medida que los profesionales del aprendizaje automático buscan implementar modelos en distintos tipos de hardware, elegir la arquitectura adecuada es fundamental. En esta guía técnica completa, comparamos dos hitos importantes del campo de la visión artificial: YOLOv9, presentado a principios de 2024 y centrado en la optimización de las rutas del gradiente, y Ultralytics YOLO26, el framework más avanzado, publicado a principios de 2026, que redefine por completo la inferencia en dispositivos edge y la estabilidad del entrenamiento.
Resumen ejecutivo: linaje y autoría de los modelos#
Conocer los orígenes de estos modelos de aprendizaje profundo aporta un contexto valioso sobre las decisiones de diseño de su arquitectura y sus públicos objetivo.
YOLOv9#
YOLOv9, creado por Chien-Yao Wang y Hong-Yuan Mark Liao, del Instituto de Ciencias de la Información de la Academia Sinica en Taiwán, se publicó el 21 de febrero de 2024. El modelo se centra en conceptos teóricos del aprendizaje profundo y, en concreto, aborda el problema del cuello de botella de la información en las redes neuronales convolucionales profundas (CNNs).
Ultralytics YOLO26#
YOLO26, creado por Glenn Jocher y Jing Qiu en Ultralytics, se publicó el 14 de enero de 2026. A partir del enorme éxito de modelos anteriores como YOLO11 y YOLOv8, YOLO26 se diseñó desde cero para dar prioridad a la preparación para producción, la implementación en dispositivos edge y la eficiencia nativa de extremo a extremo.
¿Preparado para actualizar tu pipeline de visión artificial? Puedes entrenar e implementar fácilmente modelos YOLO26 en la nube sin escribir código gracias a la plataforma de Ultralytics.
Innovaciones arquitectónicas#
Ambos modelos introducen cambios revolucionarios en el procesamiento de datos visuales por parte de las redes neuronales, pero abordan el problema desde perspectivas diferentes.
Información de gradiente programable en YOLOv9#
La principal aportación de YOLOv9 al campo es la introducción de información de gradiente programable (PGI) y la red de agregación de capas eficiente generalizada (GELAN). A medida que las redes neuronales se hacen más profundas, suelen sufrir pérdidas de información durante el proceso de propagación hacia delante. PGI garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación sigan siendo precisos y fiables, lo que permite a la arquitectura GELAN lograr una gran precisión con menos parámetros.
Sin embargo, YOLOv9 depende en gran medida de la supresión no máxima tradicional (NMS) para el posprocesamiento, lo que puede convertirse en un cuello de botella de latencia durante la inferencia en situaciones reales.
La arquitectura de YOLO26, diseñada para dispositivos edge#
YOLO26 adopta un enfoque radicalmente distinto al optimizar todo el pipeline, desde el entrenamiento hasta la implementación en tiempo real. Se basa en el diseño sin NMS de extremo a extremo, introducido por primera vez en YOLOv10, y elimina por completo la necesidad de posprocesamiento con NMS. Así consigue una latencia extraordinariamente baja, por lo que está muy optimizado para dispositivos edge como Raspberry Pi o NVIDIA Jetson.
Además, YOLO26 elimina por completo la pérdida focal de distribución (DFL). Este cambio estructural simplifica la exportación a ONNX y ofrece una compatibilidad mucho mejor con dispositivos edge de bajo consumo.
Para la fase de entrenamiento, YOLO26 integra el novedoso optimizador MuSGD, un híbrido de descenso de gradiente estocástico y Muon (inspirado en las metodologías de entrenamiento de LLM de Kimi K2, de Moonshot AI). Esto conecta las innovaciones del entrenamiento de modelos de lenguaje de gran tamaño (LLM) con la visión artificial, y ofrece un entrenamiento mucho más estable y una convergencia más rápida.
Comparativa de rendimiento y métricas#
Al comparar ambos modelos con el conocido conjunto de datos COCO, los dos demuestran capacidades excepcionales, pero el ecosistema de Ultralytics destaca por la velocidad práctica de inferencia y la eficiencia en el uso de parámetros.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
Análisis de los resultados#
- Velocidad y eficiencia: gracias a su arquitectura sin NMS y a sus funciones de pérdida simplificadas, YOLO26 ofrece una inferencia en CPU hasta un 43 % más rápida que las arquitecturas anteriores. El modelo YOLO26n alcanza una velocidad asombrosa de 1,7 ms en una GPU NVIDIA T4 con TensorRT, lo que lo convierte en la opción ideal para flujos de vídeo en tiempo real.
- Precisión: el modelo YOLO26x alcanza unos 57,5 mAP sin precedentes y supera al modelo YOLOv9e más grande, a la vez que mantiene una latencia menor.
- Requisitos de memoria: los modelos de Ultralytics son conocidos por su eficiencia. YOLO26 necesita mucha menos memoria CUDA durante el entrenamiento del modelo y la inferencia que los complejos modelos de visión basados en Transformer, lo que permite a los desarrolladores utilizar tamaños de lote mayores en hardware de consumo.
Ecosistema, facilidad de uso y versatilidad#
La verdadera fortaleza del ecosistema de Ultralytics reside en la experiencia de usuario. Mientras que los investigadores que utilizan la base de código de YOLOv9 en GitHub deben lidiar con configuraciones de entorno complejas y scripts manuales, YOLO26 está totalmente integrado en la intuitiva API de Python de Ultralytics.
Ejemplo de API simplificada#
Para entrenar un modelo YOLO26 de vanguardia solo necesitas unas pocas líneas de código Python:
from ultralytics import YOLO
# Carga el modelo YOLO26 nativo más reciente de extremo a extremo
model = YOLO("yolo26s.pt")
# Entrena el modelo; optimizer="auto" selecciona MuSGD para ejecuciones largas (>10k iteraciones)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Expórtalo de forma nativa al formato ONNX con un solo comando
model.export(format="onnx")Versatilidad multitarea sin igual#
A diferencia de YOLOv9, diseñado principalmente para la detección de objetos estándar, YOLO26 admite de forma nativa una amplia variedad de tareas de visión artificial desde el primer momento. La arquitectura incluye mejoras específicas para distintas aplicaciones:
- Segmentación de instancias: incorpora una función de pérdida de segmentación semántica especializada y prototipos multiescala para generar máscaras impecables a nivel de píxel.
- Estimación de pose: integra la estimación residual de máxima verosimilitud (RLE) para seguir puntos clave del esqueleto con una precisión extrema.
- Cajas delimitadoras orientadas (OBB): incluye una función de pérdida angular especializada, diseñada específicamente para resolver problemas de límites en la detección de objetos rotados en imágenes aéreas.
- Clasificación de imágenes: ofrece una categorización fiable de imágenes completas según los estándares de ImageNet.
Todos los modelos YOLO26 se benefician de una integración fluida con la plataforma de Ultralytics, que ofrece etiquetado de conjuntos de datos integrado, aprendizaje activo y pipelines de implementación instantánea.
Aplicaciones en el mundo real#
La elección entre estos modelos suele depender del entorno en el que se vayan a implementar.
IoT y robótica edge#
Para la robótica, los drones autónomos y los dispositivos IoT para el hogar inteligente, YOLO26 es el claro vencedor. La integración de ProgLoss + STAL mejora notablemente el reconocimiento de objetos pequeños, algo fundamental para la supervisión agrícola con drones a gran altura. Combinado con una inferencia en CPU un 43 % más rápida y un diseño sin NMS, YOLO26 funciona con fluidez en hardware sin GPU dedicada.
Investigación académica y análisis del gradiente#
YOLOv9 sigue gozando de gran prestigio en el ámbito académico. Los investigadores que estudien los límites teóricos del flujo del gradiente o quieran crear capas personalizadas de PyTorch basadas en el concepto PGI encontrarán en la base de código de YOLOv9 un excelente punto de partida para explorar la teoría del aprendizaje profundo.
Pipelines de fabricación de alta velocidad#
En entornos industriales, como la detección de defectos automatizada en cintas transportadoras de alta velocidad, la vertiginosa velocidad de TensorRT en los modelos YOLO26 garantiza que no se pierda ningún fotograma y maximiza el rendimiento de los sistemas de control de calidad.
Casos de uso y recomendaciones#
La elección entre YOLOv9 y YOLO26 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.
Cuándo elegir YOLOv9#
YOLOv9 es una buena opción para:
- Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
- Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
- Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.
Cuándo elegir YOLO26#
Se recomienda YOLO26 para:
- Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
- Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
- Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.
Conclusión#
Ambos modelos representan avances extraordinarios para la comunidad de código abierto. YOLOv9 introdujo mejoras teóricas fundamentales en el flujo del gradiente que inspirarán arquitecturas durante años. Sin embargo, para los desarrolladores actuales, las startups y los equipos empresariales que buscan un equilibrio impecable entre velocidad, precisión y facilidad de implementación, Ultralytics YOLO26 es la recomendación clara.
Al ofrecer inferencia sin NMS, incorporar el potente optimizador MuSGD y proporcionar un conjunto de herramientas sin parangón para tareas de detección, segmentación y pose, YOLO26 garantiza que tus proyectos de visión artificial se basen en el framework más fiable y preparado para el futuro disponible hoy.