YOLO26 frente a YOLOv9#
El panorama de la visión artificial avanza rápidamente, con nuevas arquitecturas que amplían continuamente los límites de la velocidad y la precisión. En esta comparación técnica, examinamos las diferencias entre YOLO26 y YOLOv9, dos modelos muy influyentes en el ámbito de la detección de objetos en tiempo real. Aunque ambos modelos ofrecen innovaciones arquitectónicas distintas, comprender sus compromisos de rendimiento, capacidades de despliegue y requisitos de hardware es crucial para seleccionar la herramienta adecuada para tu próximo proyecto de visión.
YOLO26: La potencia optimizada para dispositivos edge#
Lanzado a principios de 2026, Ultralytics YOLO26 representa un salto generacional en la eficiencia de despliegue y la estabilidad del entrenamiento del modelo. Diseñado como un framework nativo de extremo a extremo, aborda directamente los cuellos de botella del despliegue que históricamente han afectado a las aplicaciones de IA en dispositivos edge.
Detalles del modelo:
- Autores: Glenn Jocher y Jing Qiu
- Organización: Ultralytics
- Fecha: 2026-01-14
- GitHub: Repositorio de Ultralytics
- Documentación: Documentación de YOLO26
Arquitectura e innovaciones#
YOLO26 rediseña por completo la canalización de posprocesamiento al introducir un diseño de extremo a extremo sin NMS. Al eliminar la necesidad de la supresión no máxima (NMS), el modelo consigue una variabilidad de latencia mucho menor. Esto facilita significativamente el despliegue en plataformas móviles y edge, especialmente al exportar a frameworks como ONNX y Apple CoreML.
Además, la eliminación de la pérdida focal de distribución (DFL) simplifica el proceso de exportación y mejora la compatibilidad con microcontroladores de bajo consumo. Para mejorar la estabilidad del entrenamiento, YOLO26 integra el novedoso optimizador MuSGD, un híbrido del descenso de gradiente estocástico (SGD) y Muon (inspirado en innovaciones del entrenamiento de modelos de lenguaje de gran tamaño). Esto se traduce en una convergencia más rápida y una extracción de características más robusta en conjuntos de datos difíciles.
Gracias a las simplificaciones arquitectónicas y a la eliminación de DFL, YOLO26 logra una inferencia en CPU hasta un 43 % más rápida, lo que lo convierte en la opción ideal para dispositivos edge con recursos limitados, como Raspberry Pi o NVIDIA Jetson Nano.
Para detectar elementos especialmente difíciles en escenas como imágenes aéreas captadas por drones, YOLO26 utiliza las funciones de pérdida actualizadas ProgLoss + STAL. Estas proporcionan mejoras notables en el recall del reconocimiento de objetos pequeños. Además, ofrece mejoras específicas para cada tarea, como proto multiescala para la segmentación de instancias, la estimación residual de log-verosimilitud (RLE) para la estimación de pose y una función de pérdida angular especializada para detectar cajas delimitadoras orientadas (OBB).
YOLOv9: Información de gradiente programable#
Presentado a principios de 2024, YOLOv9 aportó avances teóricos a la forma en que las redes neuronales gestionan el flujo de gradientes durante la fase de entrenamiento, centrándose en la eficiencia de los parámetros y la conservación de características profundas.
Detalles del modelo:
- Autores: Chien-Yao Wang y Hong-Yuan Mark Liao
- Organización: Institute of Information Science, Academia Sinica, Taiwán
- Fecha: 2024-02-21
- Arxiv: Artículo de YOLOv9
- GitHub: Repositorio de YOLOv9
- Documentación: Documentación de YOLOv9
Arquitectura y puntos fuertes#
YOLOv9 se basa en el concepto de información de gradiente programable (PGI) y la red de agregación de capas eficiente generalizada (GELAN). Estos conceptos abordan el problema del cuello de botella de información que suele observarse en las redes neuronales profundas. Al conservar la información esencial durante el proceso de propagación hacia delante, GELAN garantiza que los gradientes utilizados para actualizar los pesos sigan siendo fiables. Esta arquitectura ofrece una gran precisión y convierte a YOLOv9 en una opción sólida para la investigación académica sobre teoría de redes neuronales y optimización de rutas de gradiente mediante el framework PyTorch.
Limitaciones#
A pesar de su excelente eficiencia en cuanto a parámetros, YOLOv9 depende en gran medida de la NMS tradicional para el posprocesamiento de las cajas delimitadoras, lo que puede crear cuellos de botella computacionales durante la inferencia en dispositivos edge. Además, el repositorio oficial se centra principalmente en la detección de objetos, por lo que requiere un trabajo de ingeniería personalizado considerable para adaptarlo a tareas especializadas como el seguimiento o la estimación de pose.
Comparación de rendimiento#
Al evaluar estos modelos para su despliegue en el mundo real, es fundamental equilibrar la precisión (mAP), la velocidad de inferencia y el uso de memoria. Los modelos de Ultralytics son conocidos por sus bajos requisitos de memoria tanto durante el entrenamiento como durante la inferencia, y necesitan mucha menos memoria de CUDA que las alternativas basadas en Transformer, como RT-DETR.
A continuación se muestra una comparación directa del rendimiento de YOLO26 y YOLOv9 en el conjunto de datos COCO. Los mejores valores de cada columna aparecen resaltados en negrita.
| Modelo | tamaño (píxeles) | mAPval 50-95 | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Nota: Las velocidades de CPU de YOLOv9 se omiten porque varían mucho según la configuración de NMS y, por lo general, son más lentas que la implementación nativa sin NMS de YOLO26.
Casos de uso y recomendaciones#
La elección entre YOLO26 y YOLOv9 depende de los requisitos específicos de tu proyecto, las limitaciones del despliegue y tus preferencias en cuanto al ecosistema.
Cuándo elegir YOLO26#
YOLO26 es una opción sólida para:
- Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
- Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
- Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.
Cuándo elegir YOLOv9#
YOLOv9 se recomienda para:
- Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
- Estudios de optimización del flujo de gradientes: Investigación centrada en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
- Evaluación comparativa de detección de alta precisión: Escenarios en los que se necesita el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO como punto de referencia para comparar arquitecturas.
La ventaja de Ultralytics#
Elegir un modelo implica mucho más que consultar una prueba de referencia de precisión; el ecosistema de software que lo rodea determina la rapidez con la que puedes pasar de la recopilación de datos a producción.
Facilidad de uso y ecosistema#
La API de Python de Ultralytics ofrece una experiencia fluida de «cero a experto». En lugar de clonar repositorios complejos o configurar manualmente scripts de entrenamiento distribuido, los desarrolladores pueden instalar el paquete mediante pip y empezar a entrenar inmediatamente. El ecosistema de Ultralytics, que se mantiene activamente, garantiza actualizaciones frecuentes, integraciones automatizadas con plataformas de ML como Weights & Biases y una documentación extensa.
Versatilidad en tareas de visión#
Mientras que YOLOv9 es principalmente un motor de detección, YOLO26 es una herramienta de visión de propósito general. Con una única sintaxis unificada, puedes pasar fácilmente de la detección de objetos a la segmentación de imágenes píxel a píxel o a la clasificación de imágenes completas. Esta versatilidad reduce la deuda técnica de mantener varias bases de código independientes para distintas funcionalidades de visión artificial.
Entrenamiento y despliegue eficientes#
La eficiencia del entrenamiento es un pilar fundamental de la filosofía de Ultralytics. YOLO26 utiliza pesos preentrenados disponibles y ofrece un uso de memoria significativamente menor en comparación con los pesados Transformer de visión. Una vez entrenado, las canalizaciones de exportación integradas permiten convertir con un solo clic a formatos optimizados como TensorRT o TensorFlow Lite, lo que facilita el paso a producción.
Ejemplo de código: primeros pasos con YOLO26#
Implementar YOLO26 es extraordinariamente sencillo. El siguiente fragmento de Python muestra cómo cargar un modelo preentrenado, entrenarlo con datos personalizados y ejecutar la inferencia mediante la API de Ultralytics.
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset utilizing the MuSGD optimizer
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Uses GPU 0, or use 'cpu' for CPU training
)
# Run an NMS-free inference on a sample image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Display the bounding boxes and confidences
predictions[0].show()Al aprovechar la velocidad, la arquitectura simplificada y el sólido ecosistema de YOLO26, los equipos pueden llevar aplicaciones avanzadas de IA de visión al mercado más rápido y con menos obstáculos técnicos que nunca.