YOLO Vision 2026:

YOLOv9 frente a YOLO26#

El panorama de la detección de objetos en tiempo real ha evolucionado significativamente en los últimos años. A medida que los profesionales del aprendizaje automático buscan implementar modelos en una variedad de hardware, elegir la arquitectura adecuada es fundamental. En esta guía técnica exhaustiva, comparamos dos hitos importantes en el campo de la visión artificial: YOLOv9, presentado a principios de 2024 con un enfoque en las optimizaciones de rutas de gradiente, y Ultralytics YOLO26, el marco de última generación más reciente lanzado a principios de 2026 que redefinido por completo la inferencia en el borde y la estabilidad del entrenamiento.

Resumen ejecutivo: Linaje del modelo y autoría#

Comprender los orígenes de estos modelos de aprendizaje profundo aporta un contexto valioso sobre sus decisiones de diseño arquitectónico y sus audiencias objetivo.

YOLOv9#

Escrito por Chien-Yao Wang y Hong-Yuan Mark Liao del Instituto de Ciencia de la Información de Academia Sinica en Taiwán, YOLOv9 se lanzó el 21 de febrero de 2024. El modelo se centra en gran medida en conceptos teóricos del aprendizaje profundo, abordando específicamente el problema del cuello de botella de información en las redes neuronales convolucionales profundas (CNN).

Aprende más sobre YOLOv9

Ultralytics YOLO26#

Escrito por Glenn Jocher y Jing Qiu en Ultralytics, YOLO26 se lanzó el 14 de enero de 2026. Basándose en el enorme éxito de predecesores como YOLO11 y YOLOv8, YOLO26 fue diseñado desde cero para priorizar la preparación para producción, la implementación en el borde y la eficiencia nativa de extremo a extremo.

Más información sobre YOLO26

Prueba YOLO26 hoy

¿Estás listo para actualizar tu tubería de visión artificial? Puedes entrenar e implementar fácilmente modelos YOLO26 en la nube sin escribir código utilizando Ultralytics Platform.

Innovaciones arquitectónicas#

Ambos modelos introducen cambios innovadores en la forma en que las redes neuronales procesan datos visuales, pero abordan el problema desde diferentes ángulos.

Información de gradiente programable en YOLOv9#

La principal contribución de YOLOv9 al campo es la introducción de Información de Gradiente Programable (PGI) y la Red de Agregación de Capas Eficiente Generalizada (GELAN). A medida que las redes neuronales se vuelven más profundas, a menudo sufren pérdida de información durante el proceso de propagación hacia adelante. PGI garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación sigan siendo precisos y confiables, lo que permite que la arquitectura GELAN logre una alta precisión con menos parámetros.

Sin embargo, YOLOv9 depende en gran medida de la supresión de no máximos (NMS) tradicional para el posprocesamiento, lo que puede convertirse en un cuello de botella de latencia durante la inferencia en el mundo real.

La arquitectura enfocada al borde de YOLO26#

YOLO26 adopta un enfoque radicalmente diferente al optimizar toda la tubería desde el entrenamiento hasta la implementación en tiempo real. Se basa en el Diseño Sin NMS de Extremo a Extremo pionero en YOLOv10, eliminando por completo la necesidad de posprocesamiento NMS. Esto da como resultado una latencia increíblemente baja, lo que lo hace altamente optimizado para dispositivos de borde como Raspberry Pi o NVIDIA Jetson.

Además, YOLO26 elimina por completo la Pérdida Focal de Distribución (DFL). Este cambio estructural simplifica la exportación de modelos a ONNX y proporciona una compatibilidad significativamente mejor con microcontroladores de bajo consumo.

Para la fase de entrenamiento, YOLO26 integra el novedoso MuSGD Optimizer, un híbrido de Descenso de Gradiente Estocástico y Muon (inspirado en las metodologías de entrenamiento de LLM de Kimi K2 de Moonshot AI). Esto cierra la brecha entre las innovaciones de entrenamiento de Modelos de Lenguaje Grande (LLM) y la visión artificial, ofreciendo un entrenamiento drásticamente más estable y tiempos de convergencia más rápidos.

Comparación de rendimiento y métricas#

Al realizar pruebas comparativas en el ampliamente utilizado conjunto de datos COCO, ambos modelos demuestran capacidades excepcionales, pero el ecosistema Ultralytics brilla en velocidades de inferencia prácticas y eficiencia de parámetros.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Análisis de los resultados#

  • Velocidad y eficiencia: Debido a que YOLO26 utiliza una arquitectura sin NMS y funciones de pérdida simplificadas, cuenta con hasta un 43 % más de velocidad de inferencia en CPU en comparación con arquitecturas heredadas. El modelo YOLO26n se ejecuta a unos vertiginosos 1.7 ms en una GPU NVIDIA T4 utilizando TensorRT, lo que lo convierte en la opción definitiva para transmisiones de video en tiempo real.
  • Precisión: El modelo YOLO26x logra una 57.5 mAP inigualable, superando al mayor modelo YOLOv9e mientras mantiene una latencia más baja.
  • Requisitos de memoria: Los modelos de Ultralytics son conocidos por su eficiencia. YOLO26 requiere mucha menos memoria CUDA durante el entrenamiento del modelo y la inferencia en comparación con los complejos modelos de visión basados en transformadores, lo que permite a los desarrolladores utilizar tamaños de lote más grandes en hardware de grado de consumidor.

Ecosistema, facilidad de uso y versatilidad#

La verdadera fuerza del ecosistema Ultralytics radica en su experiencia de usuario. Mientras que los investigadores que utilizan la base de código de GitHub de YOLOv9 deben navegar por configuraciones de entorno complejas y scripts manuales, YOLO26 está totalmente integrado en la intuitiva API de Python de Ultralytics.

Ejemplo de API optimizada#

Entrenar un modelo YOLO26 de última generación requiere solo unas pocas líneas de código Python:

from ultralytics import YOLO

# Load the latest native end-to-end YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model effortlessly with the default MuSGD optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export natively to ONNX format in a single command
model.export(format="onnx")

Versatilidad de tareas inigualable#

A diferencia de YOLOv9, que está adaptado principalmente para la detección de objetos estándar, YOLO26 admite de forma nativa una amplia gama de tareas de visión artificial listas para usar. La arquitectura incluye mejoras específicas para diversas aplicaciones:

  • Segmentación de instancias: Presenta una pérdida de segmentación semántica especializada y un proto multiescala para máscaras perfectas a nivel de píxel.
  • Estimación de poses: Integra la Estimación de Log-Verosimilitud Residual (RLE) para rastrear puntos clave esqueléticos con extrema precisión.
  • Cajas delimitadoras orientadas (OBB): Incluye una función de pérdida de ángulo especializada diseñada específicamente para resolver problemas de límites en la detección de objetos rotados para imágenes aéreas.
  • Clasificación de imágenes: Categorización robusta para imágenes completas basada en los estándares de ImageNet.
Ecosistema integrado

Todos los modelos YOLO26 se benefician de una integración perfecta con Ultralytics Platform, ofreciendo etiquetado de conjuntos de datos integrado, aprendizaje activo y conductos de implementación instantánea.

Aplicaciones en el mundo real#

Elegir entre estos modelos a menudo depende del entorno en el que se implementarán.

IoT y robótica de borde#

Para la robótica, los drones autónomos y los dispositivos IoT de hogares inteligentes, YOLO26 es el campeón indiscutible. La integración de ProgLoss + STAL aporta mejoras notables en el reconocimiento de objetos pequeños, lo cual es fundamental para el monitoreo agrícola desde drones de gran altitud. Combinado con su inferencia de CPU un 43 % más rápida y su diseño sin NMS, YOLO26 puede ejecutarse de manera fluida en hardware sin GPU dedicadas.

Investigación académica y análisis de gradiente#

YOLOv9 sigue siendo un modelo muy respetado dentro de los círculos académicos. Los investigadores que investigan los límites teóricos del flujo de gradiente, o aquellos que buscan construir capas de PyTorch personalizadas basadas en el concepto de PGI, encontrarán que la base de código de YOLOv9 es una excelente base para la exploración de la teoría del aprendizaje profundo.

Canalizaciones de fabricación de alta velocidad#

En entornos industriales como la detección de defectos automatizada en cintas transportadoras de alta velocidad, las velocidades ultrarrápidas de TensorRT de los modelos YOLO26 garantizan que no se pierda ningún fotograma, maximizando el rendimiento de los sistemas de control de calidad.

Casos de uso y recomendaciones#

Elegir entre YOLOv9 y YOLO26 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y las preferencias de ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una opción sólida para:

  • Investigación del cuello de botella de información: proyectos académicos que estudian arquitecturas de información de gradiente programable (PGI) y redes de agregación de capas eficientes generalizadas (GELAN).
  • Estudios de optimización del flujo de gradiente: investigación enfocada en comprender y mitigar la pérdida de información en capas de red profundas durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: escenarios donde el sólido rendimiento de YOLOv9 en el benchmark COCO es necesario como punto de referencia para comparaciones arquitectónicas.

Cuándo elegir YOLO26#

Se recomienda YOLO26 para:

  • Implementación en el borde sin NMS: Aplicaciones que requieren una inferencia consistente y de baja latencia sin la complejidad del posprocesamiento de supresión de no máximos.
  • Entornos solo de CPU: Dispositivos sin aceleración de GPU dedicada, donde la inferencia en CPU hasta un 43% más rápida de YOLO26 proporciona una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios desafiantes como la aerial drone imagery o el análisis con sensores IoT donde ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

Conclusión#

Ambos modelos representan increíbles saltos adelante para la comunidad de código abierto. YOLOv9 introdujo mejoras teóricas vitales en el flujo de gradiente que inspirarán arquitecturas durante años. Sin embargo, para los desarrolladores modernos, startups y equipos empresariales que buscan un equilibrio impecable entre velocidad, precisión y facilidad de implementación, Ultralytics YOLO26 es la recomendación clara.

Al eliminar NMS, introducir el potente optimizador MuSGD y proporcionar un conjunto inigualable de herramientas en tareas de detección, segmentación y pose, YOLO26 asegura que tus proyectos de visión artificial se construyan sobre el marco de trabajo más fiable y preparado para el futuro disponible hoy en día.

Colaboradores

Comentarios