Ultralytics YOLO27:

YOLOv9 frente a YOLO26#

El panorama de la detección de objetos en tiempo real ha evolucionado significativamente en los últimos años. A medida que los profesionales del aprendizaje automático buscan implementar modelos en una amplia variedad de dispositivos, elegir la arquitectura adecuada es fundamental. En esta completa guía técnica, comparamos dos hitos importantes del campo de la visión artificial: YOLOv9, presentado a principios de 2024 con especial atención a las optimizaciones de las rutas de gradiente, y Ultralytics YOLO26, el marco de trabajo de última generación más reciente, publicado a principios de 2026, que redefine por completo la inferencia en el edge y la estabilidad del entrenamiento.

Resumen ejecutivo: linaje y autoría de los modelos#

Comprender los orígenes de estos modelos de aprendizaje profundo aporta un contexto valioso sobre sus decisiones de diseño arquitectónico y sus públicos objetivo.

YOLOv9#

Desarrollado por Chien-Yao Wang y Hong-Yuan Mark Liao, del Institute of Information Science de la Academia Sinica en Taiwán, YOLOv9 se publicó el 21 de febrero de 2024. El modelo se centra en gran medida en conceptos teóricos del aprendizaje profundo, abordando específicamente el problema del cuello de botella de información en las redes neuronales convolucionales (CNNs) profundas.

Más información sobre YOLOv9

Ultralytics YOLO26#

Desarrollado por Glenn Jocher y Jing Qiu en Ultralytics, YOLO26 se publicó el 14 de enero de 2026. Basándose en el enorme éxito de predecesores como YOLO11 y YOLOv8, YOLO26 se diseñó desde cero para priorizar la preparación para producción, la implementación en el edge y la eficiencia nativa de extremo a extremo.

Prueba YOLO26 hoy mismo

¿Listo para actualizar tu pipeline de visión artificial? Puedes entrenar e implementar fácilmente modelos YOLO26 en la nube sin escribir código mediante Ultralytics Platform.

Innovaciones arquitectónicas#

Ambos modelos introducen cambios revolucionarios en la forma en que las redes neuronales procesan los datos visuales, pero abordan el problema desde perspectivas diferentes.

Información de gradiente programable en YOLOv9#

La principal contribución de YOLOv9 al campo es la introducción de la información de gradiente programable (PGI) y la red generalizada de agregación eficiente de capas (GELAN). A medida que las redes neuronales se hacen más profundas, suelen sufrir pérdidas de información durante el proceso de propagación hacia delante. PGI garantiza que los gradientes utilizados para actualizar los pesos durante la retropropagación sigan siendo precisos y fiables, lo que permite a la arquitectura GELAN alcanzar una gran precisión con menos parámetros.

Sin embargo, YOLOv9 depende en gran medida de la supresión no máxima (NMS) tradicional para el posprocesamiento, lo que puede convertirse en un cuello de botella de latencia durante la inferencia en situaciones reales.

La arquitectura edge-first de YOLO26#

YOLO26 adopta un enfoque radicalmente distinto al optimizar todo el pipeline, desde el entrenamiento hasta la implementación en tiempo real. Se basa en el diseño de extremo a extremo sin NMS, introducido originalmente en YOLOv10, y elimina por completo la necesidad del posprocesamiento NMS. El resultado es una latencia extremadamente baja, lo que lo hace altamente adecuado para dispositivos edge como Raspberry Pi o [NVIDIA Jetson](https://ultralytics-translation-2.invalid].

Además, YOLO26 elimina por completo la pérdida focal de distribución (DFL). Este cambio estructural simplifica la exportación a ONNX de modelos y ofrece una compatibilidad considerablemente mejor con microcontroladores de bajo consumo.

Para la fase de entrenamiento, YOLO26 integra el novedoso optimizador MuSGD, un híbrido del descenso de gradiente estocástico y Muon (inspirado en las metodologías de entrenamiento de modelos de lenguaje de gran tamaño (LLM) de Kimi K2, de Moonshot AI). Esto tiende un puente entre las innovaciones del entrenamiento de modelos de lenguaje de gran tamaño (LLM) y la visión artificial, ofreciendo un entrenamiento mucho más estable y tiempos de convergencia más rápidos.

Comparación de rendimiento y métricas#

Al realizar pruebas de referencia con el ampliamente utilizado conjunto de datos COCO, ambos modelos demuestran unas capacidades excepcionales, pero el ecosistema de Ultralytics destaca por sus velocidades de inferencia prácticas y su eficiencia en cuanto a parámetros.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

Análisis de los resultados#

  • Velocidad y eficiencia: Como YOLO26 utiliza una arquitectura sin NMS y funciones de pérdida simplificadas, ofrece una inferencia en CPU hasta un 43 % más rápida que las arquitecturas heredadas. El modelo YOLO26n se ejecuta en unos impresionantes 1,7 ms en una GPU NVIDIA T4 mediante TensorRT, lo que lo convierte en la opción definitiva para streams de vídeo en tiempo real.
  • Precisión: El modelo YOLO26x alcanza un mAP de 57,5 sin precedentes, superando al modelo YOLOv9e más grande y manteniendo una latencia inferior.
  • Requisitos de memoria: Los modelos de Ultralytics son conocidos por su eficiencia. YOLO26 requiere mucha menos memoria CUDA durante el entrenamiento del modelo y la inferencia que los complejos modelos de visión basados en Transformer, lo que permite a los desarrolladores utilizar tamaños de lote mayores en hardware de consumo.

Ecosistema, facilidad de uso y versatilidad#

La verdadera fortaleza del ecosistema de Ultralytics reside en su experiencia de usuario. Mientras que los investigadores que utilizan el repositorio de código de YOLOv9 en GitHub deben lidiar con configuraciones de entorno complejas y scripts manuales, YOLO26 está completamente integrado en la intuitiva API de Python de Ultralytics.

Ejemplo de API simplificado#

Entrenar un modelo YOLO26 de última generación solo requiere unas pocas líneas de código Python:

from ultralytics import YOLO

# Load the latest native end-to-end YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model effortlessly with the default MuSGD optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export natively to ONNX format in a single command
model.export(format="onnx")

Versatilidad de tareas sin igual#

A diferencia de YOLOv9, diseñado principalmente para la detección de objetos estándar, YOLO26 admite de forma nativa una amplia variedad de tareas de visión artificial desde el primer momento. La arquitectura incluye mejoras específicas para diversas aplicaciones:

  • Segmentación de instancias: Incluye una función de pérdida de segmentación semántica especializada y un proto multiescala para generar máscaras impecables a nivel de píxel.
  • Estimación de poses: Integra la estimación residual de log-verosimilitud (RLE) para realizar un seguimiento extremadamente preciso de los puntos clave del esqueleto.
  • Cajas delimitadoras orientadas (OBB): Incluye una función de pérdida angular especializada, diseñada específicamente para resolver problemas de límites en la detección de objetos rotados en imágenes aéreas.
  • Clasificación de imágenes: Categorización robusta de imágenes completas basada en los estándares de ImageNet.
Ecosistema integrado

Todos los modelos YOLO26 se benefician de una integración fluida con Ultralytics Platform, que ofrece etiquetado de conjuntos de datos, aprendizaje activo y pipelines de implementación instantánea integrados.

Aplicaciones en el mundo real#

La elección entre estos modelos suele depender del entorno en el que se implementarán.

IoT y robótica edge#

Para robótica, drones autónomos y dispositivos IoT domésticos inteligentes, YOLO26 es el campeón indiscutible. La integración de ProgLoss + STAL aporta mejoras notables en el reconocimiento de objetos pequeños, algo fundamental para la monitorización agrícola desde drones a gran altitud. Combinado con su inferencia en CPU un 43 % más rápida y su diseño sin NMS, YOLO26 puede ejecutarse con fluidez en hardware sin GPUs dedicadas.

Investigación académica y análisis de gradientes#

YOLOv9 sigue siendo un modelo muy respetado en los círculos académicos. Los investigadores que estudien los límites teóricos del flujo de gradientes o que busquen crear capas personalizadas de PyTorch basadas en el concepto PGI encontrarán en el repositorio de código de YOLOv9 una base excelente para explorar la teoría del aprendizaje profundo.

Pipelines de fabricación de alta velocidad#

En entornos industriales, como la detección de defectos automatizada en cintas transportadoras de alta velocidad, las vertiginosas velocidades de TensorRT de los modelos YOLO26 garantizan que no se pierda ningún frame, maximizando el rendimiento de los sistemas de control de calidad.

Casos de uso y recomendaciones#

La elección entre YOLOv9 y YOLO26 depende de los requisitos específicos de tu proyecto, las limitaciones de implementación y tus preferencias en cuanto al ecosistema.

Cuándo elegir YOLOv9#

YOLOv9 es una buena opción para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradientes: Investigación centrada en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Escenarios en los que se necesita el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO como punto de referencia para comparar arquitecturas.

Cuándo elegir YOLO26#

YOLO26 se recomienda para:

  • Despliegue edge sin NMS: Aplicaciones que requieren una inferencia constante y de baja latencia sin la complejidad del posprocesamiento de supresión no máxima.
  • Entornos exclusivamente con CPU: Dispositivos sin aceleración dedicada mediante GPU, donde la inferencia en CPU hasta un 43 % más rápida de YOLO26 ofrece una ventaja decisiva.
  • Detección de objetos pequeños: Escenarios exigentes, como las imágenes aéreas captadas por drones o el análisis de sensores del IoT, en los que ProgLoss y STAL mejoran significativamente la precisión en objetos diminutos.

Conclusión#

Ambos modelos representan avances extraordinarios para la comunidad de código abierto. YOLOv9 introdujo mejoras teóricas fundamentales en el flujo de gradientes que inspirarán arquitecturas durante muchos años. Sin embargo, para los desarrolladores, las startups y los equipos empresariales actuales que buscan un equilibrio perfecto entre velocidad, precisión y facilidad de implementación, Ultralytics YOLO26 es la recomendación clara.

Al eliminar NMS, introducir el potente optimizador MuSGD y ofrecer un conjunto de herramientas sin igual para tareas de detección, segmentación y estimación de poses, YOLO26 garantiza que tus proyectos de visión artificial se basen en el marco de trabajo más fiable y preparado para el futuro disponible hoy.

Comentarios