Ultralytics YOLO27:
Get Started

YOLO26 frente a YOLOv9#

El panorama de la visión artificial evoluciona rápidamente y las nuevas arquitecturas amplían continuamente los límites de la velocidad y la precisión. En esta comparativa técnica, analizamos las diferencias entre YOLO26 y YOLOv9, dos modelos de gran influencia en el ámbito de la detección de objetos en tiempo real. Aunque ambos modelos incorporan innovaciones arquitectónicas propias, comprender las diferencias de rendimiento, las capacidades de implementación y los requisitos de hardware es fundamental para elegir la herramienta adecuada para tu próximo proyecto de visión.

YOLO26: potencia optimizada para edge#

Lanzado a principios de 2026, Ultralytics YOLO26 representa un salto generacional en la eficiencia de implementación y la estabilidad del entrenamiento de modelos. Diseñado como un framework de extremo a extremo nativo, aborda directamente los cuellos de botella de implementación que históricamente han afectado a las aplicaciones de IA edge.

Detalles del modelo:

Arquitectura e innovaciones#

YOLO26 rediseña por completo el proceso de posprocesamiento mediante un diseño de extremo a extremo sin NMS. Cuando se ejecuta con su cabezal opcional uno a uno (nms=False), el modelo omite la supresión no máxima (NMS) y reduce drásticamente la variabilidad de la latencia. Esto facilita mucho la implementación en plataformas móviles y edge, especialmente al exportar a frameworks como ONNX y Apple CoreML.

Además, eliminar la pérdida focal de distribución (DFL) agiliza el proceso de exportación y mejora la compatibilidad con microcontroladores de bajo consumo. Para mejorar la estabilidad del entrenamiento, YOLO26 integra el novedoso optimizador MuSGD, una combinación de descenso de gradiente estocástico (SGD) y Muon, inspirada en las innovaciones del entrenamiento de modelos de lenguaje grandes. El resultado es una convergencia más rápida y una extracción de características más robusta en conjuntos de datos complejos.

Inferencia en dispositivos edge

Gracias a las simplificaciones arquitectónicas y a la eliminación de DFL, YOLO26 alcanza una inferencia con CPU hasta un 43 % más rápida, por lo que es la opción ideal para dispositivos edge con recursos limitados, como Raspberry Pi o NVIDIA Jetson Nano.

Para detectar objetos especialmente difíciles en escenas como las imágenes aéreas tomadas con drones, YOLO26 utiliza las funciones de pérdida ProgLoss + STAL actualizadas. Estas mejoran notablemente la exhaustividad del reconocimiento de objetos pequeños. Además, incorpora mejoras específicas para cada tarea, como prototipos multiescala para la segmentación de instancias, estimación residual de log-verosimilitud (RLE) para la estimación de pose y una función de pérdida angular especializada para detectar cajas delimitadoras orientadas (OBB).

YOLOv9: información de gradiente programable#

Presentado a principios de 2024, YOLOv9 aportó avances teóricos sobre cómo gestionan las redes neuronales el flujo de gradiente durante el entrenamiento, con especial atención a la eficiencia de parámetros y a la conservación de características profundas.

Detalles del modelo:

Arquitectura y puntos fuertes#

YOLOv9 se basa en los conceptos de información de gradiente programable (PGI) y red de agregación de capas eficiente generalizada (GELAN). Estos conceptos abordan el problema del cuello de botella de información que suele observarse en las redes neuronales profundas. Al conservar información esencial durante el proceso de propagación hacia delante, GELAN garantiza que los gradientes utilizados para actualizar los pesos sigan siendo fiables. Esta arquitectura ofrece una gran precisión y convierte a YOLOv9 en una opción sólida para la investigación académica sobre teoría de redes neuronales y optimización de rutas de gradiente con el framework PyTorch.

Limitaciones#

A pesar de su excelente eficiencia de parámetros, YOLOv9 depende en gran medida de la NMS tradicional para el posprocesamiento de cajas delimitadoras, lo que puede generar cuellos de botella computacionales durante la inferencia en dispositivos edge. Además, el repositorio oficial se centra principalmente en la detección de objetos, por lo que adaptarlo a tareas especializadas como el seguimiento o la estimación de pose requiere un trabajo de ingeniería personalizado considerable.

Más información sobre YOLOv9

Comparativa de rendimiento#

Al evaluar estos modelos para su implementación en entornos reales, es fundamental equilibrar la precisión (mAP), la velocidad de inferencia y el uso de memoria. Los modelos de Ultralytics son conocidos por sus bajos requisitos de memoria tanto durante el entrenamiento como durante la inferencia: necesitan mucha menos memoria CUDA que las alternativas basadas en Transformer, como RT-DETR.

A continuación se compara directamente el rendimiento de YOLO26 y YOLOv9 en el conjunto de datos COCO. Los mejores valores de cada columna aparecen en negrita.

Modelotamaño
(píxeles)
mAPval
50-95
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
parámetros
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.5
YOLO26s64048.687.22.59.520.9
YOLO26m64053.1220.04.720.468.4
YOLO26l64055.0286.26.224.886.8
YOLO26x64057.5525.811.855.7194.4
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Nota: Se omiten las velocidades de CPU de YOLOv9 porque varían mucho según la configuración de NMS y, en general, son inferiores a las de la implementación nativa sin NMS de YOLO26.

Casos de uso y recomendaciones#

La elección entre YOLO26 y YOLOv9 depende de los requisitos concretos de tu proyecto, las limitaciones de implementación y tus preferencias de ecosistema.

Cuándo elegir YOLO26#

YOLO26 es una buena opción para:

  • Implementación edge sin NMS: Aplicaciones que necesitan inferencias uniformes y de baja latencia sin la complejidad del posprocesamiento con supresión no máxima.
  • Entornos que solo usan CPU: Dispositivos sin aceleración GPU dedicada, en los que la inferencia con CPU hasta un 43 % más rápida de YOLO26 supone una ventaja decisiva.
  • Detección de objetos pequeños: Casos exigentes, como las imágenes aéreas tomadas con drones o el análisis de sensores IoT, donde ProgLoss y STAL mejoran notablemente la precisión al detectar objetos diminutos.

Cuándo elegir YOLOv9#

YOLOv9 se recomienda para:

  • Investigación sobre cuellos de botella de información: Proyectos académicos que estudian las arquitecturas de información de gradiente programable (PGI) y de red de agregación de capas eficiente generalizada (GELAN).
  • Estudios de optimización del flujo de gradiente: Investigaciones centradas en comprender y mitigar la pérdida de información en las capas profundas de la red durante el entrenamiento.
  • Evaluación comparativa de detección de alta precisión: Situaciones en las que el sólido rendimiento de YOLOv9 en las pruebas de referencia de COCO sirve como referencia para comparar arquitecturas.

La ventaja de Ultralytics#

Elegir un modelo implica algo más que consultar una prueba de referencia de precisión: el ecosistema de software que lo rodea determina la rapidez con la que puedes pasar de recopilar datos a ponerlos en producción.

Facilidad de uso y ecosistema#

La API de Python de Ultralytics ofrece una experiencia fluida desde cero hasta el dominio. En lugar de clonar repositorios complejos o configurar manualmente scripts de entrenamiento distribuido, los desarrolladores pueden instalar el paquete con pip y empezar a entrenar de inmediato. El ecosistema de Ultralytics, que se mantiene activamente, garantiza actualizaciones frecuentes, integraciones automatizadas con plataformas de aprendizaje automático como Weights & Biases y una documentación extensa.

Otros modelos de Ultralytics

Si te interesa explorar otros modelos del ecosistema de Ultralytics, también puedes comparar YOLO11 o el clásico YOLOv8, que ofrecen una flexibilidad excepcional para aplicaciones personalizadas.

Versatilidad en distintas tareas de visión#

Mientras que YOLOv9 es principalmente un motor de detección, YOLO26 es una herramienta de visión de propósito general. Con una única sintaxis unificada, puedes pasar fácilmente de la detección de objetos a la segmentación de imágenes píxel a píxel o a la clasificación de imágenes completas. Esta versatilidad reduce la deuda técnica asociada al mantenimiento de varias bases de código independientes para distintas funciones de visión artificial.

Entrenamiento e implementación eficientes#

La eficiencia del entrenamiento es uno de los pilares de la filosofía de Ultralytics. YOLO26 utiliza pesos preentrenados fáciles de conseguir y consume mucha menos memoria que los voluminosos modelos Transformer de visión. Una vez entrenado, sus procesos de exportación integrados permiten convertir modelos con un solo clic a formatos optimizados como TensorRT o LiteRT, lo que facilita su puesta en producción.

Ejemplo de código: primeros pasos con YOLO26#

Implementar YOLO26 es muy sencillo. El siguiente fragmento de Python muestra cómo cargar un modelo preentrenado, entrenarlo con datos personalizados y ejecutar inferencias mediante la API de Ultralytics.

from ultralytics import YOLO

# Carga el modelo nano YOLO26 de última generación
model = YOLO("yolo26n.pt")

# Entrena el modelo con el conjunto de datos COCO8 (optimizer='auto' selecciona MuSGD para entrenamientos más largos)
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Usa la GPU 0 o usa 'cpu' para entrenar con CPU
)

# Ejecuta una inferencia sin NMS en una imagen de muestra
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)

# Muestra las cajas delimitadoras y las confianzas
predictions[0].show()

Gracias a la velocidad, la arquitectura simplificada y el sólido ecosistema de YOLO26, los equipos pueden lanzar al mercado aplicaciones avanzadas de IA visual más rápido y con menos obstáculos técnicos que nunca.

Comentarios