YOLO Vision 2026:

Ultralytics YOLO26#

Descripción general#

Ultralytics YOLO26 es una familia unificada de modelos de visión en tiempo real descrita en el Ultralytics YOLO26 paper. Introduce inferencia nativa de extremo a extremo, una cabeza de detección más ligera, una receta de entrenamiento actualizada y cabezas específicas para tareas de detección, segmentación, estimación de postura, clasificación y detección orientada.

A través de sus cinco escalas de detección, YOLO26 alcanza 40.9-57.5 mAP en COCO con una latencia de 1.7-11.8 ms en TensorRT sobre T4. El artículo también reporta una inferencia en CPU ONNX hasta un 43% más rápida para YOLO26n en comparación con YOLO11n en una CPU Intel Xeon a 2.00 GHz.

Ultralytics YOLO26 Comparison Plots



Watch: How to Train a YOLO26 model on Your Custom Dataset in Google Colab.
Inicio rápido
from ultralytics import YOLO

model = YOLO("yolo26n.pt")  # load a pretrained YOLO26n model
results = model("path/to/bus.jpg")  # run inference
Pruébalo en la Plataforma Ultralytics

Explora y ejecuta modelos YOLO26 directamente en Ultralytics Platform.

La familia de modelos YOLO26 está construida en torno a cuatro áreas de diseño:

  • Inferencia nativa de extremo a extremo: La cabecera de detección predeterminada de uno a uno produce predicciones sin supresión de no máximos (NMS), lo que simplifica el despliegue y reduce el post-procesamiento.
  • Regresión de cajas más ligera: YOLO26 elimina la Distribution Focal Loss (DFL), reduciendo la complejidad de la cabecera de detección mientras preserva un rango de regresión sin restricciones.
  • Actualizaciones de la receta de entrenamiento: El pipeline de entrenamiento combina MuSGD (un optimizador híbrido de Muon + SGD), Progressive Loss y STAL (Small-Target-Aware Label Assignment) para mejorar la optimización, desplazar la supervisión hacia la cabeza en tiempo de inferencia y mantener la cobertura de etiquetas positivas para objetos pequeños. Los hiperparámetros completos detrás de los checkpoints publicados se documentan en la YOLO26 Training Recipe guide.
  • Cabeceras y pérdidas específicas para tareas: YOLO26 añade diseños específicos para segmentación de instancias, variantes de segmentación semántica, estimación de poses y detección orientada, manteniendo una única tubería de modelo para todas las tareas.

En conjunto, estas actualizaciones mejoran el equilibrio entre precisión y latencia a través de diversas escalas de modelos y objetivos de despliegue.

Características clave#

  • Regresión sin DFL YOLO26 elimina la Distribution Focal Loss (DFL), reduciendo la complejidad de la cabecera de detección y simplificando la exportación.

  • Inferencia de extremo a extremo sin NMS A diferencia de los detectores tradicionales que dependen de la NMS como un paso de post-procesamiento separado, YOLO26 es nativamente de extremo a extremo de forma predeterminada. Las predicciones se generan directamente, lo que reduce la latencia y facilita la integración en producción.

  • Progressive Loss + STAL Progressive Loss desplaza el énfasis del entrenamiento hacia la cabecera de tiempo de inferencia, mientras que STAL mejora la cobertura de etiquetas positivas para objetos pequeños.

  • Optimizador MuSGD Un optimizador híbrido que combina SGD con Muon, adaptando ideas de optimización del entrenamiento de modelos de lenguaje grandes a la visión artificial.

  • Despliegue eficiente La cabecera simplificada y la ruta predeterminada sin NMS reducen la sobrecarga de inferencia en todos los objetivos de exportación y perfiles de hardware, incluyendo la aceleración en CPU ONNX reportada en el artículo para YOLO26n frente a YOLO11n.

  • Mejoras en segmentación de instancias Introduce la pérdida de segmentación semántica para mejorar la convergencia del modelo y un módulo proto actualizado que aprovecha la información multiescala para una calidad de máscara superior. El artículo reporta ganancias sobre YOLO11 de hasta +2.5 AP en cajas y +3.7 AP en máscaras en COCO para segmentación de instancias.

  • Estimación de Postura de Precisión Integra Residual Log-Likelihood Estimation (RLE) para una localización de puntos clave más precisa y optimiza el proceso de decodificación para aumentar la velocidad de inferencia. El artículo informa de hasta +7.2 AP sobre YOLO11 en la estimación de postura de COCO.

  • Decodificación OBB refinada Introduce una pérdida angular especializada para mejorar la precisión de detección de objetos cuadrados y optimiza la decodificación OBB para resolver problemas de discontinuidad en los bordes. El artículo reporta hasta +3.4 mAP sobre YOLO11 en la detección orientada DOTA-v1.0.

Ultralytics YOLO26 End-to-End Comparison Plots


Tareas y modos soportados#

YOLO26 soporta el conjunto estándar de tareas de Ultralytics a través de cinco escalas de modelo:

ModeloNombres de archivoTareaEntrenamientoValidaciónInferenciaExportar
YOLO26yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.ptDetection
YOLO26-segyolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.ptInstance Segmentation
YOLO26-semyolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.ptSemantic Segmentation
YOLO26-depthyolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.ptDepth Estimation
YOLO26-clsyolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.ptClassification
YOLO26-poseyolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.ptPose/Keypoints
YOLO26-obbyolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.ptOriented Detection

Este marco unificado cubre detección en tiempo real, segmentación de instancias, segmentación semántica, estimación de profundidad monocular, clasificación, estimación de poses y detección de objetos orientados con soporte para entrenamiento, validación, inferencia y exportación.

Variantes solo de arquitectura

yolo26-p2.yaml y yolo26-p6.yaml añaden una cabeza de detección P2 (objetos pequeños) o P6 (entrada grande) y se distribuyen únicamente como arquitecturas YAML. No se lanzan pesos yolo26*-p2.pt o yolo26*-p6.pt específicos de escala. Instancia una configuración escalada desde YAML (por ejemplo, YOLO("yolo26n-p6.yaml")) y entrénala o ajustala según sea necesario.


Métricas de rendimiento#

Rendimiento

Consulta la Detection Docs para ver ejemplos de uso con estos modelos entrenados en COCO, que incluyen 80 clases preentrenadas.

Modelotamaño
(píxeles)
mAPval
50-95
mAPval
50-95(e2e)
Velocidad
CPU ONNX
(ms)
Velocidad
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO26n64040.940.138.9 ± 0.71.7 ± 0.02.45.4
YOLO26s64048.647.887.2 ± 0.92.5 ± 0.09.520.7
YOLO26m64053.152.5220.0 ± 1.44.7 ± 0.120.468.2
YOLO26l64055.054.4286.2 ± 2.06.2 ± 0.224.886.4
YOLO26x64057.556.9525.8 ± 4.011.8 ± 0.255.7193.9

Los valores de parámetros y FLOPs son para el modelo fusionado después de model.fuse(), que combina las capas Conv y BatchNorm y elimina la cabeza de detección auxiliar de uno a muchos. Los checkpoints preentrenados conservan toda la arquitectura de entrenamiento y pueden mostrar recuentos más altos.


Ejemplos de uso#

Esta sección proporciona ejemplos sencillos de entrenamiento e inferencia con YOLO26. Para ver la documentación completa sobre estos y otros modes, consulta las páginas de documentación de Predict, Train, Val y Export.

Ten en cuenta que el ejemplo siguiente es para modelos YOLO26 Detect para object detection. Para otras tareas compatibles adicionales, consulta la documentación de Segment, Semantic Segmentation, Depth, Classify, Pose y OBB.

Ejemplo

Se pueden pasar modelos preentrenados de PyTorch *.pt así como archivos de configuración *.yaml a la clase YOLO() para crear una instancia de modelo en Python:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")

# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
Arquitectura de doble cabecera

Los modelos de detección YOLO26 utilizan una arquitectura de doble cabecera que ofrece flexibilidad para diferentes escenarios de despliegue:

  • Cabeza One-to-One (Predeterminada): Produce predicciones de extremo a extremo sin NMS, generando (N, 300, 6) con un máximo de 300 detecciones por imagen. Esta cabeza está optimizada para una inferencia rápida y un despliegue simplificado.
  • Cabeza One-to-Many: Genera salidas tradicionales de YOLO que requieren posprocesamiento NMS, generando (N, nc + 4, 8400) donde nc es el número de clases. Esta cabeza suele lograr una precisión ligeramente mayor a costa de un procesamiento adicional.

Puedes cambiar entre cabeceras durante la exportación, la predicción o la validación:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")

# Use one-to-one head (default, no NMS required)
results = model.predict("image.jpg")  # inference
metrics = model.val(data="coco.yaml")  # validation
model.export(format="onnx")  # export

# Use one-to-many head (requires NMS)
results = model.predict("image.jpg", end2end=False)  # inference
metrics = model.val(data="coco.yaml", end2end=False)  # validation
model.export(format="onnx", end2end=False)  # export

La elección depende de tus requisitos de despliegue: utiliza la cabecera uno-a-uno para obtener la máxima velocidad y simplicidad, o la cabecera uno-a-muchos cuando la precisión sea la máxima prioridad.

YOLOE-26: Detección y segmentación de vocabulario abierto#

YOLO26 también impulsa YOLOE-26, una variante de vocabulario abierto que detecta y segmenta categorías de objetos a partir de text prompts, visual prompts o un prompt-free mode en lugar de una lista de clases fija aprendida en el momento del entrenamiento. YOLOE-26 mantiene el diseño sin NMS y de extremo a extremo (e2e) de YOLO26, por lo que la inferencia de vocabulario abierto sigue siendo lo suficientemente rápida para entornos dinámicos donde las categorías de destino cambian con el tiempo. YOLOE-26x alcanza 40.6 AP en minival de LVIS bajo peticiones de texto, 38.5 AP bajo peticiones visuales y 31.1 AP en el ajuste sin peticiones Non-E2E.

Consulta la YOLOE documentation para ver tablas de rendimiento por escala, variantes sin peticiones y ejemplos de uso completos.

Citas y agradecimientos#

Para una descripción técnica completa de la arquitectura YOLO26, la receta de entrenamiento, las cabezas de tareas y la extensión de vocabulario abierto YOLOE-26, lee Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models. Si usas YOLO26 en tu investigación, por favor cítalo:

Cita
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
  title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
  author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
  year = {2026},
  eprint = {2606.03748},
  archivePrefix = {arXiv},
  primaryClass = {cs.CV},
  doi = {10.48550/arXiv.2606.03748},
  url = {https://arxiv.org/abs/2606.03748},
}

El código, los modelos y la documentación de YOLO26 están disponibles en el Ultralytics GitHub repository y Ultralytics Docs bajo las licencias AGPL-3.0 y Enterprise.


FAQ#

    • Regresión sin DFL: Simplifica la cabeza de detección y la ruta de exportación
    • Inferencia de extremo a extremo sin NMS: Elimina el NMS de la ruta de inferencia predeterminada
    • Progressive Loss + STAL: Mejora la alineación del entrenamiento y la cobertura de etiquetas para objetos pequeños
    • Optimizador MuSGD: Combina SGD con una optimización inspirada en Muon para un entrenamiento estable
    • Cabezas y funciones de pérdida específicas para cada tarea: Mejora el soporte para segmentación, pose y detección orientada
  • YOLO26 es una familia de modelos unificada, que proporciona soporte integral para múltiples tareas de visión artificial:

    Cada variante de tamaño (n, s, m, l, x) admite todas las tareas, además de versiones de vocabulario abierto a través de YOLOE-26.

  • YOLO26 mejora la eficiencia del despliegue con:

    • Inferencia nativa de extremo a extremo sin NMS por defecto
    • Regresión sin DFL y una cabecera de detección más ligera
    • Exportación de modelos fusionados que elimina componentes auxiliares exclusivos del entrenamiento
    • Hasta un 43% más de rapidez en la inferencia ONNX en CPU para YOLO26n frente a YOLO11n en una CPU Intel Xeon @ 2.00 GHz
    • Formatos de exportación flexibles, incluyendo TensorRT, ONNX, CoreML, LiteRT y OpenVINO
  • Los modelos YOLO26 están disponibles para su descarga a través del paquete ultralytics. Instala o actualiza el paquete y carga un modelo:

    from ultralytics import YOLO
    
    # Load a pretrained YOLO26 nano model
    model = YOLO("yolo26n.pt")
    
    # Run inference on an image
    results = model("image.jpg")

    Consulta la sección Usage Examples para obtener instrucciones de entrenamiento, validación y exportación.

Comentarios