Ultralytics YOLO26#
Descripción general#
Ultralytics YOLO26 es una familia unificada de modelos de visión en tiempo real descrita en el artículo de Ultralytics sobre YOLO26. Introduce inferencia nativa de extremo a extremo, una cabeza de detección más ligera, una receta de entrenamiento actualizada y cabezas específicas para detección, segmentación, estimación de pose, clasificación y detección orientada.
En sus cinco escalas de detección, YOLO26 alcanza 40.9-57.5 mAP en COCO con una latencia de 1.7-11.8 ms en T4 TensorRT. El artículo también informa de una inferencia ONNX en CPU hasta un 43 % más rápida para YOLO26n en comparación con YOLO11n en una CPU Intel Xeon @ 2.00 GHz.
Consulta la vista previa de YOLO27 no lanzada para ver la arquitectura prevista, las tareas y las métricas de rendimiento preliminares.

from ultralytics import YOLO
model = YOLO("yolo26n.pt") # load a pretrained YOLO26n model
results = model("path/to/bus.jpg") # run inferenceExplora y ejecuta modelos YOLO26 directamente en Ultralytics Platform.
La familia de modelos YOLO26 se basa en cuatro áreas de diseño:
- Inferencia nativa de extremo a extremo: La cabeza de detección opcional de uno a uno produce predicciones sin supresión de no máximos (NMS), lo que simplifica el despliegue y reduce el postprocesamiento.
- Regresión de cajas más ligera: YOLO26 elimina Distribution Focal Loss (DFL), lo que reduce la complejidad de la cabeza de detección y conserva un rango de regresión sin restricciones.
- Actualizaciones de la receta de entrenamiento: El flujo de entrenamiento combina MuSGD (un optimizador híbrido Muon + SGD), Progressive Loss y STAL (asignación de etiquetas consciente de objetos pequeños) para mejorar la optimización, trasladar la supervisión hacia la cabeza usada durante la inferencia y mantener la cobertura de etiquetas positivas para objetos pequeños. Todos los hiperparámetros de los checkpoints publicados están documentados en la guía de la receta de entrenamiento de YOLO26.
- Cabezas y pérdidas específicas para cada tarea: YOLO26 añade diseños específicos para la segmentación de instancias, variantes de segmentación semántica, estimación de pose y detección orientada, manteniendo un único flujo de modelo para todas las tareas.
En conjunto, estas actualizaciones mejoran el equilibrio entre precisión y latencia en las distintas escalas de modelo y objetivos de implementación.
Características principales#
-
Regresión sin DFL YOLO26 elimina Distribution Focal Loss (DFL), reduciendo la complejidad de la cabeza de detección y simplificando la exportación.
-
Inferencia de extremo a extremo sin NMS YOLO26 admite la inferencia nativa de extremo a extremo con
nms=False, lo que produce predicciones sin una fase de NMS independiente. La ruta predeterminada de uno a muchos utiliza NMS para mayor precisión. -
Progressive Loss + STAL Progressive Loss desplaza el énfasis del entrenamiento hacia la cabeza usada durante la inferencia, mientras que STAL mejora la cobertura de etiquetas positivas para objetos pequeños.
-
Optimizador MuSGD Un optimizador híbrido que combina SGD con Muon, adaptando ideas de optimización del entrenamiento de modelos de lenguaje de gran tamaño a la visión por ordenador.
-
Despliegue eficiente La cabeza simplificada y la ruta opcional sin NMS reducen la sobrecarga de inferencia en diferentes objetivos de exportación y perfiles de hardware, incluida la aceleración en CPU con ONNX informada en el artículo para YOLO26n en comparación con YOLO11n.
-
Mejoras en la segmentación de instancias Introduce una pérdida de segmentación semántica para mejorar la convergencia del modelo y un módulo proto actualizado que aprovecha información multiescala para lograr una calidad superior de las máscaras. El artículo informa de mejoras frente a YOLO11 de hasta +2.5 AP de cajas y +3.7 AP de máscaras en la segmentación de instancias de COCO.
-
Estimación precisa de la pose Integra Residual Log-Likelihood Estimation (RLE) para localizar los puntos clave con mayor precisión y optimiza el proceso de decodificación para aumentar la velocidad de inferencia. El artículo informa de hasta +7.2 AP frente a YOLO11 en la estimación de pose de COCO.
-
Decodificación OBB refinada Introduce una pérdida angular especializada para mejorar la precisión de detección de objetos con forma cuadrada y optimiza la decodificación OBB para resolver problemas de discontinuidad en los límites. El artículo informa de hasta +3.4 mAP frente a YOLO11 en la detección orientada de DOTA-v1.0.

Tareas y modos compatibles#
YOLO26 admite el conjunto de tareas estándar de Ultralytics en cinco escalas de modelo:
| Modelo | Nombres de archivo | Tarea | Entrenamiento | Validación | Inferencia | Exportar |
|---|---|---|---|---|---|---|
| YOLO26 | yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.pt | Detección | ✅ | ✅ | ✅ | ✅ |
| YOLO26-seg | yolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.pt | Segmentación de instancias | ✅ | ✅ | ✅ | ✅ |
| YOLO26-sem | yolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.pt | Segmentación semántica | ✅ | ✅ | ✅ | ✅ |
| YOLO26-depth | yolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.pt | Estimación de profundidad | ✅ | ✅ | ✅ | ✅ |
| YOLO26-cls | yolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.pt | Clasificación | ✅ | ✅ | ✅ | ✅ |
| YOLO26-pose | yolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.pt | Pose/puntos clave | ✅ | ✅ | ✅ | ✅ |
| YOLO26-obb | yolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.pt | Detección orientada | ✅ | ✅ | ✅ | ✅ |
Este marco unificado cubre la detección en tiempo real, la segmentación de instancias, la segmentación semántica, la estimación monocular de profundidad, la clasificación, la estimación de pose y la detección de objetos orientados, con compatibilidad con el entrenamiento, la validación, la inferencia y la exportación.
yolo26-p2.yaml y yolo26-p6.yaml añaden una cabeza de detección P2 (objetos pequeños) o P6 (entrada grande) y se distribuyen únicamente como arquitecturas YAML. No se publican pesos yolo26*-p2.pt ni yolo26*-p6.pt específicos de cada escala. Instancia una configuración escalada desde YAML (por ejemplo, YOLO("yolo26n-p6.yaml")) y entrénala o ajústala según sea necesario.
Métricas de rendimiento#
Consulta la documentación de detección para ver ejemplos de uso de estos modelos entrenados con COCO, que incluyen 80 clases preentrenadas.
| Modelo | tamaño (píxeles) | mAPval 50-95 | mAPval 50-95(e2e) | Velocidad CPU ONNX (ms) | Velocidad T4 TensorRT10 (ms) | parámetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 40.1 | 38.9 ± 0.7 | 1.7 ± 0.0 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 47.8 | 87.2 ± 0.9 | 2.5 ± 0.0 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 52.5 | 220.0 ± 1.4 | 4.7 ± 0.1 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 54.4 | 286.2 ± 2.0 | 6.2 ± 0.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 56.9 | 525.8 ± 4.0 | 11.8 ± 0.2 | 55.7 | 194.4 |
Los valores de parámetros y FLOPs corresponden al modelo fusionado tras el plegado de Conv/BatchNorm y la eliminación de la rama de detección no utilizada. Las mediciones de velocidad seleccionan la cabeza sin NMS con nms=False. Los puntos de control preentrenados conservan la arquitectura de entrenamiento completa y pueden mostrar recuentos superiores.
Ejemplos de uso#
Esta sección ofrece ejemplos sencillos de entrenamiento e inferencia con YOLO26. Para consultar la documentación completa sobre estos y otros modos, visita las páginas de documentación de Predict, Train, Val y Export.
Ten en cuenta que el ejemplo siguiente corresponde a modelos YOLO26 de Detect para la detección de objetos. Para consultar otras tareas compatibles, visita la documentación de Segment, Semantic Segmentation, Depth, Classify, Pose y OBB.
Los modelos *.pt preentrenados con PyTorch, así como los archivos de configuración *.yaml, se pueden pasar a la clase YOLO() para crear una instancia del modelo en Python:
from ultralytics import YOLO
# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")
# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")
# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)Los modelos de detección YOLO26 utilizan una arquitectura de doble cabeza que ofrece flexibilidad para distintos escenarios de implementación:
- Cabeza de uno a muchos (predeterminada): Genera salidas de YOLO tradicionales que requieren postprocesamiento con NMS, y genera
(N, nc + 4, 8400)dondences el número de clases. Esta cabeza suele alcanzar una precisión ligeramente mayor a costa de un procesamiento adicional. - Cabeza de uno a uno (
nms=False): Produce predicciones de extremo a extremo sin NMS, y genera(N, 300, 6)con un máximo de 300 detecciones por imagen. Esta cabeza está optimizada para una inferencia rápida y un despliegue simplificado.
Puedes cambiar de cabeza durante la exportación, la predicción o la validación:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Use one-to-many head (default, Ultralytics applies NMS)
results = model.predict("image.jpg") # inference
metrics = model.val(data="coco.yaml") # validation
model.export(format="onnx") # export
# Opt into the NMS-free one-to-one head
results = model.predict("image.jpg", nms=False) # inference
metrics = model.val(data="coco.yaml", nms=False) # validation
model.export(format="onnx", nms=False) # exportLa predicción y la validación utilizan de forma predeterminada la cabeza de uno a muchos para mayor precisión. Usa nms=False para la inferencia sin NMS, o nms=True para integrar NMS en una exportación compatible. Ambas cabezas se entrenan independientemente de esta elección. Consulta la guía de detección de extremo a extremo para ver los formatos de salida y la compatibilidad de exportación.
YOLOE-26: detección y segmentación de vocabulario abierto#
YOLO26 también impulsa YOLOE-26, una variante de vocabulario abierto que detecta y segmenta categorías de objetos a partir de indicaciones de texto, indicaciones visuales o un modo sin indicaciones en lugar de una lista de clases fija aprendida en el momento del entrenamiento. YOLOE-26 mantiene la cabeza opcional sin NMS de extremo a extremo (e2e) de YOLO26, por lo que la inferencia de vocabulario abierto sigue siendo lo suficientemente rápida para entornos dinámicos donde las categorías de destino cambian con el tiempo. YOLOE-26x alcanza 40.6 AP en LVIS minival con indicaciones de texto, 38.5 AP con indicaciones visuales y 31.1 AP sin indicaciones; estas son las cifras sin extremo a extremo del artículo, a las que su cabeza de extremo a extremo se queda atrás por 1.1, 2.3 y 1.2 AP.
Consulta la documentación de YOLOE para ver tablas de rendimiento por escala, variantes sin indicaciones y ejemplos de uso completos.
Citas y agradecimientos#
Para obtener una descripción técnica completa de la arquitectura de YOLO26, la receta de entrenamiento, las cabezas de tarea y la extensión de vocabulario abierto YOLOE-26, lee Ultralytics YOLO26: modelos de visión unificados de extremo a extremo en tiempo real. Si utilizas YOLO26 en tu investigación, cita:
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
year = {2026},
eprint = {2606.03748},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
doi = {10.48550/arXiv.2606.03748},
url = {https://arxiv.org/abs/2606.03748},
}El código, los modelos y la documentación de YOLO26 están disponibles en el repositorio de Ultralytics en GitHub y en la documentación de Ultralytics, bajo las licencias AGPL-3.0 y Enterprise.
Preguntas frecuentes#
- Regresión sin DFL: Simplifica la cabeza de detección y la ruta de exportación
- Inferencia de extremo a extremo sin NMS: Admite inferencia sin NMS con
nms=False - Progressive Loss + STAL: Mejora la alineación del entrenamiento y la cobertura de etiquetas para objetos pequeños
- Optimizador MuSGD: Combina SGD con una optimización inspirada en Muon para lograr un entrenamiento estable
- Cabezas y pérdidas específicas para cada tarea: Mejora la compatibilidad con la segmentación, la pose y la detección orientada
YOLO26 es una familia de modelos unificada que ofrece compatibilidad de extremo a extremo con varias tareas de visión por ordenador:
- Detección de objetos
- Segmentación de instancias
- Segmentación semántica
- Estimación monocular de profundidad
- Clasificación de imágenes
- Estimación de pose
- Detección de objetos orientados (OBB)
Cada variante de tamaño (n, s, m, l, x) admite todas las tareas, además de versiones de vocabulario abierto mediante YOLOE-26.
YOLO26 mejora la eficiencia de la implementación mediante:
- Inferencia nativa opcional de extremo a extremo sin NMS (
nms=False) - Regresión sin DFL y una cabeza de detección más ligera
- Exportación de modelos fusionados que elimina los componentes auxiliares exclusivos del entrenamiento
- Inferencia ONNX en CPU hasta un 43 % más rápida para YOLO26n frente a YOLO11n en una CPU Intel Xeon @ 2.00 GHz
- Formatos de exportación flexibles, incluidos TensorRT, ONNX, CoreML, LiteRT y OpenVINO
- Inferencia nativa opcional de extremo a extremo sin NMS (
Los modelos YOLO26 están disponibles para descargarlos mediante el paquete
ultralytics. Instala o actualiza el paquete y carga un modelo:from ultralytics import YOLO # Load a pretrained YOLO26 nano model model = YOLO("yolo26n.pt") # Run inference on an image results = model("image.jpg")Consulta la sección Ejemplos de uso para obtener instrucciones sobre entrenamiento, validación y exportación.