Ultralytics YOLO26#
Visão geral#
Ultralytics YOLO26 é uma família unificada de modelos de visão em tempo real descrita no artigo sobre Ultralytics YOLO26. Introduz inferência nativa de ponta a ponta, uma cabeça de deteção mais leve, uma receita de treino atualizada e cabeças específicas para cada tarefa: deteção, segmentação, estimativa de pose, classificação e deteção orientada.
Nas suas cinco escalas de deteção, YOLO26 alcança 40.9-57.5 mAP no COCO com latência de 1.7-11.8 ms em T4 TensorRT. O artigo também indica uma inferência ONNX na CPU até 43% mais rápida para YOLO26n em comparação com YOLO11n numa CPU Intel Xeon a 2.00 GHz.
Consulta a pré-visualização do YOLO27 ainda não lançado para conhecer a arquitetura planeada, as tarefas e os benchmarks preliminares.

from ultralytics import YOLO
model = YOLO("yolo26n.pt") # carrega um modelo YOLO26n pré-treinado
results = model("path/to/bus.jpg") # executa a inferênciaExplora e executa modelos YOLO26 diretamente na plataforma Ultralytics.
A família de modelos YOLO26 assenta em quatro áreas de design:
- Inferência nativa de ponta a ponta: a cabeça de deteção opcional um-para-um produz predições sem supressão não máxima (NMS), simplificando a implementação e reduzindo o pós-processamento.
- Regressão de caixas mais leve: YOLO26 remove Distribution Focal Loss (DFL), reduzindo a complexidade da cabeça de deteção e preservando um intervalo de regressão sem restrições.
- Atualizações à receita de treino: o pipeline de treino combina MuSGD (um otimizador híbrido Muon + SGD), Progressive Loss e STAL (atribuição de rótulos sensível a objetos pequenos) para melhorar a otimização, direcionar a supervisão para a cabeça usada no momento da inferência e manter uma cobertura positiva de rótulos para objetos pequenos. Os hiperparâmetros completos dos checkpoints lançados estão documentados no Guia da receita de treino do YOLO26.
- Cabeças e funções de perda específicas para cada tarefa: YOLO26 acrescenta designs específicos para segmentação de instâncias, variantes de segmentação semântica, estimativa de pose e deteção orientada, mantendo um único pipeline de modelo para todas as tarefas.
Em conjunto, estas atualizações melhoram o equilíbrio entre precisão e latência em várias escalas de modelo e alvos de implementação.
Principais funcionalidades#
-
Regressão sem DFL YOLO26 remove Distribution Focal Loss (DFL), reduzindo a complexidade da cabeça de deteção e simplificando a exportação.
-
Inferência de ponta a ponta sem NMS YOLO26 é compatível com inferência nativa de ponta a ponta com
nms=False, produzindo predições sem uma etapa NMS separada. O percurso predefinido um-para-muitos usa NMS para garantir a precisão. -
Progressive Loss + STAL Progressive Loss direciona a ênfase do treino para a cabeça usada no momento da inferência, enquanto STAL melhora a cobertura positiva de rótulos para objetos pequenos.
-
Otimizador MuSGD Um otimizador híbrido que combina SGD com Muon, adaptando ideias de otimização do treino de modelos de linguagem de grande dimensão à visão computacional.
-
Implementação eficiente A cabeça simplificada e o percurso opcional sem NMS reduzem a sobrecarga da inferência em vários alvos de exportação e perfis de hardware, incluindo a aceleração ONNX na CPU indicada no artigo para YOLO26n em comparação com YOLO11n.
-
Melhorias na segmentação de instâncias Introduz uma função de perda de segmentação semântica para melhorar a convergência do modelo e um módulo proto atualizado que aproveita informações multiescala para obter máscaras de melhor qualidade. O artigo indica ganhos de até +2.5 AP de caixas e +3.7 AP de máscaras em relação ao YOLO11 na segmentação de instâncias do COCO.
-
Estimativa precisa de pose Integra Residual Log-Likelihood Estimation (RLE) para localizar pontos-chave com maior precisão e otimiza o processo de descodificação para aumentar a velocidade de inferência. O artigo indica até +7.2 AP em relação ao YOLO11 na estimativa de pose do COCO.
-
Descodificação OBB refinada Introduz uma função de perda de ângulo especializada para melhorar a precisão de deteção de objetos quadrados e otimiza a descodificação OBB para resolver problemas de descontinuidade nos limites. O artigo indica até +3.4 mAP em relação ao YOLO11 na deteção orientada do DOTA-v1.0.

Tarefas e modos compatíveis#
YOLO26 é compatível com o conjunto padrão de tarefas da Ultralytics em cinco escalas de modelo:
| Modelo | Nomes de arquivo | Tarefa | Treinamento | Validação | Inferência | Exportar |
|---|---|---|---|---|---|---|
| YOLO26 | yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.pt | Detecção | ✅ | ✅ | ✅ | ✅ |
| YOLO26-seg | yolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.pt | Segmentação de instâncias | ✅ | ✅ | ✅ | ✅ |
| YOLO26-sem | yolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.pt | Segmentação semântica | ✅ | ✅ | ✅ | ✅ |
| YOLO26-depth | yolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.pt | Estimativa de profundidade | ✅ | ✅ | ✅ | ✅ |
| YOLO26-cls | yolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.pt | Classificação | ✅ | ✅ | ✅ | ✅ |
| YOLO26-pose | yolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.pt | Pose/Pontos-chave | ✅ | ✅ | ✅ | ✅ |
| YOLO26-obb | yolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.pt | Detecção orientada | ✅ | ✅ | ✅ | ✅ |
Esta estrutura unificada abrange deteção em tempo real, segmentação de instâncias, segmentação semântica, estimativa monocular de profundidade, classificação, estimativa de pose e deteção de objetos orientados, com suporte para treino, validação, inferência e exportação.
yolo26-p2.yaml e yolo26-p6.yaml acrescentam uma cabeça de deteção P2 (objetos pequenos) ou P6 (entrada grande) e são fornecidos apenas como arquiteturas YAML. Não são lançados pesos yolo26*-p2.pt nem yolo26*-p6.pt específicos para cada escala. Cria uma instância de uma configuração escalada a partir de YAML (por exemplo, YOLO("yolo26n-p6.yaml")) e treina-a ou ajusta-a conforme necessário.
Métricas de desempenho#
Consulta a documentação de deteção para ver exemplos de utilização destes modelos treinados no COCO, que incluem 80 classes pré-treinadas.
| Modelo | tamanho (pixels) | mAPval 50-95 | mAPval 50-95(e2e) | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 40.1 | 38.9 ± 0.7 | 1.7 ± 0.0 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 47.8 | 87.2 ± 0.9 | 2.5 ± 0.0 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 52.5 | 220.0 ± 1.4 | 4.7 ± 0.1 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 54.4 | 286.2 ± 2.0 | 6.2 ± 0.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 56.9 | 525.8 ± 4.0 | 11.8 ± 0.2 | 55.7 | 194.4 |
Os valores de Params e FLOPs referem-se ao modelo fundido após a fusão de Conv/BatchNorm e a remoção do ramo de deteção não utilizado. As medições de velocidade selecionam a cabeça sem NMS com nms=False. Os checkpoints pré-treinados mantêm a arquitetura de treino completa e podem apresentar contagens superiores.
Exemplos de uso#
Esta secção apresenta exemplos simples de treino e inferência com YOLO26. Para consultar a documentação completa destes e de outros modos, vê as páginas de documentação Prever, Treinar, Validar e Exportar.
Nota que o exemplo abaixo se refere a modelos YOLO26 de Deteção para deteção de objetos. Para conhecer outras tarefas suportadas, consulta a documentação de Segmentação, Segmentação semântica, Profundidade, Classificação, Pose e OBB.
Os modelos *.pt pré-treinados em PyTorch, assim como os ficheiros de configuração *.yaml, podem ser passados à classe YOLO() para criar uma instância do modelo em Python:
from ultralytics import YOLO
# Carregar um modelo YOLO26n pré-treinado com COCO
model = YOLO("yolo26n.pt")
# Executar inferência com o modelo YOLO26n na imagem 'bus.jpg'
results = model("path/to/bus.jpg")
# Treina o modelo no conjunto de dados de exemplo COCO8 durante 100 épocas
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)Os modelos de deteção YOLO26 usam uma arquitetura de cabeça dupla que oferece flexibilidade para diferentes cenários de implementação:
- Cabeça one-to-many (predefinição): Gera as saídas tradicionais de YOLO, que requerem pós-processamento NMS, produzindo
(N, nc + 4, 8400), em quencé o número de classes. Esta cabeça costuma alcançar uma precisão ligeiramente superior, à custa de processamento adicional. - Cabeça one-to-one (
nms=False): Produz previsões de ponta a ponta sem NMS, gerando(N, 300, 6)com um máximo de 300 deteções por imagem. Esta cabeça está otimizada para inferência rápida e implementação simplificada.
Podes alternar entre cabeças durante a exportação, a previsão ou a validação:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Usar a cabeça one-to-many (predefinição; a Ultralytics aplica NMS)
results = model.predict("image.jpg") # inference
metrics = model.val(data="coco.yaml") # validation
model.export(format="onnx") # export
# Ativar a cabeça one-to-one sem NMS
results = model.predict("image.jpg", nms=False) # inference
metrics = model.val(data="coco.yaml", nms=False) # validation
model.export(format="onnx", nms=False) # exportA previsão e a validação usam por predefinição a cabeça one-to-many para privilegiar a precisão. Usa nms=False para inferência sem NMS ou nms=True para incorporar NMS numa exportação compatível. Ambas as cabeças são treinadas, independentemente desta escolha. Consulta o guia de deteção de ponta a ponta para ver os formatos de saída e a compatibilidade de exportação.
YOLOE-26: deteção e segmentação de vocabulário aberto#
YOLO26 também impulsiona YOLOE-26, uma variante de vocabulário aberto que deteta e segmenta categorias de objetos a partir de prompts de texto, prompts visuais ou de um modo sem prompts, em vez de usar uma lista fixa de classes aprendida durante o treino. YOLOE-26 mantém a cabeça opcional de ponta a ponta (e2e) sem NMS do YOLO26, pelo que a inferência de vocabulário aberto continua suficientemente rápida para ambientes dinâmicos em que as categorias-alvo mudam ao longo do tempo. YOLOE-26x alcança 40.6 AP no LVIS minival com prompts de texto, 38.5 AP com prompts visuais e 31.1 AP sem prompts — valores Non-E2E do artigo, que a sua cabeça de ponta a ponta fica aquém em 1.1, 2.3 e 1.2 AP, respetivamente.
Consulta a documentação de YOLOE para ver tabelas de desempenho por escala, variantes sem prompts e exemplos de utilização completos.
Citações e agradecimentos#
Para uma descrição técnica completa da arquitetura YOLO26, da receita de treino, das cabeças de tarefa e da extensão de vocabulário aberto YOLOE-26, lê Ultralytics YOLO26: modelos de visão unificados, em tempo real e de ponta a ponta. Se usares YOLO26 na tua investigação, cita:
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
year = {2026},
eprint = {2606.03748},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
doi = {10.48550/arXiv.2606.03748},
url = {https://arxiv.org/abs/2606.03748},
}O código, os modelos e a documentação de YOLO26 estão disponíveis no repositório GitHub da Ultralytics e na documentação da Ultralytics, ao abrigo das licenças AGPL-3.0 e Enterprise.
Perguntas frequentes#
- Regressão sem DFL: Simplifica a cabeça de deteção e o processo de exportação
- Inferência de ponta a ponta sem NMS: Suporta inferência sem NMS com
nms=False - Progressive Loss + STAL: Melhora o alinhamento do treino e a cobertura de rótulos de objetos pequenos
- Otimizador MuSGD: Combina SGD com otimização inspirada no Muon para um treino estável
- Cabeças e funções de perda específicas da tarefa: Melhora o suporte à segmentação, à pose e à deteção orientada
YOLO26 é uma família de modelos unificada, que oferece suporte de ponta a ponta para várias tarefas de visão por computador:
- Deteção de objetos
- Segmentação de instâncias
- Segmentação semântica
- Estimativa de profundidade monocular
- Classificação de imagens
- Estimativa de pose
- Deteção de objetos orientados (OBB)
Cada variante de tamanho (n, s, m, l, x) suporta todas as tarefas, bem como versões de vocabulário aberto através de YOLOE-26.
YOLO26 melhora a eficiência da implementação com:
- Inferência nativa opcional de ponta a ponta sem NMS (
nms=False) - Regressão sem DFL e uma cabeça de deteção mais leve
- Exportação do modelo fundido, que remove componentes auxiliares usados apenas no treino
- Inferência ONNX na CPU até 43% mais rápida com YOLO26n do que com YOLO11n num Intel Xeon CPU @ 2.00 GHz
- Formatos de exportação flexíveis, incluindo TensorRT, ONNX, CoreML, LiteRT e OpenVINO
- Inferência nativa opcional de ponta a ponta sem NMS (
Os modelos YOLO26 estão disponíveis para transferência através do pacote
ultralytics. Instala ou atualiza o pacote e carrega um modelo:from ultralytics import YOLO # Carregar um modelo nano YOLO26 pré-treinado model = YOLO("yolo26n.pt") # Executa a inferência numa imagem results = model("image.jpg")Consulta a secção Exemplos de utilização para obter instruções de treino, validação e exportação.