YOLO Vision 2026:

Ultralytics YOLO26#

Visão geral#

Ultralytics YOLO26 é uma família unificada de modelos de visão em tempo real descrita no artigo do Ultralytics YOLO26. O modelo introduz inferência nativa de ponta a ponta (end-to-end), um cabeçote de detecção mais leve, uma receita de treinamento atualizada e cabeçotes específicos de tarefas para detecção, segmentação, estimativa de pose, classificação e detecção orientada.

Em suas cinco escalas de detecção, o YOLO26 atinge 40,9-57,5 mAP no COCO com 1,7-11,8 ms de latência T4 TensorRT. O artigo também relata inferência CPU ONNX até 43% mais rápida para o YOLO26n em comparação com o YOLO11n em uma CPU Intel Xeon @ 2.00 GHz.

Gráficos de Comparação do Ultralytics YOLO26



Watch: How to Train a YOLO26 model on Your Custom Dataset in Google Colab.
Início rápido
from ultralytics import YOLO

model = YOLO("yolo26n.pt")  # load a pretrained YOLO26n model
results = model("path/to/bus.jpg")  # run inference
Experimenta na Ultralytics Platform

Explora e executa modelos YOLO26 diretamente na Ultralytics Platform.

A família de modelos YOLO26 é construída em torno de quatro áreas de design:

  • Inferência nativa de ponta a ponta: A cabeça de detecção padrão um-para-um produz previsões sem a supressão de não-máximos (NMS), simplificando a implementação e reduzindo o pós-processamento.
  • Regressão de caixa mais leve: O YOLO26 remove a Distribution Focal Loss (DFL), reduzindo a complexidade da cabeça de detecção enquanto preserva uma faixa de regressão irrestrita.
  • Atualizações na receita de treinamento: O pipeline de treinamento combina MuSGD (um otimizador híbrido de Muon + SGD), Progressive Loss e STAL (Small-Target-Aware Label Assignment) para melhorar a otimização, direcionar a supervisão para o cabeçote em tempo de inferência e manter a cobertura de rótulos positivos para pequenos objetos. Os hiperparâmetros completos por trás dos checkpoints lançados estão documentados no guia da Receita de Treinamento do YOLO26.
  • Cabeças e perdas específicas para tarefas: O YOLO26 adiciona designs direcionados para segmentação de instâncias, variantes de segmentação semântica, estimativa de pose e detecção orientada, mantendo um pipeline de modelo único entre as tarefas.

Juntas, essas atualizações melhoram o equilíbrio entre precisão e latência em todas as escalas de modelo e alvos de implementação.

Principais recursos#

  • Regressão livre de DFL O YOLO26 remove a Distribution Focal Loss (DFL), reduzindo a complexidade da cabeça de detecção e simplificando a exportação.

  • Inferência de ponta a ponta sem NMS Ao contrário dos detectores tradicionais que dependem de NMS como uma etapa separada de pós-processamento, o YOLO26 é nativamente de ponta a ponta por padrão. As previsões são geradas diretamente, reduzindo a latência e tornando a integração em produção mais simples.

  • Progressive Loss + STAL A Progressive Loss desloca a ênfase do treinamento para a cabeça de tempo de inferência, enquanto o STAL melhora a cobertura de rótulos positivos para objetos pequenos.

  • Otimizador MuSGD Um otimizador híbrido que combina SGD com Muon, adaptando ideias de otimização de treinamento de grandes modelos de linguagem para a visão computacional.

  • Implementação eficiente A cabeça simplificada e o caminho padrão sem NMS reduzem a sobrecarga de inferência em todos os alvos de exportação e perfis de hardware, incluindo o ganho de velocidade em CPU ONNX relatado no artigo para o YOLO26n versus o YOLO11n.

  • Melhorias na segmentação de instâncias Introduz a perda de segmentação semântica para melhorar a convergência do modelo e um módulo proto atualizado que aproveita informações multiescala para uma qualidade de máscara superior. O artigo relata ganhos em relação ao YOLO11 de até +2,5 AP de caixa e +3,7 AP de máscara na segmentação de instâncias do COCO.

  • Estimativa de Pose de Precisão Integra a Residual Log-Likelihood Estimation (RLE) para uma localização de pontos-chave (keypoints) mais precisa e otimiza o processo de decodificação para maior velocidade de inferência. O artigo relata até +7.2 AP em relação ao YOLO11 na estimativa de pose no COCO.

  • Decodificação de OBB refinada Introduz uma perda de ângulo especializada para melhorar a precisão da detecção para objetos em formato quadrado e otimiza a decodificação de OBB para resolver problemas de descontinuidade de limite. O artigo relata até +3,4 mAP em relação ao YOLO11 na detecção orientada DOTA-v1.0.

Gráficos de Comparação Ponta a Ponta do Ultralytics YOLO26


Tarefas e modos suportados#

O YOLO26 suporta o conjunto de tarefas padrão do Ultralytics em cinco escalas de modelo:

ModeloNomes de arquivoTarefaTreinamentoValidaçãoInferênciaExportar
YOLO26yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.ptDetecção
YOLO26-segyolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.ptSegmentação de Instância
YOLO26-semyolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.ptSegmentação Semântica
YOLO26-depthyolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.ptEstimativa de Profundidade
YOLO26-clsyolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.ptClassificação
YOLO26-poseyolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.ptPose/Pontos-Chave
YOLO26-obbyolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.ptDetecção Orientada

Esta estrutura unificada abrange detecção em tempo real, segmentação de instâncias, segmentação semântica, estimativa de profundidade monocular, classificação, estimativa de pose e detecção de objetos orientados com suporte para treinamento, validação, inferência e exportação.

Variantes apenas de arquitetura

yolo26-p2.yaml e yolo26-p6.yaml adicionam um cabeçote de detecção P2 (para pequenos objetos) ou P6 (para entradas grandes) e são fornecidos apenas como arquiteturas YAML. Nenhum peso específico de escala yolo26*-p2.pt ou yolo26*-p6.pt é lançado. Instancia uma configuração dimensionada a partir do YAML (por exemplo, YOLO("yolo26n-p6.yaml")) e treina ou faz o fine-tuning conforme necessário.


Métricas de desempenho#

Desempenho

Consulta a Documentação de Detecção para exemplos de uso com esses modelos treinados no COCO, que incluem 80 classes pré-treinadas.

Modelotamanho
(pixels)
mAPval
50-95
mAPval
50-95(e2e)
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B)
YOLO26n64040.940.138.9 ± 0.71.7 ± 0.02.45.4
YOLO26s64048.647.887.2 ± 0.92.5 ± 0.09.520.7
YOLO26m64053.152.5220.0 ± 1.44.7 ± 0.120.468.2
YOLO26l64055.054.4286.2 ± 2.06.2 ± 0.224.886.4
YOLO26x64057.556.9525.8 ± 4.011.8 ± 0.255.7193.9

Os valores de parâmetros e FLOPs são para o modelo fundido após model.fuse(), que mescla as camadas Conv e BatchNorm e remove o cabeçote de detecção auxiliar de um para muitos. Os checkpoints pré-treinados retêm a arquitetura de treinamento completa e podem mostrar contagens mais altas.


Exemplos de uso#

Esta seção fornece exemplos simples de treinamento e inferência com o YOLO26. Para ver a documentação completa sobre estes e outros modos, consulta as páginas de documentação de Predict, Train, Val e Export.

Nota que o exemplo abaixo é para modelos YOLO26 Detect para detecção de objetos. Para tarefas adicionais suportadas, consulta a documentação de Segment, Semantic Segmentation, Depth, Classify, Pose e OBB.

Exemplo

Modelos pré-treinados em PyTorch *.pt bem como ficheiros de configuração *.yaml podem ser passados para a classe YOLO() para criar uma instância de modelo em Python:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")

# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
Arquitetura de Cabeça Dupla

Os modelos de detecção YOLO26 usam uma arquitetura de cabeça dupla que proporciona flexibilidade para diferentes cenários de implantação:

  • Cabeçote One-to-One (Padrão): Produz previsões de ponta a ponta sem NMS, gerando (N, 300, 6) com um máximo de 300 detecções por imagem. Este cabeçote é otimizado para inferência rápida e implementação simplificada.
  • Cabeçote One-to-Many: Gera saídas tradicionais do YOLO que exigem pós-processamento NMS, gerando (N, nc + 4, 8400) onde nc é o número de classes. Este cabeçote normalmente atinge uma precisão ligeiramente superior ao custo de processamento adicional.

Podes alternar entre cabeças durante a exportação, predição ou validação:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")

# Use one-to-one head (default, no NMS required)
results = model.predict("image.jpg")  # inference
metrics = model.val(data="coco.yaml")  # validation
model.export(format="onnx")  # export

# Use one-to-many head (requires NMS)
results = model.predict("image.jpg", end2end=False)  # inference
metrics = model.val(data="coco.yaml", end2end=False)  # validation
model.export(format="onnx", end2end=False)  # export

A escolha depende dos teus requisitos de implantação: usa a cabeça um-para-um para máxima velocidade e simplicidade, ou a cabeça um-para-muitos quando a precisão for a prioridade máxima.

YOLOE-26: Detecção e Segmentação de Vocabulário Aberto#

O YOLO26 também alimenta o YOLOE-26, uma variante de vocabulário aberto que deteta e segmenta categorias de objetos a partir de comandos de texto (text prompts), comandos visuais (visual prompts) ou um modo sem comandos (prompt-free mode) em vez de uma lista fixa de classes aprendida no momento do treinamento. O YOLOE-26 mantém o design de ponta a ponta sem NMS do YOLO26, para que a inferência de vocabulário aberto permaneça rápida o suficiente para ambientes dinâmicos onde as categorias de destino mudam ao longo do tempo. O YOLOE-26x atinge 40.6 AP no LVIS minival com comandos de texto, 38.5 AP com comandos visuais e 31.1 AP no cenário sem comandos Non-E2E.

Consulta a documentação do YOLOE para tabelas de desempenho por escala, variantes sem comandos e exemplos de uso completos.

Citações e Agradecimentos#

Para uma descrição técnica completa da arquitetura do YOLO26, receita de treinamento, cabeçotes de tarefas e extensão de vocabulário aberto YOLOE-26, lê Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models. Se utilizas o YOLO26 na tua investigação, por favor cita:

Citação
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
  title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
  author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
  year = {2026},
  eprint = {2606.03748},
  archivePrefix = {arXiv},
  primaryClass = {cs.CV},
  doi = {10.48550/arXiv.2606.03748},
  url = {https://arxiv.org/abs/2606.03748},
}

O código, os modelos e a documentação do YOLO26 estão disponíveis no repositório GitHub do Ultralytics e na Ultralytics Docs sob as licenças AGPL-3.0 e Enterprise.


FAQ#

    • Regressão sem DFL: Simplifica a cabeça de detecção e o caminho de exportação
    • Inferência de fim a fim sem NMS: Remove o NMS do caminho de inferência padrão
    • Progressive Loss + STAL: Melhora o alinhamento de treinamento e a cobertura de rótulos para objetos pequenos
    • Otimizador MuSGD: Combina SGD com otimização inspirada em Muon para um treinamento estável
    • Cabeças e perdas específicas de tarefa: Melhora o suporte para segmentação, pose e detecção orientada
  • O YOLO26 é uma família de modelos unificada, oferecendo suporte de fim a fim para múltiplas tarefas de visão computacional:

    Cada variante de tamanho (n, s, m, l, x) suporta todas as tarefas, além de versões de vocabulário aberto através do YOLOE-26.

  • O YOLO26 melhora a eficiência da implantação com:

    • Inferência ponta a ponta nativa sem NMS por padrão
    • Regressão sem DFL e uma head de detecção mais leve
    • Exportação de modelo fundido que remove componentes auxiliares apenas de treinamento
    • Até 43% mais rápida inferência ONNX em CPU para YOLO26n em comparação ao YOLO11n em um Intel Xeon CPU @ 2.00 GHz
    • Formatos de exportação flexíveis, incluindo TensorRT, ONNX, CoreML, LiteRT e OpenVINO
  • Os modelos YOLO26 estão disponíveis para transferência através do pacote ultralytics. Instala ou atualiza o pacote e carrega um modelo:

    from ultralytics import YOLO
    
    # Load a pretrained YOLO26 nano model
    model = YOLO("yolo26n.pt")
    
    # Run inference on an image
    results = model("image.jpg")

    Consulta a seção de Exemplos de Uso para obter instruções de treinamento, validação e exportação.

Comentários