Ultralytics YOLO27:

Ultralytics YOLO26#

Visão geral#

Ultralytics YOLO26 é uma família unificada de modelos de visão em tempo real descrita no artigo do Ultralytics YOLO26. Introduz inferência nativa de ponta a ponta, uma cabeça de deteção mais leve, uma receita de treino atualizada e cabeças específicas para deteção, segmentação, estimativa de pose, classificação e deteção orientada.

Nas suas cinco escalas de deteção, o YOLO26 alcança 40.9-57.5 mAP no COCO com latência de 1.7-11.8 ms no T4 TensorRT. O artigo também relata uma inferência CPU ONNX até 43% mais rápida para o YOLO26n em comparação com o YOLO11n numa CPU Intel Xeon a 2.00 GHz.

Vê a pré-visualização não lançada de YOLO27 para arquitetura planeada, tarefas e benchmarks preliminares.

Gráficos de comparação do Ultralytics YOLO26



Watch: How to Train a YOLO26 model on Your Custom Dataset in Google Colab.
Início rápido
from ultralytics import YOLO

model = YOLO("yolo26n.pt")  # load a pretrained YOLO26n model
results = model("path/to/bus.jpg")  # run inference
Experimenta na Ultralytics Platform

Explora e executa modelos YOLO26 diretamente na Ultralytics Platform.

A família de modelos YOLO26 assenta em quatro áreas de design:

  • Inferência nativa de ponta a ponta: A cabeça de deteção opcional um para um produz previsões sem supressão de não máximos (NMS), simplificando a implementação e reduzindo o pós-processamento.
  • Regressão de caixas mais leve: O YOLO26 remove a Perda Focal de Distribuição (DFL), reduzindo a complexidade da cabeça de deteção e preservando simultaneamente um intervalo de regressão sem restrições.
  • Atualizações da receita de treino: O pipeline de treino combina MuSGD (um otimizador híbrido Muon + SGD), Progressive Loss e STAL (Atribuição de Rótulos Sensível a Objetos Pequenos) para melhorar a otimização, transferir a supervisão para a cabeça usada no momento da inferência e manter a cobertura de rótulos positivos para objetos pequenos. Os hiperparâmetros completos usados nos checkpoints publicados estão documentados no guia da receita de treino do YOLO26.
  • Cabeças e perdas específicas por tarefa: O YOLO26 adiciona designs direcionados para segmentação de instâncias, variantes de segmentação semântica, estimativa de pose e deteção orientada, mantendo um único pipeline de modelo em todas as tarefas.

Em conjunto, estas atualizações melhoram o compromisso entre precisão e latência em todas as escalas de modelo e destinos de implementação.

Principais funcionalidades#

  • Regressão sem DFL O YOLO26 remove a Perda Focal de Distribuição (DFL), reduzindo a complexidade da cabeça de deteção e simplificando a exportação.

  • Inferência sem NMS de ponta a ponta O YOLO26 suporta inferência nativa de ponta a ponta com nms=False, produzindo previsões sem uma etapa de NMS separada. O caminho padrão de um para muitos usa NMS para precisão.

  • Progressive Loss + STAL A Progressive Loss transfere a ênfase do treino para a cabeça usada no momento da inferência, enquanto o STAL melhora a cobertura de rótulos positivos para objetos pequenos.

  • Otimizador MuSGD Um otimizador híbrido que combina SGD com Muon, adaptando ideias de otimização do treino de modelos de linguagem de grande escala à visão computacional.

  • Implementação eficiente A cabeça simplificada e o caminho opcional sem NMS reduzem a sobrecarga de inferência em alvos de exportação e perfis de hardware, incluindo a aceleração de CPU ONNX relatada no artigo para o YOLO26n em comparação com o YOLO11n.

  • Melhorias na segmentação de instâncias Introduz uma perda de segmentação semântica para melhorar a convergência do modelo e um módulo proto atualizado que aproveita informações multiescala para obter uma qualidade superior das máscaras. O artigo relata ganhos sobre o YOLO11 de até +2.5 AP de caixas e +3.7 AP de máscaras na segmentação de instâncias no COCO.

  • Estimativa precisa de pose Integra a Estimativa de Log-Verosimilhança Residual (RLE) para uma localização mais precisa dos pontos-chave e otimiza o processo de descodificação para aumentar a velocidade da inferência. O artigo relata até +7.2 AP em relação ao YOLO11 na estimativa de pose no COCO.

  • Descodificação OBB refinada Introduz uma perda de ângulo especializada para melhorar a precisão da deteção de objetos quadrados e otimiza a descodificação OBB para resolver problemas de descontinuidade nos limites. O artigo relata até +3.4 mAP em relação ao YOLO11 na deteção orientada no DOTA-v1.0.

Gráficos de comparação de ponta a ponta do Ultralytics YOLO26

Tarefas e modos suportados#

O YOLO26 suporta o conjunto padrão de tarefas da Ultralytics em cinco escalas de modelo:

ModeloNomes dos ficheirosTarefaTreinoValidaçãoInferênciaExportação
YOLO26yolo26n.pt yolo26s.pt yolo26m.pt yolo26l.pt yolo26x.ptDeteção
YOLO26-segyolo26n-seg.pt yolo26s-seg.pt yolo26m-seg.pt yolo26l-seg.pt yolo26x-seg.ptSegmentação de instâncias
YOLO26-semyolo26n-sem.pt yolo26s-sem.pt yolo26m-sem.pt yolo26l-sem.pt yolo26x-sem.ptSegmentação semântica
YOLO26-depthyolo26n-depth.pt yolo26s-depth.pt yolo26m-depth.pt yolo26l-depth.pt yolo26x-depth.ptEstimativa de profundidade
YOLO26-clsyolo26n-cls.pt yolo26s-cls.pt yolo26m-cls.pt yolo26l-cls.pt yolo26x-cls.ptClassificação
YOLO26-poseyolo26n-pose.pt yolo26s-pose.pt yolo26m-pose.pt yolo26l-pose.pt yolo26x-pose.ptPose/Pontos-chave
YOLO26-obbyolo26n-obb.pt yolo26s-obb.pt yolo26m-obb.pt yolo26l-obb.pt yolo26x-obb.ptDeteção orientada

Este framework unificado abrange deteção em tempo real, segmentação de instâncias, segmentação semântica, estimativa de profundidade monocular, classificação, estimativa de pose e deteção de objetos orientados, com suporte para treino, validação, inferência e exportação.

Variantes apenas de arquitetura

yolo26-p2.yaml e yolo26-p6.yaml adicionam uma cabeça de deteção P2 (objetos pequenos) ou P6 (entradas grandes) e são fornecidos apenas como arquiteturas YAML. Não são disponibilizados pesos yolo26*-p2.pt ou yolo26*-p6.pt específicos de escala. Instancia uma configuração dimensionada a partir de YAML (por exemplo, YOLO("yolo26n-p6.yaml")) e treina-a ou ajusta-a conforme necessário.

Métricas de desempenho#

Desempenho

Consulta a documentação de deteção para ver exemplos de utilização destes modelos treinados com COCO, que incluem 80 classes pré-treinadas.

Modelotamanho
(píxeis)
mAPval
50-95
mAPval
50-95(e2e)
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLO26n64040.940.138.9 ± 0.71.7 ± 0.02.45.5
YOLO26s64048.647.887.2 ± 0.92.5 ± 0.09.520.9
YOLO26m64053.152.5220.0 ± 1.44.7 ± 0.120.468.4
YOLO26l64055.054.4286.2 ± 2.06.2 ± 0.224.886.8
YOLO26x64057.556.9525.8 ± 4.011.8 ± 0.255.7194.4

Os valores de parâmetros e FLOPs são para o modelo fundido após a dobra de Conv/BatchNorm e a remoção do ramo de deteção não utilizado. As medições de velocidade selecionam a cabeça sem NMS com nms=False. Os pontos de controlo pré-treinados retêm a arquitetura de treino completa e podem mostrar contagens mais altas.

Exemplos de utilização#

Esta secção fornece exemplos simples de treino e inferência do YOLO26. Para obter a documentação completa sobre estes e outros modos, consulta as páginas de documentação Predict, Train, Val e Export.

Nota que o exemplo abaixo é para modelos YOLO26 Detect de deteção de objetos. Para consultar outras tarefas suportadas, vê a documentação de Segment, Semantic Segmentation, Depth, Classify, Pose e OBB.

Exemplo

Os modelos *.pt pré-treinados do PyTorch, bem como os ficheiros de configuração *.yaml, podem ser transmitidos à classe YOLO() para criar uma instância de modelo em Python:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO26n model
model = YOLO("yolo26n.pt")

# Run inference with the YOLO26n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
Arquitetura de duas cabeças

Os modelos de deteção YOLO26 utilizam uma arquitetura de duas cabeças que oferece flexibilidade para diferentes cenários de implementação:

  • Cabeça de um para muitos (Padrão): Gera saídas tradicionais do YOLO que requerem pós-processing de NMS, produzindo (N, nc + 4, 8400) onde nc é o número de classes. Esta cabeça normalmente atinge uma precisão ligeiramente superior ao custo de processamento adicional.
  • Cabeça de um para um (nms=False): Produz previsões de ponta a ponta sem NMS, produzindo (N, 300, 6) com um máximo de 300 deteções por imagem. Esta cabeça é otimizada para inferência rápida e implementação simplificada.

Podes alternar entre as cabeças durante a exportação, a previsão ou a validação:

from ultralytics import YOLO

model = YOLO("yolo26n.pt")

# Use one-to-many head (default, Ultralytics applies NMS)
results = model.predict("image.jpg")  # inference
metrics = model.val(data="coco.yaml")  # validation
model.export(format="onnx")  # export

# Opt into the NMS-free one-to-one head
results = model.predict("image.jpg", nms=False)  # inference
metrics = model.val(data="coco.yaml", nms=False)  # validation
model.export(format="onnx", nms=False)  # export

A previsão e a validação usam a cabeça de um para muitos por padrão para precisão. Usa nms=False para inferência sem NMS, ou nms=True para incorporar NMS numa exportação suportada. Ambas as cabeças são treinadas independentemente desta escolha. Consulta o End-to-End Detection guide para formatos de saída e compatibilidade de exportação.

YOLOE-26: Deteção e segmentação de vocabulário aberto#

O YOLO26 também alimenta o YOLOE-26, uma variante de vocabulário aberto que deteta e segmenta categorias de objetos a partir de text prompts, visual prompts ou um prompt-free mode em vez de uma lista de classes fixa aprendida no momento do treino. O YOLOE-26 mantém a cabeça opcional end-to-end (e2e) sem NMS do YOLO26, pelo que a inferência de vocabulário aberto se mantém suficientemente rápida para ambientes dinâmicos onde as categorias alvo mudam ao longo do tempo. O YOLOE-26x atinge 40.6 AP no LVIS minival sob text prompting, 38.5 AP sob visual prompting e 31.1 AP prompt-free — os valores Non-E2E do artigo, que a respetiva cabeça end-to-end fica atrás por 1.1, 2.3 e 1.2 AP.

Consulta a documentação do YOLOE para ver tabelas de desempenho por escala, variantes sem prompt e exemplos completos de utilização.

Citações e agradecimentos#

Para obter uma descrição técnica completa da arquitetura do YOLO26, da receita de treino, das cabeças de tarefa e da extensão de vocabulário aberto YOLOE-26, lê Ultralytics YOLO26: Modelos de visão unificados, em tempo real e de ponta a ponta. Se utilizares o YOLO26 na tua investigação, cita:

Citação
@misc{jocher2026ultralyticsyolo26unifiedrealtime,
  title = {Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models},
  author = {Glenn Jocher and Jing Qiu and Mengyu Liu and Shuai Lyu and Fatih Cagatay Akyon and Muhammet Esat Kalfaoglu},
  year = {2026},
  eprint = {2606.03748},
  archivePrefix = {arXiv},
  primaryClass = {cs.CV},
  doi = {10.48550/arXiv.2606.03748},
  url = {https://arxiv.org/abs/2606.03748},
}

O código, os modelos e a documentação do YOLO26 estão disponíveis no repositório Ultralytics no GitHub e na documentação da Ultralytics, ao abrigo das licenças AGPL-3.0 e Enterprise.

Perguntas frequentes#

    • Regressão sem DFL: Simplifica a cabeça de deteção e o caminho de exportação
    • Inferência sem NMS de ponta a ponta: Suporta inferência sem NMS com nms=False
    • Progressive Loss + STAL: Melhora o alinhamento do treino e a cobertura de rótulos para objetos pequenos
    • Otimizador MuSGD: Combina SGD com uma otimização inspirada no Muon para um treino estável
    • Cabeças e perdas específicas por tarefa: Melhora o suporte para segmentação, pose e deteção orientada
  • O YOLO26 é uma família unificada de modelos, que fornece suporte de ponta a ponta para várias tarefas de visão computacional:

    Cada variante de tamanho (n, s, m, l, x) suporta todas as tarefas, além das versões de vocabulário aberto através do YOLOE-26.

  • O YOLO26 melhora a eficiência da implementação através de:

    • Inferência nativa opcional de ponta a ponta sem NMS (nms=False)
    • Regressão sem DFL e uma cabeça de deteção mais leve
    • Exportação de modelos fundidos que remove componentes auxiliares exclusivos do treino
    • Inferência CPU ONNX até 43% mais rápida para o YOLO26n em comparação com o YOLO11n numa CPU Intel Xeon a 2.00 GHz
    • Formatos de exportação flexíveis, incluindo TensorRT, ONNX, CoreML, LiteRT e OpenVINO
  • Os modelos YOLO26 estão disponíveis para transferência através do pacote ultralytics. Instala ou atualiza o pacote e carrega um modelo:

    from ultralytics import YOLO
    
    # Load a pretrained YOLO26 nano model
    model = YOLO("yolo26n.pt")
    
    # Run inference on an image
    results = model("image.jpg")

    Consulta a secção Exemplos de utilização para obter instruções de treino, validação e exportação.

Comentários