YOLO Vision 2026:

YOLO12: Deteção de Objetos Centrada em Atenção#

Visão geral#

O YOLO12, lançado no início de 2025, introduz uma arquitetura centrada em atenção que se afasta das abordagens tradicionais baseadas em CNN usadas em modelos YOLO anteriores, mas retém a velocidade de inferência em tempo real essencial para muitas aplicações. Este modelo atinge alta precisão na detecção de objetos por meio de inovações metodológicas inéditas em mecanismos de atenção e na arquitetura geral da rede, mantendo o desempenho em tempo real. Apesar dessas vantagens, o YOLO12 continua sendo um lançamento voltado para a comunidade que pode apresentar instabilidade no treinamento, consumo elevado de memória e menor rendimento em CPU devido aos seus blocos de atenção pesados, por isso a Ultralytics recomenda o YOLO11 ou o YOLO26 para a maioria das cargas de trabalho de produção.

Modelo Comunitário

O YOLO12 é mantido principalmente para benchmarking e pesquisa. Se precisas de treinamento estável, uso previsível de memória e inferência otimizada em CPU, escolhe o YOLO11 ou o YOLO26 para implantação.



Watch: How to Use YOLO12 for Object Detection with the Ultralytics Package | Is YOLO12 Fast or Slow? 🚀

Principais recursos#

  • Mecanismo de Atenção por Área: Uma nova abordagem de autoatenção que processa grandes campos receptivos de forma eficiente. Ele divide os mapas de características em l regiões de igual tamanho (com valor padrão igual a 4), seja na horizontal ou na vertical, evitando operações complexas e mantendo um grande campo receptivo efetivo. Isso reduz significativamente o custo computacional em comparação com a autoatenção padrão.
  • Redes de Agregação de Camadas Eficientes Residuais (R-ELAN): Um módulo de agregação de características melhorado baseado em ELAN, concebido para resolver desafios de otimização, especialmente em modelos centrados em atenção de maior escala. O R-ELAN introduz:
    • Ligações residuais ao nível de bloco com dimensionamento (semelhante ao dimensionamento de camadas).
    • Um método redesenhado de agregação de características que cria uma estrutura semelhante a um estrangulamento (bottleneck).
  • Arquitetura de Atenção Otimizada: O YOLO12 simplifica o mecanismo de atenção padrão para uma maior eficiência e compatibilidade com o framework YOLO. Isto inclui:
    • Utilizar FlashAttention para minimizar a sobrecarga de acesso à memória.
    • Remover a codificação posicional para um modelo mais limpo e rápido.
    • Ajustar o rácio MLP (do típico 4 para 1.2 ou 2) para equilibrar melhor a computação entre as camadas de atenção e as camadas feed-forward.
    • Reduzir a profundidade dos blocos empilhados para uma otimização melhorada.
    • Aproveitar as operações de convolução (quando apropriado) pela sua eficiência computacional.
    • Adicionar uma convolução separável 7x7 (o "percetor de posição") ao mecanismo de atenção para codificar implicitamente a informação posicional.
  • Suporte Abrangente a Tarefas: O YOLO12 suporta uma variedade de tarefas essenciais de visão computacional: detecção de objetos, segmentação de instâncias, classificação de imagens, estimativa de pose e detecção de objetos orientados (OBB).
  • Eficiência Melhorada: Alcança uma maior precisão com menos parâmetros em comparação com muitos modelos anteriores, demonstrando um melhor equilíbrio entre velocidade e precisão.
  • Implementação Flexível: Concebido para implementação em diversas plataformas, desde dispositivos edge até infraestruturas na nuvem.

Visualização de comparação do YOLO12

Tarefas e modos suportados#

O YOLO12 suporta uma variedade de tarefas de visão computacional. A tabela abaixo mostra o suporte de tarefas e os modos operacionais (Inferência, Validação, Treino e Exportação) ativados para cada uma:

Disponibilidade de pesos pré-treinados

Apenas os pesos de detecção (yolo12n.pt, yolo12s.pt, yolo12m.pt, yolo12l.pt, yolo12x.pt) são lançados em ultralytics/assets. As arquiteturas de segmentação, classificação, pose e OBB são definidas em ultralytics/cfg/models/12/, portanto essas variantes suportam treinamento do zero a partir da configuração .yaml, mas nenhum arquivo pré-treinado .pt está disponível no momento para elas. Para checkpoints pré-treinados de segmentação, pose, classificação ou OBB, a Ultralytics recomenda o YOLO11 ou o YOLO26.

Tipo de ModeloTarefaPesos Pré-treinadosTreinamentoValidaçãoInferênciaExportar
YOLO12Detecção
YOLO12-segSegmentação
YOLO12-clsClassificação
YOLO12-posePose
YOLO12-obbOBB

Todas as arquiteturas do YOLO12 suportam todos os modos assim que um checkpoint treinado estiver disponível. A coluna Pretrained Weights indica apenas se a Ultralytics publica um .pt pré-treinado oficial em ultralytics/assets: para segmentação, pose, classificação e OBB, deves treinar o teu próprio checkpoint a partir do .yaml correspondente antes de executar inferência, validação ou exportação.

Métricas de desempenho#

O YOLO12 demonstra melhorias significativas de precisão em todas as escalas de modelos, com algumas compensações na velocidade em comparação com os modelos YOLO anteriores mais rápidos. Abaixo estão os resultados quantitativos para a detecção de objetos no conjunto de dados de validação COCO:

Desempenho de Deteção (COCO val2017)#

Desempenho
Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT
(ms)
params
(M)
FLOPs
(B)
Comparação
(mAP/Velocidade)
YOLO12n64040.6-1.642.67.6+2.1%/-9% (vs. YOLOv10n)
YOLO12s64048.0-2.619.323.7+0.1%/+42% (vs. RT-DETRv2)
YOLO12m64052.5-4.8620.271.3+1.0%/-3% (vs. YOLO11m)
YOLO12l64053.7-6.7726.496.3+0.4%/-8% (vs. YOLO11l)
YOLO12x64055.2-11.7959.1210.2+0.6%/-4% (vs. YOLO11x)
  • Velocidade de inferência medida em uma GPU NVIDIA T4 com precisão TensorRT FP16.
  • As comparações mostram a melhoria relativa no mAP e a variação percentual na velocidade (positivo indica mais rápido; negativo indica mais lento). As comparações são feitas em relação aos resultados publicados para YOLOv10, YOLO11 e RT-DETR, quando disponíveis.

Exemplos de uso#

Esta seção fornece exemplos de treinamento e inferência com o YOLO12. Para obter documentação mais abrangente sobre estes e outros modos (incluindo Validação e Exportação), consulta as páginas dedicadas de Previsão e Treinamento.

Os exemplos abaixo concentram-se nos modelos Detecção do YOLO12 (para detecção de objetos). Para outras tarefas suportadas (segmentação, classificação, estimativa de pose e detecção de objetos orientados), consulta a respetiva documentação específica de cada tarefa: Segmentar, Classificar, Pose e OBB.

Exemplo

Modelos pré-treinados *.pt (usando PyTorch) e arquivos de configuração *.yaml podem ser passados para a classe YOLO() para criar uma instância de modelo em Python:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO12n model
model = YOLO("yolo12n.pt")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with the YOLO12n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

Principais Melhorias#

  1. Extração de Características Aprimorada:

    • Atenção por Área: Lida de forma eficiente com grandes campos receptivos, reduzindo o custo computacional.
    • Equilíbrio Otimizado: Equilíbrio melhorado entre as computações de atenção e da rede feed-forward.
    • R-ELAN: Melhora a agregação de características utilizando a arquitetura R-ELAN.
  2. Inovações de Otimização:

    • Ligações Residuais: Introduz ligações residuais com dimensionamento para estabilizar o treino, especialmente em modelos maiores.
    • Integração de Características Refinada: Implementa um método melhorado para integração de características dentro do R-ELAN.
    • FlashAttention: Incorpora FlashAttention para reduzir a sobrecarga de acesso à memória.
  3. Eficiência Arquitetural:

    • Parâmetros Reduzidos: Alcança um menor número de parâmetros enquanto mantém ou melhora a precisão em comparação com muitos modelos anteriores.
    • Atenção Simplificada: Utiliza uma implementação de atenção simplificada, evitando a codificação posicional.
    • Rácios MLP Otimizados: Ajusta os rácios MLP para alocar mais eficazmente os recursos computacionais.

Requisitos#

A implementação do Ultralytics YOLO12, por predefinição, não requer FlashAttention. No entanto, o FlashAttention pode ser opcionalmente compilado e utilizado com o YOLO12. Para compilar o FlashAttention, é necessário um dos seguintes GPUs NVIDIA:

Citações e Agradecimentos#

Se usares o YOLO12 na tua investigação, cita o trabalho original da University at Buffalo e da University of Chinese Academy of Sciences:

Citação
@inproceedings{tian2025yolov12,
  title={YOLOv12: Attention-Centric Real-Time Object Detectors},
  author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
  booktitle={Advances in Neural Information Processing Systems},
  volume={38},
  pages={78433--78457},
  year={2025},
  url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}

@software{yolo12,
  author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
  title = {YOLO12: Attention-Centric Real-Time Object Detectors},
  year = {2025},
  url = {https://github.com/sunsmarterjie/yolov12},
  license = {AGPL-3.0}
}

O artigo do YOLO12 foi publicado nos anais da NeurIPS 2025, com um pré-print no arXiv.

FAQ#

  • O YOLO12 incorpora várias inovações fundamentais para equilibrar velocidade e precisão. O mecanismo de atenção por área processa eficientemente grandes campos receptivos, reduzindo o custo computacional em comparação com a autoatenção padrão. As Redes de Agregação de Camadas Eficientes Residuais (R-ELAN) melhoram a agregação de características, resolvendo desafios de otimização em modelos maiores centrados em atenção. A Arquitetura de Atenção Otimizada, incluindo o uso de FlashAttention e a remoção de codificação posicional, aprimora ainda mais a eficiência. Esses recursos permitem que o YOLO12 alcance uma precisão de ponta enquanto mantém a velocidade de inferência em tempo real crucial para muitas aplicações.

  • O YOLO12 é um modelo versátil que suporta uma ampla gama de tarefas essenciais de visão computacional. Ele destaca-se na detecção de objetos, segmentação de instâncias, classificação de imagens, estimativa de pose e detecção de objetos orientados (OBB) (ver detalhes). Esse suporte abrangente a tarefas torna o YOLO12 uma ferramenta poderosa para diversas aplicações, desde robótica e condução autônoma até imagens médicas e inspeção industrial. Nota que os pesos pré-treinados .pt são atualmente publicados apenas para detecção; as arquiteturas de segmentação, pose, classificação e OBB são fornecidas como configurações .yaml para treinamento do zero.

  • O YOLO12 demonstra melhorias significativas de precisão em todas as escalas de modelos em comparação com modelos YOLO anteriores como o YOLOv10 e o YOLO11, com algumas compensações na velocidade em comparação com os modelos anteriores mais rápidos. Por exemplo, o YOLO12n atinge uma melhoria de mAP de +2,1% em relação ao YOLOv10n e +1,2% em relação ao YOLO11n no conjunto de dados COCO val2017. Em comparação com modelos como o RT-DETR, o YOLO12s oferece uma melhoria de mAP de +1,5% e um aumento substancial de velocidade de +42%. Essas métricas destacam o forte equilíbrio do YOLO12 entre precisão e eficiência. Consulta a seção de métricas de desempenho para comparações detalhadas.

  • Por predefinição, a implementação do Ultralytics YOLO12 não requer FlashAttention. No entanto, o FlashAttention pode ser opcionalmente compilado e utilizado com o YOLO12 para minimizar a sobrecarga de acesso à memória. Para compilar o FlashAttention, é necessário um dos seguintes GPUs NVIDIA: Turing GPUs (por exemplo, T4, série Quadro RTX), Ampere GPUs (por exemplo, série RTX30, A30/40/100), Ada Lovelace GPUs (por exemplo, série RTX40) ou Hopper GPUs (por exemplo, H100/H200). Esta flexibilidade permite aos utilizadores aproveitar os benefícios do FlashAttention quando os recursos de hardware o permitem.

  • Esta página fornece exemplos de uso básicos para treinamento e inferência. Para documentação abrangente sobre estes e outros modos, incluindo Validação e Exportação, consulta as páginas dedicadas de Previsão e Treinamento. Para informações específicas de tarefas (segmentação, classificação, estimativa de pose e detecção de objetos orientados), consulta a respetiva documentação: Segmentar, Classificar, Pose e OBB. Esses recursos fornecem orientações aprofundadas para utilizar o YOLO12 eficazmente em vários cenários.

Comentários