YOLO26 vs YOLOv9#
O cenário da visão computacional avança rapidamente, com novas arquiteturas ampliando continuamente os limites de velocidade e precisão. Nesta comparação técnica, examinamos as diferenças entre YOLO26 e YOLOv9, dois modelos altamente influentes no campo da detecção de objetos em tempo real. Embora ambos ofereçam inovações arquitetônicas distintas, entender as compensações entre desempenho, recursos de implantação e requisitos de hardware é essencial para escolher a ferramenta certa para seu próximo projeto de visão computacional.
YOLO26: o destaque otimizado para dispositivos de borda#
Lançado no início de 2026, o Ultralytics YOLO26 representa um salto geracional na eficiência de implantação e na estabilidade do treinamento de modelos. Projetado como uma estrutura nativamente de ponta a ponta, ele aborda diretamente os gargalos de implantação que historicamente têm dificultado as aplicações de IA de borda.
Detalhes do modelo:
- Autores: Glenn Jocher e Jing Qiu
- Organização: Ultralytics
- Data: 2026-01-14
- GitHub: Repositório da Ultralytics
- Documentação: Documentação do YOLO26
Arquitetura e inovações#
O YOLO26 reformula fundamentalmente o fluxo de pós-processamento ao introduzir um design de ponta a ponta sem NMS. Quando executado com sua cabeça opcional um para um (nms=False), o modelo ignora a supressão não máxima (NMS) e reduz drasticamente a variabilidade da latência. Isso facilita muito a implantação em plataformas móveis e de borda, especialmente ao exportar para estruturas como ONNX e Apple CoreML.
Além disso, a remoção da Distribution Focal Loss (DFL) simplifica o processo de exportação e aumenta a compatibilidade com microcontroladores de baixo consumo. Para melhorar a estabilidade do treinamento, o YOLO26 integra o novo otimizador MuSGD, uma combinação de descida do gradiente estocástica (SGD) e Muon (inspirada em inovações no treinamento de Modelos de Linguagem de Grande Escala). Isso resulta em convergência mais rápida e extração de características mais robusta em conjuntos de dados desafiadores.
Graças às simplificações arquitetônicas e à remoção do DFL, o YOLO26 oferece inferência na CPU até 43% mais rápida, sendo a escolha ideal para dispositivos de borda com recursos limitados, como o Raspberry Pi ou o NVIDIA Jetson Nano.
Para detectar objetos particularmente desafiadores em cenas como imagens aéreas de drones, o YOLO26 utiliza as funções de perda atualizadas ProgLoss + STAL. Elas proporcionam melhorias notáveis na revocação do reconhecimento de objetos pequenos. Além disso, o modelo oferece aprimoramentos específicos para cada tarefa, incluindo proto em múltiplas escalas para segmentação de instâncias, Estimativa de Log-Verossimilhança Residual (RLE) para estimativa de pose e uma função de perda de ângulo especializada para detectar caixas delimitadoras orientadas (OBB).
YOLOv9: informações de gradiente programáveis#
Introduzido no início de 2024, o YOLOv9 trouxe avanços teóricos à forma como as redes neurais lidam com o fluxo de gradientes durante a fase de treinamento, com foco na eficiência de parâmetros e na retenção de características profundas.
Detalhes do modelo:
- Autores: Chien-Yao Wang e Hong-Yuan Mark Liao
- Organização: Instituto de Ciências da Informação, Academia Sinica, Taiwan
- Data: 2024-02-21
- Arxiv: Artigo do YOLOv9
- GitHub: Repositório do YOLOv9
- Documentação: Documentação do YOLOv9
Arquitetura e pontos fortes#
O YOLOv9 foi desenvolvido em torno dos conceitos de Informação de Gradiente Programável (PGI) e Rede de Agregação de Camadas Eficiente Generalizada (GELAN). Esses conceitos abordam o problema do gargalo de informação frequentemente observado em redes neurais profundas. Ao preservar informações essenciais durante o processo de propagação direta, a GELAN garante que os gradientes usados para atualizar os pesos permaneçam confiáveis. Essa arquitetura oferece alta precisão e torna o YOLOv9 uma ótima opção para pesquisas acadêmicas sobre teoria de redes neurais e otimização do caminho do gradiente usando a estrutura PyTorch.
Limitações#
Apesar da excelente eficiência de parâmetros, o YOLOv9 depende muito da NMS tradicional para o pós-processamento de caixas delimitadoras, o que pode criar gargalos computacionais durante a inferência em dispositivos de borda. Além disso, o repositório oficial se concentra principalmente na detecção de objetos, exigindo bastante engenharia personalizada para adaptá-lo a tarefas especializadas, como rastreamento ou estimativa de pose.
Comparação de desempenho#
Ao avaliar esses modelos para implantação no mundo real, é essencial equilibrar a precisão (mAP), a velocidade de inferência e o uso de memória. Os modelos Ultralytics são conhecidos pelos baixos requisitos de memória tanto durante o treinamento quanto durante a inferência, exigindo muito menos memória CUDA do que alternativas baseadas em Transformer, como o RT-DETR.
A seguir, uma comparação direta do desempenho do YOLO26 e do YOLOv9 no conjunto de dados COCO. Os melhores valores de cada coluna estão destacados em negrito.
| Modelo | tamanho (pixels) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Observação: as velocidades de CPU do YOLOv9 foram omitidas, pois variam muito conforme a configuração da NMS e geralmente são inferiores às da implementação nativa do YOLO26 sem NMS.
Casos de uso e recomendações#
A escolha entre YOLO26 e YOLOv9 depende dos requisitos específicos do seu projeto, das restrições de implantação e das preferências de ecossistema.
Quando escolher o YOLO26#
O YOLO26 é uma ótima opção para:
- Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
- Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
- Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.
Quando escolher o YOLOv9#
O YOLOv9 é recomendado para:
- Pesquisa sobre gargalos de informação: Projetos acadêmicos que estudam arquiteturas de Informação de Gradiente Programável (PGI) e Rede de Agregação de Camadas Eficiente Generalizada (GELAN).
- Estudos de otimização do fluxo de gradientes: Pesquisas voltadas a entender e reduzir a perda de informação nas camadas profundas da rede durante o treinamento.
- Benchmarking de detecção de alta precisão: Cenários em que o forte desempenho do YOLOv9 no benchmark COCO é necessário como referência para comparações arquitetônicas.
A vantagem da Ultralytics#
Escolher um modelo envolve mais do que simplesmente consultar um benchmark de precisão; o ecossistema de software ao redor determina a rapidez com que você pode passar da coleta de dados à produção.
Facilidade de uso e ecossistema#
A API Python da Ultralytics oferece uma experiência completa, do zero ao avançado. Em vez de clonar repositórios complexos ou configurar manualmente scripts de treinamento distribuído, desenvolvedores podem instalar o pacote com pip e começar a treinar imediatamente. O ecossistema Ultralytics, mantido ativamente, garante atualizações frequentes, integrações automatizadas com plataformas de ML como Weights & Biases e documentação abrangente.
Versatilidade em tarefas de visão computacional#
Enquanto o YOLOv9 é principalmente um mecanismo de detecção, o YOLO26 é uma ferramenta de visão computacional de uso geral. Com uma única sintaxe unificada, você pode alternar facilmente da detecção de objetos para a segmentação de imagens com precisão em nível de pixel ou a classificação de imagens completas. Essa versatilidade reduz a dívida técnica de manter várias bases de código independentes para diferentes recursos de visão computacional.
Treinamento e implantação eficientes#
A eficiência de treinamento é um pilar da filosofia Ultralytics. O YOLO26 utiliza pesos pré-treinados prontamente disponíveis e apresenta um uso de memória significativamente menor em comparação com Transformers de visão volumosos. Após o treinamento, os pipelines de exportação integrados permitem conversões com um clique para formatos otimizados, como TensorRT ou LiteRT, facilitando o caminho até a produção.
Exemplo de código: primeiros passos com o YOLO26#
Implementar o YOLO26 é muito simples. O trecho de código Python a seguir demonstra como carregar um modelo pré-treinado, treiná-lo com dados personalizados e executar inferência usando a API Ultralytics.
from ultralytics import YOLO
# Carrega o modelo nano YOLO26 de última geração
model = YOLO("yolo26n.pt")
# Treina o modelo no conjunto de dados COCO8 (optimizer='auto' seleciona MuSGD para execuções de treinamento mais longas)
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Usa a GPU 0 ou 'cpu' para treinar na CPU
)
# Executa inferência sem NMS em uma imagem de exemplo
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# Exibe as caixas delimitadoras e os níveis de confiança
predictions[0].show()Ao aproveitar a velocidade, a arquitetura simplificada e o ecossistema robusto do YOLO26, as equipes podem lançar aplicações avançadas de IA para visão computacional no mercado com mais rapidez e menos obstáculos técnicos do que nunca.