YOLO26 vs YOLOv9#
O panorama da visão computacional evolui rapidamente, com novas arquiteturas a ultrapassarem continuamente os limites de velocidade e precisão. Nesta comparação técnica, analisamos as diferenças entre YOLO26 e YOLOv9, dois modelos altamente influentes no domínio da deteção de objetos em tempo real. Embora ambos os modelos ofereçam inovações arquiteturais distintas, compreender os compromissos entre desempenho, capacidades de implementação e requisitos de hardware é essencial para escolher a ferramenta certa para o teu próximo projeto de visão.
YOLO26: A potência otimizada para edge#
Lançado no início de 2026, o Ultralytics YOLO26 representa um salto geracional na eficiência de implementação e na estabilidade do treino do modelo. Concebido como uma estrutura nativamente end-to-end, aborda diretamente os obstáculos de implementação que historicamente afetaram as aplicações de IA em edge.
Detalhes do modelo:
- Autores: Glenn Jocher e Jing Qiu
- Organização: Ultralytics
- Data: 2026-01-14
- GitHub: Repositório da Ultralytics
- Documentação: Documentação do YOLO26
Arquitetura e inovações#
O YOLO26 reformula fundamentalmente o pipeline de pós-processamento ao introduzir um Design end-to-end sem NMS. Ao eliminar a necessidade de Supressão não máxima (NMS), o modelo alcança uma variabilidade de latência significativamente menor. Isto facilita consideravelmente a implementação em plataformas móveis e edge, especialmente ao exportar para frameworks como ONNX e Apple CoreML.
Além disso, a remoção de Distribution Focal Loss (DFL) simplifica o processo de exportação e aumenta a compatibilidade com microcontroladores de baixo consumo. Para melhorar a estabilidade do treino, o YOLO26 integra o novo otimizador MuSGD, um híbrido de Stochastic Gradient Descent (SGD) e Muon (inspirado em inovações no treino de Large Language Models). Isto resulta numa convergência mais rápida e numa extração de características mais robusta em datasets difíceis.
Graças às simplificações arquiteturais e à remoção de DFL, o YOLO26 alcança uma inferência em CPU até 43% mais rápida, tornando-o a escolha ideal para dispositivos edge com recursos limitados, como o Raspberry Pi ou o NVIDIA Jetson Nano.
Para detetar objetos particularmente difíceis em cenas como imagens aéreas captadas por drones, o YOLO26 utiliza as funções de perda atualizadas ProgLoss + STAL. Estas proporcionam melhorias notáveis no recall do reconhecimento de objetos pequenos. Além disso, o modelo inclui melhorias específicas para cada tarefa, incluindo proto multiescala para segmentação de instâncias, Residual Log-Likelihood Estimation (RLE) para estimativa de pose e uma função de perda de ângulo especializada para detetar Oriented Bounding Boxes (OBB).
YOLOv9: Informação de gradiente programável#
Introduzido no início de 2024, o YOLOv9 trouxe avanços teóricos à forma como as redes neuronais lidam com o fluxo de gradientes durante a fase de treino, com foco na eficiência dos parâmetros e na retenção de características profundas.
Detalhes do modelo:
- Autores: Chien-Yao Wang e Hong-Yuan Mark Liao
- Organização: Institute of Information Science, Academia Sinica, Taiwan
- Data: 2024-02-21
- Arxiv: Artigo do YOLOv9
- GitHub: Repositório do YOLOv9
- Documentação: Documentação do YOLOv9
Arquitetura e pontos fortes#
O YOLOv9 baseia-se no conceito de Informação de Gradiente Programável (PGI) e da Rede Generalizada de Agregação de Camadas Eficiente (GELAN). Estes conceitos abordam o problema do gargalo de informação frequentemente observado em redes neuronais profundas. Ao preservar informações essenciais durante o processo feed-forward, a GELAN garante que os gradientes utilizados para atualizar os pesos permanecem fiáveis. Esta arquitetura proporciona elevada precisão e torna o YOLOv9 uma opção forte para investigação académica sobre a teoria das redes neuronais e a otimização dos caminhos dos gradientes utilizando o framework PyTorch.
Limitações#
Apesar da sua excelente eficiência de parâmetros, o YOLOv9 depende fortemente da NMS tradicional para o pós-processamento das caixas delimitadoras, o que pode criar gargalos computacionais durante a inferência em dispositivos edge. Além disso, o repositório oficial está amplamente focado na deteção de objetos, exigindo um trabalho de engenharia personalizado significativo para o adaptar a tarefas especializadas, como tracking ou estimativa de pose.
Comparação de desempenho#
Ao avaliar estes modelos para implementação no mundo real, é fundamental equilibrar a precisão (mAP), a velocidade de inferência e a utilização de memória. Os modelos Ultralytics são reconhecidos pelos seus baixos requisitos de memória tanto durante o treino como durante a inferência, exigindo muito menos memória CUDA do que alternativas baseadas em Transformer, como o RT-DETR.
Abaixo está uma comparação direta do desempenho do YOLO26 e do YOLOv9 no dataset COCO. Os melhores valores de cada coluna estão destacados a negrito.
| Modelo | tamanho (píxeis) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Nota: As velocidades em CPU do YOLOv9 foram omitidas, pois variam muito consoante a configuração da NMS e são geralmente inferiores às da implementação nativa sem NMS do YOLO26.
Casos de uso e recomendações#
A escolha entre YOLO26 e YOLOv9 depende dos requisitos específicos do teu projeto, das restrições de implementação e das preferências do ecossistema.
Quando escolher o YOLO26#
O YOLO26 é uma excelente escolha para:
- Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
- Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
- Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.
Quando escolher o YOLOv9#
O YOLOv9 é recomendado para:
- Investigação sobre gargalos de informação: Projetos académicos que estudam as arquiteturas de Informação de Gradiente Programável (PGI) e Rede Generalizada de Agregação de Camadas Eficiente (GELAN).
- Estudos de otimização do fluxo de gradientes: Investigação centrada na compreensão e mitigação da perda de informação nas camadas profundas da rede durante o treino.
- Avaliação comparativa de deteção de alta precisão: Cenários nos quais o forte desempenho do YOLOv9 no benchmark COCO é necessário como ponto de referência para comparações arquiteturais.
A vantagem da Ultralytics#
Escolher um modelo envolve mais do que consultar um benchmark de precisão; o ecossistema de software envolvente determina a rapidez com que podes passar da recolha de dados à produção.
Facilidade de utilização e ecossistema#
A API Python da Ultralytics oferece uma experiência simples de "zero a especialista". Em vez de clonar repositórios complexos ou configurar manualmente scripts de treino distribuído, os programadores podem instalar o pacote através de pip e começar imediatamente o treino. O ecossistema Ultralytics, mantido ativamente, garante atualizações frequentes, integrações automatizadas com plataformas de ML como Weights & Biases e documentação abrangente.
Versatilidade em tarefas de visão#
Enquanto o YOLOv9 é principalmente um motor de deteção, o YOLO26 é uma ferramenta de visão de uso geral. Utilizando uma única sintaxe unificada, podes facilmente passar da deteção de objetos para a segmentação de imagens ao nível dos píxeis ou para a classificação da imagem completa. Esta versatilidade reduz a dívida técnica de manter várias bases de código independentes para diferentes funcionalidades de visão computacional.
Treino e implementação eficientes#
A eficiência do treino é uma pedra angular da filosofia da Ultralytics. O YOLO26 utiliza pesos pré-treinados facilmente disponíveis e apresenta uma utilização de memória significativamente inferior à de vision transformers de grandes dimensões. Depois do treino, os pipelines de exportação integrados permitem conversões com um clique para formatos otimizados, como TensorRT ou TensorFlow Lite, simplificando o caminho até à produção.
Exemplo de código: começar a utilizar o YOLO26#
Implementar o YOLO26 é extremamente simples. O seguinte trecho de código Python demonstra como carregar um modelo pré-treinado, treiná-lo com dados personalizados e executar inferência utilizando a API da Ultralytics.
from ultralytics import YOLO
# Load the latest state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset utilizing the MuSGD optimizer
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # Uses GPU 0, or use 'cpu' for CPU training
)
# Run an NMS-free inference on a sample image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Display the bounding boxes and confidences
predictions[0].show()Ao tirar partido da velocidade, da arquitetura simplificada e do ecossistema robusto do YOLO26, as equipas podem colocar aplicações avançadas de IA de visão no mercado mais rapidamente e com menos obstáculos técnicos do que nunca.