YOLOv9 vs YOLO26#
O panorama da deteção de objetos em tempo real evoluiu significativamente nos últimos anos. À medida que os profissionais de machine learning procuram implementar modelos numa variedade de hardwares, escolher a arquitetura certa é fundamental. Neste guia técnico abrangente, comparamos dois marcos importantes no campo da visão computacional: o YOLOv9, introduzido no início de 2024 com foco em otimizações do caminho dos gradientes, e o Ultralytics YOLO26, o mais recente framework de última geração, lançado no início de 2026, que redefine completamente a inferência na edge e a estabilidade do treino.
Resumo executivo: linhagem e autoria dos modelos#
Compreender as origens destes modelos de deep learning fornece um contexto valioso sobre as suas escolhas de design arquitetural e os públicos-alvo.
YOLOv9#
Com autoria de Chien-Yao Wang e Hong-Yuan Mark Liao, do Institute of Information Science da Academia Sinica, em Taiwan, o YOLOv9 foi lançado a 21 de fevereiro de 2024. O modelo foca-se intensamente em conceitos teóricos de deep learning, abordando especificamente o problema do gargalo de informação em redes neurais convolucionais profundas (CNNs).
Ultralytics YOLO26#
Com autoria de Glenn Jocher e Jing Qiu, da Ultralytics, o YOLO26 foi lançado a 14 de janeiro de 2026. Desenvolvido com base no enorme sucesso de predecessores como o YOLO11 e o YOLOv8, o YOLO26 foi concebido de raiz para dar prioridade à prontidão para produção, à implementação na edge e à eficiência end-to-end nativa.
Pronto para atualizar o teu pipeline de visão computacional? Podes treinar e implementar facilmente modelos YOLO26 na cloud sem escrever código, utilizando a Ultralytics Platform.
Inovações arquiteturais#
Ambos os modelos introduzem mudanças revolucionárias na forma como as redes neurais processam dados visuais, mas abordam o problema a partir de perspetivas diferentes.
Informação de gradiente programável no YOLOv9#
A principal contribuição do YOLOv9 para o campo é a introdução da Informação de Gradiente Programável (PGI) e da Rede Generalizada de Agregação Eficiente de Camadas (GELAN). À medida que as redes neurais se tornam mais profundas, sofrem frequentemente de perda de informação durante o processo feed-forward. A PGI garante que os gradientes utilizados para atualizar os pesos durante a retropropagação permanecem precisos e fiáveis, permitindo que a arquitetura GELAN alcance uma elevada precisão com menos parâmetros.
No entanto, o YOLOv9 depende fortemente da supressão não máxima (NMS) tradicional para o pós-processamento, o que pode tornar-se um gargalo de latência durante a inferência no mundo real.
A arquitetura edge-first do YOLO26#
O YOLO26 adota uma abordagem radicalmente diferente, otimizando todo o pipeline, desde o treino até à implementação em tempo real. Baseia-se no Design End-to-End sem NMS, pioneiro no YOLOv10, eliminando completamente a necessidade de pós-processamento com NMS. O resultado é uma latência incrivelmente baixa, tornando-o altamente otimizado para dispositivos edge, como o Raspberry Pi ou o NVIDIA Jetson.
Além disso, o YOLO26 remove completamente o Distribution Focal Loss (DFL). Esta alteração estrutural simplifica a exportação para ONNX do modelo e proporciona uma compatibilidade significativamente melhor com microcontroladores de baixo consumo.
Para a fase de treino, o YOLO26 integra o inovador otimizador MuSGD, um híbrido de Descida de Gradiente Estocástica e Muon, inspirado nas metodologias de treino de LLM da Kimi K2, da Moonshot AI. Isto estabelece uma ponte entre as inovações de treino de Modelos de Linguagem de Grande Escala (LLM) e a visão computacional, proporcionando um treino muito mais estável e tempos de convergência mais rápidos.
Comparação de desempenho e métricas#
Ao realizar benchmarks no amplamente utilizado dataset COCO, ambos os modelos demonstram capacidades excecionais, mas o ecossistema da Ultralytics destaca-se nas velocidades práticas de inferência e na eficiência de parâmetros.
| Modelo | tamanho (píxeis) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
Análise dos resultados#
- Velocidade e eficiência: Como o YOLO26 utiliza uma arquitetura sem NMS e funções de perda simplificadas, oferece até 43% mais rapidez na inferência em CPU em comparação com arquiteturas legadas. O modelo YOLO26n é executado em impressionantes 1,7 ms numa GPU NVIDIA T4 utilizando TensorRT, tornando-o a escolha ideal para streams de vídeo em tempo real.
- Precisão: O modelo YOLO26x alcança uns 57,5 mAP sem precedentes, superando o maior modelo YOLOv9e e mantendo uma latência inferior.
- Requisitos de memória: Os modelos da Ultralytics são conhecidos pela sua eficiência. O YOLO26 requer significativamente menos memória CUDA durante o treino do modelo e a inferência, em comparação com modelos de visão baseados em Transformer complexos, permitindo que os developers utilizem tamanhos de batch maiores em hardware de consumo.
Ecossistema, facilidade de utilização e versatilidade#
A verdadeira força do ecossistema da Ultralytics reside na experiência do utilizador. Enquanto os investigadores que utilizam a base de código do YOLOv9 no GitHub têm de lidar com configurações complexas do ambiente e scripting manual, o YOLO26 está totalmente integrado na intuitiva API Python da Ultralytics.
Exemplo de API simplificado#
Treinar um modelo YOLO26 de última geração requer apenas algumas linhas de código Python:
from ultralytics import YOLO
# Load the latest native end-to-end YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model effortlessly with the default MuSGD optimizer
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export natively to ONNX format in a single command
model.export(format="onnx")Versatilidade de tarefas incomparável#
Ao contrário do YOLOv9, principalmente adaptado à deteção de objetos padrão, o YOLO26 suporta nativamente uma vasta gama de tarefas de visão computacional desde o início. A arquitetura inclui melhorias específicas para diversas aplicações:
- Segmentação de instâncias: Inclui uma função de perda de segmentação semântica especializada e um proto multiescala para máscaras perfeitas ao nível dos píxeis.
- Estimativa de pose: Integra a Estimativa de Log-Verosimilhança Residual (RLE) para acompanhar pontos-chave do esqueleto com extrema precisão.
- Caixas delimitadoras orientadas (OBB): Inclui uma função de perda angular especializada, concebida especificamente para resolver problemas de limites na deteção de objetos rodados em imagens aéreas.
- Classificação de imagens: Categorização robusta de imagens completas com base nos padrões do ImageNet.
Todos os modelos YOLO26 beneficiam de uma integração perfeita com a Ultralytics Platform, que oferece rotulagem integrada de datasets, aprendizagem ativa e pipelines de implementação instantânea.
Aplicações no mundo real#
A escolha entre estes modelos depende frequentemente do ambiente onde serão implementados.
IoT e robótica edge#
Para robótica, drones autónomos e dispositivos IoT domésticos inteligentes, o YOLO26 é o campeão indiscutível. A integração de ProgLoss + STAL traz melhorias significativas ao reconhecimento de objetos pequenos, algo fundamental para a monitorização agrícola realizada por drones a grande altitude. Combinado com a sua inferência em CPU 43% mais rápida e o design sem NMS, o YOLO26 pode ser executado de forma fluida em hardware sem GPUs dedicadas.
Investigação académica e análise de gradientes#
O YOLOv9 continua a ser um modelo altamente respeitado nos meios académicos. Os investigadores que estudam os limites teóricos do fluxo de gradientes, ou que procuram desenvolver camadas PyTorch personalizadas com base no conceito PGI, considerarão a base de código do YOLOv9 uma excelente fundação para explorar a teoria do deep learning.
Pipelines de fabrico de alta velocidade#
Em ambientes industriais, como na deteção de defeitos automatizada em tapetes transportadores de alta velocidade, as velocidades extremamente rápidas do TensorRT nos modelos YOLO26 garantem que nenhum frame é perdido, maximizando o débito dos sistemas de garantia de qualidade.
Casos de uso e recomendações#
A escolha entre YOLOv9 e YOLO26 depende dos requisitos específicos do teu projeto, das restrições de implementação e das preferências em termos de ecossistema.
Quando escolher o YOLOv9#
O YOLOv9 é uma escolha sólida para:
- Investigação sobre gargalos de informação: Projetos académicos que estudam as arquiteturas de Informação de Gradiente Programável (PGI) e Rede Generalizada de Agregação de Camadas Eficiente (GELAN).
- Estudos de otimização do fluxo de gradientes: Investigação centrada na compreensão e mitigação da perda de informação nas camadas profundas da rede durante o treino.
- Avaliação comparativa de deteção de alta precisão: Cenários nos quais o forte desempenho do YOLOv9 no benchmark COCO é necessário como ponto de referência para comparações arquiteturais.
Quando escolher o YOLO26#
O YOLO26 é recomendado para:
- Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
- Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
- Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.
Conclusão#
Ambos os modelos representam avanços extraordinários para a comunidade open source. O YOLOv9 introduziu melhorias teóricas fundamentais no fluxo de gradientes que irão inspirar arquiteturas durante muitos anos. No entanto, para developers modernos, startups e equipas empresariais que procuram um equilíbrio perfeito entre velocidade, precisão e facilidade de implementação, o Ultralytics YOLO26 é a recomendação clara.
Ao eliminar o NMS, introduzir o poderoso otimizador MuSGD e disponibilizar um conjunto incomparável de ferramentas para tarefas de deteção, segmentação e pose, o YOLO26 garante que os teus projetos de visão computacional são desenvolvidos sobre o framework mais fiável e preparado para o futuro atualmente disponível.