Ultralytics YOLO27:
Get Started

YOLOv5 vs. YOLOv9#

O cenário da visão computacional e da detecção de objetos em tempo real avançou de forma notável nos últimos anos. Escolher entre modelos consolidados e testados em campo e arquiteturas de pesquisa mais recentes é um desafio comum para engenheiros de aprendizado de máquina. Este guia apresenta uma comparação técnica abrangente entre dois modelos muito influentes da família YOLO: YOLOv5 e YOLOv9.

Seja para implantar em dispositivos de borda com recursos limitados, pesquisar extração de características de alta fidelidade ou criar pipelines complexos de detecção de objetos, é fundamental compreender as nuances arquiteturais, as métricas de desempenho e as diferenças entre os ecossistemas desses modelos.

Visão geral dos modelos#

Antes de analisar as comparações arquiteturais, é útil entender as origens e os principais objetivos de cada modelo.

Ultralytics YOLOv5#

Desenvolvido por Glenn Jocher e lançado pela Ultralytics em 26 de junho de 2020, o YOLOv5 marcou uma mudança de paradigma na forma como os desenvolvedores interagiam com modelos de visão. Ao adotar totalmente a estrutura PyTorch, o YOLOv5 substituiu as complexas etapas de compilação dos modelos anteriores baseados em Darknet por uma experiência intuitiva, centrada em Python.

O YOLOv5 é conhecido pela facilidade de uso e pelo desempenho estável em diversos ambientes de hardware. Ele oferece suporte não apenas à detecção, mas também à classificação de imagens e à segmentação de instâncias.

YOLOv9#

Apresentado por Chien-Yao Wang e Hong-Yuan Mark Liao, do Instituto de Ciências da Informação da Academia Sinica, em Taiwan, o YOLOv9 se concentra fortemente na teoria arquitetural para mitigar problemas de gargalo de informação em redes neurais profundas.

O YOLOv9 se baseia em duas grandes inovações teóricas: Informação de Gradiente Programável (PGI) e Rede Generalizada de Agregação Eficiente de Camadas (GELAN). Esses conceitos ajudam o modelo a preservar características espaciais essenciais ao longo das camadas profundas da rede.

Saiba mais sobre o YOLOv9

Prepare suas implantações para o futuro

Embora YOLOv5 e YOLOv9 sejam modelos potentes, o recém-lançado YOLO26 representa o equilíbrio ideal entre velocidade e precisão. Com inferência opcional ponta a ponta sem NMS e inferência em CPU até 43% mais rápida, o YOLO26 é altamente recomendado para computação de borda moderna e implantações em produção.

Diferenças arquiteturais e técnicas#

Entender o que impulsiona esses modelos de visão internamente é essencial para otimizar as estratégias de implantação de modelos.

Extração e retenção de características#

O YOLOv5 usa uma espinha dorsal Cross Stage Partial Network (CSPNet), que reduz efetivamente a sobrecarga computacional e mantém um fluxo de gradiente preciso durante a retropropagação. Esse design é altamente otimizado para operações de GPU tradicionais e garante requisitos de memória menores durante o treinamento em comparação com alternativas pesadas baseadas em Transformer.

O YOLOv9 apresenta a GELAN, uma arquitetura genérica que amplia os princípios da CSPNet. Combinada à PGI — um ramo auxiliar reversível —, a GELAN garante que as camadas profundas não percam os dados semânticos necessários para funções objetivo precisas. Isso permite que o YOLOv9 alcance alta precisão, especialmente em objetos menores, embora os ramos auxiliares complexos possam, às vezes, dificultar os pipelines de exportação para hardware de borda com recursos muito limitados.

Requisitos de memória e eficiência de treinamento#

Em termos de eficiência de treinamento, o YOLOv5 continua extremamente robusto. O ecossistema da Ultralytics, bem mantido, garante que os modelos YOLOv5 consumam muito menos memória CUDA, permitindo que pesquisadores maximizem os tamanhos de lote em GPUs de consumo. Embora o YOLOv9 alcance excelente eficiência de parâmetros (alta precisão em relação ao seu tamanho), seu processo de treinamento pode exigir mais recursos se não forem usadas estruturas otimizadas. Felizmente, a integração do YOLOv9 à API da Ultralytics o aproxima da gestão simplificada de recursos do YOLOv5.

Desempenho e métricas#

Para avaliar essas arquiteturas de forma objetiva, comparamos seu desempenho em conjuntos de dados padrão, como o COCO. Abaixo está uma análise detalhada de métricas como mAP (precisão média média), velocidade de inferência e número de parâmetros.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Como mostra a tabela, o YOLOv9 alcança maior precisão bruta em categorias equivalentes, refletindo sua arquitetura mais recente. No entanto, o YOLOv5n mantém uma latência extremamente baixa de 1,12 ms com TensorRT, destacando sua força duradoura em aplicações de computação de borda localizada e de alta velocidade.

Metodologias de treinamento e facilidade de uso#

Hoje, a verdadeira vantagem de usar a visão computacional está na acessibilidade da cadeia de ferramentas.

A vantagem da Ultralytics#

Embora os repositórios originais de pesquisa de modelos como o YOLOv9 sejam fundamentais, muitas vezes vêm acompanhados de matrizes complexas de dependências e scripts padronizados. A API Python da Ultralytics abstrai completamente essa complexidade. Com o ecossistema da Ultralytics, você pode treinar, avaliar e exportar YOLOv5 e YOLOv9 usando a mesma sintaxe unificada.

from ultralytics import YOLO

# Carrega um modelo YOLOv5 pré-treinado para implantação rápida
model_v5 = YOLO("yolov5su.pt")  # YOLOv5u: pesos YOLOv5 sem âncoras para o pacote ultralytics

# Ou aproveita um modelo YOLOv9 para obter alta precisão
model_v9 = YOLO("yolov9c.pt")

# Treina facilmente com dados personalizados
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)

# Exporta o modelo treinado para ONNX
model_v9.export(format="onnx")

Essa abordagem com uma única API oferece enorme versatilidade e oferece suporte não apenas à detecção, mas também à estimativa de pose e às caixas delimitadoras orientadas (OBB), dependendo do modelo escolhido. Além disso, integrações robustas com ferramentas como Comet ML e Weights & Biases já vêm incorporadas ao ciclo de treinamento.

Casos de uso ideais e aplicações no mundo real#

A escolha entre essas arquiteturas depende principalmente das restrições do seu hardware e da precisão exigida pelo domínio da sua aplicação.

Quando escolher o YOLOv5#

O YOLOv5 é um veterano testado em campo que se destaca em implantações que priorizam estabilidade, baixo consumo de memória e ampla compatibilidade de exportação.

  • Implantações móveis: Exportar o YOLOv5 para LiteRT ou CoreML para inferência no dispositivo em smartphones mais antigos é extremamente simples.
  • Hardware de borda legado: Em dispositivos como Raspberry Pi ou NVIDIA Jetson Nano de primeira geração, as convoluções diretas do YOLOv5 garantem taxas de quadros consistentes para aplicações como gestão inteligente de estacionamentos.
  • Prototipagem rápida: A ampla disponibilidade de tutoriais da comunidade, pesos pré-treinados personalizados e compatibilidade com inúmeros conjuntos de dados fazem dele a maneira mais rápida de validar uma prova de conceito.

Quando escolher o YOLOv9#

O YOLOv9 é ideal para cenários em que capturar detalhes complexos e minimizar falsos negativos é absolutamente essencial, mesmo que isso exija um pouco mais de recursos computacionais.

  • Imagens aéreas e de satélite: A estrutura PGI é altamente eficaz na preservação da fidelidade de objetos pequenos, tornando o YOLOv9 excelente para monitoramento agrícola baseado em drones.
  • Diagnóstico por imagens médicas: Ao detectar anomalias ou lesões minúsculas em exames de alta resolução, o fluxo preciso de gradientes da GELAN oferece uma vantagem necessária na revocação.
  • Análise de varejo de alto nível: O rastreamento de produtos sobrepostos em prateleiras lotadas se beneficia muito da capacidade superior de retenção de características do YOLOv9.

Amplie seus horizontes#

Embora a comparação entre YOLOv5 e YOLOv9 mostre claramente como as arquiteturas evoluíram de 2020 a 2024, o campo da IA está avançando mais rápido do que nunca. Para desenvolvedores que buscam o limite máximo de desempenho, recomendamos explorar os mais recentes modelos YOLO26. Ao oferecer um design nativo ponta a ponta sem NMS (nms=False) como alternativa à supressão não máxima tradicional e utilizar o avançado otimizador MuSGD, o YOLO26 reduz a distância entre a precisão de nível de pesquisa e a velocidade de nível de produção. Com a remoção de DFL (Distribution Focal Loss removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de borda e de baixo consumo), o YOLO26 alcança inferência em CPU até 43% mais rápida, tornando-o ideal para computação de borda. Além disso, ProgLoss + STAL oferece funções de perda aprimoradas, com melhorias notáveis no reconhecimento de objetos pequenos, algo essencial para IoT, robótica e imagens aéreas.

Você também pode se interessar por comparar essas arquiteturas com outros modelos de última geração, como o RT-DETR ou o altamente capaz YOLO11. Usar a estrutura unificada da Ultralytics garante que, independentemente do modelo escolhido, seu pipeline de desenvolvimento continue organizado, eficiente e pronto para escalar.

Comentários