Ultralytics YOLO27:

YOLOv9 vs DAMO-YOLO#

A rápida evolução da visão computacional produziu um conjunto de arquiteturas poderosas, adaptadas a diferentes restrições de implementação e requisitos de precisão. Duas opções notáveis neste espaço são o YOLOv9, reconhecido pelo tratamento robusto dos gargalos de informação, e o DAMO-YOLO, que se concentra fortemente na Busca de Arquitetura Neural (NAS) e em pirâmides de características eficientes.

Este guia apresenta uma comparação técnica aprofundada entre YOLOv9 e DAMO-YOLO, destacando as suas diferenças arquiteturais, metodologias de treino e cenários ideais de implementação. Também vamos explorar como o ecossistema Ultralytics oferece um percurso contínuo do desenvolvimento à produção e por que razão modelos modernos como o YOLO26 se tornaram o padrão recomendado para novos projetos.

Análise aprofundada da arquitetura#

Compreender os mecanismos fundamentais que impulsionam cada modelo revela por que razão eles apresentam desempenhos diferentes em várias métricas.

YOLOv9: Informação de gradiente programável#

O YOLOv9 foi concebido para abordar diretamente a perda de informação que ocorre à medida que os dados percorrem redes neurais profundas.

  • Autores: Chien-Yao Wang, Hong-Yuan Mark Liao
  • Organização: Institute of Information Science, Academia Sinica, Taiwan
  • Data: 21 de fevereiro de 2024
  • Ligações: Arxiv, GitHub, Documentação

Saiba mais sobre o YOLOv9

O YOLOv9 introduz a Informação de Gradiente Programável (PGI) e a Rede Generalizada de Agregação Eficiente de Camadas (GELAN). A PGI garante que a informação espacial e semântica vital seja retida durante o processo de propagação para a frente, impedindo a degradação dos gradientes utilizados para atualizar os pesos. A GELAN complementa esta abordagem ao maximizar a eficiência dos parâmetros, permitindo ao modelo alcançar uma precisão média (mAP) de última geração com menos FLOPs do que muitas CNNs convencionais.

DAMO-YOLO: eficiência orientada por NAS#

Desenvolvido pelo Alibaba Group, o DAMO-YOLO segue uma abordagem diferente, utilizando a pesquisa automatizada de arquiteturas para encontrar o equilíbrio ideal entre velocidade e precisão.

  • Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun
  • Organização: Alibaba Group
  • Data: 23 de novembro de 2022
  • Ligações: Arxiv, GitHub

Learn more about DAMO-YOLO

O DAMO-YOLO baseia-se num tronco MAE-NAS (Maximum Entropy Neural Architecture Search) para gerar automaticamente estruturas de rede eficientes. Utiliza uma RepGFPN (Reparameterized Generalized Feature Pyramid Network) para a fusão robusta de características e um design "ZeroHead" para minimizar a carga computacional da cabeça de deteção. Adicionalmente, incorpora o AlignedOTA para a atribuição de rótulos e destilação de conhecimento para potenciar o desempenho das suas variantes mais pequenas.

O papel da NAS na visão computacional

A Busca de Arquitetura Neural (NAS) automatiza o design de redes neurais artificiais. Embora possa produzir modelos altamente eficientes como o DAMO-YOLO, muitas vezes exige enormes recursos computacionais para pesquisar o espaço de arquiteturas, em contraste com a filosofia de design mais determinística de modelos como o YOLOv9.

Comparação de desempenho e métricas#

Ao selecionar um modelo de deteção de objetos, é fundamental equilibrar a precisão, a velocidade e o consumo computacional.

Modelotamanho
(píxeis)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Análise#

  • Precisão vs. parâmetros: O YOLOv9 geralmente demonstra uma relação superior entre parâmetros e precisão. Por exemplo, o YOLOv9c alcança 53,0% de mAP com 25,3M de parâmetros, enquanto o DAMO-YOLOl alcança 50,8% de mAP, mas requer significativamente mais parâmetros (42,1M).
  • Velocidade de inferência: A arquitetura do DAMO-YOLO proporciona velocidades de inferência competitivas com TensorRT em GPUs T4, superando ligeiramente o YOLOv9 nos níveis médios. No entanto, a eficiência do YOLOv9 em FLOPs e na quantidade de parâmetros traduz-se numa excecional eficiência de memória da GPU.
  • Requisitos de memória: Os modelos Ultralytics YOLO, incluindo o YOLOv9, apresentam normalmente um menor consumo de memória tanto durante o treino como durante a inferência, em comparação com modelos complexos gerados por NAS ou arquiteturas pesadas baseadas em Transformer, tornando-os altamente acessíveis para implementação em hardware de edge com recursos limitados.

A vantagem do ecossistema Ultralytics#

Embora as métricas teóricas sejam importantes, a implementação prática determina em grande medida o sucesso de um projeto. É aqui que a Ultralytics Platform e o seu ecossistema de software abrangente se destacam em relação a repositórios independentes como o DAMO-YOLO.

Facilidade de utilização e eficiência de treino#

Treinar um modelo YOLOv9 personalizado requer muito pouco código boilerplate. A API Python da Ultralytics abstrai processos complexos como aumento de dados, treino distribuído e otimização de hardware.

from ultralytics import YOLO

# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Validate model performance
metrics = model.val()

# Export for production deployment
model.export(format="onnx")

Por outro lado, utilizar o DAMO-YOLO exige frequentemente navegar por ficheiros de configuração rígidos e cadeias complexas de dependências específicas do seu pipeline de treino singular, o que resulta numa curva de aprendizagem mais acentuada.

Versatilidade entre tarefas#

Uma característica marcante dos modelos Ultralytics é a sua versatilidade intrínseca. Para além da deteção padrão de caixas delimitadoras, o framework Ultralytics suporta perfeitamente tarefas como segmentação de instâncias, estimativa de pose, classificação de imagens e deteção de caixas delimitadoras orientadas (OBB). O DAMO-YOLO é estritamente otimizado para a deteção de objetos 2D, exigindo uma reengenharia significativa para se adaptar a outros paradigmas visuais.

Exportação para dispositivos Edge

A Ultralytics simplifica o pipeline de implementação ao oferecer exportação de modelos com um clique para formatos como TensorRT, OpenVINO e CoreML, garantindo o máximo desempenho independentemente do hardware de destino.

Casos de uso e recomendações#

A escolha entre YOLOv9 e DAMO-YOLO depende dos requisitos específicos do teu projeto, das restrições de implementação e das preferências de ecossistema.

Quando escolher o YOLOv9#

O YOLOv9 é uma escolha sólida para:

  • Investigação sobre gargalos de informação: Projetos académicos que estudam as arquiteturas de Informação de Gradiente Programável (PGI) e Rede Generalizada de Agregação de Camadas Eficiente (GELAN).
  • Estudos de otimização do fluxo de gradientes: Investigação centrada na compreensão e mitigação da perda de informação nas camadas profundas da rede durante o treino.
  • Avaliação comparativa de deteção de alta precisão: Cenários nos quais o forte desempenho do YOLOv9 no benchmark COCO é necessário como ponto de referência para comparações arquiteturais.

Quando escolher o DAMO-YOLO#

O DAMO-YOLO é recomendado para:

  • Análise de vídeo de elevado débito: Processamento de streams de vídeo com FPS elevado em infraestruturas GPU NVIDIA fixas, nas quais o débito com batch-1 é a principal métrica.
  • Linhas de fabrico industrial: Cenários com restrições rigorosas de latência GPU em hardware dedicado, como a inspeção de qualidade em tempo real em linhas de montagem.
  • Investigação sobre pesquisa de arquitetura neural: Estudo dos efeitos da pesquisa automatizada de arquiteturas (MAE-NAS) e de backbones eficientemente reparametrizados no desempenho da deteção.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, o Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência de desenvolvimento:

  • Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.

O futuro: avançar para o YOLO26#

Embora o YOLOv9 e o DAMO-YOLO representem marcos históricos importantes, a visão computacional moderna mudou para arquiteturas nativamente de ponta a ponta. Para qualquer novo desenvolvimento, o YOLO26 é o padrão recomendado.

Lançado em 2026, o YOLO26 baseia-se nos êxitos dos seus antecessores, oferecendo um salto tanto na precisão como na simplicidade de implementação.

Principais inovações do YOLO26#

  • Design de ponta a ponta sem NMS: O YOLO26 elimina completamente o pós-processamento de Supressão não máxima (NMS). Isto cria um pipeline de implementação simplificado e nativamente de ponta a ponta, uma inovação pioneiramente introduzida no YOLOv10.
  • Remoção de DFL: A Distribution Focal Loss foi removida para simplificar a exportação e melhorar a compatibilidade com dispositivos edge/de baixo consumo.
  • Até 43% mais rápido na inferência em CPU: Ao remover o pós-processamento complexo e otimizar as convoluções principais, o YOLO26 é especialmente adequado para cenários de edge computing sem GPUs dedicadas.
  • Otimizador MuSGD: Inspirado nas inovações do treino de LLMs, o YOLO26 utiliza uma combinação de SGD e Muon (MuSGD) para garantir treinos mais estáveis e tempos de convergência visivelmente mais rápidos.
  • ProgLoss + STAL: Estas funções de perda avançadas proporcionam melhorias notáveis no reconhecimento de objetos pequenos, tornando o YOLO26 ideal para imagens aéreas de grande altitude e dispositivos IoT.

Se estás atualmente a avaliar o YOLO11 ou o YOLOv8 para o teu próximo projeto, atualizar para o YOLO26 garante que estás a utilizar o framework de IA para visão computacional mais otimizado e avançado disponível atualmente.

Resumo#

A escolha do modelo certo depende das tuas restrições operacionais específicas:

  • DAMO-YOLO oferece uma perspetiva fascinante sobre a otimização orientada por NAS, proporcionando velocidades competitivas para perfis de hardware muito específicos nos quais a sua arquitetura RepGFPN se destaca.
  • YOLOv9 é uma excelente escolha para investigadores focados na retenção de detalhes visuais refinados, utilizando a sua arquitetura PGI para evitar a perda de informação em redes profundas.
  • Ultralytics YOLO26 afirma-se como a escolha definitiva para aplicações empresariais e de investigação modernas. A sua facilidade de utilização incomparável, a arquitetura sem NMS e as otimizações de treino MuSGD de vanguarda fazem dele o modelo mais fiável, preciso e fácil de implementar no panorama da visão computacional.

Comentários