Ultralytics YOLO27:
Get Started

YOLOv9 vs DAMO-YOLO#

A rápida evolução da visão computacional produziu uma série de arquiteturas poderosas, adaptadas a diferentes restrições de implantação e requisitos de precisão. Dois modelos notáveis nesse campo são YOLOv9, reconhecido por lidar com robustez com gargalos de informação, e DAMO-YOLO, que se concentra na Busca de Arquitetura Neural (NAS) e em pirâmides de características eficientes.

Este guia apresenta uma comparação técnica aprofundada entre YOLOv9 e DAMO-YOLO, destacando suas diferenças arquitetônicas, metodologias de treinamento e cenários de implantação ideais. Também veremos como o ecossistema da Ultralytics oferece um caminho contínuo do desenvolvimento à produção e por que modelos modernos como YOLO26 se tornaram o padrão recomendado para novos projetos.

Análise aprofundada da arquitetura#

Entender os mecanismos centrais de cada modelo revela por que eles apresentam desempenhos diferentes em várias métricas.

YOLOv9: informações de gradiente programáveis#

YOLOv9 foi projetado para abordar diretamente a perda de informação que ocorre à medida que os dados fluem por redes neurais profundas.

  • Autores: Chien-Yao Wang, Hong-Yuan Mark Liao
  • Organização: Instituto de Ciências da Informação, Academia Sinica, Taiwan
  • Data: 21 de fevereiro de 2024
  • Links: Arxiv, GitHub, Documentação

Saiba mais sobre o YOLOv9

YOLOv9 apresenta Informações de Gradiente Programáveis (PGI) e a Rede Generalizada de Agregação Eficiente de Camadas (GELAN). A PGI garante a retenção de informações espaciais e semânticas vitais durante a propagação direta, evitando a degradação dos gradientes usados para atualizar os pesos. A GELAN complementa esse recurso maximizando a eficiência dos parâmetros, permitindo que o modelo alcance uma precisão média (mAP) de última geração com menos FLOPs do que muitas CNNs convencionais.

DAMO-YOLO: eficiência orientada por NAS#

Desenvolvido pelo Alibaba Group, DAMO-YOLO segue uma abordagem diferente, utilizando a busca automatizada de arquiteturas para encontrar o equilíbrio ideal entre velocidade e precisão.

  • Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun
  • Organização: Alibaba Group
  • Data: 23 de novembro de 2022
  • Links: Arxiv, GitHub

Saiba mais sobre o DAMO-YOLO

DAMO-YOLO depende de uma rede backbone MAE-NAS (busca de arquitetura neural por entropia máxima) para gerar automaticamente estruturas de rede eficientes. Ele utiliza uma RepGFPN (rede generalizada de pirâmide de características reparametrizada) para fusão robusta de características e um design "ZeroHead" para minimizar a carga computacional da cabeça de detecção. Além disso, incorpora AlignedOTA para atribuição de rótulos e destilação de conhecimento, melhorando o desempenho de suas variantes menores.

O papel da NAS na visão computacional

A Busca de Arquitetura Neural (NAS) automatiza o projeto de redes neurais artificiais. Embora possa produzir modelos altamente eficientes como DAMO-YOLO, geralmente exige enormes recursos computacionais para explorar o espaço de arquiteturas, em contraste com a filosofia de projeto mais determinística de modelos como YOLOv9.

Comparação de desempenho e métricas#

Ao escolher um modelo de detecção de objetos, é fundamental equilibrar precisão, velocidade e consumo computacional.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Análise#

  • Precisão vs. parâmetros: YOLOv9 geralmente apresenta uma relação entre parâmetros e precisão superior. Por exemplo, YOLOv9c alcança 53,0% de mAP com 25,5 milhões de parâmetros, enquanto DAMO-YOLOl alcança 50,8% de mAP, mas exige significativamente mais parâmetros (42,1 milhões).
  • Velocidade de inferência: a arquitetura do DAMO-YOLO oferece velocidades competitivas de inferência com TensorRT em GPUs T4, superando ligeiramente YOLOv9 nas categorias intermediárias. No entanto, a eficiência do YOLOv9 em FLOPs e quantidade de parâmetros resulta em uma eficiência excepcional no uso da memória da GPU.
  • Requisitos de memória: os modelos Ultralytics YOLO, incluindo YOLOv9, normalmente apresentam menor uso de memória durante o treinamento e a inferência do que modelos complexos gerados por NAS ou arquiteturas Transformer pesadas, tornando-os bastante acessíveis para implantação em hardware de borda limitado.

A vantagem do ecossistema Ultralytics#

Embora as métricas teóricas sejam importantes, a implementação prática determina em grande parte o sucesso de um projeto. É nesse aspecto que a plataforma Ultralytics e seu ecossistema abrangente de software se destacam em relação a repositórios independentes como DAMO-YOLO.

Facilidade de uso e eficiência do treinamento#

Treinar um modelo YOLOv9 personalizado exige pouco código repetitivo. A API Python da Ultralytics abstrai processos complexos como aumento de dados, treinamento distribuído e otimização de hardware.

from ultralytics import YOLO

# Carrega um modelo YOLOv9 pré-treinado
model = YOLO("yolov9c.pt")

# Treina o modelo com o teu conjunto de dados personalizado
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valida o desempenho do modelo
metrics = model.val()

# Exporta para implantação em produção
model.export(format="onnx")

Por outro lado, usar o DAMO-YOLO costuma exigir lidar com arquivos de configuração rígidos e cadeias complexas de dependências específicas do pipeline de treinamento exclusivo do modelo, o que resulta em uma curva de aprendizado mais acentuada.

Versatilidade em várias tarefas#

Uma característica marcante dos modelos Ultralytics é sua versatilidade inerente. Além da detecção padrão de caixas delimitadoras, o framework Ultralytics oferece suporte contínuo a tarefas como segmentação de instâncias, estimativa de pose, classificação de imagens e detecção de caixas delimitadoras orientadas (OBB). O DAMO-YOLO é otimizado estritamente para detecção de objetos 2D, exigindo uma reengenharia significativa para se adaptar a outros paradigmas visuais.

Exportação para dispositivos de borda

A Ultralytics simplifica o pipeline de implantação oferecendo exportação de modelos com um clique para formatos como TensorRT, OpenVINO e CoreML, garantindo o máximo desempenho independentemente do hardware de destino.

Casos de uso e recomendações#

A escolha entre YOLOv9 e DAMO-YOLO depende dos requisitos específicos do seu projeto, das restrições de implantação e das preferências de ecossistema.

Quando escolher o YOLOv9#

YOLOv9 é uma ótima opção para:

  • Pesquisa sobre gargalos de informação: Projetos acadêmicos que estudam arquiteturas de Informação de Gradiente Programável (PGI) e Rede de Agregação de Camadas Eficiente Generalizada (GELAN).
  • Estudos de otimização do fluxo de gradientes: Pesquisas voltadas a entender e reduzir a perda de informação nas camadas profundas da rede durante o treinamento.
  • Benchmarking de detecção de alta precisão: Cenários em que o forte desempenho do YOLOv9 no benchmark COCO é necessário como referência para comparações arquitetônicas.

Quando escolher DAMO-YOLO#

O DAMO-YOLO é recomendado para:

  • Análise de vídeo de alto rendimento: Processamento de transmissões de vídeo com alto FPS em uma infraestrutura fixa de GPU NVIDIA, na qual o rendimento com lote 1 é a principal métrica.
  • Linhas de fabricação industrial: Cenários com restrições rigorosas de latência da GPU em hardware dedicado, como inspeção de qualidade em tempo real em linhas de montagem.
  • Pesquisa em busca de arquitetura neural: Estudo dos efeitos da busca automatizada de arquitetura (MAE-NAS) e de backbones eficientes com reparametrização no desempenho da detecção.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

O futuro: migrando para YOLO26#

Embora YOLOv9 e DAMO-YOLO representem marcos históricos importantes, a visão computacional moderna migrou para arquiteturas nativamente de ponta a ponta. Para qualquer novo desenvolvimento, YOLO26 é o padrão recomendado.

Lançado em 2026, YOLO26 se baseia nos sucessos de seus predecessores, oferecendo um salto tanto na precisão quanto na simplicidade de implantação.

Principais Inovações do YOLO26#

  • Design de ponta a ponta sem NMS: a cabeça opcional one-to-one do YOLO26 (nms=False) elimina totalmente o pós-processamento de supressão não máxima (NMS). Isso cria um pipeline de implantação simplificado e nativamente de ponta a ponta, um avanço pioneiro do YOLOv10.
  • Remoção da DFL: a Distribution Focal Loss foi removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de borda e de baixo consumo de energia.
  • Inferência na CPU até 43% mais rápida: ao remover a DFL e otimizar as convoluções principais, YOLO26 é especialmente adequado para cenários de computação de borda sem GPUs dedicadas.
  • Otimizador MuSGD: inspirado nas inovações do treinamento de LLMs, YOLO26 utiliza uma combinação de SGD e Muon (MuSGD) para garantir treinamentos mais estáveis e tempos de convergência visivelmente menores.
  • ProgLoss + STAL: essas funções de perda avançadas aprimoram significativamente o reconhecimento de objetos pequenos, tornando YOLO26 ideal para imagens aéreas de alta altitude e dispositivos IoT.

Se você está pesquisando YOLO11 ou YOLOv8 para seu próximo projeto, migrar para YOLO26 garante que você esteja usando o framework de IA para visão mais otimizado e avançado disponível atualmente.

Resumo#

A escolha do modelo certo depende das suas restrições operacionais específicas:

  • DAMO-YOLO oferece uma visão fascinante da otimização baseada em NAS, proporcionando velocidades competitivas em perfis de hardware muito específicos, nos quais sua arquitetura RepGFPN se destaca.
  • YOLOv9 é uma excelente opção para pesquisadores que buscam preservar detalhes visuais refinados, usando sua arquitetura PGI para evitar a perda de informações em redes profundas.
  • Ultralytics YOLO26 é a escolha definitiva para aplicações empresariais e de pesquisa modernas. Sua facilidade de uso incomparável, arquitetura sem NMS e otimizações de treinamento MuSGD de ponta fazem dele o modelo mais confiável, preciso e fácil de implantar no cenário da visão computacional.

Comentários