DAMO-YOLO vs YOLOv7#
A rápida evolução da visão computacional produziu modelos eficientes de detecção de objetos projetados para equilibrar precisão e custo computacional. Dois modelos notáveis lançados em 2022 são o DAMO-YOLO e o YOLOv7. Embora ambos busquem ampliar os limites das tarefas de visão em tempo real, eles alcançam seus resultados por meio de paradigmas arquitetônicos e metodologias de treinamento muito diferentes.
Esta comparação técnica abrangente explora as abordagens distintas dos dois modelos, examinando suas arquiteturas, potencial de implantação e métricas de desempenho para ajudar engenheiros de machine learning a escolher a ferramenta certa para suas aplicações específicas de visão computacional.
Origens e metadados dos modelos#
Antes de nos aprofundarmos na análise técnica, é essencial contextualizar as origens desses dois modelos de visão computacional.
DAMO-YOLO#
Desenvolvido por pesquisadores do Alibaba Group, o DAMO-YOLO foi lançado para otimizar velocidade e precisão por meio da busca automatizada por arquiteturas e da destilação.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun
- Organização: Alibaba Group
- Data: 23 de novembro de 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
YOLOv7#
Lançado em meados de 2022 como modelo de última geração, o YOLOv7 ampliou os limites da inferência em tempo real ao introduzir "vantagens gratuitas" treináveis sem aumentar os custos de implantação.
- Autores: Chien-Yao Wang, Alexey Bochkovskiy e Hong-Yuan Mark Liao
- Organização: Instituto de Ciência da Informação, Academia Sinica, Taiwan
- Data: 6 de julho de 2022
- Arxiv: 2207.02696
- Documentação: Documentação do YOLOv7
A Ultralytics não publica pesos nem arquivos YAML do YOLOv7, portanto, não é possível treinar o YOLOv7 nativamente com o pacote Ultralytics. Os modelos YOLOv7 treinados no repositório upstream podem ser exportados para ONNX ou TensorRT e executados para inferência com a Ultralytics.
Inovações arquiteturais#
DAMO-YOLO: NAS e destilação#
O DAMO-YOLO incorpora várias técnicas de ponta voltadas para a máxima eficiência:
- Backbones NAS: usa a busca por arquitetura neural (NAS) para projetar automaticamente backbones ideais (MAE-NAS), adaptados a ambientes sensíveis à latência.
- RepGFPN eficiente: uma rede de pirâmide de características generalizada modificada que aprimora significativamente a eficiência da fusão de características em várias escalas.
- ZeroHead e AlignedOTA: incorpora uma cabeça de detecção leve e uma estratégia otimizada de atribuição de rótulos (AlignedOTA) para reduzir a sobrecarga computacional.
- Aprimoramento por destilação: aproveita bastante a destilação de conhecimento durante o treinamento para melhorar o desempenho de variantes menores do modelo sem aumentar a quantidade de parâmetros.
YOLOv7: E-ELAN e vantagens gratuitas#
O YOLOv7 adotou uma abordagem mais voltada à engenharia estrutural, com foco na otimização dos caminhos dos gradientes e em estratégias robustas de treinamento.
- Arquitetura E-ELAN: a Rede Estendida e Eficiente de Agregação de Camadas permite que o modelo aprenda características mais diversas controlando os caminhos mais curtos e mais longos dos gradientes, garantindo uma convergência eficaz do aprendizado.
- Escalonamento do modelo: introduz um método de escalonamento composto, adaptado a modelos baseados em concatenação, que ajusta simultaneamente a profundidade e a largura para garantir o alinhamento estrutural.
- Vantagens gratuitas treináveis: emprega técnicas como convoluções reparametrizadas (RepConv) sem conexões de identidade e estratégias dinâmicas de atribuição de rótulos, que aumentam a precisão durante o treinamento sem afetar a velocidade de inferência.
Análise de desempenho#
Na avaliação da precisão média (mAP), da velocidade e da eficiência, ambos os modelos apresentam métricas impressionantes, embora atendam a segmentos ligeiramente diferentes. O YOLOv7 foca bastante na implantação em GPU com alta precisão, enquanto as estruturas derivadas de NAS do DAMO-YOLO visam implantações agressivas de baixa latência em CPU e dispositivos de borda.
| Modelo | tamanho (pixels) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Como mostram as métricas, embora o DAMO-YOLO ofereça variantes extremamente leves (como o modelo tiny, com apenas 8,5 milhões de parâmetros), o YOLOv7 alcança um pico de precisão geral mais alto: o YOLOv7x chega a uma impressionante mAP de 53,1 no conjunto de dados COCO.
A vantagem do ecossistema Ultralytics#
Embora a arquitetura teórica seja importante, a praticidade de um modelo é determinada pelo seu ecossistema. Os modelos nativos da Ultralytics, como o YOLO26, contam com um ecossistema bem mantido e uma facilidade de uso incomparável.
- Equilíbrio de desempenho: os modelos da Ultralytics mantêm consistentemente um equilíbrio ideal entre velocidade de inferência e precisão de detecção, sendo ideais tanto para dispositivos de borda quanto para a implantação de modelos na nuvem.
- Requisitos de memória: ao contrário dos modelos mais pesados baseados em Transformers, os modelos YOLO da Ultralytics exigem pouca memória CUDA durante o treinamento. Isso permite usar tamanhos de lote maiores, simplificando o processo de treinamento até mesmo em hardware de consumo.
- Versatilidade: a estrutura da Ultralytics vai além da detecção de objetos e abrange tarefas como segmentação de instâncias e estimativa de pose, oferecendo aos desenvolvedores um kit completo de ferramentas de visão computacional.
O pacote Ultralytics permite passar facilmente dos conjuntos de dados a um modelo totalmente treinado em poucos minutos, aproveitando carregadores de dados altamente otimizados e pesos pré-treinados.
Exemplo de código: execução do YOLOv7 com a Ultralytics#
Depois de converter uma exportação ONNX do YOLOv7 upstream, conforme descrito nos exemplos de uso do YOLOv7, você pode executá-la com a API Python da Ultralytics.
from ultralytics import YOLO
# Carrega um modelo ONNX do YOLOv7 convertido para a Ultralytics
model = YOLO("yolov7-ultralytics.onnx", task="detect")
# Executar inferência
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)O novo padrão: conheça o YOLO26#
Embora o YOLOv7 e o DAMO-YOLO tenham representado avanços importantes em 2022, o campo da IA de visão evolui rapidamente. Para as equipes que iniciam novos projetos hoje, o modelo recomendado é o avançado Ultralytics YOLO26, lançado em janeiro de 2026.
O YOLO26 representa um salto geracional em desempenho e usabilidade, incorporando inovações de última geração:
- Design de ponta a ponta sem NMS: o YOLO26 oferece uma cabeça nativa de ponta a ponta (
nms=False). Ao eliminar o pós-processamento de supressão não máxima (NMS), ele proporciona uma lógica de implantação mais rápida e simples — uma mudança de paradigma inicialmente introduzida pelo YOLOv10. - Otimizador MuSGD: inspirado em inovações de modelos de linguagem grandes, como o Kimi K2 da Moonshot AI, o YOLO26 utiliza um híbrido de SGD e Muon. Esse otimizador garante dinâmicas de treinamento altamente estáveis e taxas de convergência muito mais rápidas.
- Inferência na CPU até 43% mais rápida: com a remoção direcionada da perda focal de distribuição (DFL) e melhorias estruturais profundas, o YOLO26 é altamente otimizado para computação de borda de baixo consumo, superando as gerações anteriores em hardware sem GPU.
- ProgLoss + STAL: incorpora novas funções de perda avançadas que visam explicitamente melhorar o reconhecimento de objetos pequenos, uma capacidade essencial para aplicações em imagens aéreas, robótica e monitoramento de segurança.
- Melhorias específicas para cada tarefa: além da detecção padrão, o YOLO26 apresenta melhorias adaptadas a várias tarefas, incluindo prototipagem multiescala para segmentação, RLE para estimativa de pose e perdas angulares específicas para caixas delimitadoras orientadas (OBB).
Casos de utilização ideais#
A escolha da arquitetura certa depende inteiramente do ambiente de implantação de destino e das restrições do projeto.
Quando escolher o DAMO-YOLO:
- Você trabalha em ambientes de borda com grandes restrições e recursos limitados, nos quais a quantidade bruta de parâmetros precisa ser extremamente baixa (por exemplo, em microcontroladores).
- Você utiliza pipelines automatizados de machine learning integrados especificamente aos serviços de nuvem proprietários da Alibaba.
Quando escolher o YOLOv7:
- Você já tem pipelines legados de GPU otimizados para inferência baseada em âncoras e de alta precisão.
- Estás a operar em ambientes onde a precisão em tempo real é fundamental, como em veículos autónomos de alta velocidade ou em robótica avançada.
Quando escolher YOLO26 (recomendado):
- Estás a desenvolver uma nova aplicação de visão computacional do zero e precisas do que há de mais avançado em precisão e velocidade de inferência em CPU/edge.
- Precisas de uma implementação rápida e integrada (por exemplo, exportando para CoreML ou TensorRT) sem ter de lidar com as restrições dos operadores NMS.
- Queres aproveitar todos os recursos da Ultralytics Platform para treino na cloud, gestão de conjuntos de dados e implementação automatizada.
Ao aproveitar o robusto ecossistema de modelos Ultralytics, os programadores podem reduzir drasticamente o tempo de engenharia e, ao mesmo tempo, garantir um desempenho preditivo de ponta nas aplicações do mundo real.