YOLOv5 vs DAMO-YOLO#
O panorama da visão computacional em tempo real está em constante evolução, com investigadores e engenheiros a procurarem o equilíbrio perfeito entre precisão, velocidade e usabilidade. Dois modelos proeminentes que moldaram este percurso são o Ultralytics YOLOv5 e o DAMO-YOLO da Alibaba.
Este guia fornece uma análise técnica aprofundada das suas arquiteturas, métricas de desempenho e metodologias de treino para te ajudar a escolher o modelo certo para a tua próxima implementação.
Contexto dos modelos#
Antes de explorar os detalhes técnicos, é importante compreender as origens e as principais filosofias de design por detrás de cada um destes influentes modelos de visão.
Ultralytics YOLOv5#
Desenvolvido por Glenn Jocher e pela equipa da Ultralytics, o YOLOv5 tornou-se um padrão da indústria desde o seu lançamento. Desenvolvido nativamente na framework PyTorch, priorizou uma experiência de desenvolvimento simplificada e capacidades robustas de implementação desde o início.
- Autor: Glenn Jocher
- Organização: Ultralytics
- Data: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- Documentação: Documentação do Ultralytics YOLOv5
DAMO-YOLO#
Criado por investigadores do Alibaba Group, o DAMO-YOLO centra-se fortemente na Pesquisa Automatizada de Arquitetura (NAS) e em técnicas avançadas de destilação. Ultrapassa os limites teóricos do desempenho específico do hardware, destinando-se sobretudo a ambientes de investigação e de edge computing que exigem uma otimização extrema.
- Autores: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang e Xiuyu Sun
- Organização: Alibaba Group
- Data: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
Inovações arquiteturais#
Ambos os modelos utilizam conceitos estruturais exclusivos para alcançar o seu desempenho em tempo real, embora as suas abordagens sejam significativamente diferentes.
YOLOv5: estabilidade e versatilidade#
O YOLOv5 utiliza uma backbone CSP (Parcial entre Estágios) modificada, combinada com um neck PANet (Rede de Agregação de Caminhos). Esta estrutura é altamente eficiente, minimizando o uso de memória CUDA durante o treino e a inferência.
Um dos maiores pontos fortes do YOLOv5 é a sua versatilidade entre tarefas. Para além das previsões de caixas delimitadoras, oferece arquiteturas dedicadas para segmentação de imagens e classificação de imagens, permitindo aos programadores uniformizar os seus pipelines de visão em torno de uma única framework coesa.
DAMO-YOLO: pesquisa automatizada de arquitetura#
A principal inovação do DAMO-YOLO é o seu MAE-NAS Backbone. Usando uma busca guiada por entropia máxima, a equipe da Alibaba descobriu backbones que equilibram a precisão de detecção e a velocidade de inferência dinamicamente.
Além disso, inclui o neck Efficient RepGFPN para uma fusão de características melhorada — altamente benéfica para variações complexas de escala frequentemente observadas na análise de imagens de satélite. O seu design ZeroHead simplifica as camadas finais de previsão para reduzir a latência, embora esta geração estrutural complexa possa tornar a arquitetura rígida e mais difícil de modificar para aplicações personalizadas.
As arquiteturas baseadas em Transformer enfrentam frequentemente dificuldades com um elevado consumo de VRAM. Tanto o YOLOv5 como o DAMO-YOLO utilizam designs convolucionais eficientes para manter reduzida a utilização de memória, mas os modelos da Ultralytics estão particularmente otimizados para GPUs de consumo, tornando-os muito mais acessíveis a investigadores independentes e startups.
Desempenho e métricas#
A avaliação de detetores de objetos em tempo real exige analisar uma matriz de mAP (Precisão Média Média), velocidade de inferência e parâmetros de tamanho do modelo.
| Modelo | tamanho (píxeis) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
Embora o DAMO-YOLO alcance pontuações de mAP altamente competitivas com determinadas quantidades de parâmetros, o YOLOv5 demonstra consistentemente velocidades excecionais com TensorRT e quantidades de parâmetros extremamente reduzidas nas suas configurações nano e small. Este equilíbrio de desempenho garante que o YOLOv5 funcione de forma eficiente em diversos cenários de implementação edge.
Eficiência do treino e ecossistema#
A precisão teórica de um modelo é tão boa quanto a sua aplicabilidade prática. É neste ponto que os modelos divergem consideravelmente.
A complexidade da destilação#
O DAMO-YOLO depende fortemente de uma metodologia de treinamento em vários estágios. Ele emparelha a atribuição de rótulos AlignedOTA com uma técnica de destilação de conhecimento de professor-aluno. Embora isso extraia o desempenho máximo do modelo aluno, exige o treinamento inicial de um modelo professor massivo. Isso aumenta drasticamente o tempo de computação, os custos de energia e o hardware necessário, representando um gargalo para equipes de ML ágeis.
A vantagem da Ultralytics: facilidade de utilização#
Por outro lado, o ecossistema Ultralytics é mundialmente reconhecido pelas suas APIs intuitivas e eficiência de treino. Com o apoio de um desenvolvimento ativo e de uma enorme comunidade open source, os programadores podem treinar, validar e implementar modelos de forma simples.
from ultralytics import YOLO
# Load a pretrained YOLOv5 model
model = YOLO("yolov5s.pt")
# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export to ONNX format for deployment
model.export(format="onnx")A Ultralytics também fornece suporte integrado para acompanhamento de experiências através de ferramentas como Weights & Biases e Comet ML, criando um fluxo de trabalho sem atritos.
Casos de utilização no mundo real#
- O YOLOv5 destaca-se em ambientes de produção acelerados. A sua exportação simples torna-o a escolha ideal para análise de retalho inteligente, deteção de defeitos de fabrico a alta velocidade e integração em aplicações móveis através do CoreML.
- O DAMO-YOLO é altamente adequado para avaliações académicas rigorosas e cenários onde estão disponíveis vastos recursos computacionais para executar longos ciclos de treino destilado, destinados a obter melhorias fracionárias de mAP para alvos de hardware específicos e fixos.
Casos de uso e recomendações#
A escolha entre YOLOv5 e DAMO-YOLO depende dos requisitos específicos do teu projeto, das restrições de implementação e das tuas preferências de ecossistema.
Quando escolher o YOLOv5#
O YOLOv5 é uma excelente escolha para:
- Sistemas comprovados em produção: Implementações existentes em que o longo historial de estabilidade do YOLOv5, a documentação abrangente e o enorme suporte da comunidade são valorizados.
- Treino com recursos limitados: Ambientes com recursos de GPU limitados, onde o pipeline de treino eficiente do YOLOv5 e os menores requisitos de memória são vantajosos.
- Suporte abrangente a formatos de exportação: Projetos que exigem implementação em vários formatos, incluindo ONNX, TensorRT, CoreML e TFLite.
Quando escolher o DAMO-YOLO#
O DAMO-YOLO é recomendado para:
- Análise de vídeo de elevado débito: Processamento de streams de vídeo com FPS elevado em infraestruturas GPU NVIDIA fixas, nas quais o débito com batch-1 é a principal métrica.
- Linhas de fabrico industrial: Cenários com restrições rigorosas de latência GPU em hardware dedicado, como a inspeção de qualidade em tempo real em linhas de montagem.
- Investigação sobre pesquisa de arquitetura neural: Estudo dos efeitos da pesquisa automatizada de arquiteturas (MAE-NAS) e de backbones eficientemente reparametrizados no desempenho da deteção.
Quando escolher Ultralytics (YOLO26)#
Para a maioria dos projetos novos, o Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência de desenvolvimento:
- Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
- Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
- Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.
A próxima evolução: YOLO26#
Se estás a iniciar um novo projeto, é altamente recomendável olhar para o futuro. O Ultralytics YOLO26 baseia-se na incrível fundação do YOLOv5, incorporando avanços revolucionários que redefinem o estado da arte da IA de visão.
Lançado com aclamação universal, o YOLO26 é nativamente end-to-end. Inclui um design end-to-end sem NMS, eliminando completamente o pós-processamento de supressão não máxima para uma implementação substancialmente mais rápida e simples.
As principais inovações do YOLO26 incluem:
- Otimizador MuSGD: Inspirado nas inovações do treino de LLM, este híbrido de SGD e Muon garante um treino altamente estável e uma convergência rápida.
- Inferência em CPU até 43% mais rápida: Fortemente otimizado para edge computing, tornando-o perfeito para dispositivos IoT que funcionam sem GPUs dedicadas.
- ProgLoss + STAL: Funções de perda avançadas que melhoram drasticamente o reconhecimento de objetos pequenos, algo fundamental para imagens aéreas captadas por drones e robótica.
- Melhorias específicas para cada tarefa: Desde a perda angular especializada para caixas delimitadoras orientadas (OBB) até à Estimativa de Log-Verossimilhança Residual (RLE) para uma estimativa de pose precisa, o YOLO26 lida facilmente com domínios complexos.
Conclusão#
Tanto o YOLOv5 como o DAMO-YOLO consolidaram os seus lugares na história da deteção de objetos. O DAMO-YOLO continua a ser um estudo fascinante sobre Pesquisa Automatizada de Arquitetura e destilação. No entanto, para organizações que dão prioridade a um ecossistema bem mantido, à facilidade de utilização e a um caminho rápido para a produção, os modelos da Ultralytics continuam incomparáveis.
Recomendamos vivamente a utilização da Plataforma Ultralytics para anotar, treinar e implementar a próxima geração de modelos, como o YOLO26, garantindo que o teu pipeline de visão computacional seja preparado para o futuro, rápido e extraordinariamente preciso.