YOLOv5 vs RTDETRv2#
O cenário da visão computacional se expandiu significativamente nos últimos anos, oferecendo aos desenvolvedores uma ampla variedade de arquiteturas para lidar com tarefas visuais complexas. Entre os paradigmas mais populares estão as redes neurais convolucionais (CNNs) e os Transformers de detecção (DETRs).
Este guia apresenta uma comparação técnica aprofundada entre dois modelos fundamentais dessas categorias: Ultralytics YOLOv5, um modelo baseado em CNN altamente eficiente e amplamente adotado, e RTDETRv2, um detector de objetos em tempo real baseado em Transformer e de última geração.
Ultralytics YOLOv5: o padrão do setor em eficiência#
Desde seu lançamento, Ultralytics YOLOv5 tornou-se um pilar da comunidade de IA, impulsionando milhares de aplicações comerciais e projetos de pesquisa em todo o mundo. Desenvolvido inteiramente com o framework PyTorch, o modelo priorizou uma experiência de desenvolvimento intuitiva sem comprometer o desempenho em tempo real.
Principais características:
- Autor: Glenn Jocher
- Organização: Ultralytics
- Data: 2020-06-26
- Links: Repositório no GitHub
Arquitetura e pontos fortes#
YOLOv5 utiliza uma arquitetura CNN simplificada, projetada para maximizar a eficiência da extração de características e manter uma estrutura extremamente leve em termos de memória. O modelo emprega um backbone CSPDarknet e um pescoço PANet, formando uma combinação poderosa para a fusão de características em várias escalas.
Uma das principais vantagens de YOLOv5 é o equilíbrio de desempenho. O modelo oferece um equilíbrio excepcional entre velocidade e precisão, tornando-se uma opção ideal para a implantação de modelos em hardware com recursos limitados, como dispositivos NVIDIA Jetson e smartphones.
Além disso, YOLOv5 oferece versatilidade incomparável. Ao contrário dos modelos restritos à previsão de caixas delimitadoras, YOLOv5 oferece suporte nativo à classificação de imagens e à segmentação de instâncias, proporcionando um framework unificado para diversas tarefas visuais. Sua eficiência de treinamento também é notável: o modelo exige significativamente menos memória CUDA durante o treinamento do que as arquiteturas baseadas em Transformer.
Pontos fracos#
Por se basear em um framework CNN mais antigo, YOLOv5 depende da supressão não máxima (NMS) durante o pós-processamento para eliminar caixas delimitadoras duplicadas. Embora altamente otimizada no framework Ultralytics, a NMS pode ocasionalmente criar gargalos de latência em NPUs de borda especializadas.
RTDETRv2: Transformers em tempo real da Baidu#
RTDETRv2 (Transformer de detecção em tempo real v2) representa um avanço significativo na aplicação de arquiteturas Transformer à detecção de objetos em tempo real, solucionando as ineficiências computacionais que historicamente afetaram os DETRs padrão.
Principais características:
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
- Organização: Baidu
- Data: 2024-07-24
- Links: Artigo no Arxiv, Repositório no GitHub
Arquitetura e pontos fortes#
RTDETRv2 se baseia em seu antecessor e utiliza um codificador híbrido e um design flexível de decodificador para processar imagens. O mecanismo de autoatenção do Transformer proporciona ao modelo uma compreensão global do contexto da imagem, permitindo um desempenho excepcional em cenas complexas com forte oclusão de objetos.
Uma característica marcante do RTDETRv2 é seu design ponta a ponta sem NMS. Ao prever consultas de objetos diretamente, sem exigir caixas delimitadoras de referência nem pós-processamento NMS, o modelo simplifica o pipeline de inferência. Essa arquitetura alcança um mAP (precisão média média) impressionante em conjuntos de dados de benchmark como COCO.
Pontos fracos#
Apesar de suas capacidades em tempo real, RTDETRv2 tem requisitos de memória consideravelmente maiores do que os modelos YOLO. Os mecanismos de atenção dos Transformers crescem quadraticamente com o comprimento da sequência, o que pode causar erros de falta de memória durante o treinamento em alta resolução, a menos que sejam usados grandes clusters de GPU. Além disso, o modelo não oferece a versatilidade imediata do ecossistema Ultralytics e se concentra principalmente na detecção de objetos 2D, sem suporte nativo à segmentação nem à estimativa de pose.
Tabela de comparação de desempenho#
Para avaliar essas arquiteturas de forma objetiva, compilamos as métricas de desempenho. Os valores destacados em negrito representam as métricas mais eficientes ou de melhor desempenho entre as escalas testadas.
| Modelo | tamanho (pixels) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Embora RTDETRv2-x alcance o mAP absoluto mais alto, exige aproximadamente 40 vezes mais parâmetros que YOLOv5n. Para aplicações de alta velocidade executadas em hardware limitado, os modelos Ultralytics oferecem consistentemente a melhor eficiência computacional.
A vantagem do ecossistema Ultralytics#
Ao passar de um notebook de pesquisa para um ambiente de produção, o software que envolve o modelo é tão importante quanto a arquitetura da rede neural. O Ecossistema Bem Mantido oferecido pela Ultralytics acelera drasticamente o ciclo de desenvolvimento.
Facilidade de uso incomparável#
Os modelos Ultralytics priorizam uma experiência de utilização incrivelmente simplificada. Quer queiras treinar um modelo personalizado, executar a validação ou exportar para formatos específicos de hardware, como TensorRT ou ONNX, a API Python da Ultralytics permite fazê-lo com apenas algumas linhas de código.
Aqui está um exemplo prático de código que mostra como é simples treinar e executar inferência com um modelo Ultralytics:
from ultralytics import YOLO
# Inicializa o modelo (os pesos são transferidos automaticamente)
model = YOLO("yolov5su.pt") # YOLOv5u: pesos YOLOv5 sem âncoras para o pacote ultralytics
# Treina o modelo com o conjunto de dados COCO8
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")
# Executa a inferência numa imagem online
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")
# Apresenta a imagem resultante com caixas delimitadoras
inference_results[0].show()Esta API unificada e simples oferece suporte nativo a integrações de acompanhamento de experimentos com ferramentas como Weights & Biases e Comet, permitindo que os programadores registem métricas sem dificuldades, sem escrever código repetitivo e complexo.
Casos de uso e recomendações#
A escolha entre YOLOv5 e RT-DETR depende dos requisitos específicos do teu projeto, das restrições de implementação e das preferências de ecossistema.
Quando escolher o YOLOv5#
O YOLOv5 é uma ótima opção para:
- Sistemas de produção comprovados: implantações existentes em que são valorizados o longo histórico de estabilidade do YOLOv5, sua documentação abrangente e o enorme suporte da comunidade.
- Treinamento com recursos limitados: ambientes com recursos de GPU limitados, nos quais o pipeline de treinamento eficiente e os menores requisitos de memória do YOLOv5 são vantajosos.
- Amplo suporte a formatos de exportação: projetos que exigem implantação em vários formatos, incluindo ONNX, TensorRT, CoreML e LiteRT.
Quando escolher o RT-DETR#
O RT-DETR é recomendado para:
- Pesquisa em detecção baseada em Transformer: Projetos que exploram mecanismos de atenção e arquiteturas Transformer para detecção de objetos ponta a ponta sem NMS.
- Cenários de alta precisão com latência flexível: Aplicações em que a precisão da detecção é a prioridade máxima e uma latência de inferência um pouco maior é aceitável.
- Detecção de objetos grandes: Cenas com objetos predominantemente médios ou grandes, nas quais o mecanismo de atenção global dos Transformers oferece uma vantagem natural.
Quando escolher Ultralytics (YOLO26)#
Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:
- Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
- Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
- Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.
Perspetivas futuras: YOLO11 e YOLO26#
Se estiveres a começar hoje um novo projeto de visão computacional, recomendamos vivamente que explores as gerações mais recentes de modelos Ultralytics.
Embora YOLOv5 continue a ser incrivelmente fiável, YOLO11 oferece maior precisão e um conjunto alargado de tarefas, incluindo a deteção de caixas delimitadoras orientadas (OBB).
Mais importante ainda, o avançado YOLO26 combina o melhor dos dois mundos. Implementa um Design sem NMS de ponta a ponta (criado inicialmente em YOLOv10), eliminando a sobrecarga do pós-processamento e mantendo a eficiência de uma CNN. YOLO26 também introduz o Otimizador MuSGD, inspirado nas inovações do treino de LLM, para uma convergência mais rápida. Com a Remoção de DFL (a Distribution Focal Loss foi removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de borda e de baixo consumo), YOLO26 proporciona Inferência na CPU até 43% mais rápida, tornando-o a melhor opção para IA de borda. Além disso, ProgLoss + STAL oferece funções de perda melhoradas, com avanços notáveis no reconhecimento de objetos pequenos, essencial para IoT, robótica e imagens aéreas.
Conclusão#
A escolha entre YOLOv5 e RTDETRv2 depende muito das tuas restrições de implementação. RTDETRv2 eleva os limites de mAP com mecanismos poderosos de atenção Transformer, mas tem um custo elevado em memória e processamento.
Em contrapartida, o Ultralytics YOLOv5 oferece uma solução comprovada, altamente otimizada e versátil, que funciona sem problemas em qualquer ambiente — desde servidores na nuvem até microcontroladores. Para as equipas que procuram a maior precisão possível e ferramentas de implementação sem complicações, a atualização para YOLO26 no ecossistema Ultralytics oferece a solução definitiva de ponta para aplicações modernas de IA de visão.