YOLOv5 vs RTDETRv2#
O panorama da visão computacional expandiu-se significativamente nos últimos anos, oferecendo aos programadores uma vasta gama de arquiteturas para abordar tarefas visuais complexas. Entre os paradigmas mais populares encontram-se as Redes neuronais convolucionais (CNNs) e os Transformers de deteção (DETRs).
Este guia fornece uma comparação técnica aprofundada entre dois modelos fundamentais destas categorias: Ultralytics YOLOv5, um modelo baseado em CNN altamente eficiente e amplamente adotado, e o RTDETRv2, um detetor de objetos em tempo real baseado em Transformer de última geração.
Ultralytics YOLOv5: o padrão da indústria em eficiência#
Desde o seu lançamento, o Ultralytics YOLOv5 tornou-se uma referência na comunidade de IA, suportando milhares de aplicações comerciais e projetos de investigação em todo o mundo. Desenvolvido inteiramente com base no framework PyTorch, priorizou uma experiência intuitiva para programadores sem comprometer o desempenho em tempo real.
Características principais:
- Autor: Glenn Jocher
- Organização: Ultralytics
- Data: 2020-06-26
- Ligações: Repositório no GitHub
Arquitetura e pontos fortes#
O YOLOv5 utiliza uma arquitetura CNN otimizada, concebida para maximizar a eficiência da extração de caraterísticas enquanto mantém uma utilização de memória extremamente reduzida. Emprega um backbone CSPDarknet e um neck PANet, criando uma combinação poderosa para a fusão de caraterísticas em várias escalas.
Uma das principais vantagens do YOLOv5 é o seu Equilíbrio de desempenho. Estabelece um compromisso excecional entre velocidade e precisão, tornando-o uma escolha ideal para a implementação de modelos em hardware com recursos limitados, como dispositivos NVIDIA Jetson e smartphones.
Além disso, o YOLOv5 destaca-se pela sua Versatilidade incomparável. Ao contrário dos modelos estritamente limitados a previsões de caixas delimitadoras, o YOLOv5 suporta nativamente a classificação de imagens e a segmentação de instâncias, fornecendo um framework unificado para várias tarefas visuais. A sua eficiência de treino também é notável, exigindo significativamente menos memória CUDA durante o treino em comparação com arquiteturas baseadas em Transformer.
Pontos fracos#
Por depender de um framework CNN mais antigo, o YOLOv5 depende inerentemente da Supressão não máxima (NMS) durante o pós-processamento para eliminar caixas delimitadoras duplicadas. Embora altamente otimizada no framework Ultralytics, a NMS pode ocasionalmente introduzir estrangulamentos de latência em NPU de edge especializadas.
RTDETRv2: Transformers em tempo real da Baidu#
O RTDETRv2 (Transformer de deteção em tempo real v2) representa um avanço significativo na aplicação de arquiteturas Transformer à deteção de objetos em tempo real, solucionando as ineficiências computacionais que historicamente afetavam os DETRs padrão.
Características principais:
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
- Organização: Baidu
- Data: 2024-07-24
- Ligações: Artigo no Arxiv, Repositório no GitHub
Arquitetura e pontos fortes#
O RTDETRv2 baseia-se no seu antecessor, utilizando um codificador híbrido e um design de descodificador flexível para processar imagens. O mecanismo de autoatenção do Transformer proporciona ao modelo uma compreensão global do contexto da imagem, permitindo-lhe ter um desempenho excecional em cenas complexas com forte oclusão de objetos.
Uma caraterística definidora do RTDETRv2 é o seu design de ponta a ponta sem NMS. Ao prever consultas de objetos diretamente, sem exigir anchor boxes ou pós-processamento NMS, simplifica o pipeline de inferência. Esta arquitetura alcança um mAP (precisão média) impressionante em conjuntos de dados de referência como o COCO.
Pontos fracos#
Apesar das suas capacidades em tempo real, o RTDETRv2 tem requisitos de memória significativamente superiores aos dos modelos YOLO. Os mecanismos de atenção dos Transformers escalam quadraticamente com o comprimento da sequência, o que pode causar erros de memória insuficiente durante o treino de alta resolução, a menos que sejam utilizados enormes clusters de GPU. Além disso, não oferece a versatilidade pronta a utilizar do ecossistema Ultralytics, concentrando-se principalmente apenas na deteção de objetos 2D, sem suporte nativo para segmentação ou estimativa de pose.
Tabela de comparação de desempenho#
Para avaliar objetivamente estas arquiteturas, compilámos as respetivas métricas de desempenho. Os valores destacados a negrito representam as métricas mais eficientes ou com melhor desempenho nas escalas testadas.
| Modelo | tamanho (píxeis) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Embora o RTDETRv2-x alcance o mAP absoluto mais elevado, requer quase 30 vezes mais parâmetros do que o YOLOv5n. Para aplicações de alta velocidade executadas em hardware limitado, os modelos Ultralytics oferecem consistentemente a melhor eficiência computacional.
A vantagem do ecossistema Ultralytics#
Ao transferir um modelo de um notebook de investigação para um ambiente de produção, o software que envolve o modelo é tão importante como a arquitetura da rede neuronal. O Ecossistema bem mantido fornecido pela Ultralytics acelera significativamente o ciclo de desenvolvimento.
Facilidade de utilização incomparável#
Os modelos Ultralytics priorizam uma experiência de utilização extremamente simplificada. Quer queiras treinar um modelo personalizado, executar uma validação ou exportar para formatos específicos de hardware, como TensorRT ou ONNX, a API Python da Ultralytics torna tudo possível com apenas algumas linhas de código.
Eis um exemplo prático de código que demonstra como é simples treinar e executar inferência com um modelo Ultralytics:
from ultralytics import YOLO
# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")
# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the resulting image with bounding boxes
inference_results[0].show()Esta API simples e unificada suporta nativamente integrações de acompanhamento de experiências com ferramentas como Weights & Biases e Comet, permitindo aos programadores registar métricas sem problemas, sem escrever código boilerplate complexo.
Casos de uso e recomendações#
A escolha entre YOLOv5 e RT-DETR depende dos requisitos específicos do teu projeto, das restrições de implementação e das preferências relativamente ao ecossistema.
Quando escolher o YOLOv5#
O YOLOv5 é uma excelente escolha para:
- Sistemas comprovados em produção: Implementações existentes em que o longo historial de estabilidade do YOLOv5, a documentação abrangente e o enorme suporte da comunidade são valorizados.
- Treino com recursos limitados: Ambientes com recursos de GPU limitados, onde o pipeline de treino eficiente do YOLOv5 e os menores requisitos de memória são vantajosos.
- Suporte abrangente a formatos de exportação: Projetos que exigem implementação em vários formatos, incluindo ONNX, TensorRT, CoreML e TFLite.
Quando escolher o RT-DETR#
O RT-DETR é recomendado para:
- Investigação sobre detecção baseada em Transformer: projetos que exploram mecanismos de atenção e arquiteturas Transformer para detecção de objetos de ponta a ponta sem NMS.
- Cenários de elevada precisão com latência flexível: aplicações em que a precisão da detecção é a prioridade máxima e uma latência de inferência ligeiramente superior é aceitável.
- Detecção de objetos grandes: cenas compostas principalmente por objetos médios a grandes, nas quais o mecanismo de atenção global dos Transformer oferece uma vantagem natural.
Quando escolher Ultralytics (YOLO26)#
Para a maioria dos projetos novos, o Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência de desenvolvimento:
- Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
- Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
- Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.
O futuro: YOLO11 e YOLO26#
Se estás a iniciar hoje um novo projeto de visão, é altamente recomendável explorar as gerações mais recentes de modelos Ultralytics.
Embora o YOLOv5 continue a ser extremamente fiável, o YOLO11 oferece maior precisão e um conjunto alargado de tarefas, incluindo a deteção de Caixas delimitadoras orientadas (OBB).
Ainda mais importante, o YOLO26 combina o melhor dos dois mundos. Implementa um Design de ponta a ponta sem NMS (pioneiro no YOLOv10), eliminando a sobrecarga do pós-processamento e mantendo a eficiência de uma CNN. O YOLO26 também introduz o Otimizador MuSGD, inspirado nas inovações do treino de LLM, para uma convergência mais rápida. Com a Remoção de DFL (Distribution Focal Loss removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de edge e de baixo consumo), o YOLO26 proporciona uma Inferência em CPU até 43% mais rápida, tornando-o a melhor escolha absoluta para IA de edge. Além disso, ProgLoss + STAL fornece funções de perda melhoradas, com melhorias notáveis no reconhecimento de objetos pequenos, algo fundamental para IoT, robótica e imagens aéreas.
Conclusão#
A escolha entre YOLOv5 e RTDETRv2 depende fortemente das tuas restrições de implementação. O RTDETRv2 ultrapassa os limites do mAP utilizando mecanismos poderosos de atenção Transformer, mas implica custos elevados de memória e sobrecarga computacional.
Por outro lado, o Ultralytics YOLOv5 oferece uma solução comprovada, altamente otimizada e versátil, que funciona sem problemas em qualquer lugar — desde servidores na cloud até microcontroladores. Para equipas que procuram a maior precisão possível juntamente com ferramentas de implementação integradas, a atualização dentro do ecossistema Ultralytics para o YOLO26 fornece a solução de última geração definitiva para aplicações modernas de IA de visão.