Ultralytics YOLO27:

YOLOv5 vs RTDETRv2#

O panorama da visão computacional expandiu-se significativamente nos últimos anos, oferecendo aos programadores uma vasta gama de arquiteturas para abordar tarefas visuais complexas. Entre os paradigmas mais populares encontram-se as Redes neuronais convolucionais (CNNs) e os Transformers de deteção (DETRs).

Este guia fornece uma comparação técnica aprofundada entre dois modelos fundamentais destas categorias: Ultralytics YOLOv5, um modelo baseado em CNN altamente eficiente e amplamente adotado, e o RTDETRv2, um detetor de objetos em tempo real baseado em Transformer de última geração.

Ultralytics YOLOv5: o padrão da indústria em eficiência#

Desde o seu lançamento, o Ultralytics YOLOv5 tornou-se uma referência na comunidade de IA, suportando milhares de aplicações comerciais e projetos de investigação em todo o mundo. Desenvolvido inteiramente com base no framework PyTorch, priorizou uma experiência intuitiva para programadores sem comprometer o desempenho em tempo real.

Características principais:

Arquitetura e pontos fortes#

O YOLOv5 utiliza uma arquitetura CNN otimizada, concebida para maximizar a eficiência da extração de caraterísticas enquanto mantém uma utilização de memória extremamente reduzida. Emprega um backbone CSPDarknet e um neck PANet, criando uma combinação poderosa para a fusão de caraterísticas em várias escalas.

Uma das principais vantagens do YOLOv5 é o seu Equilíbrio de desempenho. Estabelece um compromisso excecional entre velocidade e precisão, tornando-o uma escolha ideal para a implementação de modelos em hardware com recursos limitados, como dispositivos NVIDIA Jetson e smartphones.

Além disso, o YOLOv5 destaca-se pela sua Versatilidade incomparável. Ao contrário dos modelos estritamente limitados a previsões de caixas delimitadoras, o YOLOv5 suporta nativamente a classificação de imagens e a segmentação de instâncias, fornecendo um framework unificado para várias tarefas visuais. A sua eficiência de treino também é notável, exigindo significativamente menos memória CUDA durante o treino em comparação com arquiteturas baseadas em Transformer.

Pontos fracos#

Por depender de um framework CNN mais antigo, o YOLOv5 depende inerentemente da Supressão não máxima (NMS) durante o pós-processamento para eliminar caixas delimitadoras duplicadas. Embora altamente otimizada no framework Ultralytics, a NMS pode ocasionalmente introduzir estrangulamentos de latência em NPU de edge especializadas.

RTDETRv2: Transformers em tempo real da Baidu#

O RTDETRv2 (Transformer de deteção em tempo real v2) representa um avanço significativo na aplicação de arquiteturas Transformer à deteção de objetos em tempo real, solucionando as ineficiências computacionais que historicamente afetavam os DETRs padrão.

Características principais:

Arquitetura e pontos fortes#

O RTDETRv2 baseia-se no seu antecessor, utilizando um codificador híbrido e um design de descodificador flexível para processar imagens. O mecanismo de autoatenção do Transformer proporciona ao modelo uma compreensão global do contexto da imagem, permitindo-lhe ter um desempenho excecional em cenas complexas com forte oclusão de objetos.

Uma caraterística definidora do RTDETRv2 é o seu design de ponta a ponta sem NMS. Ao prever consultas de objetos diretamente, sem exigir anchor boxes ou pós-processamento NMS, simplifica o pipeline de inferência. Esta arquitetura alcança um mAP (precisão média) impressionante em conjuntos de dados de referência como o COCO.

Pontos fracos#

Apesar das suas capacidades em tempo real, o RTDETRv2 tem requisitos de memória significativamente superiores aos dos modelos YOLO. Os mecanismos de atenção dos Transformers escalam quadraticamente com o comprimento da sequência, o que pode causar erros de memória insuficiente durante o treino de alta resolução, a menos que sejam utilizados enormes clusters de GPU. Além disso, não oferece a versatilidade pronta a utilizar do ecossistema Ultralytics, concentrando-se principalmente apenas na deteção de objetos 2D, sem suporte nativo para segmentação ou estimativa de pose.

Sabe mais sobre o RT-DETR

Tabela de comparação de desempenho#

Para avaliar objetivamente estas arquiteturas, compilámos as respetivas métricas de desempenho. Os valores destacados a negrito representam as métricas mais eficientes ou com melhor desempenho nas escalas testadas.

Modelotamanho
(píxeis)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
Contexto do desempenho

Embora o RTDETRv2-x alcance o mAP absoluto mais elevado, requer quase 30 vezes mais parâmetros do que o YOLOv5n. Para aplicações de alta velocidade executadas em hardware limitado, os modelos Ultralytics oferecem consistentemente a melhor eficiência computacional.

A vantagem do ecossistema Ultralytics#

Ao transferir um modelo de um notebook de investigação para um ambiente de produção, o software que envolve o modelo é tão importante como a arquitetura da rede neuronal. O Ecossistema bem mantido fornecido pela Ultralytics acelera significativamente o ciclo de desenvolvimento.

Facilidade de utilização incomparável#

Os modelos Ultralytics priorizam uma experiência de utilização extremamente simplificada. Quer queiras treinar um modelo personalizado, executar uma validação ou exportar para formatos específicos de hardware, como TensorRT ou ONNX, a API Python da Ultralytics torna tudo possível com apenas algumas linhas de código.

Eis um exemplo prático de código que demonstra como é simples treinar e executar inferência com um modelo Ultralytics:

from ultralytics import YOLO

# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
inference_results[0].show()

Esta API simples e unificada suporta nativamente integrações de acompanhamento de experiências com ferramentas como Weights & Biases e Comet, permitindo aos programadores registar métricas sem problemas, sem escrever código boilerplate complexo.

Casos de uso e recomendações#

A escolha entre YOLOv5 e RT-DETR depende dos requisitos específicos do teu projeto, das restrições de implementação e das preferências relativamente ao ecossistema.

Quando escolher o YOLOv5#

O YOLOv5 é uma excelente escolha para:

  • Sistemas comprovados em produção: Implementações existentes em que o longo historial de estabilidade do YOLOv5, a documentação abrangente e o enorme suporte da comunidade são valorizados.
  • Treino com recursos limitados: Ambientes com recursos de GPU limitados, onde o pipeline de treino eficiente do YOLOv5 e os menores requisitos de memória são vantajosos.
  • Suporte abrangente a formatos de exportação: Projetos que exigem implementação em vários formatos, incluindo ONNX, TensorRT, CoreML e TFLite.

Quando escolher o RT-DETR#

O RT-DETR é recomendado para:

  • Investigação sobre detecção baseada em Transformer: projetos que exploram mecanismos de atenção e arquiteturas Transformer para detecção de objetos de ponta a ponta sem NMS.
  • Cenários de elevada precisão com latência flexível: aplicações em que a precisão da detecção é a prioridade máxima e uma latência de inferência ligeiramente superior é aceitável.
  • Detecção de objetos grandes: cenas compostas principalmente por objetos médios a grandes, nas quais o mecanismo de atenção global dos Transformer oferece uma vantagem natural.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, o Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência de desenvolvimento:

  • Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.

O futuro: YOLO11 e YOLO26#

Se estás a iniciar hoje um novo projeto de visão, é altamente recomendável explorar as gerações mais recentes de modelos Ultralytics.

Embora o YOLOv5 continue a ser extremamente fiável, o YOLO11 oferece maior precisão e um conjunto alargado de tarefas, incluindo a deteção de Caixas delimitadoras orientadas (OBB).

Ainda mais importante, o YOLO26 combina o melhor dos dois mundos. Implementa um Design de ponta a ponta sem NMS (pioneiro no YOLOv10), eliminando a sobrecarga do pós-processamento e mantendo a eficiência de uma CNN. O YOLO26 também introduz o Otimizador MuSGD, inspirado nas inovações do treino de LLM, para uma convergência mais rápida. Com a Remoção de DFL (Distribution Focal Loss removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de edge e de baixo consumo), o YOLO26 proporciona uma Inferência em CPU até 43% mais rápida, tornando-o a melhor escolha absoluta para IA de edge. Além disso, ProgLoss + STAL fornece funções de perda melhoradas, com melhorias notáveis no reconhecimento de objetos pequenos, algo fundamental para IoT, robótica e imagens aéreas.

Conclusão#

A escolha entre YOLOv5 e RTDETRv2 depende fortemente das tuas restrições de implementação. O RTDETRv2 ultrapassa os limites do mAP utilizando mecanismos poderosos de atenção Transformer, mas implica custos elevados de memória e sobrecarga computacional.

Por outro lado, o Ultralytics YOLOv5 oferece uma solução comprovada, altamente otimizada e versátil, que funciona sem problemas em qualquer lugar — desde servidores na cloud até microcontroladores. Para equipas que procuram a maior precisão possível juntamente com ferramentas de implementação integradas, a atualização dentro do ecossistema Ultralytics para o YOLO26 fornece a solução de última geração definitiva para aplicações modernas de IA de visão.

Comentários