Ultralytics YOLO27:
Get Started

RTDETRv2 vs EfficientDet#

Selecionar a arquitetura de rede neural ideal é uma decisão determinante para qualquer projeto de visão computacional. Esta comparação técnica abrangente analisa dois modelos influentes de detecção de objetos: RTDETRv2, um detector de ponta baseado em Transformer, e EfficientDet, uma rede neural convolucional altamente escalável. Vamos avaliar suas arquiteturas distintas, métricas de desempenho, metodologias de treinamento e cenários ideais de implantação para ajudar-te a tomar decisões orientadas por dados para teus pipelines de IA.

RTDETRv2: o Transformer de detecção em tempo real#

Com base no sucesso do RT-DETR original, RTDETRv2 aprimora o paradigma de detecção de objetos baseado em Transformer. Ao otimizar as estruturas do codificador e do decodificador, ele oferece alta precisão e mantém velocidades de inferência em tempo real, preenchendo efetivamente a lacuna entre as CNNs tradicionais e os Transformers de visão.

Detalhes do modelo

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
  • Organização: Baidu
  • Data: 2024-07-24
  • Links: Arxiv, GitHub, Documentação

Arquitetura e principais pontos fortes#

RTDETRv2 utiliza uma arquitetura híbrida que combina um backbone CNN potente (geralmente ResNet ou HGNet) com um decodificador Transformer eficiente. A característica mais marcante do RTDETRv2 é sua capacidade nativa de dispensar a supressão não máxima (NMS). Os detectores tradicionais precisam da NMS para filtrar caixas delimitadoras duplicadas, o que adiciona latência de inferência variável durante o pós-processamento. RTDETRv2 formula a detecção como um problema direto de previsão de conjuntos, usando correspondência bipartida para gerar previsões únicas.

Esse modelo se destaca em implantações em servidores, onde há bastante memória de GPU. Seu mecanismo de atenção global oferece percepção contextual excepcional, tornando-o muito eficaz para separar objetos sobrepostos em ambientes densos e congestionados, como sistemas automatizados de alarme de segurança ou monitoramento de multidões.

Limitações#

Embora poderosas, as arquiteturas Transformer exigem inerentemente mais memória CUDA durante o treinamento do que as CNNs padrão. Além disso, o ajuste fino do RTDETRv2 pode exigir tempos de convergência prolongados dos dados de treinamento, tornando a prototipagem rápida um pouco mais intensiva em recursos.

Saiba mais sobre o RTDETRv2

EfficientDet: CNNs escaláveis e eficientes#

EfficientDet introduziu uma família de modelos de detecção de objetos otimizados tanto para precisão quanto para eficiência em uma ampla variedade de restrições de recursos. Ele continua sendo um exemplo clássico de projeto escalável de visão de máquina.

Detalhes do modelo

Arquitetura e principais pontos fortes#

A inovação por trás do EfficientDet está em duas áreas principais: a rede de pirâmide de características bidirecional (BiFPN) e um método de escalonamento composto. A BiFPN permite uma extração de características multiescala simples e rápida, introduzindo pesos aprendíveis para determinar a importância de diferentes características de entrada e aplicando repetidamente a fusão de características multiescala de cima para baixo e de baixo para cima. O método de escalonamento composto ajusta uniformemente, ao mesmo tempo, a resolução, a profundidade e a largura da rede.

Os modelos EfficientDet vão do ultraleve D0 ao enorme D7. Isso os torna altamente versáteis para implantações de IA de borda, nas quais os desenvolvedores precisam equilibrar orçamentos computacionais restritos com requisitos de precisão, como nas primeiras aplicações de realidade aumentada para dispositivos móveis.

Limitações#

EfficientDet é uma arquitetura mais antiga que depende muito de caixas-âncora e do pipeline tradicional de pós-processamento NMS. O processo de geração de âncoras exige ajuste cuidadoso de hiperparâmetros, e a etapa NMS pode se tornar um gargalo na implantação em hardware embarcado, como um Raspberry Pi. Também não oferece suporte nativo a tarefas modernas, como estimativa de pose ou caixas delimitadoras orientadas (OBB).

Sabe mais sobre o EfficientDet

Comparação de desempenho e métricas#

Para compreender as vantagens e desvantagens exatas entre esses modelos, é preciso analisar a taxa de transferência e a eficiência em relação à quantidade de parâmetros. A tabela abaixo mostra como a moderna série RTDETRv2 se compara à família escalável EfficientDet.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Como mostrado acima, RTDETRv2 iguala ou supera a precisão média (mAP) de modelos EfficientDet de tamanho semelhante, sendo muito mais rápido na GPU (por exemplo, 53,4 mAP em 9,76 ms para RTDETRv2-l, contra 52,6 mAP em 89,29 ms para EfficientDet-d6), aproveitando intensamente sua arquitetura Transformer para aumentar a precisão.

Casos de uso e recomendações#

A escolha entre RT-DETR e EfficientDet depende dos requisitos específicos do teu projeto, das restrições de implantação e das preferências de ecossistema.

Quando escolher o RT-DETR#

O RT-DETR é uma ótima opção para:

  • Pesquisa em detecção baseada em Transformer: Projetos que exploram mecanismos de atenção e arquiteturas Transformer para detecção de objetos ponta a ponta sem NMS.
  • Cenários de alta precisão com latência flexível: Aplicações em que a precisão da detecção é a prioridade máxima e uma latência de inferência um pouco maior é aceitável.
  • Detecção de objetos grandes: Cenas com objetos predominantemente médios ou grandes, nas quais o mecanismo de atenção global dos Transformers oferece uma vantagem natural.

Quando escolher o EfficientDet#

O EfficientDet é recomendado para:

  • Pipelines do Google Cloud e TPU: Sistemas profundamente integrados com as APIs do Google Cloud Vision ou com a infraestrutura TPU, onde o EfficientDet dispõe de otimizações nativas.
  • Investigação sobre escalonamento composto: Avaliação comparativa académica centrada no estudo dos efeitos do escalonamento equilibrado da profundidade, largura e resolução da rede.
  • Implementação móvel através do LiteRT: Projetos que exigem especificamente a exportação para LiteRT (anteriormente TensorFlow Lite) para Android ou dispositivos Linux integrados.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

A alternativa da Ultralytics: avançando o estado da arte#

Embora RTDETRv2 e EfficientDet tenham méritos importantes, o desenvolvimento moderno de IA exige estruturas que ofereçam uma experiência de desenvolvimento fluida, aliada a um desempenho de ponta. O ecossistema Ultralytics oferece uma abordagem significativamente mais simplificada para tarefas de visão computacional.

Se estás a explorar deteção de última geração, o recém-lançado Ultralytics YOLO26 combina os melhores aspetos das CNNs e dos transformers.

Por que escolher YOLO26?

O YOLO26 implementa um design opcional de ponta a ponta sem NMS (nms=False), trazendo a simplicidade de implementação do RTDETRv2 para a arquitetura YOLO ultr eficiente. Além disso, introduz o otimizador MuSGD — inspirado nas inovações de treino de LLMs — para uma estabilidade de treino superior. Com a remoção de DFL (Distribution Focal Loss removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de baixo consumo e de edge), o YOLO26 oferece inferência na CPU até 43% mais rápida do que as gerações anteriores, o que o torna uma opção excecional para computação de edge em comparação com modelos mais pesados. Além disso, ProgLoss + STAL proporciona funções de perda melhoradas, com avanços notáveis no reconhecimento de objetos pequenos, algo essencial para IoT, robótica e imagens aéreas.

A facilidade de utilização proporcionada pelo pacote Python da Ultralytics é incomparável. Os programadores podem treinar, validar e exportar modelos através de uma API intuitiva que abstrai o código repetitivo normalmente exigido pelos repositórios de investigação.

from ultralytics import RTDETR

# Carrega um modelo RT-DETR pré-treinado do ecossistema Ultralytics
model = RTDETR("rtdetr-l.pt")

# Treina o modelo com o conjunto de dados COCO8
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Exporta para inferência otimizada no TensorRT
model.export(format="engine")

Os modelos Ultralytics suportam nativamente várias tarefas, incluindo segmentação de instâncias e classificação de imagens, disponibilizando um conjunto de ferramentas versátil para diversas necessidades do setor. Além disso, a remoção de Distribution Focal Loss (DFL) nos modelos modernos da Ultralytics simplifica o grafo computacional, garantindo uma exportação mais fluida para NPUs e TPUs integradas.

Para uma anotação de dados e gestão de modelos sem complicações, a Ultralytics Platform oferece um ambiente abrangente na cloud para supervisionar todo o ciclo de vida do machine learning, tornando-se a opção de referência para implementar soluções robustas de visão computacional em produção.

Comentários