Ultralytics YOLO27:

RTDETRv2 vs EfficientDet#

Selecionar a arquitetura de rede neural ideal é uma decisão determinante para qualquer projeto de visão computacional. Esta comparação técnica abrangente analisa em detalhe dois modelos influentes de deteção de objetos: o RTDETRv2, um detetor baseado em Transformer de última geração, e o EfficientDet, uma rede neural convolucional altamente escalável. Avaliaremos as suas arquiteturas distintas, métricas de desempenho, metodologias de treino e cenários ideais de implementação para te ajudar a tomar decisões baseadas em dados para os teus pipelines de IA.

RTDETRv2: o Transformer de Deteção em Tempo Real#

Com base no sucesso do RT-DETR original, o RTDETRv2 aperfeiçoa o paradigma de deteção de objetos baseado em Transformer. Ao otimizar as estruturas do codificador e do descodificador, oferece elevada precisão, mantendo velocidades de inferência em tempo real e colmatando eficazmente a lacuna entre as CNNs tradicionais e os Transformers de visão.

Detalhes do modelo

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
  • Organização: Baidu
  • Data: 2024-07-24
  • Ligações: Arxiv, GitHub, Documentação

Arquitetura e principais pontos fortes#

O RTDETRv2 utiliza uma arquitetura híbrida que combina um potente backbone CNN (frequentemente ResNet ou HGNet) com um descodificador Transformer eficiente. A característica mais marcante do RTDETRv2 é a sua capacidade nativa de ignorar a supressão não máxima (NMS). Os detetores tradicionais precisam de NMS para filtrar caixas delimitadoras duplicadas, introduzindo uma latência de inferência variável durante o pós-processamento. O RTDETRv2 formula a deteção como um problema de predição direta de conjuntos, utilizando correspondência bipartida para produzir predições únicas.

Este modelo destaca-se em implementações no lado do servidor, onde a memória da GPU é abundante. O seu mecanismo de atenção global proporciona uma perceção excecional do contexto, tornando-o altamente eficaz na separação de objetos sobrepostos em ambientes densos e desorganizados, como sistemas automatizados de alarme de segurança ou monitorização de multidões.

Limitações#

Embora sejam poderosas, as arquiteturas Transformer exigem inerentemente mais memória CUDA durante o treino do que as CNNs padrão. Além disso, o ajuste fino do RTDETRv2 pode exigir tempos de convergência mais longos dos dados de treino, tornando a prototipagem rápida ligeiramente mais exigente em termos de recursos.

Saiba mais sobre o RTDETRv2

EfficientDet: CNNs escaláveis e eficientes#

O EfficientDet introduziu uma família de modelos de deteção de objetos otimizados tanto para a precisão como para a eficiência, abrangendo um amplo espetro de restrições de recursos. Continua a ser um exemplo clássico de design escalável de visão por computador.

Detalhes do modelo

Arquitetura e principais pontos fortes#

A inovação por detrás do EfficientDet reside em duas áreas fundamentais: a Rede de Pirâmide de Características Bidirecional (BiFPN) e um método de escalonamento composto. A BiFPN permite uma extração de características simples e rápida em várias escalas, introduzindo pesos aprendíveis para determinar a importância de diferentes características de entrada e aplicando repetidamente a fusão de características em várias escalas de cima para baixo e de baixo para cima. O método de escalonamento composto ajusta uniformemente e em simultâneo a resolução, a profundidade e a largura da rede.

Os modelos EfficientDet vão do D0 ultraleve ao D7 de grandes dimensões. Isto torna-os altamente versáteis para implementações de IA na periferia, onde os programadores têm de equilibrar orçamentos computacionais limitados com requisitos de precisão, como nas primeiras aplicações móveis de realidade aumentada.

Limitações#

O EfficientDet é uma arquitetura mais antiga que depende fortemente de caixas âncora e do pipeline tradicional de pós-processamento NMS. O processo de geração de âncoras exige um ajuste cuidadoso dos hiperparâmetros, e a etapa NMS pode tornar-se um gargalo na implementação em hardware incorporado, como um Raspberry Pi. Também não oferece suporte nativo para tarefas modernas, como estimativa de pose ou caixas delimitadoras orientadas (OBB).

Saiba mais sobre o EfficientDet

Comparação de desempenho e métricas#

Compreender as vantagens e desvantagens exatas entre estes modelos exige analisar o seu débito e a eficiência dos parâmetros. A tabela abaixo apresenta uma comparação entre a moderna série RTDETRv2 e a família escalável EfficientDet.

Modelotamanho
(píxeis)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

Como se pode ver acima, o RTDETRv2 alcança uma média da precisão média (mAP) significativamente superior com uma quantidade de parâmetros comparável à dos modelos EfficientDet de gama média, utilizando intensivamente a sua arquitetura Transformer para aumentar a precisão.

Casos de uso e recomendações#

A escolha entre RT-DETR e EfficientDet depende dos requisitos específicos do teu projeto, das restrições de implementação e das preferências do ecossistema.

Quando escolher o RT-DETR#

O RT-DETR é uma escolha sólida para:

  • Investigação sobre detecção baseada em Transformer: projetos que exploram mecanismos de atenção e arquiteturas Transformer para detecção de objetos de ponta a ponta sem NMS.
  • Cenários de elevada precisão com latência flexível: aplicações em que a precisão da detecção é a prioridade máxima e uma latência de inferência ligeiramente superior é aceitável.
  • Detecção de objetos grandes: cenas compostas principalmente por objetos médios a grandes, nas quais o mecanismo de atenção global dos Transformer oferece uma vantagem natural.

Quando escolher o EfficientDet#

O EfficientDet é recomendado para:

  • Pipelines Google Cloud e TPU: Sistemas profundamente integrados com as APIs Google Cloud Vision ou com uma infraestrutura TPU, onde o EfficientDet tem otimização nativa.
  • Investigação sobre escalabilidade composta: Avaliação académica centrada no estudo dos efeitos do escalamento equilibrado da profundidade, largura e resolução da rede.
  • Implementação móvel através de TFLite: Projetos que exigem especificamente a exportação para TensorFlow Lite para Android ou dispositivos Linux incorporados.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, o Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência de desenvolvimento:

  • Implantação em dispositivos de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência sem a complexidade do pós-processamento de Supressão de Não-Máximos.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência em CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas capturadas por drones ou análise de sensores de IoT, nos quais ProgLoss e STAL aumentam significativamente a precisão em objetos minúsculos.

A alternativa da Ultralytics: a avançar o estado da arte#

Embora tanto o RTDETRv2 como o EfficientDet tenham méritos significativos, o desenvolvimento moderno de IA exige frameworks que ofereçam uma experiência de desenvolvimento fluida, aliada a um desempenho de vanguarda. O ecossistema Ultralytics proporciona uma abordagem significativamente mais simplificada às tarefas de visão computacional.

Se estás a explorar deteção de última geração, o recém-lançado Ultralytics YOLO26 sintetiza os melhores aspetos das CNNs e dos Transformers.

Porquê escolher o YOLO26?

O YOLO26 implementa um Design End-to-End sem NMS, proporcionando a simplicidade de implementação do RTDETRv2 à arquitetura YOLO ultr eficiente. Além disso, introduz o Otimizador MuSGD — inspirado nas inovações do treino de LLM — para uma estabilidade de treino superior. Com a Remoção de DFL (Distribution Focal Loss removida para simplificar a exportação e melhorar a compatibilidade com dispositivos de periferia e de baixo consumo), o YOLO26 oferece uma inferência na CPU até 43% mais rápida do que as gerações anteriores, tornando-o uma escolha excecional para [computação na periferia](https://ultralytics-translation-0.invalid em comparação com modelos mais pesados. Além disso, ProgLoss + STAL proporciona funções de perda melhoradas, com melhorias notáveis no reconhecimento de objetos pequenos, algo fundamental para IoT, robótica e imagens aéreas.

A facilidade de utilização proporcionada pelo pacote Python da Ultralytics é incomparável. Os programadores podem treinar, validar e exportar modelos utilizando uma API intuitiva que abstrai o código repetitivo normalmente exigido pelos repositórios de investigação.

from ultralytics import RTDETR

# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export for optimized inference on TensorRT
model.export(format="engine")

Os modelos da Ultralytics suportam nativamente várias tarefas, incluindo segmentação de instâncias e classificação de imagens, fornecendo um conjunto de ferramentas versátil para diversas necessidades industriais. Além disso, a remoção da Distribution Focal Loss (DFL) nos modelos modernos da Ultralytics simplifica o grafo computacional, garantindo uma exportação mais fluida para NPUs e TPUs incorporados.

Para uma anotação de dados e gestão de modelos fluidas, a Ultralytics Platform disponibiliza um ambiente abrangente na cloud para supervisionar todo o ciclo de vida do machine learning, estabelecendo-se como a escolha de referência para implementar soluções robustas de visão computacional em produção.

Comentários