Ultralytics YOLO27:

RTDETRv2 vs YOLOv9#

O campo da visão computacional tem testemunhado uma divergência fascinante entre filosofias arquiteturais, principalmente entre Redes Neuronais Convolucionais (CNNs) e modelos baseados em Transformer. Ao comparar RTDETRv2 e YOLOv9, os programadores estão essencialmente a avaliar os compromissos entre mecanismos de atenção global e informações de gradiente programáveis. Ambos os modelos representam o auge dos respetivos paradigmas, ampliando os limites da deteção de objetos em tempo real.

Introdução aos modelos#

RTDETRv2: Transformer de Deteção em Tempo Real#

Desenvolvido por investigadores da Baidu, o RTDETRv2 baseia-se no RT-DETR original ao introduzir um "Bag-of-Freebies" para melhorar o Transformer de Deteção em Tempo Real de referência. Aborda o gargalo tradicional dos transformers — a velocidade de inferência — tornando-os viáveis para aplicações em tempo real.

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
  • Organização: Baidu
  • Data: 2024-07-24
  • Ligações: Arxiv, GitHub

Uma característica definidora do RTDETRv2 é o seu design nativamente end-to-end sem NMS. Ao remover completamente a Supressão não máxima (NMS) durante o pós-processamento, o modelo estabiliza a latência de inferência e simplifica o pipeline de implementação. O mecanismo de atenção global permite que o modelo se destaque na compreensão de cenas complexas e em multidões densas, pois avalia simultaneamente todo o contexto da imagem.

Saiba mais sobre o RTDETRv2

YOLOv9: Informação de gradiente programável#

O YOLOv9, uma arquitetura altamente eficiente baseada em CNN, aborda o problema do gargalo de informação inerente às redes neuronais profundas. Introduz as Informações de Gradiente Programáveis (PGI) e a Rede de Agregação de Camadas Eficiente Generalizada (GELAN).

O YOLOv9 baseia-se nos fundamentos comprovados de uma rede neuronal convolucional, mas maximiza a eficiência dos parâmetros. Ao reter informações cruciais durante o processo feed-forward, garante atualizações fiáveis dos pesos, resultando num modelo incrivelmente leve e, ainda assim, altamente preciso. No entanto, ao contrário do RTDETRv2, o YOLOv9 continua a depender do pós-processamento NMS padrão.

Saiba mais sobre o YOLOv9

Desempenho e eficiência de recursos#

Ao avaliar estes modelos para produção, é fundamental equilibrar a Precisão média (mAP) com o custo computacional. A tabela abaixo ilustra o desempenho no conjunto de dados MS COCO.

Modelotamanho
(píxeis)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

Requisitos de memória e eficiência de treino#

Transformers como o RTDETRv2 são conhecidos pelo elevado consumo de memória durante o treino, exigindo frequentemente uma quantidade substancial de memória CUDA e períodos de treino mais longos para convergirem totalmente. Por outro lado, arquiteturas CNN como o YOLOv9 e outros modelos Ultralytics YOLO oferecem um consumo de memória significativamente menor, permitindo aos programadores treinar com tamanhos de batch maiores em hardware de consumo.

Treino eficiente

Para maximizar a utilização do hardware, considera utilizar a Plataforma Ultralytics para um treino na cloud simplificado. Trata automaticamente da configuração do ambiente e da definição ideal do tamanho do batch.

A vantagem da Ultralytics: ecossistema e facilidade de utilização#

Embora pesquisar repositórios independentes, como as páginas oficiais do RTDETRv2 ou do YOLOv9 no GitHub, possa ser bastante educativo, os ambientes de produção exigem estabilidade, facilidade de utilização e um ecossistema bem mantido. Integrar estes modelos através da API Python da Ultralytics proporciona uma experiência de desenvolvimento fluida.

API unificada e versatilidade#

A framework Ultralytics abstrai as complexidades do carregamento de dados, dos aumentos de dados e do treino distribuído. Além disso, enquanto o RTDETRv2 original se concentra estritamente na deteção, o ecossistema Ultralytics permite aos utilizadores alternar facilmente entre Deteção de Objetos, Segmentação de Instâncias e Estimativa de Postura.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model on custom data
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# Easily switch to RT-DETR for complex scene evaluation
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# Export to production-ready formats like TensorRT
model_yolo.export(format="engine")

Com documentação robusta, acompanhamento automático de experiências e capacidades de exportação simples para formatos como ONNX, TensorRT e OpenVINO, a Ultralytics reduz drasticamente o tempo entre o protótipo e a produção.

Casos de Utilização Ideais#

Onde o RTDETRv2 se destaca#

Graças ao seu mecanismo de atenção global, o RTDETRv2 é uma solução poderosa para processamento no lado do servidor e ambientes onde o contexto global é essencial. Destaca-se em:

  • Imagiologia médica: Identificação de anomalias subtis onde o contexto circundante é fundamental.
  • Vigilância aérea: Deteção de objetos pequenos em imagens de drones de alta resolução, sem os enviesamentos espaciais das convoluções CNN tradicionais.
  • Análise de multidões densas: Rastreamento de indivíduos onde a oclusão severa normalmente confunde modelos baseados em âncoras.

Onde o YOLOv9 se destaca#

O YOLOv9 é um campeão das implementações edge com recursos limitados. A sua eficiência computacional torna-o ideal para:

  • Robótica: Navegação em tempo real e prevenção de obstáculos onde é necessária latência mínima.
  • IoT para cidades inteligentes: Implementação em dispositivos edge, como o NVIDIA Jetson, para monitorização do tráfego.
  • Inspeção industrial: Controlo de qualidade em linhas de montagem de alta velocidade que exige uma elevada taxa de frames por segundo (FPS).

O futuro: entra o Ultralytics YOLO26#

Embora o YOLOv9 e o RTDETRv2 representem enormes avanços, o panorama evoluiu rapidamente. Para implementações modernas, o recém-lançado Ultralytics YOLO26 representa a sinergia ideal entre ambas as filosofias arquiteturais.

Ao combinar os melhores aspetos dos transformers e das CNNs, o YOLO26 estabelece um novo padrão:

  • Design end-to-end sem NMS: Tal como o RTDETRv2, o YOLO26 é nativamente end-to-end, eliminando completamente o pós-processamento NMS para pipelines de implementação mais rápidos, simples e altamente previsíveis.
  • Otimizador MuSGD: Inspirado em técnicas de treino de Modelos de Linguagem de Grande Escala (LLM), como o Kimi K2 da Moonshot AI, o YOLO26 utiliza uma combinação de SGD e Muon. Isto proporciona uma estabilidade de treino incomparável e uma convergência rápida à visão computacional.
  • Até 43% mais rápido na inferência em CPU: Ao contrário dos transformers pesados, o YOLO26 é fortemente otimizado para computação edge e dispositivos sem GPUs.
  • Remoção do DFL: A remoção da Distribution Focal Loss simplifica drasticamente o grafo do modelo, garantindo uma exportação perfeita para dispositivos edge de baixo consumo e Unidades de Processamento Neural (NPUs) incorporadas.
  • ProgLoss + STAL: Estas funções de perda melhoradas aumentam significativamente o reconhecimento de objetos pequenos, uma funcionalidade essencial para conjuntos de dados de IoT e imagens aéreas.

Para equipas que pretendem iniciar um novo projeto de visão computacional, recomendamos vivamente avaliar o YOLO26. Este oferece a elegância sem NMS de um transformer, juntamente com a velocidade impressionante e a eficiência de treino de uma arquitetura YOLO altamente otimizada.

Resumo#

A escolha entre RTDETRv2 e YOLOv9 depende em grande medida do hardware de implementação e das necessidades específicas de precisão. O RTDETRv2 oferece precisão de última geração e consciência contextual para aplicações apoiadas por servidores, enquanto o YOLOv9 proporciona uma eficiência excecional em dispositivos edge.

No entanto, ao tirar partido do ecossistema maduro da Ultralytics, os programadores podem experimentar facilmente ambos. Além disso, com a introdução de modelos mais recentes, como o YOLO11 e o YOLO26 nativamente end-to-end, nunca foi tão fácil encontrar o equilíbrio ideal entre inferência de alta velocidade, suporte versátil a tarefas e baixo consumo de memória.

Comentários