RTDETRv2 vs YOLOv9#
O campo da visão computacional testemunhou uma divergência fascinante entre filosofias arquitetónicas, principalmente entre Redes neurais convolucionais (CNNs) e modelos baseados em Transformer. Ao comparar o RTDETRv2 e o YOLOv9, os desenvolvedores estão essencialmente a avaliar as compensações entre mecanismos de atenção global e informações de gradiente programáveis. Ambos os modelos representam o ápice dos respetivos paradigmas e ampliam os limites da deteção de objetos em tempo real.
Introdução aos modelos#
RTDETRv2: Transformer de deteção em tempo real#
Desenvolvido por pesquisadores da Baidu, o RTDETRv2 baseia-se no RT-DETR original ao introduzir um «Bag-of-Freebies» para aprimorar o Transformer de deteção em tempo real de referência. O modelo aborda o gargalo tradicional dos Transformers — a velocidade de inferência — tornando-os viáveis para aplicações em tempo real.
- Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
- Organização: Baidu
- Data: 2024-07-24
- Links: Arxiv, GitHub
Uma característica marcante do RTDETRv2 é a sua conceção nativa de ponta a ponta sem NMS. Ao remover completamente a Supressão não máxima (NMS) durante o pós-processamento, o modelo estabiliza a latência de inferência e simplifica o pipeline de implantação. O mecanismo de atenção global permite que o modelo se destaque na compreensão de cenas complexas e multidões densas, pois avalia simultaneamente todo o contexto da imagem.
YOLOv9: informações de gradiente programáveis#
O YOLOv9, uma arquitetura altamente eficiente baseada em CNN, aborda o problema do gargalo de informação inerente às redes neurais profundas. O modelo introduz as Informações de gradiente programáveis (PGI) e a Rede de agregação de camadas eficiente generalizada (GELAN).
- Autores: Chien-Yao Wang e Hong-Yuan Mark Liao
- Organização: Institute of Information Science, Academia Sinica
- Data: 21 de fevereiro de 2024
- Links: Arxiv, GitHub
O YOLOv9 baseia-se nos fundamentos comprovados das redes neurais convolucionais, mas maximiza a eficiência dos parâmetros. Ao reter informações cruciais durante o processo de propagação direta, garante atualizações confiáveis dos pesos, resultando num modelo incrivelmente leve e preciso. No entanto, ao contrário do RTDETRv2, o YOLOv9 ainda depende do pós-processamento NMS padrão.
Desempenho e eficiência de recursos#
Ao avaliar estes modelos para produção, é fundamental equilibrar a Precisão média média (mAP) com o custo computacional. A tabela abaixo mostra o desempenho dos modelos no conjunto de dados MS COCO.
| Modelo | tamanho (pixels) | mAPval 50-95 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Requisitos de memória e eficiência de treinamento#
Os Transformers, como o RTDETRv2, são notoriamente exigentes em termos de memória durante o treinamento, exigindo muitas vezes bastante memória CUDA e ciclos de treinamento mais longos para convergir totalmente. Em contrapartida, as arquiteturas CNN, como o YOLOv9 e outros modelos YOLO da Ultralytics, usam significativamente menos memória, permitindo que os desenvolvedores treinem com tamanhos de lote maiores em hardware de consumo.
Para maximizar a utilização do hardware, considera usar a Plataforma Ultralytics para simplificar o treinamento na nuvem. A plataforma gere automaticamente a configuração do ambiente e o dimensionamento ideal do lote.
A vantagem da Ultralytics: ecossistema e facilidade de uso#
Embora pesquisar repositórios independentes, como as páginas oficiais do RTDETRv2 ou do YOLOv9 no GitHub, possa ser muito educativo, os ambientes de produção exigem estabilidade, facilidade de uso e um ecossistema bem mantido. Integrar estes modelos por meio da API Python da Ultralytics oferece uma experiência simples para os desenvolvedores.
API unificada e versatilidade#
A estrutura da Ultralytics abstrai as complexidades do carregamento de dados, dos aumentos de dados e do treinamento distribuído. Além disso, embora o RTDETRv2 original se concentre exclusivamente na deteção, o ecossistema Ultralytics permite que os usuários alternem facilmente entre deteção de objetos, segmentação de instâncias e estimativa de pose.
from ultralytics import RTDETR, YOLO
# Treina um modelo YOLOv9 com dados personalizados
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)
# Muda facilmente para RT-DETR para avaliar cenas complexas
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")
# Exporta para formatos prontos para produção, como TensorRT
model_yolo.export(format="engine")Com documentação robusta, rastreamento automático de experimentos e recursos de exportação integrados para formatos como ONNX, TensorRT e OpenVINO, a Ultralytics reduz drasticamente o tempo entre o protótipo e a produção.
Casos de utilização ideais#
Onde o RTDETRv2 se destaca#
Graças ao seu mecanismo de atenção global, o RTDETRv2 é excelente para processamento no servidor e ambientes em que o contexto global é fundamental. Ele se destaca em:
- Imagens médicas: Identificação de anomalias sutis em que o contexto ao redor é fundamental.
- Vigilância aérea: Identificação de objetos pequenos em imagens de drones de alta resolução sem os vieses espaciais das convoluções CNN tradicionais.
- Análise de multidões densas: Rastreamento de indivíduos em situações em que a oclusão intensa costuma confundir modelos baseados em âncoras.
Onde o YOLOv9 se destaca#
O YOLOv9 é excelente para implantações de borda com recursos limitados. Sua eficiência computacional o torna ideal para:
- Robótica: Navegação em tempo real e desvio de obstáculos quando a latência mínima é essencial.
- IoT para cidades inteligentes: Implantação em dispositivos de borda, como o NVIDIA Jetson, para monitoramento de tráfego.
- Inspeção industrial: Controle de qualidade em linhas de montagem de alta velocidade que exige uma alta taxa de quadros por segundo (FPS).
O futuro: conheça o Ultralytics YOLO26#
Embora o YOLOv9 e o RTDETRv2 representem grandes avanços, o cenário evoluiu rapidamente. Para as implantações modernas, o recém-lançado Ultralytics YOLO26 representa a combinação ideal das duas filosofias arquiteturais.
Ao combinar os melhores aspectos dos transformers e das CNNs, o YOLO26 estabelece um novo padrão:
- Design de ponta a ponta sem NMS: Assim como o RTDETRv2, o YOLO26 oferece inferência nativa de ponta a ponta, dispensando o pós-processamento NMS com
nms=Falsepara pipelines de implantação mais rápidos, simples e altamente previsíveis. - Otimizador MuSGD: Inspirado em técnicas de treinamento de modelos de linguagem grandes (LLM), como o Kimi K2 da Moonshot AI, o YOLO26 utiliza uma combinação de SGD e Muon. Isso proporciona estabilidade de treinamento incomparável e convergência rápida em visão computacional.
- Inferência na CPU até 43% mais rápida: Ao contrário dos transformers pesados, o YOLO26 é altamente otimizado para computação de borda e dispositivos sem GPUs.
- Remoção de DFL: A remoção de Distribution Focal Loss simplifica drasticamente o grafo do modelo, garantindo uma exportação confiável para dispositivos de borda de baixo consumo e Unidades de Processamento Neural (NPUs) integradas.
- ProgLoss + STAL: Essas funções de perda aprimoradas melhoram muito o reconhecimento de objetos pequenos, um recurso essencial para IoT e conjuntos de dados aéreos.
Para equipes que querem iniciar um novo projeto de visão computacional, recomendamos fortemente avaliar o YOLO26. Ele oferece a elegância opcional, sem NMS, de um transformer, além da velocidade impressionante e da eficiência de treinamento de uma arquitetura YOLO altamente otimizada.
Resumo#
A escolha entre RTDETRv2 e YOLOv9 depende, em grande parte, do hardware de implantação e dos requisitos específicos de precisão. O RTDETRv2 oferece precisão de ponta e percepção contextual para aplicações com suporte de servidores, enquanto o YOLOv9 proporciona eficiência excepcional em dispositivos de borda.
No entanto, ao aproveitar o ecossistema maduro da Ultralytics, os desenvolvedores podem experimentar facilmente o YOLOv9 e o RT-DETR original. Além disso, com a introdução de modelos mais recentes, como o YOLO11 e o YOLO26 nativamente de ponta a ponta, nunca foi tão fácil encontrar o equilíbrio ideal entre inferência de alta velocidade, suporte versátil a tarefas e baixo consumo de memória.