Ultralytics YOLO27:
Get Started

YOLOX vs RTDETRv2#

A escolha da arquitetura ideal para aplicações de visão computacional exige um equilíbrio cuidadoso entre precisão, velocidade de inferência e viabilidade de implementação. Nesta análise técnica abrangente, exploramos as diferenças fundamentais entre o YOLOX, uma arquitetura CNN sem âncoras de grande sucesso, e o RTDETRv2, um Transformer de deteção em tempo real de última geração.

Embora ambos os modelos tenham contribuído significativamente para o campo da deteção de objetos, os programadores que criam aplicações prontas para produção descobrem muitas vezes que alternativas modernas, como o Ultralytics YOLO26, oferecem maior eficiência de treino, menores requisitos de memória e um ecossistema de implementação mais robusto.

YOLOX: a colmatar a lacuna entre a investigação e a indústria#

O YOLOX surgiu como uma adaptação sem âncoras muito popular da série YOLO, introduzindo um design simplificado que proporcionou melhorias de desempenho impressionantes na altura do seu lançamento.

Inovações arquiteturais#

O YOLOX levou a família YOLO para um paradigma sem âncoras, integrando uma cabeça desacoplada e a avançada estratégia de atribuição de etiquetas SimOTA. Ao eliminar as caixas-âncora, a arquitetura reduziu significativamente o número de parâmetros de design e melhorou a generalização em diversos conjuntos de dados de benchmark. As suas versões leves, YOLOX-Nano e YOLOX-Tiny, tornaram-se opções populares para implementar aplicações de IA de visão em dispositivos de edge.

Considerações sobre modelos legados

Embora o YOLOX tenha trazido avanços notáveis, a sua dependência de pipelines de aumento de dados pesados e de rotinas de pós-processamento mais antigas (como a NMS tradicional) pode resultar numa latência superior à dos modelos nativamente de ponta a ponta.

Saiba mais sobre o YOLOX

RTDETRv2: a impulsionar os Transformers de visão em tempo real#

Com base nos alicerces do seu antecessor, o RTDETRv2 tira partido dos Vision Transformers (ViTs) para alcançar uma precisão altamente competitiva sem sacrificar velocidades de inferência em tempo real.

  • Autores: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang e Yi Liu
  • Organização: Baidu
  • Data: 2024-07-24
  • Links: Arxiv, GitHub

Inovações arquiteturais#

O RTDETRv2 reformula fundamentalmente o pipeline de deteção, utilizando uma arquitetura baseada em Transformer que contorna nativamente a Supressão Não Máxima (NMS). Isto é conseguido através de um codificador híbrido e da seleção de consultas com consciência de IoU, que melhora a inicialização das consultas de objetos. O modelo processa eficazmente características em várias escalas, o que lhe permite captar detalhes complexos em ambientes difíceis, como na deteção de tráfego em vídeo durante a noite.

No entanto, os Transformers exigem inerentemente muitos recursos. O treino do RTDETRv2 costuma exigir significativamente mais memória GPU e ciclos de computação do que as alternativas baseadas em CNN, o que pode ser um obstáculo para equipas com orçamentos limitados ou que necessitem de ajustar frequentemente os modelos.

Saiba mais sobre o RTDETRv2

Tabela de comparação de desempenho#

Para avaliar objetivamente estas arquiteturas, analisamos o seu desempenho no conjunto de dados COCO. A tabela abaixo ilustra os compromissos entre precisão (mAP), número de parâmetros e complexidade computacional.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Embora o RTDETRv2 alcance uma precisão impressionante, o YOLOX mantém uma vantagem em perfis com poucos parâmetros, sobretudo nas variantes Nano e Tiny.

Casos de uso e recomendações#

A escolha entre YOLOX e RT-DETR depende dos requisitos específicos do teu projeto, das restrições de implementação e das tuas preferências de ecossistema.

Quando escolher o YOLOX#

O YOLOX é uma ótima opção para:

  • Investigação em deteção sem âncoras: Investigação académica que utiliza a arquitetura simples e sem âncoras do YOLOX como referência para experimentar novas cabeças de deteção ou funções de perda.
  • Dispositivos de borda ultraleves: Implementações em microcontroladores ou hardware móvel legado, onde o tamanho extremamente reduzido da variante YOLOX-Nano (0,91 milhões de parâmetros) é essencial.
  • Estudos sobre atribuição de rótulos SimOTA: Projetos de investigação que analisam estratégias de atribuição de rótulos baseadas em transporte ótimo e o seu impacto na convergência do treino.

Quando escolher o RT-DETR#

O RT-DETR é recomendado para:

  • Pesquisa em detecção baseada em Transformer: Projetos que exploram mecanismos de atenção e arquiteturas Transformer para detecção de objetos ponta a ponta sem NMS.
  • Cenários de alta precisão com latência flexível: Aplicações em que a precisão da detecção é a prioridade máxima e uma latência de inferência um pouco maior é aceitável.
  • Detecção de objetos grandes: Cenas com objetos predominantemente médios ou grandes, nas quais o mecanismo de atenção global dos Transformers oferece uma vantagem natural.

Quando escolher Ultralytics (YOLO26)#

Para a maioria dos projetos novos, Ultralytics YOLO26 oferece a melhor combinação de desempenho e experiência para desenvolvedores:

  • Implantação de borda sem NMS: Aplicações que exigem inferência consistente e de baixa latência, sem a complexidade do pós-processamento com supressão não máxima.
  • Ambientes que usam apenas CPU: Dispositivos sem aceleração dedicada por GPU, nos quais a inferência na CPU até 43% mais rápida do YOLO26 oferece uma vantagem decisiva.
  • Detecção de objetos pequenos: Cenários desafiadores, como imagens aéreas de drones ou análise de sensores de IoT, nos quais ProgLoss e STAL melhoram significativamente a precisão na detecção de objetos minúsculos.

A vantagem da Ultralytics: YOLO26#

Embora YOLOX e RTDETRv2 tenham vantagens distintas, o recém-lançado Ultralytics YOLO26 redefine o estado da arte em IA de visão, resolvendo os compromissos históricos entre velocidade, precisão e facilidade de implementação.

1. Arquitetura de ponta a ponta sem NMS#

Inspirado nos modelos Transformer, mas mantendo a eficiência das CNN, o YOLO26 inclui um design opcional de ponta a ponta sem NMS (nms=False). Ao eliminar a Supressão Não Máxima como etapa de pós-processamento, o YOLO26 simplifica drasticamente os pipelines de implementação, garantindo uma latência de inferência consistente em vários dispositivos de edge, sem a sobrecarga do ajuste complexo de limiares.

2. Inferência na CPU até 43% mais rápida#

Ao contrário de arquiteturas Transformer, como o RTDETRv2, que dependem fortemente de GPUs de alto desempenho, o YOLO26 está especificamente otimizado para ambientes de computação de edge. Ao remover Distribution Focal Loss (DFL), o YOLO26 simplifica a exportação do modelo e alcança uma inferência na CPU até 43% mais rápida, tornando-o a escolha ideal para integração em hardware como o Raspberry Pi ou dispositivos móveis comuns.

3. Eficiência de treino com MuSGD#

O treino de modelos Transformer conduz muitas vezes a um consumo excessivo de memória CUDA e a tempos de treino prolongados. O YOLO26 introduz o inovador otimizador MuSGD — uma combinação de Descida do Gradiente Estocástico e do otimizador Muon, inspirado em LLM. Esta inovação proporciona um treino excecionalmente estável e uma convergência mais rápida, reduzindo significativamente os requisitos de hardware em comparação com o RTDETRv2.

4. Ecossistema e versatilidade sem paralelo#

O ecossistema Ultralytics proporciona uma experiência de desenvolvimento intuitiva e simplificada. Com documentação abrangente, uma comunidade ativa e a plataforma Ultralytics, que funciona na cloud, nunca foi tão fácil gerir todo o ciclo de vida da IA. Além disso, o YOLO26 é altamente versátil. Enquanto o RTDETRv2 se centra na deteção de objetos, o YOLO26 suporta sem complicações, de forma nativa, tarefas de segmentação de instâncias, classificação de imagens, estimativa de pose e caixas delimitadoras orientadas (OBB). Reforçado pelo novo ProgLoss + STAL (perda progressiva e atribuição de etiquetas sensível a objetos pequenos), o YOLO26 também se destaca no reconhecimento de objetos pequenos, uma funcionalidade crucial para imagens aéreas e deteção de defeitos industriais.

Outros modelos suportados

A framework Ultralytics também suporta a geração anterior, YOLO11 e YOLOv8, permitindo aos utilizadores comparar facilmente o desempenho e fazer a transição de pipelines legados.

Integração simples com a Ultralytics#

A implementação de modelos não deve exigir que tenhas de lidar com bases de código complexas e fragmentadas. A API Python da Ultralytics permite-te carregar, treinar e exportar modelos de última geração com apenas algumas linhas de código.

from ultralytics import YOLO

# Carrega o modelo nano YOLO26 mais recente para obter o melhor desempenho em edge
model = YOLO("yolo26n.pt")

# Treina o modelo com o teu conjunto de dados personalizado e uma utilização mínima de memória
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Valida o desempenho do modelo
metrics = model.val()

# Exporta facilmente para ONNX ou TensorRT para implementação
model.export(format="onnx")

Ao utilizar a Ultralytics, evitas as configurações de ambiente complicadas normalmente associadas aos repositórios de investigação e aceleras o lançamento do teu produto no mercado.

Conclusão#

YOLOX e RTDETRv2 representam marcos importantes na evolução da deteção de objetos em tempo real. O YOLOX demonstrou a viabilidade de CNN sem âncoras altamente eficientes, enquanto o RTDETRv2 adaptou com sucesso os Transformers às restrições de tempo real.

No entanto, para aplicações modernas que vão desde a análise inteligente do retalho até à robótica embarcada, Ultralytics YOLO26 oferece a solução definitiva. Ao combinar inferência sem NMS com velocidades de CPU incomparáveis, menor consumo de memória e o suporte robusto da Ultralytics Platform, o YOLO26 permite aos programadores criar a próxima geração de sistemas fiáveis e de alto desempenho de visão computacional.

Comentários