Ultralytics YOLO27:
Get Started

RTDETRv2 vs DAMO-YOLO#

O cenário da visão computacional está em constante evolução, com pesquisadores e engenheiros buscando desenvolver modelos que equilibrem perfeitamente velocidade, precisão e eficiência. Duas arquiteturas de destaque que causaram grande impacto nessa área são RTDETRv2, desenvolvido pela Baidu, e DAMO-YOLO, criado pelo Alibaba Group. Ambos os modelos ampliam os limites da detecção de objetos em tempo real, mas adotam filosofias arquiteturais fundamentalmente diferentes para alcançar seus resultados impressionantes.

Nesta comparação técnica, vamos analisar em profundidade suas arquiteturas, metodologias de treinamento e capacidades de implantação no mundo real. Também vamos examinar como esses modelos se comparam ao ecossistema mais amplo, em especial à altamente otimizada Ultralytics Platform e à arquitetura de ponta YOLO26.

Inovações arquiteturais#

Compreender os mecanismos centrais desses modelos é fundamental para engenheiros de machine learning encarregados de selecionar a ferramenta certa para ambientes de produção.

RTDETRv2: a abordagem Transformer#

Com base no sucesso do RT-DETR original, RTDETRv2 utiliza um codificador híbrido e um decodificador Transformer. Esse projeto permite que o modelo processe o contexto global com grande eficácia, tornando-o excepcionalmente bom para distinguir objetos sobrepostos em cenas densas. A vantagem mais significativa dessa arquitetura é seu projeto nativo sem NMS (supressão não máxima). Ao eliminar a etapa de pós-processamento NMS, RTDETRv2 simplifica o pipeline de inferência e garante uma latência mais estável em diferentes configurações de hardware.

Saiba mais sobre o RTDETRv2

DAMO-YOLO: avançando a eficiência das CNNs#

DAMO-YOLO, por outro lado, mantém suas raízes na bem-sucedida linhagem YOLO baseada em CNN, mas introduz diversos aprimoramentos inovadores. Ele aproveita a busca por arquitetura neural (NAS) para otimizar seu backbone e garantir a máxima eficiência na extração de características. Além disso, incorpora uma RepGFPN (rede de pirâmide de características generalizada reparametrizada) eficiente e um projeto ZeroHead, além de técnicas de aprimoramento AlignedOTA e destilação. Essas inovações permitem que DAMO-YOLO alcance altas velocidades de inferência mantendo uma pontuação mAPval altamente competitiva.

Saiba mais sobre DAMO-YOLO

Divergência arquitetural

Enquanto RTDETRv2 se concentra em aproveitar mecanismos de atenção para compreender características globais sem NMS, DAMO-YOLO maximiza a eficiência das CNNs tradicionais por meio de NAS e destilação avançada, exigindo o pós-processamento padrão, mas oferecendo vantagens distintas de velocidade em determinados hardwares.

Comparação de desempenho e métricas#

Ao avaliar modelos para implantação, métricas de desempenho, como precisão média (mAP), velocidade de inferência e quantidade de parâmetros, são fundamentais. Abaixo está uma comparação detalhada das duas famílias de modelos.

Modelotamanho
(pixels)
mAPval
50-95
Velocidade
CPU ONNX
(ms)
Velocidade
T4 TensorRT10
(ms)
parâmetros
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

Análise dos resultados#

Como mostra a tabela, RTDETRv2-x alcança a maior precisão, com um mAPval de 54,3, demonstrando o poder da arquitetura Transformer em validações complexas, como o conjunto de dados COCO. No entanto, isso implica uma quantidade significativamente maior de parâmetros (76M) e FLOPs.

Por outro lado, DAMO-YOLOt (Tiny) é excepcionalmente leve, exigindo apenas 8,5M de parâmetros, o que o torna uma opção incrivelmente rápida para ambientes em que a memória CUDA é extremamente limitada. Em geral, DAMO-YOLO oferece um equilíbrio favorável entre velocidade e precisão para dispositivos de borda mais antigos.

Ecossistema, usabilidade e a vantagem da Ultralytics#

Embora repositórios independentes, como o GitHub oficial do RT-DETR e o GitHub do DAMO-YOLO, ofereçam o código-fonte para treinar esses modelos, integrá-los a pipelines de produção costuma exigir muito código boilerplate e otimização manual.

É aqui que o ecossistema Ultralytics simplifica drasticamente a experiência de desenvolvimento. A Ultralytics integra detectores Transformer, como o RT-DETR original, diretamente à sua API unificada, permitindo que os usuários treinem, validem e exportem modelos com uma única linha de código. Além disso, os modelos da Ultralytics são conhecidos por seus requisitos mínimos de memória durante o treinamento, em comparação com repositórios independentes pesados baseados em Transformer.

Exemplo de código: integração fluida#

Veja como é fácil aproveitar a biblioteca Python da Ultralytics para executar inferência. A API permanece consistente, quer estejas usando um modelo Transformer, quer uma CNN de ponta.

from ultralytics import RTDETR, YOLO

# Carrega um modelo RT-DETR para compreender cenas complexas
model_rtdetr = RTDETR("rtdetr-l.pt")

# Carrega o modelo Ultralytics YOLO26 mais recente para obter o máximo desempenho na borda
model_yolo26 = YOLO("yolo26n.pt")

# Executa inferência em uma imagem de exemplo sem complicações
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# Apresenta os resultados
results_yolo[0].show()
Exportação de modelos para produção

Com a API da Ultralytics, podes exportar teus modelos treinados facilmente para formatos como TensorRT, ONNX ou CoreML usando um simples comando model.export(format="engine"), reduzindo drasticamente os obstáculos à implantação.

Casos de utilização ideais#

A escolha entre essas arquiteturas depende inteiramente dos requisitos específicos do teu projeto:

  • RTDETRv2 se destaca no processamento em servidores, onde há bastante VRAM. Sua percepção do contexto global é ideal para imagens médicas e análises de multidões densas, nas quais as oclusões são frequentes.
  • DAMO-YOLO é altamente indicado para aplicações de IoT embarcada e linhas de inspeção industrial de alta velocidade, nas quais a baixa quantidade de parâmetros e o alto FPS são requisitos rigorosos.

O futuro: Ultralytics YOLO26#

Embora RTDETRv2 e DAMO-YOLO tenham suas vantagens, a área de visão computacional avança rapidamente. Para novos projetos, o mais recente Ultralytics YOLO26 representa a síntese definitiva de velocidade, precisão e experiência de desenvolvimento.

YOLO26 adota um projeto ponta a ponta sem NMS, incorporando o principal benefício dos Transformers sem a enorme sobrecarga computacional. Ele incorpora o inovador otimizador MuSGD — inspirado no treinamento de modelos de linguagem grandes — para uma convergência estável e rápida. Além disso, com a remoção de DFL (remoção de Distribution Focal Loss para simplificar a exportação e melhorar a compatibilidade com dispositivos de borda e baixo consumo), YOLO26 alcança uma inferência na CPU até 43% mais rápida, tornando-se o campeão indiscutível da computação de borda. Além disso, ProgLoss + STAL oferece funções de perda aprimoradas, com melhorias notáveis no reconhecimento de objetos pequenos, essencial para IoT, robótica e imagens aéreas.

Ao contrário dos modelos limitados estritamente a caixas delimitadoras, a família YOLO26 oferece versatilidade incomparável, abrangendo tarefas que vão de segmentação de instâncias e estimativa de pose a caixas delimitadoras orientadas (OBB), tudo gerenciado facilmente pela intuitiva Ultralytics Platform.

Detalhes e referências do modelo#

RTDETRv2#

DAMO-YOLO#

Se quiseres explorar outras comparações, consulta nossos guias sobre RTDETRv2 vs. YOLO11 ou DAMO-YOLO vs. YOLOv8 para ver como esses modelos se comparam às gerações anteriores da família Ultralytics.

Comentários