RTDETRv2とDAMO-YOLOの比較#
コンピュータービジョンの領域は常に進化しており、研究者やエンジニアは速度、精度、効率のバランスが完璧に取れたモデルの構築に努めています。この分野で大きな影響を与えた2つの主要なアーキテクチャが、Baiduによって開発されたRTDETRv2と、Alibaba Groupによって作成されたDAMO-YOLOです。どちらのモデルもリアルタイムのobject detectionの限界を押し広げていますが、印象的な結果を達成するために根本的に異なるアーキテクチャの哲学を採用しています。
この技術的比較では、そのアーキテクチャ、トレーニング手法、および実際のデプロイ能力について詳しく掘り下げます。また、これらのモデルが、より広いエコシステム、特に高度に最適化されたUltralytics Platformや最先端のYOLO26 architectureに対してどのように比較されるかについても探ります。
アーキテクチャの革新#
本番環境に適したツールを選択する任務を負ったmachine learning engineersにとって、これらのモデルのコアメカニズムを理解することは不可欠です。
RTDETRv2: Transformerアプローチ#
オリジナルのRT-DETRの成功を基にして、RTDETRv2はハイブリッドエンコーダーとtransformer decoderを利用しています。この設計により、モデルはグローバルコンテキストを非常に効果的に処理できるようになり、高密度なシーンでの重なり合うオブジェクトの区別に抜群に優れたものになります。このアーキテクチャの最も重要な利点は、ネイティブのNMSフリー(非最大値抑制)設計です。NMSのポスト処理ステップを排除することで、RTDETRv2は推論パイプラインを合理化し、さまざまなハードウェア構成でより安定したレイテンシを保証します。
DAMO-YOLO: CNN効率の向上#
一方、DAMO-YOLOは、大成功を収めたCNNベースのYOLOの系譜を受け継ぎつつも、いくつかの画期的な機能拡張を導入しています。ニューラルアーキテクチャ探索(NAS)を活用してバックボーンを最適化し、最大の特徴抽出効率を確保しています。さらに、効率的なRepGFPN(Reparameterized Generalized Feature Pyramid Network)とZeroHead設計を組み込み、AlignedOTAおよび蒸留拡張技術を採用しています。これらの革新により、DAMO-YOLOは、非常に競争力のあるmAPvalスコアを維持しながら、高速な推論速度を実現しています。
RTDETRv2がNMSなしでグローバルな特徴理解のためにアテンションメカニズムを活用することに焦点を当てているのに対し、DAMO-YOLOはNASと高度な蒸留を通じて従来のCNN効率を最大化しており、標準的な後処理が必要ですが、特定のハードウェアでは明確な速度上の利点を提供します。
パフォーマンスと指標の比較#
デプロイに向けてモデルを評価する際、平均精度平均(mAP)、推論速度、パラメータ数などのperformance metricsが最も重要になります。以下に、2つのモデルファミリーの詳細な比較を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
結果の分析#
表に見られるように、RTDETRv2-xは54.3のmAPvalで最高の精度を達成しており、COCO datasetのような複雑な検証におけるトランスフォーマーアーキテクチャのパワーを示しています。ただし、これは大幅に高いパラメータ(76M)とFLOPsを代償としています。
対照的に、DAMO-YOLOt(Tiny)は非常に軽量で、パラメータ数はわずか8.5Mであり、CUDAメモリが厳しく制限される環境において非常に高速な選択肢となります。DAMO-YOLOは、レガシーエッジデバイスに対して、一般的に速度と精度の良好なトレードオフを提供します。
エコシステム、ユーザビリティ、そしてUltralyticsの利点#
公式のRT-DETR GitHubやDAMO-YOLO GitHubのような独立したリポジトリは、これらのモデルをトレーニングするための生コードを提供していますが、それらを本番パイプラインに統合するには、多くの場合、広範なボイラープレートコードと手動の最適化が必要です。
ここでUltralytics ecosystemが開発者のエクスペリエンスを劇的に簡素化します。Ultralyticsは、RTDETRv2などのモデルを統合APIに直接組み込んでおり、ユーザーは1行のコードでモデルのトレーニング、検証、エクスポートを行えます。さらに、Ultralyticsモデルは、重いトランスフォーマーベースのスタンドアロンリポジトリと比較して、トレーニング中のメモリ要件が最小限であることで知られています。
コード例: シームレスな統合#
Ultralytics Pythonライブラリを活用して推論を実行するのがいかに簡単かを示します。transformerモデルを使用する場合でも、最先端のCNNを使用する場合でも、APIの一貫性は維持されます。
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")
# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")
# Display the results
results_yolo[0].show()Ultralytics APIを使用すると、シンプルな model.export(format="engine") コマンドで、訓練済みモデルをエクスポートしてTensorRT、ONNX、CoreMLなどのフォーマットにシームレスに変換でき、デプロイの摩擦を大幅に軽減できます。
理想的なユースケース#
これらのアーキテクチャを選択するかどうかは、特定のプロジェクト要件に完全に依存します。
- RTDETRv2は、VRAMが豊富なサーバーサイドの処理に優れています。そのグローバルコンテキスト認識は、オクルージョンが頻発するmedical imagingや高密度な群衆分析に最適です。
- DAMO-YOLOは、パラメータ数が少なく高FPSが厳格に求められるembedded IoT applicationsや、動きの速い産業用検査ラインに非常に適しています。
未来:Ultralytics YOLO26#
RTDETRv2とDAMO-YOLOにはそれぞれ長所がありますが、コンピュータービジョンの分野は急速に進歩しています。新しいプロジェクトにおいて、最新の**Ultralytics YOLO26**は、速度、精度、開発者エクスペリエンスの究極の統合を表しています。
YOLO26はエンドツーエンドのNMSフリー設計を採用しており、膨大な計算オーバーヘッドなしでトランスフォーマーの主なメリットを取り入れています。Large Language Modelのトレーニングにインスパイアされた革新的なMuSGD Optimizerを組み込んでおり、安定した高速な収束を実現します。さらに、DFL削除(シンプル化されたエクスポートとエッジ/低電力デバイスの互換性向上のために分布焦点損失を削除)により、YOLO26は最大43%高速なCPU推論を実現し、edge computingの揺るぎないチャンピオンとなっています。さらに、ProgLoss + STALにより、IoT、ロボット工学、航空画像に不可欠な小物体認識の大幅な改善をはじめとする、優れた損失関数が提供されます。
バウンディングボックスに厳密に限定されたモデルとは異なり、YOLO26ファミリーは比類のない汎用性を提供し、instance segmentationやpose estimationからoriented bounding boxes (OBB)までのタスクをサポートし、すべて直感的なUltralytics Platformを通じてシームレスに管理されます。
モデルの詳細とリファレンス#
RTDETRv2#
- 著者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, and Yi Liu
- 組織: Baidu
- 日付: 2024年7月24日
- Arxiv: 2407.17140
- GitHub: RT-DETR Repository
DAMO-YOLO#
- 著者: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, and Xiuyu Sun
- Organization: Alibaba Group
- 日付: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: DAMO-YOLO Repository
他の比較の探索に関心のあるユーザーは、RTDETRv2 vs. YOLO11またはDAMO-YOLO vs. YOLOv8に関するガイドをチェックして、これらのモデルがUltralyticsファミリーの以前の世代に対してどのようにパフォーマンスを発揮するかを確認してください。