YOLOv9 vs RTDETRv2#
リアルタイム物体検出の分野は、近年パラダイムシフトを経験しています。この分野を支配する、2つの異なるアーキテクチャ思想が登場しています。それは、高度に最適化された畳み込みニューラルネットワーク(CNN)と、リアルタイム検出Transformer(DETR)です。これら2つのアプローチの頂点に位置するのが、YOLOv9とRTDETRv2です。
この包括的なガイドでは、これら2つの強力なモデルを比較し、アーキテクチャ上の革新、パフォーマンス指標、および理想的なデプロイシナリオを分析します。これにより、コンピュータビジョンパイプラインに適したモデルを選択できます。
エグゼクティブサマリー#
どちらのモデルも最先端の成果を達成していますが、対応するデプロイ制約と開発エコシステムは若干異なります。
- YOLOv9を選ぶ場合: エッジデバイス上で、パラメーターを非常に効率的に利用し、高速な推論を実現する必要がある場合です。YOLOv9はCNNの効率性における理論的限界を押し広げており、計算リソースが厳しく制限された環境に最適です。
- RTDETRv2を選ぶ場合: Transformerが提供する高度なコンテキスト理解が必要で、特に深刻なオクルージョンや複雑な物体間の関係を含むシーンを扱い、やや大規模なアーキテクチャを支えるハードウェアがある場合です。
- YOLO26(推奨)を選ぶ場合: 両方の長所を最大限に活用したい場合です。Ultralytics Platformで利用できる最新世代のモデルであるYOLO26は、ネイティブのエンドツーエンドNMSフリーデザイン(DETRモデルに類似していますが、はるかに高速です)を備えています。これにより、後処理のボトルネックを排除し、従来世代と比較して最大43%高速なCPU推論を実現します。
技術仕様と開発者情報#
これらのモデルの起源と設計意図を理解することは、アーキテクチャ上の選択を把握するうえで重要な文脈となります。
YOLOv9#
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織: 中央研究院情報科学研究所
- 日付: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
アーキテクチャのイノベーション#
YOLOv9:情報ボトルネックの解消#
Ultralytics YOLOv9は、データが深層ニューラルネットワークを通過する際の情報損失に対処するために設計された、2つの主要な革新を導入しています。
- プログラマブル勾配情報(PGI): この補助的な教師あり学習フレームワークは、ネットワークの重みを更新するために信頼性の高い勾配が生成されることを保証し、非常に深いネットワーク層でも重要な特徴情報を保持します。
- 一般化効率的レイヤー集約ネットワーク(GELAN): CSPNetとELANの強みを組み合わせた新しいアーキテクチャです。GELANはパラメーター効率を最適化し、従来のCNNと比較して、より少ないFLOPsでYOLOv9が高い精度を達成できるようにします。
RTDETRv2:リアルタイムTransformerの強化#
元のRT-DETRの成功を基盤として、RTDETRv2は、非最大抑制(NMS)の必要性を本質的に回避するTransformerベースのアーキテクチャを使用しています。主な改良点は次のとおりです。
- Bag-of-Freebies戦略: v2では、高度な学習手法とデータ拡張を取り入れており、推論レイテンシーにオーバーヘッドを追加することなく、精度を大幅に向上させます。
- 効率的なハイブリッドエンコーダー: スケール内およびスケール間のアテンションメカニズムを分離してマルチスケール特徴を処理することで、RTDETRv2はVision Transformerにおいて従来課題となっていた高い計算コストを効率的に管理します。
RTDETRv2がTransformerを活用してNMSフリー検出を実現する一方で、新しいYOLO26アーキテクチャは、高度に最適化されたCNN構造内でこれをネイティブに実現します。これにより、同じように効率化されたデプロイを提供しながら、エッジ推論速度は大幅に向上します。
性能比較#
本番環境向けにモデルを評価する際は、精度と計算要件のトレードオフが重要です。以下の表では、標準ベンチマークにおける各モデルサイズのパフォーマンスを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
分析#
データが示すとおり、YOLOv9はパラメーター効率において明確な優位性を維持しています。YOLOv9cモデルは、わずか25.3M個のパラメーターで、優れた53.0 mAPを達成しており、非常に軽量です。
一方、RTDETRv2は中規模から大規模のモデルカテゴリで強力な競争力を発揮します。ただし、Transformerモデルに典型的な、より多いパラメーター数と大幅に大きいFLOPsというコストを伴います。このアーキテクチャの違いはメモリ使用量にも表れます。YOLOモデルは通常、Transformerベースのモデルと比較して、学習時と推論時の両方で必要なCUDAメモリが大幅に少なくなります。
Ultralyticsの優位性:エコシステムと汎用性#
純粋なアーキテクチャ指標も重要ですが、ソフトウェアエコシステムがAIプロジェクトの成否を左右することも少なくありません。Ultralytics Python APIを通じてこれらの高度なモデルにアクセスすることで、他に類を見ない利点が得られます。
効率化された学習とデプロイ#
検出トランスフォーマーのトレーニングには通常、複雑な設定ファイルとハイエンドGPUが必要です。Ultralytics frameworkを利用することで、開発者は同一のシンプルな構文でYOLOv9モデルとRT-DETRモデルの両方をトレーニングでき、効率の高いトレーニングパイプラインとすぐに利用可能な事前トレーニング済み重みの恩恵を受けることができます。
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")比類のないタスク汎用性#
RTDETRv2のような特化型モデルの大きな制限の1つは、バウンディングボックス検出に焦点が限定されていることです。これに対して、YOLO11やYOLOv8などのモデルを含む、より広範なUltralyticsエコシステムは、多様なコンピュータビジョンタスクをサポートしています。これには、ピクセル単位で正確なインスタンスセグメンテーション、骨格ベースの姿勢推定、画像全体の分類、および航空画像向けの回転バウンディングボックス(OBB)検出が含まれます。
実世界での用途#
高速エッジ分析#
エッジデバイス上でリアルタイムの商品認識が求められる小売環境や製造ラインでは、YOLOv9が優れた選択肢です。そのGELANアーキテクチャにより、NVIDIA Jetsonシリーズのようなリソースが限られたハードウェア上でも高いスループットを実現し、大幅な遅延なしで自動品質管理を可能にします。
複雑なシーンの分析#
高密度な群衆監視や複雑な交通交差点など、物体同士が頻繁に遮蔽し合うシナリオでは、RTDETRv2のグローバルアテンションメカニズムが力を発揮します。画像全体のコンテキストをネイティブに推論できるため、物体が部分的に隠れている場合でも、堅牢な追跡と検出を維持できます。
ユースケースと推奨事項#
YOLOv9とRT-DETRのどちらを選ぶかは、具体的なプロジェクト要件、デプロイ制約、エコシステムに関する好みによって決まります。
YOLOv9を選ぶタイミング#
YOLOv9が適しているケース:
- 情報ボトルネックの研究: プログラマブル勾配情報(PGI)および汎用効率的レイヤー集約ネットワーク(GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と軽減に重点を置く研究。
- 高精度検出のベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の優れたCOCOベンチマーク性能が必要なシナリオ。
RT-DETRを選択するケース#
RT-DETRは次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使用しないエンドツーエンド物体検出のために、アテンションメカニズムやTransformerアーキテクチャを研究するプロジェクト。
- 柔軟なレイテンシーを許容できる高精度シナリオ: 検出精度を最優先し、やや高い推論レイテンシーを許容できるアプリケーション。
- 大きな物体の検出: 主に中型から大型の物体が存在し、Transformerのグローバルアテンションメカニズムが本質的な優位性を発揮するシーン。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
未来:YOLO26の登場#
YOLOv9とRTDETRv2は大きな成果を示していますが、コンピュータビジョン分野は急速に進化しています。新しいプロジェクトを開始する開発者には、最先端の推奨ソリューションとして**YOLO26**をお勧めします。
2026年にリリースされたYOLO26は、CNNとDETRの両方の優れた機能を取り入れています。エンドツーエンドNMSフリーデザインを備え、後処理レイテンシーを完全に排除しています。これはYOLOv10が初めて導入した手法です。さらに、YOLO26はエッジとの互換性を高めるために分布フォーカル損失(DFL)を廃止し、革新的なMuSGD Optimizerを導入しています。大規模言語モデルの学習、特にMoonshot AIのKimi K2から着想を得たこのハイブリッドオプティマイザーにより、かつてない学習安定性と、より高速な収束を実現します。
ProgLossやSTALなどの改良された損失関数と組み合わせることで、小さな物体を優れた精度で認識できるYOLO26は、最大43%高速なCPU推論を実現し、現代のAIデプロイメントにおける究極のモデルとしての地位を確立しています。