YOLOv9とRTDETRv2#
リアルタイム物体検出の分野は、近年パラダイムシフトを経験しています。この分野では、最適化された畳み込みニューラルネットワーク(CNNs)とリアルタイム検出Transformer(DETRs)という、異なる2つのアーキテクチャ思想が主流になっています。それぞれのアプローチを代表する最高峰のモデルが、YOLOv9とRTDETRv2です。
この包括的なガイドでは、2つの強力なモデルを比較し、アーキテクチャの革新、性能指標、最適なデプロイシナリオを分析することで、コンピュータービジョンのパイプラインに合ったモデル選びを支援します。
概要#
どちらのモデルも最先端の結果を達成しますが、デプロイの制約や開発エコシステムに応じて、適した用途が少し異なります。
- YOLOv9を選ぶ場合: パラメーターを非常に効率よく利用し、エッジデバイスで高速に推論する必要がある場合に適しています。YOLOv9はCNNの効率性における理論上の限界を押し広げており、計算リソースが厳しく制限される環境に最適です。
- RTDETRv2を選ぶ場合: Transformerがもたらす詳細なコンテキスト理解が必要で、特に深刻なオクルージョンや複雑なオブジェクト間の関係があるシーンを扱い、やや大規模なアーキテクチャを支えるハードウェアがある場合に適しています。
- YOLO26を選ぶ場合(推奨): 両方の長所を最大限に活用したい場合に適しています。Ultralytics Platformで利用できる最新世代のYOLO26は、オプションのエンドツーエンドNMSフリーデザイン(
nms=False。DETRモデルに似ていますが、はるかに高速です)を備え、後処理のボトルネックを解消して、従来世代よりCPU推論を最大43%高速化します。
技術仕様と開発者#
これらのモデルの起源と設計意図を理解することは、アーキテクチャの選択を把握するうえで重要です。
YOLOv9#
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織:中央研究院情報科学研究所
- 日付: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
RTDETRv2#
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
アーキテクチャの革新#
YOLOv9:情報ボトルネックの解消#
YOLOv9は、深層ニューラルネットワークを通過するデータの情報損失に対処するため、2つの主要な革新を導入しています。
- プログラマブル勾配情報(PGI): この補助的な教師あり学習フレームワークにより、ネットワークの重みを更新するための信頼性の高い勾配が生成され、非常に深いネットワーク層でも重要な特徴情報が保持されます。
- 汎用効率的レイヤー集約ネットワーク(GELAN): CSPNetとELANの長所を組み合わせた新しいアーキテクチャです。GELANはパラメーター効率を最適化し、従来のCNNと比較して、より少ないFLOPsでYOLOv9の精度を高めます。
RTDETRv2:リアルタイムTransformerの強化#
オリジナルのRT-DETRの成功を基盤として、RTDETRv2はTransformerベースのアーキテクチャを採用し、Non-Maximum Suppression(NMS)を必要としない設計を実現しています。主な改良点は次のとおりです。
- Bag-of-Freebies戦略: v2では、高度なトレーニング手法とデータ拡張を取り入れ、推論レイテンシーにオーバーヘッドを加えることなく精度を大幅に向上させています。
- 効率的なハイブリッドエンコーダー: スケール内およびスケール間の注意機構を分離し、マルチスケール特徴を処理することで、RTDETRv2はVision Transformerに従来伴っていた高い計算コストを効率的に抑えます。
RTDETRv2はNMSを使用しない検出にTransformerを活用しますが、新しいYOLO26アーキテクチャは、高度に最適化されたCNN構造内でオプションのone-to-oneヘッド(nms=False)を使用してこれを実現します。これにより、同様にシンプルなデプロイを可能にしながら、エッジでの推論速度を大幅に高めています。
パフォーマンス比較#
本番環境向けのモデルを評価する際には、精度と計算要件のトレードオフが重要です。以下の表では、標準的なベンチマークにおける各モデルサイズの性能を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
分析#
データが示すように、YOLOv9はパラメーター効率で明確な優位性を維持しています。YOLOv9cモデルは、わずか25.5Mのパラメーターで53.0 mAPを達成し、非常に軽量です。
一方、RTDETRv2は中規模から大規模のモデルカテゴリーで強力な競争力を発揮します。ただし、Transformerモデルに典型的な、より多くのパラメーターと大幅に大きなFLOPsを伴います。このアーキテクチャの違いはメモリ使用量にも表れます。YOLOモデルは通常、学習時と推論時の両方で、Transformerモデルよりも大幅に少ないCUDAメモリしか必要としません。
Ultralyticsの強み:エコシステムと汎用性#
純粋なアーキテクチャ指標も重要ですが、ソフトウェアエコシステムがAIプロジェクトの成否を左右することも少なくありません。Ultralytics Python APIを通じてこれらの高度なモデルを利用すると、比類のないメリットが得られます。
効率的な学習とデプロイ#
Detection Transformerの学習には、通常、複雑な設定ファイルとハイエンドGPUが必要です。Ultralyticsフレームワークを活用すれば、開発者はYOLOv9とRT-DETRの両方を同じシンプルな構文で学習でき、効率的な学習パイプラインとすぐに利用できる事前学習済み重みによるメリットも得られます。
from ultralytics import RTDETR, YOLO
# YOLOv9モデルを学習する
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# まったく同じAPIを使ってRTDETRモデルを学習する
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# モデルをOpenVINOまたはTensorRTにスムーズにエクスポートする
model_yolo.export(format="openvino")比類のないタスク対応力#
RTDETRv2のような専用モデルの大きな制約は、バウンディングボックス検出に用途が限定されることです。対照的に、YOLO11やYOLOv8などのモデルを含む、より幅広いUltralyticsエコシステムは、多様なコンピュータービジョンタスクに対応しています。これには、ピクセル単位の精度を実現するインスタンスセグメンテーション、骨格に基づく姿勢推定、画像全体の分類、航空画像向けのOriented Bounding Box(OBB)検出が含まれます。
実際の用途#
エッジでの高速分析#
エッジデバイス上でリアルタイムの商品認識が必要な小売環境や製造ラインには、YOLOv9が最適です。GELANアーキテクチャにより、NVIDIA Jetsonシリーズなどのリソースが限られたハードウェアでも高いスループットを実現し、大幅な遅延なく品質管理を自動化できます。
複雑なシーンの分析#
人混みの監視や複雑な交通交差点など、物体同士が頻繁に遮蔽し合う状況では、RTDETRv2のグローバルな注意機構が力を発揮します。画像全体のコンテキストをネイティブに推論できるため、物体の一部が隠れていても、堅牢な追跡と検出を維持できます。
ユースケースと推奨事項#
YOLOv9とRT-DETRのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムの好みによって異なります。
YOLOv9を選ぶ場合#
YOLOv9が適している用途:
- 情報ボトルネックの研究: プログラム可能な勾配情報(PGI)や一般化効率的層集約ネットワーク(GELAN)のアーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と抑制に焦点を当てた研究。
- 高精度検出のベンチマーク: アーキテクチャの比較において、YOLOv9の優れたCOCOベンチマーク性能を基準として必要とするシナリオ。
RT-DETRを選ぶケース#
RT-DETRは、次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
次世代モデル:YOLO26の登場#
YOLOv9とRTDETRv2は大きな成果を示していますが、コンピュータービジョンの分野は急速に進化しています。新しいプロジェクトを始める開発者には、最先端のソリューションとしてYOLO26を推奨します。
2026年にリリースされたYOLO26は、CNNとDETRの優れた特徴を取り入れています。オプションのエンドツーエンドNMSフリーデザイン(nms=False)を備え、NMSの後処理を排除します。この手法はYOLOv10で初めて導入されました。さらに、YOLO26はエッジデバイスとの互換性を高めるためにDistribution Focal Loss(DFL)を廃止し、革新的なMuSGD Optimizerを導入しています。大規模言語モデルの学習、特にMoonshot AIのKimi K2に着想を得たこのハイブリッドオプティマイザーは、これまでにない学習の安定性と高速な収束を実現します。
小さな物体の認識に優れたProgLossとSTAL(Progressive Loss and Small-Target-Aware Label Assignment)を組み合わせることで、YOLO26はCPU推論を最大43%高速化し、最新のAIデプロイに最適なモデルとしての地位を確立しています。