RTDETRv2 vs PP-YOLOE+#
急速に進化するコンピュータービジョン分野では、複雑なリアルタイム物体検出の課題を解決するため、多様なアーキテクチャアプローチが生み出されています。近年の特に注目すべき進歩として、RTDETRv2と**PP-YOLOE+**が挙げられます。これらは、ビジュアル認識に対して根本的に異なる設計思想でアプローチする、強力な2つのモデルです。どちらも高性能な検出を目指していますが、基盤となる仕組み、学習パラダイム、理想的なデプロイシナリオは大きく異なります。
この包括的なガイドでは、両モデルの技術的な特徴を詳しく解説し、アーキテクチャ、パフォーマンス指標、エコシステムのサポートを比較することで、開発者や研究者がそれぞれのデプロイ要件に最適なソリューションを選択できるよう支援します。
モデルの概要#
パフォーマンスデータを分析する前に、各モデルの起源とアーキテクチャ上の目標を理解することが重要です。どちらもBaiduの研究チームから生まれましたが、物体検出の系譜における異なる系統を代表しています。
RTDETRv2#
RTDETRv2は、Transformerベースのビジョンアーキテクチャにおける大きな飛躍を表しています。元のリアルタイム検出Transformerを基盤として、効率的なハイブリッドエンコーダーと組み合わせた柔軟なビジョンTransformerバックボーンを活用します。最も特徴的なのは、本質的にエンドツーエンドで予測できる点であり、ポストプロセス中の非最大抑制(NMS)を完全に不要にします。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETRリポジトリ
PP-YOLOE+#
PP-YOLOE+は、YOLOシリーズの高度な改良版であり、高性能な産業用途向けに大幅に最適化されています。アンカーフリーの検出ヘッドを備えた、スケーラブルなCNNアーキテクチャを採用しています。速度と精度の優れたトレードオフを実現するよう設計されており、ET-headや一般化フォーカルロス関数などの強力な技術を導入して、小物体検出を改善します。
- 著者: PaddlePaddle 開発者
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetectionリポジトリ
両モデルには独立した研究リポジトリがありますが、Ultralytics Pythonパッケージ内でRTDETRv2を直接簡単に試すことができ、統一されたAPIと効率化されたエクスポートオプションを利用できます。
アーキテクチャの違い#
この2つのモデルの根本的な違いは、ビジュアルコンテキストを処理して予測を生成する方法にあります。
PP-YOLOE+は、従来型ながら高度に最適化された畳み込みニューラルネットワーク(CNN)バックボーンを使用します。局所的な受容野に依存して特徴を抽出するため、標準的なデプロイでは非常に高速かつ効率的です。ただし、重複するバウンディングボックスをフィルタリングするために標準的なNMSポストプロセスが必要であり、密集したシーンではレイテンシーのボトルネックが生じる可能性があります。
一方、RTDETRv2はハイブリッドエンコーダーとTransformerデコーダーを採用しています。これにより、画像全体のグローバルコンテキストを同時に捉えることができます。アテンションメカニズムが物体間の関係を本質的に理解するため、NMSなしで最終的なバウンディングボックスを直接出力できます。このエンドツーエンドのアプローチにより、検出する物体数にかかわらず、推論レイテンシーが安定します。
パフォーマンス指標と比較#
YOLOのパフォーマンス指標を評価する際は、精度(mAP)と計算コスト(FLOPs)、推論速度のバランスを取ることが重要です。以下の表では、さまざまなサイズにおける両モデルのパフォーマンスを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
PP-YOLOE+xはCOCOデータセットで54.7%というわずかに高いmAPvalを達成していますが、RTDETRv2モデルは一般に、NMS不要の設計による一貫したレイテンシーという利点を備えつつ、競争力のある精度を提供します。ただし、PP-YOLOE+は小型モデルにおけるパラメーター数とFLOPsで明確な優位性を維持しており、エッジデプロイメントに非常に適しています。
Ultralyticsの優位性:YOLO26の登場#
RTDETRv2とPP-YOLOE+はそれぞれ優れた性能を発揮しますが、最先端技術は進化を続けています。速度、精度、エコシステムサポートの最適なバランスを求める開発者にとって、Ultralytics YOLO26は新たな業界標準です。
YOLO26は、CNNとTransformerの両方の長所を統合しています。最新のアーキテクチャによって先導されたエンドツーエンドNMSフリー設計を採用し、ポストプロセスのボトルネックを効果的に排除します。さらに、LLMの学習における革新的な取り組みに着想を得たハイブリッドアプローチである画期的なMuSGD Optimizerを導入し、非常に安定した学習と迅速な収束を実現します。
大容量のCUDAメモリを必要とする重量級Transformerモデルとは異なり、YOLO26はDFL Removal(分布フォーカルロス)を備え、エッジコンピューティング向けに特別に最適化されています。これにより、従来世代と比較してCPU推論が最大43%高速になります。
さらに、YOLO26は単純な物体検出に限定されません。標準でインスタンスセグメンテーション、ポーズ推定、指向性バウンディングボックス(OBB)をサポートする、本質的に汎用性の高いモデルです。一方、PP-YOLOE+は主にバウンディングボックス検出に特化しています。
トレーニング手法とエコシステム#
Ultralyticsエコシステムは、独立した研究リポジトリと比較して、学習効率と使いやすさの点で真価を発揮します。PP-YOLOE+はPaddlePaddleフレームワークに依存し、RTDETRv2では複雑な環境構築が必要になることが多い一方、Ultralyticsを介してモデルを統合すれば、シームレスなエクスペリエンスを利用できます。
Ultralytics APIを使用すると、学習中のメモリ要件の削減、自動化されたデータセット処理、簡素化されたハイパーパラメーター調整というメリットが得られます。さらに、モデルをONNXやTensorRTなどの本番環境向けフォーマットに、1つのコマンドでデプロイできます。
コード例: 効率化された推論#
以下では、Ultralytics Pythonパッケージを使用して、RTDETRv2と推奨モデルであるYOLO26を簡単に利用する方法を示します。
from ultralytics import RTDETR, YOLO
# Initialize the RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Perform NMS-free inference on a test image
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()
# For superior speed and versatility, initialize the latest YOLO26 model
model_yolo26 = YOLO("yolo26n.pt")
# Train the YOLO26 model effortlessly with optimized memory usage
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)
# Export to TensorRT for edge deployment
model_yolo26.export(format="engine")実際のアプリケーションとユースケース#
これらのアーキテクチャのどちらを選ぶかは、具体的なハードウェアとアプリケーションの要件によって決まることが多くなります。
- RTDETRv2は、サーバーサイド環境と複雑なシーン理解に優れています。グローバルアテンションメカニズムにより、群衆管理や、重複する物体によって標準的なNMSアルゴリズムが失敗しやすい密集した医用画像分析に非常に効果的です。
- **PP-YOLOE+**は、高速な産業検査や、PaddlePaddleエコシステムを中心に構築された環境に非常に適しています。小さいスケールでのパラメーター数が少ないため、特定のロボティクス用途にも利用できます。
- Ultralytics YOLO26は、包括的な商用デプロイに広く推奨されるソリューションです。強化されたProgLoss + STAL関数により、航空ドローン運用やスマートシティの交通監視に不可欠な小物体認識を大幅に向上させます。
ユースケースと推奨事項#
RT-DETRとPP-YOLOE+のどちらを選ぶかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムに関する好みによって決まります。
RT-DETRを選択するケース#
RT-DETRが適しているケース:
- Transformerベースの検出研究: NMSを使用しないエンドツーエンド物体検出のために、アテンションメカニズムやTransformerアーキテクチャを研究するプロジェクト。
- 柔軟なレイテンシーを許容できる高精度シナリオ: 検出精度を最優先し、やや高い推論レイテンシーを許容できるアプリケーション。
- 大きな物体の検出: 主に中型から大型の物体が存在し、Transformerのグローバルアテンションメカニズムが本質的な優位性を発揮するシーン。
PP-YOLOE+ を選択するケース#
PP-YOLOE+ は次の用途に推奨されます。
- PaddlePaddle エコシステムとの統合: 既存のインフラストラクチャがBaidu の PaddlePaddleフレームワークとツールで構築されている組織。
- Paddle Lite エッジデプロイ: Paddle Lite または Paddle 推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- 高精度なサーバーサイド検出: フレームワークへの依存が問題にならず、高性能 GPU サーバー上で最大限の検出精度を優先するシナリオ。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
まとめ#
RTDETRv2とPP-YOLOE+はどちらもコンピュータービジョンの可能性の限界を押し広げ、Transformerアーキテクチャと高度に最適化されたCNNアーキテクチャの双方が実用可能であることを証明しました。しかし、分散した研究コードベースのデプロイの複雑さが、本番環境への移行スケジュールの妨げになる可能性があります。
最新のAIエンジニアにとって、Ultralytics Platformの活用は他に類を見ない優位性をもたらします。YOLO11や最先端のYOLO26のようなシームレスに統合されたモデルへ移行することで、チームはメモリ要件と開発オーバーヘッドを大幅に削減しながら、可能な限り高い精度と速度の比率を実現できます。