PP-YOLOE+とRTDETRv2の比較#
コンピュータービジョンの分野は近年、特にリアルタイム物体検出の領域で劇的な進化を遂げています。デプロイに適したアーキテクチャを選ぶことは、動作が遅くメモリを大量に消費するアプリケーションと、高度に最適化された応答性の高いシステムの差を生む可能性があります。この技術比較では、Baiduが開発した代表的な2つのモデル、CNNベースのPP-YOLOE+とTransformerベースのRTDETRv2を検証します。両モデルのアーキテクチャ、性能指標、理想的なユースケースを分析するとともに、最先端のUltralytics YOLO26プラットフォームとの比較も行います。
PP-YOLOE+:CNNのパラダイムを前進させる#
前身モデルを発展させる形で開発されたPP-YOLOE+は、従来の畳み込みニューラルネットワーク(CNN)が物体検出で実現できる可能性をさらに広げています。YOLOシリーズの基本的な仕組みを土台としながら、PaddlePaddleエコシステム向けの最適化を導入した、高性能なアンカーフリー検出器です。
モデルの詳細:
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetectionリポジトリ
- ドキュメント: PP-YOLOE+ドキュメント
アーキテクチャと手法#
PP-YOLOE+は、高度に最適化されたバックボーンと独自の特徴ピラミッドネットワークを用いて、マルチスケールの特徴を効果的に統合します。アンカーフリー設計により、通常はアンカーボックスの生成に必要となるヒューリスティックな調整が簡素化されます。さらに、学習方法には高度なラベル割り当て戦略が含まれており、学習時に予測結果と正解ボックスをより適切に対応付けます。
強みとユースケース#
PP-YOLOE+の主な強みは、標準的なサーバーハードウェアで安定した性能を発揮することと、Baiduのツールと深く統合されていることです。ハードウェアの制約がそれほど厳しくない製造環境での静的な欠陥検出など、従来型の産業ワークフローに適しています。
PP-YOLOE+は高い精度を実現しますが、ネイティブのエコシステム外にデプロイする場合、追加の変換手順が必要になることがあります。これは、最新のUltralyticsパイプラインで利用できるネイティブのエクスポート形式とは異なる点です。
RTDETRv2:リアルタイム検出Transformer#
純粋なCNNから発展したRTDETRv2(リアルタイム検出Transformerバージョン2)は、コンピュータービジョンタスクにおけるアテンションベースの手法への移行を象徴しています。Transformerのグローバルなコンテキスト理解と、実環境のアプリケーションに求められる低レイテンシの両立を目指しています。
モデルの詳細:
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2リポジトリ
- ドキュメント: RTDETRv2のREADME
アーキテクチャと手法#
RTDETRv2は、特徴抽出用のCNNバックボーンと、簡素化されたTransformerのエンコーダー・デコーダーを組み合わせたハイブリッドアーキテクチャを採用しています。RTDETRv2の大きな特徴は、従来の非最大値抑制(NMS)による後処理を省略する、ネイティブなエンドツーエンド設計です。また、マルチスケール検出や複雑なシーンへの対応も導入しており、セルフアテンションを活用して離れた物体間の空間的な関係を理解します。
強みとユースケース#
Transformerアーキテクチャにより、RTDETRv2はグローバルなコンテキストの理解が重要なシナリオで高い効果を発揮します。ただし、Transformerモデルは一般に、軽量なCNNと比べて学習時と推論時の両方で大幅に多くのCUDAメモリを必要とします。高性能なGPUサーバーで実行するクラウドベースの動画分析など、ハードウェアに制約のない環境に最適です。
パフォーマンスと指標の比較#
これらのモデルを評価する際には、平均適合率(mAP)と計算コスト(FLOPsおよび推論レイテンシで測定)のトレードオフが重要です。以下の表では、PP-YOLOE+とRTDETRv2の各スケールにおける主な指標を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2は高いmAPを示す一方で、パラメーター数とFLOPsが増加します。制約のあるエッジデバイスへのデプロイを検討する開発者は、Transformer層に一般的な大量のメモリ要件がボトルネックになることがよくあります。
ユースケースと推奨事項#
PP-YOLOE+とRT-DETRのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムの好みによって異なります。
PP-YOLOE+を選ぶ場合#
PP-YOLOE+は、次のような用途に適しています。
- PaddlePaddleエコシステムとの統合: BaiduのPaddlePaddleフレームワークとツールを基盤とする既存インフラストラクチャを持つ組織。
- Paddle Liteによるエッジデプロイ: Paddle LiteまたはPaddle推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- サーバー側での高精度検出: フレームワークへの依存が問題にならない、強力なGPUサーバー上で検出精度を最大化することを優先するシナリオ。
RT-DETRを選ぶケース#
RT-DETRは、次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの強み:YOLO26の紹介#
PP-YOLOE+とRTDETRv2はいずれも重要なマイルストーンですが、現代の開発者には、卓越した性能と使いやすさを両立するエコシステムが求められています。Ultralytics Platformと画期的なYOLO26モデルは、まさにそれを実現します。
2026年1月にリリースされたYOLO26は、エッジを最優先とするビジョンAIの新たな標準を確立します。旧来のアーキテクチャに伴うデプロイ上の課題を効果的に解決し、速度と精度の両面で旧来のモデルを上回ります。
アーキテクチャの革新#
YOLO26は、従来のCNNや大規模なTransformerを凌駕する、先進的な機能強化をいくつも導入しています。
- エンドツーエンドのNMSフリー設計: RTDETRv2と同様に、YOLO26はネイティブなエンドツーエンド推論に対応しています。オプションのワンツーワンヘッド(
nms=False)を使用して非最大値抑制(NMS)による後処理を省略することで、レイテンシのばらつきを抑えながら、より高速で簡単なデプロイを実現します。リアルタイムのロボティクスや自律システムに最適です。 - CPU推論が最大43%高速: アーキテクチャを深く最適化することで、YOLO26はディスクリートGPUを搭載しないエッジデバイス上で競合モデルを大幅に上回る性能を発揮し、IoTやスマートシティのアプリケーションに最適な選択肢となります。
- MuSGDオプティマイザー: LLMの学習における技術革新に着想を得たYOLO26は、SGDとMuonを組み合わせたハイブリッド方式を採用しています。これにより、学習過程がより安定し、収束が大幅に高速化されるため、GPUの学習時間を大きく削減できます。
- ProgLoss + STAL: これらの高度な損失関数は、小物体認識を大きく改善します。この分野はPP-YOLOE+などのモデルが従来苦手としてきた領域であり、航空画像やドローンのアプリケーションで重要な役割を果たします。
- DFLの削除: Distribution Focal Lossを削除することでエクスポートプロセスが簡素化され、さまざまなエッジデバイスや低消費電力デバイスとのシームレスな互換性が確保されます。
特化型の物体検出器とは異なり、YOLO26は高い汎用性を備えており、インスタンスセグメンテーション、姿勢推定、分類、回転バウンディングボックス(OBB)に対応しています。姿勢推定向けのRLEや、OBB向けの専用角度損失など、タスクに合わせた機能強化も含まれています。
比類のない使いやすさ#
RTDETRv2のような複雑なアーキテクチャを採用する際の大きな課題の一つは、学習曲線が急で、統合プロセスが分断されていることです。Ultralyticsエコシステムでは、直感的なPython APIと包括的なWebベースのプラットフォームを通じて、こうした複雑さをすべて抽象化しています。
カスタムデータセットの学習でも、手軽な推論の実行でも、プロセスはシームレスです。
from ultralytics import RTDETR, YOLO
# 最先端のYOLO26モデルを初期化する
model_yolo = YOLO("yolo26n.pt")
# または、同じシンプルなAPIを使ってRT-DETRモデルを初期化します
model_rtdetr = RTDETR("rtdetr-l.pt")
# 手軽にリアルタイム推論を実行します
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# 1行でエッジデプロイ向けにエクスポートします
model_yolo.export(format="engine", quantize=16)Ultralytics YOLOモデルは一般に必要なメモリが少ないため、Transformerベースのモデルと比べて、より高速な学習と低コストのハードウェアへのデプロイが可能です。さらに、活発な開発と世界水準のドキュメントにより、本番環境のパイプラインを安定して運用できます。
ほかの選択肢を検討しているチームにとって、YOLO11はエコシステム内で引き続き手厚くサポートされている高性能な旧世代モデルであり、レガシーハードウェアとの統合に適した優れたベースラインとなります。YOLO11とRT-DETRの比較もぜひご覧ください。
概要#
PP-YOLOE+とRTDETRv2はそれぞれ、高度なCNNパイプラインとリアルタイムTransformerの実用性を示し、コンピュータービジョンの発展に大きく貢献してきました。しかし、2026年に堅牢で汎用性が高く、高度に最適化されたコンピュータービジョンアプリケーションのデプロイを目指す組織にとって、Ultralytics YOLO26は他に類を見ないソリューションです。オプションのNMSフリー推論、大幅に高速化されたCPU推論、効率的なエコシステムにより、開発者は構想からスケーラブルな本番運用まで、これまで以上に迅速に移行できます。