RTDETRv2とPP-YOLOE+の比較#
急速に進化するコンピュータービジョンの分野では、多様なアーキテクチャが複雑なリアルタイム物体検出の課題に取り組んでいます。最近の特に注目すべき進歩として、設計思想が根本的に異なる強力なモデル、RTDETRv2とPP-YOLOE+が挙げられます。どちらも高性能な検出を目指していますが、基盤となる仕組み、トレーニング方式、理想的なデプロイシナリオには大きな違いがあります。
この包括的なガイドでは、両モデルの技術的な詳細を掘り下げ、アーキテクチャ、性能指標、エコシステムのサポートを比較します。開発者や研究者が、それぞれのデプロイ要件に最適なソリューションを選ぶ際にお役立てください。
モデルの概要#
性能データを分析する前に、各モデルの起源とアーキテクチャの目標を理解しておくことが重要です。どちらもBaiduの研究チームから生まれましたが、物体検出の系譜では異なる系統に属しています。
RTDETRv2#
RTDETRv2は、Transformerベースのビジョンアーキテクチャにおける大きな進歩です。初代Real-Time Detection Transformerを発展させ、CNNバックボーンと効率的なハイブリッドエンコーダー、Transformerデコーダーを組み合わせています。最大の特徴は、ネイティブにエンドツーエンドの予測が可能な点であり、後処理における非最大抑制 (NMS) を完全に不要にします。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETRリポジトリ
PP-YOLOE+#
PP-YOLOE+はYOLOシリーズの高度なバージョンであり、高性能な産業用途向けに大幅に最適化されています。スケーラブルなCNNアーキテクチャとアンカーフリーの検出ヘッドを備えています。速度と精度の優れたバランスを実現するため、ET-headや汎用化されたFocal Loss関数などの強力な手法を導入し、小さな物体の検出を改善します。
- 著者: PaddlePaddleの著者
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetectionリポジトリ
どちらのモデルにも独立した研究リポジトリがありますが、Ultralytics Pythonパッケージ内で初代RT-DETRを簡単に試すこともできます。統合されたAPIと効率的なエクスポートオプションを活用できます。
アーキテクチャの違い#
この2つのモデルの根本的な違いは、視覚的なコンテキストの処理方法と予測の生成方法にあります。
PP-YOLOE+は、従来型ながらも高度に最適化された畳み込みニューラルネットワーク (CNN) のバックボーンを採用しています。局所受容野を使って特徴を抽出するため、標準的なデプロイで非常に高速かつ効率的です。ただし、重なり合うバウンディングボックスを除外する標準的なNMS後処理が必要で、物体が密集したシーンではレイテンシーのボトルネックになる可能性があります。
一方、RTDETRv2はハイブリッドエンコーダーとTransformerデコーダーを採用しています。これにより、モデルは画像全体のグローバルコンテキストを同時に捉えられます。アテンション機構は物体間の関係を本質的に理解し、NMSを使わずに最終的なバウンディングボックスを直接出力します。このエンドツーエンド方式により、検出する物体の数に関係なく推論レイテンシーが安定します。
性能指標と比較#
YOLOの性能指標を評価する際は、精度 (mAP)、計算コスト (FLOPs)、推論速度のバランスが重要です。以下の表では、さまざまなモデルサイズにおける両モデルの性能を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
PP-YOLOE+xはCOCOデータセットで54.7%のmAPvalを達成し、わずかに上回ります。一方、RTDETRv2モデルは、NMSフリー設計による一貫したレイテンシーの利点を備えながら、概して競争力のある精度を実現します。ただし、小型モデルではパラメーター数とFLOPsの面でPP-YOLOE+が明確に優位なため、エッジデプロイで非常に効率的です。
Ultralyticsの強み:YOLO26の登場#
RTDETRv2とPP-YOLOE+はいずれも優れたモデルですが、最先端技術は進化を続けています。速度、精度、エコシステムのサポートを最高のバランスで実現したい開発者には、Ultralytics YOLO26が新たな業界標準となります。
YOLO26は、CNNとTransformerの優れた特長を組み合わせています。最新のアーキテクチャで先駆けて採用されたオプションのエンドツーエンドNMSフリー推論モード (nms=False) を導入し、有効にすると後処理のボトルネックを解消します。さらに、LLMトレーニングの革新に着想を得たハイブリッド方式の画期的なMuSGDオプティマイザーを導入し、非常に安定したトレーニングと迅速な収束を実現します。
大量のCUDAメモリを必要とする重いTransformerモデルとは異なり、YOLO26はDFLの削除 (Distribution Focal Loss) を採用し、エッジコンピューティング向けに特化して最適化されています。前世代よりもCPU推論を最大43%高速化します。
さらに、YOLO26は単純な物体検出にとどまりません。ネイティブに高い汎用性を備え、インスタンスセグメンテーション、姿勢推定、回転バウンディングボックス (OBB)を標準でサポートします。一方、PP-YOLOE+は主にバウンディングボックス検出に特化しています。
トレーニング手法とエコシステム#
スタンドアロンの研究リポジトリと比べると、トレーニング効率と使いやすさはUltralyticsエコシステムの優れた点です。PP-YOLOE+はPaddlePaddleフレームワークに依存し、RTDETRv2では複雑な環境構築が必要になることが多い一方、Ultralyticsを通じてモデルを統合すれば、シームレスに利用できます。
Ultralytics APIを使うと、トレーニング時のメモリ要件の低減、データセット処理の自動化、ハイパーパラメーター調整の簡素化といったメリットが得られます。さらに、ONNXやTensorRTなどの本番環境向け形式へのモデルのデプロイも、単一のコマンドで実行できます。
コード例:効率化された推論#
以下では、Ultralytics Pythonパッケージを使い、RT-DETRと推奨モデルのYOLO26を簡単に利用する方法を紹介します。
from ultralytics import RTDETR, YOLO
# RT-DETRモデルを初期化します (Ultralyticsは初代RT-DETR-LとRT-DETR-Xをサポートしています)
model_rtdetr = RTDETR("rtdetr-l.pt")
# テスト画像でNMSフリー推論を実行します
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()
# 優れた速度と汎用性を得るため、最新のYOLO26モデルを初期化します
model_yolo26 = YOLO("yolo26n.pt")
# メモリ使用量を最適化してYOLO26モデルを簡単にトレーニングします
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)
# エッジデプロイ向けにTensorRTへエクスポート
model_yolo26.export(format="engine")実世界での用途とユースケース#
これらのアーキテクチャのどちらを選ぶかは、多くの場合、具体的なハードウェアとアプリケーションの要件によって決まります。
- RTDETRv2は、サーバーサイド環境や複雑なシーンの理解に優れています。グローバルアテンション機構により、群衆管理や高密度な医療画像解析で非常に高い効果を発揮します。こうした場面では、物体の重なりによって標準的なNMSアルゴリズムが機能しなくなることがよくあります。
- PP-YOLOE+は、高速な産業検査や、PaddlePaddleエコシステムを全面的に活用する環境に非常に適しています。小規模なモデルではパラメーター数が少ないため、一部のロボティクス用途にも有効です。
- Ultralytics YOLO26は、幅広い商用デプロイに推奨できる汎用的なソリューションです。強化されたProgLoss + STAL機能により、航空ドローン運用やスマートシティの交通監視で重要となる小さな物体の認識性能が大幅に向上します。
ユースケースと推奨事項#
RT-DETRとPP-YOLOE+のどちらを選ぶかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムに関する好みによって決まります。
RT-DETRを選ぶケース#
RT-DETRは、次のような用途に適しています。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
PP-YOLOE+を選ぶ場合#
PP-YOLOE+は、次のような用途におすすめです。
- PaddlePaddleエコシステムとの統合: BaiduのPaddlePaddleフレームワークとツールを基盤とする既存インフラストラクチャを持つ組織。
- Paddle Liteによるエッジデプロイ: Paddle LiteまたはPaddle推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- サーバー側での高精度検出: フレームワークへの依存が問題にならない、強力なGPUサーバー上で検出精度を最大化することを優先するシナリオ。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
結論#
RTDETRv2とPP-YOLOE+は、コンピュータービジョンで可能なことの限界を押し広げ、Transformerと高度に最適化されたCNNアーキテクチャの両方が実用的であることを示しました。しかし、分断された研究用コードベースのデプロイが複雑なため、本番環境への導入スケジュールが遅れることがあります。
現代のAIエンジニアにとって、Ultralytics Platformを活用することは、他に類を見ない利点をもたらします。YOLO11や最先端のYOLO26のようなシームレスに統合されたモデルへ移行することで、メモリー要件と開発負荷を大幅に削減しながら、精度と速度の比率を最大限に高められます。