PP-YOLOE+ vs YOLOv9#
リアルタイムコンピュータービジョンの分野は絶えず変化しており、研究者や開発者は精度と推論速度の限界を継続的に押し広げています。PP-YOLOE+とYOLOv9を比較する際には、モデルアーキテクチャとエコシステム設計における2つの異なる理念を見ていくことになります。
この包括的な技術比較では、アーキテクチャの革新、パフォーマンス指標、トレーニング手法、理想的なユースケースを分析し、次のデプロイに適した物体検出モデルを選択できるようにします。
モデルの系譜と技術的基盤#
これらのモデルの起源とアーキテクチャ上の選択を理解することは、コンピュータービジョンプロジェクトへの適合性を判断するうえで重要です。
PP-YOLOE+ の概要#
BaiduのPaddlePaddle Authorsによって開発されたPP-YOLOE+は、2022年4月2日に発表されました。PaddleDetectionフレームワーク内の以前のイテレーションを基盤として、高性能な物体検出を実現します。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetectionリポジトリ
PP-YOLOE+は、PaddlePaddleエコシステムでのデプロイに重点を置いて最適化された、堅牢なアンカーフリーアーキテクチャを導入しています。変更を加えたCSPRepResNetバックボーンとET-headを利用して、特徴抽出とバウンディングボックス回帰を改善します。高い平均適合率 (mAP)を達成する一方で、PaddlePaddleフレームワークへの依存により、PyTorchやTensorFlowに慣れた開発者にとって統合時の問題が生じる場合があります。
YOLOv9の概要#
台湾の中央研究院情報科学研究所に所属するChien-Yao Wang氏とHong-Yuan Mark Liao氏によって発表されたYOLOv9は、ディープラーニングにおける情報ボトルネックを効率的に処理するうえで大きな飛躍を遂げています。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 所属機関: 台湾 中央研究院 情報科学研究所
- 日付: 2024-02-21
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
YOLOv9の大きなブレークスルーは、プログラマブル勾配情報 (PGI)です。これは、特徴が深層ニューラルネットワークを通過する際のデータ損失を防ぎます。一般化効率的レイヤー集約ネットワーク (GELAN)と組み合わせることで、YOLOv9はパラメーター効率と計算フローを最大化します。さらに、Ultralyticsエコシステムにネイティブ統合されているため、研究用途と商用アプリケーションのどちらでも利用しやすくなっています。
パフォーマンスとメトリクスの比較#
生のパフォーマンスを分析すると、YOLOv9は優れたパラメーター効率を示します。より少ないパラメーター数とFLOPsで同等以上の精度を達成するため、モデルのトレーニング時のVRAM要件を低減できます。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
表に示すように、YOLOv9cは53.0 mAPという高い性能を達成し、同等のPP-YOLOE+l(52.2M)よりもパラメーター数が大幅に少なくなっています(25.3M)。この低いメモリ使用量により、YOLOv9は限られたGPUリソースで作業する開発者にとって優れた選択肢となります。
エコシステム、汎用性、使いやすさ#
YOLOv9の最大の利点は、適切にメンテナンスされたUltralyticsエコシステムとのシームレスな統合にあります。PP-YOLOE+では複雑なPaddlePaddle設定ファイルを扱う必要がありますが、YOLOv9は合理化されたPython APIのメリットを得られます。
Ultralytics Python APIを使用すると、開発者は事前トレーニング済みの重みを読み込み、データ拡張を管理し、最小限のボイラープレートコードでトレーニングを開始できます。
from ultralytics import YOLO
# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Export the model to ONNX format
model.export(format="onnx")さらに、Ultralyticsエコシステムは比類のない汎用性を提供します。バウンディングボックス検出に加えて、フレームワークはインスタンスセグメンテーション、ポーズ推定、指向性バウンディングボックス (OBB)検出をネイティブにサポートします。これにより、モデルを複雑な実世界のパイプラインに非常に効率よく適応できます。
ユースケースと推奨事項#
PP-YOLOE+とYOLOv9のどちらを選択するかは、具体的なプロジェクト要件、デプロイの制約、エコシステムに関する предпочтенияによって決まります。
PP-YOLOE+ を選択するケース#
PP-YOLOE+は次のような場合に適しています:
- PaddlePaddle エコシステムとの統合: 既存のインフラストラクチャがBaidu の PaddlePaddleフレームワークとツールで構築されている組織。
- Paddle Lite エッジデプロイ: Paddle Lite または Paddle 推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- 高精度なサーバーサイド検出: フレームワークへの依存が問題にならず、高性能 GPU サーバー上で最大限の検出精度を優先するシナリオ。
YOLOv9を選ぶタイミング#
YOLOv9は次の用途に推奨されます。
- 情報ボトルネックの研究: プログラマブル勾配情報(PGI)および汎用効率的レイヤー集約ネットワーク(GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と軽減に重点を置く研究。
- 高精度検出のベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の優れたCOCOベンチマーク性能が必要なシナリオ。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
将来を見据えて: YOLO26の優位性#
PP-YOLOE+とYOLOv9はいずれも強力ですが、新たにリリースされたYOLO26は、本番環境における決定的な次のステップとなります。2026年1月にリリースされたYOLO26は、エッジコンピューティングとクラウドデプロイの新たな標準を確立します。画期的な革新を備えているため、すべての新しいコンピュータービジョンプロジェクトにYOLO26を強く推奨します。
- エンドツーエンドのNMSフリーデザイン: YOLO26はネイティブにエンドツーエンドで動作し、非最大抑制 (NMS)の後処理を完全に不要にします。これにより、デプロイパイプラインが大幅に簡素化され、レイテンシーが低減します。
- CPU推論が最大43%高速: エッジコンピューティング向けにアーキテクチャを特別に最適化することで、専用GPUを搭載していないハードウェア上でもYOLO26は大幅に高速に動作します。
- DFLの削除: Distribution Focal Lossを削除することで、エクスポートが簡素化され、低消費電力のエッジデバイスとの互換性が大幅に向上します。
- MuSGDオプティマイザー: 大規模言語モデルのトレーニング手法(Moonshot AIのKimi K2など)に着想を得た、SGDとMuonのハイブリッドです。非常に安定したトレーニングダイナミクスと高速な収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数により、小物体認識が大幅に改善されます。これは航空画像やロボティクスに不可欠なアップグレードです。
- タスク固有の改善: YOLO26には、セグメンテーション向けのマルチスケールprotoや、ポーズ推定向けの残差対数尤度推定 (RLE)など、特定のタスクに合わせたカスタムアーキテクチャが含まれています。
Ultralytics Platformを通じてYOLO26モデルを簡単にトレーニングおよびデプロイできます。Ultralytics Platformは、データセットのアノテーション、クラウドトレーニング、モデルモニタリングに対応したオールインワンソリューションです。
実世界での用途#
これらのアーキテクチャのどちらを選択するかは、多くの場合、対象とするデプロイ環境によって決まります。
**PP-YOLOE+**は、特にPaddlePaddle統合とBaiduのハードウェアスタックが企業インフラに深く組み込まれている地域で、産業用製造センターに導入されることが多くあります。厳格なリアルタイム制約よりも絶対的な精度が優先される静止画像分析で優れた性能を発揮します。
YOLOv9は、高速なリアルタイム推論が求められる動的な環境で優れた性能を発揮します。優れたパラメーター効率により、自律型ドローンのナビゲーションやエッジベースのセキュリティシステムに適しています。さらに、VRAM消費量が少ないため、コンシューマー向けGPUでトレーニングする研究者にとって導入のハードルが下がります。
スマートシティの交通管理や高速ロボティクスで最高のパフォーマンスを求める場合、新しいYOLO26に匹敵する選択肢はありません。NMSのボトルネックによるオーバーヘッドなしに、エンドツーエンドの効率を提供します。