PP-YOLOE+とYOLOv9の比較#
リアルタイムコンピュータービジョンの分野は絶えず変化しており、研究者や開発者は精度と推論速度の限界を押し広げ続けています。PP-YOLOE+とYOLOv9を比較すると、モデルアーキテクチャとエコシステム設計に対する2つの異なる考え方が見えてきます。
この包括的な技術比較では、アーキテクチャの革新、性能指標、トレーニング手法、最適な用途を分析し、次のデプロイに適した物体検出モデルを選べるよう支援します。
モデルの系譜と技術的基盤#
これらのモデルの起源とアーキテクチャ上の選択を理解することは、コンピュータービジョンプロジェクトへの適合性を判断するうえで重要です。
PP-YOLOE+の概要#
BaiduのPaddlePaddle開発者によって開発されたPP-YOLOE+は、2022年4月2日に発表されました。PaddleDetectionフレームワークにおける従来のバージョンを基盤とし、高性能な物体検出を実現します。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetectionリポジトリ
PP-YOLOE+は、PaddlePaddleエコシステムでのデプロイに最適化された、堅牢なアンカーフリーアーキテクチャを採用しています。変更を加えたCSPRepResNetバックボーンとET-headを使用し、特徴抽出とバウンディングボックス回帰を改善します。平均適合率(mAP)は高いものの、PaddlePaddleフレームワークへの依存により、PyTorchやTensorFlowに慣れた開発者には統合作業が煩雑になる場合があります。
YOLOv9の概要#
台湾の中央研究院情報科学研究所に所属するChien-Yao Wang氏とHong-Yuan Mark Liao氏によって発表されたYOLOv9は、ディープラーニングにおける情報ボトルネックに効率的に対処するための大きな進歩です。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 所属機関: 台湾、中央研究院情報科学研究所
- 日付: 2024-02-21
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
YOLOv9の大きな革新はProgrammable Gradient Information(PGI)です。これにより、特徴が深層ニューラルネットワークを通過する際のデータ損失を防ぎます。Generalized Efficient Layer Aggregation Network(GELAN)と組み合わせることで、YOLOv9はパラメーター効率と計算フローを最大化します。さらに、Ultralyticsエコシステムにネイティブ統合されているため、研究用途と商用用途のどちらでも簡単に利用できます。
パフォーマンスと指標の比較#
生の性能を分析すると、YOLOv9は優れたパラメーター効率を示します。より少ないパラメーター数とFLOPsで同等以上の精度を達成できるため、モデルのトレーニングに必要なVRAMを削減できます。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
表に示すように、YOLOv9cは53.0 mAPという高い性能を、同等のPP-YOLOE+l(52.2M)より大幅に少ないパラメーター数(25.5M)で達成します。メモリ使用量が少ないため、GPUリソースに制約のある開発者にはYOLOv9がより適しています。
エコシステム、汎用性、使いやすさ#
YOLOv9の大きな利点は、適切にメンテナンスされたUltralyticsエコシステムとシームレスに統合できることです。PP-YOLOE+では複雑なPaddlePaddle設定ファイルへの対応が必要ですが、YOLOv9は合理化されたPython APIを利用できます。
Ultralytics Python APIを使えば、事前学習済みの重みを読み込み、データ拡張を管理し、最小限の定型コードでトレーニングを開始できます。
from ultralytics import YOLO
# 事前学習済みのYOLOv9モデルを読み込みます
model = YOLO("yolov9c.pt")
# COCO8データセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")
# モデルをONNXフォーマットにエクスポート
model.export(format="onnx")さらに、Ultralyticsエコシステムは比類のない汎用性を備えています。バウンディングボックス検出に加えて、フレームワークはインスタンスセグメンテーション、姿勢推定、回転バウンディングボックス(OBB)検出をネイティブでサポートしています。そのため、複雑な実環境のパイプラインにも非常に効率よくモデルを適応できます。
ユースケースと推奨事項#
PP-YOLOE+とYOLOv9のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに関する好みによって異なります。
PP-YOLOE+を選ぶ場合#
PP-YOLOE+は、次のような用途に適しています。
- PaddlePaddleエコシステムとの統合: BaiduのPaddlePaddleフレームワークとツールを基盤とする既存インフラストラクチャを持つ組織。
- Paddle Liteによるエッジデプロイ: Paddle LiteまたはPaddle推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- サーバー側での高精度検出: フレームワークへの依存が問題にならない、強力なGPUサーバー上で検出精度を最大化することを優先するシナリオ。
YOLOv9を選ぶ場合#
YOLOv9は、次のような用途に推奨されます。
- 情報ボトルネックの研究: プログラム可能な勾配情報(PGI)や一般化効率的層集約ネットワーク(GELAN)のアーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と抑制に焦点を当てた研究。
- 高精度検出のベンチマーク: アーキテクチャの比較において、YOLOv9の優れたCOCOベンチマーク性能を基準として必要とするシナリオ。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
今後を見据えて:YOLO26の優位性#
PP-YOLOE+とYOLOv9はいずれも高性能ですが、新たにリリースされたYOLO26は、本番環境における次の決定的な進化を示しています。2026年1月にリリースされたYOLO26は、エッジコンピューティングとクラウドデプロイの新たな標準を確立します。画期的なイノベーションを備えているため、新しいコンピュータービジョンプロジェクトにはYOLO26を強くおすすめします。
- エンドツーエンドのNMSフリー設計: YOLO26はネイティブのエンドツーエンド推論をサポートしており、
nms=Falseで実行すると、Non-Maximum Suppression(NMS)の後処理が不要になります。これにより、デプロイパイプラインが大幅に簡素化され、レイテンシも低減します。 - CPU推論が最大43%高速化: エッジコンピューティング向けにアーキテクチャを特化して最適化したことで、専用GPUを搭載しないハードウェアでもYOLO26は大幅に高速化されています。
- DFLの削除: Distribution Focal Lossを削除したことで、エクスポートが簡単になり、低消費電力のエッジデバイスとの互換性が大幅に向上します。
- MuSGDオプティマイザー: Moonshot AIのKimi K2など、大規模言語モデルのトレーニング手法に着想を得たSGDとMuonのハイブリッド方式により、トレーニングが非常に安定し、迅速に収束します。
- ProgLoss + STAL: これらの高度な損失関数により、小物体認識の性能が大幅に向上します。航空画像やロボティクスにとって重要な改良です。
- タスク固有の改良: YOLO26には、セグメンテーション向けのマルチスケールprotoや、姿勢推定向けのResidual Log-Likelihood Estimation(RLE)など、特定のタスクに合わせたアーキテクチャが含まれています。
データセットのアノテーション、クラウドトレーニング、モデル監視のためのオールインワンソリューションであるUltralytics Platformを通じて、YOLO26モデルを簡単にトレーニングおよびデプロイできます。
実際の用途#
これらのアーキテクチャのどちらを選ぶかは、多くの場合、デプロイ先の環境によって決まります。
PP-YOLOE+は、特にPaddlePaddleとの統合とBaiduのハードウェアスタックが企業インフラに深く組み込まれている地域で、産業用製造拠点に広く導入されています。厳密なリアルタイム性より絶対的な精度が重視される静止画像解析に適しています。
YOLOv9は、高速なリアルタイム推論が求められる動的な環境で優れた性能を発揮します。優れたパラメーター効率により、自律型ドローンのナビゲーションやエッジベースのセキュリティシステムに最適です。また、VRAMの使用量が少ないため、コンシューマー向けGPUでトレーニングする研究者も導入しやすくなります。
スマートシティの交通管理や高速ロボティクスで最高の性能を求めるなら、新しいYOLO26が最適です。NMSによるボトルネックのオーバーヘッドを伴わない、オプションのエンドツーエンド推論を提供します。