PP-YOLOE+とYOLOv7の比較#
コンピュータービジョンのパイプラインを構築する際、適切な物体検出モデルを選ぶことが重要です。2022年に登場した2つの主要なアーキテクチャ、PP-YOLOE+とYOLOv7は、リアルタイム物体検出に大きな進歩をもたらしました。この技術比較では、両モデルのアーキテクチャ、学習手法、実環境での性能を詳しく見ていき、アプリケーションに適した判断を支援します。
モデルの概要#
PP-YOLOE+とYOLOv7はどちらも、精度と速度の限界を押し広げるよう設計されていますが、異なる開発エコシステムと設計思想に基づいています。
PP-YOLOE+#
BaiduのPaddlePaddle開発者によって開発されたPP-YOLOE+は、従来のPP-YOLOv2を基盤としています。PaddlePaddleエコシステム向けに最適化された、効率的で高精度な物体検出器として導入されました。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetectionリポジトリ
- ドキュメント: PP-YOLOE+ドキュメント
YOLOv7#
Chien-Yao Wang、Alexey Bochkovskiy、Hong-Yuan Mark Liaoによって開発されたYOLOv7は、「学習可能な無料特典」を導入し、リリース当時のリアルタイム物体検出器の最先端ベンチマークを更新しました。
- 著者: Chien-Yao Wang、Alexey Bochkovskiy、Hong-Yuan Mark Liao
- 所属機関: 台湾、中央研究院情報科学研究所
- 日付: 2022-07-06
- Arxiv: 2207.02696
- GitHub: YOLOv7リポジトリ
- ドキュメント: Ultralytics YOLOv7ドキュメント
アーキテクチャの革新#
PP-YOLOE+のアーキテクチャ#
PP-YOLOE+はアンカーフリー方式を大きく採用しており、カスタムデータセットに合わせてアンカーボックスを調整する必要がないため、デプロイが簡素化されます。強力なRepResNetバックボーンとCSPNetスタイルのPAN(経路集約ネットワーク)を組み合わせ、効果的なマルチスケール特徴融合を実現します。さらに、タスクアライメント学習(TAL)の概念を活用して学習中に分類タスクと位置特定タスクを動的に整合させ、さまざまなコンピュータービジョンタスクで高い精度を確保します。
YOLOv7のアーキテクチャ#
YOLOv7は、拡張効率的層集約ネットワーク(E-ELAN)を導入するという異なるアプローチを採用しました。このアーキテクチャにより、元の勾配経路を損なうことなく、ネットワークがより多様な特徴を学習でき、収束性が向上します。また、YOLOv7はモデルの再パラメーター化、特に計画的な再パラメーター化畳み込みを多用します。推論時に畳み込み層を統合することで、精度を損なわずに実行速度を高めます。そのため、複数物体追跡や複雑なセキュリティ警報システムなどのタスクで特に優れています。
パフォーマンス分析#
速度、パラメーター数、精度(mAP)のバランスを比較すると、特定のモデルバリエーションや対象ハードウェアによって優劣が変わります。以下に、両モデルの指標を包括的に比較します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
PP-YOLOE+xはやや高いmAPを達成しますが、YOLOv7の各バリエーションはパラメーター数に対する精度の比率に優れています。YOLOv7のアーキテクチャは、TensorRT最適化によって極めて低いレイテンシーを実現するGPU処理で、今も高い人気を誇ります。
Ultralyticsの強み#
これらのモデルを学習・デプロイする際、選択するフレームワークはモデル自体と同じくらい重要です。Ultralyticsを利用すると、高度に統一されたPython APIによって機械学習のライフサイクル全体が簡素化され、効率的で一貫したユーザー体験が得られます。
- 適切に保守されたエコシステム: Ultralytics YOLOモデルは、継続的に更新されるエコシステム、充実したドキュメント、活発なコミュニティの恩恵を受けています。
- メモリー要件: Ultralyticsはデータ読み込みと学習方法を高度に最適化しています。Ultralytics YOLOモデルの学習で必要となるCUDAメモリーは、一般に大規模なTransformerベースのアーキテクチャより大幅に少なく、開発者はコンシューマー向けハードウェアでも、より大きなバッチサイズを利用できます。
- 学習効率: 強力なデータ拡張戦略と組み込みのハイパーパラメーター調整を活用することで、Ultralyticsはすぐに利用できる事前学習済み重みを用いて、モデルを迅速に収束させます。
シンプルなAPIの実装#
UltralyticsパッケージはYOLOv7のネイティブ学習をサポートしていません(上流版YOLOv7のエクスポートを実行する方法はYOLOv7ドキュメントをご覧ください)。ただし、最新のUltralytics YOLOモデルの学習は数行のコードで完了し、複雑な学習スクリプトを完全に抽象化できます。
from ultralytics import YOLO
# 事前学習済みYOLO26モデルを読み込みます
model = YOLO("yolo26n.pt")
# カスタムデータセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# デプロイ用にTensorRTへエクスポートします
model.export(format="engine", device=0)新たなスタンダード:YOLO26の紹介#
PP-YOLOE+とYOLOv7は物体検出における重要な節目ですが、AI分野は急速に進化しています。新しいコンピュータービジョンプロジェクトでは、Ultralytics YOLO26を強く推奨します。2026年1月にリリースされたYOLO26は、エッジファーストのビジョンAIに大きな進歩をもたらします。
YOLO26が旧世代のアーキテクチャを上回る理由:
- エンドツーエンドのNMSフリー設計: YOLO26はネイティブのエンドツーエンドモデルです。オプションのワンツーワンヘッド(
nms=False)により、後処理の非最大値抑制(NMS)を省略し、予測可能で決定論的な推論レイテンシーを実現します。この革新的な方式は、YOLOv10で初めて採用されました。 - DFLの削除: 分布焦点損失を削除することでエクスポート処理が簡素化され、低消費電力エッジデバイスとの互換性が大幅に向上します。
- CPU推論が最大43%高速化: 専用GPUがないスマートシティのIoTセンサーなどの環境に向けて、YOLO26はCPU上で直接効率よく動作するよう高度に最適化されています。
- MuSGDオプティマイザー: Moonshot AIのKimi K2など、高度なLLM学習手法を参考にしたYOLO26は、SGDとMuonを組み合わせて、非常に安定した学習と迅速な収束を実現します。
- ProgLoss + STAL: これらの改良された損失関数は小物体検出を大幅に向上させます。ドローン空撮画像や製造上の欠陥検出などのユースケースで重要です。
最適なユースケースとデプロイシナリオ#
PP-YOLOE+を使用する場面#
BaiduおよびPaddlePaddleのエコシステムを深く活用している場合、PP-YOLOE+が適しています。デプロイ先でPaddleモデル向けの専用ハードウェア(アジアの一部の製造パイプラインなど)を利用する場合、PP-YOLOE+は優れた精度とシームレスな統合を実現します。産業製造の自動化に非常に効果的です。
YOLOv7を使用する場合#
YOLOv7は汎用的な高性能推論に引き続き適した選択肢であり、特にTensorRTを利用してNVIDIAハードウェアにデプロイする場合に優れています。PyTorchエコシステムとの統合により、学術研究やカスタム商用パイプラインで高い汎用性を発揮します。たとえば、ネットワークの構造的完全性が重要となるリアルタイムの群衆管理や複雑な姿勢推定タスクに適しています。
検討すべきその他のモデル#
具体的なニーズに応じて、幅広く本番環境に対応できる柔軟性を備えたYOLO11や、従来の畳み込みネットワークに対するビジョンTransformer特有の利点が必要なプロジェクト向けのRT-DETRとの比較もご検討ください。
結論#
PP-YOLOE+とYOLOv7は、リアルタイム物体検出の分野に大きな進歩をもたらしました。PP-YOLOE+はPaddlePaddleを標準とする環境で優れた性能を発揮し、YOLOv7はPyTorchエコシステムを通じて優れた柔軟性と性能を提供します。
しかし、コンピュータービジョンソリューションが進化し続ける中、最新ツールの活用が不可欠です。Ultralytics PlatformとYOLO26のような次世代アーキテクチャを採用すれば、開発者は速度、精度、使いやすさの最先端を維持できます。