PP-YOLOE+ vs YOLOv5#
コンピュータビジョンのために適切なディープラーニングフレームワークを選択する際、開発者はスピード、精度、デプロイの容易さの完璧なバランスを見つけるために、さまざまなアーキテクチャの機能を比較することがよくあります。本記事では、PP-YOLOE+とYOLOv5の技術的な違いについて詳しく解説します。アーキテクチャ、パフォーマンスメトリクス、そして理想的なデプロイシナリオを分析することで、リアルタイムロボティクス、エッジデプロイ、クラウドベースのビデオ解析など、次に行うプロジェクトにとって最適な意思決定ができるようになります。
モデルの起源とメタデータ#
両モデルとも非常に有能なエンジニアリングチームによって開発されていますが、ターゲットとするエコシステムはわずかに異なります。その背景を理解することは、アーキテクチャ設計の選択に関する貴重なコンテキストを提供します。
PP-YOLOE+の詳細:
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- Docs: PaddleDetection README
YOLOv5の詳細:
- 作成者:Glenn Jocher
- 組織: Ultralytics
- 日付:2020年6月26日
- GitHub:https://github.com/ultralytics/yolov5
- Docs: https://docs.ultralytics.com/models/yolov5
アーキテクチャの比較#
PP-YOLOE+ のアーキテクチャ#
PP-YOLOE+はBaiduエコシステムにおける進化系であり、PP-YOLOv2などの従来モデルの基盤の上に構築されています。クロスステージパーシャル(CSP)ネットワークの原則と再パラメータ化テクニックを組み合わせることで特徴抽出を強化する、高度に最適化されたCSPRepResNetバックボーンを導入しています。これにより、モデルはトレーニング中の高精度を維持しながら、より合理化されたアーキテクチャに縮小して推論を高速化できます。
さらに、PP-YOLOE+はタスクアライメント学習(TAL)と効率的なタスクアライメントヘッド(ET-head)を採用しています。この組み合わせは、高密度オブジェクト検出器における共通のボトルネックである、分類タスクとローカリゼーションタスクの不整合を解決することを目的としています。構造的には優れていますが、このアーキテクチャはPaddlePaddle frameworkと密に結合しているため、他の主流のMLライブラリを標準化しているチームにとっては統合の課題となる可能性があります。
YOLOv5のアーキテクチャ#
対照的に、YOLOv5は学術研究とエンタープライズ本番環境の両方における業界標準であるPyTorchでネイティブに設計されました。優れた勾配フローとパラメータ効率で知られる、修正されたCSPDarknet53バックボーンを利用しています。
YOLOv5の特徴は、トレーニング前に特定のカスタムデータセットに基づいてアンカーボックスのサイズを動的に確認および調整するAutoAnchorアルゴリズムです。これにより、バウンディングボックスのハイパーパラメータを手動で調整する必要がなくなります。モデルのPath Aggregation Network (PANet) ネックは堅牢なマルチスケール特徴融合を保証し、さまざまなサイズのオブジェクト検出において非常に高い効果を発揮します。
YOLOv5はPyTorch上に直接構築されているため、ONNXやTensorRTなどの最適化された形式へのエクスポートには、ローカライズされたフレームワークにバインドされたモデルよりも大幅に少ないミドルウェア設定が必要です。
パフォーマンス分析#
これらのモデルを評価するには、mean Average Precision (mAP) とレイテンシのトレードオフを考慮する必要があります。以下の表は、異なるモデルサイズ間でのメトリクスを示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
PP-YOLOE+は大規模なスケール(Xバリアントなど)で非常に競争力のあるmAPスコアを達成しますが、YOLOv5はスペクトルの小規模側で優れた速度と低いパラメータ数を提供します。YOLOv5 Nano(YOLOv5n)に必要なパラメータはわずか260万個であり、メモリ要件が厳しい制約のあるエッジデバイスに非常に適しています。さらに、YOLOモデルのトレーニングは、RT-DETRのような重いトランスフォーマーベースの代替手段と比較して、通常、より少ないCUDAメモリを消費します。
Ultralyticsの利点#
アーキテクチャを選択する際、生のメトリクスは要素の一部に過ぎません。開発者体験、エコシステムのサポート、デプロイパイプラインが、プロジェクトの現実世界での成功を左右することがよくあります。ここでUltralyticsモデルが真価を発揮します。
比類なき使いやすさ#
UltralyticsのPython APIは、複雑なボイラープレートコードを抽象化します。開発者はトレーニングの開始、パフォーマンスの検証、モデルのシームレスなデプロイを行えます。ドキュメントは広範囲にわたり、十分に保守されており、大規模なグローバルオープンソースコミュニティによってサポートされています。
タスク間での汎用性#
PP-YOLOE+は専用のオブジェクト検出器ですが、Ultralyticsエコシステムを使用すると、ユーザーは単一の統一されたAPIの下で複数のコンピュータビジョンタスクに取り組むことができます。YOLOv5およびその継承モデルを使用すると、標準のバウンディングボックスからImage Segmentationや分類ワークフローに簡単に移行できます。
コード例: YOLOv5のトレーニング#
開始するには、わずか数行のコードが必要です。このシンプルさが、研究開発サイクルを大幅に加速させます。
from ultralytics import YOLO
# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run fast inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()実際のユースケース#
PP-YOLOE+を選択すべき場面: 組織がBaiduのソフトウェアスタックに深く組み込まれている場合や、PaddlePaddleフレームワークを必須とする特殊なハードウェアに大きく依存している場合、PP-YOLOE+は堅実なパフォーマンスを発揮します。これは、Paddleとのレガシー統合が存在するアジア各地の特殊な製造パイプラインで頻繁に利用されています。
YOLOv5を選択する場合: 大多数の国際的な開発者、研究者、企業にとって、YOLOv5は強力なツールであり続けています。そのPyTorchのルーツは、追跡のためのWeights & Biasなどのツールと即座に互換性があることを意味し、NVIDIA GPUアクセラレーション用のTensorRTやAppleデバイス用のCoreMLにクリーンにエクスポートされます。農業作物のモニタリングから高速ドローンナビゲーションまで、さまざまな分野で優れています。
検出の未来: Ultralytics YOLO26#
YOLOv5は象徴的なモデルですが、コンピュータビジョンのフロンティアは進歩しています。すべての新しい開発に対して、2026年1月にリリースされたYOLO26への移行を強くお勧めします。Ultralytics Platformを介してシームレスに利用できるYOLO26は、効率性を完全に再定義します。
YOLO26における主なイノベーション:
- エンドツーエンドのNMSフリー設計: YOLO26はNon-Maximum Suppression (NMS) の後処理を完全に排除しました。これにより、レイテンシの変動が低減され、デプロイパイプラインが大幅に簡素化されます。
- 最大43%高速なCPU推論: Distribution Focal Loss (DFL) を戦略的に削除することで、YOLO26はGPUのないエッジデバイスでのスピードを劇的に向上させました。
- MuSGDオプティマイザ: 主要な大規模言語モデルに触発されたこのハイブリッドオプティマイザは、トレーニングのダイナミクスを安定させ、カスタムデータセット上での収束を大幅に高速化します。
- タスク固有の機能強化: ProgLossやSTALなどの高度な損失関数を備えており、小さなオブジェクトに対してこれまでにない精度を実現します。航空画像用のOriented Bounding Box (OBB)検出をネイティブでサポートしています。
最先端のビジョンモデルを探索している場合は、前世代のYOLO11やRT-DETRのようなトランスフォーマーベースのアプローチの比較にも興味があるかもしれません。最終的に、堅牢なエコシステムは最先端のアーキテクチャの進歩と相まって、近代的なコンピュータビジョンタスクにおける最優先の選択肢としてのUltralyticsを確固たるものにしています。