YOLO11とPP-YOLOE+#
本番環境でコンピュータービジョンアプリケーションをデプロイする際、最適なニューラルネットワークアーキテクチャの選択は重要です。この技術比較では、リアルタイム物体検出分野の主要モデルであるUltralytics YOLO11とBaiduのPP-YOLOE+を検証します。どちらのアーキテクチャも堅牢なパフォーマンスを提供しますが、精度、推論速度、開発者向けエコシステムの課題へのアプローチは大きく異なります。
以下のインタラクティブなグラフでは、各モデルのパフォーマンス上の特性を示しています。お使いのハードウェア制約に最適なモデルを見つける際にお役立てください。
モデルの起源と技術的な系譜#
これらのモデルの起源と設計思想を理解することで、それぞれの強みや最適なユースケースを把握するための貴重な背景情報が得られます。
YOLO11の詳細#
Ultralyticsが開発したYOLO11は、YOLOシリーズを高度に洗練させたモデルであり、高速な推論、極めて高いパラメーター効率、そして優れた使いやすさのバランスを重視しています。統合されたマルチタスク機能と開発者に優しいPython APIで広く知られています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- ドキュメント: YOLO11ドキュメント
PP-YOLOE+の詳細#
PP-YOLOE+は、PaddlePaddleフレームワークを基盤として構築されたPP-YOLOv2の進化版です。CSPRepResNetバックボーンやTask Alignment Learning(TAL)などのアーキテクチャ変更を導入し、特にハイエンドGPUでの精度向上を目指しています。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: https://github.com/PaddlePaddle/PaddleDetection/
- ドキュメント: PP-YOLOE+の設定に関するドキュメント
アーキテクチャの違い#
YOLO11とPP-YOLOE+の基本的なアーキテクチャ設計には、コンピュータービジョン分野における優先事項の違いが反映されています。
YOLO11は、高度に最適化されたバックボーンとアンカーフリーの検出ヘッドを基盤としています。C3k2ブロックとSpatial Pyramid Pooling - Fast(SPPF)を活用し、計算オーバーヘッドを最小限に抑えながらマルチスケールの特徴を捉えます。この設計は、エッジNPUやモバイルCPUなどのリソースに制約のあるデバイスで推論レイテンシを削減するうえで大きな利点があります。さらに、YOLO11はマルチタスク学習をネイティブに想定して設計されており、標準でインスタンスセグメンテーション、姿勢推定、回転バウンディングボックス(OBB)検出をサポートしています。
PP-YOLOE+は、CSPRepResNetバックボーンとEfficient Task-aligned head(ET-head)を導入しています。再パラメーター化技術を多用し、学習中の表現能力を高める一方、推論時にはそれらのパラメーターを標準的な畳み込みに統合します。これにより優れた平均適合率(mAP)が得られますが、モデルのパラメーター数やメモリ使用量は増える傾向があり、軽量なエッジデバイスよりも高性能なサーバーGPUへのデプロイに適しています。
標準的なバウンディングボックス以外の機能が必要なプロジェクトでは、Ultralytics YOLO11が同じAPI内でセグメンテーション、姿勢推定、分類をネイティブにサポートしているため、複数の異なるリポジトリを統合する場合と比べて開発オーバーヘッドを大幅に削減できます。
性能とベンチマーク#
パフォーマンスを評価する際は、精度(mAP)、さまざまなハードウェアでの推論速度、モデル効率(パラメーター数とFLOPs)を確認します。以下の表では比較指標を示し、最も効率的または高性能な値を太字で示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
分析#
YOLO11は、パフォーマンスのバランスとパラメーター効率において明確な優位性を示しています。たとえば、YOLO11mはPP-YOLOE+m(49.8)より高いmAP(51.5)を達成しながら、パラメーター数は少なく(20.1M対23.43M)、TensorRTでの推論速度も大幅に高速です(4.7ms対5.56ms)。YOLO11モデルは軽量なため、モデル学習時とデプロイ時の両方で必要なメモリを抑えられます。
トレーニングのエコシステムと使いやすさ#
モデルの真価は、開発者がカスタムのコンピュータービジョンデータセットでどれだけ簡単に学習させ、本番環境にデプロイできるかに表れることがよくあります。
Ultralyticsの強み#
Ultralyticsは、開発者が効率よく作業できる環境を重視しています。YOLO11の学習は、シンプルなPython APIまたはCLIを通じて実行でき、複雑な定型コードを抽象化します。Ultralytics Platformでは、ノーコード学習、自動化されたデータセット管理、ONNX、CoreML、TensorRTなどの形式へのワンクリックエクスポートも利用できます。
さらに、YOLOモデルは学習時のメモリ効率に優れており、Transformerベースのアーキテクチャや大規模な再パラメーター化モデルで一般的な膨大なVRAMオーバーヘッドを避けられるため、一般消費者向けハードウェアでも学習できます。
from ultralytics import YOLO
# 事前学習済みYOLO11モデルを読み込みます
model = YOLO("yolo11n.pt")
# COCO8データセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()PP-YOLOE+のエコシステム#
PP-YOLOE+はPaddleDetectionエコシステムで動作します。このフレームワークは高機能で、Baiduの産業向けソリューションと深く統合されていますが、開発者は特定の深層学習フレームワークであるPaddlePaddleを採用する必要があります。そのため、すでにPyTorchを標準としているチームでは、学習コストが高くなる可能性があります。また、PP-YOLOE+モデルをエッジデバイス向けの標準的な汎用形式にエクスポートするには、Ultralyticsのワークフローにあるネイティブのエクスポートパイプラインと比べて、追加の変換手順が必要になる場合があります。
最適なユースケース#
これらのモデルのどちらを選ぶかは、具体的なデプロイ環境によって異なります。
- アジャイルな開発、エッジコンピューティング、モバイルアプリケーションには、YOLO11を選択してください。高速な推論、少ないメモリ使用量、幅広いエクスポート機能により、標準的なCPUでのリアルタイムな小売在庫管理、ドローンによる航空画像分析、複雑なマルチタスクパイプラインなどに適しています。
- 本番パイプライン全体ですでにPaddlePaddleエコシステムを広く利用している場合や、メモリ制約およびハードウェア互換性(Paddleの最適化ハードウェア以外)が主要な懸念事項ではない高性能な専用推論サーバーにデプロイする場合は、PP-YOLOE+を選択してください。
次世代モデル:YOLO26の紹介#
YOLO11は非常に高性能ですが、AI分野の進歩は急速です。物体検出の最先端を求める方に向けて、Ultralyticsは新しいYOLO26を発表しました。2026年1月にリリースされたYOLO26は、前世代モデルの成果を基盤に、かつてない効率性と精度を実現します。
YOLO26の主な革新点:
- エンドツーエンドのNMSフリー設計: YOLO26のオプションであるone-to-oneヘッド(
nms=False)は、後処理の非最大値抑制(NMS)を省略します。これにより推論が大幅に高速化し、デプロイのロジックが簡素化されます。このアーキテクチャ上の飛躍は、YOLOv10が初めて実現しました。 - CPU推論が最大43%高速化: GPUを搭載しないエッジデバイス向けに特化して最適化されており、低消費電力のハードウェアでもリアルタイム性能を発揮します。
- MuSGDオプティマイザー: LLMの学習安定性に着想を得た、SGDとMuonのハイブリッド手法で、収束を速め、学習をより安定させます。
- ProgLoss + STAL: 損失関数の改善により小物体の認識性能が大幅に向上します。これはドローンの用途やセキュリティ監視に不可欠です。
- DFLの削除: Distribution Focal Lossを削除することで、モデルのエクスポートが簡素化され、幅広いエッジデバイスとの互換性が大幅に向上します。
速度、スムーズなエクスポート、最高レベルの精度を重視する新規プロジェクトには、Ultralytics Platformを通じてYOLO26の機能を活用することを強くお勧めします。
ほかのアーキテクチャを評価している場合は、YOLO11とRT-DETRを比較したり、最新のベンチマークで従来のYOLOv8がどの程度の性能を発揮するかを確認したりすることもできます。