PP-YOLOE+ と YOLO11#
コンピュータービジョンの分野は、より高速で、より高精度かつ効率的なモデルへのニーズに後押しされ、絶えず進化しています。物体検出タスクに取り組む開発者や研究者にとって、適切なアーキテクチャを選択することは極めて重要です。この包括的な比較では、代表的な2つのモデル、PP-YOLOE+ と Ultralytics YOLO11 の違いを詳しく見ていきます。
それぞれのアーキテクチャ、パフォーマンス指標、理想的なユースケースを分析することで、次の機械学習デプロイメントに向けて十分な情報に基づいた判断を行うために必要な知見を提供します。
モデルの起源と技術概要#
どちらのモデルも、厳密な学術研究と広範なエンジニアリングを基盤としていますが、その起源はまったく異なるエコシステムにあります。それぞれのモデルの基礎となる詳細を見ていきましょう。
PP-YOLOE+ の概要#
Baidu の研究者によって開発された PP-YOLOE+ は、以前の PP-YOLOE を発展させたモデルであり、PaddlePaddle エコシステム内でリアルタイム検出の限界を押し広げるよう設計されています。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: PaddleDetectionリポジトリ
- ドキュメント: PP-YOLOE+ ドキュメント
YOLO11 の概要#
Ultralytics が開発した YOLO11 は、使いやすさと精度を大きく向上させています。非常に成功したアーキテクチャの系譜を受け継ぎ、開発者がスムーズに利用できる体験と、複数のタスクに対応する柔軟性を最適化しています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: Ultralytics GitHubリポジトリ
- ドキュメント: YOLO11公式ドキュメント
Ultralytics YOLO11 は、物体検出だけに対応しているわけではありません。標準で、まったく同じ API を使用して、インスタンスセグメンテーション、姿勢推定、回転バウンディングボックス (OBB) 検出を実行できます。
アーキテクチャとパフォーマンスの比較#
これら2つの検出器を比較する際は、単純な数値だけでなく、それぞれのアーキテクチャ上の選択が実際のモデルデプロイメントにどのような影響を与えるかを理解する必要があります。
PP-YOLOE+ のアーキテクチャ#
PP-YOLOE+ は、PaddlePaddle フレームワークに大きく依存しています。RepResNet バックボーンと変更された Path Aggregation Network (PAN) を使用し、強力なアンカーフリーのパラダイムを導入しています。「+」バリアントでは、大規模データセットによる事前学習(Objects365 など)と改良された TaskAlignedAssigner を取り入れることで、前身モデルをさらに改善しています。高い平均適合率 (mAP)を達成する一方で、PaddlePaddle への強い依存は、PyTorch や TensorFlow 環境に慣れたチームにとって障壁となる可能性があります。
YOLO11のアーキテクチャ#
Ultralytics YOLO11 は、現代のディープラーニングにおける業界標準である PyTorch をネイティブに基盤としています。そのアーキテクチャは パフォーマンスのバランス を重視し、さまざまな実環境のデプロイメントシナリオに適した、速度と精度の有利なトレードオフを実現します。YOLO11 は、勾配の流れを改善する最適化された C3k2 モジュールと、分類タスクと回帰タスクを効率的に分離して処理する分離ヘッドを備えています。さらに YOLO11 は、複雑な RT-DETR などの Transformer モデルと比較して、トレーニングおよび推論時のメモリ使用量を大幅に削減できるよう設計されています。
パフォーマンス指標の表#
次の表では、さまざまなモデルスケールにおけるパフォーマンスの違いを示します。YOLO11 は概して同等以上の mAP を達成しながら、パラメーター数と FLOPs を大幅に削減している点に注目してください。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
ユースケースと推奨事項#
PP-YOLOE+ と YOLO11 のどちらを選択するかは、具体的なプロジェクト要件、デプロイメントの制約、エコシステムに関する好みによって決まります。
PP-YOLOE+ を選択するケース#
PP-YOLOE+ は、次の用途に適しています。
- PaddlePaddle エコシステムとの統合: 既存のインフラストラクチャがBaidu の PaddlePaddleフレームワークとツールで構築されている組織。
- Paddle Lite エッジデプロイ: Paddle Lite または Paddle 推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- 高精度なサーバーサイド検出: フレームワークへの依存が問題にならず、高性能 GPU サーバー上で最大限の検出精度を優先するシナリオ。
YOLO11を選ぶタイミング#
YOLO11は次の用途に推奨されます:
- 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最重要となる、Raspberry PiやNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
- マルチタスクビジョンアプリケーション: 単一の統合フレームワーク内で、検出、セグメンテーション、ポーズ推定、OBBを必要とするプロジェクト。
- **迅速なプロトタイピングとデプロイメント:**合理化されたUltralytics Python APIを使用して、データ収集から本番環境まで迅速に移行する必要があるチーム。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの優位性#
学術的なベンチマークは重要ですが、AI プロジェクトの長期的な成功は、モデルを取り巻くエコシステムに大きく左右されます。Ultralytics Platform は、開発者と企業の双方に明確なメリットを提供します。
- 使いやすさ: Ultralytics は、ディープラーニングの複雑さを抽象化します。効率化されたユーザーエクスペリエンスとシンプルな Python API により、開発者はわずか数行のコードでカスタムモデルをトレーニングできます。これは、PP-YOLOE+ で頻繁に必要となる複雑な設定ファイルとは対照的です。
- 適切に保守されたエコシステム: 研究専用のリポジトリとは異なり、Ultralytics エコシステムは活発に開発されています。強力なコミュニティサポート、頻繁なアップデート、Weights & Biases や Comet ML などのツールとの幅広い統合を備えています。
- 柔軟性: YOLO11 は、複数のコンピュータービジョンタスクに対応する単一の統合フレームワークを提供し、分類、セグメンテーション、バウンディングボックス検出ごとに異なるライブラリを学習する必要をなくします。
- トレーニング効率: YOLO モデルの効率的なトレーニングプロセスにより、時間とコンピューティングコストの両方を削減できます。COCO データセットで事前学習された重みを活用することで、コンシューマー向けハードウェアでもモデルは迅速に収束します。
トレーニングコードの比較#
使いやすさを示すため、最先端の YOLO11 モデルをトレーニングする方法を紹介します。データの拡張、ロギング、ハードウェアのオーケストレーションをすべて自動的に処理します。
from ultralytics import YOLO
# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model on your custom dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run a quick inference test on a public image
inference_results = model("https://ultralytics.com/images/bus.jpg")
inference_results[0].show()PaddleDetectionで同等のパイプラインをセットアップするには、複雑なYAML設定を手動で操作し、長大なコマンドライン文字列を実行する必要があり、アジャイルな開発サイクルが遅くなる可能性があります。
今後の展望:YOLO26の登場#
YOLO11 は非常に強力なツールであり続けていますが、AI の分野は急速に進歩しています。2026年1月にリリースされた YOLO26 は、Ultralytics の系譜における最先端のモデルであり、すべての新規プロジェクトに推奨されるモデルです。
YOLO26 は、画期的なイノベーションをいくつか導入しています。
- エンドツーエンドの NMS フリーデザイン: YOLOv10 で初めて先駆的に導入された概念を基盤として、YOLO26 はネイティブなエンドツーエンドモデルになっています。Non-Maximum Suppression (NMS) の後処理を完全に排除することで、デプロイメントを大幅に簡素化し、レイテンシーの変動を大きく低減します。
- CPU 推論を最大43%高速化: Distribution Focal Loss (DFL) を戦略的に除去することで、モデルを大幅に軽量化しています。この最適化により、エッジコンピューティングや低消費電力の IoT デバイスに最適な選択肢となっています。
- MuSGD オプティマイザー: YOLO26 は、LLM トレーニングのイノベーションをコンピュータービジョンにもたらします。SGD と Muon のハイブリッドである MuSGD オプティマイザーを使用することで、非常に安定したトレーニングダイナミクスと、より高速な収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数により、小さな物体の認識性能が大きく向上します。これは、ドローン画像や航空監視において重要な特長です。
結論と実環境での応用#
PP-YOLOE+ と YOLO11(またはより新しい YOLO26)のどちらを選択するかを決める際は、デプロイメントのエコシステムが重要な判断要素となります。
PP-YOLOE+ は、特定の産業環境、特にハードウェアが Baidu のテクノロジースタックと PaddlePaddle ライブラリに深く統合されているアジアの製造拠点で優れた性能を発揮します。最大 mAP のみを最優先する静止画像分析に適しています。
一方、YOLO11 と YOLO26 は、より柔軟で開発者に優しいアプローチを提供します。パラメーター数が少なく高速であるため、次の用途に最適です。
- スマートリテール: 自動レジや在庫管理のためのリアルタイム動画フィード処理。
- 自律ロボティクス: リソースに制約のある組み込みデバイス上での高速な障害物回避を実現します。
- セキュリティと監視: 単一の非常に効率的な推論パスで、堅牢なマルチタスク分析(トラッキングや姿勢推定など)を提供します。
信頼性、幅広いコミュニティサポート、ONNX や TensorRT などの形式へのシンプルなデプロイメントパイプラインを求める現代の AI エンジニアにとって、Ultralytics エコシステムは依然として他に類を見ない選択肢です。