PP-YOLOE+とYOLO11#
コンピュータービジョンの分野は、より高速で高精度かつ効率的なモデルへの需要を背景に、絶えず進化しています。物体検出に取り組む開発者や研究者にとって、適切なアーキテクチャの選択は非常に重要です。この包括的な比較では、注目すべき2つのモデル、PP-YOLOE+とUltralytics YOLO11の違いを詳しく解説します。
このガイドでは、各モデルのアーキテクチャ、性能指標、最適なユースケースを分析し、次の機械学習デプロイについて十分な情報に基づいて判断するために必要な知見を提供します。
モデルの起源と技術概要#
どちらのモデルも厳密な学術研究と大規模なエンジニアリングを基盤としていますが、まったく異なるエコシステムから生まれました。それぞれのモデルの基礎情報を見ていきましょう。
PP-YOLOE+の概要#
Baiduの研究者が開発したPP-YOLOE+は、PaddlePaddleエコシステム内でリアルタイム検出の限界を押し広げることを目指し、初期のPP-YOLOEを改良したモデルです。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: https://arxiv.org/abs/2203.16250
- GitHub: PaddleDetectionリポジトリ
- ドキュメント: PP-YOLOE+ドキュメント
YOLO11の概要#
Ultralyticsが開発したYOLO11は、使いやすさと精度を大きく向上させています。高い成功を収めてきたアーキテクチャを基盤に、開発者エクスペリエンスの円滑化とマルチタスクへの対応力を高めています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: Ultralytics GitHubリポジトリ
- ドキュメント: YOLO11公式ドキュメント
Ultralytics YOLO11は、物体検出以外のタスクもサポートします。同じAPIを使って、インスタンスセグメンテーション、姿勢推定、Oriented Bounding Box(OBB)検出をすぐに実行できます。
アーキテクチャと性能の比較#
これら2つの検出器を比較する際は、生の数値だけでなく、アーキテクチャの選択が実環境でのモデルデプロイに与える影響も理解する必要があります。
PP-YOLOE+のアーキテクチャ#
PP-YOLOE+はPaddlePaddleフレームワークに大きく依存しています。CSPRepResNetバックボーンと改良版Path Aggregation Network(PAN)を利用する、強力なアンカーフリーの手法を導入しています。「+」版では、Objects365などの大規模データセットによる事前トレーニングと、改良されたTaskAlignedAssignerを取り入れ、前身モデルから性能を向上させています。高い平均適合率(mAP)を達成する一方で、PaddlePaddleへの強い依存は、PyTorchやTensorFlow環境に慣れたチームにとって導入上の障壁となる場合があります。
YOLO11のアーキテクチャ#
Ultralytics YOLO11は、最新のディープラーニングにおける業界標準であるPyTorchをネイティブに基盤としています。そのアーキテクチャは性能のバランスを重視し、さまざまな実環境へのデプロイに適した速度と精度の優れたトレードオフを実現します。YOLO11は、勾配の流れを改善する最適化済みC3k2モジュールと、分類タスクと回帰タスクを効率的に分離して処理するデカップルドヘッドを備えています。さらに、YOLO11はメモリ要件を抑えるよう設計されており、RT-DETRなどの複雑なTransformerモデルと比べ、トレーニング時と推論時のメモリ使用量が大幅に少なくなっています。
性能指標の表#
以下の表では、さまざまなモデルスケールにおける性能の違いを示します。YOLO11は概して同等以上のmAPを達成しながら、パラメーター数とFLOPsを大幅に削減しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
ユースケースと推奨事項#
PP-YOLOE+とYOLO11のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムの好みによって異なります。
PP-YOLOE+を選ぶ場合#
PP-YOLOE+は、次のような用途に適しています。
- PaddlePaddleエコシステムとの統合: BaiduのPaddlePaddleフレームワークとツールを基盤とする既存インフラストラクチャを持つ組織。
- Paddle Liteによるエッジデプロイ: Paddle LiteまたはPaddle推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- サーバー側での高精度検出: フレームワークへの依存が問題にならない、強力なGPUサーバー上で検出精度を最大化することを優先するシナリオ。
YOLO11を選ぶ場合#
YOLO11は、次の用途に推奨されます:
- 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最優先となる、Raspberry PiやNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
- マルチタスクのビジョンアプリケーション: 単一の統合フレームワークで、検出、セグメンテーション、姿勢推定、OBBを必要とするプロジェクト。
- 迅速なプロトタイピングとデプロイメント: 効率化されたUltralytics Python APIを使って、データ収集から本番環境への移行を迅速に進めたいチーム。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの強み#
学術的なベンチマークも重要ですが、AIプロジェクトの長期的な成功は、モデルを取り巻くエコシステムに大きく左右されます。Ultralytics Platformは、開発者と企業の双方に明確な利点を提供します。
- 使いやすさ: Ultralyticsは、ディープラーニングの複雑さを抽象化します。シンプルなPython APIと効率化されたユーザーエクスペリエンスにより、開発者は数行のコードでカスタムモデルをトレーニングできます。これは、PP-YOLOE+で必要となることの多い複雑な設定ファイルとは対照的です。
- 保守の行き届いたエコシステム: 研究専用のリポジトリとは異なり、Ultralyticsエコシステムは活発に開発されています。充実したコミュニティサポート、頻繁なアップデート、Weights & BiasesやComet MLなどのツールとの幅広い統合が特徴です。
- 汎用性: YOLO11は、複数のコンピュータービジョンタスクに対応する単一の統合フレームワークを提供するため、分類、セグメンテーション、バウンディングボックス検出ごとに異なるライブラリを習得する必要がありません。
- トレーニング効率: YOLOモデルの効率的なトレーニングプロセスにより、時間と計算コストの両方を削減できます。COCOデータセットで事前トレーニングされた重みを活用することで、一般向けハードウェアでもモデルは迅速に収束します。
トレーニングコードの比較#
使いやすさを示すため、最先端のYOLO11モデルをトレーニングする方法を紹介します。データ拡張、ロギング、ハードウェアのオーケストレーションはすべて自動的に処理されます。
from ultralytics import YOLO
# 事前トレーニング済みのYOLO11小型モデルを読み込みます
model = YOLO("yolo11s.pt")
# カスタムデータセットでモデルを100エポック学習します
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 公開画像で簡単な推論テストを実行します
inference_results = model("https://ultralytics.com/images/bus.jpg")
inference_results[0].show()PaddleDetectionで同等のパイプラインを構築するには、複雑なYAML設定を手動で操作し、長いコマンドライン文字列を実行する必要があるため、アジャイルな開発サイクルが遅れる可能性があります。
今後の展望:YOLO26の登場#
YOLO11は非常に高性能なツールですが、AI分野は急速に進歩しています。2026年1月にリリースされたYOLO26は、Ultralyticsの系譜における最先端モデルであり、新規プロジェクトに推奨されるモデルです。
YOLO26は、画期的な複数の技術革新を導入しています。
- エンドツーエンドNMSフリーデザイン: YOLOv10が初めて導入したコンセプトを発展させ、YOLO26はネイティブなエンドツーエンドヘッド(
nms=False)を備えています。後処理でのNon-Maximum Suppression(NMS)を完全に排除することで、デプロイを大幅に簡素化し、レイテンシの変動も大きく抑えます。 - CPU推論が最大43%高速: Distribution Focal Loss(DFL)を戦略的に削除することで、モデルを大幅に軽量化しています。この最適化により、エッジコンピューティングや低消費電力のIoTデバイスに最適なモデルとなっています。
- MuSGDオプティマイザー: YOLO26は、LLMトレーニングの革新をコンピュータービジョンにもたらします。SGDとMuonを組み合わせたMuSGDオプティマイザーを使用することで、非常に安定したトレーニング動態と高速な収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数は、小さな物体の認識を大きく改善します。これはドローン画像や航空監視に不可欠な機能です。
結論と実環境での応用#
PP-YOLOE+とYOLO11(または新しいYOLO26)のどちらを選ぶかは、デプロイ先のエコシステムによって決まります。
PP-YOLOE+は、特定の産業環境、とりわけハードウェアがBaiduの技術スタックと深く統合されたアジアの製造拠点で強みを発揮します。PaddlePaddleライブラリとの親和性が高く、最高のmAPのみを重視する静止画像の分析に適しています。
一方、YOLO11とYOLO26は、より汎用的で開発者に優しいアプローチを提供します。パラメーター数が少なく、速度も優れているため、次の用途に最適です。
- スマートリテール: リアルタイムの動画フィードを処理し、自動精算や在庫管理を実現します。
- 自律型ロボティクス: リソースが限られた組み込みデバイスで高速な障害物回避を実現します。
- セキュリティと監視: 単一の高効率な推論処理で、追跡や姿勢推定などを含む堅牢なマルチタスク分析を提供します。
信頼性、充実したコミュニティサポート、ONNXやTensorRTなどの形式へのシンプルなデプロイパイプラインを求める現代のAIエンジニアにとって、Ultralyticsエコシステムは依然として比類のない選択肢です。