PP-YOLOE+ vs YOLOv6-3.0#
リアルタイムコンピュータビジョンの分野は急速に発展し、多様なデプロイシナリオに最適化された高度に専門化されたアーキテクチャが生まれています。高スループットと信頼性の高い精度の両立が求められるアプリケーションを構築する際、開発者はPP-YOLOE+とYOLOv6-3.0を頻繁に比較します。どちらのモデルもリリース時にアーキテクチャへ大幅な改善を導入し、産業およびエッジアプリケーション向けの推論速度の向上に重点を置いていました。
詳細なアーキテクチャの比較に入る前に、以下のグラフで、速度と精度の観点からこれらのモデルが互いにどのような性能を発揮するかを確認してください。
PP-YOLOE+:アーキテクチャの長所と短所#
PaddlePaddleの開発者によって開発されたPP-YOLOE+は、前世代のモデルを基盤として、さまざまなスケール要件にわたって堅牢な性能を実現する主要なアンカーフリー検出器です。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
アーキテクチャの主な特徴#
PP-YOLOE+は、従来のPP-YOLOE設計に対して、いくつかの重要な改良を導入しました。強力なCSPRepResNetバックボーンを活用し、計算コストと特徴抽出能力のバランスを効率的に取っています。さらに、高度な特徴ピラミッドネットワーク(FPN)とPath Aggregation Network(PAN)を組み合わせて、多尺度の特徴融合を実現しています。特に注目すべき機能の1つがET-head(効率的なタスク整合ヘッド)であり、物体検出時の分類と位置特定の連携を大幅に改善します。
PP-YOLOE+は優れた平均適合率(mAP)を達成しますが、PaddlePaddleエコシステムに依存しているため、PyTorchネイティブのワークフローに慣れた研究者にとっては、学習曲線が急になる場合があります。そのため、Paddleの推論を直接サポートしていない異種エッジデバイスを対象とする場合、モデルのデプロイプロセスがやや複雑になる可能性があります。
PP-YOLOE+はBaiduのテクノロジースタック内でのデプロイに高度に最適化されているため、本番環境がPaddleの推論ツールに大きく依存している場合に優れた選択肢となります。
YOLOv6-3.0:産業用スループット#
Meituan Vision AI DepartmentによってリリースされたYOLOv6-3.0は、産業アプリケーション向けの次世代物体検出器として明確に設計されており、GPUハードウェア上での大規模なスループットを優先しています。
- 著者: Chuyi Li、Lulu Li、Yifei Geng、ほか
- 組織: Meituan
- 日付: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
アーキテクチャの主な特徴#
YOLOv6-3.0は、特にNVIDIA GPU上でTensorRTを使用する場合に、ハードウェアの利用効率を最大化するよう特別に設計されたEfficientRepバックボーンを採用しています。v3.0のアップデートでは、ネックに双方向連結 (BiC) モジュールが導入され、パラメーター数を大幅に増加させることなく、空間的特徴の保持性能が向上しました。さらに、アンカー支援トレーニング (AAT) 戦略が導入され、モデルのトレーニング中はアンカーベースの安定性の利点を活用しながら、リアルタイム推論中は高速なアンカーフリーアーキテクチャを維持できます。
ただし、YOLOv6-3.0はサーバーグレードのGPU向けに高度に最適化されているため、CPUのみを使用する制約の厳しいエッジデバイスにデプロイした場合、レイテンシーの改善幅が小さくなることがあります。この特化により、オフライン動画分析のような環境では優れた性能を発揮しますが、小規模でローカルなハードウェア上では、動的に最適化されたモデルに後れを取る可能性があります。
性能比較表#
以下の表では、両アーキテクチャの異なるスケールバリアントを直接比較し、主要な性能指標を示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
ユースケースと推奨事項#
PP-YOLOE+とYOLOv6のどちらを選ぶかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムに関する предпочт事項によって決まります。
PP-YOLOE+ を選択するケース#
PP-YOLOE+ は、次の用途に適しています。
- PaddlePaddle エコシステムとの統合: 既存のインフラストラクチャがBaidu の PaddlePaddleフレームワークとツールで構築されている組織。
- Paddle Lite エッジデプロイ: Paddle Lite または Paddle 推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- 高精度なサーバーサイド検出: フレームワークへの依存が問題にならず、高性能 GPU サーバー上で最大限の検出精度を優先するシナリオ。
YOLOv6を選択する場合#
YOLOv6は次の用途に推奨されます:
- 産業用ハードウェアを考慮したデプロイ: モデルのハードウェアを考慮した設計と効率的な再パラメータ化により、特定の対象ハードウェア上で最適化された性能が得られるシナリオ。
- 高速なシングルステージ検出: 管理された環境でのリアルタイム動画処理において、GPU上での生の推論速度を優先するアプリケーション。
- Meituanエコシステムとの統合: すでにMeituanの技術スタックとデプロイインフラストラクチャを利用しているチーム。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの優位性:レガシーモデルを超える進化#
PP-YOLOE+とYOLOv6-3.0は目的に特化したソリューションを提供しますが、現代のAI開発には、柔軟でメモリ効率の高いワークフローが求められます。ここでUltralytics Platformが、他に類を見ない開発者体験を提供します。統合されたPython APIにより、従来の研究用リポジトリで一般的に必要とされる膨大な設定作業なしに、最先端モデルのトレーニング、検証、デプロイをシームレスに実行できます。
Ultralyticsのモデルは、標準的な検出以外にも、インスタンスセグメンテーション、ポーズ推定、画像分類、回転バウンディングボックス(OBB)の抽出など、幅広いビジョンタスクをネイティブにサポートしています。さらに、トレーニング中のメモリ使用量が少なくなるよう高度に最適化されており、一般に大量のGPU VRAM割り当てを必要とするTransformerベースのモデルであるRT-DETRなどとは対照的です。
YOLO26を発見:新たな標準#
最先端のビジョンモデルをデプロイしたい組織にとって、Ultralytics YOLO26(2026年1月リリース)は性能の限界を再定義します。いくつかの重要なイノベーションにより、旧世代を大幅に上回る性能を実現しています。
- エンドツーエンドのNMSフリー設計: YOLOv10のコンセプトを基盤として、YOLO26は非最大抑制(NMS)の後処理を完全に排除しています。このネイティブなエンドツーエンド方式により、リアルタイムの安全システムに不可欠な、予測可能で極めて低いレイテンシーの推論を実現します。
- CPU推論が最大43%高速: アーキテクチャからDistribution Focal Loss(DFL)を削除することで、YOLO26はエッジコンピューティングや専用GPUアクセラレーションを利用できない環境向けに抜本的に最適化されています。
- MuSGDオプティマイザー: LLMトレーニングの安定性をビジョンモデルに取り入れたこのハイブリッドオプティマイザーは、Moonshot AIに着想を得ており、迅速な収束と非常に安定したカスタムトレーニングセッションを実現します。
- ProgLoss + STAL: これらの高度な損失定式化により、小さい物体の認識性能が大幅に向上します。これは、航空ドローン画像や混雑したシーンの分析などのアプリケーションに不可欠です。
現在新しいプロジェクトを構築している場合は、レガシーアーキテクチャを避け、YOLO26を採用することを強く推奨します。メモリ効率とNMSフリーの速度により、本番環境へのリリースが大幅に容易になります。
シームレスな実装#
Ultralytics Pythonパッケージを使用した最先端モデルのトレーニングとエクスポートは非常に簡単です。以下の例では、最新のYOLO26モデルをトレーニングし、高速なエッジデプロイに向けてONNXへエクスポートする方法を示します。
from ultralytics import YOLO
# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 example dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a test image (NMS-free speed)
predict_results = model.predict("https://ultralytics.com/images/bus.jpg")
# Export to ONNX format for edge deployment
model.export(format="onnx")古いワークフローに深く統合されているものの、最新の安定性を求めているチームにとっては、Ultralytics YOLO11を検討することも優れた移行ステップです。Ultralyticsエコシステム全体に支えられた包括的なタスクの柔軟性を提供します。