PP-YOLOE+とYOLOv6-3.0#
リアルタイムコンピュータービジョンの分野は急速に拡大し、多様なデプロイシナリオに最適化された、専門性の高いアーキテクチャが登場しています。高いスループットと安定した精度の両立が必要なアプリケーションを構築する際、開発者はPP-YOLOE+とYOLOv6-3.0をよく比較します。両モデルはリリース時に大幅なアーキテクチャ改善をもたらし、産業用およびエッジアプリケーションの推論速度向上に重点を置いていました。
アーキテクチャの詳細な分析に入る前に、以下のグラフで速度と精度の観点から両モデルの性能を比較してください。
PP-YOLOE+: アーキテクチャの強みと弱み#
PaddlePaddle開発者によって開発されたPP-YOLOE+は、先行モデルを基盤に構築された代表的なアンカーフリー検出器で、さまざまな規模の要件に対して堅牢な性能を発揮します。
- 著者: PaddlePaddle Authors
- 組織: Baidu
- 日付: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
アーキテクチャの主な特徴#
PP-YOLOE+は、元のPP-YOLOE設計にいくつかの重要な改良を加えました。計算コストと特徴抽出能力のバランスを効率よく取る、強力なCSPRepResNetバックボーンを採用しています。さらに、高度な特徴ピラミッドネットワーク(FPN)と経路集約ネットワーク(PAN)を組み合わせ、マルチスケール特徴融合を実現します。特に優れた点として、ET-head(効率的なタスク整合型ヘッド)が挙げられます。これは物体検出時の分類と位置特定の連携を大幅に改善します。
PP-YOLOE+は優れた平均適合率(mAP)を達成しますが、PaddlePaddleエコシステムへの依存により、PyTorchネイティブのワークフローに慣れた研究者にとって学習のハードルが高くなる場合があります。そのため、Paddle推論を直接サポートしない異種エッジデバイスを対象とする場合、モデルのデプロイがやや複雑になることがあります。
PP-YOLOE+はBaiduのテクノロジースタック内でのデプロイに高度に最適化されているため、本番環境でPaddle推論ツールを多用する場合に最適です。
YOLOv6-3.0:産業用スループット#
Meituan Vision AI DepartmentがリリースしたYOLOv6-3.0は、産業用途向けの次世代物体検出器として明確に設計されており、GPUハードウェアでの大規模なスループットを優先しています。
- 著者: Chuyi Li、Lulu Li、Yifei Gengほか
- 組織: Meituan
- 日付: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
アーキテクチャの主な特徴#
YOLOv6-3.0は、特にTensorRTを使用するNVIDIA GPUでハードウェア利用率を最大化するよう調整されたEfficientRepバックボーンを備えています。v3.0アップデートでは、ネックに双方向連結(BiC)モジュールが追加され、パラメーター数を大幅に増やすことなく空間特徴の保持を強化しました。さらに、アンカー支援学習(AAT)戦略を導入し、モデル学習時のアンカーベース方式の安定性を取り入れながら、リアルタイム推論時には高速なアンカーフリーアーキテクチャを維持します。
ただし、YOLOv6-3.0はサーバー向けGPUに高度に最適化されているため、制約の厳しいCPUのみのエッジデバイスでは、レイテンシーの改善効果が低下する場合があります。この特化により、オフラインの動画分析などの環境では優れた性能を発揮しますが、小型のローカルハードウェアでは動的に最適化されたモデルに及ばないことがあります。
性能比較表#
以下の表では、両アーキテクチャの異なるスケールのモデルバリエーションを直接比較し、主要な性能指標を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
ユースケースと推奨事項#
PP-YOLOE+とYOLOv6のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムの好みによって異なります。
PP-YOLOE+を選ぶ場合#
PP-YOLOE+は、次のような用途に適しています。
- PaddlePaddleエコシステムとの統合: BaiduのPaddlePaddleフレームワークとツールを基盤とする既存インフラストラクチャを持つ組織。
- Paddle Liteによるエッジデプロイ: Paddle LiteまたはPaddle推論エンジン向けに特別に最適化された推論カーネルを備えるハードウェアへのデプロイ。
- サーバー側での高精度検出: フレームワークへの依存が問題にならない、強力なGPUサーバー上で検出精度を最大化することを優先するシナリオ。
YOLOv6を選ぶ場合#
YOLOv6は、次のような場合に推奨されます。
- 産業用ハードウェアを考慮したデプロイ: モデルのハードウェアを考慮した設計と効率的な再パラメーター化によって、特定のターゲットハードウェア上で最適な性能が得られるシナリオです。
- 高速な1ステージ検出: 制御された環境でのリアルタイム動画処理において、GPU上での生の推論速度を重視するアプリケーションです。
- Meituanエコシステムとの統合: すでにMeituanの技術スタックとデプロイインフラストラクチャを利用しているチームです。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの強み: 旧世代モデルを超える進化#
PP-YOLOE+とYOLOv6-3.0は特定の用途に適したソリューションですが、現代のAI開発では、汎用性とメモリー効率に優れたワークフローが求められます。Ultralytics Platformは、他に類を見ない開発者体験を提供します。統一されたPython APIにより、旧来の研究用リポジトリで一般的に必要とされる膨大な設定作業を行わずに、最先端モデルの学習、検証、デプロイをシームレスに実施できます。
Ultralyticsモデルは、標準的な物体検出に加えて、インスタンスセグメンテーション、画像分類、姿勢推定、回転バウンディングボックス(OBB)の抽出など、幅広いビジョンタスクをネイティブにサポートします。さらに、学習時のメモリー使用量が少なくなるよう高度に最適化されています。一般に大量のGPU VRAMを必要とするTransformerベースのモデル、たとえばRT-DETRとは対照的です。
YOLO26を知る: 新たな標準#
最先端のビジョンモデルを導入したい組織には、2026年1月にリリースされたUltralytics YOLO26をおすすめします。YOLO26は性能の限界を塗り替え、いくつかの重要な技術革新によって旧世代を大幅に上回ります。
- エンドツーエンドのNMSフリー設計: YOLOv10の概念を発展させ、YOLO26のオプションのワンツーワンヘッド(
nms=False)は非最大値抑制(NMS)の後処理を完全に排除します。このネイティブなエンドツーエンド方式により、予測可能で極めて低いレイテンシーの推論を実現し、リアルタイムの安全システムで重要な性能を発揮します。 - CPU推論が最大43%高速化: アーキテクチャから分布焦点損失(DFL)を削除することで、YOLO26はエッジコンピューティングや専用GPUアクセラレーションのない環境向けに大幅に最適化されています。
- MuSGDオプティマイザー: LLM学習の安定性をビジョンモデルに取り入れたこのハイブリッドオプティマイザー(Moonshot AIに着想を得たもの)は、迅速な収束と、非常に安定したカスタム学習を実現します。
- ProgLoss + STAL: これらの高度な損失関数は小物体認識を大幅に改善し、ドローン空撮画像や混雑したシーンの分析などのアプリケーションで重要な役割を果たします。
現在、新しいプロジェクトを構築している場合は、旧世代のアーキテクチャを避け、YOLO26を採用することを強く推奨します。メモリー効率に優れ、NMSフリーで高速なため、本番環境への導入が大幅に容易になります。
シームレスな実装#
Ultralytics Pythonパッケージを使用すれば、最先端モデルの学習とエクスポートを非常に簡単に行えます。以下の例では、最新のYOLO26モデルを学習し、エッジへの迅速なデプロイに向けてONNXにエクスポートする方法を示します。
from ultralytics import YOLO
# 最先端のYOLO26 smallモデルを読み込む
model = YOLO("yolo26s.pt")
# COCO8のサンプルデータセットでモデルをトレーニングする
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# テスト画像に対してNMSフリー推論を実行します
predict_results = model.predict("https://ultralytics.com/images/bus.jpg", nms=False)
# エッジデプロイ用にONNX形式へエクスポートします
model.export(format="onnx")旧来のワークフローに深く統合されているものの、最新の安定性を求めるチームには、Ultralytics YOLO11も優れた移行先です。Ultralyticsエコシステム全体に支えられ、幅広いタスクに対応できます。