YOLO Vision 2026:

PP-YOLOE+ と DAMO-YOLO の比較#

コンピュータビジョンの絶え間ない進化により、リアルタイム物体検出のための高度に専門化されたアーキテクチャが数多く生み出されてきました。産業用および研究用のアプリケーション向けモデルを評価する際、2022年の2つの著名なフレームワークがよく議論に上がります。Baiduによる PP-YOLOE+ と、Alibaba Groupによる DAMO-YOLO です。両モデルとも、新規のバックボーン、高度なラベル割り当て戦略、および専門化された特徴融合技術を導入することで、アンカーフリー検出の限界を押し広げました。

本ガイドでは、PP-YOLOE+とDAMO-YOLOの詳細な技術的分析を提供し、そのアーキテクチャ、トレーニング手法、デプロイメントにおける強みを検証します。また、これらのフレームワークがUltralytics YOLO26のようなモダンなソリューションとどのように比較されるかを検証し、特定のデプロイメントの制約に適したツールを選択できるように支援します。

PP-YOLOE+: 洗練された産業用物体検出#

Baiduエコシステム内で開発されたPP-YOLOE+は、オリジナルのPP-YOLOEを反復的に改良したものであり、PaddlePaddleディープラーニングフレームワーク向けに高度に最適化されています。サーバーグレードのハードウェアにおける精度と推論速度を最大化するように設計されており、産業用検査やスマートリテールのアプリケーションに最適な候補となります。

アーキテクチャの革新#

PP-YOLOE+ は、従来のアンカーフリー検出器を改善するために、いくつかのアーキテクチャ上の強化を導入しています。

  • CSPRepResNet バックボーン: このバックボーンは、RepVGGスタイルのアーキテクチャと Cross Stage Partial (CSP) 接続を組み合わせており、特徴抽出能力と推論レイテンシの強力なバランスを提供します。
  • Task Alignment Learning (TAL): PP-YOLOE+ は、トレーニング中に分類タスクと回帰タスクを整合させる高度な動的ラベル割り当て戦略を採用しており、トレーニングと推論のパフォーマンス間のギャップを縮小します。
  • 効率的なタスク整合ヘッド (ET-head): 空間分解能を犠牲にすることなく機能を迅速に処理するように設計された効率的な検出ヘッドであり、高いmAPメトリクスを維持する上で非常に有益です。

PP-YOLOE+の詳細:

PP-YOLOE+の詳細はこちら

DAMO-YOLO: エッジにおけるニューラルアーキテクチャ探索#

Alibaba DAMO Academyによって作成されたDAMO-YOLOは、明確に異なるアプローチを採用しています。研究チームはバックボーンを手動で設計する代わりに、ニューラルアーキテクチャ探索 (NAS) を利用して、厳格なレイテンシの制約に合わせて調整された高効率のネットワークトポロジを発見しました。

主な特徴とトレーニングパイプライン#

DAMO-YOLO は、自動化された蒸留重視の方法論を通じて、低レイテンシと高精度を重視しています。

  • MAE-NASバックボーン: 効率的なニューラルアーキテクチャ探索の自動化手法を利用して、DAMO-YOLOはパラメータと精度のトレードオフに特化して最適化されたバックボーンを構築します。
  • Efficient RepGFPN: 再パラメータ化された Generalized Feature Pyramid Network により、堅牢なマルチスケール特徴融合が可能となり、モデルはフレーム内で大きく異なるサイズの物体を検出できるようになります。
  • ZeroHead デザイン: 推論フェーズ中の計算オーバーヘッドを大幅に削減する、高度に簡素化された検出ヘッドです。
  • 蒸留による強化: 小型バリアントのパフォーマンスを向上させるために、DAMO-YOLO は、より大きな教師モデルが学生モデルを導く複雑な知識蒸留プロセスに大きく依存しています。

DAMO-YOLO の詳細:

DAMO-YOLOの詳細はこちら

フレームワークへの依存

PP-YOLOE+ と DAMO-YOLO はどちらも堅牢な理論的革新を提供しますが、それぞれのフレームワーク(PaddlePaddle および特定の Alibaba 環境)に密接に結合されています。これにより、これらのモデルを標準化されたクラウドまたはエッジ環境へ移行しようとする際に摩擦が生じる可能性があります。

パフォーマンス分析#

これらのモデルを評価する際、レイテンシ、計算複雑性 (FLOPs)、および mean Average Precision (mAP) の間のトレードオフが、理想的なデプロイ環境を決定します。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

DAMO-YOLOは一般的にナノおよびタイニーのスケールでより低いTensorRTレイテンシを達成し、高スループットのビデオストリームにおいて非常に高い競争力を持ちます。しかし、PP-YOLOE+は超大型(x)バリアントへと非常に優れたスケーラビリティを発揮し、推論時間が二次的な懸念事項となる複雑な画像に対してトップクラスの精度を実現します。

Ultralytics の優位性: 2022年のアーキテクチャを超えて#

PP-YOLOE+とDAMO-YOLOは重要なマイルストーンとなりましたが、現代の開発には、より高い汎用性、より簡単なトレーニングパイプライン、そしてより低いメモリ要件が求められています。Ultralytics プラットフォームは、古いモデルに必要とされる複雑な蒸留やフレームワーク固有の設定を大幅に凌駕する、摩擦のないエクスペリエンスを提供することでこれらのニーズに応えます。

現在、最高のパフォーマンスバランスを達成したい開発者にとって、Ultralytics YOLO26は現実世界のデプロイメント効率における革新的な飛躍を提供します。

なぜ YOLO26 が業界をリードするのか#

2026年初頭にリリースされたYOLO26は、プロダクション向けに調整された画期的な技術を導入することで、YOLO11のレガシーを継承・発展させています。

  • エンドツーエンドの NMS フリー設計: YOLO26 は Non-Maximum Suppression (NMS) 後処理を排除しました。これは、よりシンプルなデプロイロジックと、一貫性があり予測可能な推論レイテンシを実現することを意味します。
  • MuSGD オプティマイザ: 大規模言語モデルのトレーニング技術に触発された YOLO26 は、ハイブリッドな MuSGD オプティマイザを利用しています。これにより非常に安定したトレーニングと迅速な収束が保証され、貴重な GPU 時間を節約します。
  • 優れたCPU推論: 分布焦点損失 (DFL) を削除し、ネットワークグラフを最適化することにより、YOLO26は最大43%高速なCPU推論を実現し、エッジAIデバイスにとって最適な選択肢となります。
  • ProgLoss + STAL: これらの高度な損失関数は、小物体認識において驚異的な改善をもたらし、これはドローン運用やリモートセンシングにおいて極めて重要です。
  • 比類のない汎用性: 検出に厳密に焦点を当てているPP-YOLOE+とは異なり、YOLO26は姿勢推定インスタンスセグメンテーション画像分類、および指向性バウンディングボックス (OBB)をシームレスにネイティブサポートします。

使いやすさと学習の効率性#

DAMO-YOLO モデルのトレーニングには、複雑な教師・学生蒸留パイプラインの管理が必要です。対照的に、Ultralytics モデルのトレーニングはわずか数行の Python コードで済み、競合するアーキテクチャと比較して CUDA メモリの使用量も最小限に抑えられます。

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 model
model = YOLO("yolo26n.pt")

# Train the model with native MuSGD optimization
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run an end-to-end NMS-free inference
results = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX or TensorRT seamlessly
model.export(format="onnx")

YOLO26の詳細はこちら

理想的なユースケースと推奨事項#

最適なコンピュータビジョンアーキテクチャの選択は、チームのエコシステム統合とデプロイ対象に大きく依存します。

  • PP-YOLOE+ を選択すべき場合: パイプライン全体が Baidu PaddlePaddle エコシステムに深く組み込まれている場合。精度を最大化することが最優先事項である強力なサーバー上での静止画像解析には、依然として優れた選択肢です。
  • DAMO-YOLO を選択すべき場合: ニューラルアーキテクチャ探索アルゴリズムに関する特定の研究を行っている場合、あるいは、野心的な TensorRT レイテンシの目標を達成するために複雑な蒸留パイプラインを維持するエンジニアリングリソースがある場合。
  • ほぼすべての現代的な本番シナリオにおいて、Ultralytics YOLO26を選択してください。Ultralytics ecosystemは、比類のないドキュメント、低いメモリ要件、そして効率的なAPIを提供します。自動品質管理システムの構築においても、Raspberry Piでのリアルタイムトラッキングの実行においても、YOLO26のNMSフリーアーキテクチャにより、導入後すぐに、迅速かつ安定した、極めて精度の高い結果が得られます。

他の最先端のソリューションを探索する開発者向けに、Ultralyticsのドキュメントでは広く採用されているYOLOv8および堅牢なYOLO11に関する豊富なリソースも提供されており、あらゆるコンピュータビジョンチャレンジに適したモデルを確実に選択できます。

コントリビューター

コメント