YOLO Vision 2026:

PP-YOLOE+ と YOLOv9 の比較#

リアルタイムコンピュータビジョンの領域は常に変化しており、研究者や開発者は精度と推論速度の限界を絶えず押し広げています。PP-YOLOE+YOLOv9を比較する場合、モデルのアーキテクチャとエコシステムの設計における2つの異なる哲学を見ることになります。

この包括的な技術比較では、次回のデプロイメントに適切なobject detectionモデルを選択できるよう、アーキテクチャの革新、パフォーマンス指標、トレーニング手法、理想的なユースケースを分析します。

モデルの系譜と技術的基盤#

これらのモデルの起源とアーキテクチャの選択を理解することは、computer vision projectsへの適合性を判断する上で不可欠です。

PP-YOLOE+ の概要#

BaiduのPaddlePaddleチームによって開発された PP-YOLOE+ は、2022年4月2日に発表されました。これは、PaddleDetectionフレームワーク内の以前のバージョンをベースに構築されており、高性能な物体検出を実現しています。

PP-YOLOE+は、PaddlePaddleエコシステム内でのデプロイメント向けに高度に最適化された、堅牢なアンカーフリーのアーキテクチャを導入しています。特徴抽出とバウンディングボックス回帰を改善するために、修正されたCSPRepResNetバックボーンとETヘッドを利用しています。高いmean Average Precision (mAP)を達成する一方で、PaddlePaddleフレームワークへの依存により、PyTorchやTensorFlowに慣れた開発者にとって統合の摩擦が生じることがあります。

PP-YOLOE+の詳細はこちら

YOLOv9 の概要#

台湾の中央研究院情報科学研究所の Chien-Yao Wang と Hong-Yuan Mark Liao によって発表された YOLOv9 は、ディープラーニングにおける情報ボトルネックの効率的な処理において大きな飛躍を遂げました。

  • 著者: Chien-Yao Wang および Hong-Yuan Mark Liao
  • 組織: 台湾 中央研究院 情報科学研究所
  • 日付: 2024-02-21
  • Arxiv: 2402.13616
  • GitHub: WongKinYiu/yolov9

YOLOv9の最大のブレークスルーは、ディープニューラルネットワークを通過する際のデータ損失を防ぐプログラマブル勾配情報(PGI)です。Generalized Efficient Layer Aggregation Network(GELAN)と組み合わせることで、YOLOv9はパラメータ効率と計算フローを最大化します。さらに、Ultralytics ecosystemにネイティブ統合されているため、研究と商用アプリケーションの両方で非常にアクセスしやすくなっています。

YOLOv9の詳細はこちら

その他のUltralyticsモデル

最先端のオプションを探索している場合、YOLO11RT-DETRにも興味を持つかもしれません。これらは、Transformerベースの精度とリアルタイムのエッジパフォーマンスのさまざまなバランスを提供します。

パフォーマンスと指標の比較#

生のパフォーマンスを分析すると、YOLOv9は卓越したパラメータ効率を示します。より少ないパラメータとFLOPsで同等以上の精度を達成し、model training中のVRAM要件の低下につながります。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

表に示す通り、YOLOv9c は 53.0 mAP という強力な結果を達成しながら、同等の PP-YOLOE+l (52.2M) と比較して大幅に少ないパラメータ数 (25.3M) で実現しています。このメモリ使用量の少なさは、制限のある GPU リソースで作業する開発者にとって YOLOv9 を優れた選択肢にします。

エコシステム、汎用性、使いやすさ#

YOLOv9 の最大の利点は、十分に整備された Ultralytics エコシステムとのシームレスな統合にあります。PP-YOLOE+ は複雑な PaddlePaddle の設定ファイルを操作する必要がありますが、YOLOv9 は効率化された Python API の恩恵を受けられます。

Ultralytics Python APIを使用すると、開発者は最小限のボイラープレートコードで、事前トレーニング済み重みのロード、data augmentationの管理、トレーニングの開始を行うことができます。

from ultralytics import YOLO

# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")

# Export the model to ONNX format
model.export(format="onnx")

さらに、Ultralyticsエコシステムは比類のない汎用性を提供します。バウンディングボックス検出を超えて、フレームワークはInstance SegmentationPose EstimationOriented Bounding Box (OBB)の検出をネイティブにサポートしています。これにより、複雑な現実世界のパイプラインへのモデルの適応が信じられないほど効率的になります。

エクスポートオプション

Ultralyticsフレームワークを使用してトレーニングされたモデルは、TensorRTOpenVINOなど複数のフォーマットにエクスポートでき、多様なハードウェア全体で高度に最適化された推論を保証します。

ユースケースと推奨事項#

PP-YOLOE+ と YOLOv9 のどちらを選ぶかは、特定のプロジェクト要件、デプロイの制約、およびエコシステムの好みに依存します。

PP-YOLOE+ を選ぶべき場面#

PP-YOLOE+ は以下の場合に強力な選択肢となります:

  • PaddlePaddleエコシステムの統合: Baidu's PaddlePaddleのフレームワークとツール上に構築された既存のインフラストラクチャを持つ組織。
  • Paddle Lite エッジデプロイメント: Paddle Lite または Paddle 推論エンジン専用に高度に最適化された推論カーネルを備えたハードウェアへのデプロイ。
  • 高精度サーバーサイド検出: フレームワークの依存関係が懸念事項とならない、強力な GPU サーバー上での最大の検出精度を優先するシナリオ。

YOLOv9を選択すべき場合#

YOLOv9は以下の場合に推奨されます:

  • 情報ボトルネック研究: Programmable Gradient Information (PGI)およびGeneralized Efficient Layer Aggregation Network (GELAN)アーキテクチャを研究する学術プロジェクト。
  • 勾配フロー最適化の研究: トレーニング中の深層ネットワーク層における情報損失の理解と軽減に重点を置いた研究。
  • 高精度検出ベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の強力なCOCOベンチマークパフォーマンスが必要とされるシナリオ。

Ultralytics (YOLO26) を選択すべき時#

ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。

  • NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
  • CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
  • 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。

今後の展望:YOLO26の優位性#

PP-YOLOE+とYOLOv9のどちらも強力ですが、新しくリリースされたYOLO26は、本番環境に向けた決定的な次のステップを表しています。2026年1月にリリースされたYOLO26は、エッジコンピューティングとクラウドデプロイメントの新しい標準を確立します。その画期的な革新性により、すべての新しいコンピュータビジョンプロジェクトにYOLO26を強くお勧めします:

  • エンドツーエンドの NMS 不要設計: YOLO26 はネイティブなエンドツーエンドモデルであり、Non-Maximum Suppression (NMS) の後処理が完全に不要です。これによりデプロイパイプラインが大幅に簡素化され、レイテンシが削減されます。
  • CPU 推論が最大 43% 高速化: エッジコンピューティング向けにアーキテクチャを最適化することで、専用 GPU を持たないハードウェア上で YOLO26 は大幅に高速化されます。
  • DFL の削除: Distribution Focal Loss が削除され、エクスポートがよりシンプルになり、低電力のエッジデバイスとの互換性が劇的に向上しました。
  • MuSGD オプティマイザー: 大規模言語モデルの学習手法 (Moonshot AI の Kimi K2 など) に着想を得たこの SGD と Muon のハイブリッド手法により、非常に安定した学習ダイナミクスと迅速な収束が保証されます。
  • ProgLoss + STAL: これらの高度な損失関数は、aerial imageryroboticsにとって不可欠なアップグレードである、小物体認識の顕著な改善をもたらします。
  • タスク固有の改善: YOLO26 には、セグメンテーション用のマルチスケール proto やポーズ推定用の Residual Log-Likelihood Estimation (RLE) など、特定のタスク向けのカスタマイズされたアーキテクチャが含まれています。

データセットのアノテーション、クラウドトレーニング、モデル監視のためのオールインワンソリューションであるUltralytics Platformを通じて、YOLO26モデルを簡単にトレーニングおよびデプロイできます。

実際のアプリケーション#

これらのアーキテクチャの選択は、多くの場合、ターゲットとするデプロイ環境によって決まります。

**PP-YOLOE+**は、産業製造センター、特にPaddlePaddle integrationとBaiduのハードウェアスタックがエンタープライズインフラストラクチャに深く組み込まれている地域で頻繁にデプロイされます。厳格なリアルタイム制約よりも絶対的な精度が優先される静的画像分析に優れています。

YOLOv9は、迅速なreal-time inferenceを必要とする動的な環境で優れています。その優れたパラメータ効率により、自律型ドローンのナビゲーションやエッジベースのセキュリティシステムに最適です。さらに、その低いVRAM消費量は、コンシューマー向けGPUでトレーニングを行う研究者の参入障壁を下げます。

smart city traffic managementおよび高速ロボティクス全体で絶対的な最高のパフォーマンスを実現するためには、NMSのボトルネックのオーバーヘッドなしでエンドツーエンドの効率を提供する、より新しいYOLO26が比類のないものです。

コメント