YOLO Vision 2026:

PP-YOLOE+ 対 YOLOv7#

コンピュータビジョンのパイプラインを構築する際、適切な物体検出モデルを選択することは不可欠です。2022年に登場したPP-YOLOE+とYOLOv7という2つの重要なアーキテクチャは、リアルタイム物体検出において強力な進歩をもたらしました。本テクニカル比較では、読者がアプリケーション開発において十分な情報に基づいた決定を下せるよう、両モデルのアーキテクチャ、トレーニング手法、および実世界でのパフォーマンスを詳細に検証します。

モデルの概要#

PP-YOLOE+とYOLOv7はどちらも精度と速度の限界に挑むべく設計されましたが、それぞれ異なる開発エコシステムと設計哲学に基づいています。

PP-YOLOE+#

PP-YOLOE+はBaiduのPaddlePaddle開発チームによって開発され、元のPP-YOLOv2をベースに構築されています。これは、PaddlePaddleエコシステム向けに最適化された、効率的かつ高精度な物体検出器を提供するために導入されました。

PP-YOLOE+の詳細はこちら

YOLOv7#

YOLOv7はChien-Yao Wang、Alexey Bochkovskiy、Hong-Yuan Mark Liaoによって開発されました。リリースの際、リアルタイム物体検出器として新たな最先端ベンチマークを打ち立てるために「学習可能なbag-of-freebies」が導入されました。

YOLOv7の詳細はこちら

アーキテクチャの革新#

PP-YOLOE+ のアーキテクチャ#

PP-YOLOE+はアンカーフリーのパラダイムに大きく依存しており、カスタムデータセット向けのアンカーボックスのチューニングの必要性をなくすことで、デプロイメントプロセスをシンプルにします。強力なRepResNetバックボーンと、効果的なマルチスケール特徴融合のためのCSPNetスタイルのPAN(Path Aggregation Network)を組み込んでいます。さらに、タスクアライメント学習(TAL)の概念を活用して、トレーニング中に分類タスクとローカライゼーションタスクを動的にアライメントし、さまざまなcomputer vision tasks全体で高い精度を確保します。

YOLOv7のアーキテクチャ#

YOLOv7は、拡張効率的レイヤー集約ネットワーク(E-ELAN)を導入することで異なるアプローチを取りました。このアーキテクチャにより、ネットワークは元の勾配パスを破壊することなくより多様な特徴を学習でき、より優れた収束につながります。また、YOLOv7はモデルの再パラメータ化(具体的には、計画的な再パラメータ化畳み込み)を強力に活用しており、推論中に畳み込み層をマージして、精度を犠牲にすることなく実行を高速化します。これにより、YOLOv7はmulti-object trackingや複雑なsecurity alarm systemsなどのタスクで非常に強力になります。

エコシステムの違い

PP-YOLOE+がBaiduのPaddlePaddleフレームワークと密に統合されている一方で、YOLOv7はPyTorchで構築されており、歴史的により大きなコミュニティと、ONNXTensorRTのようなデプロイメントパイプラインとのより幅広い標準互換性を提供します。

パフォーマンス分析#

速度、パラメータ数、精度(mAP)のバランスを考慮する場合、特定のバリエーションやターゲットハードウェアによって優劣が入れ替わります。以下は、両モデルの指標を総合的に比較したものです。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

PP-YOLOE+xモデルはわずかに高いmAPを達成しますが、YOLOv7のバリアントは非常に強力なパラメータ対精度比を提供します。YOLOv7のアーキテクチャは、TensorRTの最適化によって非常に低いレイテンシが提供される、生のGPU処理において今でもお気に入りです。

Ultralyticsの利点#

これらのモデルをトレーニングしてデプロイする場合、どのフレームワークを選択するかもモデルそのものと同じくらい重要です。Ultralyticsを活用することで、機械学習のライフサイクル全体を簡素化する高度に統一されたPython APIにより、効率化されたユーザー体験を提供します。

  • メンテナンスされたエコシステム: Ultralytics YOLOモデルは、継続的に更新されるエコシステム、充実したドキュメント、そして活発なコミュニティの恩恵を受けています。
  • メモリ要件: Ultralyticsはデータローディングとトレーニングのレジームを強力に最適化しています。Ultralytics YOLOモデルのトレーニングには通常、重いTransformerベースのアーキテクチャと比較してはるかに少ないCUDAメモリしか必要とせず、開発者はコンシューマー向けハードウェアでより大きなbatch sizesを利用できます。
  • トレーニング効率: 強力なdata augmentation strategiesと組み込みのハイパーパラメータチューニングを活用することで、Ultralyticsは、すぐに利用できる事前学習済みウェイトを使用してモデルが迅速に収束することを保証します。

シンプルなAPI実装#

Ultralyticsを使用したYOLOv7モデルのトレーニングは、複雑なトレーニングスクリプトを完全に抽象化し、わずか数行のコードで実行可能です。

from ultralytics import YOLO

# Load a pretrained YOLOv7 model
model = YOLO("yolov7.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export to TensorRT for deployment
model.export(format="engine", device=0)

新しい標準: YOLO26の紹介#

PP-YOLOE+とYOLOv7はオブジェクト検出のマイルストーンですが、AIのランドスケープは急速に進化しています。新しいcomputer visionプロジェクトには、Ultralytics YOLO26を強くお勧めします。2026年1月にリリースされたYOLO26は、エッジファーストのビジョンAIにおける大きな飛躍を表しています。

YOLO26が旧アーキテクチャを凌駕する理由:

  • エンドツーエンドのNMSフリーデザイン: YOLO26はネイティブのエンドツーエンドです。非最大値抑制(NMS)後処理を排除することにより、予測可能で決定論的な推論レイテンシを保証します。これは、YOLOv10で初めて見られたブレークスルーです。
  • DFLの削除: Distribution Focal Lossを削除したことで、エクスポートプロセスが簡素化され、低電力エッジデバイスとの互換性が大幅に向上しました。
  • 最大43%高速なCPU推論: smart city IoT sensorsなどの専用GPUがないシナリオ向けに、YOLO26はCPU上で直接効率的に実行できるように高度に最適化されています。
  • MuSGDオプティマイザー: 高度なLLMトレーニング技術(Moonshot AIのKimi K2など)に触発されたYOLO26は、SGDとMuonのハイブリッドを使用して、極めて安定したトレーニングと高速な収束を実現します。
  • ProgLoss + STAL: これらの改善された損失関数は、小物体検出において著しい向上をもたらします。これは、drone aerial imageryや製造欠陥検出などのユースケースにとって不可欠です。

YOLO26の詳細はこちら

理想的なユースケースとデプロイシナリオ#

PP-YOLOE+の使用時期#

PP-YOLOE+は、BaiduおよびPaddlePaddleのエコシステムに深く根ざしている場合に輝きます。デプロイメントターゲットがPaddleモデル向けに調整された特殊なハードウェアを利用している場合(例えば、特定の日本の製造パイプラインなど)、PP-YOLOE+は優れた精度とシームレスな統合を提供します。industrial manufacturing automationに対して非常に効果的です。

YOLOv7を使用する場合#

YOLOv7は、一般的な高性能推論、特にTensorRTを利用するNVIDIAハードウェアにデプロイする場合に、依然として優れた選択肢です。PyTorchエコシステムへの統合により、学術研究やカスタム商用パイプライン(real-time crowd managementやネットワークの構造的完全性が最重要となる複雑なpose estimationタスクなど)において非常に多用途になります。

検討すべきその他のモデル#

正確なニーズに応じて、広範で本番環境対応の柔軟性を求めてこれらのアーキテクチャをYOLO11と比較することにも関心を持つかもしれません。または、プロジェクトに従来の畳み込みネットワークに対するビジョンTransformerの特定の利点が必要な場合は、RT-DETRと比較することもできます。

結論#

PP-YOLOE+とYOLOv7の両者は、リアルタイム物体検出の世界に大幅な改善をもたらしました。PP-YOLOE+はPaddlePaddleを中心とした環境で優れた性能を発揮する一方、YOLOv7はPyTorchおよびUltralyticsエコシステムを通じて驚異的な柔軟性とパフォーマンスを提供します。

しかし、computer vision solutionsが進化し続けるにつれて、最新のツールを活用することが不可欠です。Ultralytics PlatformYOLO26のような次世代アーキテクチャを採用することで、開発者はアプリケーションがスピード、精度、使いやすさの最先端に維持されることを保証できます。

コメント