YOLO Vision 2026:

YOLOv5 vs YOLOv6-3.0#

コンピュータビジョンの領域は常に進化しており、新しいアーキテクチャが速度と精度の限界を押し広げています。次なるビジョンAIプロジェクトのためにモデルを選択する際、開発者は多くの場合、定評のある汎用性の高いフレームワークと、高度に専門化された産業用検出器を比較検討することになります。本稿では、Ultralytics YOLOv5MeituanのYOLOv6-3.0の技術的な違いを深掘りし、展開ニーズに最適なツールを選択するための一助として解説します。

モデルの紹介#

Ultralytics YOLOv5:汎用性の高いスタンダード#

2020年にリリースされたUltralytics YOLOv5は、アクセスしやすく高性能な物体検出のゴールドスタンダードとして急速に定着しました。その圧倒的な使いやすさ、堅牢なトレーニングパイプライン、そして広範なデプロイメント統合によって高く評価されています。

PyTorchエコシステム内でシームレスな開発者体験を提供するために、YOLOv5はゼロから設計されました。エッジデバイスからクラウドサーバーまで、多様な実際のデプロイシナリオに適した高い推論速度を維持しつつ、優れた平均精度(mAP)を達成し、好ましいパフォーマンスバランスを提供します。

YOLOv5の詳細はこちら

YOLOv6-3.0: 産業用スループット#

MeituanのVision AI部門によって開発されたYOLOv6-3.0は、産業用途に特化しており、専用ハードウェアアクセラレータ上での高いスループットを最優先に設計されています。

  • 著者: Chuyi Li, Lulu Li, Yifei Geng, 他
  • 組織: Meituan
  • 日付: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

NVIDIA T4などのGPU上で処理速度を最大化することを目指してYOLOv6は開発されています。パフォーマンスを達成するためにカスタム量子化手法や特殊なバックボーンを使用しており、バッチ推論が多用されるバックエンドサーバー処理において有力な選択肢となります。

YOLOv6の詳細はこちら

アーキテクチャの違い#

これらのモデルの背景にあるアーキテクチャ上の選択を理解することは、理想的なユースケースを特定するために極めて重要です。

YOLOv5のアーキテクチャ#

YOLOv5は、高度に最適化されたCSPDarknetバックボーンと、Path Aggregation Network (PANet) ネックを組み合わせて利用しています。この構造は、トレーニングおよび推論中のメモリ要件を最小限に抑えるよう、高度に微調整されています。膨大なCUDAメモリと長いトレーニング時間を必要とする大規模なTransformerモデルとは異なり、YOLOv5は標準的な民生用ハードウェア上で効率的に動作します。

メモリ効率

Ultralyticsのモデルは、トレーニング効率のために特別に設計されています。多くの場合、単一のミドルレンジGPUでYOLOv5モデルをトレーニングできるため、研究者やスタートアップ企業にとって非常に利用しやすいものとなっています。

さらに、YOLOv5は単なる物体検出モデルではありません。そのアーキテクチャは他のタスクへとシームレスに拡張され、画像セグメンテーションおよび画像分類に対して、箱から出してすぐに使える堅牢なサポートを提供します。

YOLOv6-3.0アーキテクチャ#

YOLOv6-3.0は、特にGPU実行においてハードウェアフレンドリーな設計であるEfficientRepバックボーンを特徴としています。ネック部分には、特徴融合を強化するためのBi-directional Concatenation (BiC) モジュールを採用しています。

トレーニング中、YOLOv6は収束を安定させるためにAnchor-Aided Training (AAT) 戦略を使用しますが、推論時はアンカーフリーの検出器として動作します。このアーキテクチャはGPU加速タスクに優れていますが、高度にポータブルなYOLOv5フレームワークと比較すると、多様なエッジデバイスへの適合が時に複雑になることがあります。

パフォーマンス分析#

これらのモデルを評価する際には、生の速度と精度のメトリクスが不可欠です。以下は、COCO dataset上でのさまざまなモデルサイズのパフォーマンスを強調する比較表です。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

YOLOv6-3.0はより大きなバリアントで高いmAPスコアを達成しますが、YOLOv5は非常に軽量なフットプリントを維持しています。例えば、YOLOv5nは対応するYOLOv6モデルよりもパラメータ数とFLOPsが大幅に少なく、モバイルやCPU負荷の高いデプロイメントにおいて非常に最適です。

エコシステムと使いやすさ#

多くのエンジニアリングチームにとって真の決定要因となるのは、モデルを取り巻くエコシステムです。

YOLOv6は印象的な研究リポジトリですが、さまざまなフォーマットでデプロイするためには多くのボイラープレートコードが必要です。対照的に、Ultralyticsは合理化されたユーザー体験を特徴とする、よくメンテナンスされたエコシステムを提供しています。統合されたPython APIと直感的なUltralytics Platformを通じて、開発者はシームレスなデータセット管理、ワンクリック学習、ONNXTensorRTなどのフォーマットへの直接のエクスポート機能を利用できます。

コード例: 統一されたUltralytics API#

Ultralyticsの ultralytics pipパッケージを使用すると、わずか数行のコードでモデルのロード、学習、デプロイを行うことができます。

from ultralytics import YOLO

# Load a pretrained YOLOv5 small model
model = YOLO("yolov5s.pt")

# Train the model effortlessly on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run fast inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for edge deployment
model.export(format="onnx")

ユースケースと推奨事項#

YOLOv5とYOLOv6のどちらを選択するかは、特定のプロジェクト要件、デプロイメントの制約、およびエコシステムの好みによって決まります。

YOLOv5を選択すべき場合#

YOLOv5は次の場合に強力な選択肢となります:

  • 実証済みの本番システム: YOLOv5の長期にわたる安定性の実績、広範なドキュメント、および膨大なコミュニティサポートが重視される既存のデプロイ環境。
  • リソースが制限されたトレーニング: GPUリソースが限られており、YOLOv5の効率的なトレーニングパイプラインと低いメモリ要件が有利に働く環境。
  • 豊富なエクスポートフォーマットのサポート: ONNXTensorRTCoreMLTFLiteを含む多くのフォーマットにわたるデプロイを必要とするプロジェクト。

YOLOv6を選択すべき時#

YOLOv6が推奨されるケース:

  • 産業用ハードウェア対応の展開: モデルのハードウェア認識設計と効率的な再パラメータ化が、特定のターゲットハードウェア上で最適化されたパフォーマンスを提供するシナリオ。
  • 高速なシングルステージ検出: 管理された環境でのリアルタイムビデオ処理において、GPU上の生の推論速度を優先するアプリケーション。
  • Meituanエコシステムの統合: すでにMeituanの技術スタックおよびデプロイインフラストラクチャ内で作業しているチーム。

Ultralytics (YOLO26) を選択すべき時#

ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。

  • NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
  • CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
  • 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。

前進する:YOLO26の利点#

YOLOv5は依然として信頼性の高い実用的なモデルであり、YOLOv6-3.0は産業用GPUにおいて強力なスループットを提供しますが、最先端技術は進化しています。現在新しいプロジェクトを開始する開発者にとって、推奨されるパスはUltralytics YOLO26です。

2026年1月にリリースされたYOLO26は、大きな飛躍を遂げています。Ultralyticsエコシステムの比類ない汎用性を継承しつつ、画期的なアーキテクチャの改善を導入しています:

  • エンドツーエンドのNMSフリー設計: YOLO26はNon-Maximum Suppressionのポストプロセッシングを排除し、レイテンシの変動を劇的に削減するとともに、デプロイメントのロジックを簡素化します。
  • 最大43%高速なCPU推論: DFLの除去と最適化されたヘッドにより、エッジおよび低電力デバイスにおいて、前世代と比較して大幅に性能が向上しています。
  • MuSGDオプティマイザ: LLMトレーニングの革新技術を活用した新しいMuSGDオプティマイザにより、非常に安定したトレーニングと驚くほど高速な収束を実現しています。
  • 高度な汎用性: YOLO26は、ProgLossやSTALなどの特化型タスク損失を用いて、Oriented Bounding Box (OBB)姿勢推定、およびセグメンテーションをシームレスに処理し、比類ない小物体認識を実現します。

Ultralyticsエコシステム内の他のオプションを探索している場合は、汎用のYOLO11や、オープンボキャブラリ検出タスク向けの革新的なYOLO-Worldも検討できます。

結論#

YOLOv5とYOLOv6-3.0は、いずれもコンピュータビジョンの分野に大きな影響を与えてきました。YOLOv6-3.0はハイエンドサーバーハードウェア向けに優れたスループットを提供し、特殊なオフライン解析に適しています。しかし、YOLOv5は、堅牢で使いやすく、世界クラスのプラットフォームに支えられた非常に汎用性の高いモデルを必要とする開発者にとって、依然として優れた選択肢です。

次世代の精度、ネイティブなNMSフリーのデプロイ、そして業界最高のエクスペリエンスの究極のバランスを求める場合、Ultralytics Platformを介してYOLO26にアップグレードすることが、現代のビジョンAIソリューションにとって決定版の選択肢となります。

コントリビューター

コメント