YOLO Vision 2026:

YOLOX対YOLOv5#

適切なオブジェクト検出モデルの選択は、あらゆるコンピュータビジョンプロジェクトの成功を左右する重要な決定です。このガイドでは、AI分野における2つの重要なモデル、MegviiのYOLOXとUltralytics YOLOv5の包括的な技術比較を提供します。そのアーキテクチャ、パフォーマンス指標、およびトレーニングエコシステムを分析することで、開発者や研究者が特定のデプロイメント環境に適した選択を行えるよう支援することを目指しています。

モデルの紹介#

両モデルはリアルタイム物体検出が急速に進歩していた時期に登場しましたが、その性能を達成するためのアーキテクチャの哲学は異なります。

YOLOX:アンカーフリーのアプローチ#

2021年7月18日にMegviiの研究者であるZheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sunによって発表されたYOLOXは、従来のアンカーボックスから脱却するという大きな変化をもたらしました。Arxivの技術レポートに記載されているように、YOLOXはアンカーフリーの設計に、分離型ヘッド(decoupled head)およびSimOTAラベル割り当て戦略を統合しました。この設計は、学術研究と産業応用のギャップを埋め、標準データセット上で強力なパフォーマンスを提供することを目指していました。

YOLOX について詳しく学ぶ

YOLOv5:プロダクションVision AIのスタンダード#

Glenn Jocherによって作成され、2020年6月26日にUltralyticsによってリリースされたYOLOV5は、デプロイされるコンピュータビジョンにおける業界標準へと急速に成長しました。PyTorchフレームワーク上でネイティブに構築されており、比類のない使いやすさ、非常に高速なトレーニング、高度に洗練されたリポジトリを提供することで、最先端のAIを民主化しました。YOLOV5のアーキテクチャは、速度、精度、デプロイの容易さの完璧なバランスに焦点を当てており、エッジデバイスから大規模なクラウドデプロイに至るまで、あらゆる用途で人気を集めました。

YOLOv5の詳細はこちら

アーキテクチャの違い#

これらのネットワーク間の基本的なメカニズムの違いを理解することで、なぜ各タスクにおいてパフォーマンスに差が生じるのかが明確になります。

アンカーフリー対アンカーベース#

最も決定的な違いは、YOLOXのアンカーフリーメカニズムです。YOLOv5のような従来のモデルは、事前に定義されたアンカーボックスに依存してbboxを予測します。これには、最適なアンカーサイズを決定するためにトレーニングデータセットでのクラスタリング分析が必要です。YOLOXはこれを排除し、各空間位置で直接bbox座標を予測します。アンカーフリーのアプローチは設計パラメータの数とヒューリスティックな調整を減らしますが、YOLOv5の洗練されたアンカーベースのアプローチは、オートアンカー機能によって、最初から非常に安定した予測可能なトレーニングの収束を保証します。

デカップルヘッド対カップルヘッド#

YOLOXはデカップルヘッドを採用しており、これは分類タスクと回帰タスクが別々のニューラルネットワークブランチに分離されていることを意味します。著者らは、これが空間的特徴学習と意味的特徴学習の間の競合を解決すると主張しました。対照的に、YOLOv5は(初期バージョンにおいて)計算効率を最大化し、推論レイテンシを低減する高度に最適化されたカップルヘッドを利用しており、これはリアルタイムエッジコンピューティングにおいて極めて重要です。

アーキテクチャの進化

YOLOXが2021年に分離型ヘッドを支持した一方で、Ultralyticsはその後継モデルであるYOLOv8や最先端のYOLO26などのモデルで分離型アーキテクチャを採用・完成させ、両者の長所を組み合わせました。

ラベル割り当て戦略#

YOLOXはラベル割り当てにSimOTAを利用しており、これは正解オブジェクトと予測のペアリングを最適な輸送問題として定式化するものです。この動的な割り当てにより、密集したシーンの処理が改善されます。YOLOv5は堅牢な形状ルールに基づく割り当てを採用しており、高品質なポジティブサンプルが確実に損失関数へ供給されるようにしており、これが伝説的なトレーニングの安定性に寄与しています。

性能とベンチマーク#

速度と精度のトレードオフは、これらのアーキテクチャにとって究極のテストです。以下の表は、標準的なベンチマークにおける各モデルサイズのパフォーマンスを示しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4

YOLOXは特に大規模なバリアントで競争力のあるmAPスコアを達成していますが、YOLOv5はTensorRT推論速度において全体的に驚くべき優位性を維持しています。例えば、YOLOv5sモデルは卓越した速度と精度の比率を提供し、1ミリ秒を争うリアルタイムアプリケーションにおいて非常に望ましい選択肢となります。

Ultralyticsの利点:トレーニングとユーザビリティ#

研究からプロダクションへ移行する際、モデルを取り巻くエコシステムはモデルそのものと同じくらい重要です。ここで、Ultralyticsエコシステムの利点が明確になります。

効率的なユーザー体験#

YOLOV5は、その「ゼロからヒーローへ」の開発者体験で普遍的に称賛されています。Ultralytics Python APIとCLIを使用すると、数行のコードでモデルの読み込み、トレーニング、デプロイを行うことができます。対照的に、Megvii GitHubリポジトリからYOLOXを実行するには、環境変数のより手動での設定、複雑なPythonパスの設定、および学術研究コードベース特有の急な学習曲線を必要とします。

トレーニングの効率とメモリ要件#

Ultralyticsモデルは、トレーニング中のメモリ使用量を最小限に抑えるよう綿密に設計されています。YOLOV5は、RT-DETRのようなパラメータが大量にあるTransformerモデルや最適化されていない研究用モデルと比較して、必要なCUDAメモリが大幅に少なくなります。これにより、開発者はコンシューマー向けハードウェアでより大きなバッチサイズをトレーニングでき、反復的な開発サイクルを加速させることができます。

タスク間での汎用性#

YOLOXは厳密にオブジェクト検出フレームワークですが、UltralyticsエコシステムはYOLOV5を拡張し、複数のビジョンタスクをサポートするように進化させています。すぐに使用可能な状態として、まったく同じAPI構文を使用して画像分類インスタンスセグメンテーション、およびオブジェクト検出を実行できます。

絶え間ない革新

姿勢推定指向性バウンディングボックス (OBB)検出などのさらに高度なタスクが必要な場合は、これらすべてを最先端の精度でネイティブにサポートする最新のUltralytics YOLO26アーキテクチャにアップグレードすることを強くお勧めします。

コード比較#

ユーザビリティの違いは、コードを見れば一目瞭然です。

YOLOv5でのトレーニング:

from ultralytics import YOLO

# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")

# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")

# Display results
results[0].show()

YOLOXでのトレーニング: (手動でのリポジトリクローン、setup.pyインストール、および複雑なCLI引数が必要)

# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -o

Ultralyticsのアプローチは摩擦をなくし、設定ファイルのデバッグではなく、データセットとアプリケーションのロジックに集中できるようにします。さらに、Weights & BiasesComet MLの組み込み統合により、実験の追跡がシームレスに行えます。

理想的なユースケースと実世界のアプリケーション#

これらのモデルの選択は、プロジェクトの運用環境に依存します。

YOLOXが優れている点#

YOLOXは、研究者がアンカーフリーのパラダイムやラベル割り当て戦略を明確に研究している学術環境において、強力な候補であり続けます。また、混雑したシーンでの検出が絶対的に最優先される指標であり、エッジ展開の速度が二の次であるシナリオでも有用です。

YOLOv5が優れている点#

YOLOv5は実用的なデプロイにおいて疑いの余地のないチャンピオンです。

  • 高速製造: アセンブリラインの欠陥検出において、エッジGPU上でのYOLOV5の最小限の推論レイテンシにより、ベルトを遅くすることなく製品の検査を行うことができます。
  • ドローンおよび空撮画像: 効率的なメモリフットプリントにより、農業モニタリングや野生動物の追跡などのタスクのために、ドローン上の軽量なコンパニオンコンピュータで実行できます。
  • スマートリテール: 自動チェックアウトから在庫管理まで、YOLOV5はTensorRTONNXに簡単にエクスポートでき、数千台の店舗カメラへの一斉デプロイが可能です。

今後の展望:YOLO26の優位性#

YOLOv5は伝説的なモデルですが、AIの分野は急速に進化しています。現在新しいプロジェクトを開始する場合は、最新世代のUltralyticsモデルを検討することを強く推奨します。

2026年にリリースされた**Ultralytics YOLO26は、大きな飛躍を遂げています。エンドツーエンドNMSフリー設計を特徴とし、Non-Maximum Suppressionの後処理の必要性が完全になくなり、デプロイメントロジックが大幅に簡素化されます。分布焦点損失(DFL)を排除し、最先端のMuSGDオプティマイザーを利用することにより、YOLO26は、新しいProgLoss + STAL損失関数のおかげで、特に小さなオブジェクトに対してより高い精度を維持しながら、前世代と比較して最大43%高速なCPU推論**を実現します。

YOLOV5の実証済みの信頼性を選択する場合でも、YOLO26の最先端のパフォーマンスを選択する場合でも、Ultralyticsプラットフォームを使用することで、コンピュータビジョンソリューションをコンセプトからプロダクションへとシームレスに移行するための最高のツールを確実に手に入れることができます。AIパイプラインの可能性を最大限に引き出すために、包括的なUltralyticsドキュメントを必ず確認してください。

コメント