Ultralytics YOLO27:
Get Started

YOLOv5とYOLOXの比較#

リアルタイムコンピュータービジョンは進化を続け、さまざまなアーキテクチャが速度と精度の限界を押し広げてきました。この分野で大きな影響力を持つモデルが、YOLOv5とYOLOXです。どちらも物体検出で高い性能を発揮することで知られていますが、アーキテクチャのアプローチは根本的に異なります。

このガイドでは、2つのモデルのアーキテクチャ、性能指標、トレーニング手法、最適なデプロイシナリオを詳しく技術的に分析・比較し、開発者や研究者がビジョンAIプロジェクトに適したツールを選べるよう支援します。

モデルの概要とアーキテクチャの違い#

Ultralytics YOLOv5#

Ultralyticsによって発表されたYOLOv5は、性能、使いやすさ、メモリ効率の優れたバランスにより、急速に業界標準となりました。PyTorchフレームワーク上にネイティブに構築されたYOLOv5は、アンカーベースのアーキテクチャを採用しています。事前定義されたバウンディングボックス形状を基に物体の位置を予測するため、標準的な物体検出タスクで高い効果を発揮します。

YOLOv5の大きな強みの1つは、よく整備されたエコシステムです。充実したドキュメント、非常にシンプルなPython API、Ultralytics Platformとのネイティブな統合を備えています。これにより、開発者はデータセットのラベリングからトレーニング、ONNXやTensorRTなどの形式へのエクスポートまで、シームレスに移行できます。

エコシステムの優位性

Ultralytics YOLOモデルは通常、複雑なTransformerベースの代替モデルと比べて、トレーニング時に必要なGPUメモリが大幅に少なくて済みます。この低いメモリ使用量により、YOLOv5は一般向けハードウェアを使用する研究者にも利用しやすくなっています。

Megvii YOLOX#

Megviiの研究者によって開発されたYOLOXは、アンカーフリー設計をYOLOファミリーに導入し、異なるアプローチを取りました。アンカーボックスを排除することで、YOLOXは検出ヘッドを簡素化し、トレーニング中に手動で調整する必要があるヒューリスティックなパラメーターの数を大幅に削減します。

YOLOXは、分類タスクと回帰タスクを別々のネットワーク分岐に分けるデカップルドヘッドも採用し、SimOTAラベル割り当て戦略を利用しています。こうした技術革新は学術研究と産業応用の隔たりを埋め、物体のスケールが大きく異なる環境でYOLOXを特に効果的にします。

YOLOXの詳細はこちら

パフォーマンスとメトリクス#

コンピュータービジョンモデルを評価する際は、平均適合率(mAP)と推論速度のトレードオフが重要です。どちらのモデルも、さまざまなハードウェア制約に対応できるよう、NanoからExtra-Largeまで複数のサイズを提供しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9

YOLOXxは最高精度がわずかに高い(51.1 mAP)一方、YOLOv5はCPUとGPUのハードウェア全般にわたって、はるかに堅牢で十分に検証されたデプロイパイプラインを提供します。YOLOv5のTensorRT速度は、エッジコンピューティングデバイス向けに深く最適化されていることを示しており、リアルタイム動画分析において非常に信頼性の高い選択肢です。

トレーニング手法と使いやすさ#

この2つのアーキテクチャでは、開発者体験に大きな違いがあります。

YOLOXのアプローチ#

YOLOXのトレーニングでは通常、元のリポジトリをクローンし、個別の依存関係を管理して、複雑なコマンドラインスクリプトを実行する必要があります。MegEngineを介した混合精度トレーニングやマルチノード構成などの高度な機能に対応していますが、迅速なプロトタイピングを必要とする開発者にとって、習得のハードルが高い場合があります。

Ultralyticsの強み#

対照的に、Ultralyticsは非常にシンプルなユーザー体験を重視しています。ultralytics Pythonパッケージを使用すると、最小限の定型コードでモデルの読み込み、トレーニング、検証を行えます。複雑なデータ拡張、ハイパーパラメーターの最適化、学習率スケジューリングはUltralyticsが自動的に処理します。

from ultralytics import YOLO

# 事前学習済みYOLOv5のSmallモデルを読み込む
model = YOLO("yolov5su.pt")  # YOLOv5u: ultralyticsパッケージ向けのアンカーフリーYOLOv5重み

# COCO8データセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# モデルの性能を検証します
metrics = model.val()

さらに、YOLOv5は標準的な物体検出にとどまらない汎用性を備えており、同じ一貫したAPI内で画像分類とインスタンスセグメンテーションにも強力に対応しています。

効率的なデプロイ

トレーニングが完了したら、YOLOv5モデルをONNX、CoreML、LiteRT、OpenVINOにエクスポートする操作は、model.export(format="onnx")のような1回の呼び出しだけで簡単に行えます。これにより、研究中心のリポジトリで一般的に必要となるサードパーティ製変換スクリプトが不要になります。

実際の用途#

これらのモデルの選択は、デプロイ環境と技術要件によって異なります。

  • 小売・在庫管理: NVIDIA Jetsonなどのエッジデバイス上でリアルタイムの商品認識が必要なアプリケーションには、YOLOv5が非常に適しています。メモリ使用量が少なく、TensorRT推論が高速なため、フレームを落とさずに複数のカメラを追跡できます。
  • 学術研究・カスタムアーキテクチャ: YOLOXは研究コミュニティで高く評価されています。デカップルドヘッドとアンカーフリー設計により、新しいラベル割り当て戦略を試したいエンジニアや、従来のアンカーボックスでは汎化が難しいデータセットに取り組むエンジニアにとって、優れたベースラインとなります。
  • 農業AI: ドローンを使った果物の検出や雑草の識別などの精密農業タスクでは、Ultralytics Platformを利用してYOLOv5モデルを簡単にトレーニング、デプロイできるため、機械学習エンジニアリングの深い知識がない分野の専門家でもAIソリューションを導入できます。

ユースケースと推奨事項#

YOLOv5とYOLOXのどちらを選ぶかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムの好みによって異なります。

YOLOv5を選ぶ場合#

YOLOv5は、次のような場合に適しています。

  • 実績のある本番システム: YOLOv5の長年にわたる安定性の実績、充実したドキュメント、幅広いコミュニティサポートが重視される既存のデプロイ環境です。
  • リソースが限られたトレーニング: GPUリソースが限られており、YOLOv5の効率的なトレーニングパイプラインと低いメモリ要件が有利となる環境です。
  • 幅広いエクスポート形式への対応: ONNX、TensorRT、CoreML、LiteRTなど、多様な形式でのデプロイが必要なプロジェクトです。

YOLOXを選ぶタイミング#

YOLOXは次のような用途に推奨されます。

  • アンカーフリー検出の研究: 新しい検出ヘッドや損失関数を試す際のベースラインとして、YOLOXのシンプルなアンカーフリーアーキテクチャを使用する学術研究。
  • 超軽量エッジデバイス: YOLOX-Nanoバリアントの極めて小さなフットプリント(パラメーター数0.91M)が重要となる、マイクロコントローラーや旧式のモバイルハードウェアへのデプロイ。
  • SimOTAラベル割り当ての研究: 最適輸送に基づくラベル割り当て戦略と、トレーニングの収束への影響を調査する研究プロジェクト。

Ultralytics (YOLO26)を選ぶ場合#

多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。

  • NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
  • CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
  • 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。

ビジョンAIの未来:YOLO26の登場#

YOLOv5とYOLOXはいずれもコンピュータービジョンの歴史に確かな足跡を残していますが、この分野は急速に進歩しています。現在、新しいプロジェクトを始める開発者には、Ultralyticsの最新フラッグシップモデルであるYOLO26の検討を強くおすすめします。

2026年1月にリリースされたYOLO26は、性能と使いやすさの両面で大きく進歩しています。画期的なエンドツーエンドのNMSフリー設計(nms=Falseで選択)を導入し、Non-Maximum Suppressionによる後処理を不要にします。これによりレイテンシーのばらつきが大幅に減り、低消費電力デバイスでのデプロイロジックが簡素化されます。

さらに、YOLO26はLLMトレーニングの技術革新に着想を得たSGDとMuonのハイブリッドである、新しいMuSGD Optimizerを採用しており、非常に安定した高速な収束を実現します。DFL Removal(エクスポートの簡素化とエッジ・低消費電力デバイスとの互換性向上のためにDistribution Focal Lossを削除)により、YOLO26はCPU推論を最大43%高速化し、最新のエッジコンピューティング、ロボティクス、IoTアプリケーションに最適なモデルとしての地位を確立しています。さらに、ProgLoss + STALは損失関数を改善し、小物体認識の精度を大幅に向上させます。これはIoT、ロボティクス、航空画像において重要です。以前の世代に関心がある場合はYOLO11もご覧いただけますが、最先端の選択肢としてはYOLO26が他を圧倒しています。

結論#

YOLOv5とYOLOXはいずれも優れた物体検出能力を備えています。YOLOXは2021年に、アンカーフリー設計が従来手法と競合し、それを上回ることもできると示し、アーキテクチャの可能性を広げました。しかし、比類のない使いやすさ、充実したエコシステム、トレーニング時のメモリ要件の低さにより、YOLOv5は依然として大きな存在感を保っています。

大半の商用アプリケーションでは、Ultralyticsのエコシステムにより、生データセットから本番環境にデプロイされたモデルまで、最短で進められます。実績のあるYOLOv5を使用する場合も、最先端のYOLO26にアップグレードする場合も、開発者はビジョンAIを使いやすく、効率的で、高性能にするために設計されたフレームワークのメリットを得られます。

コントリビューター

コメント