YOLOXとYOLOv5#
適切な物体検出モデルの選択は、あらゆるコンピュータービジョンプロジェクトの成否を左右する重要な判断です。このガイドでは、AI分野を代表する2つのモデル、MegviiのYOLOXとUltralytics YOLOv5を包括的に技術比較します。アーキテクチャ、性能指標、トレーニングエコシステムを分析し、開発者や研究者がそれぞれのデプロイ環境に適した選択を行えるよう支援します。
モデルの概要#
両モデルはリアルタイム物体検出が急速に進歩した時期に登場しましたが、性能を実現するために異なるアーキテクチャの考え方を採用しました。
YOLOX:アンカーフリーのアプローチ#
研究者のZheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sunによって、2021年7月18日にMegviiからリリースされたYOLOXは、従来のアンカーボックスから脱却するという大きな転換をもたらしました。Arxivの技術レポートに記載されているように、YOLOXはアンカーフリー設計に、分離型ヘッドとSimOTAラベル割り当て戦略を組み合わせました。この設計は、標準的なデータセットで高い性能を発揮し、学術研究と産業応用の隔たりを埋めることを目指しました。
YOLOv5:本番環境のビジョンAIにおける標準#
Glenn Jocherが開発し、2020年6月26日にUltralyticsからリリースされたYOLOv5は、デプロイされるコンピュータービジョンの業界標準として急速に普及しました。PyTorch framework上にネイティブに構築され、比類ない使いやすさ、非常に高速なトレーニング、完成度の高いリポジトリを提供することで、最先端AIを広く利用できるようにしました。YOLOv5のアーキテクチャは、速度、精度、デプロイの容易さの絶妙なバランスに重点を置いており、エッジデバイスから大規模なクラウドデプロイまで、幅広い用途で選ばれています。
アーキテクチャの違い#
これらのネットワークの基本的な仕組みの違いを理解すると、さまざまなタスクで性能に差が生じる理由が明確になります。
アンカーフリーとアンカーベース#
最も顕著な違いは、YOLOXのアンカーフリー機構です。YOLOv5のような従来モデルは、バウンディングボックスを予測する際に事前定義されたアンカーボックスに依存しており、最適なアンカーサイズを決めるためにトレーニングデータセットのクラスタリング分析が必要です。YOLOXはこれを排除し、各空間位置でバウンディングボックスの座標を直接予測します。アンカーフリーのアプローチは設計パラメーターの数とヒューリスティックな調整を減らします。一方、YOLOv5の洗練されたアンカーベースのアプローチは、自動アンカー機能によって、初期状態から非常に安定した予測可能なトレーニング収束を実現します。
分離型ヘッドと結合型ヘッド#
YOLOXは分離型ヘッドを採用しており、分類タスクと回帰タスクを別々のニューラルネットワーク分岐に分けています。著者らは、これによって空間特徴と意味特徴の学習間に生じる競合を解消できると説明しています。一方、YOLOv5は(初期バージョンでは)高度に最適化された結合型ヘッドを採用し、計算効率を最大化して推論レイテンシを低減しました。これはリアルタイムのエッジコンピューティングで特に重要です。
ラベル割り当て戦略#
YOLOXはラベル割り当てにSimOTAを使用します。これは、正解オブジェクトと予測の対応付けを最適輸送問題として定式化する手法です。この動的な割り当てにより、混雑したシーンへの対応が向上します。YOLOv5は堅牢な形状ルールに基づく割り当てを採用し、高品質な正例サンプルを常に損失関数に渡します。これが、優れたトレーニング安定性の一因です。
性能とベンチマーク#
速度と精度のトレードオフは、これらのアーキテクチャを評価するうえで最も重要な基準です。以下の表は、標準的なベンチマークにおける各モデルサイズの性能を示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
YOLOXは、特に大型バリエーションで競争力のあるmAPスコアを達成しますが、YOLOv5は全般的にTensorRT推論速度で際立った優位性を維持しています。たとえばYOLOv5sモデルは、速度と精度の比率に優れており、1ミリ秒も無駄にできないリアルタイムアプリケーションに適しています。
Ultralyticsの強み:トレーニングと使いやすさ#
研究から本番環境へ移行する際には、モデル自体と同じくらい、そのモデルを取り巻くエコシステムが重要になることがよくあります。ここで、Ultralyticsエコシステムの利点が際立ちます。
使いやすいユーザー体験#
YOLOv5は「ゼロからヒーローへ」とも評される開発者体験で広く高く評価されています。Ultralytics Python APIとCLIを使えば、1行のコードでモデルの読み込み、トレーニング、デプロイを実行できます。一方、Megvii GitHubリポジトリからYOLOXを実行するには、環境変数の手動設定、複雑なPythonパスの構成、学術研究用コードベース特有の習得コストが必要です。
トレーニング効率とメモリ要件#
Ultralyticsのモデルは、トレーニング時のメモリ使用量を最小限に抑えるよう、綿密に設計されています。YOLOv5のCUDAメモリ使用量は、RT-DETRのようなパラメーター数の多いTransformerモデルや、最適化されていない研究モデルと比べて大幅に少なくなります。そのため、開発者は一般消費者向けハードウェアでより大きなバッチサイズをトレーニングでき、反復的な開発サイクルを加速できます。
さまざまなタスクに対応する汎用性#
YOLOXが物体検出専用のフレームワークである一方、UltralyticsエコシステムではYOLOv5が進化し、複数のビジョンタスクに対応しています。追加設定なしで、同じAPI構文を使って画像分類、インスタンスセグメンテーション、物体検出を実行できます。
姿勢推定や方向付きバウンディングボックス(OBB)検出など、さらに高度なタスクが必要な場合は、これらすべてにネイティブ対応し、最先端の精度を実現する最新のUltralytics YOLO26アーキテクチャへのアップグレードを強くおすすめします。
コードの比較#
使いやすさの違いは、コードを見れば最もよく分かります。
YOLOv5でのトレーニング:
from ultralytics import YOLO
# 事前学習済みYOLOv5sモデルを読み込む
model = YOLO("yolov5su.pt") # YOLOv5u: ultralyticsパッケージ向けのアンカーフリーYOLOv5重み
# COCO8のサンプルデータセットでモデルをトレーニングする
model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 画像に対して推論を実行する
results = model("https://ultralytics.com/images/zidane.jpg")
# 結果を表示
results[0].show()YOLOXでのトレーニング: (リポジトリの手動クローン、setup.pyのインストール、複雑なCLI引数が必要です)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oUltralyticsのアプローチでは手間が減り、設定ファイルのデバッグではなく、データセットとアプリケーションロジックに集中できます。さらに、Weights & BiasesとComet MLとの組み込み連携により、実験の追跡も簡単です。
最適なユースケースと実際の応用例#
どちらのモデルを選ぶかは、プロジェクトの運用環境によって決まります。
YOLOXが優れている点#
YOLOXは、アンカーフリーのパラダイムやラベル割り当て戦略を明確に研究する学術分野で、依然として有力な候補です。また、混雑シーンの検出が最優先の評価指標であり、エッジデプロイの速度が二次的な要件となる状況にも適しています。
YOLOv5が優れている用途#
YOLOv5は、実用的なデプロイにおいて間違いなく優れています。
- 高速製造: 組立ラインでの欠陥検出では、エッジGPUでのYOLOv5の低い推論レイテンシにより、ベルトコンベアを減速させずに製品を検査できます。
- ドローンと航空画像: メモリ使用量が少ないため、ドローンの軽量なコンパニオンコンピューター上で、農業モニタリングや野生動物の追跡などのタスクを実行できます。
- スマートリテール: 自動精算から在庫管理まで、YOLOv5はTensorRTやONNXに簡単にエクスポートでき、数千台の店舗カメラに一斉にデプロイできます。
今後を見据えて:YOLO26の優位性#
YOLOv5は優れたモデルですが、AI分野は急速に進歩しています。現在新しいプロジェクトを始める場合は、最新世代のUltralyticsモデルをぜひご検討ください。
2026年にリリースされたUltralytics YOLO26は、大きな飛躍を遂げています。オプションのエンドツーエンドNMSフリー設計(nms=False)を備え、Non-Maximum Suppressionによる後処理を不要にすることで、デプロイロジックを大幅に簡素化します。Distribution Focal Loss(DFL)を排除し、最先端のMuSGD Optimizerを採用することで、YOLO26は従来世代より最大43%高速なCPU推論を実現します。また、新しいProgLoss + STAL(Progressive Loss and Small-Target-Aware Label Assignment)により、特に小さな物体で高い精度を維持します。
実績のあるYOLOv5の信頼性を選ぶ場合も、最先端のYOLO26の性能を選ぶ場合も、Ultralytics Platformを活用すれば、コンピュータービジョンソリューションを構想から本番環境までスムーズに導入するための最適なツールを利用できます。AIパイプラインの可能性を最大限に引き出すため、包括的なUltralyticsドキュメントもぜひご確認ください。