YOLOX 対 YOLOv9#
コンピュータービジョンの分野は、計算効率と高い精度のバランスを取る、継続的なアーキテクチャ上のブレークスルーによって形作られてきました。リアルタイム物体検出モデルを評価する際、MegviiのYOLOXとAcademia SinicaのYOLOv9を比較すると、ディープラーニング開発における2つの異なる思想が浮かび上がります。一方は簡素化されたアンカーフリーパラダイムを先駆的に導入し、もう一方は情報保持を最大化する高度な勾配ルーティング技術を導入しました。
この技術ガイドでは、両モデルのアーキテクチャ上の特徴、性能ベンチマーク、理想的なユースケースを詳しく解説するとともに、Ultralytics Platformや新たにリリースされたYOLO26モデルなど、プロダクション対応のデプロイメントに向けた最新ソリューションが、より優れた代替手段となる仕組みを紹介します。
YOLOX:アンカーフリーパラダイムの先駆け#
2021年半ばにリリースされたYOLOXは、学術研究と産業利用の隔たりを埋めるうえで大きな前進となりました。事前定義されたアンカーボックスを不要にすることで、カスタムデータセットに最適なアンカーサイズを見つけるために必要なヒューリスティック調整を大幅に簡素化しました。
- 著者: Zheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sun
- 組織: Megvii
- リリース日: 2021年7月18日
- 参考資料: ArXiv論文
- ソースコード: YOLOX GitHubリポジトリ
- ドキュメント: YOLOX公式ドキュメント
アーキテクチャのイノベーション#
YOLOXは、標準的な検出パイプラインにいくつかの重要な変更を導入しました。分類タスクと回帰タスクを分離するデカップルドヘッドを実装し、物体の識別と境界の位置特定の間に生じる競合を大幅に軽減しました。さらに、YOLOXはSimOTAを採用しました。これは、トレーニング中に正例サンプルを動的に割り当てる高度なラベル割り当て戦略であり、標準のベンチマークデータセットにおける収束の高速化と全体的な性能向上につながりました。
長所と制限事項#
YOLOXの主な強みは、その簡素化された設計にあります。アンカーフリー機構により、開発者は特定のデータに最適なアンカーサイズを見つけるためのクラスタリングアルゴリズムの実行に費やす時間を短縮できます。ただし、セルフアテンションや勾配経路に関する近年の進歩を取り入れずに構築された古いアーキテクチャであるため、新しいネットワークと同等のパラメータ効率を実現するのは困難です。また、統合されたAPI内でのインスタンスセグメンテーションやポーズ推定などの高度なタスクのネイティブサポートもありません。
YOLOv9:勾配情報の最大化#
2024年に入り、YOLOv9は、深層畳み込みニューラルネットワークに内在する情報ボトルネック問題を解決するため、非常に理論的なアプローチを導入しました。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織: 中央研究院情報科学研究所
- リリース日: 2024年2月21日
- 参考資料: ArXiv論文
- ソースコード: YOLOv9 GitHubリポジトリ
- ドキュメント: Ultralytics YOLOv9ドキュメント
アーキテクチャのイノベーション#
YOLOv9を特徴づける機能は、プログラマブル勾配情報(PGI)です。これは、ネットワークの複数のレイヤーを通過する際に重要なセマンティックデータが失われないようにします。一般化効率的レイヤー集約ネットワーク(GELAN)と組み合わせることで、YOLOv9はパラメータ数と精度の比率において卓越した性能を実現します。これにより、重みの更新に必要な正確な勾配を保持できるため、軽量バリアントでも非常に高い効果を発揮します。
長所と制限事項#
YOLOv9は、モデル精度の理論的限界を押し広げる点で優れています。COCOで非常に高いmAPスコアを達成するため、研究者に好まれています。しかし、効率性に優れている一方で、YOLOv9は依然として後処理に従来の非最大抑制(NMS)を使用しており、推論中にレイテンシーの急増を引き起こします。エッジデバイスへのAIデプロイメントに取り組むエンジニアにとって、NMSロジックの管理はデプロイメントパイプラインに不要な複雑さを加えます。
YOLOXやYOLOv9などの従来型モデルでは、重複するバウンディングボックスを除外するために非最大抑制(NMS)が必要です。この処理は本質的に逐次的であり、CPU上でボトルネックを生じさせることが多いため、最新のUltralyticsモデルに搭載されたネイティブなエンドツーエンドアーキテクチャの必要性が浮き彫りになります。
性能比較#
これらのアーキテクチャの生の計算指標を比較すると、YOLOv9がより現代的なベースラインを提供する一方、YOLOXはレガシー環境向けの軽量な選択肢であることが明らかです。以下に、両モデルの標準モデルについて詳しく説明します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
同程度のパラメータ数で比較するとYOLOv9はより高い精度を示しますが、速度、精度、使いやすさの究極のバランスを求める開発者は、Ultralyticsの最新の進歩を検討する必要があります。
Ultralyticsの優位性:YOLO26の紹介#
YOLOXやYOLOv9などの過去のモデルを評価することは有用な背景情報を提供しますが、現在の最先端技術はUltralytics YOLO26によって定義されています。2026年初頭にリリースされたYOLO26は、現代のエンタープライズ環境向けに検出パイプラインを根本から再設計しました。
比類のないアーキテクチャイノベーション#
YOLO26は、ネイティブなエンドツーエンドNMSフリーデザインにより、前世代モデルの後処理ボトルネックを完全に解消し、あらゆるハードウェアでのデプロイメントを簡素化します。さらに、Distribution Focal Loss(DFL)を削除し、確率的勾配降下法とMuonのハイブリッドである革新的なMuSGD Optimizerを統合することで、YOLO26は前例のないトレーニング安定性を実現します。
Raspberry Piのような制約のある環境にデプロイする開発者向けに、YOLO26はCPU推論を最大43%高速化します。また、ProgLoss + STAL損失関数を導入し、小さな物体の認識を大幅に向上させます。これは、航空画像やドローン分析において重要です。
効率化された開発エコシステム#
スタンドアロンの研究リポジトリとは異なり、Ultralyticsエコシステムは比類のない開発者体験を提供します。Ultralytics Python APIを活用することで、エンジニアはボイラープレートコードを大幅に削減できます。さらに、メモリ要件も高度に最適化されているため、アテンションを多用するアーキテクチャと比較して、より少ないGPU VRAMで堅牢なモデルをトレーニングできます。
from ultralytics import YOLO
# Load the highly optimized, NMS-free YOLO26 small model
model = YOLO("yolo26s.pt")
# Train on a custom dataset with minimal memory footprint
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Easily export to optimized deployment formats
model.export(format="engine", quantize=16) # Exports to TensorRT検出に加えて、YOLO26はまったく同じフレームワーク内で多様なタスクをシームレスにサポートします。衛星画像に対する正確なOriented Bounding Boxes(OBB)が必要な場合でも、医用画像アプリケーション向けの詳細なピクセルマスクが必要な場合でも、ワークフローは同一です。以前の世代のワークフローを利用しているチーム向けには、Ultralytics YOLO11も利用でき、完全にサポートされています。
最適なユースケースとデプロイ戦略#
適切なアーキテクチャの選択は、対象のデプロイメント環境とプロジェクト要件に完全に依存します。
エッジコンピューティングとロボティクス#
低消費電力デバイスでは、重い後処理を必要とするモデルに依存すると、性能が大幅に低下する可能性があります。YOLOX-Nanoは非常に小型ですが、安全性が重視されるタスクでは精度が不十分なことが多くあります。ここではYOLO26が決定的な選択肢です。DFLとNMSがないため、生のCPUスレッド上でスムーズに動作し、自律型ロボティクスやスマートパーキング管理に最適です。
学術的ベンチマーク#
目的が勾配フローの分析とディープネットワークのボトルネックの研究だけであれば、YOLOv9は依然として優れた研究対象です。そのPGIフレームワークは、深層ニューラルネットワークのレイヤー間で特徴がどのように保持されるかについて興味深い洞察をもたらすため、畳み込み理論を研究する大学の研究者にとって有用なツールとなります。
エンタープライズ動画分析#
セキュリティアラームシステムや交通監視など、大規模な動画処理タスクでは、速度と柔軟なエクスポート機能が極めて重要です。Ultralyticsフレームワークが提供するネイティブなエクスポートツールを使用すると、チームは1つのコマンドでYOLO26を直接TensorRTまたはOpenVINO向けにコンパイルでき、製品化までの時間を大幅に短縮できます。
Ultralyticsエコシステムの包括的な機能を活用することで、機械学習チームは研究用の生のコードベースに伴う複雑さを回避し、スケーラブルで現実世界に対応したAIアプリケーションの構築に直接集中できます。