YOLOXとYOLOv9#
コンピュータービジョンの分野は、計算効率と高い精度の両立を目指すアーキテクチャの継続的な革新によって発展してきました。リアルタイム物体検出モデルを評価する際、MegviiのYOLOXとAcademia SinicaのYOLOv9を比較すると、ディープラーニング開発に対する2つの異なる考え方が見えてきます。一方はシンプルなアンカーフリーパラダイムを先駆けて導入し、もう一方は情報保持を最大化する高度な勾配ルーティング手法を導入しました。
この技術ガイドでは、両モデルのアーキテクチャの特徴、性能ベンチマーク、最適なユースケースを解説します。また、Ultralytics Platformや新たにリリースされたYOLO26モデルなどの最新ソリューションが、本番環境向けデプロイに優れた代替手段となることも紹介します。
YOLOX:アンカーフリーパラダイムの先駆け#
2021年半ばにリリースされたYOLOXは、学術研究と産業応用の隔たりを埋める大きな一歩となりました。事前定義されたアンカーボックスを不要にし、カスタムデータセットに必要なヒューリスティックな調整を大幅に簡素化しました。
- 著者: Zheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sun
- 組織: Megvii
- リリース日: 2021年7月18日
- 参考文献: Arxiv論文
- ソースコード: YOLOX GitHubリポジトリ
- ドキュメント: YOLOX公式ドキュメント
アーキテクチャの革新#
YOLOXは、標準的な検出パイプラインにいくつかの重要な変更を加えました。分類タスクと回帰タスクを分離する分離型ヘッドを採用し、物体の識別とその境界の特定との競合を大幅に緩和しました。さらに、YOLOXは高度なラベル割り当て戦略であるSimOTAを導入しました。これはトレーニング中に正例サンプルを動的に割り当て、標準的なベンチマークデータセットでの収束を速め、全体的な性能を向上させます。
長所と制約#
YOLOXの主な強みは、シンプルな設計にあります。アンカーフリー機構により、開発者は特定のデータに適したアンカーサイズを見つけるためのクラスタリングアルゴリズムの実行にかける時間を減らせます。一方、自己注意や勾配経路に関する近年の進歩を取り入れずに構築された旧世代のアーキテクチャであるため、新しいネットワークと同等のパラメーター効率を実現するのは困難です。また、統一API内でのインスタンスセグメンテーションや姿勢推定などの高度なタスクもネイティブにはサポートしていません。
YOLOv9:勾配情報の最大化#
2024年に話を進めると、YOLOv9は、深層畳み込みニューラルネットワークに内在する情報ボトルネック問題を解決するため、理論を重視した手法を導入しました。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織:中央研究院情報科学研究所
- リリース日: 2024年2月21日
- 参考文献: Arxiv論文
- ソースコード: YOLOv9 GitHubリポジトリ
- ドキュメント: Ultralytics YOLOv9ドキュメント
アーキテクチャの革新#
YOLOv9の特徴的な機能は、Programmable Gradient Information(PGI)です。これにより、ネットワークの複数の層を通過する際に、重要な意味情報が失われないようにします。Generalized Efficient Layer Aggregation Network(GELAN)と組み合わせることで、YOLOv9はパラメーター数に対する精度の比率を非常に高くしています。これにより、モデルは重み更新に必要な正確な勾配を保持でき、軽量版でも高い効果を発揮します。
長所と制約#
YOLOv9は、モデル精度の理論上の限界を押し広げる点で優れています。COCOで優れたmAPスコアを達成し、研究者に好まれています。しかし、効率性に優れる一方で、後処理には従来の非最大値抑制(NMS)を使用するため、推論時にレイテンシの急増が発生します。エッジデバイスへのAIデプロイを重視するエンジニアにとって、NMSロジックの管理はデプロイパイプラインに不要な複雑さを加えます。
YOLOXやYOLOv9などの従来モデルでは、重複したバウンディングボックスを除去するために非最大値抑制(NMS)が必要です。この処理は本質的に逐次実行され、CPUでボトルネックになることが多いため、最新のUltralyticsモデルに搭載されているネイティブなエンドツーエンドアーキテクチャの必要性が明らかになります。
パフォーマンス比較#
これらのアーキテクチャの計算指標を比較すると、YOLOv9がより現代的なベースラインを提供する一方、YOLOXは従来の環境向けの軽量な選択肢であることがわかります。以下に、標準モデルの詳細を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
YOLOv9は同程度のパラメーター数で優れた精度を示しますが、速度、精度、使いやすさの究極のバランスを求める開発者は、Ultralyticsの最新技術を検討することをおすすめします。
Ultralyticsの強み:YOLO26の紹介#
YOLOXやYOLOv9などの過去のモデルを評価することは有益ですが、現在の最先端を定義するのはUltralytics YOLO26です。2026年初頭にリリースされたYOLO26は、現代のエンタープライズ環境に向けて検出パイプラインを根本から再設計しています。
比類のないアーキテクチャの革新#
YOLO26はオプションのエンドツーエンドNMSフリーデザイン(nms=False)によって、先行モデルの後処理ボトルネックを解消し、あらゆるハードウェアへのデプロイをシンプルにします。さらに、Distribution Focal Loss(DFL)を取り除き、確率的勾配降下法とMuonを組み合わせた新しいMuSGDオプティマイザーを統合することで、これまでにないトレーニングの安定性を実現します。
Raspberry Piのような制約のある環境にデプロイする開発者向けに、YOLO26はCPU推論を最大43%高速化します。また、ProgLoss + STAL(Progressive Loss and Small-Target-Aware Label Assignment)を導入し、小さな物体の認識を大幅に改善します。これは、航空画像やドローン分析に不可欠です。
開発エコシステムの効率化#
単独の研究リポジトリとは異なり、Ultralyticsエコシステムは他に類を見ない開発者体験を提供します。Ultralytics Python APIを活用することで、エンジニアは定型コードを大幅に削減できます。さらに、メモリー要件は高度に最適化されているため、注意機構を多用するアーキテクチャと比べて少ないGPU VRAMで堅牢なモデルをトレーニングできます。
from ultralytics import YOLO
# 最適化されたNMSフリーのYOLO26小型モデルを読み込みます
model = YOLO("yolo26s.pt")
# メモリー使用量を最小限に抑えてカスタムデータセットでトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 最適化されたデプロイ形式へ簡単にエクスポートします
model.export(format="engine", quantize=16) # TensorRTにエクスポートするYOLO26は検出以外にも、同じフレームワーク内でさまざまなタスクをシームレスにサポートします。衛星画像向けの正確な回転バウンディングボックス(OBB)が必要な場合も、医療画像アプリケーション向けの高精細なピクセルマスクが必要な場合も、ワークフローは変わりません。以前の世代のワークフローを利用しているチーム向けには、Ultralytics YOLO11も提供され、完全にサポートされています。
最適なユースケースとデプロイ戦略#
適切なアーキテクチャは、対象となるデプロイ環境とプロジェクト要件によって決まります。
エッジコンピューティングとロボティクス#
低消費電力デバイスでは、重い後処理を必要とするモデルに依存すると、性能が大きく損なわれるおそれがあります。YOLOX-Nanoは非常に小型ですが、安全性が重要なタスクには精度が不十分な場合が少なくありません。このような用途にはYOLO26が最適です。DFLフリーのヘッドとオプションのNMSフリー推論により、CPUのスレッド上でスムーズに動作し、自律型ロボティクスやスマートパーキング管理に適しています。
学術的なベンチマーク#
勾配フローの分析とディープネットワークのボトルネックの研究だけが目的であれば、YOLOv9は今も優れた研究対象です。そのPGIフレームワークは、深層ニューラルネットワークの層を通じて特徴がどのように保持されるかについて興味深い知見を与えるため、畳み込み理論を研究する大学の研究者にとって有用なツールです。
エンタープライズ向け動画分析#
セキュリティ警報システムや交通監視など、大規模な動画処理タスクでは、速度と柔軟なエクスポート機能が極めて重要です。Ultralyticsフレームワークに組み込まれたエクスポートツールを使えば、YOLO26を1つのコマンドで直接TensorRTやOpenVINOにコンパイルでき、市場投入までの時間を大幅に短縮できます。
Ultralyticsエコシステムの包括的な機能を活用することで、機械学習チームは研究コードベース特有の複雑さを避け、スケーラブルな実用AIアプリケーションの開発に直接取り組めます。