YOLOv9とYOLOX#
コンピュータービジョン分野では、リアルタイム物体検出アーキテクチャが急速に進化しています。このガイドでは、YOLOv9とYOLOXを包括的に比較し、アーキテクチャの革新、パフォーマンス指標、トレーニング手法を分析します。製造業におけるAI向けのスマートアプリケーションを構築する場合も、予測モデリングを検討する場合も、これらのモデルを理解することで、次のデプロイに向けた適切な判断に役立ちます。
アーキテクチャの革新#
YOLOv9:プログラム可能な勾配情報#
YOLOv9は、ディープニューラルネットワークに内在する情報ボトルネック問題に対処し、新たなパラダイムを切り開きました。主な革新として、Programmable Gradient Information(PGI)とGeneralized Efficient Layer Aggregation Network(GELAN)があります。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 所属機関: 台湾、中央研究院情報科学研究所
- 日付: 2024年2月21日
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
YOLOv9は、フィードフォワード処理中に重要な特徴データを保持することで、バックプロパゲーション時の重み更新に使われる勾配の正確性を確保します。このアーキテクチャは特徴抽出に優れており、航空画像や詳細な医療画像に見られるような複雑な環境でも、小物体を高い能力で検出できます。
YOLOX:研究と産業の架け橋#
2021年半ばにリリースされたYOLOXは、YOLOシリーズをアンカーフリー設計へと移行させました。分類タスクと位置特定タスクを分離するデカップルドヘッドを導入し、トレーニングの収束を改善するためにSimOTAラベル割り当て戦略を採用しました。
- 著者: Zheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sun
- 組織: Megvii
- 日付: 2021年7月18日
- Arxiv: 2107.08430
- GitHub: Megvii-BaseDetection/YOLOX
YOLOXは当時画期的であり、優れた平均適合率(mAP)を達成し、アンカーボックスのハイパーパラメーター調整を不要にしました。しかし、その基盤となるアーキテクチャは、パラメーター数と特徴保持のバランスに優れた最新のネットワークに追い越されています。
YOLOXと新しいUltralyticsモデルは、どちらもアンカーフリー設計を採用しており、ハイパーパラメーター調整の複雑さを軽減し、多様なデータセットに対する汎化性能を高めています。
パフォーマンス分析#
MS COCOベンチマークでこれらのモデルを比較すると、YOLOv9の進歩が明らかになります。YOLOv9は、精度とFLOPsのトレードオフにおいて、一貫して優れた結果を達成します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
YOLOXには、極端なエッジ環境向けのYOLOX-Nanoのような軽量モデルもありますが、純粋な精度では、YOLOv9の各モデルが同程度のサイズのYOLOXモデルを一貫して上回ります。たとえば、YOLOv9mはYOLOXlの49.7%に対し51.4%のmAPを達成し、パラメーター数は半分以下(20.1M対54.2M)です。
Ultralyticsの強み#
モデル選定では、アーキテクチャの理論だけでなく、そのモデルを取り巻くエコシステムが開発速度とデプロイの成功を左右します。UltralyticsエコシステムでYOLOv9を利用すると、比類ない使いやすさと、充実したコミュニティサポートを活用できます。
従来の研究用リポジトリとは異なり、Ultralyticsフレームワークは複雑なパイプラインを簡素化する、統一されたPython APIを提供します。トレーニングに必要なGPUメモリは多くの代替手段より大幅に少なく、優れたトレーニング効率を実現します。
from ultralytics import YOLO
# YOLOv9cモデルを初期化します
model = YOLO("yolov9c.pt")
# カスタムデータセットでモデルをシームレスにトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# モデルの性能を検証します
metrics = model.val()
# 最適化済みモデルをTensorRT形式にエクスポートします
model.export(format="engine")物体検出、インスタンスセグメンテーション、姿勢推定など、複数のタスクが組み込みでサポートされているため、コードベース全体を変更せずにコンピュータービジョンソリューションを迅速に転換できます。
実際の用途#
モデルごとの強みは、それぞれ異なる実用的な用途に適しています。
高速な小売分析#
リアルタイムの商品認識が求められる現代の小売環境では、YOLOv9が優れた性能を発揮します。複雑な特徴の詳細を保持できるため、混雑した棚に並ぶ見た目の似た商品を見分ける必要がある小売業におけるAIの導入に最適です。
レガシーなエッジデバイスへのデプロイ#
厳しいハードウェア制約がある環境や、新しい集約ブロックの処理が難しい専用NPUを使用する環境では、YOLOX-Nanoがニッチな用途に適する場合があります。シンプルで無駄を省いた畳み込みパターンは、極めてリソースが限られたマイクロコントローラーで好まれることがあります。
自律型ロボティクス#
ロボットのナビゲーションでは、小さな物体の見落としが重大な結果につながる可能性があります。YOLOv9のGELANアーキテクチャは、小さく離れた障害物の特徴がネットワークの深い層で失われないようにし、自動車分野のAIのような重要な安全性が求められる環境で旧来のモデルを上回ります。
ユースケースと推奨事項#
YOLOv9とYOLOXのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに対する好みによって異なります。
YOLOv9を選ぶ場合#
YOLOv9が適している用途:
- 情報ボトルネックの研究: プログラム可能な勾配情報(PGI)や一般化効率的層集約ネットワーク(GELAN)のアーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と抑制に焦点を当てた研究。
- 高精度検出のベンチマーク: アーキテクチャの比較において、YOLOv9の優れたCOCOベンチマーク性能を基準として必要とするシナリオ。
YOLOXを選ぶタイミング#
YOLOXは次のような用途に推奨されます。
- アンカーフリー検出の研究: 新しい検出ヘッドや損失関数を試す際のベースラインとして、YOLOXのシンプルなアンカーフリーアーキテクチャを使用する学術研究。
- 超軽量エッジデバイス: YOLOX-Nanoバリアントの極めて小さなフットプリント(パラメーター数0.91M)が重要となる、マイクロコントローラーや旧式のモバイルハードウェアへのデプロイ。
- SimOTAラベル割り当ての研究: 最適輸送に基づくラベル割り当て戦略と、トレーニングの収束への影響を調査する研究プロジェクト。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
次世代モデル:YOLO26の登場#
YOLOv9は注目すべきマイルストーンですが、本番環境の要求は常に技術の限界を押し広げています。新たにリリースされたYOLO26は、現代のビジョンAIにおける決定的な標準モデルです。
YOLO26は、オプションのエンドツーエンドNMSフリーデザインにより、デプロイパイプラインを一新します。nms=Falseによる後処理で複雑なNon-Maximum Suppressionが不要になるため、推論レイテンシを大幅に削減します。
さらに、YOLO26には画期的なMuSGDオプティマイザーが組み込まれています。SGDとMuonのハイブリッドであり、LLMトレーニングの革新を取り入れることで、非常に安定した高速な収束を実現します。Distribution Focal Loss(DFL)を削除することで、YOLO26は先行モデルと比べてCPU推論を最大43%高速化し、エッジデバイスやエンタープライズへのデプロイに最適な選択肢となっています。ProgLossとSTALによる小物体認識の大幅な向上により、YOLO26はYOLOXとYOLOv9の両方を実質的に上回ります。
最新のアーキテクチャを検討しているエンジニアには、Ultralytics製品群の強力な代替モデルとしてYOLO11とRT-DETRもおすすめします。Ultralytics Platformで最新モデルの卓越したパフォーマンスを活用し、プロジェクトを将来に備えましょう。