YOLOv9 と YOLOX の比較#
コンピュータビジョンの分野は、リアルタイム物体検出アーキテクチャの急速な進化を目の当たりにしてきました。本ガイドでは、YOLOv9とYOLOXを包括的に比較し、それらのアーキテクチャの革新、パフォーマンス指標、および学習手法を分析します。製造業におけるAI向けのスマートアプリケーションを構築している場合でも、予測モデリングを探索している場合でも、これらのモデルを理解することは、次回のデプロイに向けて十分な情報に基づいた意思決定を行うのに役立ちます。
アーキテクチャの革新#
YOLOv9: プログラマブル勾配情報#
YOLOv9 は、深層ニューラルネットワーク固有の情報ボトルネック問題に対処することで、パラダイムシフトをもたらしました。その中核となる革新技術には、PGI(Programmable Gradient Information)と GELAN(Generalized Efficient Layer Aggregation Network)が含まれます。
- 著者: Chien-Yao Wang および Hong-Yuan Mark Liao
- 組織: 台湾 中央研究院 情報科学研究所
- 日付: 2024年2月21日
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
順伝播の過程で重要な特徴データを保持することにより、YOLOv9はバックプロパゲーション時に重みを更新するために使用される勾配が正確に保たれるようにします。このアーキテクチャは特徴抽出に優れており、航空画像や詳細な医療スキャンなどに見られる、複雑な環境での小さな物体の検出において非常に高い能力を発揮します。
YOLOX:研究と産業の橋渡し#
2021年中頃にリリースされた YOLOX は、YOLO シリーズをアンカーフリー設計へと移行させました。分類タスクと位置特定タスクを分離するデカップリングヘッドを導入し、学習の収束を改善するために SimOTA ラベル割り当て戦略を利用しました。
- 著者: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, Jian Sun
- 組織: Megvii
- 日付: 2021年7月18日
- Arxiv: 2107.08430
- GitHub: Megvii-BaseDetection/YOLOX
YOLOXは当時画期的であり、優れた平均精度平均(mAP)を達成し、アンカーボックスのハイパーパラメータチューニングを不要にしましたが、その基盤となるアーキテクチャは、パラメータ数と特徴の保持のバランスをより良く取る現代のネットワークによって、すでに凌駕されています。
YOLOX と新しい Ultralytics モデルはどちらもアンカーフリー設計を採用しており、ハイパーパラメータ調整の複雑さを軽減し、多様なデータセット全体での汎用性を向上させています。
パフォーマンス分析#
MS COCOベンチマークでこれらのモデルを比較すると、YOLOv9における進歩が明らかになります。YOLOv9は、精度とFLOPsの間でより優れたトレードオフを継続的に実現します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
YOLOXには極端なエッジケース向けのYOLOX-Nanoのような軽量バリエーションが用意されていますが、YOLOv9のバリエーションは、純粋な精度において同等サイズのYOLOXモデルを一貫して上回ります。たとえば、YOLOv9mはパラメータ数が半分未満(20.0M対54.2M)であるにもかかわらず、YOLOXlの49.7%に対して51.4%のmAPを達成しています。
Ultralyticsの利点#
モデルの選択には、アーキテクチャの理論だけにとどまらない要素が含まれます。それを囲むエコシステムが、開発スピードとデプロイの成功を左右します。Ultralyticsエコシステム内でYOLOv9を利用することで、比類のない使いやすさと強力なコミュニティサポートが提供されます。
古いオリジナルの研究リポジトリとは異なり、Ultralyticsフレームワークは複雑なパイプラインを簡素化する統一されたPython APIを提供します。学習に必要なGPUメモリは多くの代替手段よりも大幅に少なく、信じられないほどの学習効率を提供します。
from ultralytics import YOLO
# Initialize the YOLOv9c model
model = YOLO("yolov9c.pt")
# Train the model on your custom dataset seamlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model's performance
metrics = model.val()
# Export the optimized model to TensorRT format
model.export(format="engine")物体検出、インスタンスセグメンテーション、姿勢推定を含む複数のタスクの組み込みサポートにより、コードベース全体を変更することなく、コンピュータビジョンソリューションを迅速にピボットできます。
実際のアプリケーション#
これらのモデルの具体的な強みは、それぞれ異なる実世界のアプリケーションに適しています。
高速小売分析#
リアルタイムの製品認識を必要とする現代の小売環境において、YOLOv9は優れたパフォーマンスを発揮します。複雑な特徴詳細を保持するその能力により、混雑した棚の上で視覚的に類似した製品を区別する必要がある小売業におけるAIのデプロイに完全に適しています。
レガシーなエッジデプロイメント#
厳格なハードウェアの制限や、新しい集約ブロック処理が困難な特殊なNPUによって管理されるシナリオでは、YOLOX-Nanoがニッチな需要を見出すことがあります。その純粋で簡素化された畳み込みパターンは、リソースが極端に制約されたマイクロコントローラにおいて好まれることがあります。
自律型ロボティクス#
ロボット工学のナビゲーションにおいて、小さな小物の見落としは致命的となる可能性があります。YOLOv9内のGELANアーキテクチャにより、小さく遠くにある障害物の特徴がネットワークの深い層で失われないように保証され、自動車におけるAIアプリケーションのような重要な安全性環境において古いモデルを凌駕します。
ユースケースと推奨事項#
YOLOv9 と YOLOX のどちらを選択するかは、特定のプロジェクト要件、デプロイメントの制約、およびエコシステムの優先順位に依存します。
YOLOv9を選択すべき場合#
YOLOv9は以下の場合に強力な選択肢となります:
- 情報ボトルネック研究: Programmable Gradient Information (PGI)およびGeneralized Efficient Layer Aggregation Network (GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: トレーニング中の深層ネットワーク層における情報損失の理解と軽減に重点を置いた研究。
- 高精度検出ベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の強力なCOCOベンチマークパフォーマンスが必要とされるシナリオ。
YOLOXを選択すべき時#
YOLOXが推奨されるケース:
- アンカーフリー検出研究: 新しい検出ヘッドや損失関数を実験するためのベースラインとして、YOLOXのクリーンでアンカーフリーなアーキテクチャを使用する学術研究。
- 超軽量エッジデバイス: YOLOX-Nanoバリアントの非常に小さなフットプリント(0.91Mパラメータ)が不可欠な、マイクロコントローラやレガシーモバイルハードウェアへのデプロイ。
- SimOTAラベル割り当ての研究: 最適輸送に基づくラベル割り当て戦略と、それが学習の収束に与える影響を調査する研究プロジェクト。
Ultralytics (YOLO26) を選択すべき時#
ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
未来への展望: YOLO26の登場#
YOLOv9は印象的なマイルストーンを表していますが、本番環境の要求は常に限界を押し広げています。新しくリリースされた**YOLO26**は、現代のビジョンAIの決定的な標準を表しています。
YOLO26は、ネイティブなエンドツーエンドNMSフリーデザインにより、デプロイパイプラインを完全に活性化します。後処理中の複雑な非最大値抑制(Non-Maximum Suppression)の必要性を排除することで、大幅に低い推論レイテンシを実現します。
さらに、YOLO26 は画期的な MuSGD オプティマイザ を組み込んでいます。これは、LLM トレーニングのイノベーションを取り入れた SGD と Muon のハイブリッドであり、信じられないほど安定した迅速な収束を提供します。Distribution Focal Loss (DFL) を排除することで、YOLO26 は前身モデルと比較して最大 43% 高速な CPU 推論 を達成し、エッジデバイスやエンタープライズ環境でのデプロイメントに最も適した選択肢となっています。ProgLoss と STAL を通じた小さな物体の認識における顕著な改善により、YOLO26 は YOLOX と YOLOv9 の両方を実質的に取って代わる存在です。
現代のアーキテクチャを探索しているエンジニアに向けて、Ultralyticsスイート内の強力な代替手段としてYOLO11とRT-DETRのチェックも推奨します。Ultralyticsプラットフォーム上の最新モデルの比類のないパフォーマンスを活用することで、プロジェクトが将来にわたって有効であることを確認してください。