YOLOX対YOLO11#
コンピュータービジョンの進化は、高い精度と推論速度のバランスを取るリアルタイム物体検出フレームワークの追求によって強力に推進されてきました。この歩みにおける最も注目すべきマイルストーンの中に、YOLOXとUltralytics YOLO11があります。両モデルともこの分野に多大な貢献を果たしていますが、その基礎となるアーキテクチャ、設計哲学、および開発者エコシステムは大きく異なります。
本技術比較では、次なる人工知能プロジェクトに向けて情報に基づいた意思決定ができるよう、両モデルのアーキテクチャ、パフォーマンスメトリクス、学習手法、および理想的なデプロイシナリオについて詳しく解説します。
YOLOXの概要#
2021年7月18日にMegviiの研究者であるZheng Ge、Songtao Liu、Feng Wang、Zeming Li、およびJian Sunによって発表されたYOLOXは、YOLOシリーズにおける重要な転換点となりました。アンカーフリー設計を導入することにより、学術研究と産業応用のギャップを首尾よく埋めました。
より詳細な技術的背景については、元のYOLOX Arxiv paperを確認してください。
主要なアーキテクチャの特徴#
YOLOXは、デカップルヘッド(decoupled head)とアンカーフリーメカニズムを採用することで、従来のアンカーベースの検出から脱却しました。この設計により設計パラメータ数が削減され、さまざまなベンチマークにおいてモデルのパフォーマンスが向上しました。さらに、SimOTAのような高度なラベル割り当て戦略を導入し、学習プロセスの加速と収束の改善を実現しました。
YOLOXは当時としては非常に優れた精度を提供しましたが、主にバウンディングボックスによる物体検出に焦点を当てており、他の複雑なビジョンタスクへのネイティブ対応は提供されていません。
定義済みのアンカーボックスを排除することで、YOLOXはデータセットごとに必要となるヒューリスティックな調整を劇的に削減し、アンカーフリー手法の研究における強力なベースラインとなりました。
Ultralytics YOLO11の概要#
2024年9月27日にUltralyticsのGlenn JocherとJing QiuによってリリースされたYOLO11は、コンピュータービジョンにおける汎用性と使いやすさを再定義する最先端モデルです。長年の基礎研究に基づいて構築されており、多数のタスクで優れた性能を発揮する、高度に洗練された本番環境対応のソリューションを提供します。
Ultralyticsの利点#
YOLO11は単なる物体検出器ではなく、instance segmentation、image classification、pose estimation、およびoriented bounding box (OBB)の検出をサポートする統合フレームワークです。速度、パラメータ数、および精度のシームレスなバランスを優先する、非常に効率的なアーキテクチャを誇ります。
さらに、YOLO11はUltralytics Platformに完全に統合されており、データアノテーション、モデルトレーニング、およびデプロイのための効率的なエコシステムを提供します。
パフォーマンスと指標の比較#
これらのモデルを比較すると、パフォーマンスのバランスが明らかになります。YOLO11は、多くのサイズカテゴリにおいて、YOLOXと比較してパラメータ数とFLOPsが大幅に少ないにもかかわらず、より高いmAP(平均適合率)を達成しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
示されているように、YOLO11モデルは、より少ないパラメータフットプリントを維持しながら、一貫してYOLOXよりも優れた精度を実現します。たとえば、YOLO11mはわずか20.1M parametersで51.5 mAPを達成しますが、YOLOXxは同様の51.1 mAPを達成するのに大規模な99.1M parametersを必要とします。トレーニングおよび推論中のこのメモリ効率により、YOLO11は、RT-DETRのような古いモデルやTransformerベースのモデルに特有の重いCUDAメモリ要件を回避し、エッジAIデバイスへのデプロイに非常に適したものとなっています。
Ultralyticsモデルは、YOLOXやTransformerベースのアーキテクチャと比較して、学習時に必要なGPUメモリが大幅に少ないため、研究者は標準的なコンシューマー向けハードウェアで強力なモデルを学習できます。
エコシステムと使いやすさ#
両フレームワークの最も際立った違いの一つは、開発者体験です。
YOLOXでは、モデルをトレーニングしてONNXやTensorRTなどのフォーマットにエクスポートするために、リポジトリのクローン作成、複雑な環境の設定、冗長なコマンドライン引数の実行が必要になることがよくあります。
対照的に、Ultralytics YOLO11は、信じられないほどシンプルなPython APIとCLIを提供します。Ultralyticsライブラリは、data augmentation、hyperparameter tuning、およびエクスポートを自動的に処理します。
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")
# Train the model effortlessly on custom data
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained model to TensorRT for optimized deployment
model.export(format="engine")このよくメンテナンスされたエコシステムは、充実したdocumentationと、experiment trackingのためのWeights & Biasesなどのツールとのシームレスな統合によって支えられています。
理想的なユースケース#
これらのモデルの選択は、多くの場合、デプロイ環境の詳細に依存します。
YOLOXを使用すべき場合#
- レガシーシステム: MegEngineフレームワークや2021年初期の物体検出パラダイムを中心に構築された確立されたパイプラインがある場合。
- 学術的なベースライン: 2021年時代の基礎的なアンカーフリーアーキテクチャと直接ベンチマーク比較を行う必要がある研究を行う場合。
YOLO11を使用すべき場合#
- 本番環境のデプロイ: 強固で保守されたコードと高精度が不可欠である、smart retailやsecurity alarm systemsにおける商用アプリケーション向け。
- マルチタスクパイプライン: 物体の追跡、人間の姿勢推定、インスタンスのセグメンテーションを単一の統合フレームワークで行う必要があるプロジェクトの場合。
- リソース制約のあるエッジデバイス: パラメータ数が少なくスループットが高いため、YOLO11は Raspberry Pi や、CoreML および NCNN を介したモバイルエッジノードへのデプロイに最適です。
今後の展望: YOLO26の優位性#
YOLO11はYOLOXに比べて大きな飛躍を表していますが、コンピュータービジョンの分野は急速に進歩しています。今日新しくプロジェクトを開始する開発者にとって、**Ultralytics YOLO26**が決定版の推奨事項です。
2026年1月にリリースされたYOLO26は、YOLO11のアーキテクチャの輝きを受け継ぎ、いくつかの画期的な機能を導入しています。
- エンドツーエンドのNMS-Free設計: YOLO26はNon-Maximum Suppression (NMS)の後処理を排除し、より高速でシンプルなデプロイパイプラインのために推論をネイティブにストリーミングします(この概念はYOLOv10で最初に調査されました)。
- 最大43%高速なCPU推論: Distribution Focal Loss (DFL)の削除により、YOLO26はCPUや低電力エッジデバイス上で大幅に効率化されました。
- MuSGDオプティマイザ: Moonshot AIのLLM学習の革新から着想を得たMuSGDオプティマイザは、非常に安定した学習と高速な収束を保証します。
- 高度な損失関数: ProgLoss + STALを活用することで、YOLO26は小物体認識において顕著な改善を実現しており、これはdrone imageryや自律ロボット工学において極めて重要です。
最新のコンピュータービジョンタスクの大部分において、パイプラインをアップグレードしてYOLO26を活用することは、速度、精度、およびデプロイのシンプルさの絶対的に最高のバランスを提供します。