YOLOX vs YOLO11#
コンピュータビジョンの進化は、高い精度と推論速度のバランスを実現するリアルタイム物体検出フレームワークの追求によって大きく推進されてきました。この歩みにおける特筆すべきマイルストーンとして、YOLOXとUltralytics YOLO11が挙げられます。両モデルはこの分野に大きく貢献してきましたが、その基盤アーキテクチャ、設計思想、開発者エコシステムには大きな違いがあります。
この包括的な技術比較では、アーキテクチャ、パフォーマンス指標、学習手法、理想的なデプロイシナリオを検証し、次の人工知能プロジェクトに向けた十分な情報に基づく意思決定を支援します。
YOLOXの概要#
2021年7月18日にMegviiの研究者であるZheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sunによって発表されたYOLOXは、YOLOシリーズに大きな変化をもたらしました。アンカーフリー設計を導入することで、学術研究と産業応用の間にあった隔たりを効果的に埋めました。
技術的な背景について詳しく知りたい場合は、原著のYOLOX Arxiv論文をご覧ください。
主なアーキテクチャ上の特徴#
YOLOXは、デカップルドヘッドとアンカーフリー機構を採用することで、従来のアンカーベース検出から脱却しました。この設計により設計パラメータの数が減少し、さまざまなベンチマークにおけるモデルの性能が向上しました。さらに、SimOTAのような高度なラベル割り当て戦略を導入し、学習プロセスを高速化して収束性を改善しました。
YOLOXは当時としては優れた精度を提供しますが、主にバウンディングボックス物体検出に焦点を当てており、その他の複雑なビジョンタスクを標準でネイティブサポートしていません。
事前定義されたアンカーボックスを排除することで、YOLOXはデータセットごとに必要となるヒューリスティックな調整を大幅に削減し、アンカーフリー手法の研究における有力なベースラインとなりました。
Ultralytics YOLO11の概要#
2024年9月27日にUltralyticsのGlenn JocherとJing QiuによってリリースされたYOLO11は、コンピュータビジョンにおける汎用性と使いやすさを再定義する最先端モデルです。長年にわたる基礎研究を基盤として、さまざまなタスクで優れた性能を発揮する、洗練された本番環境対応ソリューションを提供します。
Ultralyticsの優位性#
YOLO11は単なる物体検出器ではありません。インスタンスセグメンテーション、画像分類、ポーズ推定、方向付きバウンディングボックス(OBB)検出をサポートする統合フレームワークです。速度、パラメータ数、精度のシームレスなバランスを重視した、非常に効率的なアーキテクチャを備えています。
さらに、YOLO11はUltralytics Platformに完全統合されており、データアノテーション、モデル学習、デプロイのための効率化されたエコシステムを提供します。
パフォーマンスとメトリクスの比較#
これらのモデルを比較すると、性能のバランスが明確になります。YOLO11は、ほとんどのサイズカテゴリで、対応するYOLOXモデルと比較して、はるかに少ないパラメータ数とFLOPsで、より高い平均適合率(mAP)を達成します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
このように、YOLO11モデルは、より少ないパラメータフットプリントを維持しながら、精度において一貫してYOLOXを上回ります。たとえば、YOLO11mはわずか20.1Mパラメータで51.5 mAPを達成します。一方、YOLOXxは同程度の51.1 mAPを達成しますが、膨大な99.1Mパラメータを必要とします。学習時と推論時のメモリ効率に優れるため、YOLO11はエッジAIデバイスへのデプロイに非常に適しており、RT-DETRのような旧世代またはTransformerベースのモデルで一般的だった、大きなCUDAメモリ要件を回避できます。
Ultralyticsのモデルは、YOLOXやTransformerベースのアーキテクチャと比較して、学習時に必要なGPUメモリが大幅に少ないため、研究者は一般的なコンシューマー向けハードウェアで高性能なモデルを学習できます。
エコシステムと使いやすさ#
2つのフレームワークにおける最も顕著な違いの1つは、開発者体験です。
YOLOXでは、リポジトリのクローン、複雑な環境の構築、ONNXやTensorRTなどの形式へのモデルの学習とエクスポートに向けた、冗長なコマンドライン引数の実行が必要になることがよくあります。
これとは対照的に、Ultralytics YOLO11は非常にシンプルなPython APIとCLIを提供します。Ultralyticsライブラリが、データ拡張、ハイパーパラメータチューニング、エクスポートを自動的に処理します。
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")
# Train the model effortlessly on custom data
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained model to TensorRT for optimized deployment
model.export(format="engine")この適切に保守されたエコシステムは、豊富なドキュメントと、実験追跡向けのWeights & Biasesなどのツールとのシームレスな統合によって支えられています。
理想的なユースケース#
これらのモデルのどちらを選ぶかは、多くの場合、デプロイ環境の具体的な条件によって決まります。
YOLOXを使用する場合#
- レガシーシステム: MegEngineフレームワークや2021年初頭の物体検出パラダイムを中心に明確に構築された既存のパイプラインがある場合。
- 学術的なベースライン: 2021年当時の基盤となるアンカーフリーアーキテクチャとの直接的なベンチマークが必要な研究を実施する場合。
YOLO11を使用する場合#
- 本番環境へのデプロイ: スマートリテールやセキュリティ警報システムなど、堅牢で保守されたコードと高い精度が不可欠な商用アプリケーション。
- マルチタスクパイプライン: 単一の統合フレームワークを使用して、物体の追跡、人間のポーズ推定、インスタンスのセグメンテーションを行う必要があるプロジェクト。
- リソース制約のあるエッジデバイス: パラメータ数が少なくスループットが高いため、YOLO11はRaspberry Piへのデプロイや、CoreMLおよびNCNNを介したモバイルエッジノードへのデプロイに適しています。
今後の展望: YOLO26の優位性#
YOLO11はYOLOXから大きく飛躍していますが、コンピュータビジョンの分野は急速に進歩しています。現在新しいプロジェクトを開始する開発者には、**Ultralytics YOLO26**を強く推奨します。
2026年1月にリリースされたYOLO26は、YOLO11の優れたアーキテクチャを基盤に、画期的な機能をいくつか導入しています。
- エンドツーエンドのNMSフリー設計: YOLO26は、非最大値抑制(NMS)の後処理を排除し、より高速でシンプルなデプロイメントパイプラインを実現します(この概念はYOLOv10で初めて探求されました)。
- CPU推論が最大43%高速化: Distribution Focal Loss(DFL)を除去することで、YOLO26はCPUや低消費電力のエッジデバイス上で大幅に効率化されています。
- MuSGDオプティマイザー: Moonshot AIによるLLM学習の革新から着想を得たMuSGDオプティマイザーは、非常に安定した学習実行と迅速な収束を実現します。
- 高度な損失関数: ProgLoss + STALを活用するYOLO26は、小さな物体の認識において大幅な改善を実現します。これはドローン画像や自律ロボティクスにとって重要です。
現代のコンピュータビジョンタスクの大半において、パイプラインをYOLO26に対応させることで、速度、精度、デプロイのシンプルさの絶対的に最適なバランスを実現できます。