Ultralytics YOLO27:
Get Started

YOLOXとYOLO11の比較#

コンピュータービジョンの進化は、高い精度と推論速度を両立するリアルタイム物体検出フレームワークの追求によって大きく推進されてきました。この歩みにおける注目すべき節目として、YOLOXとUltralytics YOLO11が挙げられます。どちらのモデルもこの分野に大きく貢献していますが、基盤となるアーキテクチャ、設計思想、開発者エコシステムには大きな違いがあります。

この包括的な技術比較では、アーキテクチャ、パフォーマンス指標、学習手法、最適なデプロイシナリオを検討し、次のAIプロジェクトについて十分な情報に基づいた判断ができるよう支援します。

YOLOXの概要#

2021年7月18日、Megviiの研究者であるZheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sunによって発表されたYOLOXは、YOLOシリーズに大きな変革をもたらしました。アンカーフリー設計を導入することで、学術研究と産業応用の隔たりを埋めました。

技術的な背景について詳しく知りたい場合は、YOLOXのarXiv論文をご覧ください。

主なアーキテクチャ上の特徴#

YOLOXは分離型ヘッドとアンカーフリー機構を採用し、従来のアンカーベース検出から脱却しました。この設計により設計パラメーターの数が減り、さまざまなベンチマークでモデルの性能が向上しました。また、SimOTAなどの高度なラベル割り当て戦略を導入し、学習プロセスを高速化して収束を改善しました。

YOLOXは当時として優れた精度を実現していますが、主にバウンディングボックスによる物体検出に重点を置いており、他の複雑なビジョンタスクを標準でネイティブサポートしていません。

YOLOXについて詳しく見る

アンカーフリー設計

事前定義されたアンカーボックスをなくすことで、YOLOXはさまざまなデータセットに対して必要となるヒューリスティックな調整を大幅に削減し、アンカーフリー手法の研究における有力なベースラインとなっています。

Ultralytics YOLO11の概要#

2024年9月27日に、Glenn JocherとJing QiuがUltralyticsからリリースしたYOLO11は、コンピュータービジョンにおける汎用性と使いやすさを再定義する最先端モデルです。長年にわたる基礎研究を基盤に構築されており、多様なタスクで優れた性能を発揮する、洗練された本番環境対応のソリューションを提供します。

Ultralyticsの強み#

YOLO11は単なる物体検出器ではありません。インスタンスセグメンテーション、画像分類、姿勢推定、回転バウンディングボックス(OBB)検出をサポートする統合フレームワークです。速度、パラメーター数、精度のシームレスなバランスを優先した、高効率なアーキテクチャを備えています。

さらにYOLO11はUltralytics Platformに完全統合されており、データアノテーション、モデル学習、デプロイのための効率的なエコシステムを提供します。

パフォーマンスと指標の比較#

これらのモデルを比較すると、パフォーマンスのバランスが明確になります。YOLO11は、多くのサイズ区分で、YOLOXの対応モデルよりも大幅に少ないパラメーター数とFLOPsで、より高い平均適合率(mAP)を達成します。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター
(M)
FLOPs
(B)
YOLOXnano41625.8--0.911.08
YOLOXtiny41632.8--5.066.45
YOLOXs64040.5-2.569.026.8
YOLOXm64046.9-5.4325.373.8
YOLOXl64049.7-9.0454.2155.6
YOLOXx64051.1-16.199.1281.9
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

示されているとおり、YOLO11モデルは、パラメーター数を抑えながら一貫してYOLOXを上回る精度を実現しています。たとえば、YOLO11mはわずか20.1Mのパラメーターで51.5 mAPを達成します。一方、YOLOXxは同程度の51.1 mAPを達成するために、膨大な99.1Mのパラメーターを必要とします。学習時と推論時のメモリ効率が高いため、YOLO11はエッジAIデバイスへのデプロイに非常に適しており、RT-DETRのような旧世代モデルやTransformerベースのモデルに典型的な、大きなCUDAメモリ要件を回避できます。

効率的なトレーニング

Ultralyticsモデルは、YOLOXやTransformerベースのアーキテクチャと比べて学習時に必要なGPUメモリが大幅に少ないため、研究者は一般的な市販ハードウェアで高性能モデルを学習できます。

エコシステムと使いやすさ#

2つのフレームワークの最も顕著な違いの一つは、開発者エクスペリエンスです。

YOLOXでは、多くの場合、リポジトリのクローン、複雑な環境のセットアップ、ONNXやTensorRTなどの形式へのモデルの学習・エクスポートに必要な冗長なコマンドライン引数の実行が求められます。

これとは対照的に、Ultralytics YOLO11は非常にシンプルなPython APIとCLIを提供します。Ultralyticsライブラリは、データ拡張、ハイパーパラメーター調整、エクスポートを自動的に処理します。

from ultralytics import YOLO

# 事前学習済みYOLO11モデルを読み込みます
model = YOLO("yolo11n.pt")

# カスタムデータを使って簡単にモデルを学習します
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 最適化されたデプロイのために、学習済みモデルをTensorRTにエクスポートします
model.export(format="engine")

十分に保守されたこのエコシステムは、充実したドキュメントに支えられており、実験管理用のWeights & Biasesなどのツールともシームレスに統合できます。

最適なユースケース#

どちらのモデルを選ぶかは、多くの場合、デプロイ環境の具体的な条件によって異なります。

YOLOXを使用する場合#

  • レガシーシステム: 元のYOLOXコードベースや2021年初頭の物体検出手法を基盤として、すでにパイプラインが構築されている場合。
  • 学術研究のベースライン: 2021年当時の基礎的なアンカーフリーアーキテクチャと直接比較する必要がある研究を実施する場合。

YOLO11を使用する場合#

  • 本番環境へのデプロイ: 堅牢で保守されたコードと高精度が不可欠な、スマートリテールやセキュリティ警報システムなどの商用アプリケーション。
  • マルチタスクパイプライン: 単一の統合フレームワークを使用して、物体の追跡、人間の姿勢推定、インスタンスのセグメンテーションが必要なプロジェクト。
  • リソースが限られたエッジデバイス: パラメーター数が少なくスループットが高いため、YOLO11はRaspberry Piや、CoreMLおよびNCNNを使用するモバイルエッジノードへのデプロイに最適です。

今後の展望:YOLO26の優位性#

YOLO11はYOLOXを大きく上回っていますが、コンピュータービジョンの分野は急速に進歩しています。現在、新しいプロジェクトを始める開発者には、Ultralytics YOLO26を決定版としておすすめします。

2026年1月にリリースされたYOLO26は、YOLO11の優れたアーキテクチャを基盤に、画期的な機能をいくつか導入しています。

  • エンドツーエンドのNMSフリーデザイン: YOLO26のオプションの1対1ヘッド(nms=False)は、後処理の非最大値抑制(NMS)をなくし、より高速でシンプルなデプロイパイプラインを実現します。このコンセプトは、YOLOv10で初めて検討されました。
  • CPU推論が最大43%高速化: Distribution Focal Loss(DFL)を取り除くことで、YOLO26はCPUや低消費電力のエッジデバイスで大幅に効率化されています。
  • MuSGDオプティマイザー: Moonshot AIによるLLMトレーニングの革新に着想を得たMuSGDオプティマイザーは、非常に安定したトレーニングと迅速な収束を実現します。
  • 高度な損失関数: ProgLoss + STALを活用するYOLO26は、小さな物体の認識を大幅に改善します。これは、ドローン画像や自律型ロボティクスに不可欠です。

最新のコンピュータービジョンタスクの大半では、パイプラインを更新してYOLO26を活用することで、速度、精度、デプロイのシンプルさを最高のバランスで実現できます。

コントリビューター

コメント