YOLOXとDAMO-YOLOの比較#
リアルタイム物体検出の進化では、アンカーベースからアンカーフリーのアーキテクチャへの移行や、手動で設計されたバックボーンから自動ニューラルアーキテクチャ探索(NAS)への移行など、数多くのパラダイムシフトが起きてきました。この包括的な技術比較では、この進化における重要な2つの節目、YOLOXとDAMO-YOLOを分析します。それぞれのアーキテクチャ上の革新、学習手法、性能上のトレードオフを解説しながら、現代の開発者に比類のない選択肢を提供する最新のUltralytics YOLO26についても紹介します。
YOLOX:アンカーフリーパラダイムの先駆け#
Zheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian SunがMegviiで開発したYOLOXは、2021年7月18日に公開され、アンカーフリー設計をYOLOファミリーに取り入れることに成功し、大きな転換点となりました。詳細なArXiv技術レポートで説明されているように、YOLOXは学術研究と産業現場での導入の隔たりを埋めることを目指しました。
主なアーキテクチャ上の革新#
YOLOXでは、従来モデルを大幅に改善する、いくつかの主要な構造変更が導入されました。
- アンカーフリー機構: YOLOXは、物体の中心とバウンディングボックスの寸法を直接予測することで、設計上の経験則を減らし、複雑なアンカークラスタリングの処理を簡素化しました。これにより、さまざまなコンピュータービジョンのシナリオに柔軟に適応できます。
- 分離型ヘッド: 従来のYOLOモデルでは、分類と回帰の両方に単一の結合型ヘッドを使用していました。YOLOXは、分類と位置推定を個別に処理する分離型ヘッドを採用し、収束を大幅に高速化するとともに精度を向上させました。
- SimOTAラベル割り当て: Optimal Transport Assignment(OTA)を簡略化した手法を用いて、正例サンプルを動的に割り当てることで、学習時間を短縮し、中心点ベースの割り当てに伴う曖昧さを解消しました。
YOLOXの分離型ヘッド設計は、その後の物体検出モデルの世代に大きな影響を与え、多くの最新モデルに標準機能として採用されました。
DAMO-YOLO:大規模な自動アーキテクチャ探索#
Alibaba GroupのXianzhe Xuと研究チームが開発したDAMO-YOLOは、2022年11月23日に発表されました。ArXivの論文で詳述されているように、このモデルではニューラルアーキテクチャ探索(NAS)を多用し、速度と精度のパレートフロンティアを押し広げました。
主なアーキテクチャ上の革新#
DAMO-YOLOの戦略は、効率的な構造の設計を自動化することを基盤としていました。
- MAE-NASバックボーン: 最大エントロピーに基づく探索を活用し、DAMO-YOLOは特定のレイテンシ予算に合わせてカスタマイズされた高効率なバックボーンを発見しました。特に、TensorRTなどのフレームワークにエクスポートした場合に効果的です。
- Efficient RepGFPN: 異なる空間解像度間の特徴融合を大幅に強化する、計算負荷の高いネック設計です。航空画像の解析や、さまざまなスケールの物体検出に特に有効です。
- ZeroHead: モデル全体の平均適合率(mAP)を損なうことなく、計算上の冗長性を削減する簡素化された予測ヘッドです。
- AlignedOTAと蒸留: 高度なラベル割り当てと教師・生徒型の知識蒸留を取り入れ、小規模な生徒モデルから最大限の性能を引き出します。
パフォーマンスと指標の比較#
これら2つのモデルを比較する際は、パラメーター数、必要なFLOPs、レイテンシの特性を確認する必要があります。以下に、複数のスケールにおけるYOLOXとDAMO-YOLOのベンチマークデータを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
どちらのモデルも優れた結果を達成しますが、注意点があります。YOLOXでは分離型ヘッドを慎重に調整する必要がある一方、DAMO-YOLOは蒸留に大きく依存するため、カスタムデータセットでの再学習には多大なリソースが必要となり、大量のGPUメモリが求められます。
ユースケースと推奨事項#
YOLOXとDAMO-YOLOのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムの好みによって異なります。
YOLOXを選ぶタイミング#
YOLOXは次のような用途に適しています:
- アンカーフリー検出の研究: 新しい検出ヘッドや損失関数を試す際のベースラインとして、YOLOXのシンプルなアンカーフリーアーキテクチャを使用する学術研究。
- 超軽量エッジデバイス: YOLOX-Nanoバリアントの極めて小さなフットプリント(パラメーター数0.91M)が重要となる、マイクロコントローラーや旧式のモバイルハードウェアへのデプロイ。
- SimOTAラベル割り当ての研究: 最適輸送に基づくラベル割り当て戦略と、トレーニングの収束への影響を調査する研究プロジェクト。
DAMO-YOLOを選ぶケース#
DAMO-YOLOは、次の用途に適しています。
- 高スループットの動画分析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上で高FPSの動画ストリームを処理する用途。
- 産業用製造ライン: 組み立てラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャ探索の研究: 自動アーキテクチャ探索 (MAE-NAS) と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響を研究する用途。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの強み:YOLO26の紹介#
YOLOXとDAMO-YOLOは、歴史的に重要な節目となるモデルですが、現代の開発者には、最先端の精度と比類のない使いやすさを兼ね備えたソリューションが求められています。そこで活躍するのが、Ultralytics YOLO26です。2026年1月にリリースされたYOLO26は、NMSフリーモデルの系譜を受け継ぎ、速度、精度、開発者体験の究極のバランスを実現します。
YOLO26を選ぶ理由#
統合されたUltralyticsエコシステムは、分散した学術リポジトリを上回る次のようなメリットを提供します。
- エンドツーエンドのNMSフリー設計: YOLO26のオプションであるワンツーワンヘッド(
nms=False)は、推論時の非極大値抑制(NMS)を不要にします。これにより、エッジデバイスへのデプロイで重要となるレイテンシを、非常に高速かつ予測可能にでき、自動運転車にも適しています。 - DFLの削除: Distribution Focal Lossを削除することで、YOLO26はエッジデバイスへのエクスポートを簡素化し、軽量なアプリケーションに必要なメモリを大幅に削減します。
- MuSGDオプティマイザー: YOLO26は、SGDとMuonを組み合わせたハイブリッドオプティマイザーにより、LLMの学習における革新を取り入れ、非常に安定した学習と超高速な収束を実現します。
- CPU推論が最大43%高速: 深い構造最適化により、YOLO26は高価なGPUハードウェアを必要とせず、CPU上で非常に高速に動作します。
- 高度な損失関数: ProgLoss + STALの統合により、小物体認識が大幅に向上し、ドローン検査やIoTモニタリングなどのタスクに最適です。
- 多用途性: 検出専用のDAMO-YOLOとは異なり、YOLO26は単一の統合フレームワークでインスタンスセグメンテーション、姿勢推定、画像分類、回転バウンディングボックス(OBB)のタスクをネイティブにサポートします。
Ultralytics Python APIを使えば、複雑な蒸留パイプラインを手動で設定したり、モデルのデプロイに何百行ものC++コードを書いたりする必要はありません。
from ultralytics import YOLO
# 最先端のYOLO26 nanoモデルを読み込みます
model = YOLO("yolo26n.pt")
# カスタムデータセットでモデルを簡単にトレーニングします
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 超高速なNMSフリー推論を実行できます
results = model("https://ultralytics.com/images/bus.jpg", nms=False)
# 1つのコマンドでONNXまたはOpenVINOにエクスポートできます
model.export(format="openvino")検討すべきその他のモデル#
コンピュータービジョンのエコシステムは幅広いため、固有の制約に応じて、Ultralyticsエコシステムで完全にサポートされている他のアーキテクチャもご検討ください。
- YOLO11: YOLO26の高機能な前世代モデルであり、小売分析や製造品質管理での堅牢性に定評があります。
- YOLOv8: エッジデバイスへの幅広い導入を普及させた、伝説的で非常に安定したアンカーフリーモデルです。
- RT-DETR: Baiduが開発したリアルタイム物体検出Transformerで、グローバルAttention機構の恩恵を大きく受けるタスクに優れた選択肢を提供しますが、学習時に必要なメモリはより多くなります。
結論#
YOLOXとDAMO-YOLOは、ディープラーニングの発展に不可欠な概念をもたらしました。YOLOXは分離型かつアンカーフリーのアプローチを実証し、DAMO-YOLOは自動アーキテクチャ探索の威力を示しました。しかし、実運用では、研究当初のコードベースの複雑さがアジャイルなチームの開発を遅らせる可能性があります。
包括的なUltralytics Platformを活用すれば、開発者はこうした障壁を回避できます。YOLO26のエンドツーエンド設計、優れたCPU速度、充実したドキュメントにより、最先端のビジョンAIをこれまで以上に手軽に実現できます。スマートシティのインフラ、医療診断、高度なロボティクスのいずれを構築する場合も、Ultralyticsは生データから堅牢な実環境へのデプロイまでを最も効率的につなぎます。