YOLO Vision 2026:

DAMO-YOLOとYOLO26の比較#

コンピュータビジョンの領域は常に進化しており、高精度と低遅延の推論を両立するアーキテクチャの需要が高まっています。本比較では、DAMO-YOLOUltralytics YOLO26の技術的な詳細を掘り下げ、そのアーキテクチャの革新性、トレーニング手法、および最適なユースケースを探ります。

ビジョンモデルをエッジデバイスにデプロイする場合でも、高スループットのクラウドパイプラインを構築する場合でも、これらのモデル間の微妙な違いを理解することは、最新のAI開発において情報に基づいたアーキテクチャの決定を行うために不可欠です。

Alibaba Group によって開発された DAMO-YOLO は、2022年11月23日にリリースされました。Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sunの各氏によって設計されたこのモデルは、ニューラルアーキテクチャ探索(NAS)を使用した効率的なアーキテクチャの自動発見に大きく焦点を当てています。

オリジナルの研究については、ArXiv paper をご覧いただくか、DAMO-YOLO GitHub repository でソースコードをご確認ください。

主要なアーキテクチャの特徴#

DAMO-YOLOは、リアルタイム物体検出の限界を押し広げるために設計されたいくつかの技術革新を導入しています:

  • MAE-NAS Backbones: DAMO-YOLOは、マルチオブジェクティブ進化的探索を利用して最適なバックボーンを見つけます。このNASアプローチは、特定のハードウェアにおける推論速度と検出精度を厳密にバランスさせるアーキテクチャを発見します。
  • Efficient RepGFPN: 特徴量融合を大幅に改善するヘビーネック設計であり、aerial imagery のような複雑なシーンを分析する際に非常に有効です。
  • ZeroHead Design: 最終的な予測レイヤーの計算複雑性を最小限に抑える、大幅に簡素化された検出ヘッドです。
  • AlignedOTA and Distillation: DAMO-YOLOは、ラベル割り当ての曖昧さを解消するためにAligned Optimal Transport Assignment (AlignedOTA) を採用しており、さらに、より大きな教師ネットワークを使用して小さな学生モデルの精度を高める強力な知識蒸留強化戦略と組み合わせています。

DAMO-YOLOの詳細はこちら

Ultralyticsの利点:YOLO26#

Ultralytics の Glenn Jocher と Jing Qiu によって 2026年1月14日にリリースされた YOLO26 は、アクセシブルで高性能なビジョン AI の最高峰です。YOLO11YOLOv10 のレガシーを基盤に構築された YOLO26 は、エッジファーストのデプロイメント、マルチモーダルの汎用性、そして比類のない使いやすさを実現するためにゼロから設計されています。

YOLO26の革新#

Ultralytics YOLO26は、現代のコンピュータビジョンアプリケーションにとって決定的な選択肢となるいくつかの画期的な機能を導入しています:

  • End-to-End NMS-Free Design: YOLO26は、Non-Maximum Suppression (NMS) の後処理をネイティブで排除します。YOLOv10で最初に開拓されたこのエンドツーエンドのアプローチは、デプロイメントパイプラインを劇的に簡素化し、決定的で低遅延な推論を保証します。
  • 最大 43% 高速な CPU 推論: エッジコンピューティング向けにアーキテクチャが最適化されており、エッジデバイスや標準的な CPUs で優れた速度を発揮するため、バッテリー駆動の IoT デバイスに最適です。
  • MuSGD Optimizer: LLMトレーニング(Moonshot AIのKimi K2など)に触発されたYOLO26は、SGDとMuonのハイブリッドを組み込んでいます。これにより、大規模言語モデルのトレーニングの安定性がコンピュータビジョンにもたらされ、より迅速で信頼性の高い収束が実現します。
  • DFL の削除: Distribution Focal Loss を削除することによりモデルグラフが簡素化され、ONNXTensorRT などのフォーマットへのシームレスなエクスポートが可能になります。
  • ProgLoss + STAL: これらの高度な損失関数は、ドローン運用農業において重要な機能である小物体認識において、顕著な改善を提供します。
タスク固有の拡張機能

YOLO26 には、複数のモダリティにわたる専門的な改良が含まれています。Instance Segmentation 用のマルチスケールプロト、Pose Estimation 用の Residual Log-Likelihood Estimation(RLE)、および Oriented Bounding Box (OBB) 検出における境界の問題を軽減するための高度な角度損失です。

YOLO26の詳細はこちら

パフォーマンスの比較#

これらのモデルを評価する際には、精度(mAP)と計算効率(Speed/FLOPs)のバランスが最も重要です。以下の表は、業界標準の COCO dataset を使用してこれらのモデルがどのように比較されるかを示しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

上記のように、YOLO26は一貫して少ないパラメータ数とFLOPsでより高い精度を提供し、トレーニングと推論の両方において、はるかに効率的なアーキテクチャを実現しています。

トレーニングの効率とユーザビリティ#

DAMO-YOLOの複雑さ#

DAMO-YOLOは競争力のある精度を達成していますが、そのトレーニング手法は非常に複雑です。Neural Architecture Search (NAS) への依存と、重い知識蒸留のプロセスは、カスタムモデルをトレーニングするために多大なGPUリソースと専門的な知識が必要であることを意味します。巨大な教師モデルをトレーニングして小さな学生モデルに蒸留するというこの多段階のプロセスは、カスタムデータセットで迅速に反復しようとするアジャイルなエンジニアリングチームにとってボトルネックになる可能性があります。

合理化されたUltralyticsのエクスペリエンス#

対照的に、Ultralytics YOLO26は「ゼロからヒーローへ」の使いやすさを目指して設計されています。トレーニング、検証、デプロイのライフサイクル全体が、クリーンで統一されたPythonのAPIとCLIの背後に抽象化されています。さらに、YOLO26はRT-DETRのようなTransformerベースのモデルと比較してトレーニング中のCUDAメモリ消費量が大幅に少ないため、研究者はコンシューマー向けハードウェアで最先端のモデルをトレーニングできます。

以下は、Ultralytics SDKを使用してYOLO26モデルをトレーニング、評価、エクスポートすることがいかに簡単かを示す例です:

from ultralytics import YOLO

# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Evaluate the model's performance on the validation set
metrics = model.val()

# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()

# Export the model to ONNX format for deployment
model.export(format="onnx")

コード不要の環境を好むチームのために、Ultralytics Platform はデータセットのアノテーション、クラウドでのトレーニング、シームレスなデプロイメントのための直感的なインターフェースを提供します。

実際のアプリケーション#

適切なアーキテクチャを選択するかどうかは、ターゲットのデプロイメント環境とハードウェアの制約に大きく依存します。

産業品質管理#

高速な manufacturing automation 向けに、DAMO-YOLO は専用の GPU ハードウェア上で優れたパフォーマンスを発揮できます。しかし、近代的な組立ラインには YOLO26 が推奨される選択肢となります。その End-to-End NMS-Free 設計により、決定論的でジッターのないレイテンシが保証されます。これは、視覚データをリアルタイムでロボットアクチュエータと同期させる際に不可欠です。

エッジAIおよびモバイルデバイス#

バッテリー駆動のデバイスにコンピュータビジョンをデプロイするには、極めて高い効率が求められます。DAMO-YOLO が特定の RepGFPN ネックに依存しているのに対し、YOLO26n(Nano)はエッジコンピューティング向けに特化して最適化されています。その DFL の削除と 43% 高速な CPU 推論により、スマートカメラ、モバイルアプリケーション、および security alarm systems 向けの究極のソリューションとなっています。

マルチモーダルプロジェクトの要件#

プロジェクトが単なる物体検出にとどまらず、姿勢推定を使用した sports でのプレイヤーのメカニクス分析や、インスタンスセグメンテーションを使用した正確なピクセル境界の抽出などを必要とする場合、YOLO26 は単一の統一されたコードベース内でこれらすべてのタスクをネイティブにサポートします。DAMO-YOLO はバウンディングボックス検出のみに厳しく制限されています。

ユースケースと推奨事項#

DAMO-YOLOとYOLO26のどちらを選択するかは、特定のプロジェクト要件、デプロイメントの制約、およびエコシステムの好みに依存します。

DAMO-YOLOを選択すべきケース#

DAMO-YOLOは以下のような場合に強力な選択肢となります。

  • 高スループットビデオ解析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上での高FPSビデオストリーム処理。
  • 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上での厳格なGPUレイテンシ制約があるシナリオ。
  • Neural Architecture Searchの研究: 自動化されたアーキテクチャ探索 (MAE-NAS) や効率的な再パラメータ化バックボーンが検出パフォーマンスに与える影響の研究。

YOLO26を選ぶべき時#

YOLO26は以下のような場合に推奨されます。

  • NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
  • CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
  • 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。

結論#

両方のアーキテクチャは、ディープラーニングの分野における重要な成果を表しています。DAMO-YOLOは、特定のハードウェアベンチマークに合わせて調整されたNeural Architecture Searchと蒸留技術の力について、魅力的な洞察を提供します。

しかし、本番環境に対応したソリューションを求める開発者、研究者、および企業にとって、Ultralytics YOLO26は優れた選択肢として際立っています。エンドツーエンドのNMSフリー設計、大幅なCPU推論の向上、マルチモーダルの汎用性、そして十分にメンテナンスされたUltralyticsエコシステムへの統合の組み合わせにより、現実世界のコンピュータビジョンの課題を解決するための最も堅牢で実用的なツールとなっています。

Ultralytics エコシステム内の他のモデルの探索に関心のあるユーザー向けに、YOLO11YOLOv8、およびトランスフォーマーベースの RT-DETR の包括的なドキュメントが用意されています。

コメント