YOLO Vision 2026:

DAMO-YOLOとYOLO11の比較#

次回のコンピュータビジョンプロジェクトでリアルタイム物体検出アーキテクチャを選択する際、主要モデル間の違いを理解することは不可欠です。本ガイドでは、DAMO-YOLOとUltralytics YOLO11の技術的な詳細を比較分析し、それぞれのアーキテクチャ、パフォーマンス指標、学習手法、そして現実世界における理想的なデプロイメントシナリオを検証します。

DAMO-YOLO の詳細:
著者: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun
組織: Alibaba Group
日付: 2022-11-23
Arxiv: 2211.15444v2
GitHub: tinyvision/DAMO-YOLO
ドキュメント: DAMO-YOLO Documentation

YOLO11 の詳細:
著者: Glenn Jocher, Jing Qiu
組織: Ultralytics
日付: 2024-09-27
GitHub: ultralytics/ultralytics
ドキュメント: YOLO11 Documentation

アーキテクチャの設計思想#

物体検出モデルの基盤となるアーキテクチャによって、推論速度、精度、そして様々なハードウェア環境への適合性が決まります。

DAMO-YOLOは、バックボーンの自動設計にNeural Architecture Search (NAS)を多用するなど、学術的な革新を取り入れています。効率的なRepGFPN (Reparameterized Generalized Feature Pyramid Network) を活用して特徴融合を強化し、従来のアーキテクチャで見られた肥大化した予測ヘッドを大幅に縮小するZeroHead設計を採用しています。このNAS主導のアプローチにより、特定のGPU環境下で効率性を発揮しますが、結果として生成されるアーキテクチャは、多様なエッジデバイス間でシームレスに汎用性を発揮するための柔軟性に欠ける場合があります。

対照的に、YOLO11 は長年の基礎研究を基盤とし、高度に最適化された手作業によるアーキテクチャを実現しています。スリム化されたバックボーンと、冗長な計算を削減する非常に効率的なネックに焦点を当てています。YOLO11 の主な利点の一つは、洗練されたパラメータ効率です。RT-DETR のような Transformer ベースのモデルに典型的な重い VRAM 要件なしで、高い特徴表現を実現します。これにより、YOLO11 は非常に多用途であり、コンシューマー向け GPU、モバイルデバイス、特殊なエッジアクセラレータ上でスムーズに動作します。

パフォーマンスとメトリクス#

パフォーマンスを評価する際は、トップラインの精度だけでなく、速度、モデルサイズ、計算負荷 (FLOPs) のバランスを考慮する必要があります。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9

表が示すように、YOLO11 は非常に有利なパフォーマンスのバランスを実現しています。例えば、YOLO11s バリアントは、大幅に小さなパラメータフットプリントを維持しながら、精度において DAMO-YOLOs を上回ります。このメモリ要件の削減は、導入コストの低下と、エッジデバイスにおけるより俊敏なパフォーマンスに直接つながります。

YOLO11の詳細はこちら

トレーニング手法と使いやすさ#

学習パイプラインは開発者が最も多くの時間を費やす部分であり、学習効率は非常に重要です。

DAMO-YOLO は、知識蒸留に大きく依存するマルチステージトレーニングプロセスを採用しています。ラベル割り当てに AlignedOTA (Optimal Transport Assignment) を利用し、より小さな「生徒」モデルに知識を蒸留するために、より大きな「教師」モデルのトレーニングを必要とすることがよくあります。この手法により、最適な収束を実現するために必要な CUDA memory フットプリントと全体的な計算時間が劇的に増加します。

一方、Ultralytics エコシステムは、モデルトレーニングの複雑さを抽象化します。YOLO11 は抜群の使いやすさを目指して設計されており、合理化された Python API と、エンジニアが単一のコマンドでカスタムデータセットのトレーニングを開始できるようにする包括的な CLI interfaces を備えています。トレーニングパイプラインは本質的にリソース効率が高く、メモリの急上昇を最小限に抑えるため、より大きなモデルでも標準的なハードウェアでトレーニングできます。

Ultralyticsによる効率化された学習

Ultralyticsモデルの学習には、定型コードが一切不要です。組み込みのデータ読み込み、拡張、損失計算パイプラインは、初期状態で完全に最適化されています。

以下は、Ultralyticsモデルを学習・デプロイする際の簡便さを示すクイックサンプルです。

from ultralytics import YOLO

# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")

# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)

# Export the trained model to ONNX for seamless deployment
model.export(format="onnx")

YOLO11の詳細はこちら

現実世界のアプリケーションと汎用性#

これらのアーキテクチャの選択は、デプロイ先環境で必要とされるタスクの幅に左右されることがよくあります。

DAMO-YOLOの適性#

DAMO-YOLOは純粋な物体検出フレームワークです。再パラメータ化の研究や、特定のNeural Architecture Search実験の再現などを行う学術研究環境において真価を発揮します。また、NASによって生成されたバックボーンと完全に一致する特定のGPUアクセラレータを搭載した、厳格に制限された産業環境にもデプロイ可能です。

Ultralyticsの利点#

YOLO11 を含む Ultralytics モデルは、その比類のない汎用性とよくメンテナンスされたエコシステムにより、現実世界の商用アプリケーションで優れた性能を発揮します。DAMO-YOLO とは異なり、Ultralytics フレームワークはマルチモーダルタスクをネイティブでサポートしています。医療画像の Instance Segmentation からスポーツの生体力学解析のための Pose Estimation まで、単一の統合されたコードベースで処理できます。

YOLO11を活用する業界は以下の通りです。

  • スマート農業: 物体検出を活用して作物の健康状態を監視し、収穫機械の自動化を実現します。
  • リテールアナリティクス: 顧客のトラフィックを分析し、在庫管理を自動化するための smart surveillance の実装。
  • ロジスティクスおよびサプライチェーン: 高速で移動するコンベアベルト上での Oriented Bounding Boxes (OBB) を使用した高速バーコードおよびパッケージ検出。

ユースケースと推奨事項#

DAMO-YOLOとYOLO11のどちらを選択するかは、特定のプロジェクト要件、デプロイメントの制約、エコシステムの好みによって決まります。

DAMO-YOLOを選択すべきケース#

DAMO-YOLOは以下のような場合に強力な選択肢となります。

  • 高スループットビデオ解析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上での高FPSビデオストリーム処理。
  • 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上での厳格なGPUレイテンシ制約があるシナリオ。
  • Neural Architecture Searchの研究: 自動化されたアーキテクチャ探索 (MAE-NAS) や効率的な再パラメータ化バックボーンが検出パフォーマンスに与える影響の研究。

YOLO11を選択すべき時#

YOLO11は以下のような場合に推奨されます。

  • 本番エッジデプロイメント: 信頼性と積極的なメンテナンスが最優先される、Raspberry PiNVIDIA Jetson などのデバイス上の商用アプリケーション。
  • マルチタスクビジョンアプリケーション: 単一の統一されたフレームワーク内で detectionsegmentationpose estimation、および OBB を必要とするプロジェクト。
  • 迅速なプロトタイピングとデプロイメント: 合理化された Ultralytics Python API を使用して、データ収集から本番環境まで迅速に移行する必要があるチーム。

Ultralytics (YOLO26) を選択すべき時#

ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。

  • NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
  • CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
  • 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。

次世代: YOLO26の導入#

YOLO11 は強力で信頼性の高い選択肢であり続けていますが、コンピュータビジョンの分野は急速に進歩しています。新しいプロジェクトを開始する開発者にとって、最新の YOLO26 モデルは新しい最先端(SOTA)を表しています。

2026年1月にリリースされたYOLO26は、いくつかの画期的な進歩をもたらします。

  • エンドツーエンドのNMSフリー設計: Non-Maximum Suppressionの後処理を排除することで、YOLO26はより高速で決定論的な推論時間を確保し、デプロイメントパイプラインを劇的に簡素化します。
  • CPU推論が最大43%高速化: Distribution Focal Loss (DFL) の削除により、このモデルは専用GPUを搭載していないエッジデバイスや低電力デバイスに適しています。
  • MuSGDオプティマイザ: Moonshot AIから着想を得たLLM学習の革新を取り入れたこのハイブリッドオプティマイザにより、学習中の安定的かつ迅速な収束が保証されます。
  • 高度な損失関数: ProgLoss + STALを活用することで、YOLO26は空中画像やロボティクスにおいて重要な、小物体認識において顕著な改善を示しています。

YOLO26の詳細はこちら

結論#

DAMO-YOLO と YOLO11 はどちらも、高速で正確なコンピュータビジョンの発展に大きく貢献してきました。DAMO-YOLO がアーキテクチャ探索と蒸留に関する興味深い学術的インサイトを提供している一方で、Ultralytics YOLO11 (および画期的な YOLO26) は優れた開発者体験を提供します。

より低いメモリ要件、豊富なドキュメント、マルチタスク機能、そして強力な Ultralytics Platform との統合により、Ultralytics モデルは、頑健でスケーラブルな AI ソリューションの構築を目指す研究者やエンタープライズエンジニアにとって、最高の推奨事項であり続けます。他の高度なアーキテクチャを探索している方向けに、YOLO26 vs RT-DETR の比較は、Transformer ベースの代替案に関する追加のインサイトを提供します。

コメント