DAMO-YOLOとYOLOv9の比較#
リアルタイム物体検出の分野は、急速な勢いで進化し続けています。エンジニアリングチームや研究者が精度、推論速度、計算効率の最適なバランスを追求するなか、研究コミュニティから2つの注目すべきアーキテクチャ、DAMO-YOLOとYOLOv9が登場しました。どちらのモデルも、コンピュータービジョンの可能性を広げることを目指した、重要なアーキテクチャ上の革新を導入しています。
この詳細な技術ガイドでは、これら2つのモデルを掘り下げて分析し、それぞれに固有のアーキテクチャアプローチ、トレーニング手法、実環境でのデプロイ能力を比較します。また、現代のAI開発において幅広いソフトウェアエコシステムが果たす重要な役割についても考察し、Ultralytics Platformのような統合プラットフォームや、YOLO26のような新世代モデルの利点を紹介します。
エグゼクティブサマリー:適切なアーキテクチャの選択#
どちらのモデルもディープラーニング研究における重要な節目ですが、対象とするデプロイの理念はやや異なります。
DAMO-YOLOは、大規模なニューラルアーキテクチャ探索(NAS)を活用して特定のパフォーマンス特性を引き出せる環境に適しており、カスタマイズされたエッジデプロイの研究対象として興味深いモデルです。一方、YOLOv9はディープラーニングにおける情報ボトルネックの解消に重点を置き、非常に高いパラメーター効率を実現します。
しかし、本番環境に対応したデプロイでは、エンジニアリングチームは一貫して統合されたUltralyticsエコシステムの活用を推奨しています。新しいプロジェクト向けには、最新のYOLO26モデルが両方の長所を提供します。最先端の精度に加え、複雑な後処理を不要にするオプションのエンドツーエンド設計を備えています。
DAMO-YOLOとYOLOv9は強力な学術モデルですが、本番環境へのデプロイには多くの場合、大規模なカスタムエンジニアリングが必要です。Ultralytics YOLO26を利用すれば、効率的でメンテナンスしやすいAPIから最先端のパフォーマンスを活用できます。
技術仕様と開発者#
これらのモデルの起源と開発上の重点を理解すると、それぞれの強みを把握するために欠かせない背景を得られます。
DAMO-YOLO#
Alibaba Groupの研究者が開発したDAMO-YOLOは、自動アーキテクチャ生成と効率的な特徴融合に重点を置いています。
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- リリース日: 2022年11月23日
- arXiv論文: DAMO-YOLO研究論文
- 公式GitHub: tinyvision/DAMO-YOLOリポジトリ
- ドキュメント: DAMO-YOLO README
YOLOv9#
ディープ畳み込みネットワークにおける情報損失への対策として導入されたYOLOv9は、トレーニング中の勾配保持に関する理論的限界に挑みます。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織: 台湾、中央研究院情報科学研究所
- リリース日: 2024年2月21日
- arXiv論文: YOLOv9研究論文
- 公式GitHub: WongKinYiu/yolov9リポジトリ
- ドキュメント: YOLOv9 Ultralyticsドキュメント
アーキテクチャの革新#
DAMO-YOLO:ニューラルアーキテクチャ探索を活用#
DAMO-YOLOは、機械生成された高度なカスタムコンポーネントを特徴としています。バックボーンはニューラルアーキテクチャ探索(NAS)を用いて生成され、さまざまなハードウェアでの低レイテンシ推論に特化しています。
このアーキテクチャでは、特徴融合に効率的なRepGFPN(再パラメーター化汎用特徴ピラミッドネットワーク)を採用し、計算オーバーヘッドを過度に増やすことなくマルチスケール物体検出を強化します。さらに、検出ヘッドを簡素化するZeroHead設計を採用し、ラベル割り当てにはAlignedOTAを利用するとともに、トレーニング中に高度な蒸留強化プロセスを組み合わせています。これらの手法により推論は高速になりますが、多段階の蒸留プロセスでは大量のVRAMと長いトレーニング時間が必要になることがよくあります。
YOLOv9:情報ボトルネックの解消#
YOLOv9は、ディープネットワークにおける根本的な問題、すなわち入力データが連続するレイヤーを通過するにつれて徐々に情報が失われる問題に取り組みます。
これに対処するため、著者らは、深い層に重要な詳細を保持し、重み更新に非常に信頼性の高い勾配を生成する補助的な教師あり学習フレームワークである Programmable Gradient Information (PGI) を導入しました。PGIとともに導入されたのが、GELAN (Generalized Efficient Layer Aggregation Network) アーキテクチャです。GELANは、CSPNetとELANの長所を組み合わせることでパラメーター効率を最適化し、情報の流れを最大化しながら浮動小数点演算(FLOPs)を厳密に最小限に抑えます。
パフォーマンス分析と指標#
パフォーマンスを評価すると、両モデルともCOCOなどの標準ベンチマークで高い平均適合率(mAP)を示します。YOLOv9は、同程度のパラメーター数でより高い精度を達成し、全体として最も高い精度を記録しています。これは、PGIアーキテクチャを活用して、難易度の高いデータセットでも高い忠実度を維持するためです。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
上記のとおり、YOLOv9-Eが最も高い精度を達成する一方、小型のDAMO-YOLOとYOLOv9の各バリアントは、TensorRTの最適化によって非常に競争力のある推論速度を維持しています。
トレーニング手法とエコシステム#
アーキテクチャそのものも重要ですが、実用化においては、モデルのエコシステムが左右する使いやすさとトレーニング効率が最も重要です。
DAMO-YOLOは知識蒸留に依存しているため、対象となる「生徒」モデルに知識を転移する前に、扱いにくい「教師」モデルをトレーニングする必要があることがよくあります。この従来型の研究アプローチでは、メモリ要件とトレーニングサイクルの所要時間が大幅に増加します。同様に、YOLOv9の元のリポジトリでは複雑な設定ファイルを扱う必要があり、アジャイルな開発の妨げになることがあります。
対照的に、モデルをUltralytics Platformに統合すると、開発者のエクスペリエンスが一変します。Ultralytics Pythonパッケージは定型コードを抽象化するため、チームはデータ拡張、ハイパーパラメーター調整、モデルのエクスポートを簡単に行えます。
実世界でのアプリケーションとユースケース#
リソース要件と精度の特性に応じて、アーキテクチャごとに得意とする業界は異なります。
- エッジAIにおけるDAMO-YOLO: NASで最適化されたバックボーンを備えるDAMO-YOLOは、ハードウェア固有の再パラメーター化が必須となる組み込みシステムでよく検討されています。たとえば、基本的な製造品質管理におけるカスタムASICへのデプロイが挙げられます。
- 高精度分析におけるYOLOv9: 高いパラメーター効率とPGIによる勾配保持を備えるYOLOv9は、航空画像の分析や、混雑した小売環境での小さな物体の追跡など、高密度な物体検出のシナリオに適しています。
ユースケースと推奨事項#
DAMO-YOLOとYOLOv9のどちらを選ぶかは、具体的なプロジェクト要件、デプロイの制約、エコシステムに関する好みによって決まります。
DAMO-YOLOを選ぶケース#
DAMO-YOLOが適しているケース:
- 高スループットの動画分析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上で高FPSの動画ストリームを処理する用途。
- 産業用製造ライン: 組み立てラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャ探索の研究: 自動アーキテクチャ探索 (MAE-NAS) と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響を研究する用途。
YOLOv9を選ぶ場合#
YOLOv9は、次のような用途に推奨されます。
- 情報ボトルネックの研究: プログラム可能な勾配情報(PGI)や一般化効率的層集約ネットワーク(GELAN)のアーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と抑制に焦点を当てた研究。
- 高精度検出のベンチマーク: アーキテクチャの比較において、YOLOv9の優れたCOCOベンチマーク性能を基準として必要とするシナリオ。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの強み:YOLO26への進化#
従来のアーキテクチャを比較しているユーザーにとって、最新のUltralyticsエコシステム、特に最新のYOLO26モデルへの移行は、他に類を見ない優位性をもたらします。
YOLO26は、エンドツーエンドのNMSフリーデザインによってデプロイ環境を大きく変えます。オプションのワンツーワンヘッド(nms=False)により、Non-Maximum Suppression (NMS)の後処理が不要になり、より高速で大幅にシンプルなデプロイアーキテクチャを実現します。Distribution Focal Loss (DFL)の削除と相まって、YOLO26はエッジデバイスや低消費電力デバイスとの優れた互換性を備えています。
さらに、YOLO26には、LLMのトレーニングにおける革新に着想を得た確率的勾配降下法とMuonの最適化手法を組み合わせた、革新的な MuSGD Optimizer が組み込まれています。これにより、Transformerを多用する代替手法と比べてメモリ使用量を非常に低く抑えながら、安定したトレーニングの収束を実現します。
直感的に使えるUltralytics APIにより、実験追跡機能を標準搭載した最先端のYOLO26モデルを、わずか数行のPythonコードでトレーニングできます。
from ultralytics import YOLO
# 最新のYOLO26モデルを読み込みます
model = YOLO("yolo26n.pt")
# カスタムデータセットで効率よくトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# トレーニング済みモデルをONNX形式にエクスポートします
model.export(format="onnx")高度なインスタンスセグメンテーション、高精度な姿勢推定、標準的なバウンディングボックス検出のいずれが必要な場合も、Ultralyticsフレームワークの柔軟性によって、チームはディープラーニング環境の設定に費やす時間を減らし、堅牢なAIソリューションのデプロイにより多くの時間を割けます。小さな物体の認識を強化する ProgLoss + STAL など、タスクに特化した改良を備えるYOLO26は、次世代のビジョンアプリケーションに最適な選択肢です。