DAMO-YOLO と YOLOv9#
リアルタイム物体検出の分野は、目まぐるしい速さで進化し続けています。エンジニアリングチームや研究者が精度、推論速度、計算効率の最適なバランスを追求する中、研究コミュニティから注目すべき2つのアーキテクチャ、DAMO-YOLO と YOLOv9 が登場しました。どちらのモデルも、コンピュータビジョンで可能なことの限界を押し広げることを目指し、重要なアーキテクチャ革新を導入しています。
この詳細な技術ガイドでは、これら2つのモデルを詳しく分析し、それぞれ独自のアーキテクチャアプローチ、トレーニング手法、実環境でのデプロイ能力を比較します。また、現代のAI開発でより広範なソフトウェアエコシステムが果たす重要な役割についても検討し、Ultralytics Platform のような統合プラットフォームや、YOLO26 のような新世代モデルの利点を紹介します。
エグゼクティブサマリー:適切なアーキテクチャの選択#
どちらのモデルもディープラーニング研究における重要なマイルストーンですが、対象とするデプロイの方針は少し異なります。
DAMO-YOLO は、大規模な Neural Architecture Search (NAS) を活用して特定の性能プロファイルを引き出せる環境で優れています。そのため、カスタマイズされたエッジデプロイの研究対象として興味深いモデルです。一方、YOLOv9 はディープラーニングにおける情報ボトルネックの解決に重点を置き、非常に高いパラメータ効率を実現します。
ただし、本番環境対応のデプロイでは、エンジニアリングチームは一貫して統合された Ultralytics エコシステム の活用を推奨しています。新規プロジェクトでは、最新の YOLO26 モデルが両方の利点を提供します。すなわち、最先端の精度と、複雑な後処理を不要にするネイティブなエンドツーエンド設計を兼ね備えています。
DAMO-YOLO と YOLOv9 は強力な学術モデルですが、本番環境にデプロイするには、多くの場合、大規模なカスタムエンジニアリングが必要です。Ultralytics YOLO26 を使用すると、合理化され保守しやすい API によって、最先端の性能を利用できます。
技術仕様と開発者情報#
これらのモデルの起源と開発上の重点を理解することは、それぞれの強みを把握するうえで不可欠です。
DAMO-YOLO#
Alibaba Group の研究者によって開発された DAMO-YOLO は、自動アーキテクチャ生成と効率的な特徴融合に重点を置いています。
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- リリース日: 2022年11月23日
- Arxiv 論文: DAMO-YOLO Research Paper
- 公式 GitHub: tinyvision/DAMO-YOLO Repository
- ドキュメント: DAMO-YOLO README
YOLOv9#
ディープ畳み込みネットワークにおける情報損失への解決策として導入された YOLOv9 は、トレーニング中の勾配保持に関する理論的限界を押し広げます。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織: 台湾中央研究院情報科学研究所
- リリース日: 2024年2月21日
- Arxiv 論文: YOLOv9 Research Paper
- 公式 GitHub: WongKinYiu/yolov9 Repository
- ドキュメント: YOLOv9 Ultralytics Docs
アーキテクチャのイノベーション#
DAMO-YOLO:Neural Architecture Search による駆動#
DAMO-YOLO は、機械によって生成された高度にカスタマイズされたコンポーネントによって差別化されています。バックボーンは Neural Architecture Search (NAS) を使用して生成され、さまざまなハードウェアでの低レイテンシ推論を明確に目標としています。
このアーキテクチャは、特徴融合のための効率的な RepGFPN (Reparameterized Generalized Feature Pyramid Network) を備えており、計算オーバーヘッドを過度に増やすことなくマルチスケール物体検出を強化します。さらに、検出ヘッドを簡素化する ZeroHead 設計を採用し、ラベル割り当てには AlignedOTA を使用しています。また、トレーニング中には高度な蒸留強化プロセスを組み合わせます。これらの手法により高速な推論を実現できますが、複数段階の蒸留プロセスでは、多くの場合、大容量の VRAM と長いトレーニング時間が必要になります。
YOLOv9:情報ボトルネックの解消#
YOLOv9 は、ディープネットワークにおける根本的な問題、つまり入力データの情報が連続する各層を通過するにつれて徐々に失われる問題に取り組みます。
これに対処するため、著者らは Programmable Gradient Information (PGI) を導入しました。これは、ディープな層に重要な詳細情報を保持し、重み更新に非常に信頼性の高い勾配を生成するために設計された補助的な教師あり学習フレームワークです。PGI とともに、GELAN (Generalized Efficient Layer Aggregation Network) アーキテクチャも導入されています。GELAN は CSPNet と ELAN の長所を組み合わせてパラメータ効率を最適化し、Floating Point Operations (FLOPs) を厳密に最小化しながら情報フローを最大化します。
パフォーマンス分析と指標#
性能を評価すると、どちらのモデルも COCO などの標準ベンチマークで高い mean Average Precision (mAP) を示します。同等のモデルサイズでは、YOLOv9 がより高い絶対精度を達成します。これは、PGI アーキテクチャを活用して、難易度の高いデータセットでも高い忠実度を維持するためです。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
上記のとおり、YOLOv9-E が最高精度を達成する一方、より小型の DAMO-YOLO と YOLOv9 のバリアントは、TensorRT optimizations によって非常に競争力の高い推論速度を維持します。
トレーニング手法とエコシステム#
生のアーキテクチャも重要ですが、実環境での利用においては、モデルのエコシステムが決める使いやすさとトレーニング効率が最も重要です。
DAMO-YOLO は知識蒸留に依存するため、ターゲットの「student」モデルに知識を転移する前に、扱いの難しい「teacher」モデルをトレーニングする必要があることがよくあります。この従来型の研究アプローチにより、必要なメモリ容量とトレーニングサイクルの時間が大幅に増加します。同様に、元の YOLOv9 リポジトリでは複雑な設定ファイルを扱う必要があり、アジャイルな開発が遅くなる可能性があります。
これに対して、モデルを Ultralytics Platform に統合すると、開発者エクスペリエンスが大きく変わります。Ultralytics Python パッケージがボイラープレートコードを抽象化するため、チームはデータ拡張、ハイパーパラメータチューニング、モデルのエクスポートを簡単に処理できます。
実環境でのアプリケーションとユースケース#
各アーキテクチャは、リソース要件と精度プロファイルに基づいて、特定の業界で自然に優れた性能を発揮します。
- エッジAIにおけるDAMO-YOLO: NASに最適化されたバックボーンにより、DAMO-YOLOは、基本的な製造品質管理におけるカスタムASICのデプロイなど、ハードウェア固有の再パラメータ化が厳密に求められる組み込みシステムで頻繁に検討されます。
- 高精度分析における YOLOv9: 高いパラメータ効率と PGI による勾配保持を備えた YOLOv9 は、密集した物体検出のシナリオに適しています。たとえば、航空画像の分析 や、混雑した小売環境における小さな物体の追跡などです。
ユースケースと推奨事項#
DAMO-YOLO と YOLOv9 のどちらを選択するかは、具体的なプロジェクト要件、デプロイの制約、エコシステムに関する選好によって決まります。
DAMO-YOLOを選択する場合#
DAMO-YOLOが適しているのは、次のような場合です。
- 高スループットの動画分析: バッチサイズ1のスループットが主要な指標となる、固定されたNVIDIA GPUインフラストラクチャ上での高FPS動画ストリーム処理。
- 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャサーチ研究: 自動アーキテクチャ探索(MAE-NAS)と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響の研究。
YOLOv9を選ぶタイミング#
YOLOv9は次の用途に推奨されます。
- 情報ボトルネックの研究: プログラマブル勾配情報(PGI)および汎用効率的レイヤー集約ネットワーク(GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と軽減に重点を置く研究。
- 高精度検出のベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の優れたCOCOベンチマーク性能が必要なシナリオ。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
Ultralytics の利点:YOLO26 への移行#
従来のアーキテクチャを比較しているユーザーにとって、最新の YOLO26 モデル を中心とする現代的な Ultralytics エコシステムへ移行することは、他に類を見ない利点をもたらします。
YOLO26 は、エンドツーエンドの NMS 不使用設計 によって、デプロイの状況を根本的に変えます。Non-Maximum Suppression (NMS) の後処理を完全に排除することで、より高速で大幅にシンプルなデプロイアーキテクチャを実現します。さらに Distribution Focal Loss (DFL) を排除することで、YOLO26 はエッジデバイスや低消費電力デバイスとの優れた互換性を提供します。
さらに、YOLO26 は革新的な MuSGD Optimizer を組み込んでいます。これは、LLM トレーニングの革新に着想を得た、Stochastic Gradient Descent と Muon の最適化を組み合わせたハイブリッドです。これにより、Transformer を多用する代替手法と比較して、非常に低いメモリ使用量を維持しながら、極めて安定したトレーニング収束を実現します。
直感的な Ultralytics API により、組み込みの実験トラッキングを使用して、数行の Python だけで最先端の YOLO26 モデルをトレーニングできます。
from ultralytics import YOLO
# Load the latest NMS-free YOLO26 model
model = YOLO("yolo26n.pt")
# Train on your custom dataset efficiently
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained model to ONNX format
model.export(format="onnx")高度な インスタンスセグメンテーション、非常に高精度な 姿勢推定、標準的なバウンディングボックス検出のいずれが必要な場合でも、Ultralytics フレームワークの柔軟性により、チームはディープラーニング環境の設定に費やす時間を減らし、堅牢な AI ソリューションのデプロイにより多くの時間を使えます。小さな物体の認識を強化する ProgLoss + STAL など、タスクに特化した改善により、YOLO26 は次世代のビジョンアプリケーションに最適な選択肢となっています。