YOLOv9とDAMO-YOLO#
コンピュータビジョンの急速な進化により、さまざまなデプロイ制約や精度要件に合わせた強力なアーキテクチャが数多く生まれています。この分野で注目すべき2つのモデルが、情報ボトルネックへの堅牢な対応で評価されているYOLOv9と、ニューラルアーキテクチャサーチ(NAS)および効率的な特徴ピラミッドに重点を置くDAMO-YOLOです。
このガイドでは、YOLOv9とDAMO-YOLOのアーキテクチャの違い、トレーニング手法、理想的なデプロイシナリオを詳しく技術比較します。また、Ultralyticsエコシステムが開発から本番運用までのシームレスな道筋を提供する仕組みと、YOLO26のような最新モデルが新規プロジェクトで推奨される標準となっている理由についても説明します。
アーキテクチャの詳細#
各モデルの性能がさまざまな指標で異なる理由を理解するには、それぞれを駆動する中核メカニズムを把握する必要があります。
YOLOv9:プログラマブル勾配情報#
YOLOv9は、データが深いニューラルネットワークを通過する際に生じる情報損失に直接対処するよう設計されています。
YOLOv9では、**プログラマブル勾配情報(PGI)と一般化効率的レイヤー集約ネットワーク(GELAN)**が導入されています。PGIは、フィードフォワード処理中に重要な空間情報と意味情報が保持されるようにし、重み更新に使用される勾配の劣化を防ぎます。GELANはこれを補完し、パラメーター効率を最大化することで、従来のCNNの多くより少ないFLOPsで最先端の平均適合率(mAP)を達成できるようにします。
DAMO-YOLO:NAS主導の効率性#
Alibaba Groupが開発したDAMO-YOLOは、速度と精度の最適なバランスを見つけるために自動アーキテクチャサーチを活用する、異なるアプローチを採用しています。
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- Organization: Alibaba Group
- 日付: 2022年11月23日
- リンク: Arxiv、GitHub
DAMO-YOLOは、効率的なネットワーク構造を自動生成するためにMAE-NAS(Maximum Entropy Neural Architecture Search)バックボーンを採用しています。堅牢な特徴量融合のためにRepGFPN(Reparameterized Generalized Feature Pyramid Network)を利用し、検出ヘッドの計算負荷を最小限に抑える「ZeroHead」設計を採用しています。さらに、ラベル割り付けのためにAlignedOTAを組み込み、小型バリアントのパフォーマンスを向上させるための知識蒸留を行っています。
ニューラルアーキテクチャサーチ(NAS)は、人工ニューラルネットワークの設計を自動化します。DAMO-YOLOのような非常に効率的なモデルを生成できる一方で、アーキテクチャ空間の探索には膨大な計算リソースが必要になることが多く、YOLOv9のようなモデルのより決定論的な設計思想とは対照的です。
パフォーマンスとメトリクスの比較#
物体検出モデルを選択する際は、精度、速度、計算フットプリントのバランスが重要です。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
分析#
- 精度とパラメーター: YOLOv9は一般に、パラメーター数と精度の比率において優れています。たとえば、YOLOv9cは25.3M個のパラメーターで53.0% mAPを達成する一方、DAMO-YOLOlは50.8% mAPにとどまり、必要なパラメーター数は大幅に多い42.1Mです。
- 推論速度: DAMO-YOLOのアーキテクチャはT4 GPU上で競争力のあるTensorRT推論速度を実現し、中規模のモデル層ではYOLOv9をわずかに上回ります。ただし、YOLOv9はFLOPsとパラメーター数の効率性により、優れたGPUメモリ効率を実現します。
- メモリ要件: YOLOv9を含むUltralyticsのYOLOモデルは、一般に、複雑なNAS生成モデルや大規模なTransformerアーキテクチャと比較して、トレーニングと推論の両方でメモリ使用量が少ない傾向があります。そのため、リソースが限られたエッジハードウェアにも容易にデプロイできます。
Ultralyticsエコシステムの優位性#
理論上の指標は重要ですが、実際の実装がプロジェクトの成功を大きく左右します。この点で、Ultralytics Platformとその包括的なソフトウェアエコシステムは、DAMO-YOLOのようなスタンドアロンリポジトリを上回ります。
使いやすさとトレーニング効率#
カスタムYOLOv9モデルのトレーニングに必要なボイラープレートは最小限です。Ultralytics Python APIは、データ拡張、分散トレーニング、ハードウェア最適化などの複雑な処理を抽象化します。
from ultralytics import YOLO
# Load a pretrained YOLOv9 model
model = YOLO("yolov9c.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate model performance
metrics = model.val()
# Export for production deployment
model.export(format="onnx")一方、DAMO-YOLOを使用する場合は、独自のトレーニングパイプラインに固有の厳格な設定ファイルや複雑な依存関係を扱う必要があることが多く、学習曲線がより急になります。
タスク全体にわたる汎用性#
Ultralyticsモデルの特徴は、本質的な汎用性です。標準的なバウンディングボックス検出に加えて、Ultralyticsフレームワークは、インスタンスセグメンテーション、ポーズ推定、画像分類、回転バウンディングボックス(OBB)検出などのタスクをシームレスにサポートします。DAMO-YOLOは2D物体検出に特化して最適化されているため、他の視覚タスクに適応するには大幅な再設計が必要です。
ユースケースと推奨事項#
YOLOv9とDAMO-YOLOのどちらを選ぶかは、具体的なプロジェクト要件、デプロイ制約、エコシステムの好みによって決まります。
YOLOv9を選ぶタイミング#
YOLOv9が適しているケース:
- 情報ボトルネックの研究: プログラマブル勾配情報(PGI)および汎用効率的レイヤー集約ネットワーク(GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と軽減に重点を置く研究。
- 高精度検出のベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の優れたCOCOベンチマーク性能が必要なシナリオ。
DAMO-YOLOを選択する場合#
DAMO-YOLOは次の用途に推奨されます。
- 高スループットの動画分析: バッチサイズ1のスループットが主要な指標となる、固定されたNVIDIA GPUインフラストラクチャ上での高FPS動画ストリーム処理。
- 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャサーチ研究: 自動アーキテクチャ探索(MAE-NAS)と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響の研究。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
将来:YOLO26への移行#
YOLOv9とDAMO-YOLOは歴史上重要なマイルストーンですが、現代のコンピュータビジョンはネイティブなエンドツーエンドアーキテクチャへと移行しています。新規開発には、**YOLO26**が推奨される標準です。
2026年にリリースされたYOLO26は、前世代モデルの成果を基盤とし、精度とデプロイの簡便性の両方で大きな飛躍を実現しています。
YOLO26 の主なイノベーション#
- エンドツーエンドのNMSフリーデザイン: YOLO26は、Non-Maximum Suppression(NMS)の後処理を完全に排除します。これにより、ネイティブなエンドツーエンドの合理化されたデプロイパイプラインが実現します。この方式は、YOLOv10で初めて先駆的に導入されました。
- DFLの削除: Distribution Focal Lossを削除し、エクスポートを簡素化するとともに、エッジデバイスや低消費電力デバイスとの互換性を高めています。
- CPU推論が最大43%高速化: 複雑な後処理を削除し、中核の畳み込みを最適化することで、YOLO26は専用GPUを搭載しないエッジコンピューティング環境に特に適しています。
- MuSGDオプティマイザー: LLMトレーニングの革新に着想を得て、YOLO26はSGDとMuonのハイブリッド(MuSGD)を利用し、より安定したトレーニングと、明らかに高速な収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数により、小物体認識が大幅に向上するため、YOLO26は高高度の航空画像やIoTデバイスに最適です。
次のプロジェクトで現在YOLO11またはYOLOv8を検討している場合は、YOLO26にアップグレードすることで、現在利用可能な最も最適化された最先端のビジョンAIフレームワークを利用できます。
まとめ#
適切なモデルの選択は、具体的な運用上の制約によって決まります。
- DAMO-YOLOは、NAS主導の最適化を垣間見せる興味深いモデルであり、RepGFPNアーキテクチャが強みを発揮する特定のハードウェア構成で競争力のある速度を提供します。
- YOLOv9は、きめ細かな視覚情報の保持に注力する研究者にとって優れた選択肢です。PGIアーキテクチャを活用して、深いネットワークでの情報損失を防ぎます。
- Ultralytics YOLO26は、現代のエンタープライズおよび研究用途における決定的な選択肢です。比類のない使いやすさ、NMSフリーアーキテクチャ、最先端のMuSGDトレーニング最適化により、コンピュータビジョン分野で最も信頼性が高く、精度に優れ、容易にデプロイできるモデルとなっています。