YOLO26とDAMO-YOLOの比較#
最先端のコンピュータービジョンモデルを選ぶ際は、推論速度、精度、デプロイの容易さを最適なバランスで実現することが重要です。この包括的なガイドでは、ビジョンAI分野を代表する2つのモデル、Ultralytics YOLO26とDAMO-YOLOを比較します。どちらのアーキテクチャもリアルタイム物体検出の限界を押し広げていますが、基盤となる設計思想と想定ユースケースは大きく異なります。
アーキテクチャの革新と設計#
Ultralytics YOLO26:エッジを最優先するビジョン標準#
UltralyticsのGlenn JocherとJing Qiuが開発し、2026年1月14日にリリースされたYOLO26は、YOLOの系譜における大きな飛躍を象徴しています。エッジコンピューティング向けにゼロから設計され、最先端のLLMトレーニング手法と高度なビジョンアーキテクチャをシームレスに融合しています。
YOLO26の主なアーキテクチャ上の革新は次のとおりです。
- エンドツーエンドのNMSフリー設計: YOLOv10の先駆的な取り組みを発展させ、YOLO26はネイティブなエンドツーエンドモデルです。オプションのone-to-one head(
nms=False)によって非最大値抑制(NMS)の後処理を省略し、レイテンシーの決定性を確保するとともに、デプロイパイプラインを大幅に簡素化します。 - DFLの削除: Distribution Focal Lossを削除することで、モデルグラフが簡素化されます。その結果、ONNXやTensorRTなどのデプロイ用フレームワークへのエクスポートが大幅に容易になり、低消費電力のエッジデバイスとの互換性も向上します。
- MuSGDオプティマイザー: Moonshot AIのKimi K2に着想を得た、確率的勾配降下法(SGD)とMuonのハイブリッドです。LLMトレーニングのイノベーションをコンピュータービジョンに取り入れ、非常に安定したトレーニングと迅速な収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数は小物体認識を大幅に向上させます。これは、ドローンによる航空画像解析や複雑なロボティクスパイプラインに不可欠です。
DAMO-YOLO:大規模なニューラルアーキテクチャ探索#
Alibaba GroupのXianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sunが開発したDAMO-YOLO(2022年11月23日リリース)は、アーキテクチャの自動探索を重視しています。arXiv論文で詳述されているこの研究では、ニューラルアーキテクチャ探索(NAS)を使用し、厳しいレイテンシー制約のもとで最適なバックボーンを見つけます。
DAMO-YOLOの主なアーキテクチャ機能は次のとおりです。
- MAE-NASバックボーン: 最大エントロピーを指針とする探索を用いて、精度と対象デプロイ環境での速度のバランスを取るバックボーンを自動設計します。
- Efficient RepGFPN: 異なるスケール間の特徴融合を最適化する、堅牢で大規模なネック設計です。複雑な視覚シーンの処理に優れています。
- ZeroHead: 最終的な予測レイヤーの計算オーバーヘッドを最小限に抑えるために設計された、大幅に簡素化された検出ヘッドです。
DAMO-YOLOのNAS主導アーキテクチャは、事前に定められた特定のハードウェア制約に対して優れています。一方、YOLO26のNMSフリー設計とDFLの削除により、さまざまなエッジ環境やクラウド環境で、より汎用性が高く予測しやすい選択肢となっています。
パフォーマンスと指標の比較#
標準のCOCOデータセットでトレーニングしたモデルバリアントを直接比較すると、それぞれ異なるパフォーマンス特性が明らかになります。以下の表では、精度(mAP)、速度、計算リソース(パラメーター数とFLOPs)のトレードオフを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
パフォーマンス分析#
データを分析すると、最新のアプリケーションではパフォーマンスのバランスがYOLO26に大きく傾いています。Nanoバリアント(YOLO26n)はパラメーター数がわずか2.4Mと非常に軽量で、NVIDIA T4 GPU上で1.7 msという驚異的な速度を実現します。さらに、YOLO26はCPU推論を最大43%高速化するよう設計されており、専用GPUアクセラレーターを搭載していないエッジデバイスで圧倒的な性能を発揮します。
純粋なmAPではDAMO-YOLOtがYOLO26nをわずかに上回りますが、その代わりにパラメーター数が約3.5倍(8.5M)必要です。より大きなバリアントでは、YOLO26は小さなメモリフットプリントとトレーニング時の低いCUDAメモリ使用量を維持しながら、精度でDAMO-YOLOを一貫して上回り、TensorRTでの速度も大幅に高速です。
エコシステム、使いやすさ、トレーニング効率#
機械学習モデルの真価は、生の指標だけでなく、開発者や研究者がどれだけ簡単に活用できるかにもあります。
Ultralyticsの強み#
Ultralyticsモデルを選ぶと、開発者を中心に設計された洗練されたエコシステムを利用できます。データ拡張、ハイパーパラメーターのチューニング、堅牢な実験追跡を含む複雑なワークフローを、直感的なコマンドで実行できます。
さらに、YOLO26は比類のない汎用性を備えています。物体検出専用のDAMO-YOLOとは異なり、YOLO26は複数の領域にわたって、タスクに特化した包括的な改善をすぐに利用できます。
- インスタンスセグメンテーション: 専用のセマンティックセグメンテーション損失関数とマルチスケールのプロトタイピングを活用します。
- 姿勢推定: 高度な残差対数尤度推定(RLE)の恩恵を受けられます。
- 方向付きバウンディングボックス (OBB): 専用の角度損失関数を導入し、難しい境界の問題を確実に解決します。
- 画像分類: 高速かつ軽量な画像全体のラベリングに適しています。
トレーニング手法#
DAMO-YOLOのトレーニングでは、大規模な「教師」モデルが小規模な「生徒」モデルを学習させる複雑な蒸留プロセスが必要になることがよくあります。この手法は精度をわずかに向上させますが、大量のGPUメモリと長いトレーニング時間が必要です。
一方、YOLO26に必要なメモリは大幅に少なくなっています。MuSGDオプティマイザーを採用したYOLO26は、一般的なコンシューマー向けハードウェアで高速かつ効率的にトレーニングできます。PyTorchベースのUltralytics Python APIを使って、YOLO26モデルを簡単にトレーニングする方法を紹介します。
from ultralytics import YOLO
# ネイティブなエンドツーエンド対応のYOLO26 nanoモデルを初期化します
model = YOLO("yolo26n.pt")
# カスタムデータセットで簡単にトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# 最適化されたNMS不要モデルをエクスポートします
model.export(format="onnx", nms=False)実際の用途#
これらのアーキテクチャのどちらを選ぶかは、最終的にはデプロイ環境によって決まります。
エッジAIとIoTデバイス#
スマート小売カメラ、自動農業モニター、ロボティクスでは、利用できる計算リソースが厳しく制限されています。このような用途には、YOLO26が最適です。CPU推論が43%高速で、完全なNMS不要パイプラインと非常に少ないパラメーター数を備えているため、重要な精度を損なわずに、Raspberry Piなどのエッジデバイス上でスムーズに動作します。
高速製造と品質管理#
高速な製造自動化ラインでは、動きの速いコンベヤーベルト上の欠陥を検出するために、最小限で予測可能なレイテンシが求められます。DAMO-YOLOは特定のGPU構成で十分な性能を発揮できますが、従来のNMS後処理によるレイテンシの変動は、ロボットアクチュエーターの同期を乱す可能性があります。YOLO26はエンドツーエンド方式のため、フレーム処理時間が一貫して予測可能になり、高速な産業用ロボティクスにも確実に統合できます。
ドローンと航空画像#
高高度から小さな対象物を検出するのは、非常に困難です。YOLO26にProgLossとSTALを組み込むことで、小さな物体の認識性能が大幅に向上します。野生動物の追跡やUAVからの交通渋滞の分析などで、YOLO26はDAMO-YOLOを含む従来のアーキテクチャが見逃しがちな、ピクセル面積の小さい物体を安定して識別します。
ユースケースと推奨事項#
YOLO26とDAMO-YOLOのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに関する好みによって決まります。
YOLO26を選ぶ場合#
YOLO26は、次のような用途に適しています。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
DAMO-YOLOを選ぶケース#
DAMO-YOLOは、次の用途に適しています。
- 高スループットの動画分析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上で高FPSの動画ストリームを処理する用途。
- 産業用製造ライン: 組み立てラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャ探索の研究: 自動アーキテクチャ探索 (MAE-NAS) と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響を研究する用途。
結論#
DAMO-YOLOは、特定のハードウェアを対象とするニューラルアーキテクチャ探索の可能性を示す興味深い研究成果ですが、現代のAI実践者にはUltralytics YOLO26が、より優れたバランスの取れたソリューションです。エンドツーエンドのNMS不要アーキテクチャ、大幅に少ないメモリ要件、ハイブリッドMuSGDオプティマイザー、そして丁寧に保守されたエコシステムにより、YOLO26は開発者が最先端のビジョンシステムをこれまで以上に迅速かつ確実に構築・デプロイできるようにします。