DAMO-YOLOとYOLO26の比較#
コンピュータービジョンの分野は、高精度と低レイテンシーの推論を両立するアーキテクチャへの需要に後押しされ、常に進化しています。本比較では、DAMO-YOLOとUltralytics YOLO26の技術的な詳細を掘り下げ、アーキテクチャの革新、トレーニング手法、最適なユースケースを検討します。
エッジデバイスにビジョンモデルをデプロイする場合でも、高スループットのクラウドパイプラインを構築する場合でも、これらのモデルの違いを理解することは、現代のAI開発において十分な情報に基づいてアーキテクチャを決定するために不可欠です。
DAMO-YOLO: 大規模なニューラルアーキテクチャサーチ#
DAMO-YOLOはAlibaba Groupによって開発され、2022年11月23日にリリースされました。Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sunによって設計されたこのモデルは、Neural Architecture Search(NAS)を使用した効率的なアーキテクチャの自動探索に重点を置いています。
原著論文はArXiv論文で確認でき、ソースコードはDAMO-YOLO GitHubリポジトリで確認できます。
主なアーキテクチャ上の特徴#
DAMO-YOLOには、リアルタイム物体検出の限界を押し広げるために設計された、複数の技術的な革新が導入されています。
- MAE-NASバックボーン: DAMO-YOLOは、最大エントロピー誘導型探索を利用して最適なバックボーンを見つけます。このNASアプローチにより、特定のハードウェアにおける検出精度と推移速度を厳密にバランスさせるアーキテクチャが発見されます。
- Efficient RepGFPN: 特徴融合を大幅に向上させる大規模なネック設計で、航空画像に見られるような複雑なシーンの解析に大きな効果を発揮します。
- ZeroHead Design: 最終予測レイヤーの計算量を最小限に抑える、非常にシンプルな検出ヘッドです。
- AlignedOTA and Distillation: DAMO-YOLOは、Aligned Optimal Transport Assignment(AlignedOTA)を使用してラベル割り当ての曖昧さを解消し、堅牢な知識蒸留強化戦略と組み合わせることで、大規模な教師ネットワークを使用して小規模な生徒モデルの精度を向上させます。
Ultralyticsの優位性:YOLO26#
Glenn JocherとJing Qiuによって2026年1月14日にUltralyticsからリリースされたYOLO26は、アクセシブルで高性能なビジョンAIの最高峰を表しています。YOLO11とYOLOv10のレガシーを基盤とするYOLO26は、エッジファーストのデプロイ、マルチタスクの汎用性、および比類のない使いやすさを実現するためにゼロから設計されています。
YOLO26の革新#
Ultralytics YOLO26には、現代のコンピュータービジョンアプリケーションにおける決定的な選択肢となる、画期的な機能が複数導入されています。
- エンドツーエンドのNMS不要設計: YOLO26は、Non-Maximum Suppression(NMS)の後処理をネイティブに排除します。YOLOv10で初めて導入されたこのエンドツーエンドのアプローチにより、デプロイパイプラインが大幅に簡素化され、決定論的で低レイテンシーの推論が実現します。
- CPU推論が最大43%高速: エッジコンピューティング向けにアーキテクチャが最適化されたYOLO26は、エッジデバイスや標準的なCPU上で優れた速度を発揮するため、バッテリー駆動のIoTデバイスに最適です。
- MuSGD Optimizer: LLMのトレーニング(Moonshot AIのKimi K2など)に着想を得て、YOLO26はSGDとMuonを組み合わせたハイブリッド手法を取り入れています。これにより、大規模言語モデルのトレーニングにおける安定性がコンピュータービジョンにもたらされ、より高速で信頼性の高い収束を実現します。
- DFLの削除: Distribution Focal Lossを削除することでモデルグラフが簡素化され、ONNXやTensorRTなどの形式へスムーズにエクスポートできます。
- ProgLoss + STAL: これらの高度な損失関数により、小さな物体の認識が大幅に向上します。これは、ドローン運用や農業において重要な機能です。
YOLO26には複数のモダリティにわたる専門的な改良が含まれています。インスタンスセグメンテーション向けのマルチスケールproto、姿勢推定向けのResidual Log-Likelihood Estimation(RLE)、Oriented Bounding Box(OBB)検出における境界の問題を軽減する高度な角度損失などです。
性能比較#
これらのモデルを評価する際には、精度(mAP)と計算効率(速度/FLOPs)のバランスが最も重要です。以下の表では、業界標準のCOCOデータセットを使用して、これらのモデルを比較しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
上記のとおり、YOLO26は一貫してより高い精度を、はるかに少ないパラメーター数とFLOPsで実現するため、トレーニングと推論の両方において、より効率的なアーキテクチャとなっています。
トレーニングの効率と使いやすさ#
DAMO-YOLOの複雑さ#
DAMO-YOLOは高い競争力を持つ精度を実現しますが、そのトレーニング手法は非常に複雑です。Neural Architecture Search(NAS)と大規模な知識蒸留に依存するため、カスタムモデルのトレーニングには多大なGPUリソースと専門知識が必要になることがよくあります。大規模な教師モデルをトレーニングして小規模な生徒モデルへ蒸留するこの多段階プロセスは、カスタムデータセットで迅速に反復したいアジャイルなエンジニアリングチームのボトルネックになる可能性があります。
合理化されたUltralyticsのエクスペリエンス#
一方、Ultralytics YOLO26は「zero-to-hero」の使いやすさを実現するように設計されています。トレーニング、検証、デプロイのライフサイクル全体が、クリーンで統一されたPython APIとCLIの背後に抽象化されています。さらに、YOLO26はRT-DETRのようなTransformerベースのモデルと比較して、トレーニング中に必要なCUDAメモリが大幅に少ないため、研究者はコンシューマー向けハードウェアで最先端のモデルをトレーニングできます。
以下は、Ultralytics SDKを使用してYOLO26モデルをトレーニング、評価、エクスポートする方法がいかに簡単かを示す例です。
from ultralytics import YOLO
# Load the latest YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Evaluate the model's performance on the validation set
metrics = model.val()
# Run inference on a sample image
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# Export the model to ONNX format for deployment
model.export(format="onnx")コードを書かない環境を好むチーム向けに、Ultralytics Platformは、データセットのアノテーション、クラウドトレーニング、シームレスなデプロイのための直感的なインターフェースを提供します。
実世界での用途#
適切なアーキテクチャの選択は、対象となるデプロイ環境とハードウェアの制約に大きく左右されます。
産業用品質管理#
高速な製造自動化では、DAMO-YOLOは専用GPUハードウェア上で優れた性能を発揮できます。ただし、現代の組立ラインにはYOLO26が適しています。そのエンドツーエンドのNMS不要設計により、決定論的でジッターのないレイテンシーが実現します。これは、視覚データとロボットアクチュエーターをリアルタイムで同期する際に不可欠です。
エッジAIとモバイルデバイス#
バッテリー駆動デバイスにコンピュータービジョンをデプロイするには、極めて高い効率が必要です。DAMO-YOLOが特定のRepGFPNネックに依存する一方で、YOLO26n(Nano)はエッジコンピューティング向けに特化して最適化されています。DFLの削除と43%高速なCPU推論により、スマートカメラ、モバイルアプリケーション、セキュリティアラームシステムに最適なソリューションとなっています。
マルチタスクプロジェクトの要件#
物体検出だけでなく、姿勢推定を使用したスポーツにおける選手の動作分析や、インスタンスセグメンテーションによる正確なピクセル境界の抽出などが必要なプロジェクトでは、YOLO26が単一の統合されたコードベース内で、これらすべてのタスクをネイティブにサポートします。DAMO-YOLOはバウンディングボックス検出に厳密に限定されています。
ユースケースと推奨事項#
DAMO-YOLOとYOLO26のどちらを選択するかは、具体的なプロジェクト要件、デプロイの制約、エコシステムに関する好みによって決まります。
DAMO-YOLOを選択する場合#
DAMO-YOLOが適しているのは、次のような場合です。
- 高スループットの動画分析: バッチサイズ1のスループットが主要な指標となる、固定されたNVIDIA GPUインフラストラクチャ上での高FPS動画ストリーム処理。
- 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャサーチ研究: 自動アーキテクチャ探索(MAE-NAS)と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響の研究。
YOLO26を選ぶタイミング#
YOLO26は次の用途に推奨されます:
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
まとめ#
両方のアーキテクチャは、ディープラーニング分野における重要な成果を示しています。DAMO-YOLOは、特定のハードウェアベンチマーク向けに調整されたNeural Architecture Searchと蒸留技術の力を垣間見せる、興味深いモデルです。
しかし、本番環境に対応するソリューションを求める開発者、研究者、および企業にとって、Ultralytics YOLO26は優れた選択肢として際立っています。エンドツーエンドのNMSフリー設計、大幅なCPU推移の向上、マルチタスクの汎用性、および十分に保守されているUltralyticsエコシステムへの統合の組み合わせにより、YOLO26は今日の現実世界のコンピュータビジョンにおける課題を解決するための最も堅牢で実用的なツールとなっています。
Ultralyticsエコシステム内の他のモデルに関心があるユーザー向けに、YOLO11、YOLOv8、TransformerベースのRT-DETRについて包括的なドキュメントを利用できます。