DAMO-YOLOとYOLO26#
コンピュータービジョンの分野は、高精度と低レイテンシの推論を両立するアーキテクチャへの需要に牽引され、絶えず進化しています。この比較では、DAMO-YOLOとUltralytics YOLO26の技術的な詳細に踏み込み、アーキテクチャの革新、トレーニング手法、最適なユースケースを検討します。
エッジデバイスへのビジョンモデルのデプロイから高スループットのクラウドパイプラインの構築まで、現代のAI開発で適切なアーキテクチャを選択するには、これらのモデルの違いを理解することが重要です。
DAMO-YOLO:大規模なニューラルアーキテクチャ探索#
Alibaba Groupが開発したDAMO-YOLOは、2022年11月23日にリリースされました。Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sunが設計したこのモデルは、ニューラルアーキテクチャ探索(NAS)を活用した効率的なアーキテクチャの自動発見に重点を置いています。
ArXiv論文で原著の研究を確認するか、DAMO-YOLO GitHubリポジトリでソースコードをご覧ください。
主なアーキテクチャ上の特徴#
DAMO-YOLOは、リアルタイム物体検出の限界を押し広げるために設計された、複数の技術革新を導入しています:
- MAE-NASバックボーン: DAMO-YOLOは、最大エントロピーに基づく探索を利用して最適なバックボーンを見つけます。このNASアプローチでは、特定のハードウェア上で検出精度と推論速度を厳密に両立するアーキテクチャを発見します。
- Efficient RepGFPN: 特徴融合を大幅に向上させる大規模なネック構造です。航空画像に見られるような複雑なシーンの分析に特に効果的です。
- ZeroHeadデザイン: 最終的な予測レイヤーの計算量を最小限に抑える、シンプルな検出ヘッドです。
- AlignedOTAと蒸留: DAMO-YOLOは、ラベル割り当ての曖昧さを解消するためにAligned Optimal Transport Assignment(AlignedOTA)を採用しています。さらに、強力な知識蒸留手法を組み合わせ、大規模な教師ネットワークを使って小規模な生徒モデルの精度を向上させます。
Ultralyticsの強み: YOLO26#
2026年1月14日にGlenn JocherとJing QiuによってUltralyticsからリリースされたYOLO26は、高性能なビジョンAIを誰もが利用できる形にした最高峰のモデルです。YOLO11とYOLOv10の実績を基盤に、エッジ優先のデプロイ、マルチタスクへの対応、卓越した使いやすさを念頭に一から設計されています。
YOLO26の革新#
Ultralytics YOLO26は、現代のコンピュータービジョンアプリケーションに最適なモデルとなる、画期的な機能を複数導入しています:
- エンドツーエンドのNMSフリーデザイン: YOLO26のネイティブな1対1ヘッド(
nms=False)は、非最大抑制(NMS)による後処理を不要にします。YOLOv10で初めて導入されたこのエンドツーエンド方式は、デプロイパイプラインを大幅に簡素化し、決定論的で低レイテンシの推論を実現します。 - CPU推論が最大43%高速: エッジコンピューティング向けにアーキテクチャが最適化されたYOLO26は、エッジデバイスや一般的なCPUで優れた速度を発揮し、バッテリー駆動のIoTデバイスに最適です。
- MuSGDオプティマイザー: LLMトレーニング(Moonshot AIのKimi K2など)に着想を得たYOLO26は、SGDとMuonを組み合わせたハイブリッド方式を取り入れています。これにより、大規模言語モデルのトレーニングの安定性をコンピュータービジョンにもたらし、より高速で信頼性の高い収束を実現します。
- DFLの除去: Distribution Focal Lossを除去することでモデルグラフが簡素化され、ONNXやTensorRTなどの形式へスムーズにエクスポートできます。
- ProgLoss + STAL: これらの高度な損失関数は、小物体認識を大幅に向上させます。これは、ドローン運用や農業に欠かせない機能です。
YOLO26は、複数のモダリティに特化した改良を備えています。インスタンスセグメンテーション向けのマルチスケールプロト、姿勢推定向けのResidual Log-Likelihood Estimation(RLE)、回転バウンディングボックス(OBB)検出の境界問題を軽減する高度な角度損失です。
パフォーマンス比較#
これらのモデルを評価する際は、精度(mAP)と計算効率(速度/FLOPs)のバランスが非常に重要です。以下の表では、業界標準のCOCOデータセットを用いて各モデルを比較しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
上記のとおり、YOLO26は一貫して、はるかに少ないパラメーター数とFLOPsで高い精度を実現し、トレーニングと推論の両方でより効率的なアーキテクチャを提供します。
トレーニング効率と使いやすさ#
DAMO-YOLOの複雑さ#
DAMO-YOLOは高い競争力を持つ精度を実現しますが、そのトレーニング手法は非常に複雑です。ニューラルアーキテクチャ探索(NAS)と大規模な知識蒸留に依存するため、カスタムモデルのトレーニングには、多くの場合、相当なGPUリソースと専門知識が必要です。巨大な教師モデルをトレーニングして小規模な生徒モデルに知識を蒸留するこの多段階プロセスは、カスタムデータセットで迅速に反復しようとする機動的なエンジニアリングチームのボトルネックになる場合があります。
効率化されたUltralyticsの体験#
一方、Ultralytics YOLO26は、初心者から上級者まで使いやすいように設計されています。トレーニング、検証、デプロイのライフサイクル全体が、シンプルで統一されたPython APIとCLIによって抽象化されています。さらに、YOLO26は、トレーニング時に必要なCUDAメモリが、RT-DETRのようなTransformerベースのモデルと比べて大幅に少ないため、研究者は一般消費者向けハードウェアで最先端のモデルをトレーニングできます。
Ultralytics SDKを使ってYOLO26モデルを簡単にトレーニング、評価、エクスポートする例を紹介します:
from ultralytics import YOLO
# 最新のYOLO26 nanoモデルを読み込みます
model = YOLO("yolo26n.pt")
# COCO8データセットでモデルを50エポックトレーニングする
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# 検証セットでモデルのパフォーマンスを評価
metrics = model.val()
# サンプル画像で推論を実行する
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# デプロイ用にモデルをONNX形式へエクスポートします
model.export(format="onnx")ノーコード環境を好むチームには、Ultralytics Platformが、データセットアノテーション、クラウドトレーニング、シームレスなデプロイのための直感的なインターフェースを提供します。
実際の用途#
適切なアーキテクチャは、主にターゲットのデプロイ環境とハードウェアの制約によって決まります。
産業用品質管理#
高速な製造自動化では、DAMO-YOLOは専用GPUハードウェア上で優れた性能を発揮します。しかし、現代の組み立てラインではYOLO26が適しています。エンドツーエンドのNMSフリーデザインにより、ジッターのない決定論的なレイテンシを実現します。これは、視覚データとロボットアクチュエーターをリアルタイムで同期させるうえで不可欠です。
エッジAIとモバイルデバイス#
バッテリー駆動デバイスでコンピュータービジョンを実行するには、極めて高い効率が必要です。DAMO-YOLOが特定のRepGFPNネックに依存する一方、YOLO26n(Nano)はエッジコンピューティング向けに特化して最適化されています。DFLの除去とCPU推論の43%高速化により、スマートカメラ、モバイルアプリケーション、セキュリティ警報システムに最適なソリューションです。
マルチタスクのプロジェクト要件#
物体検出に加えて、スポーツで姿勢推定を用いて選手の動きを分析したり、インスタンスセグメンテーションを使ってピクセル単位の正確な境界を抽出したりする必要がある場合、YOLO26は単一の統合されたコードベースでこれらすべてのタスクをネイティブにサポートします。DAMO-YOLOはバウンディングボックス検出に限定されています。
ユースケースと推奨事項#
DAMO-YOLOとYOLO26のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムの好みによって異なります。
DAMO-YOLOを選ぶケース#
DAMO-YOLOが適しているケース:
- 高スループットの動画分析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上で高FPSの動画ストリームを処理する用途。
- 産業用製造ライン: 組み立てラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャ探索の研究: 自動アーキテクチャ探索 (MAE-NAS) と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響を研究する用途。
YOLO26を選ぶ場合#
YOLO26は、次の用途に推奨されます:
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
結論#
どちらのアーキテクチャも、ディープラーニング分野における大きな成果です。DAMO-YOLOは、特定のハードウェアベンチマークに合わせたニューラルアーキテクチャ探索と蒸留技術の可能性を興味深い形で示しています。
しかし、本番環境ですぐに使えるソリューションを求める開発者、研究者、企業には、Ultralytics YOLO26が優れた選択肢です。エンドツーエンドのNMSフリーデザイン、CPU推論の大幅な高速化、マルチタスクへの対応、適切に保守されたUltralyticsエコシステムとの統合を兼ね備え、今日の現実世界のコンピュータービジョン課題を解決するための、最も堅牢で実用的なツールとなっています。
Ultralyticsエコシステムの他のモデルに関心がある方は、YOLO11、YOLOv8、TransformerベースのRT-DETRに関する包括的なドキュメントもご利用いただけます。