DAMO-YOLOとYOLO11の比較#
次のコンピュータービジョンプロジェクトでリアルタイム物体検出アーキテクチャを選ぶ際、主要モデル間の違いを理解することが重要です。この包括的なガイドでは、DAMO-YOLOとUltralytics YOLO11を詳細に技術分析し、それぞれのアーキテクチャ、パフォーマンス指標、トレーニング手法、実環境での最適なデプロイシナリオを比較します。
DAMO-YOLOの詳細:
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv:2211.15444v2
- GitHub:tinyvision/DAMO-YOLO
- ドキュメント: DAMO-YOLOのドキュメント
YOLO11の詳細:
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: ultralytics/ultralytics
- ドキュメント: YOLO11ドキュメント
アーキテクチャ設計の理念#
物体検出モデルの基盤となるアーキテクチャは、推論速度、精度、さまざまなハードウェア環境への適応性を左右します。
DAMO-YOLOはいくつかの学術的な革新を取り入れており、バックボーンの自動設計にニューラルアーキテクチャ探索(NAS)を多用しています。効率的なRepGFPN(再パラメーター化汎用特徴ピラミッドネットワーク)を利用して特徴融合を強化し、従来のアーキテクチャでよく見られる大規模な予測ヘッドを大幅に縮小するZeroHead設計を採用しています。このNAS主導のアプローチにより、選定されたGPUでは特定の効率性を実現できますが、結果として得られるアーキテクチャは、多様なエッジデバイス全体でシームレスに汎化するために必要な柔軟性を欠く場合があります。
一方、YOLO11は長年にわたる基礎研究を基盤として、高度に最適化された手設計のアーキテクチャを実現しています。簡素化されたバックボーンと、冗長な計算を削減する効率性の高いネックに重点を置いています。YOLO11の主な利点の1つは、洗練されたパラメーター効率です。RT-DETRのようなTransformerベースのモデルで一般的な大量のVRAMを必要とせずに、高い特徴表現能力を実現します。そのためYOLO11は非常に汎用性が高く、一般消費者向けGPU、モバイルデバイス、専用エッジアクセラレーターでスムーズに動作します。
パフォーマンスとメトリクス#
パフォーマンスを評価するには、全体的な精度だけでなく、速度、モデルサイズ、計算負荷(FLOPs)のバランスも考慮する必要があります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
表が示すように、YOLO11は非常に優れたパフォーマンスバランスを実現しています。たとえば、YOLO11sバリアントは、DAMO-YOLOsよりも高い精度を達成しながら、パラメーター数を大幅に抑えています。メモリ要件の削減は、デプロイコストの低減とエッジデバイスでの機敏な動作に直結します。
トレーニング手法と使いやすさ#
開発者が最も多くの時間を費やすのはトレーニングパイプラインであるため、トレーニング効率が非常に重要です。
DAMO-YOLOは、知識蒸留に大きく依存する多段階トレーニングプロセスを採用しています。ラベル割り当てにはAlignedOTA(最適輸送割り当て)を利用し、小さな「生徒」モデルに知識を蒸留するために、より大きな「教師」モデルのトレーニングを必要とすることがよくあります。この手法では、最適な収束を実現するために必要なCUDAメモリの使用量と総計算時間が大幅に増加します。
対照的に、Ultralyticsエコシステムではモデルのトレーニングに伴う複雑さが抽象化されています。YOLO11は非常に使いやすく設計されており、簡潔なPython APIと包括的なCLIインターフェースを備え、エンジニアは1つのコマンドでカスタムデータセットのトレーニングを開始できます。トレーニングパイプラインはもともとリソース効率に優れ、メモリ使用量の急増を抑えるため、大規模なモデルでも標準的なハードウェアでトレーニングできます。
Ultralyticsモデルのトレーニングにボイラープレートコードは一切必要ありません。組み込みのデータ読み込み、拡張、損失計算の各パイプラインは、すぐに使える状態で完全に最適化されています。
Ultralyticsモデルのトレーニングとデプロイがいかに簡単かを、簡単な例で紹介します。
from ultralytics import YOLO
# 事前トレーニング済みのYOLO11 smallモデルを読み込みます
model = YOLO("yolo11s.pt")
# カスタムデータセットでモデルを簡単にトレーニングします
model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0)
# トレーニング済みモデルをONNXにエクスポートし、シームレスにデプロイします
model.export(format="onnx")実環境での用途と汎用性#
これらのアーキテクチャのどちらを選ぶかは、多くの場合、デプロイ環境で求められるタスクの範囲によって決まります。
DAMO-YOLOの適用領域#
DAMO-YOLOは物体検出専用のフレームワークです。再パラメーター化を研究したり、特定のニューラルアーキテクチャ探索実験を再現したりするチームがいる学術研究環境で優れた性能を発揮します。また、特定のGPUアクセラレーターがNASで生成されたバックボーンに完全に適合する、制約の厳しい産業環境にもデプロイできます。
Ultralyticsの強み#
YOLO11を含むUltralyticsモデルは、優れた汎用性と十分にメンテナンスされたエコシステムにより、実際の商用アプリケーションで強みを発揮します。DAMO-YOLOとは異なり、Ultralyticsフレームワークは複数のタスクを標準でサポートしています。医用画像のインスタンスセグメンテーションから、スポーツの生体力学的分析における姿勢推定まで、統一された単一のコードベースですべてに対応できます。
YOLO11を活用している業界には、次のようなものがあります。
- スマート農業: 物体検出を活用して作物の健康状態を監視し、農業機械による収穫を自動化します。
- 小売分析: スマート監視を導入して顧客の流れを分析し、在庫管理を自動化します。
- 物流とサプライチェーン: 高速で移動するコンベアベルト上で、回転バウンディングボックス(OBB)を用いてバーコードや荷物を高速に検出します。
ユースケースと推奨事項#
DAMO-YOLOとYOLO11のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに関する好みによって決まります。
DAMO-YOLOを選ぶケース#
DAMO-YOLOが適しているケース:
- 高スループットの動画分析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上で高FPSの動画ストリームを処理する用途。
- 産業用製造ライン: 組み立てラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャ探索の研究: 自動アーキテクチャ探索 (MAE-NAS) と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響を研究する用途。
YOLO11を選ぶ場合#
YOLO11は、次の用途に推奨されます:
- 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最優先となる、Raspberry PiやNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
- マルチタスクのビジョンアプリケーション: 単一の統合フレームワークで、検出、セグメンテーション、姿勢推定、OBBを必要とするプロジェクト。
- 迅速なプロトタイピングとデプロイメント: 効率化されたUltralytics Python APIを使って、データ収集から本番環境への移行を迅速に進めたいチーム。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
次世代モデル:YOLO26の紹介#
YOLO11は引き続き強力で信頼性の高い選択肢ですが、コンピュータービジョンの状況は急速に変化しています。新しいプロジェクトを始める開発者には、最新のYOLO26モデルが最先端の性能を提供します。
2026年1月にリリースされたYOLO26は、いくつかの画期的な進歩をもたらします。
- エンドツーエンドのNMSフリー設計: オプションの1対1ヘッド(
nms=False)を備えたYOLO26は、Non-Maximum Suppressionの後処理を省略し、より高速で決定論的な推論時間を実現するとともに、デプロイパイプラインを大幅に簡素化します。 - CPU推論が最大43%高速: Distribution Focal Loss(DFL)を取り除いたことで、専用GPUを搭載しないエッジデバイスや低消費電力デバイスに特に適したモデルになっています。
- MuSGDオプティマイザー: Moonshot AIに着想を得たLLMトレーニングの革新を取り入れたハイブリッドオプティマイザーにより、トレーニング中の安定した高速な収束を実現します。
- 高度な損失関数: ProgLoss + STALを活用するYOLO26は、小物体認識を大幅に向上させます。これは航空画像やロボティクスに不可欠です。
結論#
DAMO-YOLOとYOLO11はどちらも、高速かつ高精度なコンピュータービジョンの発展に大きく貢献してきました。DAMO-YOLOはアーキテクチャ探索と蒸留に関する興味深い学術的知見をもたらしますが、Ultralytics YOLO11(および画期的なYOLO26)は、優れた開発者体験を提供します。
メモリ要件の低さ、充実したドキュメント、マルチタスク機能、強力なUltralytics Platformとの統合により、堅牢でスケーラブルなAIソリューションの構築を目指す研究者や企業のエンジニアには、引き続きUltralyticsモデルを最もおすすめします。ほかの高度なアーキテクチャを検討している場合は、YOLO26とRT-DETRの比較から、Transformerベースの代替モデルに関する知見も得られます。