YOLO11とDAMO-YOLOの比較#
最適なアーキテクチャの選択は、あらゆるコンピュータービジョンプロジェクトにおける重要なステップです。この技術ガイドでは、強力な2つの物体検出モデルであるUltralytics YOLO11とDAMO-YOLOを包括的に比較します。アーキテクチャ上の革新、学習方式、実環境での適用性を詳しく解説し、デプロイのニーズに最適なツールを選べるよう支援します。
モデルの概要#
Ultralytics YOLO11#
Ultralyticsのチームが開発したYOLO11は、YOLOファミリーを高度に洗練させたモデルで、精度と効率の両方を大幅に最適化しています。データセット管理からエッジデプロイまでを網羅する、統合された本番環境対応のエコシステムを求める研究者やエンジニア向けに設計されています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- ドキュメント: https://docs.ultralytics.com/models/yolo11
YOLO11の強みは汎用性です。多くの従来モデルがバウンディングボックスのみに重点を置く一方で、YOLO11は物体検出、インスタンスセグメンテーション、画像分類、姿勢推定をネイティブにサポートしています。このマルチタスク機能により、開発者は保守性の高い単一のフレームワーク上にビジョンAIパイプラインを統合できます。
DAMO-YOLO#
DAMO-YOLOはAlibaba Groupの研究者によって開発されました。Neural Architecture Search(NAS)を活用し、GPUやその他のアクセラレーターでのリアルタイム推論に特化した、非常に効率的なバックボーンを探索します。
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
- ドキュメント: https://github.com/tinyvision/DAMO-YOLO/blob/master/README.md
DAMO-YOLOの中核となる思想は、再パラメーター化と自動探索です。MAE-NAS(最大エントロピーNeural Architecture Search)を活用し、著者らは専用ハードウェアでの推論速度を大幅に高めるカスタムバックボーンを設計しました。また、レイテンシを最小限に抑えるため、高度に最適化されたEfficient RepGFPNというネックと、簡素化されたZeroHead構造を採用しています。
YOLO11とDAMO-YOLOを比較する際は、より新しいUltralytics YOLO26もご確認ください。ネイティブのエンドツーエンドNMSフリー推論を導入し、CPU速度を最大43%向上させています。YOLOXやYOLOv8を含む比較もご覧いただけます。
性能とアーキテクチャの比較#
エッジAIアプリケーションをデプロイする際は、性能のトレードオフを理解することが重要です。以下の表では、平均適合率(mAP)、レイテンシ、計算規模などの主要指標を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
アーキテクチャの詳細#
YOLO11は、パラメーター数と表現能力のバランスを巧みに取った、効率的な専用バックボーンを採用しています。幅広いハードウェアで優れた動作をするよう最適化されており、学習時と推論時の両方でCUDAメモリの使用量を最小限に抑えながら、ネイティブに高い性能を発揮します。そのため、一般的なコンシューマー向けハードウェアやリソースに制約のあるIoTデバイスに最適です。
一方、DAMO-YOLOのMAE-NASで生成されたバックボーンは、高スループットのGPU環境向けに細かく調整されています。Efficient RepGFPN(汎用特徴ピラミッドネットワーク)は複数のスケールを積極的に統合します。ただし、再パラメーター化によって推論は高速化する一方、ハードウェアスタックがこれらの演算を適切にサポートしていない場合、デプロイプロセスが複雑になることがあります。
使いやすさと学習効率#
開発にかかる時間を考慮すると、モデルの使いやすさはベンチマークの数値と同じくらい重要です。
YOLO11は、開発者が使いやすいことを重視して構築されています。包括的なultralyticsパッケージにより、データセットの解析、拡張、ハイパーパラメーター調整といった複雑な処理が抽象化されます。ONNX、TensorRT、OpenVINOなどの本番環境向け形式へのモデルのエクスポートは、1つのコマンドで実行できます。
from ultralytics import YOLO
# YOLO11の物体検出モデルを初期化します
model = YOLO("yolo11s.pt")
# COCO8で混合精度を使用してモデルを学習します
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 学習済みモデルをTensorRTにエクスポートしてエッジにデプロイします
model.export(format="engine", device=0)学術研究を中心に開発されたDAMO-YOLOは、学習コストが高くなる傾向があります。最高精度を達成するには、複雑な知識蒸留パイプラインが必要になることが多く、まず大規模な「教師」ネットワークを学習させ、その知識を小規模な「生徒」ネットワークに引き継がなければなりません。そのため、Ultralyticsモデルの軽量な学習ループと比べて、必要なGPU計算リソースのオーバーヘッドと学習時間が大幅に増加します。
ユースケースと推奨事項#
YOLO11とDAMO-YOLOのどちらを選ぶかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムの好みによって異なります。
YOLO11を選ぶ場合#
YOLO11は、次のような用途に適しています。
- 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最優先となる、Raspberry PiやNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
- マルチタスクのビジョンアプリケーション: 単一の統合フレームワークで、検出、セグメンテーション、姿勢推定、OBBを必要とするプロジェクト。
- 迅速なプロトタイピングとデプロイメント: 効率化されたUltralytics Python APIを使って、データ収集から本番環境への移行を迅速に進めたいチーム。
DAMO-YOLOを選ぶケース#
DAMO-YOLOは、次の用途に適しています。
- 高スループットの動画分析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上で高FPSの動画ストリームを処理する用途。
- 産業用製造ライン: 組み立てラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャ探索の研究: 自動アーキテクチャ探索 (MAE-NAS) と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響を研究する用途。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
実世界でのアプリケーションとユースケース#
自律システムとドローン#
航空画像やUAVへのデプロイでは、YOLO11が非常に優れた性能バランスを提供します。小物体検出はドローン分析における大きな課題ですが、YOLO11は標準でさまざまなスケールに対応します。さらに、メモリ要件が少ないため、YOLO11 NanoやSmallの各バリアントを、ドローンに搭載された軽量なエッジCPUやNPU上で直接実行できます。
産業オートメーションと品質管理#
スマートファクトリーでは、レイテンシが最も重要です。DAMO-YOLOはRepGFPNネックにより高性能なサーバー向けGPUで堅牢な推論速度を実現しますが、統合方法が柔軟でないため、過剰な構成となる場合があります。YOLO11は、シンプルなトラッキングAPIを備え、欠陥の角度付き境界の認識が必要な場合には、純粋な検出から回転バウンディングボックス(OBB)タスクへシームレスに切り替えられるため、自動品質管理において優れた代替モデルとなることがよくあります。
スマートヘルスケアと医用画像#
医用画像データセットは比較的小規模なことが多く、過学習の回避が課題になります。保守性の高いエコシステムを備えるUltralyticsが提供する積極的なデータ拡張技術と標準的な転移学習パイプラインは、医療従事者や開発者が正確な腫瘍検出モデルを確実にデプロイするうえで役立ちます。大規模なコミュニティによるサポートにより、医療などの複雑な分野で発生する問題も迅速に解決できます。
新しいアプリケーションをゼロから構築する場合は、YOLO26をご検討ください。2026年初頭にリリースされたYOLO26は、MuSGDオプティマイザーとProgLoss関数を採用し、微小物体に対する優れた精度と、ネイティブのエンドツーエンドNMSフリー推論モード(nms=False)を実現します。
DAMO-YOLOはNeural Architecture Searchの強力さを示すモデルですが、実環境のコンピュータービジョンタスクでは、迅速なデプロイ、開発のしやすさ、優れたマルチタスク性能を重視するYOLO11とUltralyticsの幅広いモデル群が、引き続き最有力の選択肢です。