YOLOv5とDAMO-YOLOの比較#
リアルタイムコンピュータービジョンの分野は絶えず進化し、研究者やエンジニアは精度、速度、使いやすさの理想的なバランスを追求しています。この進化を形作ってきた代表的なモデルが、Ultralytics YOLOv5とAlibabaのDAMO-YOLOです。
このガイドでは、アーキテクチャ、性能指標、トレーニング手法を詳しく技術的に分析し、次のデプロイに適したモデル選びを支援します。
モデルの背景#
技術的な詳細に入る前に、これらの影響力あるビジョンモデルそれぞれの起源と主な設計思想を理解することが重要です。
Ultralytics YOLOv5#
Glenn JocherとUltralyticsのチームが開発したYOLOv5は、リリース以来、業界標準となっています。PyTorchフレームワーク上にネイティブに構築され、すぐに使えるシンプルな開発者体験と堅牢なデプロイ機能を重視しました。
- 著者: Glenn Jocher
- 組織: Ultralytics
- 日付: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- ドキュメント: Ultralytics YOLOv5ドキュメント
DAMO-YOLO#
Alibaba Groupの研究者によって開発されたDAMO-YOLOは、Neural Architecture Search(NAS)と高度な蒸留技術を重視しています。ハードウェア固有の性能の理論的限界を押し広げ、極めて高度なチューニングが必要な研究やエッジ環境に適しています。
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
アーキテクチャの革新#
どちらのモデルも独自の構造コンセプトを活用してリアルタイム性能を実現していますが、アプローチには大きな違いがあります。
YOLOv5:安定性と汎用性#
YOLOv5は、改良版CSP(Cross Stage Partial)バックボーンとPANet(Path Aggregation Network)ネックを組み合わせています。この構造は非常に効率的で、トレーニング時と推論時のCUDAメモリ使用量を抑えます。
YOLOv5の最大の強みの一つは、幅広いタスクへの対応力です。バウンディングボックス予測に加えて、画像セグメンテーションと画像分類に特化したアーキテクチャも提供しており、開発者は統一されたフレームワークを基盤にビジョンパイプラインを標準化できます。
DAMO-YOLO:自動アーキテクチャ探索#
DAMO-YOLOの中核となる革新は、MAE-NAS Backboneです。最大エントロピーに基づく探索を用いて、Alibabaのチームは検出精度と推論速度のバランスを動的に調整するバックボーンを発見しました。
さらに、複雑なスケール変動がよく見られる衛星画像解析に特に有効な、特徴融合を向上させるEfficient RepGFPNネックを備えています。ZeroHead設計は最終的な予測レイヤーを簡素化してレイテンシを低減しますが、この複雑な構造生成によってアーキテクチャが硬直化し、カスタムアプリケーション向けの変更が難しくなる場合があります。
Transformerベースのアーキテクチャは、VRAM消費量が多くなりがちです。YOLOv5とDAMO-YOLOはいずれも効率的な畳み込み設計を採用してメモリフットプリントを抑えていますが、Ultralyticsのモデルはコンシューマー向けGPU向けに特に最適化されており、個人研究者やスタートアップでも利用しやすくなっています。
パフォーマンスとメトリクス#
リアルタイム物体検出器を評価するには、mAP(平均適合率)、推論速度、モデルサイズの各パラメーターを総合的に確認する必要があります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
DAMO-YOLOは、特定のパラメーター数で非常に競争力のあるmAPスコアを達成しますが、YOLOv5は一貫して優れたTensorRT速度を示し、ナノおよびスモール構成ではパラメーター数も非常に少なくなっています。この性能バランスにより、YOLOv5は多様なエッジデプロイ環境で効率的に動作します。
トレーニング効率とエコシステム#
モデルの理論上の精度は、実際に導入できて初めて価値を発揮します。この点で、両モデルには大きな違いがあります。
蒸留の複雑さ#
DAMO-YOLOは多段階のトレーニング手法に大きく依存します。AlignedOTAによるラベル割り当てと、教師・生徒型の知識蒸留技術を組み合わせています。これにより生徒モデルの性能を最大限に引き出せますが、最初に大規模な教師モデルをトレーニングする必要があります。そのため、計算時間、エネルギーコスト、必要なハードウェアが大幅に増加し、機動性を重視するMLチームのボトルネックとなる可能性があります。
Ultralyticsの強み:使いやすさ#
一方、Ultralyticsのエコシステムは、直感的なAPIとトレーニング効率で世界的に知られています。活発な開発と大規模なオープンソースコミュニティに支えられ、開発者はモデルのトレーニング、検証、デプロイをシームレスに実行できます。
from ultralytics import YOLO
# 事前トレーニング済みのYOLOv5モデルを読み込みます
model = YOLO("yolov5su.pt") # YOLOv5u: ultralyticsパッケージ向けのアンカーフリーYOLOv5重み
# カスタムデータセットで簡単にトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# デプロイ用にONNX形式へエクスポートします
model.export(format="onnx")Ultralyticsは、Weights & BiasesやComet MLなどのツールを使った実験トラッキングも標準でサポートし、スムーズなワークフローを実現します。
実際のユースケース#
- YOLOv5は、変化の速い本番環境で優れた性能を発揮します。エクスポートが簡単なため、スマートリテール分析、高速な製造ラインでの欠陥検出、CoreMLを介したモバイルアプリケーションへの統合に最適です。
- DAMO-YOLOは、厳密な学術ベンチマークや、特定の固定ハードウェア向けにmAPをわずかでも改善することを目指して、長時間の蒸留トレーニングを実行できる豊富な計算リソースがある環境に適しています。
ユースケースと推奨事項#
YOLOv5とDAMO-YOLOのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに関する好みによって異なります。
YOLOv5を選ぶ場合#
YOLOv5は、次のような場合に適しています。
- 実績のある本番システム: YOLOv5の長年にわたる安定性の実績、充実したドキュメント、幅広いコミュニティサポートが重視される既存のデプロイ環境です。
- リソースが限られたトレーニング: GPUリソースが限られており、YOLOv5の効率的なトレーニングパイプラインと低いメモリ要件が有利となる環境です。
- 幅広いエクスポート形式への対応: ONNX、TensorRT、CoreML、LiteRTなど、多様な形式でのデプロイが必要なプロジェクトです。
DAMO-YOLOを選ぶケース#
DAMO-YOLOは、次の用途に適しています。
- 高スループットの動画分析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上で高FPSの動画ストリームを処理する用途。
- 産業用製造ライン: 組み立てラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャ探索の研究: 自動アーキテクチャ探索 (MAE-NAS) と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響を研究する用途。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
次世代への進化:YOLO26#
新しいプロジェクトを始める場合は、将来を見据えた選択を強くおすすめします。Ultralytics YOLO26は、YOLOv5の優れた基盤を発展させ、ビジョンAIの最先端を再定義する革新的な進歩を取り入れています。
幅広く高い評価を受けてリリースされたYOLO26は、ネイティブなエンドツーエンドモデルです。エンドツーエンドのNMSフリーデザイン(nms=False)を採用し、Non-Maximum Suppressionの後処理を省くことで、デプロイを大幅に高速化・簡素化します。
YOLO26の主な革新点は次のとおりです。
- MuSGD Optimizer: LLMトレーニングにおける革新に着想を得たSGDとMuonのハイブリッドで、非常に安定したトレーニングと迅速な収束を実現します。
- CPU推論を最大43%高速化: エッジコンピューティング向けに高度に最適化されており、専用GPUを搭載しないIoTデバイスに最適です。
- ProgLoss + STAL: 高度な損失関数により小物体の認識性能が大幅に向上します。これはドローンによる航空画像やロボティクスに不可欠です。
- タスク固有の改良: 回転バウンディングボックス(OBB)向けの角度専用損失から、高精度な姿勢推定向けのResidual Log-Likelihood Estimation(RLE)まで、YOLO26は複雑な領域にも容易に対応します。
結論#
YOLOv5とDAMO-YOLOはどちらも、物体検出の歴史に確かな足跡を残しています。DAMO-YOLOは、Neural Architecture Searchと蒸留に関する興味深い研究例です。しかし、適切に保守されたエコシステム、使いやすさ、本番環境への迅速な移行を重視する組織にとって、Ultralyticsのモデルは依然として比類のない選択肢です。
コンピュータービジョンのパイプラインを将来にわたって使える、高速で高精度なものにするため、YOLO26など次世代モデルのアノテーション、トレーニング、デプロイにはUltralytics Platformの活用を強くおすすめします。