YOLOv5とDAMO-YOLO#
リアルタイムコンピュータービジョンの分野は継続的に進化しており、研究者やエンジニアは精度、速度、使いやすさの最適なバランスを追求しています。この歩みに大きな影響を与えてきた2つの主要なモデルが、Ultralytics YOLOv5とAlibabaのDAMO-YOLOです。
このガイドでは、アーキテクチャ、パフォーマンス指標、トレーニング手法を詳細に技術分析し、次回のデプロイに適したモデルを選択できるようにします。
モデルの背景#
技術的な細部に入る前に、これらの影響力のあるビジョンモデルそれぞれの起源と基本的な設計思想を理解することが重要です。
Ultralytics YOLOv5#
Glenn Jocher氏とUltralyticsのチームによって開発されたYOLOv5は、リリース以来、業界標準となっています。PyTorchフレームワーク上にネイティブに構築され、すぐに利用できる合理化された開発者エクスペリエンスと堅牢なデプロイ機能を重視しています。
- 著者: Glenn Jocher
- 組織: Ultralytics
- 日付: 2020-06-26
- GitHub: https://github.com/ultralytics/yolov5
- ドキュメント: Ultralytics YOLOv5 Documentation
DAMO-YOLO#
Alibaba Groupの研究者によって開発されたDAMO-YOLOは、ニューラルアーキテクチャサーチ(NAS)と高度な蒸留技術に重点を置いています。ハードウェア固有のパフォーマンスの理論的限界を追求し、極めて高度なチューニングを必要とする研究環境やエッジ環境に特に適しています。
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
アーキテクチャのイノベーション#
どちらのモデルも、独自の構造概念を活用してリアルタイム性能を実現していますが、そのアプローチは大きく異なります。
YOLOv5:安定性と汎用性#
YOLOv5は、Modified CSP(クロスステージパーシャル)バックボーンとPANet(パスアグリゲーションネットワーク)ネックを組み合わせて使用します。この構造は非常に効率的で、トレーニング中と推論中の両方でCUDAメモリ使用量を最小限に抑えます。
YOLOv5の最大の強みの1つは、タスク全般にわたる汎用性です。バウンディングボックスの予測に加えて、画像セグメンテーションと画像分類専用のアーキテクチャも提供しており、開発者は単一の一貫したフレームワークを中心にビジョンパイプラインを標準化できます。
DAMO-YOLO:自動アーキテクチャサーチ#
DAMO-YOLOのコアイノベーションは MAE-NAS Backbone です。最大エントロピー誘導探索を使用して、Alibabaチームは検出精度と推移速度を動的にバランスさせるバックボーンを発見しました。
さらに、特徴量融合を改善するEfficient RepGFPNネックを備えており、衛星画像解析でよく見られる複雑なスケール変動に特に有効です。ZeroHead設計は最終予測レイヤーを簡素化してレイテンシを削減しますが、この複雑な構造生成により、アーキテクチャが硬直化し、カスタムアプリケーション向けに変更しにくくなる場合があります。
Transformerベースのアーキテクチャは、多大なVRAM消費に悩まされることがよくあります。YOLOv5とDAMO-YOLOはいずれも効率的な畳み込み設計を採用してメモリフットプリントを低く抑えていますが、Ultralyticsのモデルはコンシューマー向けGPU向けに特に最適化されており、個人の研究者やスタートアップにとってはるかに利用しやすくなっています。
パフォーマンスとメトリクス#
リアルタイム物体検出器を評価するには、mAP(平均適合率)、推論速度、モデルサイズのパラメーターを総合的に確認する必要があります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
DAMO-YOLOは特定のパラメーター数において非常に競争力の高いmAPスコアを達成しますが、YOLOv5はnanoおよびsmall構成で、TensorRTによる非常に高速な推論と極めて少ないパラメーター数を一貫して示します。このパフォーマンスバランスにより、YOLOv5は多様なエッジデプロイシナリオで効率的に動作します。
トレーニング効率とエコシステム#
モデルの理論上の精度は、実際に実装できて初めて意味を持ちます。ここで、両モデルには大きな違いが現れます。
蒸留の複雑さ#
DAMO-YOLOはマルチステージ学習手法に大きく依存しています。AlignedOTAラベル割り当てと、教師・生徒知識蒸留技術を組み合わせます。これにより生徒モデルから最大限のパフォーマンスを引き出す一方で、最初に大規模な教師モデルを学習させる必要があります。これは計算時間、エネルギーコスト、および必要なハードウェアを大幅に増加させ、アジャイルなMLチームにとってのボトルネックとなります。
Ultralyticsの利点:使いやすさ#
一方、Ultralyticsエコシステムは、直感的なAPIとトレーニング効率で世界的に高く評価されています。活発な開発と大規模なオープンソースコミュニティに支えられ、開発者はモデルのトレーニング、検証、デプロイをシームレスに行えます。
from ultralytics import YOLO
# Load a pretrained YOLOv5 model
model = YOLO("yolov5s.pt")
# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export to ONNX format for deployment
model.export(format="onnx")Ultralyticsは、Weights & BiasesやComet MLなどのツールを介した実験トラッキングも組み込みでサポートしており、摩擦のないワークフローを実現します。
実世界でのユースケース#
- YOLOv5は、変化の速い本番環境で優れた性能を発揮します。シンプルなエクスポート性により、スマートリテール分析、高速な製造欠陥検出、CoreMLを介したモバイルアプリケーションへの統合に最適な選択肢となります。
- DAMO-YOLOは、厳密な学術ベンチマークや、特定の固定ハードウェア向けにわずかなmAP向上を追求する長時間の蒸留トレーニングを実行できる、豊富な計算リソースがあるシナリオに非常に適しています。
ユースケースと推奨事項#
YOLOv5とDAMO-YOLOのどちらを選ぶかは、具体的なプロジェクト要件、デプロイの制約、エコシステムの好みによって決まります。
YOLOv5を選ぶべきケース#
YOLOv5 は次の用途に適しています:
- 実績のある本番システム: YOLOv5の長年にわたる安定性の実績、豊富なドキュメント、広範なコミュニティサポートが重視される既存のデプロイ環境。
- リソースに制約のあるトレーニング: YOLOv5の効率的なトレーニングパイプラインと少ないメモリ要件が有利になる、GPUリソースが限られた環境。
- 幅広いエクスポート形式のサポート: ONNX、TensorRT、CoreML、TFLiteなど、多数の形式にまたがるデプロイが必要なプロジェクト。
DAMO-YOLOを選択する場合#
DAMO-YOLOは次の用途に推奨されます。
- 高スループットの動画分析: バッチサイズ1のスループットが主要な指標となる、固定されたNVIDIA GPUインフラストラクチャ上での高FPS動画ストリーム処理。
- 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャサーチ研究: 自動アーキテクチャ探索(MAE-NAS)と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響の研究。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
次の進化:YOLO26#
新しいプロジェクトを始める場合は、将来を見据えることを強くおすすめします。Ultralytics YOLO26は、YOLOv5の優れた基盤を発展させ、ビジョンAIの最先端を再定義する革新的な進歩を取り入れています。
幅広い称賛を受けてリリースされたYOLO26は、ネイティブにエンドツーエンドで動作します。エンドツーエンドのNMSフリーデザインを採用し、Non-Maximum Suppressionの後処理を完全に排除することで、デプロイを大幅に高速化・簡素化します。
YOLO26の主な革新点は次のとおりです。
- MuSGDオプティマイザー: LLMトレーニングの革新に着想を得た、SGDとMuonのハイブリッドであり、非常に安定したトレーニングと高速な収束を実現します。
- 最大43%高速なCPU推論: エッジコンピューティング向けに大幅に最適化されており、専用GPUなしで動作するIoTデバイスに最適です。
- ProgLoss + STAL: 小さな物体の認識を大幅に改善する高度な損失関数であり、空撮ドローン画像やロボティクスに不可欠です。
- タスク固有の改善: Oriented Bounding Boxes (OBB)向けの特殊な角度損失から、正確な姿勢推定を実現するResidual Log-Likelihood Estimation(RLE)まで、YOLO26は複雑な分野にも容易に対応します。
まとめ#
YOLOv5とDAMO-YOLOはいずれも、物体検出の歴史に確固たる地位を築いています。DAMO-YOLOは、ニューラルアーキテクチャサーチと蒸留に関する興味深い研究対象であり続けています。しかし、十分に保守されたエコシステム、使いやすさ、本番環境への迅速な移行を重視する組織にとって、Ultralyticsのモデルは依然として比類のない選択肢です。
次世代モデル(YOLO26など)のアノテーション、トレーニング、デプロイには、Ultralytics Platformの利用を強くおすすめします。これにより、コンピュータービジョンパイプラインを将来にわたって利用でき、高速で非常に高精度な状態に保てます。