DAMO-YOLOとYOLOv5の比較#
コンピュータビジョンの進化は、リアルタイム物体検出における継続的な革新によって特徴づけられてきました。今日、開発者や研究者は、ビジョンパイプラインを設計する際に無数のアーキテクチャの選択肢に直面しています。この包括的な技術比較では、DAMO-YOLOとUltralytics YOLOv5の間のニュアンスを探求し、それぞれのアーキテクチャ、トレーニング手法、パフォーマンス指標、および理想的なデプロイシナリオに焦点を当てています。
DAMO-YOLOの紹介#
Alibaba GroupによってリリースされたDAMO-YOLOは、検出速度と精度の限界を押し広げることを目的としたいくつかの新しい手法を導入しました。
- 著者: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, and Xiuyu Sun
- Organization: Alibaba Group
- 日付: 2022年11月23日
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- ドキュメント: README.md
アーキテクチャの革新#
DAMO-YOLOは、ニューラルアーキテクチャサーチ(NAS)の基盤の上に構築されています。著者らはMAE-NASを利用して、レイテンシと精度のバランスを取るバックボーンを自動的に設計しました。このモデルは、異なるスケールにわたる特徴の融合を改善する効率的なRepGFPN(Reparameterized Generalized Feature Pyramid Network)を導入しています。さらに、DAMO-YOLOは「ZeroHead」デザインを組み込んでおり、複雑なマルチブランチ予測ヘッドを廃し、推論時に再パラメータ化(レパラメタリゼーション)に大きく依存する、よりシンプルで効率的な構造を採用しています。
学習を改善するために、このモデルはラベル割り当てにAlignedOTAを使用し、より大きな「教師」モデルが小さな「生徒」モデルを導いてより高い精度を達成する強力な蒸留強化プロセスを使用しています。
Ultralytics YOLOv5の紹介#
Ultralytics YOLOv5は、世界で最も広く採用されているビジョンアーキテクチャの1つであり、その安定性、使いやすさ、および広範なデプロイエコシステムで有名です。
- 著者: Glenn Jocher
- 組織: Ultralytics
- 日付: 2020年6月26日
- GitHub: ultralytics/yolov5
- Docs: YOLOv5 Documentation
エコシステムの標準#
YOLOv5は、使いやすさにおける業界標準を再定義しました。PyTorchでネイティブに構築されており、高度に最適化されたCSPNetバックボーンと、堅牢な特徴集約のためのPANetネックを利用しています。後のモデルで見られるアンカーフリーのトレンドに先行するものでしたが、その洗練されたアンカーベースのアプローチは、自動アンカー学習と相まって、箱から出してすぐに優れたパフォーマンスを発揮します。
YOLOv5の真の強みは、そのよく整備されたエコシステムにあります。CometやWeights & Biasesなどの追跡ツールとシームレスに統合し、ONNX、TensorRT、CoreMLなどのフォーマットへのワンクリックエクスポートをサポートしています。
YOLOv5は、カスタムデータセットでの学習が非常に簡単です。合理化されたAPIがプロトタイプから本番環境への移行の摩擦を軽減し、アジャイルなエンジニアリングチームの間で人気となっています。
パフォーマンスと指標の比較#
これらのモデルを比較する際は、mean Average Precision (mAP)、推論速度、およびパラメータ数のバランスを見ることが不可欠です。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
トレードオフの分析#
DAMO-YOLOは、パラメータサイズに対して印象的なmAPスコアを達成しており、蒸留トレーニングフェーズから大きな恩恵を受けています。しかし、これはトレーニング効率の犠牲の上に成り立っています。マルチステージの蒸留プロセスでは、まず重い教師モデルをトレーニングする必要があり、必要なGPU計算時間とVRAMが大幅に増加します。
対照的に、YOLOv5は優れたメモリ要件を提供します。Ultralytics YOLOモデルは、複雑な蒸留パイプラインやRT-DETRのようなトランスフォーマーベースのモデルと比較して、トレーニングと推論の両方においてメモリ使用量が少ないことで知られています。これにより、YOLOv5は、コンシューマー向けハードウェアやGoogle Colabなどのアクセシブルなクラウド環境で効率的にトレーニングできます。
現実世界のアプリケーションと汎用性#
適切なアーキテクチャの選択は、多くの場合、デプロイ環境に依存します。
DAMO-YOLOの強み#
DAMO-YOLOは厳密に物体検出モデルです。学術研究、特にニューラルアーキテクチャサーチを研究しているチームや、論文に詳述されている再パラメータ化手法を再現することを目指すチームにとって優れた選択肢です。プロジェクトに蒸留トレーニングフェーズを実行するための豊富な計算リソースがあり、2Dバウンディングボックスの最後の精度の端数を絞り出すことだけに焦点を当てている場合、DAMO-YOLOは強力な候補となります。
Ultralyticsの利点#
現実世界のプロダクションにおいては、Ultralyticsモデルの使いやすさと汎用性が好まれる選択肢となります。YOLOv5は検出および画像分類の定番であり続けていますが、より広範なUltralyticsエコシステムにより、開発者はタスクを簡単に切り替えることができます。
たとえば、Ultralyticsファミリーの新しいイテレーションは、インスタンスセグメンテーション、姿勢推定、および指向性バウンディングボックス(OBB)検出をネイティブにサポートしています。このマルチタスク機能により、チームは自動ナンバープレート認識と車両セグメンテーションの組み合わせなどの複雑なパイプラインに対して、単一の統合されたPython APIを利用できるようになります。
ユースケースと推奨事項#
DAMO-YOLOとYOLOv5の選択は、プロジェクト固有の要件、デプロイの制約、およびエコシステムの優先順位に依存します。
DAMO-YOLOを選択すべきケース#
DAMO-YOLOは以下のような場合に強力な選択肢となります。
- 高スループットビデオ解析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上での高FPSビデオストリーム処理。
- 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上での厳格なGPUレイテンシ制約があるシナリオ。
- Neural Architecture Searchの研究: 自動化されたアーキテクチャ探索 (MAE-NAS) や効率的な再パラメータ化バックボーンが検出パフォーマンスに与える影響の研究。
YOLOv5を選択すべき場合#
YOLOv5は以下のような場合に推奨されます:
- 実証済みの本番システム: YOLOv5の長期にわたる安定性の実績、広範なドキュメント、および膨大なコミュニティサポートが重視される既存のデプロイ環境。
- リソースが制限されたトレーニング: GPUリソースが限られており、YOLOv5の効率的なトレーニングパイプラインと低いメモリ要件が有利に働く環境。
- 豊富なエクスポートフォーマットのサポート: ONNX、TensorRT、CoreML、TFLiteを含む多くのフォーマットにわたるデプロイを必要とするプロジェクト。
Ultralytics (YOLO26) を選択すべき時#
ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
未来: YOLO26 への移行#
YOLOv5は伝説的な存在であり、DAMO-YOLOは興味深い学術的な洞察を提供しますが、最先端技術は進化しています。2026年1月にリリースされたUltralytics YOLO26は、ビジョンコミュニティにとって大きな飛躍を遂げたことを表しています。
YOLO26は、エッジデプロイと学習不安定性の従来のボトルネックに対処しています。
- エンドツーエンドのNMSフリーデザイン: YOLO26は、非最大値抑制(NMS)の後処理をネイティブに排除します。この画期的な進歩により、デプロイロジックが簡素化され、レイテンシの変動が大幅に削減されるため、高速なロボティクスや自律システムに最適です。
- MuSGDオプティマイザ: LLM学習のイノベーション(Moonshot AIのKimi K2など)に触発され、YOLO26はMuSGDオプティマイザ(SGDとMuonのハイブリッド)を利用しています。これにより、非常に安定した学習実行と驚くほど高速な収束が保証されます。
- 最大43%高速なCPU推論: 分布焦点損失(DFL)を戦略的に削除することにより、YOLO26は、YOLO11やYOLOv8などの前モデルと比較して、CPUおよびエッジデバイスで圧倒的に優れた速度を達成しています。
- ProgLoss + STAL: これらの高度な損失関数は、小物体認識において顕著な改善をもたらします。これは、空撮ドローン画像やIoTセンサーフィードの分析に不可欠です。
コード例: シンプルな動作#
Ultralyticsパッケージを使用すると、わずか数行のコードでモデルの学習とデプロイが可能になります。YOLOv5を使用している場合でも、推奨されるYOLO26にアップグレードする場合でも、インターフェースは一貫しており直感的です。
from ultralytics import YOLO
# Load the state-of-the-art YOLO26 small model
model = YOLO("yolo26s.pt")
# Train on a custom dataset effortlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on an image and display results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# Export the model for edge deployment
model.export(format="onnx")結論#
DAMO-YOLOとYOLOv5はどちらも、コンピュータビジョンの領域に大きく貢献してきました。DAMO-YOLOはニューラルアーキテクチャ探索と蒸留の力を示しており、研究者にとって興味深い研究対象となっています。しかし、YOLOv5は、そのパフォーマンスのバランス、低いメモリ要件、比類のない使いやすさにより、依然として実用的な強力なツールです。
今日新プロジェクトを開始する開発者には、Ultralytics Platformを活用し、YOLO26を採用することが推奨されます。これは、愛されているYOLOv5の使いやすいエコシステムと画期的なアーキテクチャの進歩を兼ね備えており、クラウドおよびエッジAIアプリケーションの両方で最高水準の精度と驚異的な高速推論を保証します。開発者は、特定のレガシーハードウェアの制約に応じて、YOLOv6やYOLOXなどの他の効率的なモデルを探索することもできます。