DAMO-YOLO vs YOLOv7#
コンピュータビジョンの急激な進化により、精度と計算コストのバランスを取るように設計された非常に効率的なobject detectionモデルが生み出されました。2022年に導入された特筆すべき2つのモデルが、DAMO-YOLOとYOLOv7です。どちらもリアルタイムビジョンタスクの限界を押し広げることを目指していますが、非常に異なるアーキテクチャパラダイムとトレーニング手法を通じてその結果を達成しています。
この包括的な技術比較では、両モデルの独自のアプローチを調査し、機械学習エンジニアが特定のcomputer vision applicationsに適したツールを選択できるように、そのアーキテクチャ、デプロイのポテンシャル、およびパフォーマンス指標を検証します。
モデルの起源とメタデータ#
詳細な技術分析に入る前に、これら2つのコンピュータビジョンモデルの起源を文脈化することが不可欠です。
DAMO-YOLO#
Alibaba Groupの研究者によって開発されたDAMO-YOLOは、自動アーキテクチャ探索と蒸留を通じて、速度と精度の両方を最適化するために導入されました。
- 著者: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, and Xiuyu Sun
- Organization: Alibaba Group
- 日付: 2022年11月23日
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
YOLOv7#
2022年中頃に最先端としてリリースされたYOLOv7は、デプロイコストを増やすことなくトレーニング可能な「バグ・オブ・フリービーズ(bag-of-freebies)」を導入することで、real-time inferenceをさらに推し進めました。
- 著者: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
- 組織: Institute of Information Science, Academia Sinica, Taiwan
- 日付: 2022年7月6日
- Arxiv: 2207.02696
- Docs: YOLOv7 Documentation
YOLOv7はUltralyticsエコシステム内で公式にサポートされており、統合されたAPIを使用してシームレスなトレーニング、検証、およびエクスポートが可能です。
アーキテクチャの革新#
DAMO-YOLO: NASと蒸留#
DAMO-YOLOは、最大限の効率を目指したいくつかの最先端技術を取り入れています。
- NASバックボーン: ニューラルアーキテクチャ探索 (NAS) を活用して、遅延が重視される環境向けに調整された最適なバックボーン (MAE-NAS) を自動設計します。
- 効率的なRepGFPN: 複数のスケールにわたる特徴融合の効率を大幅に向上させる、修正されたGeneralized Feature Pyramid Networkです。
- ZeroHead & AlignedOTA: 軽量な検出ヘッドと最適化されたラベル割り当て戦略 (AlignedOTA) を組み込み、計算オーバーヘッドを削減します。
- 蒸留による強化: トレーニング中に知識蒸留を多用し、パラメータ数を増やすことなく小型モデルバリアントの性能を向上させます。
YOLOv7: E-ELANとBag-of-Freebies#
YOLOv7は、勾配経路の最適化と堅牢なトレーニング戦略に焦点を当てた、より構造的なエンジニアリングアプローチを採用しました。
- E-ELANアーキテクチャ: Extended Efficient Layer Aggregation Networkにより、モデルは最短および最長の勾配経路を制御することで、より多様な特徴を学習し、効果的な学習の収束を確実にします。
- モデルスケーリング: 連結ベースのモデル向けに調整された複合スケーリング手法を導入し、構造的な調整のために深さと幅を同時にスケーリングします。
- トレーニング可能なバグ・オブ・フリービーズ: ID接続なしの再パラメータ化畳み込み(RepConv)や、推論速度に影響を与えることなくトレーニング中のaccuracyを向上させる動的ラベル割り当て戦略などのテクニックを採用しています。
パフォーマンス分析#
mean Average Precision (mAP)、速度、効率を評価する場合、両モデルとも印象的な指標を示していますが、ターゲットとするセグメントはわずかに異なります。YOLOv7は高精度のGPUデプロイに大きく焦点を当てている一方、DAMO-YOLOのNAS由来の構造は、積極的な低遅延のCPUおよびエッジデプロイを目的としています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
指標からもわかるように、DAMO-YOLOは非常に軽量なバリアント(わずか8.5Mパラメータのtinyモデルなど)を提供しますが、YOLOv7は全体としてより高い精度ピークを達成しており、YOLOv7xはCOCOデータセットで53.1 mAPという驚異的な数値を記録しています。
Ultralyticsエコシステムの利点#
理論上のアーキテクチャは重要ですが、モデルの実用性はエコシステムによって決まります。YOLOv7のようにUltralyticsがサポートするモデルは、十分に維持されたエコシステムと比類のない使いやすさの恩恵を受けています。
- パフォーマンスのバランス: Ultralyticsモデルは、推論速度と検出精度の間で最適なトレードオフを常に実現しており、エッジデバイスとクラウドベースのmodel deploymentの両方に最適です。
- メモリ要件: より重いTransformerベースのモデルとは異なり、Ultralytics YOLOモデルはトレーニング中も低いCUDAメモリ要件を維持します。これにより、より大きなbatch sizesが可能になり、コンシューマー向けハードウェア上でもトレーニングプロセスが効率化されます。
- 汎用性: Ultralyticsフレームワークは、オブジェクト検出を超えてInstance SegmentationやPose Estimationなどのタスクに拡張され、開発者に完全なコンピュータビジョンツールキットを提供します。
Ultralyticsパッケージを使用すると、高度に最適化されたデータローダーと事前学習済み重みを活用して、データセットから完全にトレーニングされたモデルまでわずか数分でシームレスに移行できます。
コード例: UltralyticsでのYOLOv7のトレーニング#
Ultralytics Python APIを使用すれば、YOLOv7をコンピュータビジョンパイプラインに組み込むことは非常に簡単です。
from ultralytics import YOLO
# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)新しい標準: YOLO26の紹介#
YOLOv7とDAMO-YOLOは2022年に大きな画期的な成果をもたらしましたが、ビジョンAIの分野は急速に進化しています。現在、新しいプロジェクトを開始するチームにとって推奨されるモデルは、2026年1月にリリースされた最先端のUltralytics YOLO26です。
YOLO26は、最先端の技術革新を取り入れることで、パフォーマンスとユーザビリティにおいて世代を超えた飛躍をもたらします。
- エンドツーエンドのNMSフリー設計: YOLO26はネイティブでエンドツーエンドです。非最大値抑制(NMS)後処理を排除することにより、YOLOv10によって最初に切り開かれたパラダイムシフトである、より高速でシンプルなデプロイロジックを実現します。
- MuSGDオプティマイザ: Moonshot AIのKimi K2などの大規模言語モデルのイノベーションに触発されたYOLO26は、SGDとMuonのハイブリッドを利用しています。このオプティマイザは、非常に安定したトレーニングダイナミクスと劇的に高速な収束率を保証します。
- CPU推論が最大43%高速化: Distribution Focal Loss (DFL) のターゲット除去と大幅な構造強化により、YOLO26は低電力エッジコンピューティング向けに高度に最適化されており、非GPUハードウェア上で以前の世代を上回る性能を発揮します。
- ProgLoss + STAL: 小さなオブジェクトの認識を明示的にターゲットにして改善する先進的な新しい損失関数を組み込んでおり、これは航空画像、ロボティクス、security monitoringのアプリケーションにとって不可欠な機能です。
- タスク固有の改善: 標準的な検出を超えて、YOLO26には、セグメンテーション用のマルチスケールプロトタイピング、姿勢推定用のRLE、Oriented Bounding Boxes (OBB)用の特定の角度損失など、多様なタスクに向けたカスタマイズされた機能強化が備わっています。
理想的なユースケース#
適切なアーキテクチャを選択するかどうかは、ターゲットとなる展開環境とプロジェクトの制約に完全に依存します。
DAMO-YOLOを選択すべき場合:
- パラメータ数を極めて低く抑える必要がある(例:マイクロコントローラのような)リソースが制限された非常に制約の厳しいエッジ環境で作業している場合。
- Alibabaの独自クラウドサービスと特に統合された自動機械学習パイプラインを利用している場合。
YOLOv7を選択すべき場合:
- アンカーベースの高精度推論用に既に最適化されたレガシーGPUパイプラインがある場合。
- 高速なautonomous vehiclesや高度なroboticsなど、リアルタイムの精度が最優先される環境で運用しています。
YOLO26を選択すべき場合 (推奨):
- 新しいcomputer visionアプリケーションをゼロから構築しており、精度とCPU/エッジ推論速度の両方で絶対的な最先端を求めています。
- NMSオペレーターの制約に対処することなく、迅速でシームレスなデプロイ(CoreMLやTensorRTへのエクスポートなど)を必要としています。
- クラウドトレーニング、データセット管理、自動デプロイのためにUltralytics Platformの全機能を活用したいと考えています。
Ultralyticsモデルの堅牢なエコシステムを活用することで、開発者はエンジニアリング時間を劇的に短縮しつつ、現実世界のアプリケーションで最高レベルの予測性能を確保できます。