DAMO-YOLO と YOLOv8#
リアルタイムコンピュータービジョンの状況は、研究者やエンジニアが速度と精度の限界を押し広げる中で、常に変化しています。この分野における重要なマイルストーンとして、DAMO-YOLO と Ultralytics YOLOv8 が挙げられます。どちらのモデルもレイテンシと平均適合率(mAP)のトレードオフの最適化を目指していますが、物体検出の課題に取り組むためのアーキテクチャと設計思想は大きく異なります。
この包括的な技術比較では、両者の基盤アーキテクチャ、トレーニング手法、実運用でのデプロイを比較し、次の人工知能プロジェクトに適したツールを選択できるようにします。
モデルの系譜と仕様#
これらのディープラーニングモデルの起源を理解することは、その設計目標やデプロイエコシステムを把握するうえで有益です。
DAMO-YOLOの詳細#
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
Ultralytics YOLOv8 の詳細#
- 著者: Glenn Jocher、Ayush Chaurasia、Jing Qiu
- 組織: Ultralytics
- 日付: 2023-01-10
- GitHub: ultralytics/ultralytics
- ドキュメント: YOLOv8ドキュメント
アーキテクチャのイノベーション#
両アーキテクチャの性能特性は、それぞれ独自の構造上の判断に由来します。
DAMO-YOLO: アーキテクチャサーチを活用した設計#
DAMO-YOLO は、ニューラルアーキテクチャサーチ(NAS)を大いに活用して、最適なネットワーク構造を自動的に探索します。MAE-NAS という概念を導入し、低レイテンシで高い性能を発揮するバックボーンを探索します。さらに、効率的な再パラメータ化汎用特徴ピラミッドネットワーク(RepGFPN)を利用して、異なる空間スケール間の特徴融合を強化します。
トレーニングを改善するため、Alibaba チームは ZeroHead 設計と AlignedOTA ラベル割り当てを取り入れました。さらに、複雑な知識蒸留プロセスにも大きく依存しています。このプロセスでは、大規模な教師モデルが軽量な生徒モデルを導き、学術ベンチマークでより高い精度指標を引き出します。
YOLOv8: シンプルで多用途#
Ultralytics は、YOLOv8 で開発者を第一に考えたアプローチを採用しました。YOLOv5 のアンカーベース設計からアンカーフリーアーキテクチャへ移行し、バウンディングボックス予測の数を大幅に削減して推論を高速化しました。C2f(2つの畳み込みを備えた Cross-Stage Partial ボトルネック)モジュールの導入により、過度な計算オーバーヘッドを追加することなく、勾配フローと特徴表現が改善されました。
バウンディングボックスを厳密に対象とするモデルとは異なり、YOLOv8はマルチタスクを実現するためにゼロから設計されました。統合された PyTorch コードベースがインスタンスセグメンテーション、ポーズ推定、画像分類をネイティブでサポートしているため、エンジニアがバラバラのリポジトリを組み合わせる手間が省けます。
Ultralytics のモデルは、重量級の Transformer ベースアーキテクチャと比較して、トレーニング中に必要なメモリが本質的に少ないため、一般的なコンシューマー向け GPU で最先端の結果を実現できます。
性能比較#
生の指標を比較する際は、理論上の能力がハードウェア性能にどのように反映されるかを分析することが重要です。以下の表は、モデルサイズごとのトレードオフを示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
DAMO-YOLO は、蒸留技術によりパラメーター数と精度の比率に優れています。一方、YOLOv8 は Nano から Extra-large まで、より幅広いモデルサイズを提供します。YOLOv8 Nano モデルは、エッジ最適化の模範例であり、リソース消費を抑えながら実用性の高い精度を実現します。
エコシステムと開発者体験#
学術論文と本番環境対応システムを真に分けるのは、エコシステムです。
DAMO-YOLO は大規模な知識蒸留パイプラインに依存するため、カスタムトレーニングが煩雑になる場合があります。教師モデルの生成、知識の転移、NAS ベースのバックボーンの調整には大量の CUDA メモリ と高度な設定が必要であり、アジャイルなエンジニアリングチームの開発速度を低下させることがあります。
一方、Ultralytics のエコシステムは使いやすさを重視しています。Ultralytics Platform を通じて、開発者はシンプルな API、包括的なドキュメント、堅牢な実験追跡インテグレーションを利用できます。統合された Python フレームワークにより、複雑なパイプラインも容易に構築できます。
from ultralytics import YOLO
# Load a pretrained YOLOv8 nano model
model = YOLO("yolov8n.pt")
# Train the model on a custom dataset with built-in augmentations
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Export the trained model to ONNX format for deployment
model.export(format="onnx")この効率化されたワークフローと、OpenVINO および TensorRT へのシームレスなエクスポートを組み合わせることで、ローカルでのプロトタイピングからクラウドまたはエッジへのデプロイまでをスムーズに進められます。
実環境でのアプリケーションと最適なユースケース#
これらのアーキテクチャのどちらを選ぶかは、多くの場合、環境の運用上の制約によって決まります。
DAMO-YOLOの適した用途#
DAMO-YOLOは、ニューラルアーキテクチャ探索を研究するアカデミックな環境や、複雑な再パラメータ化戦略の再現を試みる研究者にとって優れた選択肢です。また、マルチタスクなトレーニングを処理するためのコンピューティングリソースをチームが備えている場合、製造ラインでの高速な不良検出など、厳しく管理された産業用アプリケーションでも優れた性能を発揮します。
Ultralytics が本番環境で優位に立つ理由#
大半の商用プロジェクトでは、Ultralytics のモデルが優れた性能バランスを提供します。
- スマートリテール: YOLOv8 のマルチタスク機能を使用して、在庫のバウンディングボックス検出と、顧客行動の分析のための ポーズ推定 の両方に対応します。
- 農業: インスタンスセグメンテーション を活用して、リアルタイムのトラクター映像から植物の正確な境界や雑草を検出します。
- 航空画像: 方向付きバウンディングボックス(OBB) を活用して、ドローンや衛星から回転した車両や船舶を正確に追跡します。
将来への備え: YOLO26 の登場#
YOLOv8 は基盤となるモデルであり続けていますが、この分野は進歩を続けています。今後のすべての開発には、YOLO26 が推奨される標準です。2026年1月にリリースされたこのモデルは、Ultralytics のラインアップにおける画期的な飛躍を表しています。
YOLO26 はネイティブな エンドツーエンドの NMS フリーデザイン を先駆けて導入し、従来の Non-Maximum Suppression によるボトルネックを完全に排除します。この構造上の画期的な進歩により、CPU 推論が最大 43% 高速化され、エッジコンピューティングや IoT ハードウェア向けの強力なモデルとなっています。
さらに、YOLO26 は MuSGD Optimizer を導入します。これは大規模言語モデル(LLM)のトレーニング手法に着想を得たハイブリッド型で、より速い収束と非常に安定したトレーニングループを実現します。新しい ProgLoss + STAL アルゴリズムと組み合わせることで、YOLO26 は小さな物体の認識性能を大幅に向上させ、デプロイ環境で高速性と妥協のない精度を両立します。