YOLOv10とDAMO-YOLOの比較#
最新のコンピュータビジョンパイプラインを構築する際、適切なリアルタイム物体検出アーキテクチャを選択することは極めて重要です。本稿では、YOLOv10とDAMO-YOLOのアーキテクチャ、パフォーマンス指標、理想的なユースケースを包括的に技術分析します。両モデルは物体検出能力において大きな飛躍を実現していますが、目標達成に向けて異なるアーキテクチャ上のアプローチを採用しています。
プロジェクトで限られたリソースのエッジAIハードウェアへのデプロイが必要な場合でも、クラウドGPU上で最高精度が求められる場合でも、これらのアーキテクチャの細かな違いを理解することで、十分な情報に基づいて判断できるようになります。
YOLOv10の概要#
清華大学の研究者によって発表されたYOLOv10は、ネイティブなエンドツーエンドアプローチを導入してYOLOファミリーに革新をもたらし、後処理における非最大抑制(NMS)の必要性を効果的に排除しました。
YOLOv10の詳細:
- 著者: Ao Wang、Hui Chen、Lihao Liu、ほか
- 組織: 清華大学
- 日付: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- Docs: https://docs.ultralytics.com/models/yolov10
主なアーキテクチャ上の特徴#
YOLOv10の主な革新は、NMSを使用しないトレーニングを実現するConsistent Dual Assignments戦略です。従来の物体検出器は、重複するバウンディングボックスをフィルタリングするためにNMSに大きく依存しており、自動運転車や高速ロボティクスなどのリアルタイムアプリケーションでは、予測不能なレイテンシという大きなボトルネックが生じます。YOLOv10は、物体ごとに単一の最適なバウンディングボックスを直接予測することで、予測可能な超低レイテンシ推論を実現します。
さらに、このモデルはHolistic Efficiency-Accuracy Driven Designを採用しています。アーキテクチャでは、軽量な分類ヘッドや空間・チャネル分離型ダウンサンプリングなど、さまざまなコンポーネントを最適化し、計算の冗長性を大幅に削減しています。その結果、競争力のある平均適合率(mAP)を維持しながら、パラメータ数とFLOPsを抑えたアーキテクチャを実現しています。
使用例#
YOLOv10はUltralyticsエコシステムに深く統合されているため、Ultralytics Pythonパッケージを介して非常に簡単に利用できます。
from ultralytics import YOLO
# Load a pre-trained YOLOv10 nano model
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Export the model to TensorRT format
model.export(format="engine", quantize=16)DAMO-YOLOの概要#
Alibaba Groupによって開発されたDAMO-YOLOは、自動ニューラルアーキテクチャサーチ(NAS)によって高効率なネットワーク構造を探索することに重点を置き、速度と精度のパレートフロンティアを押し広げることを目指しています。
DAMO-YOLOの詳細:
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
主なアーキテクチャ上の特徴#
DAMO-YOLOは、産業用アプリケーション向けに調整されたいくつかの新しい技術を導入しています。このモデルの基礎となるのは、最大エントロピー誘導型探索によって生成されたMAE-NAS Backboneです。この自動化されたプロセスにより、事前に定義された計算予算に厳密に従うバックボーン構造が発見され、精度と推論レイテンシの間で優れたバランスが保たれます。
さらに、このアーキテクチャはEfficient RepGFPNネックを採用しています。この特徴ピラミッドネットワークは、異なるスケール間での特徴融合を向上させるよう設計されており、物体のサイズが大きく異なる航空画像解析などの複雑なタスクに不可欠です。これを補完するため、DAMO-YOLOはZeroHeadを実装しています。これは最終予測レイヤーの複雑さを大幅に削減する最小構成の検出ヘッドであり、推論時の貴重な計算時間を節約します。
性能比較#
物体検出アーキテクチャを評価する際には、推論速度、パラメータ効率、検出精度の適切なトレードオフを見つけることが最も重要です。以下の表では、それぞれのモデルサイズにおけるYOLOv10とDAMO-YOLOのパフォーマンスを比較しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
ベンチマークから分かるように、YOLOv10はTensorRT上で一貫して優れたレイテンシ特性を示しており、特にnanoバリアントでは、DAMO-YOLOの同等モデルよりも大幅に少ないパラメータ数とFLOPsで動作します。DAMO-YOLOはtinyバリアントで高いmAPを実現しますが、YOLOv10ファミリーのパラメータ効率と推論レイテンシは、リソースに制約のあるデプロイ環境で明確な優位性をもたらします。
ユースケースと推奨事項#
YOLOv10とDAMO-YOLOのどちらを選択するかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムに関する選好によって決まります。
YOLOv10を選択する場合#
YOLOv10は次の用途に適しています:
- NMSフリーのリアルタイム検出: Non-Maximum Suppressionを使用しないエンドツーエンド検出のメリットを活かし、デプロイの複雑さを軽減できるアプリケーション。
- 速度と精度のバランスの取れたトレードオフ: さまざまなモデルスケールで、推論速度と検出精度の優れたバランスが求められるプロジェクト。
- レイテンシが一貫したアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が重要なデプロイシナリオ。
DAMO-YOLOを選択する場合#
DAMO-YOLOは次の用途に推奨されます。
- 高スループットの動画分析: バッチサイズ1のスループットが主要な指標となる、固定されたNVIDIA GPUインフラストラクチャ上での高FPS動画ストリーム処理。
- 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上でGPUレイテンシに厳しい制約があるシナリオ。
- ニューラルアーキテクチャサーチ研究: 自動アーキテクチャ探索(MAE-NAS)と、効率的に再パラメーター化されたバックボーンが検出性能に与える影響の研究。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの優位性#
どちらのモデルも技術的には非常に優れていますが、本番環境向けのアーキテクチャを選ぶ際は、単純な指標だけで判断すべきではありません。Ultralyticsエコシステムがネイティブにサポートするモデルを使って構築することで、開発者と研究者の双方に他に類を見ないメリットがもたらされます。
使いやすさと適切に保守されたエコシステム#
しばしば放棄されるスタンドアロンの学術リポジトリとは異なり、Ultralyticsは堅牢で継続的に保守されているエコシステムを提供しています。NASパイプラインに大きく依存するモデル用に複雑な環境を構築するのは困難な場合があります。それに対してUltralyticsは、充実したドキュメントに支えられた、標準化された直感的なPython APIと強力なCLIを提供しています。これにより、カスタムビジョンソリューションの市場投入までの時間を大幅に短縮できます。
トレーニング効率とメモリ要件#
大規模モデルのトレーニングは、すぐに計算コストが高くなる可能性があります。Ultralytics YOLOアーキテクチャは、トレーニングと推論におけるCUDAメモリ使用量の少なさで従来から知られています。この効率性により、開発者は、RT-DETRのようなTransformerベースのモデルで作業する際によく発生するメモリ不足エラーを回避しながら、コンシューマー向けハードウェアやコスト効率の高いクラウドインスタンスでモデルをトレーニングできます。
Ultralyticsは主要なMLOpsツールとネイティブに統合できます。Weights & Biases、Comet、ClearMLとの統合を利用することで、追加のボイラープレートコードなしにモデルのトレーニング進捗を簡単に追跡できます。
タスク全体にわたる汎用性#
多くの専門的な検出モデルにおける大きな制限は、対象が狭いことです。Ultralyticsエコシステムでは、物体検出だけに限定されません。ツールは、インスタンスセグメンテーション、画像分類、姿勢推定、回転バウンディングボックス(OBB)検出など、複数のコンピュータビジョンタスクにシームレスに拡張できます。
将来を見据えて: YOLO26への進化#
YOLOv10がNMSなしの推論を先駆け、DAMO-YOLOがNASの可能性を示す一方で、コンピュータビジョンの分野は急速に進化しています。最先端の究極のソリューションを求める開発者には、Ultralytics YOLO26を確認することをお勧めします。
YOLO11の決定版後継モデルとしてリリースされたYOLO26は、YOLOv10が築いたNMSなしの基盤をさらに発展させています。
YOLO26の主な進歩は次のとおりです:
- CPU推論が最大43%高速: エッジコンピューティングと低消費電力デバイス向けに特別に最適化されています。
- DFLの削除: Distribution Focal Lossを削除し、より簡単なエクスポートと、多様なデプロイ先との互換性向上を実現しています。
- MuSGDオプティマイザー: SGDとMuonを組み合わせたハイブリッド方式で、高度なLLMトレーニングの安定性と高速な収束をコンピュータビジョンに直接もたらします。
- ProgLoss + STAL: 損失関数を大幅に改善し、小物体認識を顕著に向上させます。これは農業やリモートセンシングなどのユースケースに不可欠です。
新しく刷新されたUltralytics Platformを活用することで、開発者はYOLO26のような次世代モデルのアノテーション、トレーニング、デプロイを数回のクリックでシームレスに実行でき、コンピュータビジョンパイプラインを最先端かつ将来にわたって利用できる状態に保てます。