YOLOv10 対 DAMO-YOLO#
モダンなcomputer visionパイプラインを構築する際、適切なリアルタイム物体検出アーキテクチャを選択することは極めて重要です。この包括的な技術分析では、YOLOv10とDAMO-YOLOのアーキテクチャ、パフォーマンス指標、および理想的なユースケースについて探求します。どちらのモデルも物体検出能力において大きな飛躍を遂げていますが、その目標を達成するために異なるアーキテクチャの道をたどっています。
プロジェクトが制約のあるedge AIハードウェアへのデプロイを必要とするか、あるいはクラウドGPU上で最大の精度を要求するかに関わらず、これらのアーキテクチャのニュアンスを理解することで、情報に基づいた意思決定が可能になります。
YOLOv10 の探索#
清華大学の研究者によって発表されたYOLOv10は、ネイティブのエンドツーエンドアプローチを導入することによりYOLOファミリに革命を起こし、ポスト処理中のNon-Maximum Suppression (NMS)の必要性を効果的に排除しました。
YOLOv10の詳細:
- 著者:Ao Wang, Hui Chen, Lihao Liu 他
- 組織:Tsinghua University
- 日付:2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- ドキュメント: https://docs.ultralytics.com/models/yolov10/
主要なアーキテクチャの特徴#
YOLOv10の主な革新は、NMSフリーのトレーニングに向けたConsistent Dual Assignments戦略です。従来の物体検出器は、重複するバウンディングボックスをフィルタリングするためにNMSに大きく依存しており、それが予測不可能なレイテンシを引き起こします。これは、autonomous vehiclesや高速ロボティクスなどのリアルタイムアプリケーションにとって重大なボトルネックとなります。オブジェクトごとに単一の最適なバウンディングボックスを直接予測することにより、YOLOv10は予測可能で超低レイテンシの推論を実現します。
さらに、このモデルはHolistic Efficiency-Accuracy Driven Designを採用しています。このアーキテクチャは、軽量な分類ヘッドや空間・チャネル分離型ダウンサンプリングなど、さまざまなコンポーネントを最適化し、計算の冗長性を大幅に削減します。これにより、競合するmean Average Precision (mAP)を維持しながら、より少ないパラメータ数とより少ないFLOPsを誇るアーキテクチャが実現されています。
使用例#
YOLOv10はUltralyticsエコシステムに深く統合されており、Ultralytics Python packageを通じて非常に簡単に使用できます。
from ultralytics import YOLO
# Load a pre-trained YOLOv10 nano model
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Export the model to TensorRT format
model.export(format="engine", quantize=16)DAMO-YOLO の探索#
Alibaba Group によって開発された DAMO-YOLO は、自動化された Neural Architecture Search (NAS) を通じて効率の高いネットワーク構造を発見することに焦点を当てており、速度と精度のパレートフロンティアを押し広げることを目指しています。
DAMO-YOLO の詳細:
- 著者: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, and Xiuyu Sun
- 組織:Alibaba Group
- 日付: 2022-11-23
- Arxiv:https://arxiv.org/abs/2211.15444v2
- GitHub:https://github.com/tinyvision/DAMO-YOLO
主要なアーキテクチャの特徴#
DAMO-YOLO は、産業用アプリケーション向けに調整されたいくつかの新しい技術を導入しています。モデルの基礎は、マルチオブジェクト進化的探索によって生成された MAE-NAS Backbone です。この自動化されたプロセスは、事前に定義された計算予算を厳密に遵守するバックボーン構造を発見し、精度と推論レイテンシの間の微細なバランスを取ります。
さらに、このアーキテクチャはEfficient RepGFPNネックを利用しています。このフィーチャピラミッドネットワークは、異なるスケールにわたる特徴融合を改善するように設計されており、オブジェクトのサイズが大幅に異なるaerial imagery analysisのような複雑なタスクにとって不可欠です。これを補完するため、DAMO-YOLOは最終的な予測レイヤーの複雑さを大幅に削減するミニマリストな検出ヘッドであるZeroHeadを実装し、推論時の貴重な計算時間を節約します。
パフォーマンスの比較#
物体検出アーキテクチャを評価する際、推論速度、パラメータ効率、および検出精度の間の適切なトレードオフを見つけることが最も重要です。以下の表は、各モデルサイズにおける YOLOv10 と DAMO-YOLO のパフォーマンスを比較しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
ベンチマークで観察されるように、YOLOv10 は TensorRT 上で一貫して優れたレイテンシプロファイルを提供し、特にナノバリアントでは DAMO-YOLO の同等のモデルよりも大幅に少ないパラメータと FLOPs しか必要としません。DAMO-YOLO は Tiny バリアントで高い mAP を提供しますが、YOLOv10 ファミリーのパラメータ効率と推論レイテンシは、制約のあるデプロイメント環境において明確な利点を提供します。
ユースケースと推奨事項#
YOLOv10 と DAMO-YOLO のどちらを選択するかは、特定のプロジェクトの要件、デプロイメントの制約、およびエコシステムの好みによって異なります。
YOLOv10を選択すべき場合#
YOLOv10は以下の用途に最適です。
- NMSフリーのリアルタイム検出: Non-Maximum Suppression(NMS)を使用しないエンドツーエンド検出のメリットを享受し、デプロイの複雑さを軽減できるアプリケーション。
- バランスの取れた速度と精度のトレードオフ: さまざまなモデルスケール全体で、推論速度と検出精度の強力なバランスを必要とするプロジェクト。
- 一貫したレイテンシが求められるアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が不可欠なデプロイシナリオ。
DAMO-YOLOを選択すべきケース#
DAMO-YOLOは以下の場合に推奨されます:
- 高スループットビデオ解析: バッチサイズ1でのスループットが主要な指標となる、固定のNVIDIA GPUインフラストラクチャ上での高FPSビデオストリーム処理。
- 産業用製造ライン: 組立ラインでのリアルタイム品質検査など、専用ハードウェア上での厳格なGPUレイテンシ制約があるシナリオ。
- Neural Architecture Searchの研究: 自動化されたアーキテクチャ探索 (MAE-NAS) や効率的な再パラメータ化バックボーンが検出パフォーマンスに与える影響の研究。
Ultralytics (YOLO26) を選択すべき時#
ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
Ultralyticsの利点#
どちらのモデルも技術的に印象的ですが、本番環境向けのアーキテクチャを選択する際には、生の指標を超えて見ることが必要です。Ultralytics ecosystemによってネイティブにサポートされているモデルを使用して構築を行うことは、開発者と研究者の双方にとって比類のない利点を提供します。
使いやすさと十分にメンテナンスされたエコシステム#
しばしば放置されがちなスタンドアロンの学術的リポジトリとは異なり、Ultralyticsは堅牢で活発にメンテナンスされているエコシステムを提供します。NASパイプラインに大きく依存するモデルのための複雑な環境のセットアップは、困難を伴う場合があります。対照的に、Ultralyticsは、豊富なdocumentationに裏打ちされた、標準化された直感的なPython APIと強力なCLIを提供します。これにより、カスタムビジョンソリューションの市場投入までの時間が劇的に短縮されます。
トレーニングの効率とメモリ要件#
大規模なモデルのトレーニングは、すぐに計算コストが高くなる可能性があります。Ultralytics YOLOアーキテクチャは、トレーニングおよび推論時のCUDAメモリフットプリントが低いことで歴史的に知られています。この効率性により、開発者は、RT-DETRのようなトランスフォーマーベースのモデルで一般的なメモリ不足エラーに遭遇することなく、コンシューマー向けハードウェアや費用対効果の高いクラウドインスタンスでモデルをトレーニングできます。
Ultralyticsは、主要なMLOpsツールとネイティブに統合されています。Weights & Biases、Comet、またはClearMLとの統合を使用することで、追加のボイラープレートコードなしでモデルのトレーニング進捗を簡単に追跡できます。
タスク間での汎用性#
多くの特化型検出モデルにおける大きな制限は、その対象範囲の狭さです。Ultralyticsエコシステム内では、物体検出だけに制限されることはありません。コンピュータビジョンタスクはシームレスに拡張され、インスタンスセグメンテーション、画像分類、姿勢推定、指向性バウンディングボックス(OBB)検出などが含まれます。
今後の展望: YOLO26 の進化#
YOLOv10がNMSフリー推論のパイオニアとなり、DAMO-YOLOがNASの力を実証した一方で、コンピュータビジョンの分野は急速に進歩しています。究極の最先端ソリューションを求める開発者には、Ultralytics YOLO26のチェックをお勧めします。
YOLO11の決定的な後継としてリリースされたYOLO26は、YOLOv10によって築かれたNMSフリーの基盤を基にして構築され、それを大幅に進化させています。
YOLO26 の主な進歩は次のとおりです:
- 最大 43% 高速な CPU 推論: エッジコンピューティングおよび低電力デバイス向けに特別に最適化されています。
- DFL 削除: Distribution Focal Loss が削除され、よりシンプルなエクスポートと多様なデプロイメントターゲットとの互換性が向上しました。
- MuSGD オプティマイザー: SGD と Muon のハイブリッドであり、高度な LLM トレーニングの安定性と高速な収束をコンピュータビジョンに直接もたらします。
- **ProgLoss + STAL:**小物体認識における顕著な機能強化を提供する、大幅に改善された損失関数であり、agricultureやリモートセンシングなどのユースケースに不可欠です。
新しく刷新されたUltralytics Platformを利用することで、開発者はわずか数クリックでYOLO26のような次世代モデルのアノテーション、トレーニング、デプロイをシームレスに行うことができ、コンピュータビジョンパイプラインが最先端であり、かつ将来に対応可能であることを保証します。