DAMO-YOLOとRTDETRv2#
急速に進化するコンピュータービジョンの分野では、速度、精度、計算効率のバランスを目指した多様なアーキテクチャが生まれています。こうした課題に独自のアプローチで取り組んできた代表的なモデルが、DAMO-YOLOとRTDETRv2です。どちらも最先端のリアルタイム推論を目指していますが、アーキテクチャの設計思想は根本的に異なります。
この包括的なガイドでは、両モデルの技術仕様、アーキテクチャのイノベーション、実用的なユースケースを詳しく解説します。また、Ultralytics Platformや最先端のYOLO26などの最新ソリューションが、デプロイと使いやすさに関する業界標準をどのように塗り替えたかも紹介します。
モデルの概要#
DAMO-YOLOについて#
Alibaba Groupの研究者が開発したDAMO-YOLOは、ニューラルアーキテクチャサーチ(NAS)を大いに活用する、高速かつ高精度な物体検出手法です。従来の手作業で設計されたバックボーンを、低レイテンシを目指してNASで生成した構造に置き換えています。さらに、効率的なRepGFPN(再パラメーター化汎用特徴ピラミッドネットワーク)とZeroHead設計を取り入れ、特徴集約とバウンディングボックス予測を効率化しています。
主なモデル情報:
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv:2211.15444v2
- GitHub:tinyvision/DAMO-YOLO
- ドキュメント: DAMO-YOLOのドキュメント
RTDETRv2について#
BaiduのRTDETRv2は、リアルタイム検出Transformerに大きな進歩をもたらします。アンカーボックスとNon-Maximum Suppression(NMS)に依存する従来の畳み込みニューラルネットワーク(CNN)とは異なり、RTDETRv2は自己注意機構を活用して画像全体のコンテキストを捉えます。バウンディングボックスを直接出力するため、NMSの後処理を完全に省略できます。また、「フリービーの詰め合わせ」トレーニング戦略を導入しており、推論レイテンシを増やすことなくベースライン精度を向上させます。
主なモデル情報:
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETRリポジトリ
- ドキュメント: RTDETRv2のドキュメント
Transformerはより多くの計算リソースを必要としますが、グローバルなコンテキストを処理できるため、複雑なシーン理解に非常に効果的です。これはRTDETRv2の大きな強みです。
パフォーマンス比較#
実環境へのデプロイに向けてこれらのモデルを評価する際は、平均適合率(mAP)、推論速度、メモリフットプリントなどの指標が重要です。RTDETRv2などのTransformerベースのモデルは一般に、DAMO-YOLOなどの軽量なCNNと比べて、トレーニング時と推論時により多くのCUDAメモリを必要とします。
以下では、両モデルの性能指標を詳しく比較します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
最適なユースケース#
DAMO-YOLOが優れている場面: NASで最適化したバックボーンと、小型バリアント(DAMO-YOLOtなど)の非常に少ないパラメーター数により、リソースが厳しく制約されたハードウェアへのデプロイに適しています。ONNXなどのランタイムや、エッジコンピューティング向けの専用TensorRTエンジンを使用して組み込みデバイス向けのソリューションを構築する場合、DAMO-YOLOは応答性の高いフレームワークを提供します。
RTDETRv2が優れている場面: サーバーグレードのGPUを利用でき、画像全体のコンテキストが非常に重要となるシナリオでは、RTDETRv2が優れた性能を発揮します。Transformerアーキテクチャにより、NMSを使わずに重なり合うバウンディングボックスを自然に処理できます。そのため、遠く離れた物体間の空間的な関係が重要となる、密集した群衆管理や複雑な物体追跡に適した堅牢な選択肢です。
Ultralyticsの強み:YOLO26の紹介#
DAMO-YOLOとRTDETRv2は学術的に大きな成果を挙げていますが、これらのモデルをスケーラブルで本番環境に対応したアプリケーションへ移行するのは容易ではありません。開発者は、コードベースの分断、マルチタスク学習への対応不足、複雑なデプロイパイプラインに直面することがよくあります。
Ultralyticsエコシステムは、こうした点で真価を発揮します。使いやすさ、適切に保守されたPython API、比類のない汎用性を重視することで、開発者がデバッグに費やす時間を減らし、開発に集中できるよう支援します。
最近リリースされたUltralytics YOLO26モデルは、これらの利点をさらに高め、DAMO-YOLOとRTDETRv2の両方を上回る画期的な進歩を実現します。
- エンドツーエンドのNMSフリーデザイン: YOLOv10で初めて導入されたYOLO26は、オプションのエンドツーエンドヘッド(
nms=False)を備えています。これによりNMSの後処理が不要になり、従来のCNNよりも高速かつ大幅に簡単にデプロイでき、RTDETRv2のダイレクト出力と同様の利点を実現します。 - CPU推論が最大43%高速: YOLO26nは、CPU上のONNXでYOLO11nより最大43%高速に動作し、ディスクリートGPUを搭載しないエッジAIデバイス向けに高度に最適化されています。そのため、メモリ消費の大きいTransformerと比較して、IoTアプリケーションに非常に適した選択肢です。
- MuSGDオプティマイザー: Moonshot AIのKimi K2に着想を得た、SGDとMuonのハイブリッドです。大規模言語モデル(LLM)のトレーニングにおける革新をコンピュータビジョンにもたらし、非常に安定したトレーニングと高速な収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数は、小さな物体の認識を大きく改善します。これは、従来のモデルが苦手とする領域です。航空画像やドローンのアプリケーションでは特に重要です。
- DFLの削除: Distribution Focal Lossを削除することで、エクスポート形式を簡素化し、低消費電力のエッジデバイスとの互換性を高めています。
- 比類のない汎用性: 検出のみに限定される競合モデルとは異なり、YOLO26は幅広いタスクに特化した改善を取り入れています。たとえば、Oriented Bounding Boxes(OBB)向けの専用角度損失、ピクセル単位の高精度を実現するセマンティックセグメンテーション損失、姿勢推定向けの残差対数尤度推定(RLE)などがあります。
RTDETRv2のようなTransformerベースのモデルのトレーニングには膨大なCUDAメモリが必要となり、高額なマルチGPU構成が必要になることも少なくありません。Ultralytics YOLOモデルは、トレーニングと推論の両方で必要なメモリを大幅に抑え、研究者や愛好家にもAI開発を身近なものにします。
コード例: 統合されたUltralytics API#
Ultralyticsエコシステムの大きな利点の1つは、統合されたAPIです。ワークフローを変更することなく、PyTorch実装のRT-DETRや最先端のYOLOモデルなど、さまざまなモデルをシームレスに読み込み、トレーニングし、検証できます。
from ultralytics import RTDETR, YOLO
# RT-DETRモデルを読み込む
model_rtdetr = RTDETR("rtdetr-l.pt")
# 最先端のYOLO26モデルを読み込みます
model_yolo = YOLO("yolo26n.pt")
# シンプルで統一されたインターフェースで画像の推論を実行します
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# 検出されたオブジェクトを表示します
results_yolo[0].show()このシンプルさは、カスタムデータセットのトレーニングやエクスポートにも及びます。Ultralytics Pythonパッケージを利用すれば、トレーニング済みの重みをCoreMLやOpenVINOなどのデプロイプラットフォームに、1つのコマンドで簡単に送信できます。
まとめとさらなる探索#
DAMO-YOLOとRTDETRv2は、リアルタイム物体検出の可能性を間違いなく広げてきました。DAMO-YOLOは、高い効率を実現するために最適化されたネットワーク構造を自動探索で生成し、RTDETRv2は、NMSのような従来のボトルネックを排除することで、Transformerがリアルタイム処理でも競争力を発揮できることを示しています。
しかし、パフォーマンス、包括的なドキュメント、本番環境への対応力の最適なバランスを求める開発者にとって、Ultralytics YOLOモデルは引き続き最高水準の選択肢です。YOLO26の登場により、オプションのTransformer風エンドツーエンド検出、LLMに着想を得たトレーニング効率、卓越したCPU速度を、直感的で堅牢なエコシステムで利用できます。
次のプロジェクトに向けてモデルを評価している場合は、EfficientDetとRT-DETRの比較、前世代のYOLO11、またはYOLOXなどの学術的なベースラインに関する比較もご覧ください。Ultralyticsクイックスタートガイドを確認して、さっそく開発を始めましょう。