DAMO-YOLO vs RTDETRv2#
急速に進化するコンピュータビジョンの分野では、速度、精度、計算効率のバランスを取るよう設計された、印象的な数々のアーキテクチャが生み出されています。これらの課題の解決に独自のアプローチで貢献してきた代表的な2つのモデルが、DAMO-YOLOとRTDETRv2です。どちらもリアルタイム推論向けの最先端ソリューションを提供することを目指していますが、アーキテクチャに対する基本的な考え方は大きく異なります。
この包括的なガイドでは、両モデルの技術仕様、アーキテクチャ上の革新、実用的なユースケースを詳しく解説するとともに、Ultralytics Platformや最先端のYOLO26といった最新ソリューションが、デプロイと使いやすさに関する業界標準をどのように再定義したかを探ります。
モデルの概要#
DAMO-YOLOを理解する#
Alibaba Groupの研究者によって開発されたDAMO-YOLOは、Neural Architecture Search (NAS)に大きく依存する、高速かつ高精度な物体検出手法を導入しています。従来の手作業で設計されたバックボーンを、低レイテンシ向けに設計されたNAS生成構造へ置き換えています。さらに、効率的なRepGFPN(再パラメータ化汎用特徴ピラミッドネットワーク)とZeroHead設計を組み込み、特徴量の集約とバウンディングボックスの予測を効率化しています。
モデルの主な詳細:
- 著者: Xianzhe Xu、Yiqi Jiang、Weihua Chen、Yilun Huang、Yuan Zhang、Xiuyu Sun
- 組織: Alibaba Group
- 日付: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- ドキュメント: DAMO-YOLO Documentation
RTDETRv2を理解する#
BaiduのRTDETRv2は、Real-Time Detection Transformersにおける大きな進歩を示しています。アンカーボックスとNon-Maximum Suppression (NMS)に依存する従来のConvolutional Neural Networks (CNNs)とは異なり、RTDETRv2はセルフアテンション機構を利用して画像全体のコンテキストを把握します。バウンディングボックスを直接出力するため、NMSの後処理を完全に回避できます。このモデルは、推論レイテンシを増加させずにベースライン精度を向上させる「bag of freebies」トレーニング戦略を導入しています。
モデルの主な詳細:
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETRリポジトリ
- Docs: RTDETRv2ドキュメント
Transformerはより多くの計算リソースを必要としますが、グローバルコンテキストを処理できるため、複雑なシーン理解に非常に効果的です。これはRTDETRv2の大きな強みです。
性能比較#
実際のデプロイに向けてこれらのモデルを評価する際には、Mean Average Precision (mAP)、推論速度、メモリフットプリントなどのパラメータが重要です。RTDETRv2のようなTransformerベースのモデルは、DAMO-YOLOのような軽量CNNと比較して、トレーニングと推論の両方で一般的により多くのCUDAメモリを必要とします。
以下に、両モデルのパフォーマンス指標を詳しく比較します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
理想的なユースケース#
DAMO-YOLOが優れている点: NASで最適化されたバックボーンと、小型バリアント(DAMO-YOLOtなど)における非常に少ないパラメータ数により、リソースが厳しく制限されたハードウェアへのデプロイに非常に適しています。ONNXのようなランタイムや、エッジコンピューティング向けの専用TensorRTエンジンを使用して組み込みデバイス向けのソリューションを構築する場合、DAMO-YOLOは非常に応答性の高いフレームワークを提供します。
RTDETRv2が優れている点: RTDETRv2は、サーバーグレードのGPUを利用でき、画像全体のコンテキストが極めて重要なシナリオで力を発揮します。そのTransformerアーキテクチャは、NMSなしで重複するバウンディングボックスを自然に解決できるため、空間的に離れたオブジェクト間の関係が重要となる高密度なcrowd managementや複雑なobject trackingに適した堅牢な選択肢です。
Ultralyticsの優位性: YOLO26のご紹介#
DAMO-YOLOとRTDETRv2は大きな学術的成果を示していますが、これらのモデルをスケーラブルで本番環境に対応したアプリケーションへ移行することは容易ではありません。開発者は、分断されたコードベース、マルチタスク学習のサポート不足、複雑なデプロイパイプラインに直面することがよくあります。
ここでUltralytics ecosystemが真価を発揮します。使いやすさ、適切に保守されたPython API、そして比類のない柔軟性を重視することで、Ultralyticsは開発者がデバッグに費やす時間を減らし、構築により多くの時間を使えるようにします。
最近リリースされたUltralytics YOLO26モデルは、これらの利点をさらに進化させ、DAMO-YOLOとRTDETRv2の双方を上回る画期的な機能を提供します。
- エンドツーエンドのNMSフリー設計: YOLOv10で初めて導入されたこの設計により、YOLO26はネイティブにエンドツーエンドで動作します。NMSの後処理を完全に排除するため、従来のCNNよりもデプロイが高速かつ大幅に簡素化され、RTDETRv2の直接出力の利点も実現します。
- CPU推論が最大43%高速: ディスクリートGPUを搭載しないedge AI devices向けに重点的に最適化されているため、メモリを大量に消費するTransformerと比較して、IoTアプリケーションに大幅に適した選択肢となります。
- MuSGD Optimizer: Moonshot AIのKimi K2に着想を得た、SGDとMuonのハイブリッドです。Large Language Model (LLM)のトレーニングにおける革新をコンピュータビジョンにもたらし、非常に安定したトレーニングとより高速な収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数は、モデルが従来苦手としてきた小さなオブジェクトの認識を大幅に改善します。これはaerial imageryやドローンアプリケーションにとって重要です。
- DFLの削除: Distribution Focal Lossを削除することで、エクスポート形式を簡素化し、低消費電力のエッジデバイスとの互換性を高めています。
- 比類のない柔軟性: 検出に厳しく限定された競合モデルとは異なり、YOLO26は、Oriented Bounding Boxes (OBB)向けの専用角度損失、ピクセル単位の高精度を実現するセマンティックセグメンテーション損失、Pose estimation向けのResidual Log-Likelihood Estimation (RLE)など、あらゆるタスクに特化した改善を備えています。
RTDETRv2のようなTransformerベースのモデルのトレーニングには膨大なCUDAメモリの割り当てが必要で、多くの場合、高コストなマルチGPU構成が求められます。Ultralytics YOLOモデルは、トレーニングと推論の両方で必要なメモリを大幅に抑え、研究者やホビイストにもAI開発の機会を広げます。
コード例: 統合されたUltralytics API#
Ultralyticsエコシステムの最大のメリットの1つは、その統合されたAPIです。ワークフローを変更することなく、PyTorch版のRT-DETRや最先端のYOLOモデルなど、さまざまなモデルをシームレスにロード、トレーニング、および検証できます。
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
results_yolo[0].show()このシンプルさは、custom dataset trainingとエクスポートにも及びます。Ultralytics Python packageを使用すれば、開発者はトレーニング済みの重みを、CoreMLやOpenVINOなどのデプロイプラットフォームへ1つのコマンドで簡単に送ることができます。
まとめとさらなる探索#
DAMO-YOLOとRTDETRv2は、リアルタイム物体検出で可能なことの限界を確実に押し広げました。DAMO-YOLOは、純粋な効率性を追求した高度に最適化された自動探索ネットワーク構造を提供する一方、RTDETRv2は、NMSのような従来のボトルネックを排除することで、Transformerがリアルタイム分野で競争できることを実証しています。
しかし、パフォーマンス、包括的なドキュメント、本番環境への対応力の究極のバランスを求める開発者にとって、Ultralytics YOLO modelsは依然としてゴールドスタンダードです。YOLO26の導入により、ユーザーはTransformerのようなエンドツーエンド検出、LLMに着想を得たトレーニング効率、比類のないCPU速度を、直感的で堅牢なエコシステム内で利用できます。
次のプロジェクトに向けてモデルを評価している場合は、EfficientDet vs RT-DETRの比較を参照したり、前世代のYOLO11を探索したり、YOLOXなどの学術的ベースラインを確認したりするのも役立つでしょう。Ultralyticsクイックスタートガイドを探索して、今すぐ開発を始めましょう。