Ultralytics YOLO27:
Get Started

RTDETRv2とDAMO-YOLOの比較#

コンピュータービジョンの分野は絶えず進化しており、研究者やエンジニアは速度、精度、効率のバランスに優れたモデルの構築に取り組んでいます。この分野で大きな注目を集めているアーキテクチャが、Baiduが開発したRTDETRv2と、Alibaba Groupが開発したDAMO-YOLOです。どちらもリアルタイム物体検出の限界を押し広げていますが、優れた結果を実現するために、根本的に異なるアーキテクチャの設計思想を採用しています。

この技術比較では、両モデルのアーキテクチャ、トレーニング手法、実環境でのデプロイ機能を詳しく解説します。また、最適化されたUltralytics Platformや最先端のYOLO26アーキテクチャをはじめとする、より広範なエコシステムとの比較も行います。

アーキテクチャの革新#

これらのモデルの基本的な仕組みを理解することは、本番環境に適したツールの選定を担う機械学習エンジニアにとって重要です。

RTDETRv2:Transformerによるアプローチ#

初代RT-DETRの成功を受け継ぐRTDETRv2は、ハイブリッドエンコーダーとTransformerデコーダーを採用しています。この設計により、モデルはグローバルなコンテキストを非常に効果的に処理でき、高密度なシーンで重なり合う物体を見分ける能力に優れています。このアーキテクチャの最大の利点は、ネイティブのNMSフリー(Non-Maximum Suppression)設計です。後処理のNMSステップをなくすことで、RTDETRv2は推論パイプラインを効率化し、さまざまなハードウェア構成でレイテンシーを安定させます。

RTDETRv2の詳細を見る

DAMO-YOLO:CNNの効率性を高める#

一方、DAMO-YOLOは実績のあるCNNベースのYOLO系列を継承しつつ、画期的な改良をいくつか導入しています。NASによるニューラルアーキテクチャサーチを活用してバックボーンを最適化し、特徴抽出の効率を最大限に高めます。さらに、効率的なRepGFPN(再パラメーター化された一般化特徴ピラミッドネットワーク)とZeroHead設計に加え、AlignedOTAや蒸留による強化手法も取り入れています。これらの革新により、DAMO-YOLOは競争力の高いmAPvalスコアを維持しながら、高速な推論を実現します。

DAMO-YOLOの詳細を見る

アーキテクチャの違い

RTDETRv2がNMSを使わずにアテンション機構でグローバルな特徴を理解することに重点を置く一方、DAMO-YOLOはNASと高度な蒸留によって従来型CNNの効率を最大化します。DAMO-YOLOは標準的な後処理を必要としますが、特定のハードウェアでは独自の速度上の利点を発揮します。

パフォーマンスと指標の比較#

デプロイ向けのモデルを評価する際は、平均精度(mAP)、推論速度、パラメーター数などの性能指標が重要です。以下では、2つのモデルファミリーを詳しく比較します。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3

結果の分析#

表に示すように、RTDETRv2-xはmAPvalが54.3で、最も高い精度を達成しています。これは、COCOデータセットのような複雑な検証データにおけるTransformerアーキテクチャの強みを示しています。ただし、その代わりにパラメーター数(76M)とFLOPsが大幅に増加します。

一方、DAMO-YOLOt(Tiny)は非常に軽量で、必要なパラメーター数はわずか8.5Mです。そのため、CUDAメモリーが著しく制限された環境でも、非常に高速な選択肢となります。DAMO-YOLOは一般に、旧世代のエッジデバイスで速度と精度のバランスに優れています。

エコシステム、使いやすさ、Ultralyticsの強み#

公式のRT-DETR GitHubやDAMO-YOLO GitHubのような独立したリポジトリでは、モデルのトレーニングに使えるコードが提供されていますが、本番環境のパイプラインに統合するには、多くの場合、大量の定型コードと手動での最適化が必要です。

Ultralyticsエコシステムは、開発者の作業を大幅に簡素化します。Ultralyticsは、初代RT-DETRのようなTransformer検出器を統一されたAPIに直接統合しているため、1行のコードでモデルのトレーニング、検証、エクスポートを実行できます。さらに、Ultralyticsのモデルは、独立した大規模なTransformerリポジトリと比べて、トレーニング時のメモリー要件が少ないことで知られています。

コード例:シームレスな統合#

Ultralytics Pythonライブラリを活用すれば、簡単に推論を実行できます。Transformerモデルでも最先端のCNNでも、APIの使い方は変わりません。

from ultralytics import RTDETR, YOLO

# 複雑なシーンを理解するためにRT-DETRモデルを読み込みます
model_rtdetr = RTDETR("rtdetr-l.pt")

# 最高のエッジ性能を実現する最新のUltralytics YOLO26モデルを読み込みます
model_yolo26 = YOLO("yolo26n.pt")

# サンプル画像で手軽に推論を実行します
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")

# 結果を表示します
results_yolo[0].show()
本番環境向けのモデルエクスポート

Ultralytics APIを使うと、簡単なmodel.export(format="engine")コマンドで、トレーニング済みモデルをTensorRT、ONNX、CoreMLなどの形式にシームレスにエクスポートでき、デプロイの負担を大幅に軽減できます。

最適なユースケース#

これらのアーキテクチャのどちらを選ぶかは、具体的なプロジェクト要件によって決まります。

  • RTDETRv2は、VRAMに余裕のあるサーバーサイド処理に優れています。グローバルなコンテキストを把握できるため、医用画像や、オクルージョンが頻繁に発生する高密度な群衆の分析に最適です。
  • DAMO-YOLOは、パラメーター数の少なさと高いFPSが厳しく求められる組み込みIoTアプリケーションや高速な産業検査ラインに非常に適しています。

未来を見据えて:Ultralytics YOLO26#

RTDETRv2とDAMO-YOLOにはそれぞれ長所がありますが、コンピュータービジョンの分野は急速に進歩しています。新しいプロジェクトには、速度、精度、開発者体験を究極の形で融合した最新のUltralytics YOLO26が最適です。

YOLO26はエンドツーエンドのNMSフリー設計を採用しており、Transformerの主な利点を大きな計算オーバーヘッドなしで実現します。大規模言語モデルのトレーニングに着想を得た革新的なMuSGDオプティマイザーを取り入れ、安定した高速な収束を実現します。さらに、DFLの削除(エクスポートの簡素化とエッジデバイスや低消費電力デバイスとの互換性向上のため、Distribution Focal Lossを削除)により、YOLO26はCPU推論を最大43%高速化し、エッジコンピューティングで圧倒的な性能を発揮します。また、ProgLoss + STALによって損失関数が改善され、小さな物体の認識性能が大きく向上します。これは、IoT、ロボティクス、航空画像において重要です。

バウンディングボックスだけに限られるモデルとは異なり、YOLO26ファミリーは、インスタンスセグメンテーションや姿勢推定から回転バウンディングボックス(OBB)まで、幅広いタスクに対応する優れた汎用性を備えています。これらは直感的に使えるUltralytics Platformからシームレスに管理できます。

モデルの詳細と参考情報#

RTDETRv2#

DAMO-YOLO#

ほかのモデル比較に関心のある方は、RTDETRv2とYOLO11の比較やDAMO-YOLOとYOLOv8の比較のガイドもご覧ください。これらのモデルとUltralyticsファミリーの旧世代モデルとの性能を比較できます。

コントリビューター

コメント