RTDETRv2とEfficientDet#
最適なニューラルネットワークアーキテクチャの選定は、あらゆるコンピュータービジョンプロジェクトにおける重要な判断です。この包括的な技術比較では、影響力の大きい2つの物体検出モデル、最先端のTransformerベース検出器RTDETRv2と、高いスケーラビリティを備えた畳み込みニューラルネットワークEfficientDetを詳しく分析します。それぞれのアーキテクチャの違い、性能指標、トレーニング手法、最適なデプロイシナリオを評価し、AIパイプラインにおけるデータに基づいた判断を支援します。
RTDETRv2:リアルタイム物体検出Transformer#
初代RT-DETRの成功を受け継ぐRTDETRv2は、Transformerベースの物体検出手法をさらに洗練させています。エンコーダーとデコーダーの構造を最適化することで、高い精度とリアルタイムの推論速度を両立し、従来型CNNとビジョンTransformerの隔たりを効果的に埋めています。
モデルの詳細
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- リンク: Arxiv、GitHub、ドキュメント
アーキテクチャと主な強み#
RTDETRv2は、強力なCNNバックボーン(多くの場合ResNetまたはHGNet)と効率的なTransformerデコーダーを組み合わせたハイブリッドアーキテクチャを採用しています。RTDETRv2の最大の特長は、ネイティブに非最大値抑制(NMS)を回避できることです。従来の検出器では、重複したバウンディングボックスを除去するためにNMSが必要となり、後処理時の推論レイテンシーが変動します。RTDETRv2は、二部マッチングを使った直接的な集合予測問題として検出を定式化し、重複のない予測を出力します。
このモデルは、GPUメモリーに余裕のあるサーバーサイドのデプロイに適しています。グローバルアテンション機構によって優れたコンテキスト認識を実現するため、自動化された警報システムや高密度な群衆監視のように、物体が密集して雑然とした環境でも、重なり合う物体を見分ける能力に優れています。
制限事項#
Transformerアーキテクチャは高い性能を発揮する一方、トレーニング時に標準的なCNNより多くのCUDAメモリーを必要とします。さらに、RTDETRv2のファインチューニングではトレーニングデータの収束に時間がかかる場合があり、迅速なプロトタイピングでも、やや多くのリソースが必要になります。
EfficientDet:スケーラブルで効率的なCNN#
EfficientDetは、幅広いリソース制約のもとで精度と効率の両方を最適化した物体検出モデルのファミリーです。スケーラブルなマシンビジョン設計の古典的な例として、現在も広く知られています。
モデルの詳細
アーキテクチャと主な強み#
EfficientDetの革新は、双方向特徴ピラミッドネットワーク(BiFPN)と複合スケーリング手法という2つの主要な要素にあります。BiFPNは、入力特徴の重要度を学習可能な重みで表し、トップダウンとボトムアップのマルチスケール特徴融合を繰り返すことで、シンプルかつ高速なマルチスケール特徴抽出を実現します。複合スケーリング手法は、ネットワークの解像度、深さ、幅を同時に一様に拡大します。
EfficientDetモデルには超軽量のD0から大規模なD7まであります。そのため、初期のモバイル拡張現実アプリケーションのように、限られた計算予算と精度要件のバランスが求められるエッジAIのデプロイに幅広く対応できます。
制限事項#
EfficientDetは古いアーキテクチャであり、アンカーボックスと従来型のNMS後処理パイプラインに大きく依存しています。アンカーの生成には慎重なハイパーパラメーター調整が必要です。また、NMSステップがRaspberry Piのような組み込みハードウェアでのデプロイのボトルネックになることがあります。さらに、姿勢推定や回転バウンディングボックス(OBB)といった最新のタスクをネイティブにはサポートしていません。
パフォーマンスと指標の比較#
これらのモデルの具体的なトレードオフを理解するには、スループットとパラメーター効率を分析する必要があります。以下の表では、最新のRTDETRv2シリーズとスケーラブルなEfficientDetファミリーを比較します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
上記のように、RTDETRv2は同程度のサイズのEfficientDetモデルと同等以上の平均精度(mAP)を実現しながら、GPU上で大幅に高速に動作します(たとえば、RTDETRv2-lは9.76 msで53.4 mAP、EfficientDet-d6は89.29 msで52.6 mAP)。Transformerアーキテクチャを最大限に活用して精度を高めています。
ユースケースと推奨事項#
RT-DETRとEfficientDetのどちらを選ぶかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムに関する好みによって決まります。
RT-DETRを選ぶケース#
RT-DETRは、次のような用途に適しています。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
EfficientDetを選ぶタイミング#
EfficientDetは次のような用途に推奨されます。
- Google CloudとTPUパイプライン: EfficientDetがネイティブに最適化されている、Google Cloud Vision APIやTPUインフラと緊密に統合されたシステム。
- 複合スケーリングの研究: ネットワークの深さ、幅、解像度をバランスよくスケーリングする効果の研究に焦点を当てた学術的なベンチマーク。
- LiteRTによるモバイルデプロイ: Androidまたは組み込みLinuxデバイス向けに、LiteRT(旧称TensorFlow Lite)形式へのエクスポートが特に必要なプロジェクト。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsという選択肢:最先端技術をさらに進化させる#
RTDETRv2とEfficientDetにはそれぞれ優れた点がありますが、現代のAI開発では、最先端の性能とシームレスな開発者エクスペリエンスを両立するフレームワークが求められます。Ultralyticsエコシステムは、コンピュータービジョンタスクを大幅に効率化するアプローチを提供します。
最先端の物体検出を検討している場合、新たにリリースされたUltralytics YOLO26は、CNNとTransformerの双方の長所を融合しています。
YOLO26は、オプションのエンドツーエンドNMSフリーデザイン(nms=False)を実装し、超効率的なYOLOアーキテクチャにRTDETRv2のデプロイの容易さをもたらします。さらに、LLMのトレーニングにおける革新に着想を得たMuSGDオプティマイザーを導入し、トレーニングの安定性を高めています。DFLの削除(Distribution Focal Lossを削除してエクスポートを簡素化し、エッジデバイスや低消費電力デバイスとの互換性を向上)により、YOLO26は前世代と比べてCPU推論が最大43%高速になり、より大規模なモデルよりもエッジコンピューティングに適した優れた選択肢となっています。さらに、ProgLoss + STALは損失関数を改善し、小さな物体の認識を大幅に向上させます。これはIoT、ロボティクス、航空画像に不可欠です。
Ultralytics Pythonパッケージは、比類のない使いやすさを提供します。開発者は、研究用リポジトリで通常必要となる定型コードを抽象化した直感的なAPIを使って、モデルのトレーニング、検証、エクスポートを実行できます。
from ultralytics import RTDETR
# Ultralyticsエコシステムから事前トレーニング済みのRT-DETRモデルを読み込みます
model = RTDETR("rtdetr-l.pt")
# COCO8データセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# TensorRTでの最適化された推論用にエクスポートします
model.export(format="engine")Ultralyticsモデルは、インスタンスセグメンテーションや画像分類など、複数のタスクをネイティブにサポートし、幅広い業界のニーズに対応する汎用的なツールキットを提供します。さらに、最新のUltralyticsモデルではDistribution Focal Loss(DFL)を削除して計算グラフを簡素化しているため、組み込み型のNPUsおよびTPUsへのエクスポートがよりスムーズになります。
シームレスなデータアノテーションとモデル管理を実現するUltralytics Platformは、機械学習のライフサイクル全体を管理する包括的なクラウド環境を提供し、本番環境で堅牢なコンピュータービジョンソリューションをデプロイする際の最適な選択肢となります。