YOLO Vision 2026:

RTDETRv2 と EfficientDet の比較#

最適馬ニューラルネットワークアーキテクチャの選定は、あらゆるcomputer visionプロジェクトにおいて決定的な選択となります。本包括的テクニカル比較では、最先端のトランスベース検出器であるRTDETRv2と、拡張性の高い畳み込みニューラルネットワークであるEfficientDetという、影響力の大きい2つのオブジェクト検出モデルを詳しく分析します。AIパイプラインでデータ駆動型の意思決定を行えるよう、それぞれの独特なアーキテクチャ、performance metrics、トレーニング手法、そして理想的なデプロイシナリオを評価します。

RTDETRv2: リアルタイム検出用Transformer#

オリジナルのRT-DETRの成功を基に、RTDETRv2はトランスベースのobject detectionパラダイムを洗練させています。エンコーダおよびデコーダ構造を最適化することにより、リアルタイムの推論速度を維持しながら高い精度を実現し、従来のCNNとビジョントランスのギャップを効果的に埋めています。

Model Details Authors: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, and Yi Liu
Organization: Baidu Date: 2024-07-24 Links: Arxiv, GitHub, Docs

アーキテクチャと主な利点#

RTDETRv2は、強力なCNNバックボーン(多くの場合ResNetまたはHGNet)と効率的なトランスデコーダを組み合わせたハイブリッドアーキテクチャを活用しています。RTDETRv2の最も決定的な特徴は、非最大抑制(NMS)をバイパスするネイティブな機能です。従来の検出器では、重複するバウンディングボックスをフィルタリングするためにNMSが必要となり、後処理中に可変のinference latencyが追加されます。RTDETRv2は検出を直接セット予測問題として定式化し、二部マッチングを利用して一意の予測を出力します。

このモデルは、GPUメモリが豊富なサーバーサイドのデプロイで優れたパフォーマンスを発揮します。グローバルアテンション機構により卓越したコンテキスト認識が提供されるため、自動化されたsecurity alarm systemsや密集した群衆監視などの密集して煩雑な環境において、重なり合うオブジェクトを分離する作業に非常に適しています。

制限事項#

強力である一方、トランスアーキテクチャは標準的なCNNと比較してトレーニング中により多くのCUDAメモリを本質的に必要とします。さらに、RTDETRv2のファインチューニングではtraining dataの収束により長い時間がかかる場合があり、迅速なプロトタイピングのリソース負荷がわずかに高くなります。

RTDETRv2の詳細はこちら

EfficientDet: スケーラブルで効率的なCNN#

EfficientDetは、幅広いリソース制約にわたって精度と効率の両方を最適化した、オブジェクト検出モデルのファミリーを導入しました。これは、スケーラブルなmachine vision設計の古典的な例であり続けています。

Model Details Authors: Mingxing Tan, Ruoming Pang, and Quoc V. Le
Organization: Google
Date: 2019-11-20
Links: Arxiv, GitHub, Docs

アーキテクチャと主な利点#

EfficientDetの革新は、双方向特徴ピラミッドネットワーク(BiFPN)と複合スケーリング法の2つの主要な領域にあります。BiFPNは、トップダウンおよびボトムアップのマルチスケール特徴フュージョンを繰り返し適用しながら、学習可能な重みを導入して異なる入力特徴の重要度を学習することで、シンプルかつ高速なマルチスケールfeature extractionを可能にします。複合スケーリング法は、ネットワークの解像度、深さ、および幅を同時に均一にスケールします。

EfficientDetモデルは、超軽量のD0から大規模なD7まで多岐にわたります。これにより、初期のモバイルaugmented realityアプリケーションなど、開発者が厳しい計算バジェットと精度の要件のバランスを取る必要があるedge AIのデプロイに対して非常に多用途になります。

制限事項#

EfficientDetは、アンカーボックスと従来のNMS後処理パイプラインに強く依存する古いアーキテクチャです。アンカー生成プロセスには慎重なhyperparameter tuningが必要であり、NMSステップはRaspberry Piなどの組み込みハードウェアでのデプロイのボトルネックになる可能性があります。また、pose estimationoriented bounding boxes (OBB)などの最新タスクに対するネイティブサポートが不足しています。

EfficientDetについて詳しく知る

パフォーマンスと指標の比較#

これらのモデル間の正確なトレードオフを理解するには、スループットとパラメータ効率を分析する必要があります。以下の表は、最新のRTDETRv2シリーズとスケーラブルなEfficientDetファミリーの比較を示しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

上記のように、RTDETRv2は、ミドルティアのEfficientDetモデルと同等のパラメータ数で、大幅に高いmean Average Precision (mAP)を達成しており、トランスアーキテクチャを大いに活用して精度を高めています。

ユースケースと推奨事項#

RT-DETRとEfficientDetのどちらを選択するかは、特定のプロジェクトの要件、デプロイメントの制約、およびエコシステムの優先順位によって決まります。

RT-DETRを選択すべき時#

RT-DETRは以下のような場合に強力な選択肢です。

  • Transformerベースの検出研究: NMSなしのエンドツーエンド物体検出に向けたアテンションメカニズムやTransformerアーキテクチャを探求するプロジェクト。
  • 高い精度が求められ、レイテンシに柔軟性があるシナリオ: 検出精度が最優先され、多少推論レイテンシが高くても許容されるアプリケーション。
  • 大きな物体の検出: 主に中規模から大規模な物体が中心となるシーンで、Transformerのグローバルアテンションメカニズムが自然な利点となる場合。

EfficientDetを選択すべき場合#

EfficientDetは以下の場合に推奨されます:

  • Google CloudおよびTPUパイプライン: Google Cloud Vision APIやTPUインフラストラクチャと深く統合されたシステムであり、EfficientDetのネイティブ最適化が活かせる環境。
  • 複合スケーリング研究: ネットワークの深さ、幅、解像度のスケーリングバランスが与える影響を調査することに焦点を当てた学術的なベンチマーク。
  • TFLite によるモバイルデプロイメント: Android または組み込み Linux デバイス向けに TensorFlow Lite のエクスポートを特別に必要とするプロジェクト。

Ultralytics (YOLO26) を選択すべき時#

ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。

  • NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
  • CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
  • 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。

Ultralyticsの選択肢:最先端技術の推進#

RTDETRv2とEfficientDetの両方に強い長所がありますが、現代のAI開発では、最先端のパフォーマンスと並行してシームレスなdeveloper experienceを提供するフレームワークが求められています。Ultralytics ecosystemは、コンピュータビジョンタスクに対して大幅に合理化されたアプローチを提供します。

最先端の検出を探索している場合、新しくリリースされたUltralytics YOLO26は、CNNとトランスの両方の優れた側面を統合しています。

なぜYOLO26を選ぶのか?

YOLO26はEnd-to-End NMS-Free Designを実装し、RTDETRv2のデプロイのシンプルさを超効率的なYOLOアーキテクチャにもたらします。さらに、LLMのトレーニング革新にインスパイアされたMuSGD Optimizerを導入し、優れたトレーニング安定性を実現しています。DFL Removal(簡素化されたエクスポートとエッジ/低電力デバイスの互換性の向上のためにDistribution Focal Lossを削除)により、YOLO26は以前の世代と比較して最大43%高速なCPU推論を誇り、より重いモデルよりもedge computingにとって例外的な選択肢となります。さらに、ProgLoss + STALにより、IoT、ロボット工学、および航空写真にとって重要な小物体認識の顕著な改善を伴う改良された損失関数が提供されます。

Ultralytics Python packageが提供する使いやすさは比類のないものです。開発者は、リポジトリの研究で通常必要とされるボイラープレートコードを抽象化する直感的なAPIを使用して、モデルのトレーニング、検証、およびexport modelsを行うことができます。

from ultralytics import RTDETR

# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export for optimized inference on TensorRT
model.export(format="engine")

Ultralyticsモデルは、instance segmentationimage classificationなどの複数のタスクをネイティブにサポートしており、多様な業界のニーズに対応する多彩なツールキットを提供します。さらに、近代的なUltralyticsモデルにおけるDistribution Focal Loss(DFL)の削除により計算グラフが簡素化され、組み込みのNPUs and TPUsへのよりスムーズなエクスポートが保証されます。

シームレスなdata annotationとモデル管理のために、Ultralytics Platformは機械学習ライフサイクル全体を監督するための包括的なクラウド環境を提供し、本番環境で堅牢なコンピュータビジョンソリューションをデプロイするための第一の選択肢として確立しています。

コメント