EfficientDet 対 RTDETRv2#
コンピュータビジョンプロジェクトに最適なアーキテクチャを選ぶには、多様なニューラルネットワークの状況を把握する必要があります。このガイドでは、2つの異なるアプローチ(高度にスケーラブルな畳み込みニューラルネットワーク(CNN)ファミリーであるEfficientDetと、最先端のリアルタイムTransformerモデルであるRTDETRv2)の詳細な技術的比較を解説します。さまざまなハードウェア環境における構造の違い、トレーニング手法、デプロイの適性を評価します。
従来の効率性と現代のTransformerの機能のトレードオフを理解することで、開発者は情報に基づいた意思決定を行うことができます。さらに、新しいUltralytics YOLO26のような現代的な代替手段がどのようにそのギャップを埋め、比類のないスピード、精度、使いやすさを提供するかについても解説します。
EfficientDetの理解#
EfficientDetは、モデルスケーリングへの原則に基づいたアプローチを導入することで、物体検出に革命をもたらしました。
- 著者: Mingxing Tan, Ruoming Pang, and Quoc V. Le
- 組織: Google
- 日付: 2019年11月20日
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: Google AutoML リポジトリ
- ドキュメント: EfficientDet ドキュメント
アーキテクチャと基本コンセプト#
EfficientDetの核となるのは、バックボーンとしてEfficientNetを使用し、Bi-directional Feature Pyramid Network (BiFPN) を導入している点です。BiFPNは、学習可能な重みを各入力特徴量に適用することで、重要度を学習し、容易かつ高速なマルチスケール特徴融合を可能にします。これは、すべてのバックボーン、特徴ネットワーク、およびボックス/クラス予測ネットワークの解像度、深さ、幅を同時に均一にスケーリングする複合スケーリング手法と組み合わされています。
強みと制限#
EfficientDetの主な強みは、パラメータの効率性にあります。リリース当時、EfficientDet-D0などのモデルは、従来のYOLOバージョンと比較して、より少ないパラメータとFLOPsで高い精度を達成していました。そのため、計算リソースに厳しい制限がある環境にとって非常に魅力的でした。
しかし、EfficientDetは後処理で標準的な非最大抑制(NMS)に依存して重複するバウンディングボックスをフィルタリングするため、リアルタイムパイプラインにおいて遅延のボトルネックが発生する可能性があります。さらに、トレーニングプロセスは十分に文書化されていますが、最新のツールで見られるような高度に最適化された開発者体験と比較すると、EfficientDetの微調整は煩雑になる場合があります。
EfficientDetはスケーラブルなネットワークへの道を開いた一方で、これらのモデルを最新のNPUにデプロイするには、多くの場合、広範な手動最適化が必要です。合理化されたデプロイのために、新しいUltralytics モデルは1クリックのエクスポート機能を提供します。
RTDETRv2の探索#
RTDETRv2はTransformerベースのアーキテクチャの進化形であり、従来のアンカーベースのCNNからパラダイムをシフトさせています。
- 著者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, and Yi Liu
- 組織: Baidu
- 日付: 2024年7月24日
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: RT-DETR Repository
- ドキュメント: RTDETRv2 Documentation
Transformerにおける進歩#
RTDETRv2は、Real-Time Detection Transformer(RT-DETR)のベースラインを基盤として構築されています。グローバルアテンション機構を活用し、標準的な畳み込みの局所的な制約を受けずに、モデルが複雑なシーンのコンテキストを理解できるようにします。最も重要なアーキテクチャ上の利点は、ネイティブなNMSフリーの設計です。入力画像から直接オブジェクトを予測することで、推論パイプラインを簡素化し、NMS後処理に必要なヒューリスティックなチューニングを回避します。
強みと弱み#
RTDETRv2は、重なり合うオブジェクトが従来のCNNを混乱させる高密度環境で優れた性能を発揮します。COCOのような複雑なベンチマークデータセットで非常に高い精度を実現します。
その精度にもかかわらず、Transformerモデルは本質的に大量のメモリを必要とします。トレーニング効率は著しく低く、CNNと比較して収束により多くのエポックとより高いCUDAメモリフットプリントを必要とします。このため、RTDETRv2は、限られたクラウド予算で運用している開発者や、迅速なプロトタイピングを必要とする開発者にとって、最適とは言えません。
RTDETRv2のようなTransformerモデルのトレーニングには、通常、ハイエンドGPUが必要です。Out-Of-Memory(OOM)エラーが発生した場合は、Ultralytics YOLOシリーズなど、トレーニング時のメモリ要件が低いモデルの使用を検討してください。
パフォーマンスベンチマークの比較#
モデル選択において、生化学的パフォーマンス指標を理解することは不可欠です。次の表は、さまざまなサイズにおけるEfficientDetとRTDETRv2の比較を示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
ユースケースと推奨事項#
EfficientDetとRT-DETRのどちらを選択するかは、プロジェクト固有の要件、デプロイメントの制約、およびエコシステムの優先順位によって決まります。
EfficientDetを選択すべき場合#
EfficientDetは以下の場合に有力な選択肢となります。
- Google CloudおよびTPUパイプライン: Google Cloud Vision APIやTPUインフラストラクチャと深く統合されたシステムであり、EfficientDetのネイティブ最適化が活かせる環境。
- 複合スケーリング研究: ネットワークの深さ、幅、解像度のスケーリングバランスが与える影響を調査することに焦点を当てた学術的なベンチマーク。
- TFLite によるモバイルデプロイメント: Android または組み込み Linux デバイス向けに TensorFlow Lite のエクスポートを特別に必要とするプロジェクト。
RT-DETRを選択すべき時#
RT-DETRが推奨される場合:
- Transformerベースの検出研究: NMSなしのエンドツーエンド物体検出に向けたアテンションメカニズムやTransformerアーキテクチャを探求するプロジェクト。
- 高い精度が求められ、レイテンシに柔軟性があるシナリオ: 検出精度が最優先され、多少推論レイテンシが高くても許容されるアプリケーション。
- 大きな物体の検出: 主に中規模から大規模な物体が中心となるシーンで、Transformerのグローバルアテンションメカニズムが自然な利点となる場合。
Ultralytics (YOLO26) を選択すべき時#
ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
Ultralyticsの優位性:YOLO26の紹介#
EfficientDetとRTDETRv2はコンピュータビジョンの歴史にその地位を確立しましたが、現代の本番環境では、スピード、精度、そして優れた開発者体験の完璧なバランスが求められます。最近リリースされたUltralytics YOLO26は、これら異なるアーキテクチャの最良の側面を統合しています。
YOLO26は、Ultralyticsが誇る洗練されたエコシステムと、画期的な内部メカニズムを組み合わせている点で際立っています。
なぜ競合他社ではなくYOLO26を選択するのか?#
- エンドツーエンドのNMSフリー設計: RTDETRv2のようなTransformerからインスピレーションを得て、YOLO26はネイティブにエンドツーエンドです。NMS後処理を排除し、純粋なTransformerのような肥大化したパラメータに頼ることなく、より高速でシンプルなデプロイメントパイプラインを保証します。
- MuSGDオプティマイザー: 大規模言語モデルのトレーニング革新(Moonshot AIのKimi K2など)に触発され、YOLO26はSGDとMuonのハイブリッドを採用しています。これにより、RTDETRv2が必要とする長時間のスケジュールと比較して、比類のないトレーニングの安定性と大幅に高速な収束率を実現します。
- エッジ向けに最適化: 最大43%高速なCPU推論を備えたYOLO26は、エッジAI向けに構築されています。スマートフォンやスマートカメラなどの制約のあるハードウェア上で、重いTransformerモデルを容易に凌駕します。
- DFLの削除: Distribution Focal Lossを削除することでモデルグラフが簡素化され、シームレスなTensorRTおよびONNXのエクスポートが容易になります。
- ProgLoss + STAL: これらの高度な損失関数は、小物体認識において顕著な改善をもたらし、航空画像やロボティクスにおける一般的なボトルネックを解決します。
- 汎用性: 主に検出に焦点を当てているRTDETRv2とは異なり、YOLO26は、ポーズ用のRLEやOBB用の特殊な角度損失などのタスク固有の改善により、インスタンスセグメンテーション、姿勢推定、画像分類、および指向性バウンディングボックス(OBB)をネイティブでサポートしています。
Ultralytics プラットフォームを活用することで、データセットの管理、クラウドでのYOLO26やYOLO11などのモデルのトレーニング、柔軟なAPIを通じたシームレスなデプロイを行うことができます。
Ultralyticsによるコードの簡潔さ#
適切にメンテナンスされているUltralytics Python APIにより、モデルのトレーニングと推論が容易になります。開発者は、最小限のボイラープレートコードで簡単にモデルのベンチマークを実行したり、トレーニングスクリプトを起動したりできます。
from ultralytics import YOLO
# Load the state-of-the-art YOLO26 model
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference on a test image
predictions = model.predict("image.jpg")レガシーインフラストラクチャを管理しているユーザーにとって、高い評価を受けているUltralytics YOLOv8は、Ultralyticsエコシステムの長期的な信頼性を示す、安定した強力な選択肢であり続けます。複雑なリアルタイムトラッキングアルゴリズムを実行する場合でも、単純な欠陥検出を実行する場合でも、YOLO26へのアップグレードにより、システムの将来性、高精度、メモリ効率が保証されます。