RTDETRv2とYOLO11の比較#
コンピュータービジョンの分野は絶えず進化しており、新しいアーキテクチャがエッジデバイスやクラウドサーバーで可能なことの限界を押し広げています。現在のリアルタイム物体検出分野を代表する有力なモデルが、RTDETRv2とYOLO11です。どちらも優れた性能を発揮しますが、アーキテクチャの設計思想は根本的に異なります。Transformerベースのアプローチと、高度に最適化された畳み込みニューラルネットワーク(CNN)です。
この包括的な技術比較では、両モデルのアーキテクチャ、性能指標、トレーニング手法、最適なユースケースを解説し、次の人工知能アプリケーションについて十分な情報に基づいて判断できるよう支援します。
RTDETRv2:Transformerベースの挑戦者#
初代Real-Time Detection Transformerを進化させたRTDETRv2は、視覚データの処理にアテンション機構を活用します。画像パッチをシーケンスとして扱うことで、画像全体のコンテキストを把握でき、複雑なシーンで大きく重なり合う物体の検出に特に有効です。
モデルの詳細:
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETRリポジトリ
- ドキュメント: RTDETRv2のドキュメント
アーキテクチャの強みと弱み#
RTDETRv2の主な革新は、エンドツーエンドでNMSを必要としないアーキテクチャです。非極大値抑制(NMS)をなくすことで、後処理パイプラインを簡素化します。また、初代RT-DETRモデルと比べてマルチスケール特徴抽出機能が改善され、さまざまなサイズの物体をより適切に識別できます。
ただし、Transformerに依存するため、RTDETRv2はトレーニング中に大幅に多くのメモリを必要とする傾向があります。Transformerは一般に収束が遅く、従来のCNNよりもはるかに多くのCUDAメモリを必要とします。そのため、一般消費者向けハードウェアを使用する研究者や、リソースが限られたエッジAI環境にデプロイする場合には、導入のハードルが高くなります。
Ultralytics YOLO11:CNN効率の最高峰#
長年にわたる基礎研究を踏まえ、UltralyticsはYOLO系列を大きく前進させるモデルとしてYOLO11をリリースしました。CNNアーキテクチャを改良して前例のない速度と精度を実現し、コミュニティが期待する柔軟性と開発者に使いやすいエコシステムも維持しています。
モデルの詳細:
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024年9月27日
- GitHub: Ultralyticsリポジトリ
Ultralyticsの強み#
YOLO11の強みは、性能のバランスです。速度と精度の間で優れたトレードオフを実現し、大規模なクラウドコンピューティングクラスターから軽量なモバイルデバイスまで、多様な実環境へのデプロイに高い汎用性を発揮します。
さらに、Ultralytics YOLOモデルは、トレーニング時と推論時のメモリ使用量が少ないことで知られています。VRAMを容易に使い切るTransformerモデルとは異なり、YOLO11では標準的なGPUでもバッチサイズを大きくできます。また、YOLO11は物体検出だけにとどまらず、インスタンスセグメンテーション、画像分類、姿勢推定、方向付きバウンディングボックス(OBB)をネイティブにサポートする、優れた汎用性を備えています。
パフォーマンスと指標の比較#
数値を直接比較すると、RTDETRv2は優れた精度を実現する一方、YOLO11はモデルサイズをより細かく選べ、特にTensorRTで優れた推論速度を発揮することが分かります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
表に示すように、YOLO11xモデルは、RTDETRv2-xと比べてFLOPsが少なく(195.3B対259B)、TensorRTでの推論も高速(11.3ms対15.03ms)でありながら、優れたmAPval(54.7%)を達成します。YOLO11のnanoおよびsmallバリアントは、Raspberry Piのようなリソースが限られたデバイスに、比類のない軽量な選択肢を提供します。
エコシステム、使いやすさ、トレーニング#
Ultralyticsモデルの特徴は、ユーザー体験が合理化されていることです。ultralytics Pythonパッケージは、データ拡張、分散トレーニング、モデルのエクスポートといった複雑な処理を担う、統一された直感的なAPIを提供します。RTDETRv2の研究用リポジトリでは多くの定型コードや設定が必要ですが、Ultralyticsは「ゼロからエキスパートへ」のパイプラインを提供します。
Ultralyticsのエコシステムは非常に堅牢で、YOLOモデルと並行してRT-DETRモデルもネイティブに実行できます。これにより、Weights & BiasesやComet MLとの連携を含む、Ultralyticsの十分にメンテナンスされたエコシステムを活用して、実験を簡単に追跡できます。
from ultralytics import RTDETR, YOLO
# Ultralytics APIを通じてRTDETRモデルをシームレスに読み込む
model_rtdetr = RTDETR("rtdetr-l.pt")
# 高度に最適化されたYOLO11モデルを読み込む
model_yolo = YOLO("yolo11n.pt")
# メモリを非常に効率的に使用してYOLO11をトレーニングする
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# トレーニング済みYOLOモデルをONNX形式にエクスポートする
model_yolo.export(format="onnx")機械学習では、トレーニング効率が最も重要です。Ultralyticsモデルは、迅速に収束する事前学習済みの重みを使用します。コードを書かずにデータセット、トレーニング実行、デプロイエンドポイントを管理するには、統合されたMLOps体験を提供するUltralytics Platformをご利用ください。
実際の用途#
これらのアーキテクチャのどちらを選ぶかは、多くの場合、プロジェクト固有のデプロイ制約によって決まります。
RTDETRv2が優れている場面: RTDETRv2のTransformerバックボーンは、グローバルコンテキストが必要な、物体が密集し大きく遮蔽されたシナリオで非常に効果的です。計算予算よりも、アテンションに基づく関係性の把握が重視される学術研究やアプリケーションで評価されることがよくあります。
YOLO11が優れている場面: YOLO11は、実用的な実環境へのデプロイにおいて圧倒的な性能を発揮します。メモリ使用量が少なく、推論速度も非常に速いため、次の用途に適しています。
- スマート製造: 産業用PCを使って、生産ラインでリアルタイムに欠陥を検出します。
- 農業: ドローンにデプロイして、作物の生育状況をリアルタイムで監視し、収穫ロボットを自動化します。
- 小売分析: 大規模なサーバーファームを必要とせず、複数のカメラ映像を並行して処理し、行列管理や在庫追跡を行います。
ユースケースと推奨事項#
RT-DETRとYOLO11のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに関する好みによって異なります。
RT-DETRを選ぶケース#
RT-DETRは、次のような用途に適しています。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
YOLO11を選ぶ場合#
YOLO11は、次の用途に推奨されます:
- 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最優先となる、Raspberry PiやNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
- マルチタスクのビジョンアプリケーション: 単一の統合フレームワークで、検出、セグメンテーション、姿勢推定、OBBを必要とするプロジェクト。
- 迅速なプロトタイピングとデプロイメント: 効率化されたUltralytics Python APIを使って、データ収集から本番環境への移行を迅速に進めたいチーム。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
今後の展望:YOLO26の登場#
新しいプロジェクトを始める場合は、次世代のビジョンAIであるUltralytics YOLO26もご検討ください。2026年1月にリリースされたYOLO26は、両者の長所を取り入れています。RTDETRv2と同様にNMS後処理を不要にする、オプションのエンドツーエンドNMS不要ヘッド(nms=False。その先駆けとなったのはYOLOv10です)を導入しながら、CNNならではの比類のない速度を実現します。
YOLO26は、LLMトレーニングの革新に着想を得たMuSGDオプティマイザーを採用し、非常に安定した高速な収束を実現します。また、Distribution Focal Loss(DFL)を取り除くことで、CPU推論を最大43%高速化します。さらに、専用のProgLoss + STAL損失関数により小物体の認識精度を大幅に向上させており、現代のコンピュータービジョンパイプラインに最適なモデルです。
実績ある汎用性を重視してYOLO11を選ぶ場合も、アテンション機構を重視してRTDETRv2を選ぶ場合も、最先端のエッジ性能を求めてYOLO26を選ぶ場合も、Ultralyticsドキュメントにはコンピュータービジョンの取り組みを成功させるために必要なリソースが揃っています。