RTDETRv2とYOLO11の比較#
コンピュータビジョンの領域は絶えず進化しており、新しいアーキテクチャがエッジデバイスやクラウドサーバーで可能なことの境界を押し広げています。現在、リアルタイム物体検出の分野で最も注目されている2つのモデルが、RTDETRv2とYOLO11です。どちらのモデルも優れたパフォーマンスを発揮しますが、その設計思想は根本的に異なります。一方はTransformerベースのアプローチであり、もう一方は高度に最適化された畳み込みニューラルネットワーク(CNN)です。
この包括的な技術比較では、両モデルのアーキテクチャ、パフォーマンス指標、トレーニング方法、および理想的なユースケースを検討し、次回の人工知能アプリケーション開発において情報に基づいた意思決定ができるようサポートします。
RTDETRv2:Transformerベースのチャレンジャー#
オリジナルのReal-Time Detection Transformerの進化形として導入されたRTDETRv2は、アテンションメカニズムを活用して視覚データを処理します。画像パッチをシーケンスとして扱うことで、画像コンテキストをグローバルに理解することができ、複雑なシーンで重なり合う物体を検出する際に非常に有益です。
モデル詳細:
- 著者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, and Yi Liu
- 組織: Baidu
- 日付: 2024年7月24日
- Arxiv: 2407.17140
- GitHub: RT-DETR Repository
- ドキュメント: RTDETRv2 Documentation
アーキテクチャの利点と欠点#
RTDETRv2の最大の革新は、エンドツーエンドのNMSフリーアーキテクチャです。Non-Maximum Suppression(NMS)を排除することで、後処理パイプラインが簡素化されます。さらに、マルチスケール特徴抽出機能がオリジナルのRT-DETR modelから改良されており、さまざまなサイズのオブジェクトをより正確に識別できるようになっています。
しかし、Transformerに依存しているため、RTDETRv2は通常、トレーニング中のメモリ要件が大幅に高くなるという課題があります。Transformerは一般的に収束が遅く、従来のCNNと比較して大幅に多くのCUDAメモリを必要とするため、コンシューマー向けのハードウェアで運用する研究者や、制約のあるedge AI環境にデプロイする場合にはアクセスしにくくなります。
Ultralytics YOLO11:CNN効率の頂点#
長年の基礎研究の上に構築されたUltralyticsは、YOLO系統の大きな飛躍としてYOLO11をリリースしました。これはCNNアーキテクチャを洗練させ、前例のない速度と精度を実現しつつ、コミュニティが期待する柔軟で開発者にとって使いやすいエコシステムを維持しています。
モデル詳細:
- 著者: Glenn Jocher and Jing Qiu
- 組織: Ultralytics
- 日付: 2024年9月27日
- GitHub: Ultralytics リポジトリ
Ultralyticsの利点#
YOLO11はそのパフォーマンスのバランスにおいて優れています。速度と精度の間で圧倒的なトレードオフを実現しており、大規模なcloud computingクラスターから軽量なモバイルデバイスまで、多様な現実世界のデプロイシナリオに対して非常に多用途に対応します。
さらに、Ultralytics YOLOモデルは、トレーニングおよび推論中のメモリ使用量が少ないことで知られています。VRAMを簡単に使い果たしてしまう可能性のあるTransformerモデルとは異なり、YOLO11では標準GPU上でより大きなバッチサイズを使用できます。さらに、YOLO11は単なる物体検出にとどまらず、Instance Segmentation、Image Classification、Pose Estimation、Oriented Bounding Boxes (OBB)のネイティブサポートを備えた、驚異的な多様性を誇ります。
パフォーマンスと指標の比較#
数値を単純に比較すると、RTDETRv2が高い精度を実現している一方で、YOLO11はより細かなモデルサイズの選択肢を提供しており、特にTensorRT上では優れた推論速度を誇ることが明らかです。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
表に見られるように、YOLO11xモデルは、RTDETRv2-xバリアントと比較して、より少ないFLOPs(194.9B対259B)を利用し、TensorRTでのより高速な推論(11.3ms対15.03ms)を実現しながら、54.7%という優れたmAPvalを達成しています。ナノおよびスモールサイズのYOLO11バリアントは、Raspberry Piのような制約のあるデバイス向けに、比類のない軽量オプションを提供します。
エコシステム、使いやすさ、トレーニング#
Ultralyticsモデルの決定的な特徴は、合理化されたユーザー体験です。ultralytics Pythonパッケージは、data augmentation、分散トレーニング、モデルのエクスポートの複雑な処理をこなす、統一された直感的なAPIを提供します。RTDETRv2の研究用リポジトリには多くのボイラープレートと設定が必要ですが、Ultralyticsは「ゼロからヒーローへ」のパイプラインを提供します。
興味深いことに、Ultralyticsエコシステムは非常に頑健であり、RT-DETRモデルをYOLOモデルと並行して実行することをネイティブでサポートしています!これにより、Weights & BiasesやComet MLとの統合を含む、Ultralyticsのよくメンテナンスされたエコシステムを活用して、実験を簡単に追跡できます。
from ultralytics import RTDETR, YOLO
# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")
# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")機械学習においては、トレーニングの効率性が極めて重要です。Ultralyticsモデルは、急速に収束する事前学習済み重みを利用します。コードを書かずにデータセット、トレーニング実行、デプロイメントエンドポイントを管理するには、統合されたMLOps体験を提供するUltralytics Platformをご探求ください。
実際のアプリケーション#
これらのアーキテクチャのどちらを選択するかは、多くの場合、プロジェクト特有のデプロイ環境の制約によって決まります。
RTDETRv2が適している場合: RTDETRv2のTransformerバックボーンは、高密度で物体が重なり合い、グローバルなコンテキストが必要なシナリオで非常に効果的です。これは多くの場合、学術研究や、計算予算よりもアテンションベースの関係性マッピングが優先されるアプリケーションで評価されます。
YOLO11が優れている場合: YOLO11は、実用的な現場への展開において紛れもないチャンピオンです。その最小限のメモリフットプリントと爆速の推論速度は、次のような用途に理想的です。
- Smart Manufacturing: 産業用PCを使用して、生産ライン上でリアルタイムの欠陥検出を実行する。
- Agriculture: ドローンにデプロイして、リアルタイムの作物健康状態のモニタリングや自動収穫ロボティクスを行う。
- Retail Analytics: 巨大なサーバーファームを必要とせずに、複数のカメラストリームを同時に処理してキュー管理や在庫追跡を行う。
ユースケースと推奨事項#
RT-DETRとYOLO11のどちらを選択するかは、具体的なプロジェクトの要件、デプロイの制約、およびエコシステムの優先順位に依存します。
RT-DETRを選択すべき時#
RT-DETRは以下のような場合に強力な選択肢です。
- Transformerベースの検出研究: NMSなしのエンドツーエンド物体検出に向けたアテンションメカニズムやTransformerアーキテクチャを探求するプロジェクト。
- 高い精度が求められ、レイテンシに柔軟性があるシナリオ: 検出精度が最優先され、多少推論レイテンシが高くても許容されるアプリケーション。
- 大きな物体の検出: 主に中規模から大規模な物体が中心となるシーンで、Transformerのグローバルアテンションメカニズムが自然な利点となる場合。
YOLO11を選択すべき時#
YOLO11は以下のような場合に推奨されます。
- 本番エッジデプロイメント: 信頼性と積極的なメンテナンスが最優先される、Raspberry Pi や NVIDIA Jetson などのデバイス上の商用アプリケーション。
- マルチタスクビジョンアプリケーション: 単一の統一されたフレームワーク内で detection、segmentation、pose estimation、および OBB を必要とするプロジェクト。
- 迅速なプロトタイピングとデプロイメント: 合理化された Ultralytics Python API を使用して、データ収集から本番環境まで迅速に移行する必要があるチーム。
Ultralytics (YOLO26) を選択すべき時#
ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
今後の展望:YOLO26の登場#
新しいプロジェクトを開始する場合は、次世代のビジョンAIである**Ultralytics YOLO26も検討する必要があります。2026年1月にリリースされたYOLO26は、両方の長所を取り入れています。YOLOv10で初めて先駆けて導入されたエンドツーエンドのNMSフリー設計**を導入しており、RTDETRv2と同様に後処理のレイテンシを完全に排除しつつ、CNNの比類のない速度を実現しています。
YOLO26は、LLMトレーニングのイノベーションに着想を得たMuSGD Optimizerを搭載しており、信じられないほど安定した高速な収束を可能にします。また、Distribution Focal Loss (DFL) を削除することで、最大43%のCPU推論の高速化を実現しました。専門化されたProgLoss + STAL損失関数により、微小物体認識の精度が劇的に向上しており、現代のあらゆるコンピュータビジョンパイプラインにおいて究極の推奨事項となります。
証明された汎用性のためにYOLO11を選択する場合でも、注意機構のためにRTDETRv2を選択する場合でも、あるいは究極のエッジパフォーマンスのために最先端のYOLO26を選択する場合でも、Ultralytics documentationはコンピュータービジョンの旅で成功するために必要なすべてのリソースを提供します。