YOLO11とRTDETRv2#
コンピュータービジョンの分野は急速に拡大し、堅牢なビジョンベースのアプリケーションを構築するための選択肢が開発者に数多く提供されています。リアルタイム物体検出の分野では、畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)の議論がかつてないほど活発になっています。この技術比較では、最適化されたCNNフレームワークの最高峰であるYOLO11と、Detection Transformerファミリーの強力な派生モデルであるRTDETRv2という、2つの主要なアーキテクチャを詳しく解説します。
アーキテクチャ、パフォーマンス指標、最適なデプロイシナリオを分析し、機械学習エンジニアが十分な情報に基づいて判断できるよう解説します。どちらのモデルも精度の限界を押し広げていますが、実際の本番環境では、Ultralytics YOLOモデルのほうが速度、エコシステムのサポート、使いやすさのバランスに優れている傾向があります。
YOLO11: 実環境における汎用性のベンチマーク#
Ultralyticsが発表したYOLO11は、長年にわたる基礎研究を土台とし、高速、高精度、そして非常に高い汎用性を備えたモデルです。物体検出、インスタンスセグメンテーション、画像分類、姿勢推定、回転バウンディングボックス(OBB)の抽出をネイティブでシームレスに処理できるように設計されています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: Ultralyticsリポジトリ
- ドキュメント: YOLO11ドキュメント
アーキテクチャと強み#
YOLO11は洗練されたCNNバックボーンと高度な空間特徴ピラミッドを備え、リソース効率に非常に優れています。ハードウェアの制約が厳しい環境でも力を発揮し、トレーニング時と推論時のどちらもメモリ使用量を最小限に抑えます。Ultralytics PlatformはYOLO11をネイティブでサポートしており、複数の異なるMLOpsツールを組み合わせることなく、モデルの監視、データのアノテーション、クラウドトレーニングを効率的に行えます。
エッジコンピューティングを対象とする開発者にとって、YOLO11の超低レイテンシは大きな特長です。軽量なため、Raspberry Piから一般消費者向けのスマートフォンまで、幅広いデバイス上で効率的に動作します。そのため、スマートリテール、製造業の品質管理、自動交通管理の標準モデルとなっています。
RTDETRv2: BaiduによるリアルタイムTransformer#
RTDETRv2(リアルタイム検出Transformerバージョン2)は、Transformerベースのアーキテクチャをリアルタイムタスクで実用化するためのBaiduの取り組みを示すモデルです。元のRT-DETRを基盤とし、推論レイテンシを増やすことなくベースラインの精度を向上させる「bag-of-freebies」アプローチを取り入れています。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2リポジトリ
- ドキュメント: RTDETRv2のREADME
アーキテクチャと強み#
従来のCNNとは異なり、RTDETRv2はセルフアテンション機構を備えたエンコーダー・デコーダーアーキテクチャを採用し、画像全体のグローバルなコンテキストを捉えます。これは、オクルージョンが頻繁に発生する混雑したシーンで特に有効です。RTDETRv2は後処理で非最大抑制(NMS)を必要とせず、代わりにトレーニング時のハンガリアンマッチングによる一対一の二部マッチングを使用します。
しかし、Transformerモデルは大量のVRAMとCUDAメモリを必要とすることで知られています。RTDETRv2をゼロからトレーニングしたり、カスタムデータセットでファインチューニングしたりするには、多くの場合、高性能GPUクラスターが大量に必要です。そのため、軽量なトレーニング時メモリ使用量を特徴とするUltralyticsモデルに比べて、小規模で機動力のあるチームには導入の障壁となることがあります。
パフォーマンスと指標の分析#
標準のCOCOデータセットでこれらのモデルを評価すると、パラメーター数、FLOPs、実際の精度の間に明確なトレードオフが見られます。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
結果の詳細#
表からわかるように、YOLO11はモデルサイズに対するパフォーマンスが非常に優れています。YOLO11xは、RTDETRv2-xの54.3に対してより高いmAPval(54.7)を達成しながら、パラメーター数が大幅に少なく(56.9M対76M)、計算量を示すFLOPsも大幅に抑えています(195.3B対259B)。
さらに、T4上でのYOLO11のTensorRT推論速度は非常に高速です。YOLO11sの推論時間はわずか2.5msですが、最小モデルのRTDETRv2-sでは5.03msかかります。そのため、フレーム処理時間が主なボトルネックとなる高速なリアルタイム動画分析ストリームでは、YOLO11が最適な選択肢となります。
RTDETRv2はアテンション層によって優れた精度を実現しますが、これらの機構は画像解像度に対して二次的にスケールするため、トレーニング時と推論時のどちらもVRAM消費量が増加します。YOLO11は、非常に効率の高い畳み込みブロックによってこの課題を回避します。
トレーニングエコシステムと使いやすさ#
Ultralyticsモデルを採用する主な利点は、その周辺エコシステムにあります。RTDETRv2のトレーニングでは、多くの場合、複雑な研究向けリポジトリを使いこなし、二部マッチング損失の重みを細かく調整し、多大なメモリ使用量を管理する必要があります。
一方、Ultralyticsは開発者体験を重視しています。統合Python APIによって定型コードが抽象化され、Weights & Biasesなどのツールとシームレスに連携した実験管理や、データ拡張の自動処理が可能です。
ultralyticsパッケージを使用したモデルのトレーニングとエクスポートは、次のように簡単です。
from ultralytics import YOLO
# 事前学習済みの重みでYOLO11モデルを初期化する
model = YOLO("yolo11n.pt")
# ローカルGPUまたはクラウドインスタンスでモデルを効率よくトレーニングする
train_results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # CUDA GPUを使用する
)
# 幅広いデプロイに対応するため、トレーニング済みモデルをONNXにエクスポートする
export_path = model.export(format="onnx")トレーニング後、YOLO11モデルをONNX、OpenVINO、CoreMLなどのフォーマットにエクスポートするには、1つのコマンドを実行するだけです。これにより、さまざまなハードウェアバックエンドにわたってビジョンパイプラインを容易にスケールできます。
RTDETRv2はバウンディングボックス検出に特化していますが、YOLO11アーキテクチャはインスタンスセグメンテーションと姿勢推定をネイティブでサポートしているため、複数のビジョンタスクを単一のモデルファミリーに統合できます。
ユースケースと推奨事項#
YOLO11とRT-DETRのどちらを選ぶかは、プロジェクトの具体的な要件、デプロイ制約、エコシステムに対する好みによって異なります。
YOLO11を選ぶ場合#
YOLO11は、次のような用途に適しています。
- 本番環境でのエッジデプロイメント: 信頼性と継続的なメンテナンスが最優先となる、Raspberry PiやNVIDIA Jetsonなどのデバイス上での商用アプリケーション。
- マルチタスクのビジョンアプリケーション: 単一の統合フレームワークで、検出、セグメンテーション、姿勢推定、OBBを必要とするプロジェクト。
- 迅速なプロトタイピングとデプロイメント: 効率化されたUltralytics Python APIを使って、データ収集から本番環境への移行を迅速に進めたいチーム。
RT-DETRを選ぶケース#
RT-DETRは、次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
今後の展望: YOLO26の力#
YOLO11は本番環境に適した優れたモデルですが、最先端の技術を求めるチームはYOLO26をぜひご検討ください。2026年1月にリリースされたYOLO26は、オプションのエンドツーエンドNMSフリーヘッド(YOLOv10で初めて採用されたnms=False)をコアに直接組み込むことでアーキテクチャ上のギャップを埋め、NMS後処理のレイテンシとデプロイロジックの複雑さを解消します。
YOLO26には、さらに次のような革新的な機能が導入されています。
- MuSGDオプティマイザー: Moonshot AIのKimi K2が用いるLLMトレーニング手法に着想を得た、SGDとMuonのハイブリッドです。非常に安定したトレーニングと大幅に高速な収束を実現します。
- DFLの削除: エクスポートプロセスをよりシンプルにするため、Distribution Focal Lossが削除され、低消費電力のエッジデバイスとの互換性が大幅に向上しました。
- ProgLoss + STAL: これらの高度な損失関数は小さな物体の認識を大幅に向上させます。ドローン監視、農業モニタリング、IoTエッジセンサーに不可欠な性能です。
- CPU推論を最大43%高速化: 専用GPUを使用しないデプロイ向けに、YOLO26はCPU実行に特化して最適化されており、旧世代のモデルを大幅に上回る性能を発揮します。
より幅広いアーキテクチャに関心のある方は、Ultralyticsのドキュメントで、広く採用されているYOLOv8、広く利用されているYOLOv5、オープンボキャブラリー検出向けのYOLO-Worldなどの特化型モデルについてもご覧いただけます。実績あるYOLO11の安定性を重視する場合も、YOLO26の画期的な革新を求める場合も、Ultralyticsエコシステムはコンピュータービジョンソリューションを実現するための比類のないツールを提供します。