RTDETRv2とYOLOv5#
コンピュータービジョンの進化は、精度とリアルタイム推論速度の両立を追求してきた歴史と深く結び付いています。RTDETRv2とUltralytics YOLOv5を比較する場合、開発者は、Transformerアーキテクチャの高度なグローバルコンテキスト把握能力と、徹底的に最適化され、実績を積んだ畳み込みニューラルネットワーク (CNN) の効率性を比較検討することになります。
このガイドでは、2つの代表的なアーキテクチャを技術的に詳しく分析し、性能指標、トレーニング手法、メモリ要件、理想的なデプロイシナリオを解説します。用途に最適な物体検出モデルを選ぶ際にお役立てください。
RTDETRv2:リアルタイム検出に向けたTransformerアプローチ#
初代Real-Time Detection Transformer (RT-DETR)を発展させたRTDETRv2は、推論レイテンシーを犠牲にすることなくベースラインアーキテクチャを改善するため、一連の「bag-of-freebies」を導入しています。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- リンク: Arxiv論文、GitHubリポジトリ
アーキテクチャと機能#
RTDETRv2は、CNNとTransformerを組み合わせたハイブリッドアーキテクチャを採用しています。CNNをバックボーンとして細かな視覚特徴を抽出し、Transformerのエンコーダー・デコーダー層が特徴マップ全体を処理してグローバルコンテキストを把握します。RTDETRv2の大きな特徴はエンドツーエンドで動作する点であり、非最大抑制 (NMS)による後処理を完全に不要にします。
RTDETRv2は、特に物体が重なり合う複雑で密集したシーンで優れた精度を実現しますが、無視できないトレードオフもあります。Transformerに固有のアテンション機構は、トレーニング時に一般的なCNNよりも大幅に多くのCUDAメモリを必要とします。また、NVIDIA A100やT4などのハイエンドGPUでは良好に動作しますが、一般的なCPUでは明らかに遅く、リソースが限られたエッジデバイスでは大きな制約を受けます。
Ultralytics YOLOv5:効率性における業界標準#
Ultralytics YOLOv5のリリースは、応用機械学習の状況を根本から変え、非常に直感的なフレームワークを通じて、高性能なコンピュータービジョンを世界中の開発者にとって利用しやすいものにしました。
- 著者: Glenn Jocher
- 組織: Ultralytics
- 日付: 2020年6月26日
- リンク: 公式ドキュメント、GitHubリポジトリ
エコシステムと性能のバランス#
YOLOv5はPyTorchフレームワーク上に完全に構築されており、非常に効率的なCNNアーキテクチャを採用しています。使いやすさを重視して一から設計されており、合理化されたAPIと、AI業界でも特に充実したドキュメントを備えています。
YOLOv5の最大の利点は、他に類を見ない汎用性と少ないメモリ要件です。YOLOv5モデルのトレーニングに必要なVRAMはTransformerベースのモデルよりもはるかに少なく、ハードウェア予算が限られた研究者やエンジニアでも利用できます。さらに、RTDETRv2がバウンディングボックス検出に特化しているのに対し、YOLOv5は進化を遂げ、インスタンスセグメンテーションや画像分類にも対応する汎用性の高いモデルとなっています。
ワークフローを最大限に効率化するには、Ultralytics PlatformからYOLOv5を直接トレーニング、検証、デプロイできます。このプラットフォームはクラウドトレーニング機能と、コード不要のデプロイパイプラインを提供します。
パフォーマンスと指標の比較#
標準のCOCOデータセットで生の性能を分析すると、これらのモデルがリソースをどのように優先するかの違いが明確に分かります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
トレードオフの分析#
データによると、RTDETRv2-xは平均適合率 (mAP)の最高値が54.3%で、YOLOv5xの50.7%をわずかに上回ります。しかし、この小幅な精度向上には、非常に大きな計算コストが伴います。YOLOv5xはレイテンシーが低く (TensorRTで11.89 ms対15.03 ms)、メモリ使用量も大幅に少なくなっています。超低消費電力のエッジデプロイではYOLOv5n (Nano)が依然として最適で、わずか190万のパラメーターで1.12 msで推論を完了します。RTDETRv2は、このクラスでの競争にすら挑んでいません。
トレーニング効率とコードの簡潔さ#
Ultralyticsエコシステムの主な強みの1つは、統合されたAPIです。特定の高負荷な計算タスクでTransformerアーキテクチャのRT-DETRを利用する場合でも、Ultralytics Pythonパッケージ内で完結でき、コードを1行変更するだけでモデルをシームレスに切り替えられます。
from ultralytics import RTDETR, YOLO
# Ultralytics YOLOv5 smallモデルを読み込む
model_yolo = YOLO("yolov5su.pt") # YOLOv5u: ultralyticsパッケージ向けのアンカーフリーYOLOv5重み
# Ultralytics経由でRT-DETR largeモデルを読み込む
model_rtdetr = RTDETR("rtdetr-l.pt")
# カスタムデータでYOLOv5を簡単にトレーニングする
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# 両方のモデルでシームレスに推論を実行する
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo[0].show()Ultralyticsライブラリを利用すると、開発者は実験追跡の統合機能 (Weights & BiasesやComet MLなど) を備えた、メンテナンスの行き届いたエコシステムを利用できます。また、ONNXやOpenVINOなどのデプロイ形式にワンクリックでエクスポートできます。
実環境での用途と適したユースケース#
RTDETRv2が適する領域#
RTDETRv2は、ハードウェアの制約がなく、達成可能な最高の精度だけを目指す環境に最適です。
- サーバー側の医用画像処理: 高解像度X線画像から微細な異常を検出します。
- 衛星画像: 強力なクラウドクラスターを使用して、航空監視タスクで密集し、重なり合う物体を追跡します。
YOLOv5が優位となる領域#
YOLOv5は、さまざまなハードウェアでの実用的な現実世界へのデプロイにおいて、疑いなく優れたモデルです。
- エッジAIデバイス: メモリが厳しく制限されたRaspberry PiやNVIDIA Jetsonデバイスにセキュリティアラームシステムをデプロイします。
- モバイルアプリケーション: CoreMLまたはLiteRTを使い、スマートフォン上でバウンディングボックス検出とセグメンテーションの推論を直接、高速かつリアルタイムに実行します。
- 高速な産業製造: ミリ秒単位のレイテンシーが業務の成功に直結する高速な生産ラインで、部品を検査します。
YOLOv5は伝説的なモデルですが、UltralyticsエコシステムはAIの可能性を広げ続けています。2026年に始める新規プロジェクトでモデルを比較する場合は、最先端のUltralytics YOLO26もご検討ください。YOLO26は、Transformerに似た仕組みとCNNの速度を両立する、オプションの1対1ヘッド (nms=False) によるネイティブなエンドツーエンドのNMSフリー設計を採用しています。さらに、画期的なMuSGDオプティマイザーによって非常に安定したトレーニングを実現し、CPU推論を最大43%高速化します。また、YOLO11も、姿勢推定やOBB検出が必要な汎用デプロイに適した、優れたサポート体制を備える選択肢です。
RTDETRv2はTransformer層を使って精度の限界を押し上げますが、Ultralytics YOLOフレームワークは、速度、軽量なメモリ要件、優れた開発者体験を他に類を見ないバランスで提供し、プロトタイプから本番環境への移行時間を大幅に短縮します。