RTDETRv2とYOLOv7の比較#
コンピュータビジョンの領域は、畳み込みニューラルネットワーク(CNN)とVision Transformer(ViT)の両方における絶え間ないイノベーションにより、ここ数年で劇的に拡大しました。デプロイメントに最適なアーキテクチャを選択するには、速度、精度、計算オーバーヘッドの間の微妙なトレードオフを理解する必要があります。本ガイドでは、高く評価されている2つのアーキテクチャであるRTDETRv2とYOLOv7の技術的な違いを解説するとともに、最新のUltralytics YOLO26で利用可能な最新の進歩についても紹介します。
RTDETRv2:リアルタイム検出へのTransformerアプローチ#
RTDETRv2(Real-Time Detection Transformer version 2)は、その前身の基盤の上に構築されており、従来のポストプロセスステップに頼ることなく、Transformerベースのアーキテクチャがリアルタイムのシナリオで効果的に競合できることを証明しています。
著者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, and Yi Liu
組織: Baidu
日付: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: RTDETRv2 Repository
アーキテクチャのハイライト#
RT-DETRv2はハイブリッドエンコーダーとtransformer decoderアーキテクチャを活用しています。セルフアテンション機構を活用することで、モデルは画像全体を総体的に処理し、厳密に局所化された畳み込みカーネルよりも複雑な空間関係をより良く理解することができます。最も決定的な特徴の1つは、ネイティブにNMSフリーな設計であることです。Non-Maximum Suppression (NMS)を排除することで、RT-DETRv2はデプロイ時に可変のinference latencyを引き起こす一般的なボトルネックを取り除きます。
強みと制限#
RTDETRv2の主な強みは、複雑なシーンにおける密集した重なり合うオブジェクトを処理できる能力にあります。Transformerの注意層によって提供されるグローバルコンテキストにより、特にオクルージョン(遮蔽)が頻発するシナリオにおいて、非常に高い精度を実現します。
しかし、これには計算コストが伴います。Transformerモデルは従来、CNNと比較して、学習時および推論時により多くのメモリフットプリントを必要とします。さらに、RT-DETRv2は通常、distributed trainingでの収束により多くのエポックを必要とするため、カスタムデータセットをチューニングする開発者のイテレーションサイクルが長くなります。
YOLOv7:速度のためのCNNベースライン#
RTDETRv2の1年前にリリースされたYOLOv7は、古典的なYOLOフレームワークにいくつかの構造的な最適化を導入し、発表当時にCNNベースのリアルタイム検出器としての強力なベンチマークを設定しました。
著者: Chien-Yao Wang, Alexey Bochkovskiy, and Hong-Yuan Mark Liao
組織: Institute of Information Science, Academia Sinica, Taiwan
日付: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: YOLOv7 Repository
アーキテクチャのハイライト#
YOLOv7のアーキテクチャは、Extended Efficient Layer Aggregation Network (E-ELAN)の概念に基づいて構築されています。このアプローチは勾配パスを最適化し、計算複雑度を大幅に増加させることなく、モデルがより効果的に学習できるようにします。著者らはまた、エッジデバイスでの推論速度に影響を与えることなく学習中のmodel accuracyを向上させる一連の手法である「trainable bag-of-freebies」を導入しました。
強みと制限#
YOLOv7は標準的なオブジェクト検出タスクにおいて非常に有能なモデルであり、一般的なGPUで優れた処理速度を提供します。CNNベースであるため、RTDETRv2のようなTransformerベースのモデルと比較して、トレーニング中のCUDAメモリ消費が少ないのが一般的です。
これらの利点がある一方で、YOLOv7は依然としてポストプロセスにNMSに依存しています。予測が密集する環境では、NMSステップによって処理時間に変動が生じる可能性があり、厳密なリアルタイム性を保証することが困難になります。さらに、最新のフレームワークと比較して、インスタンスセグメンテーションや姿勢推定のような多様なタスクを扱うプロセスが断片化している場合があります。
パフォーマンスの比較#
これらのモデルを評価するには、mean Average Precision (mAP)、パラメータ数、および推論速度の間の微妙なバランスを確認する必要があります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
RTDETRv2-xは最高のmAPを達成しますが、同時に最大のパラメータ数とFLOPsを要します。RTDETRv2-sのような小型のバリエーションはTensorRT上で競争力のある速度を提供しますが、専用GPUを持たない低電力環境をターゲットとするユーザーは、CPU推論能力を慎重に評価する必要があります。
最新のソリューション:YOLO26の登場#
RT-DETRv2とYOLOv7はcomputer vision applicationsの限界を押し広げる上で極めて重要でしたが、AIの状況は急速に進化しています。2026年1月にリリースされた**YOLO26**は、CNNの効率性とTransformerのようなNMSフリーのアーキテクチャの両方の最高の側面を統合しています。
新しいシステムを構築する開発者や研究者にとって、統合されたUltralytics PlatformとPythonエコシステムは、技術的負債を大幅に削減する統一された体験を提供します。
YOLO26 における主な革新#
- エンドツーエンドのNMSフリー設計: YOLO26はネイティブなエンドツーエンドモデルであり、NMSポストプロセスを排除して、より高速でシンプルなデプロイメントを実現します。この画期的なアプローチはYOLOv10で最初に導入され、オブジェクトの密度に関係なく安定したレイテンシを保証します。
- 最大43%高速なCPU推論: edge computingやGPUを持たないデバイス向けに特別に最適化されており、重いTransformerモデルよりもフィールドデプロイではるかに多様性に富んでいます。
- MuSGDオプティマイザ: SGDとMuon(Moonshot AIのKimi K2に触発された)のハイブリッドであり、LLMのトレーニングイノベーションをコンピュータビジョンにもたらし、より安定したトレーニングと高速な収束を実現します。
- DFLの削除: Distribution Focal Lossが削除されたことで、計算グラフが簡素化され、組み込みNPUやTensorRT環境へのエクスポートがスムーズになりました。
- ProgLoss + STAL: 改善された損失関数により、robotics、IoT、および航空画像解析にとって不可欠である小物体認識の顕著な向上がもたらされます。
- タスク固有の改善: YOLO26は検出専用ではありません。セグメンテーションのためのマルチスケールプロトタイプ、姿勢追跡のためのRLE(Residual Log-Likelihood Estimation)、および指向性バウンディングボックス (OBB)の境界問題を解決する特殊な角度損失機能を備えています。
合理化された開発体験#
YOLO26(または非常に人気のあるYOLO11)のようなUltralyticsモデルを選択する真の利点は、十分に整備されたエコシステムにあります。カスタムデータセットのトレーニングには、最小限の定型コードしか必要としません。
from ultralytics import YOLO
# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)理想的なユースケースとアプリケーション#
これらのアーキテクチャの選択は、ターゲットとなるハードウェアと特定の運用要件に大きく依存します。
RTDETRv2を検討すべき場合#
RTDETRv2は、強力なGPUを搭載したサーバーサイド処理環境において非常に効果的です。そのグローバル注意メカニズムにより、過密なイベントモニタリングや、重複する特徴のために深いコンテキスト分析が必要な特殊な医療画像診断など、複雑なシーンの理解に適しています。
YOLOv7を検討すべき場面#
YOLOv7は、レガシーな学術研究においてベースライン比較モデルとして維持されることが多いです。また、既存のパイプラインが特定のPyTorchバージョンにハードコーディングされており、新しいフレームワークのマルチタスク柔軟性を必要としない、古い産業用デプロイメントでも見られます。
なぜYOLO26が推奨される基準なのか#
現代のsmart cityインフラ、drone navigation、および高速製造において、YOLO26は比類のないバランスを提供します。その低いメモリ要件により、hyperparameter tuningと学習がコンシューマー向けハードウェアでアクセス可能になり、一方そのNMSフリーの推論により、Raspberry PiやNVIDIA Jetsonのような制約のあるエッジデバイスでの迅速な実行が保証されます。
これらのモデルと他のアーキテクチャとの比較に興味がありますか?YOLO11 vs. RTDETRおよびYOLOv8 vs. YOLOv7に関する詳細ガイドをチェックして、ビジョンAIプロジェクトに最適なものを見つけてください。