RTDETRv2とYOLOv7の比較#
コンピュータビジョンの分野は、畳み込みニューラルネットワーク(CNN)とビジョン・トランスフォーマー(ViT)の両方における継続的なイノベーションに牽引され、ここ数年で劇的に拡大しました。デプロイに適したアーキテクチャを選択するには、速度、精度、計算オーバーヘッドの間の微妙なトレードオフを理解する必要があります。このガイドでは、非常に評価の高い2つのアーキテクチャであるRTDETRv2とYOLOv7の技術的な違いを解説するとともに、新しいUltralyticsのYOLO26で利用可能な現代的な進化についても紹介します。
RTDETRv2:リアルタイム検出へのTransformerアプローチ#
RTDETRv2(Real-Time Detection Transformer version 2)は、その前身の基盤の上に構築されており、従来のポストプロセスステップに頼ることなく、Transformerベースのアーキテクチャがリアルタイムのシナリオで効果的に競合できることを証明しています。
著者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
組織: Baidu
日付: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: RTDETRv2 リポジトリ
アーキテクチャのハイライト#
RTDETRv2は、ハイブリッドエンコーダーとトランスフォーマーデコーダーのアーキテクチャを採用しています。セルフアテンション機構を活用することで、モデルは画像全体を全体論的に処理し、厳密にローカライズされた畳み込みカーネルよりも複雑な空間的関係をより良く理解できるようになります。その最も特徴的な機能の1つは、ネイティブなNMSフリー設計です。非最大値抑制(NMS)を排除することにより、RTDETRv2はデプロイ中の推論レイテンシに変動をもたらす一般的なボトルネックを取り除きます。
強みと制限#
RTDETRv2の主な強みは、複雑なシーンにおける密集した重なり合うオブジェクトを処理できる能力にあります。Transformerの注意層によって提供されるグローバルコンテキストにより、特にオクルージョン(遮蔽)が頻発するシナリオにおいて、非常に高い精度を実現します。
ただし、これには計算コストが伴います。トランスフォーマーモデルは、CNNと比較して、トレーニングおよび推論時に従来より多くのメモリフットプリントを必要とします。さらに、RTDETRv2は分散学習中の収束により多くのエポックを必要とする傾向があり、カスタムデータセットを調整する開発者のイテレーションサイクルが長くなります。
YOLOv7:速度のためのCNNベースライン#
RTDETRv2の1年前にリリースされたYOLOv7は、古典的なYOLOフレームワークにいくつかの構造的な最適化を導入し、発表当時にCNNベースのリアルタイム検出器としての強力なベンチマークを設定しました。
著者: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
組織: Institute of Information Science, Academia Sinica, Taiwan
日付: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: YOLOv7 リポジトリ
アーキテクチャのハイライト#
YOLOv7のアーキテクチャは、Extended Efficient Layer Aggregation Network(E-ELAN)の概念を中心に構築されています。このアプローチにより勾配パスが最適化され、計算複雑度を大幅に増加させることなく、モデルがより効果的に学習できるようになります。著者らはまた、エッジデバイスでの推論速度に影響を与えることなく、トレーニング中のモデル精度を向上させる一連の手法である「trainable bag-of-freebies」を導入しました。
強みと制限#
YOLOv7は、標準的な物体検出タスクにおいて非常に有能なモデルであり続け、コンシューマー向けGPUで優れた処理速度を提供します。そのCNNとしての性質上、RTDETRv2のようなトランスフォーマーベースのモデルと比較して、トレーニング中に必要となるCUDAメモリが通常少なくなります。
こうした利点にもかかわらず、YOLOv7は後処理にNMSに依存しています。予測が高密度な環境では、NMSのステップにより処理時間が変動し、厳格なリアルタイム保証が困難になる場合があります。さらに、最新のフレームワークと比較して、インスタンスセグメンテーションや姿勢推定などの多様なタスクを処理するプロセスが断片的になることがあります。
パフォーマンスの比較#
これらのモデルを評価するには、平均適合率(mAP)、パラメータ数、および推論速度の間の絶妙なバランスを確認する必要があります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
RTDETRv2-xは最高のmAPを達成しますが、同時に最大のパラメータ数とFLOPsを要します。RTDETRv2-sのような小型のバリエーションはTensorRT上で競争力のある速度を提供しますが、専用GPUを持たない低電力環境をターゲットとするユーザーは、CPU推論能力を慎重に評価する必要があります。
最新のソリューション:YOLO26の登場#
RTDETRv2とYOLOv7はコンピュータビジョンアプリケーションの限界を押し広げる上で極めて重要でしたが、AI分野は急速に進化しています。2026年1月にリリースされた**YOLO26**は、CNNの効率性とトランスフォーマーのようなNMSフリーアーキテクチャの両方の長所を統合しています。
新しいシステムを構築する開発者や研究者にとって、統合されたUltralytics プラットフォームとPythonエコシステムは、技術的負債を大幅に削減する統一されたエクスペリエンスを提供します。
YOLO26 における主な革新#
- エンドツーエンドのNMSフリー設計: YOLO26はネイティブのエンドツーエンドであり、NMS後処理を排除して、より高速でシンプルなデプロイを実現します。この画期的なアプローチはYOLOv10で初めて先駆けて採用され、オブジェクトの密度に関係なく安定したレイテンシを保証します。
- 最大43%高速なCPU推論: エッジコンピューティングやGPUを持たないデバイス向けに特別に最適化されており、重いトランスフォーマーモデルよりも現場でのデプロイメントにおいて格段に多用途です。
- MuSGDオプティマイザ: SGDとMuon(Moonshot AIのKimi K2に触発された)のハイブリッドであり、LLMのトレーニングイノベーションをコンピュータビジョンにもたらし、より安定したトレーニングと高速な収束を実現します。
- DFLの削除: Distribution Focal Lossが削除され、組み込みNPUやTensorRT環境へのよりスムーズなエクスポートのための簡素化された計算グラフが実現しました。
- ProgLoss + STAL: 改善された損失関数により、ロボティクス、IoT、および航空画像分析にとって不可欠な、小物体認識における顕著な向上がもたらされます。
- タスク固有の改善: YOLO26は検出だけのものではありません。セグメンテーション用のマルチスケールプロトタイプ、ポーズトラッキング用のResidual Log-Likelihood Estimation(RLE)、および指向性バウンディングボックス(OBB)の境界の問題に対処する特殊な角度損失を備えています。
合理化された開発体験#
YOLO26(または非常に人気の高いYOLO11)のようなUltralyticsモデルを選択する本当の利点は、よくメンテナンスされたエコシステムです。カスタムデータセットのトレーニングには、最小限のボイラープレートコードしか必要ありません:
from ultralytics import YOLO
# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)理想的なユースケースとアプリケーション#
これらのアーキテクチャの選択は、ターゲットとなるハードウェアと特定の運用要件に大きく依存します。
RTDETRv2を検討すべき場合#
RTDETRv2は、強力なGPUを搭載したサーバーサイド処理環境で非常に効果的です。そのグローバルアテンション機構により、混雑したイベントの監視や、重なり合う特徴に深いコンテキスト分析が必要となる専門的な医療画像など、複雑なシーンの理解に適しています。
YOLOv7を検討すべき場面#
YOLOv7は、レガシーな学術研究においてベースライン比較モデルとして維持されることが多いです。また、既存のパイプラインが特定のPyTorchバージョンにハードコーディングされており、新しいフレームワークのマルチタスク柔軟性を必要としない、古い産業用デプロイメントでも見られます。
なぜYOLO26が推奨される基準なのか#
現代のスマートシティインフラ、ドローンナビゲーション、および高速製造において、YOLO26は比類のないバランスを提供します。メモリ要件が低いためコンシューマー向けハードウェアでのハイパーパラメータチューニングとトレーニングがアクセシブルになり、NMSフリーの推論により、Raspberry PiやNVIDIA Jetsonなどの制約のあるエッジデバイスでも迅速な実行が保証されます。
これらのモデルが他のアーキテクチャとどのように比較されるか興味がありますか?YOLO11 vs. RTDETRやYOLOv8 vs. YOLOv7に関する詳細なガイドをご覧いただき、ビジョンAIプロジェクトに最適なものを見つけてください。