RTDETRv2とYOLOv7#
コンピュータービジョンの分野はここ数年で大きく拡大し、畳み込みニューラルネットワーク(CNN)とビジョンTransformer(ViT)の継続的な技術革新がその発展を後押ししています。デプロイに適したアーキテクチャを選ぶには、速度、精度、計算オーバーヘッドの微妙なトレードオフを理解する必要があります。このガイドでは、高く評価されている2つのアーキテクチャ、RTDETRv2とYOLOv7の技術的な違いを解説し、新しいUltralytics YOLO26で利用できる最新の進歩についても紹介します。
RTDETRv2:リアルタイム検出に向けたTransformerアプローチ#
RTDETRv2(Real-Time Detection Transformer version 2)は、前身モデルの基盤を引き継ぎ、従来の後処理に頼らずにTransformerベースのアーキテクチャがリアルタイムのシナリオにも効果的に対応できることを示しています。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: RTDETRv2リポジトリ
アーキテクチャの主な特徴#
RTDETRv2は、ハイブリッドエンコーダーとTransformerデコーダーのアーキテクチャを採用しています。セルフアテンション機構を活用して画像全体を包括的に処理するため、局所的な畳み込みカーネルだけを使う場合よりも複雑な空間的関係を適切に把握できます。特に重要な特徴の1つは、ネイティブのNMSフリー設計です。非最大抑制(NMS)を排除することで、RTDETRv2はデプロイ時に変動する推論レイテンシを引き起こす一般的なボトルネックを解消します。
長所と制約#
RTDETRv2の主な強みは、複雑なシーンにある密集した重なり合う物体を処理できることです。Transformerのアテンション層がもたらすグローバルコンテキストにより、特にオクルージョンが頻繁に発生する状況で高い精度を発揮します。
ただし、これには計算コストが伴います。従来、TransformerモデルはCNNと比べて、学習時も推論時もより多くのメモリを必要とします。またRTDETRv2は通常、分散学習で収束するまでにより多くのエポックを要するため、カスタムデータセットを調整する開発者のイテレーションサイクルが長くなります。
YOLOv7:速度に優れたCNNのベースライン#
RTDETRv2の2年前にリリースされたYOLOv7は、従来のYOLOフレームワークに複数の構造的最適化を導入し、公開当時、CNNベースのリアルタイム検出器の強力なベンチマークを確立しました。
- 著者: Chien-Yao Wang、Alexey Bochkovskiy、Hong-Yuan Mark Liao
- 組織: 台湾、中央研究院情報科学研究所
- 日付: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: YOLOv7リポジトリ
アーキテクチャの主な特徴#
YOLOv7のアーキテクチャは、Extended Efficient Layer Aggregation Network(E-ELAN)の概念を基盤としています。この手法は勾配経路を最適化し、計算の複雑さを大幅に増やすことなくモデルの学習効率を高めます。また、開発者は「trainable bag-of-freebies」と呼ばれる一連の手法も導入しました。これらの手法は、エッジデバイスでの推論速度に影響を与えずに、学習時のモデル精度を向上させます。
長所と制約#
YOLOv7は標準的な物体検出タスクで今も高い能力を発揮し、一般向けGPUで優れた処理速度を実現します。CNNであるため、RTDETRv2などのTransformerベースのモデルと比べ、学習時に必要なCUDAメモリが通常は少なくて済みます。
こうした利点がある一方、YOLOv7は後処理にNMSを使用します。予測密度が高い環境では、NMS処理によって処理時間が変動し、厳密なリアルタイム性能の保証が難しくなることがあります。また、最新のフレームワークと比べて、インスタンスセグメンテーションや姿勢推定など、さまざまなタスクを扱うプロセスが分断されることがあります。
パフォーマンス比較#
これらのモデルを評価するには、平均適合率(mAP)、パラメーター数、推論速度の微妙なバランスを考慮する必要があります。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
RTDETRv2-xは最も高いmAPを達成しますが、パラメーター数とFLOPsも最大です。RTDETRv2-sのような小型バリアントはTensorRT上で競争力のある速度を実現しますが、専用GPUを搭載しない低消費電力環境を対象とする場合は、CPU推論の性能を慎重に評価する必要があります。
最新のソリューション:YOLO26の登場#
RTDETRv2とYOLOv7はコンピュータービジョンアプリケーションの限界を押し広げる重要な役割を果たしましたが、AI分野は急速に進化しています。2026年1月にリリースされたYOLO26は、CNNの効率性とTransformerのようなNMSフリーアーキテクチャの長所を融合しています。
新しいシステムを構築する開発者や研究者にとって、統合されたUltralytics PlatformとPythonエコシステムは、技術的負債を大幅に削減する統一されたエクスペリエンスを提供します。
YOLO26の主な革新#
- エンドツーエンドのNMSフリーデザイン: YOLO26はネイティブのエンドツーエンドモデルであり、任意で使用できるワンツーワンヘッド(
nms=False)によってNMSの後処理を省略し、より高速でシンプルなデプロイを実現します。この画期的なアプローチはYOLOv10で初めて導入され、物体密度にかかわらず安定したレイテンシを実現します。 - CPU推論が最大43%高速: エッジコンピューティングやGPUを搭載しないデバイス向けに特化して最適化されており、大規模なTransformerモデルと比べて、現場でのデプロイに幅広く対応できます。
- MuSGDオプティマイザー: SGDとMuonを組み合わせたハイブリッド手法(Moonshot AIのKimi K2に着想を得ています)で、LLMの学習技術をコンピュータービジョンに取り入れ、学習の安定性と収束速度を高めます。
- DFLの削除: Distribution Focal Lossを削除することで計算グラフが簡素化され、組み込みNPUやTensorRT環境へのエクスポートがよりスムーズになります。
- ProgLoss + STAL: 改良された損失関数によって小さな物体の認識性能が大幅に向上します。これはロボティクス、IoT、航空画像分析で重要です。
- タスク固有の改良: YOLO26は検出だけにとどまりません。セグメンテーション向けのマルチスケールプロトタイプ、姿勢推定向けの残差対数尤度推定(RLE)、回転バウンディングボックス(OBB)の境界に関する問題に対処する専用の角度損失を備えています。
効率化された開発者エクスペリエンス#
YOLO26(または非常に人気の高いYOLO11)のようなUltralyticsモデルを選ぶ最大の利点は、適切に保守されたエコシステムです。最小限の定型コードでカスタムデータセットを学習できます。
from ultralytics import YOLO
# 最先端のYOLO26モデルを初期化する
model = YOLO("yolo26s.pt")
# COCO8データセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# エッジデプロイ向けにシームレスにエクスポートできます
model.export(format="onnx", dynamic=True)最適なユースケースと用途#
これらのアーキテクチャからどれを選ぶかは、対象ハードウェアと具体的な運用要件に大きく左右されます。
RTDETRv2を検討するケース#
RTDETRv2は、強力なGPUを備えたサーバーサイド処理環境で非常に効果的です。グローバルアテンション機構により、混雑したイベントの監視や、重なり合う特徴を深く文脈的に分析する必要がある専門的な医用画像など、複雑なシーンの理解に適しています。
YOLOv7を検討する場面#
YOLOv7は、ベースライン比較モデルとして従来の学術研究で保守されていることがよくあります。また、既存のパイプラインが特定のPyTorchバージョン向けにハードコードされており、新しいフレームワークのマルチタスク対応が不要な旧式の産業用デプロイ環境でも利用されています。
YOLO26が推奨標準である理由#
最新のスマートシティインフラ、ドローンナビゲーション、高速製造において、YOLO26は他に類を見ないバランスを提供します。メモリ要件が低いため、一般向けハードウェアでもハイパーパラメーター調整や学習が可能です。また、NMSフリー推論により、Raspberry PiやNVIDIA Jetsonなど、リソースに制約のあるエッジデバイスでも高速に実行できます。
これらのモデルと他のアーキテクチャとの比較に関心がありますか?YOLO11とRT-DETRの比較やYOLOv8とYOLOv7の比較に関する詳しいガイドをご覧いただき、ビジョンAIプロジェクトに最適なモデルをお選びください。