RTDETRv2とYOLOv9の比較#
コンピュータービジョンの分野では、主に畳み込みニューラルネットワーク(CNN)とTransformerベースのモデルの間で、アーキテクチャの設計思想が興味深い形で分岐してきました。RTDETRv2とYOLOv9を比較する際、開発者は実質的に、グローバルなアテンション機構とプログラム可能な勾配情報の間にあるトレードオフを評価しています。どちらのモデルも、それぞれのアプローチの最高峰として、リアルタイム物体検出の限界を押し広げています。
モデルの概要#
RTDETRv2:リアルタイム検出Transformer#
Baiduの研究者が開発したRTDETRv2は、初代RT-DETRを基盤に「Bag-of-Freebies」を導入し、ベースラインとなるReal-Time Detection Transformerを強化しています。Transformerに従来からあるボトルネックである推論速度に取り組み、リアルタイムアプリケーションでの利用を可能にします。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- リンク: Arxiv、GitHub
RTDETRv2の特徴は、ネイティブなエンドツーエンドのNMS不要設計です。後処理で非極大値抑制(NMS)を完全に取り除くことで、推論レイテンシを安定させ、デプロイパイプラインを簡素化します。グローバルアテンション機構は画像全体のコンテキストを同時に評価するため、複雑なシーンの理解や密集した人混みの検出に優れています。
YOLOv9:プログラム可能な勾配情報#
高効率なCNNベースのアーキテクチャであるYOLOv9は、深層ニューラルネットワークに固有の情報ボトルネック問題に取り組みます。プログラム可能な勾配情報(PGI)とGeneralized Efficient Layer Aggregation Network(GELAN)を導入しています。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織:中央研究院情報科学研究所
- 日付: 2024年2月21日
- リンク: Arxiv、GitHub
YOLOv9は実績のある畳み込みニューラルネットワークを基盤としながら、パラメーター効率を最大限に高めています。フィードフォワード処理中に重要な情報を保持し、信頼性の高い重み更新を実現することで、非常に軽量でありながら高精度なモデルを提供します。ただし、RTDETRv2とは異なり、YOLOv9は標準的なNMS後処理に依存しています。
性能とリソース効率#
本番環境向けにこれらのモデルを評価する際は、平均適合率(mAP)と計算コストのバランスが重要です。以下の表は、MS COCOデータセットでの性能を示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
メモリ要件とトレーニング効率#
RTDETRv2のようなTransformerはトレーニング中に非常に多くのメモリを消費することで知られており、十分に収束させるには多くのCUDAメモリと長いトレーニング時間が必要になることがよくあります。一方、YOLOv9などのCNNアーキテクチャやその他のUltralytics YOLOモデルはメモリ使用量が非常に少なく、一般消費者向けハードウェアでも大きなバッチサイズでトレーニングできます。
ハードウェアを最大限に活用するには、クラウドトレーニングを効率化できるUltralytics Platformの利用をご検討ください。環境設定と最適なバッチサイズの選択を自動的に処理します。
Ultralyticsの強み:エコシステムと使いやすさ#
公式のRTDETRv2やYOLOv9のGitHubページのような独立したリポジトリを調査することは学習に役立ちますが、本番環境では安定性、使いやすさ、十分にメンテナンスされたエコシステムが求められます。Ultralytics Python APIを通じてこれらのモデルを統合すれば、シームレスな開発者体験を実現できます。
統一APIと汎用性#
Ultralyticsフレームワークは、データの読み込み、データ拡張、分散トレーニングの複雑さを抽象化します。さらに、初代RTDETRv2は検出に特化していますが、Ultralyticsエコシステムでは物体検出、インスタンスセグメンテーション、姿勢推定の間を簡単に切り替えられます。
from ultralytics import RTDETR, YOLO
# カスタムデータでYOLOv9モデルをトレーニングする
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)
# 複雑なシーンの評価には、RT-DETRに簡単に切り替えられます
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")
# TensorRTなどの本番環境対応フォーマットにエクスポートできます
model_yolo.export(format="engine")充実したドキュメント、自動化された実験トラッキング、そしてONNX、TensorRT、OpenVINOなどのフォーマットへのシームレスなエクスポート機能により、Ultralyticsはプロトタイプから本番環境までにかかる時間を大幅に短縮します。
最適なユースケース#
RTDETRv2が優れている分野#
グローバルアテンション機構を備えたRTDETRv2は、サーバーサイド処理やグローバルコンテキストが極めて重要な環境で威力を発揮します。特に次の用途に適しています。
- 医用画像: 周囲のコンテキストが重要となる、わずかな異常の特定。
- 航空監視: 従来のCNN畳み込みに伴う空間的なバイアスなしに、高解像度のドローン映像から小さな物体を検出します。
- 密集した群衆の分析: 深刻なオクルージョンによってアンカーベースのモデルが通常は混乱する状況でも、個人を追跡します。
YOLOv9が優れている分野#
YOLOv9は、リソースに制約のあるエッジ環境へのデプロイに優れています。計算効率が高いため、次の用途に最適です。
- ロボティクス: 最小限のレイテンシが求められるリアルタイムのナビゲーションと障害物回避。
- スマートシティIoT: 交通監視向けに、NVIDIA Jetsonなどのエッジデバイスにデプロイします。
- 産業検査: 高いフレームレート(FPS)が求められる高速組立ラインの品質管理。
未来へ:Ultralytics YOLO26の登場#
YOLOv9とRTDETRv2は大きな飛躍を遂げましたが、状況は急速に進化しています。最新のデプロイ環境において、新たにリリースされたUltralytics YOLO26は、両方のアーキテクチャ思想を究極の形で融合しています。
TransformerとCNNの優れた点を取り入れることで、YOLO26は新たな標準を確立します。
- エンドツーエンドのNMSフリーデザイン: RTDETRv2と同様に、YOLO26はネイティブのエンドツーエンド推論に対応しており、
nms=Falseを使用してNMSの後処理を省略します。これにより、デプロイパイプラインが高速化され、簡素化されるとともに、予測可能性も大幅に向上します。 - MuSGDオプティマイザー: 大規模言語モデル(LLM)の学習手法(Moonshot AIのKimi K2など)に着想を得て、YOLO26はSGDとMuonを組み合わせたハイブリッド手法を採用しています。これにより、コンピュータービジョンの学習安定性がかつてないほど高まり、収束も高速化します。
- CPU推論が最大43%高速: 大規模なTransformerとは異なり、YOLO26はエッジコンピューティングやGPUを搭載しないデバイス向けに高度に最適化されています。
- DFLの削除: Distribution Focal Lossを削除することでモデルグラフが大幅に簡素化され、低消費電力のエッジデバイスや組み込み型ニューラルプロセッシングユニット(NPU)へのエクスポートが確実に行えます。
- ProgLoss + STAL: これらの改良された損失関数は、小さな物体の認識性能を大幅に高めます。これは、IoTや航空画像のデータセットで重要な機能です。
新たにコンピュータービジョンプロジェクトを始めるチームには、YOLO26の評価を強くお勧めします。Transformerの任意のNMSフリー設計の洗練さと、高度に最適化されたYOLOアーキテクチャの圧倒的な速度および学習効率を兼ね備えています。
概要#
RTDETRv2とYOLOv9のどちらを選ぶかは、主にデプロイ先のハードウェアと具体的な精度要件によって決まります。RTDETRv2はサーバーを利用するアプリケーション向けに最先端の精度とコンテキスト認識能力を提供し、YOLOv9はエッジデバイスで優れた効率を発揮します。
成熟したUltralyticsエコシステムを活用することで、開発者はYOLOv9と従来のRT-DETRの両方を手軽に試せます。さらに、YOLO11のような新しいモデルや、ネイティブのエンドツーエンドモデルであるYOLO26の登場により、高速な推論、多様なタスクへの対応、低メモリ消費の最適なバランスを見つけることが、かつてないほど簡単になっています。