RTDETRv2とYOLO26#
リアルタイム物体検出の分野は大きく進化し、研究者たちは速度、精度、デプロイ効率の限界を絶えず押し広げています。現在、この分野をリードする代表的なアーキテクチャは、TransformerベースのRTDETRv2と、最先端の畳み込みニューラルネットワーク(CNN)であるUltralytics YOLO26です。このガイドでは、次のコンピュータービジョンプロジェクトに適したモデルを選べるよう、両モデルのアーキテクチャ、性能指標、理想的なユースケースを詳しく分析します。
RTDETRv2:リアルタイム検出Transformer#
RTDETRv2は、元のRT-DETRアーキテクチャを基盤とし、ビジョンTransformerのグローバルな文脈認識能力とリアルタイムアプリケーションに必要な速度の両立を目指しています。
主な特徴:
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- リンク: Arxiv、GitHub、ドキュメント
アーキテクチャと強み#
従来のアンカーベースの検出器とは異なり、RTDETRv2はTransformerベースのアプローチを採用し、後処理時のNon-Maximum Suppression(NMS)をネイティブに不要にします。柔軟なアテンション機構を活用することで、複雑なシーンや重なり合う物体の理解に高い効果を発揮します。「Bag-of-Freebies」による改善により、ハイエンドGPUで許容可能な推論速度を維持しながら、COCOデータセットでの精度を大幅に向上させています。
制限事項#
RTDETRv2は学術分野で優れた結果を達成していますが、本番環境では課題が生じることがよくあります。Transformerアーキテクチャは、CNNと比べてトレーニング時と推論時の両方で本質的に多くのメモリを必要とします。そのため、リソースが限られたエッジAIデバイスへのデプロイが難しくなる場合があります。さらに、Transformerのトレーニングでは通常、大きなバッチサイズと多くのCUDAメモリが必要となり、ハードウェアが限られた研究者にとってボトルネックになることがあります。
YOLO26:エッジファーストのビジョンAIの頂点#
2026年初頭にリリースされたUltralytics YOLO26は、CNNベースの物体検出で可能なことを再定義します。シームレスな本番デプロイと極めて高いハードウェア効率を実現するために、特化した最先端の最適化を取り入れています。
主な特徴:
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2026年1月14日
- リンク: GitHub、ドキュメント
アーキテクチャの画期的な進歩#
YOLO26は、モデルのデプロイでよくある課題を解決する、いくつかの革新的な機能を導入しています。
- エンドツーエンドのNMSフリー設計: YOLOv10で先駆けて導入された概念を基盤に、YOLO26はネイティブなエンドツーエンドモデルとして設計されています。オプションのワンツーワンヘッド(
nms=False)を使ってNMS後処理を省くことで、レイテンシーのばらつきを大幅に抑え、本番環境で非常に予測しやすい推論時間を実現します。 - CPU推論を最大43%高速化: アーキテクチャを戦略的に改良し、Distribution Focal Loss(DFL)を削除することで、YOLO26はかつてないCPU速度を達成します。専用GPUを使用しないエッジコンピューティングに最適な選択肢です。
- MuSGD Optimizer: Moonshot AIのKimi K2などの大規模言語モデル(LLM)のトレーニング手法に着想を得て、YOLO26はSGDとMuonのハイブリッドであるMuSGDオプティマイザーを採用しています。これにより、非常に安定したトレーニングと驚くほど速い収束を実現します。
- ProgLoss + STAL: これらの高度な損失関数は、小さな対象物の認識精度を大幅に高めます。これは、航空画像やドローンを使った監視を伴うアプリケーションに不可欠な改善です。
標準的な検出に加えて、YOLO26にはタスクに特化した改良もあります。セグメンテーションタスク向けのセマンティックセグメンテーション損失とマルチスケールプロト、姿勢推定向けの残差対数尤度推定(RLE)、Oriented Bounding Box(OBB)検出における境界の問題を解決するカスタム角度損失です。
パフォーマンス比較#
これらのモデルを評価する際は、精度(mAP)と計算効率のバランスの取れた性能が重要です。以下の表は、さまざまなサイズのモデル全般にわたり、YOLO26がRTDETRv2を一貫して上回ることを示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
上記のとおり、YOLO26xモデルは57.5 mAPという優れた値を達成し、RTDETRv2-xモデルを大幅に上回ります。また、使用するパラメーター数が少なく、TensorRT推論も高速です。さらに、YOLO26のメモリ要件は明らかに低く、リアルタイムのエッジデプロイに最適な選択肢です。
エコシステムと使いやすさ#
生の性能も重要ですが、研究段階のモデルを本番環境にどれだけ早く移行できるかは、それを支えるエコシステムによって決まります。この点で、Ultralytics Platformは他に類を見ない優位性を提供します。
適切にメンテナンスされた統合エコシステム#
RTDETRv2は主に研究向けのリポジトリとして提供されているため、カスタムタスクでは複雑な環境構築や手動スクリプトが必要になる場合があります。一方、Ultralytics YOLO26は、成熟し、十分なテストを経たPythonパッケージのメリットを活用できます。Ultralyticsエコシステムは、トレーニング、検証、予測、エクスポートのためのシンプルなAPIを備え、非常に合理化されたユーザー体験を提供します。
Weights & BiasesとComet MLとの統合機能が組み込まれているため、実験をシームレスに追跡できます。さらに、Ultralyticsモデルは高い汎用性を備えています。RTDETRv2が物体検出に特化しているのに対し、YOLO26は同じフレームワーク内でインスタンスセグメンテーション、姿勢推定、画像分類をネイティブにサポートします。
コード例:シンプルな実装#
Ultralytics APIを使うと、開発者はわずか数行のコードでモデルの読み込み、トレーニング、推論を実行できます。これによりトレーニング効率が大幅に向上し、市場投入までの時間を短縮できます。
from ultralytics import RTDETR, YOLO
# RT-DETRモデルを読み込む
model_rtdetr = RTDETR("rtdetr-l.pt")
# 最先端のYOLO26モデルを読み込む
model_yolo = YOLO("yolo26n.pt")
# 画像に対してシームレスに推論を実行する
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# YOLO26の結果を表示する
results_yolo[0].show()
# ワンクリックでYOLO26をONNX形式にエクスポートする
model_yolo.export(format="onnx")ユースケースと推奨事項#
RT-DETRとYOLO26のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに関する好みによって異なります。
RT-DETRを選ぶケース#
RT-DETRは、次のような用途に適しています。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
YOLO26を選ぶ場合#
YOLO26は、次の用途に推奨されます:
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
その他のアーキテクチャを検討する#
YOLO26は現在最高峰の性能を誇りますが、開発者は以前のバージョンを検討する価値もあります。高い成功を収めたYOLO11は、さまざまなレガシーシステムで引き続き堅牢に動作し、全面的にサポートされているモデルです。RT-DETRとYOLO11の比較を読んで、機能をさらに詳しく確認できます。また、古いアーキテクチャを分析している場合は、EfficientDetとYOLO26の比較を確認すると、物体検出アーキテクチャがどれほど進化してきたかを歴史的な観点から理解できます。
まとめ#
RTDETRv2とYOLO26は、どちらもAI分野に大きな進歩をもたらしています。しかし、本番環境へのスムーズな移行、メモリ使用量の最小化、幅広いタスクへの対応を重視するチームには、Ultralytics YOLO26を明確におすすめします。NMS不要のアーキテクチャ、高速なCPU処理、堅牢なUltralyticsエコシステムに支えられたYOLO26なら、ビジョンAIプロジェクトのスケーラビリティ、効率性、将来性を確保できます。クラウドサーバーでも、リソースが限られたRaspberry Piでも、YOLO26は箱から出してすぐに妥協のない性能を発揮します。