YOLO26 対 RTDETRv2#
コンピュータービジョンの分野は常に進化しており、実務者は重要な選択を迫られています。高度に最適化された畳み込みニューラルネットワーク(CNNs)を活用すべきでしょうか。それとも、より新しいTransformerベースのアーキテクチャを採用すべきでしょうか。この分野で注目される2つのモデルが、最先端のUltralytics YOLO26とBaiduのRTDETRv2です。どちらのモデルもリアルタイム物体検出の限界を押し広げていますが、アーキテクチャに対する基本的な考え方は大きく異なります。
このガイドでは、両モデルについて技術的に詳しく解説し、構造、パフォーマンス指標、理想的なユースケースを比較します。次のコンピュータービジョンプロジェクトに最適な基盤を選択するのに役立ちます。
Ultralytics YOLO26:エッジファーストビジョンAIの最高峰#
Ultralyticsが開発したYOLO26は、YOLOファミリーにおける世代を超えた大きな飛躍を示すモデルです。2026年1月にリリースされ、クラウド環境とエッジ環境全体にわたる高速性、精度、シームレスなデプロイを明確な目的として設計されています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2026-01-14
- GitHub: Ultralyticsリポジトリ
- ドキュメント: YOLO26公式ドキュメント
アーキテクチャの革新と強み#
YOLO26には、Transformerモデルだけでなく、YOLO11などの従来のモデルとも差別化される、画期的な機能が複数導入されています。
- エンドツーエンドのNMSフリーデザイン: YOLO26は、後処理における従来の非最大抑制(NMS)を排除しています。YOLOv10などのモデルで先駆的に導入されたこのネイティブなエンドツーエンド方式により、推論レイテンシーのばらつきが低減され、特にエッジハードウェアでのデプロイロジックが簡素化されます。
- CPU推論が最大43%高速: 分散型AIの需要の高まりを見据え、YOLO26は、Raspberry Piなど、専用GPUを搭載していないデバイス向けに高度に最適化されています。
- DFLの除去: 分布焦点損失(DFL)を取り除くことで、YOLO26はエクスポートプロセスを簡素化し、低消費電力のエッジデバイスやマイクロコントローラーとの互換性を大幅に向上させています。
- MuSGDオプティマイザー: 大規模言語モデル(LLM)のトレーニングとコンピュータービジョンのギャップを埋めるため、YOLO26はMuSGDオプティマイザーを使用しています。SGDと、Moonshot AIのKimi K2に着想を得たMuonを組み合わせたこのハイブリッド方式により、堅牢なトレーニングの安定性と高速な収束を実現します。
- ProgLoss + STAL: 高度な損失関数により、小さな物体の認識が大幅に向上します。これは、航空画像分析やモノのインターネット(IoT)センサーに依存する業界にとって重要です。
ビジョンタスク全般への対応力#
境界ボックスだけに厳密に限定されたモデルとは異なり、YOLO26は汎用性の高い強力なモデルです。インスタンスセグメンテーション向けのセマンティックセグメンテーション損失とマルチスケールproto、ポーズ推定向けの残差対数尤度推定(RLE)、方向付き境界ボックス(OBB)タスクの境界に関する問題を解決する専用の角度損失など、タスク固有の改良が組み込まれています。
RTDETRv2:リアルタイム検出Transformerの強化#
Baiduの研究者によって開発されたRTDETRv2は、元のRT-DETRフレームワークを基盤としています。検出Transformer(DETRs)が、リアルタイムのシナリオにおいて、高度に最適化されたCNNsの速度と精度に対抗し、ときには上回ることを実証することを目指しています。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2 PyTorch 実装
- ドキュメント: RTDETRv2 README
アーキテクチャと機能#
RTDETRv2はTransformerベースのアーキテクチャを採用しています。自己注意メカニズムを活用してグローバルコンテキストを理解することで、CNNsとは本質的に異なる方法で画像を処理します。
- Bag-of-Freebies: v2では、推論コストを増加させることなくベースラインのパフォーマンスを向上させる、最適化された一連のトレーニング手法(bag-of-freebies)が導入されています。
- グローバルコンテキスト認識: Transformerのアテンションレイヤーにより、RTDETRv2は、重なり合った物体や遮蔽された物体を区別するためにグローバルコンテキストが必要となる複雑なシーンの理解を本質的に得意としています。
Transformerモデルの限界#
強力である一方、RTDETRv2のようなTransformerベースの検出モデルは、実際のデプロイで課題に直面することがよくあります。一般に、効率的なCNNsと比較して、トレーニング時により多くのCUDAメモリを必要とします。さらに、アテンションレイヤーに必要な複雑な演算により、多様なエッジ環境への統合が煩雑になる可能性があります。そのため、リソースに制約のあるデプロイではYOLO26のようなモデルがはるかに魅力的です。
性能比較#
これらのモデルを直接比較すると、最新のCNN最適化による具体的なメリットが明らかになります。以下の表では、標準ベンチマークにおけるパフォーマンスの概要を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 193.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
示されているとおり、YOLO26はすべてのサイズバリアントで一貫してRTDETRv2を上回っています。YOLO26xは、RTDETRv2-x(54.3 mAP、15.03 ms、76Mパラメーター)よりも低いレイテンシー(TensorRTで11.8 ms)と大幅に少ないパラメーター数(55.7M)で、57.5 mAPという優れた性能を達成しています。
ユースケースと推奨事項#
YOLO26とRT-DETRのどちらを選択するかは、具体的なプロジェクト要件、デプロイの制約、エコシステムの好みによって決まります。
YOLO26を選ぶタイミング#
YOLO26は次の用途に適しています:
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
RT-DETRを選択するケース#
RT-DETRは次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使用しないエンドツーエンド物体検出のために、アテンションメカニズムやTransformerアーキテクチャを研究するプロジェクト。
- 柔軟なレイテンシーを許容できる高精度シナリオ: 検出精度を最優先し、やや高い推論レイテンシーを許容できるアプリケーション。
- 大きな物体の検出: 主に中型から大型の物体が存在し、Transformerのグローバルアテンションメカニズムが本質的な優位性を発揮するシーン。
Ultralyticsの優位性#
適切な機械学習アーキテクチャを選択することは方程式の一部にすぎません。プロトタイピングから本番環境までチームがどれだけ迅速に進められるかは、周辺のエコシステムによって決まります。
使いやすさとトレーニング効率#
Ultralytics Python APIは、非常に効率化されたエクスペリエンスを提供します。複雑なモデルのトレーニングに、冗長なボイラープレートコードはもはや必要ありません。さらに、YOLO26のトレーニング効率は大幅に優れており、RTDETRv2のメモリ負荷が大きいアテンションメカニズムよりもはるかに少ないGPU VRAMしか使用しません。そのため、一般消費者向けハードウェアでもより大きなバッチサイズを利用できます。
from ultralytics import YOLO
# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")
# Export to ONNX for seamless deployment
model.export(format="onnx")適切に保守されたエコシステム#
Ultralyticsモデルを利用すると、開発者は、Weights & BiasesやComet MLなどの最新のトラッキングツールとネイティブに統合された、活発に保守されているフレームワークを利用できます。コードを使用しないアプローチを好む場合は、Ultralytics Platformによって、クラウドトレーニング、データセット管理、ワンクリックデプロイが可能になります。
パフォーマンスのバランス#
YOLO26は、推論速度と精度の間で他に類を見ないバランスを実現しています。NMSの除去とMuSGDオプティマイザーの組み合わせにより、(ProgLoss + STALによって)小さな物体に対しても高精度で、かつ本番環境では非常に高速なモデルをデプロイできます。そのため、ほぼすべての最新のコンピュータービジョンアプリケーションにとって優れた選択肢となります。
エコシステム内のその他のモデル#
YOLO26とRTDETRv2はリアルタイム検出の最先端をカバーしていますが、レガシーパイプラインを保守している開発者や、異なる効率性の特性を検討している開発者は、確立されたエンタープライズ環境向けにYOLOv8を検討したり、EfficientDetなどの他のアーキテクチャを検討したりすることもできます。ただし、新しい取り組みにはYOLO26を明確に推奨します。