YOLO26とRTDETRv2#
コンピュータビジョンの分野は絶えず進化しており、実務者は重要な選択を迫られています。高度に最適化された畳み込みニューラルネットワーク(CNNs)を活用するべきか、それとも新しいTransformerベースのアーキテクチャを採用するべきでしょうか。この分野の有力候補として、最先端のUltralytics YOLO26とBaiduのRTDETRv2が挙げられます。どちらもリアルタイム物体検出の限界を押し広げていますが、アーキテクチャの基本理念は大きく異なります。
このガイドでは、両モデルの構造、パフォーマンスメトリクス、最適なユースケースを詳しく技術的に解説し、次のコンピュータビジョンプロジェクトに最適な基盤を選べるよう支援します。
Ultralytics YOLO26:エッジファーストのビジョンAIの最高峰#
Ultralyticsが開発したYOLO26は、YOLOファミリーにおける世代を超えた大きな飛躍を表しています。2026年1月にリリースされ、クラウド環境とエッジ環境の両方で、速度、精度、シームレスなデプロイを実現するよう明確に設計されています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2026-01-14
- GitHub: Ultralyticsリポジトリ
- ドキュメント: YOLO26公式ドキュメント
アーキテクチャの革新と強み#
YOLO26には、Transformerモデルだけでなく、YOLO11などの旧世代モデルとも一線を画す、画期的な機能がいくつか導入されています。
- エンドツーエンドのNMSフリーデザイン: YOLO26のオプションのワンツーワンヘッド(
nms=False)は、後処理における従来のNon-Maximum Suppression(NMS)を不要にします。YOLOv10などのモデルで先駆けて導入されたこのエンドツーエンドのアプローチにより、推論レイテンシのばらつきが抑えられ、特にエッジハードウェアでのデプロイロジックがシンプルになります。 - CPU推論が最大43%高速: 分散型AIのニーズの高まりに対応し、YOLO26は専用GPUを搭載していないデバイス、たとえばRaspberry Pi向けに高度に最適化されています。
- DFLの削除: Distribution Focal Loss(DFL)を取り除くことで、YOLO26はエクスポートプロセスを簡素化し、低消費電力のエッジデバイスやマイクロコントローラーとの互換性を大幅に向上させています。
- MuSGD Optimizer: 大規模言語モデル(LLM)のトレーニングとコンピュータビジョンの隔たりを埋めるため、YOLO26はMuSGD Optimizerを使用しています。SGDとMuonのこのハイブリッドは、Moonshot AIのKimi K2に着想を得ており、高いトレーニング安定性と速い収束を実現します。
- ProgLoss + STAL: 高度な損失関数により、小さなオブジェクトの認識精度が大幅に向上します。これは、航空画像分析やモノのインターネット(IoT)センサーを活用する業界にとって重要です。
多様なビジョンタスクに対応#
YOLO26は、バウンディングボックスだけに限定されたモデルとは異なり、幅広い用途に対応します。セマンティックセグメンテーション損失やインスタンスセグメンテーション向けのマルチスケールプロト、姿勢推定向けの残差対数尤度推定(RLE)、回転バウンディングボックス(OBB)タスクの境界問題を解決する専用の角度損失など、タスク固有の改善が組み込まれています。
RTDETRv2:リアルタイム検出Transformerの強化#
Baiduの研究者が開発したRTDETRv2は、初代RT-DETRフレームワークを基盤としています。検出Transformer(DETR)が、リアルタイムのシナリオにおいて、高度に最適化されたCNNと競争でき、ときには速度や精度で上回ることを示すことを目指しています。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2のPyTorch実装
- ドキュメント: RTDETRv2のREADME
アーキテクチャと機能#
RTDETRv2はTransformerベースのアーキテクチャを採用しており、自己注意機構を活用してグローバルなコンテキストを理解することで、CNNとは根本的に異なる方法で画像を処理します。
- Bag-of-Freebies: v2では、推論コストを増やすことなくベースラインのパフォーマンスを向上させる、最適化されたトレーニング手法(bag-of-freebies)が複数導入されています。
- グローバルコンテキストの認識: Transformerの注意層により、RTDETRv2は、重なり合ったオブジェクトや遮蔽されたオブジェクトを区別するためにグローバルコンテキストが必要な複雑なシーンの理解に優れています。
Transformerモデルの制約#
Transformerベースの検出モデルは強力ですが、RTDETRv2のようなモデルは実運用でのデプロイに課題を抱えることがよくあります。一般に、効率的なCNNと比べてトレーニング時に必要なCUDAメモリが多くなります。さらに、注意層に必要な演算が複雑なため、多様なエッジ環境への統合が煩雑になることがあり、リソースが限られた環境ではYOLO26のようなモデルがはるかに魅力的です。
パフォーマンス比較#
これらのモデルを直接比較すると、最新のCNN最適化がもたらす具体的な利点が明らかになります。以下の表では、標準的なベンチマークでのパフォーマンスを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
結果が示すように、YOLO26はすべてのサイズバリアントでRTDETRv2を一貫して上回っています。YOLO26xは、RTDETRv2-x(mAP 54.3、15.03 ms、76Mパラメーター)よりもレイテンシが低く(TensorRTで11.8 ms)、パラメーター数が大幅に少ない(55.7M)一方で、優れたmAP 57.5を達成しています。
ユースケースと推奨事項#
YOLO26とRT-DETRのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムの好みによって異なります。
YOLO26を選ぶ場合#
YOLO26は、次のような用途に適しています。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
RT-DETRを選ぶケース#
RT-DETRは、次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
Ultralyticsの強み#
適切な機械学習アーキテクチャを選ぶことは重要ですが、それだけでは十分ではありません。周辺のエコシステムによって、チームがプロトタイプから本番環境へどれだけ速く移行できるかが決まります。
使いやすさとトレーニング効率#
Ultralytics Python APIは、非常にスムーズな開発体験を提供します。複雑なモデルのトレーニングに、冗長なボイラープレートコードは不要です。さらに、YOLO26はトレーニング効率が大幅に優れており、メモリを大量に消費するRTDETRv2の注意機構よりもGPU VRAMの使用量がはるかに少ないため、一般向けハードウェアでもバッチサイズを大きくできます。
from ultralytics import YOLO
# 最先端のYOLO26 Nanoモデルを初期化します
model = YOLO("yolo26n.pt")
# COCO8データセットで100エポック学習します
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 高速なNMSフリー推論を実行します
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# スムーズなデプロイに向けてONNXにエクスポートします
model.export(format="onnx")整備されたエコシステム#
Ultralyticsのモデルを利用することで、開発者は、Weights & BiasesやComet MLなどの最新のトラッキングツールとネイティブに連携する、活発にメンテナンスされたフレームワークを利用できます。コードを書かずに作業したい場合は、Ultralytics Platformを使って、クラウドトレーニング、データセット管理、ワンクリックデプロイを行えます。
パフォーマンスのバランス#
YOLO26は、推論速度と精度の比類ないバランスを実現します。オプションのNMS削除とMuSGD Optimizerの組み合わせにより、小さなオブジェクトでも高精度(ProgLoss + STALによる)で、本番環境では非常に高速なモデルをデプロイできます。そのため、現代のほぼすべてのコンピュータビジョンアプリケーションにおいて、優れた選択肢となります。
エコシステム内のその他のモデル#
YOLO26とRTDETRv2はリアルタイム検出の最先端を担いますが、レガシーパイプラインの保守や異なる効率特性の検討を行う開発者は、確立されたエンタープライズ環境向けのYOLOv8や、EfficientDetなどの別のアーキテクチャも検討できます。ただし、新たに取り組みを始める場合は、YOLO26を強く推奨します。