Ultralytics YOLO27:

RTDETRv2 vs YOLO26#

リアルタイム物体検出の分野は劇的に進化しており、研究者たちは速度、精度、デプロイ効率の限界を継続的に押し広げています。現在この進化を先導する代表的なアーキテクチャは、TransformerベースのRTDETRv2と、最先端の畳み込みニューラルネットワーク (CNN) である Ultralytics YOLO26 です。本ガイドでは、次の コンピュータービジョン プロジェクトに適したモデルを選択できるよう、両者のアーキテクチャ、パフォーマンス指標、理想的なユースケースを詳しく分析します。

RTDETRv2:リアルタイム検出Transformer#

RTDETRv2は、元の RT-DETR アーキテクチャを基盤としており、ビジョンTransformerのグローバルコンテキスト認識と、リアルタイムアプリケーションに必要な速度の両立を目指しています。

主な特徴:

  • 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
  • 組織: Baidu
  • 日付: 2024-07-24
  • リンク: ArxivGitHubDocs

アーキテクチャと強み#

従来のアンカーベース検出器とは異なり、RTDETRv2はTransformerベースのアプローチを活用し、後処理における 非最大抑制 (NMS) の必要性をネイティブに排除します。柔軟なアテンションメカニズムを利用することで、複雑なシーンや重なり合う物体の理解に高い効果を発揮します。「Bag-of-Freebies」による改良により、COCOデータセット における精度が大幅に向上し、高性能GPU上で許容可能な推論速度も維持しています。

制限事項#

RTDETRv2は学術研究で優れた結果を達成する一方、実運用環境では課題が生じることがあります。Transformerアーキテクチャは本質的に、CNNと比較してトレーニング時と推論時の両方でより多くのメモリを必要とします。そのため、リソースに制約のある エッジAI デバイスへのデプロイが困難になる場合があります。さらに、Transformerのトレーニングには通常、より大きなバッチサイズとより多くのCUDAメモリが必要であり、ハードウェアが限られた研究者にとってボトルネックとなる可能性があります。

RTDETRv2についてさらに学ぶ

YOLO26:エッジファースト・ビジョンAIの頂点#

2026年初頭にリリースされた Ultralytics YOLO26 は、CNNベースの物体検出で可能なことを再定義します。シームレスな本番デプロイと極めて高いハードウェア効率に特化した、最先端の最適化を取り入れています。

主な特徴:

アーキテクチャ上のブレークスルー#

YOLO26は、モデルのデプロイにおける一般的な課題を解決する、革新的な複数の機能を導入しています。

  • エンドツーエンドのNMSフリーデザイン: YOLOv10 で先駆的に導入された概念を基盤として、YOLO26はネイティブなエンドツーエンドモデルになっています。NMSの後処理を排除することで、レイテンシーの変動を大幅に抑え、本番環境で非常に予測しやすい推論時間を実現します。
  • CPU推論が最大43%高速: 戦略的なアーキテクチャの改良とDistribution Focal Loss (DFL) の削除により、YOLO26は前例のないCPU速度を実現します。専用GPUを使用しない エッジコンピューティング に最適な選択肢です。
  • MuSGDオプティマイザー: Moonshot AIのKimi K2など、大規模言語モデル (LLM) のトレーニング手法に着想を得て、YOLO26はMuSGDオプティマイザー (SGDとMuonのハイブリッド) を使用します。これにより、非常に安定したトレーニングと極めて高速な収束を実現します。
  • ProgLoss + STAL: これらの高度な損失関数により、小物体認識が大幅に向上します。これは 航空画像 やドローンベースの監視を扱うアプリケーションに不可欠な強化です。
YOLO26におけるタスク固有の強化

標準的な検出に加えて、YOLO26には、セグメンテーションタスク 向けのセマンティックセグメンテーション損失とマルチスケールproto、ポーズ推定 向けのResidual Log-Likelihood Estimation (RLE)、回転バウンディングボックス (OBB) 検出における境界の問題を解決するカスタマイズされた角度損失など、専門的な改良が施されています。

性能比較#

これらのモデルを評価する際には、精度 (mAP) と計算効率のバランスに優れたパフォーマンスを実現することが重要です。以下の表は、さまざまなサイズバリアントにおいてYOLO26が一貫してRTDETRv2を上回ることを示しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター数
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

上記のとおり、YOLO26xモデルは 57.5 mAP という優れた値を達成し、RTDETRv2-xモデルを大幅に上回っています。また、パラメーター数を抑えながら、より高速な TensorRT 推論速度を維持しています。さらに、YOLO26のメモリ要件は明らかに少なく、リアルタイムのエッジデプロイに最適な選択肢となっています。

エコシステムと使いやすさ#

生のパフォーマンスが重要である一方、モデルを研究から本番環境へどれだけ速く移行できるかは、その周辺エコシステムによって決まります。ここで Ultralytics Platform が他にない優位性を発揮します。

適切に維持管理された統合エコシステム#

RTDETRv2は主に研究グレードのリポジトリとして運用されているため、カスタムタスクでは複雑な環境構築や手動スクリプトが必要になる場合があります。一方、Ultralytics YOLO26は、成熟して十分にテストされたPythonパッケージのメリットを活用できます。Ultralyticsエコシステムは、トレーニング、検証、予測、エクスポートに対応したシンプルなAPIを提供し、非常に効率化されたユーザー体験を実現します。

Weights & BiasesComet ML が組み込まれているため、実験トラッキングをシームレスに行えます。さらに、Ultralyticsのモデルは高い汎用性を備えています。RTDETRv2が物体検出に重点を置くのに対し、YOLO26は同一のフレームワーク内で、インスタンスセグメンテーション、ポーズ推定、画像分類をネイティブにサポートします。

コード例: シンプルさの実践#

Ultralytics APIを使用すると、わずか数行のコードでモデルの読み込み、トレーニング、推論の実行が可能です。これにより、トレーニング効率が大幅に向上し、市場投入までの時間を短縮できます。

from ultralytics import RTDETR, YOLO

# Load an RT-DETR model
model_rtdetr = RTDETR("rtdetr-l.pt")

# Load a state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")

# Run inference on an image seamlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")

# Display the YOLO26 results
results_yolo[0].show()

# Export YOLO26 to ONNX format with one click
model_yolo.export(format="onnx")

ユースケースと推奨事項#

RT-DETRとYOLO26のどちらを選ぶかは、具体的なプロジェクト要件、デプロイの制約、エコシステムに関する好みによって異なります。

RT-DETRを選択するケース#

RT-DETRが適しているケース:

  • Transformerベースの検出研究: NMSを使用しないエンドツーエンド物体検出のために、アテンションメカニズムやTransformerアーキテクチャを研究するプロジェクト。
  • 柔軟なレイテンシーを許容できる高精度シナリオ: 検出精度を最優先し、やや高い推論レイテンシーを許容できるアプリケーション。
  • 大きな物体の検出: 主に中型から大型の物体が存在し、Transformerのグローバルアテンションメカニズムが本質的な優位性を発揮するシーン。

YOLO26を選ぶタイミング#

YOLO26は次の用途に推奨されます:

  • NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
  • CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
  • 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。

その他のアーキテクチャを検討する#

YOLO26が現在のパフォーマンスの頂点を表す一方で、開発者は以前の反復を探索することにも価値を見出すかもしれません。大成功を収めたYOLO11は、さまざまなレガシーシステム向けに堅牢で完全にサポートされたモデルであり続けています。RT-DETR vs YOLO11 comparisonを読むことで、YOLO11の機能についてより深く掘り下げることができます。さらに、古いアーキテクチャを分析している場合、EfficientDet vs YOLO26 comparisonを確認することは、object detection architecturesがどれほど進歩したかについての優れた歴史的文脈を提供します。

最後に#

RTDETRv2とYOLO26は、AI分野に大きな進歩をもたらしています。しかし、本番環境へのシームレスな移行、最小限のメモリフットプリント、幅広いタスクへの汎用性を重視するチームには、Ultralytics YOLO26 を明確に推奨します。NMSフリーのアーキテクチャ、高速なCPU性能、堅牢なUltralyticsエコシステムの支援により、ビジョンAIプロジェクトのスケーラビリティ、効率、将来性を確保できます。クラウドサーバーにデプロイする場合でも、リソースに制約のある Raspberry Pi にデプロイする場合でも、YOLO26はすぐに妥協のないパフォーマンスを発揮します。

コメント