YOLOXとRTDETRv2#
コンピュータービジョンアプリケーションに最適なアーキテクチャを選ぶには、精度、推論速度、デプロイの実現可能性を慎重にバランスさせる必要があります。この包括的な技術分析では、実績のあるアンカーフリーCNNアーキテクチャであるYOLOXと、最先端のリアルタイム検出TransformerであるRTDETRv2の根本的な違いを解説します。
どちらのモデルも物体検出分野に大きく貢献してきましたが、本番環境に対応したアプリケーションを構築する開発者は、Ultralytics YOLO26のような最新の代替モデルが、より高いトレーニング効率、少ないメモリ要件、より堅牢なデプロイエコシステムを提供すると実感することがよくあります。
YOLOX:研究と産業の隔たりを埋める#
YOLOXはYOLOシリーズのアンカーフリーな派生モデルとして広く普及し、リリース当時に優れた性能向上をもたらすシンプルな設計を導入しました。
- 著者: Zheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sun
- 組織: Megvii
- 日付: 2021年7月18日
- リンク: Arxiv、GitHub、ドキュメント
アーキテクチャの革新#
YOLOXはYOLOファミリーをアンカーフリーのパラダイムへと移行させ、分離型ヘッドと高度なSimOTAラベル割り当て戦略を組み合わせました。アンカーボックスを排除することで、アーキテクチャの設計パラメーター数を大幅に削減し、多様なベンチマークデータセットに対する汎化性能を向上させました。軽量版のYOLOX-NanoとYOLOX-Tinyは、エッジデバイス上でビジョンAIアプリケーションをデプロイする際の人気モデルとなりました。
YOLOXは顕著な進歩をもたらしましたが、大規模なデータ拡張パイプラインや従来型NMSなどの古い後処理手法に依存するため、ネイティブなエンドツーエンドモデルと比べてレイテンシが高くなる場合があります。
RTDETRv2:リアルタイムビジョンTransformerの進化#
RTDETRv2は、前身モデルの基盤を引き継ぎ、Vision Transformer(ViT)の能力を活用することで、リアルタイム推論速度を損なうことなく高い精度を実現しています。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- リンク: Arxiv、GitHub
アーキテクチャの革新#
RTDETRv2はTransformerベースのアーキテクチャを採用し、Non-Maximum Suppression(NMS)をネイティブに回避することで、検出パイプラインを根本から再構築しています。これはハイブリッドエンコーダーとIoUを考慮したクエリ選択によって実現され、オブジェクトクエリの初期化を改善します。このモデルはマルチスケール特徴を効果的に処理し、夜間の交通映像検出など、複雑な環境の細かな特徴を捉えます。
ただし、Transformerは本質的に多くのリソースを必要とします。RTDETRv2のトレーニングには通常、CNNベースの代替モデルよりも大幅に多くのGPUメモリと計算時間が必要となるため、厳しい予算制約のあるチームや、頻繁なモデルの調整が必要なチームにとって障壁となることがあります。
性能比較表#
これらのアーキテクチャを客観的に評価するため、COCOデータセットでの性能を検証します。以下の表では、精度(mAP)、パラメーター数、計算複雑度のトレードオフを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2は優れた精度を達成しますが、YOLOXは軽量なパラメータープロファイル、特にNanoとTinyのバリエーションで優位性を維持しています。
ユースケースと推奨事項#
YOLOXとRT-DETRのどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムへの好みによって決まります。
YOLOXを選ぶタイミング#
YOLOXは次のような用途に適しています:
- アンカーフリー検出の研究: 新しい検出ヘッドや損失関数を試す際のベースラインとして、YOLOXのシンプルなアンカーフリーアーキテクチャを使用する学術研究。
- 超軽量エッジデバイス: YOLOX-Nanoバリアントの極めて小さなフットプリント(パラメーター数0.91M)が重要となる、マイクロコントローラーや旧式のモバイルハードウェアへのデプロイ。
- SimOTAラベル割り当ての研究: 最適輸送に基づくラベル割り当て戦略と、トレーニングの収束への影響を調査する研究プロジェクト。
RT-DETRを選ぶケース#
RT-DETRは、次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの強み: YOLO26#
YOLOXとRTDETRv2にはそれぞれ異なる強みがありますが、新たにリリースされたUltralytics YOLO26は、速度、精度、デプロイの容易さに関する従来のトレードオフを解消し、ビジョンAIの最先端を塗り替えます。
1. エンドツーエンドのNMSフリーアーキテクチャ#
Transformerモデルから着想を得ながらCNNの効率性を維持するYOLO26は、オプションのエンドツーエンドNMSフリー設計(nms=False)を備えています。後処理からNon-Maximum Suppressionを排除することで、YOLO26はデプロイパイプラインを大幅に簡素化し、複雑な閾値調整の負担なく、さまざまなエッジデバイスで一貫した推論レイテンシを実現します。
2. CPU推論が最大43%高速#
ハイエンドGPUに大きく依存するRTDETRv2などのTransformerアーキテクチャとは異なり、YOLO26はエッジコンピューティング環境に特化して最適化されています。Distribution Focal Loss(DFL)を排除してモデルのエクスポートを効率化し、CPU推論を最大43%高速化するため、Raspberry Piなどのハードウェアや一般的なモバイルデバイスへの組み込みに最適です。
3. MuSGDによるトレーニング効率#
Transformerモデルのトレーニングでは、CUDAメモリの過剰な消費や長時間のトレーニングにつながることがよくあります。YOLO26は、確率的勾配降下法とLLMに着想を得たMuon Optimizerを組み合わせた新しいMuSGD Optimizerを導入しています。この革新により、非常に安定したトレーニングと高速な収束が実現し、RTDETRv2と比べてハードウェア要件が大幅に軽減されます。
4. 比類ないエコシステムと汎用性#
Ultralyticsエコシステムは、直感的で効率的な開発者体験を提供します。充実したドキュメント、活発なコミュニティサポート、クラウドを活用したUltralytics Platformにより、AIライフサイクル全体の管理がこれまで以上に簡単になります。さらに、YOLO26は非常に汎用性が高く、物体検出に特化したRTDETRv2とは異なり、インスタンスセグメンテーション、画像分類、姿勢推定、方向付きバウンディングボックス(OBB)タスクにネイティブ対応しています。新しいProgLoss + STAL(Progressive Loss and Small-Target-Aware Label Assignment)により、小さな物体の認識にも優れており、航空画像や産業用欠陥検出で重要な機能となります。
Ultralyticsとのスムーズな連携#
モデルのデプロイに、複雑で断片化したコードベースへの対応が必要であってはなりません。Ultralytics Python APIを使えば、わずか数行のコードで最先端モデルの読み込み、トレーニング、エクスポートが可能です。
from ultralytics import YOLO
# エッジで最高の性能を発揮する最新のYOLO26 nanoモデルを読み込みます
model = YOLO("yolo26n.pt")
# メモリ使用量を最小限に抑えながら、カスタムデータセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# モデルの性能を検証します
metrics = model.val()
# デプロイ用にONNXまたはTensorRTへスムーズにエクスポートします
model.export(format="onnx")Ultralyticsを活用すれば、研究用リポジトリで一般的な複雑な環境設定を回避でき、市場投入までの時間を短縮できます。
結論#
YOLOXとRTDETRv2は、リアルタイム物体検出の進歩における重要な節目となるモデルです。YOLOXは高効率なアンカーフリーCNNの実用性を示し、RTDETRv2はTransformerをリアルタイム制約に適応させることに成功しました。
スマートリテール分析から組み込みロボティクスまで、現代のアプリケーションにはUltralytics YOLO26が最適なソリューションを提供します。NMSフリー推論、比類ないCPU速度、少ないメモリ使用量、Ultralytics Platformの堅牢なサポートを組み合わせることで、YOLO26は開発者が次世代の信頼性と高性能を備えたコンピュータービジョンシステムを構築できるよう支援します。