YOLOX と RTDETRv2#
コンピュータビジョンアプリケーションに最適なアーキテクチャを選ぶには、精度、推論速度、およびデプロイの実現可能性の慎重なバランスが求められます。この包括的な技術的分析では、非常に成功を収めたアンカーフリーのCNNアーキテクチャであるYOLOXと、最先端のリアルタイム検出TransformerであるRTDETRv2の基本的な違いを掘り下げます。
両モデルともオブジェクト検出の分野に多大な貢献をしてきましたが、本番環境に対応するアプリケーションを構築する開発者は、Ultralytics YOLO26のような現代的な代替手段が、より優れたトレーニング効率、少ないメモリ要件、およびより堅牢なデプロイエコシステムを提供していることに気づくことがよくあります。
YOLOX: 研究と産業の橋渡し#
YOLOXは、YOLOシリーズの非常に人気のあるアンカーフリー適応モデルとして登場し、リリース時に優れたパフォーマンスの向上を実現した簡素化された設計を導入しました。
- 著者: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, Jian Sun
- 組織: Megvii
- 日付: 2021年7月18日
- リンク: Arxiv、GitHub、Docs
アーキテクチャの革新#
YOLOXはYOLOファミリーをアンカーフリーのパラダイムへと移行させ、分離型ヘッド(decoupled head)と高度なSimOTAラベル割り当て戦略を統合しました。アンカーボックスを排除することにより、このアーキテクチャは設計パラメータの数を大幅に削減し、さまざまなベンチマークデータセット全体での汎化性能を向上させました。その軽量版であるYOLOX-NanoとYOLOX-Tinyは、エッジデバイスでのビジョンAIアプリケーションのデプロイで人気の選択肢となりました。
YOLOXは顕著な進歩をもたらしましたが、重厚な拡張パイプラインや従来の(従来のNMSのような)後処理ルーチンへの依存は、ネイティブなエンドツーエンドモデルと比較して、より高いレイテンシを招く可能性があります。
RTDETRv2: リアルタイムビジョンTransformerの進化#
前身モデルの基盤の上に構築された RTDETRv2 は、Vision Transformer (ViTs) のパワーを活用し、リアルタイムの推論速度を犠牲にすることなく、非常に競争力のある精度を実現しています。
- 著者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, and Yi Liu
- 組織: Baidu
- 日付: 2024年7月24日
- Links: Arxiv, GitHub
アーキテクチャの革新#
RTDETRv2は、非最大値抑制(NMS)をネイティブにバイパスするTransformerベースのアーキテクチャを利用することで、検出パイプラインを根本的に再構築します。これは、ハイブリッドエンコーダとIoUアウェアなクエリ選択によって達成され、オブジェクトクエリの初期化を改善します。このモデルはマルチスケール特徴量を効果的に処理するため、夜間の交通ビデオ検出などの複雑な環境において複雑な詳細を捉えることができます。
しかし、Transformerは本質的にリソース集約型です。RTDETRv2のトレーニングには、通常、CNNベースの代替手段よりも大幅に多くのGPUメモリと計算サイクルが必要となります。これは、厳しい予算制約の中で活動するチームや、頻繁なモデルチューニングを必要とするチームにとってハードルとなる可能性があります。
性能比較テーブル#
これらのアーキテクチャを客観的に評価するために、COCOデータセットでのパフォーマンスを検証します。以下の表は、精度(mAP)、パラメータ数、および計算量の間のトレードオフを示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2 は優れた精度を達成していますが、YOLOX は、特に Nano や Tiny バリアントにおいて、軽量なパラメータプロファイルの利点を維持しています。
ユースケースと推奨事項#
YOLOX と RT-DETR のどちらを選択するかは、プロジェクト固有の要件、デプロイの制約、およびエコシステムの好みによって決まります。
YOLOXを選択すべき時#
YOLOXは以下の場合に強力な選択肢となります。
- アンカーフリー検出研究: 新しい検出ヘッドや損失関数を実験するためのベースラインとして、YOLOXのクリーンでアンカーフリーなアーキテクチャを使用する学術研究。
- 超軽量エッジデバイス: YOLOX-Nanoバリアントの非常に小さなフットプリント(0.91Mパラメータ)が不可欠な、マイクロコントローラやレガシーモバイルハードウェアへのデプロイ。
- SimOTAラベル割り当ての研究: 最適輸送に基づくラベル割り当て戦略と、それが学習の収束に与える影響を調査する研究プロジェクト。
RT-DETRを選択すべき時#
RT-DETRが推奨される場合:
- Transformerベースの検出研究: NMSなしのエンドツーエンド物体検出に向けたアテンションメカニズムやTransformerアーキテクチャを探求するプロジェクト。
- 高い精度が求められ、レイテンシに柔軟性があるシナリオ: 検出精度が最優先され、多少推論レイテンシが高くても許容されるアプリケーション。
- 大きな物体の検出: 主に中規模から大規模な物体が中心となるシーンで、Transformerのグローバルアテンションメカニズムが自然な利点となる場合。
Ultralytics (YOLO26) を選択すべき時#
ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。
- NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
- CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
- 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。
Ultralyticsの利点:YOLO26#
YOLOXとRTDETRv2のどちらも明確な強みを提供していますが、新しくリリースされたUltralytics YOLO26はビジョンAIの最先端を再定義し、速度、精度、およびデプロイの容易さの間の歴史的なトレードオフを解消します。
エンドツーエンドのNMSフリーアーキテクチャ#
Transformerモデルから着想を得つつ、CNNの効率性を維持している YOLO26 は、ネイティブな エンドツーエンドのNMSフリー設計 を特徴としています。後処理ステップとしての Non-Maximum Suppression を排除することで、YOLO26 はデプロイパイプラインを劇的に簡素化し、複雑な閾値チューニングのオーバーヘッドなしに、様々なエッジデバイス間で一貫した推論レイテンシを保証します。
最大43%高速なCPU推論#
ハイエンドGPUに大きく依存するRTDETRv2のようなTransformerアーキテクチャとは異なり、YOLO26はエッジコンピューティング環境向けに特化して最適化されています。Distribution Focal Loss(DFL)の削除により、YOLO26はモデルのエクスポートを効率化し、最大43%高速なCPU推論を実現するため、Raspberry Piや標準的なモバイルデバイスなどのハードウェアへの統合に理想的な選択肢となります。
MuSGD によるトレーニング効率#
Transformerモデルのトレーニングは、過剰なCUDAメモリ消費と長引くトレーニング時間につながることがよくあります。YOLO26は、確率的勾配降下法(SGD)とLLMにインスパイアされたMuonオプティマイザーのハイブリッドである、新しいMuSGD Optimizerを導入しています。このイノベーションにより、非常に安定したトレーニングとより速い収束がもたらされ、RTDETRv2と比較してハードウェア要件が大幅に軽減されます。
比類のないエコシステムと汎用性#
Ultralyticsエコシステムは、直感的で効率化された開発者体験を提供します。充実したドキュメント、活発なコミュニティサポート、およびクラウドベースのUltralytics Platformにより、完全なAIライフサイクルの管理がこれまで以上に簡単になりました。さらに、YOLO26は汎用性が非常に高いです。RTDETRv2がオブジェクト検出に焦点を当てている一方で、YOLO26はインスタンスセグメンテーション、姿勢推定、画像分類、および方向付きバウンディングボックス(OBB)の各タスクをネイティブにサポートします。新しいProgLoss + STAL損失関数によって強化されたYOLO26は、空撮画像や産業用欠陥検出にとって重要な機能である、小物体認識にも優れています。
Ultralyticsとのシームレスな統合#
モデルのデプロイのために、複雑で断片化されたコードベースと格闘する必要はありません。Ultralytics Python API を使用すれば、わずか数行のコードで最先端のモデルをロード、トレーニング、エクスポートできます。
from ultralytics import YOLO
# Load the latest YOLO26 nano model for optimal edge performance
model = YOLO("yolo26n.pt")
# Train the model on your custom dataset with minimal memory overhead
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Validate the model's performance
metrics = model.val()
# Export seamlessly to ONNX or TensorRT for deployment
model.export(format="onnx", optimize=True)Ultralyticsを活用することで、研究リポジトリに通常伴う複雑な環境設定を回避でき、市場投入までの時間を短縮できます。
結論#
YOLOX と RTDETRv2 は、リアルタイム物体検出の進歩における重要なマイルストーンです。YOLOX は非常に効率的なアンカーフリーCNNの実現可能性を証明し、RTDETRv2 はリアルタイムの制約に合わせてTransformerをうまく適応させました。
しかし、スマートリテール分析から組み込みロボット工学に至るまでの現代のアプリケーションにおいて、Ultralytics YOLO26は決定的なソリューションを提供します。NMSフリーの推論と比類のないCPU速度、削減されたメモリフットプリント、およびUltralytics Platformの堅牢なサポートを融合させることにより、YOLO26は、信頼性が高く高性能な次世代のコンピュータビジョンシステムを構築するための力を開発者に提供します。