RTDETRv2とYOLOX#
コンピュータービジョンの分野は急速に進化しており、開発者や研究者はビジョンベースのシステムを構築する際に、多様なアーキテクチャから選べるようになっています。この進化を示す代表的な例が、TransformerベースのRTDETRv2とCNNベースのYOLOXです。どちらもリアルタイム物体検出の分野に大きく貢献していますが、画像認識の課題を解決するためのアプローチは根本的に異なります。
この包括的なガイドでは、両モデルのアーキテクチャの特徴、性能指標、最適なデプロイシナリオを解説します。さらに、最先端のUltralytics YOLO26のような最新の代替モデルが、こうした基盤をどのように発展させ、より高い精度、効率、使いやすさを実現しているかも見ていきます。
RTDETRv2:リアルタイム検出Transformer#
初代RT-DETRの後継モデルとして登場したRTDETRv2は、Transformerアーキテクチャを活用し、高性能なリアルタイム物体検出を実現します。Non-Maximum Suppression(NMS)が不要なため、推論パイプラインを簡素化できます。
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- リンク: Arxiv論文、公式GitHub、ドキュメント
アーキテクチャと設計#
RTDETRv2はTransformerに備わるセルフアテンション機構に大きく依存しており、画像全体にわたるグローバルなコンテキストを捉えられます。この包括的な理解に基づき、バウンディングボックスとクラス確率を直接予測します。また、マルチスケールの検出特徴を導入し、雑然とした環境で小さな物体を認識する能力を高めています。
Transformerはグローバルなコンテキストの把握に優れていますが、セルフアテンション機構の計算量はシーケンス長に対して二次的に増加します。そのため、従来型CNNと比べて、トレーニング時のCUDAメモリー消費量が大幅に増えることがよくあります。
強みと弱み#
RTDETRv2の最大の強みは、ネイティブのエンドツーエンド設計です。NMSを省略することで、高密度に重なる予測に伴うレイテンシーの急増を避けられます。ただし、Transformerブロックの計算負荷が大きいため、トレーニングとデプロイの両方で多くのGPUリソースが必要です。そのため、リソースに制約のあるエッジデバイスや旧世代のモバイルハードウェアにはあまり適していません。
YOLOX:アンカーフリーCNNの進化#
学術研究と産業応用の隔たりを埋めるために開発されたYOLOXは、人気のあるYOLOモデルファミリーに、デカップルドヘッドとアンカーフリー設計を導入しました。
- 著者: Zheng Ge、Songtao Liu、Feng Wang、Zeming Li、Jian Sun
- 組織: Megvii
- 日付: 2021年7月18日
- リンク: Arxiv論文、公式GitHub、ドキュメント
アーキテクチャと設計#
YOLOXは、事前定義されたアンカーボックスを使わずに物体の位置を直接予測することで、従来のアンカーベース検出器とは異なるアプローチを採用しています。これによりネットワーク設計が簡素化され、最適な性能を得るために必要なヒューリスティックな調整パラメーターも減ります。また、YOLOXは分類タスクと回帰タスクを分離するデカップルドヘッドを採用し、トレーニング時の収束速度を向上させています。
強みと弱み#
YOLOXはアンカーフリーのため、さまざまなコンピュータービジョンタスクに柔軟に対応でき、カスタムデータセットでのトレーニングも容易です。YOLOX-Nanoなどの軽量モデルは、マイクロコントローラーや低消費電力のIoTデバイスへのデプロイに適しています。ただし、YOLOXはNMSフリーの流れが広まる前のモデルであり、従来型の後処理に依存しています。そのため、デプロイの負担が増え、高密度なシーンではレイテンシーが大きくなることがあります。
パフォーマンスと指標の比較#
これらのモデルを比較する際は、速度、精度、パラメーター効率を評価し、具体的なユースケースに最適なモデルを見極めることが重要です。以下の表では、標準的なCOCOデータセットにおける各モデルサイズの性能をまとめています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
データが示すように、RTDETRv2は最大のモデルでYOLOXxより高い最高精度(54.3 mAP)を達成しています。一方、YOLOXには大幅に小型で高速なモデルもあり、たとえばYOLOXsはパラメーター数が少なく、NVIDIA T4 GPUでの推論速度も優れています。
Ultralyticsの強み:YOLO26の登場#
RTDETRv2とYOLOXにはそれぞれ独自の利点がありますが、現代の開発者には、高精度、非常に高速な推論、使いやすいエコシステムを兼ね備えた統合ソリューションが求められることがよくあります。新たにリリースされたUltralytics YOLO26は、この進化の到達点です。
YOLO26の主な革新点#
- エンドツーエンドのNMSフリー設計:YOLOv10で初めて導入された概念を発展させ、YOLO26はオプションのNMSフリーヘッド(
nms=False)を提供します。これにより、Transformerに伴う膨大なメモリー要件なしで、RTDETRv2のようなシームレスな推論を実現します。 - MuSGDオプティマイザー:大規模言語モデルのトレーニングにおける革新に着想を得たハイブリッドMuSGDオプティマイザー(SGDとMuonを組み合わせたもの)は、トレーニングを安定させ、収束を大幅に高速化します。
- CPU推論が最大43%高速:Distribution Focal Loss(DFL)モジュールを戦略的に削除することで、YOLO26はエッジコンピューティングや低消費電力デバイス向けに最適化されています。そのため、YOLO11などの旧世代モデルよりもCPUで大幅に高速です。
- ProgLoss + STAL:これらの高度な損失関数は小さな物体の認識性能を大きく高め、航空画像やロボティクスアプリケーションでよく見られる課題に対応します。
優れた汎用性とエコシステム#
Ultralytics Platformは、モデルの性能だけでなく、ゼロから本番環境への導入までを包括的に支援するエコシステムも提供します。静的な学術リポジトリとは異なり、Ultralyticsのモデルは継続的にメンテナンスされ、単一の直感的なAPIから複数のタスクをシームレスにサポートします。インスタンスセグメンテーション、姿勢推定によるポーズの追跡、回転バウンディングボックス(OBB)を使った回転物体の処理など、どのタスクでもワークフローは変わりません。
さらに、Ultralyticsのモデルはトレーニング時と推論時の両方でメモリー要件が少ないことで知られており、研究者は一般向けのハードウェアでより大きなバッチサイズを実行できます。これは、Transformerベースのアーキテクチャが多くのリソースを必要とすることとは対照的です。
トレーニングコードの例#
Ultralyticsエコシステムの強みは、そのシンプルさに表れています。最先端のYOLO26モデルのトレーニングは数行のコードで実行でき、データの読み込みやハイパーパラメーター設定の複雑さを完全に隠蔽します。
from ultralytics import YOLO
# Initialize the YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the standard COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16)
# Validate the model's performance seamlessly
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")
# Export to ONNX or TensorRT for rapid deployment
model.export(format="engine", device=0)実環境での用途と適したユースケース#
適切なアーキテクチャは、デプロイ上の制約と利用可能なハードウェアによって決まります。
高精度なクラウド処理#
高性能なサーバーGPU上でアプリケーションを実行し、密集した群衆シーンの分析や高解像度の医用画像処理など、最大限の精度を優先する場合は、RTDETRv2の堅牢なアテンション機構が非常に効果的です。
従来型のエッジデバイスへのデプロイ#
最小限のFLOPsが厳しく求められる旧型の携帯電話や大きな制約のあるマイクロコントローラーへのデプロイには、シンプルなCNNアーキテクチャを持つ超軽量のYOLOX-Nanoも、引き続き有効な代替モデルです。
現代の標準:AIoTとロボティクス#
スマートシティのインフラ、小売分析、自律ナビゲーションなど、現代のユースケースの大半では、Ultralytics YOLO26が最適な選択肢です。CPU推論を43%高速化し、エッジコンピューティングで比類のない性能を発揮するとともに、オプションのNMSフリーヘッドによって低く安定したレイテンシーを実現します。Ultralyticsエコシステムの充実したドキュメントと活発なコミュニティサポートを組み合わせることで、データセットのアノテーションから世界規模のデプロイまで、チームはこれまで以上に迅速に進められます。
コンピュータービジョンのプロジェクトを次の段階へ進めませんか。Ultralytics Platformの幅広い機能を活用すれば、データの管理、クラウドでのモデルのトレーニング、インテリジェントなアプリケーションの大規模なデプロイを簡単に実行できます。
Ultralyticsエコシステムのほかのアーキテクチャを検討する開発者は、確立されたコミュニティ統合を活用できるYOLOv8や、旧世代のパイプラインで優れた安定性を発揮するYOLOv5もご確認ください。ただし、2026年に可能性の限界を押し広げるには、YOLO26が引き続き業界標準です。