RTDETRv2とYOLOv10の比較#
コンピュータービジョンの進化は、速度と精度のバランスを追求する絶え間ない取り組みによって大きく推進されてきました。従来、リアルタイムの物体検出パイプラインでは、重なり合うバウンディングボックスを除去する後処理として、非極大値抑制(NMS)が使われてきました。しかし、NMSはレイテンシのボトルネックを生み、複雑なハイパーパラメーター調整を必要とします。近年、この問題をネイティブに解決するため、RTDETRv2のようなTransformerベースのモデルとYOLOv10のようなCNNベースのモデルという、異なる2つのアーキテクチャアプローチが登場しました。
このガイドでは、両モデルのアーキテクチャ、性能指標、最適なユースケースを分析して包括的に技術比較するとともに、Ultralyticsエコシステムの最新の革新が、現代のデプロイに最適なソリューションをどのように提供するかを紹介します。
RTDETRv2:リアルタイム検出Transformer#
RTDETRv2は初代RT-DETRアーキテクチャを基盤とし、Vision Transformerによるグローバルコンテキストの理解と、従来YOLOモデルが担ってきたリアルタイム速度の要件を両立することを目指しています。
主な特徴:
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: https://github.com/lyuwenyu/RT-DETR/tree/main/rtdetrv2_pytorch
アーキテクチャとトレーニング手法#
RTDETRv2は、NMSを本質的に必要としないエンドツーエンドのTransformerアーキテクチャを採用しています。先行モデルを発展させ、「Bag-of-Freebies」アプローチを導入してトレーニング戦略を最適化し、マルチスケール検出機能を取り入れています。CNNバックボーンで特徴マップ(エッジやテクスチャなどの視覚的特徴)を抽出し、それをTransformerのエンコーダー・デコーダー構造で処理します。これにより画像全体のコンテキストを同時に分析できるため、物体が密集または重なり合う複雑なシーンの理解に非常に効果的です。
強みと弱み#
強み:
- グローバルコンテキスト: アテンション機構により、複雑で雑然とした環境でも優れた性能を発揮します。
- NMS不要: 物体の座標を直接予測し、デプロイパイプラインを簡素化します。
- 高精度: COCOデータセットで優れた平均適合率(mAP)を達成します。
弱み:
- リソース消費が大きい: Transformerアーキテクチャは、一般にトレーニング時にCNNよりはるかに多くのCUDAメモリを必要とするため、標準的なハードウェアでのファインチューニングにはコストがかかります。
- 推論速度のばらつき: 高速ではあるものの、アテンション計算の負荷が大きいため、専用AIアクセラレーターを搭載していないエッジデバイスではコンピュータービジョンのFPSが低下する可能性があります。
YOLOv10:リアルタイムのエンドツーエンド物体検出#
YOLOv10は、CNNフレームワーク内で長年の課題だったNMSのボトルネックに直接対処し、YOLO物体検出系列に大きな変革をもたらしました。
主な特徴:
- 著者: Ao Wang、Hui Chen、Lihao Liuほか
- 組織: 清華大学
- 日付: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
アーキテクチャとトレーニング手法#
YOLOv10の中核的な革新は、NMS不要のトレーニングを可能にする一貫したデュアル割り当てです。トレーニング中は2つの検出ヘッドを使用します。1つは豊富な教師信号を与える従来のYOLOのような一対多割り当て、もう1つはNMSを不要にする一対一割り当てです。推論時には一対一ヘッドのみを使用するため、エンドツーエンドの処理になります。さらに著者らは、効率と精度を重視した包括的なモデル設計戦略を適用し、さまざまなコンポーネントを総合的に最適化して計算の冗長性を削減しました。
強みと弱み#
強み:
- 圧倒的な速度: NMSを取り除き、アーキテクチャを最適化することで、YOLOv10は極めて低い推論レイテンシを実現します。
- 効率性: 同等の精度を達成するために必要なパラメーター数とFLOPsが少なく、リソースが限られた環境に非常に適しています。
- NMS不要のデプロイ: スマート監視などのエッジアプリケーションへの統合を簡素化します。
弱み:
- 初代モデルのコンセプト: この特定のNMS不要アーキテクチャを初めて実装したYOLOとして基礎を築きましたが、後続のYOLO11やYOLO26で見られるマルチタスクの汎用性と最適化には、まだ改善の余地がありました。
パフォーマンス比較#
本番環境向けのモデルを評価する際は、精度と計算コストのバランスが重要です。以下の表では、RTDETRv2とYOLOv10の各サイズの性能上のトレードオフを示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
RTDETRv2は堅牢な精度を提供しますが、YOLOv10はレイテンシとパラメーター効率で顕著な優位性を示します。特に小型のNanoおよびSmallバリアントは、エッジコンピューティングとAIoTの用途に非常に魅力的です。
バッチサイズやVRAMの制約が比較的少ないサーバー向けGPUにデプロイする場合は、大型モデル(-xまたは-lなど)で精度を最大限に高められます。Raspberry Piやスマートフォンなどのエッジデバイスでは、リアルタイムのフレームレートを維持できるよう、nano(-n)またはsmall(-s)バリアントを優先してください。
ユースケースと推奨事項#
RT-DETRとYOLOv10のどちらを選ぶかは、プロジェクト固有の要件、デプロイ上の制約、エコシステムに関する好みによって異なります。
RT-DETRを選ぶケース#
RT-DETRは、次のような用途に適しています。
- Transformerベースの検出研究: NMSを使わないエンドツーエンドの物体検出に向けて、注意機構やTransformerアーキテクチャを検討するプロジェクト。
- レイテンシに柔軟性がある高精度シナリオ: 検出精度を最優先し、推論レイテンシがやや高くても許容できるアプリケーション。
- 大きなオブジェクトの検出: 主に中型から大型のオブジェクトが存在し、Transformerのグローバル注意機構が本質的な優位性をもたらすシーン。
YOLOv10を選ぶ場合#
YOLOv10は、次のような用途に推奨されます。
- NMSを使用しないリアルタイム検出: 非最大抑制を使用しないエンドツーエンド検出によって、デプロイを簡素化できるアプリケーション。
- 速度と精度のバランス: さまざまなモデルスケールで、推論速度と検出精度の優れたバランスが必要なプロジェクト。
- レイテンシーが安定している必要のあるアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が重要なデプロイシナリオ。
Ultralytics (YOLO26)を選ぶ場合#
多くの新規プロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験を最適なバランスで提供します。
- NMSを使用しないエッジデプロイ: 非最大抑制の後処理を複雑化させずに、安定した低レイテンシー推論を必要とするアプリケーション。
- CPUのみの環境: 専用のGPUアクセラレーションを備えていないデバイスで、YOLO26の最大43%高速なCPU推論が大きな優位性を発揮します。
- 小物体検出: ドローンによる航空画像やIoTセンサーの分析など、ProgLossとSTALによって小さな物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの強み:YOLO26の紹介#
RTDETRv2とYOLOv10はどちらも学術面で有望な進歩をもたらしていますが、実環境にデプロイするには、堅牢で十分にメンテナンスされたソフトウェアエコシステムが必要です。Ultralytics Platformは、使いやすさ、充実したドキュメント、データアノテーションやデプロイに役立つ強力なツールを組み合わせ、比類のない開発者体験を提供します。
2026年に最先端を求める開発者には、Ultralytics YOLO26を強くおすすめします。両アーキテクチャの優れたアイデアを統合しながら、画期的な改善を導入しています。
- エンドツーエンドのNMS不要設計: YOLOv10が先駆けとなったコンセプトを発展させ、YOLO26はオプションの一対一ヘッド(
nms=False)を提供します。NMS後処理を省くことで、デプロイのロジックを簡素化して高速化し、レイテンシをより安定させます。 - DFLの削除: Distribution Focal Lossを取り除くことで、YOLO26はモデルのエクスポートを簡素化し、エッジデバイスや低消費電力デバイスとの互換性を大幅に高めます。
- MuSGDオプティマイザー: SGDとMuonを組み合わせたハイブリッドで、LLMトレーニングの革新に着想を得ています。この新しいオプティマイザーは、従来の手法よりも安定したトレーニングと大幅に速い収束を実現します。
- CPU推論を最大43%高速化: 専用GPUがない環境向けに丁寧に最適化されており、高性能なビジョンAIをより多くの環境で利用できるようにします。
- ProgLoss + STAL: これらの高度な損失関数は小物体の認識精度を大幅に向上させます。これは、ドローンを使用するアプリケーションやIoTセンサーで特に重要です。
- 比類のない汎用性: バウンディングボックスに限られるモデルとは異なり、YOLO26はインスタンスセグメンテーション、姿勢推定、画像分類、OBB検出など、幅広いタスクに対応します。姿勢推定向けのResidual Log-Likelihood Estimation(RLE)など、タスク固有の改善も備えています。
Pythonによるシームレスな実装#
Ultralytics Python APIを使用したこれらのモデルのトレーニングとデプロイは、手間なく行えるように設計されています。Transformer中心のアーキテクチャと比べてトレーニング中のメモリ要件が大幅に低いため、標準的なハードウェアでも高性能なモデルをトレーニングできます。
from ultralytics import YOLO
# 最先端のYOLO26モデルを読み込む(推奨)
# または、YOLO('yolov10n.pt')を使ってYOLOv10モデルを読み込む
model = YOLO("yolo26n.pt")
# カスタムデータセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# エッジデバイスへのデプロイに向けて、さまざまな形式に簡単にエクスポートする
model.export(format="onnx", simplify=True)セキュリティアラームシステムを実装する場合も、医療画像解析を行う場合も、活発なUltralyticsコミュニティに支えられたモデルを選べば、成功に必要なツール、ハイパーパラメーター調整のガイド、継続的なアップデートを利用できます。YOLOv10とRTDETRv2がNMS不要のアーキテクチャへの道を開いた一方で、YOLO26はその設計を完成させ、性能、汎用性、本番環境への対応力の最適なバランスを実現します。