YOLOv8とRTDETRv2の比較#
コンピュータービジョンの分野は常に進化しており、新しいアーキテクチャによってリアルタイム物体検出の可能性が広がり続けています。特に注目を集めている2つのモデルが、Ultralytics YOLOv8とBaiduのRTDETRv2です。本ガイドでは、これら2つの高性能モデルについて、アーキテクチャ、パフォーマンス指標、最適なデプロイシナリオを詳しく比較します。
YOLOv8の概要#
Ultralytics YOLOv8は、YOLO(一度見るだけ)モデルファミリーにおける大きなマイルストーンです。長年にわたる基礎研究を基盤として、幅広いタスクで優れた速度、精度、使いやすさを実現します。
主な特徴:
- 著者: Glenn Jocher、Ayush Chaurasia、Jing Qiu
- 組織: Ultralytics
- 日付: 2023年1月10日
- GitHub: Ultralyticsリポジトリ
- ドキュメント: YOLOv8ドキュメント
アーキテクチャと強み#
YOLOv8は、特徴抽出とバウンディングボックス回帰の両方を最適化する、簡素化されたアーキテクチャを導入しています。アンカーフリーの検出器であるため、予測ヘッドが簡素化され、トレーニング中に必要なハイパーパラメーターの調整回数が削減されます。このアーキテクチャにより、推論速度と平均適合率(mAP)の間で優れたパフォーマンスバランスが実現され、エッジデバイスとクラウドサーバーの両方での実運用に適しています。
さらに、YOLOv8はTransformerベースのアーキテクチャと比較して、トレーニング中に必要なメモリ要件が大幅に少なくなっています。これにより、開発者はメモリ不足エラーに遭遇することなく、一般的なコンシューマー向けGPUでモデルをトレーニングできます。
汎用性#
YOLOv8の特徴的な強みの1つは、ネイティブな汎用性です。多くのモデルがバウンディングボックスのみに注力する一方で、YOLOv8は物体検出、インスタンスセグメンテーション、画像分類、ポーズ推定、回転バウンディングボックス(OBB)検出をすぐに利用できる形でサポートしています。
RTDETRv2の概要#
RTDETRv2(リアルタイム検出Transformer バージョン2)は、元のRT-DETRを基盤としており、ビジョンTransformerの強力なアテンション機構をリアルタイム物体検出アプリケーションにもたらすことを目指しています。
主な特徴:
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETRリポジトリ
- ドキュメント: RTDETRv2 README
アーキテクチャと強み#
RTDETRv2は、畳み込みニューラルネットワーク(CNN)バックボーンとTransformerのエンコーダー・デコーダー構造を組み合わせたハイブリッドアーキテクチャを採用しています。これにより、自己注意機構を通じて複雑な空間関係とグローバルコンテキストを捉えられます。「bag-of-freebies」トレーニング戦略を活用することで、RTDETRv2はCOCOデータセットのような標準ベンチマークデータセットで、競争力のあるmAPスコアを達成します。
弱点#
高い精度を備えている一方で、RTDETRv2のTransformerベースの性質により、純粋なCNNアーキテクチャと比較してメモリ消費量が増加し、トレーニング時間も長くなります。Transformerは本質的により多くのVRAMを必要とするため、リソースに制約のあるハードウェアでのトレーニングは困難です。さらに、RTDETRv2は検出性能に優れていますが、Ultralyticsエコシステムに備わっているマルチタスクの汎用性(ポーズやセグメンテーションなど)はありません。
性能比較#
本番環境向けのモデルを評価する際は、モデルサイズ、推論速度、精度のトレードオフが最も重要です。以下の表では、YOLOv8とRTDETRv2の各バリアントを直接比較しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
速度はAmazon EC2 P4dインスタンスを使用して測定しました。CPU推論にはONNXを使用し、GPU速度はTensorRTでテストしました。
ユースケースと推奨事項#
YOLOv8とRT-DETRのどちらを選択するかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムに関する好みによって異なります。
YOLOv8を選択するタイミング#
YOLOv8が適しているケース:
- 汎用的なマルチタスクデプロイ: Ultralyticsエコシステム内で、detection、segmentation、classification、pose estimationに対応する実績のあるモデルが必要なプロジェクト。
- 確立された本番システム: YOLOv8アーキテクチャを基盤としてすでに構築され、安定した十分にテスト済みのデプロイパイプラインを備えた既存の本番環境。
- 幅広いコミュニティとエコシステムのサポート: YOLOv8の豊富なチュートリアル、サードパーティー統合、活発なコミュニティリソースの恩恵を受けるアプリケーション。
RT-DETRを選択するケース#
RT-DETRは次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使用しないエンドツーエンド物体検出のために、アテンションメカニズムやTransformerアーキテクチャを研究するプロジェクト。
- 柔軟なレイテンシーを許容できる高精度シナリオ: 検出精度を最優先し、やや高い推論レイテンシーを許容できるアプリケーション。
- 大きな物体の検出: 主に中型から大型の物体が存在し、Transformerのグローバルアテンションメカニズムが本質的な優位性を発揮するシーン。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの優位性#
モデルの選択は生の指標だけで決まるものではありません。開発者の生産性にとって、周辺のソフトウェアエコシステムが重要です。Ultralyticsエコシステムは使いやすさで知られており、機械学習のライフサイクル全体を簡素化する統合Python APIを提供しています。
データセット管理から分散トレーニングまで、Ultralyticsは複雑なボイラープレートコードを抽象化します。開発者は、すぐに利用できる事前学習済みウェイトや、Hugging Faceなどのプラットフォームおよびモニタリングツールとのシームレスな統合を利用できます。この適切に保守されたエコシステムにより、活発な開発、頻繁なアップデート、強力なコミュニティサポートが保証されます。
さらに、トレーニング効率はUltralytics YOLOモデルの大きな特長です。モデルはトレーニングプロセス中の高速な収束と低いメモリフットプリントに対して高度に最適化されており、RTDETRv2のようなTransformerベースの検出器と比較して、実験サイクルを大幅に高速化します。
将来を見据えて:YOLO26の力#
YOLOv8は依然として強力なモデルですが、最先端の性能を求める開発者は、2026年1月にリリースされた、待望のYOLO26へのアップグレードを検討してください。YOLO26は、画期的な複数のイノベーションによって最先端技術を再定義します。
- エンドツーエンドのNMSフリーデザイン: YOLO26は非最大抑制(NMS)の後処理を排除し、より高速で決定性の高いデプロイワークフローを実現します。
- DFLの削除: Distribution Focal Lossを削除することでモデルが簡素化され、エッジデバイスや低消費電力デバイスとの互換性が向上します。
- MuSGDオプティマイザー: LLMトレーニングのイノベーションを統合したMuSGDオプティマイザーにより、より安定したトレーニング実行と高速な収束を実現します。
- 最大43%高速なCPU推論: 専用GPUを搭載しない環境向けに高度に最適化されています。
- ProgLoss + STAL: これらの高度な損失関数により、小物体認識が大幅に向上します。これは航空画像やロボティクスにおいて重要です。
Ultralyticsスイートで検討する価値のあるその他の最新の選択肢には、レガシープロジェクトで堅牢なパフォーマンスを提供するYOLO11があります。ただし、すべての新規デプロイにはYOLO26を推奨します。
コード例: 学習と推論#
Ultralytics APIはシンプルなため、わずか数行のPythonコードでモデルの読み込み、トレーニング、デプロイを実行できます。次の例を実行する前に、PyTorchがインストールされていることを確認してください。
from ultralytics import YOLO
# Load a pretrained YOLOv8 small model
model = YOLO("yolov8s.pt")
# Train the model on your custom dataset
# Memory efficient training allows for larger batch sizes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()
# Export seamlessly for edge deployment
export_path = model.export(format="onnx")Ultralyticsは、ONNX、TensorRT、CoreMLなど、多数のフォーマットへのワンクリックエクスポートをサポートしており、さまざまなハードウェアアーキテクチャに対応するモデルデプロイの選択肢を簡素化します。
まとめ#
YOLOv8とRTDETRv2は、どちらもリアルタイム物体検出に適した魅力的な機能を提供します。RTDETRv2は、グローバルコンテキストの捕捉におけるTransformerの能力を示しており、推論速度とメモリオーバーヘッドが主要な制約ではない、複雑な空間推論タスクに適しています。
ただし、速度、精度、リソース効率の優れたバランスを重視する開発者にとって、Ultralytics YOLOモデルは依然として優れた選択肢です。YOLOv8の軽量性に加え、比類のない使いやすさ、複数のビジョンタスクにわたる汎用性、活発なオープンソースエコシステムを備えているため、スケーラブルな本番環境向けの第一候補となります。エッジで最高水準のパフォーマンスを求める場合は、新しくリリースされたYOLO26が、業界をリードし続ける比類のないNMSフリー効率を提供します。