YOLOv10とRTDETRv2#
コンピュータービジョンの世界は猛烈なスピードで進化しており、新しいアーキテクチャがリアルタイム物体検出の最先端を常に塗り替えています。この進化における重要なマイルストーンが、YOLOv10とRTDETRv2です。どちらのモデルも、非極大抑制(NMS)の後処理を不要にすることで、従来の検出パイプラインにおける根本的なボトルネックの解消を目指していますが、この課題へのアプローチはまったく異なるアーキテクチャパラダイムに基づいています。
この技術比較では、アーキテクチャ、トレーニング手法、理想的なデプロイシナリオを詳しく分析し、開発者や研究者が次のビジョンAIプロジェクトに適したツールを選択できるようにします。
YOLOv10:NMSフリーの先駆者#
清華大学の研究者によって開発されたYOLOv10は、アーキテクチャの効率化と後処理のボトルネックの排除に重点を置いています。NMSフリーのトレーニングを可能にする一貫したデュアルアサインメントを導入することで、推論レイテンシを大幅に削減しながら、競争力のある性能を実現しています。
技術仕様#
- 著者: Ao Wang、Hui Chen、Lihao Liu、ほか
- 組織: 清華大学
- 日付: 2024-05-23
- ArXiv: YOLOv10 Paper
- GitHub: THU-MIG/yolov10
- ドキュメント: YOLOv10 Documentation
アーキテクチャと手法#
YOLOv10の主なブレークスルーは、効率と精度を総合的に重視したモデル設計にあります。両方の観点からさまざまなコンポーネントを最適化し、計算オーバーヘッドを大幅に削減しています。一貫したデュアルアサインメント戦略により、モデルはNMSに依存せずにトレーニングできるため、エンドツーエンドのデプロイパイプラインを合理化できます。これは、ONNXやTensorRTなどのエッジ形式にモデルをエクスポートする場合に特に有効です。こうした形式では、後処理オペレーションによって予期しないレイテンシが発生する可能性があります。
長所と短所#
このモデルは、特に小規模なバリアント(NおよびS)において、速度と精度のトレードオフに優れています。レイテンシが最小限であるため、高速なエッジ環境に適しています。ただし、YOLOv10は純粋な検出速度に優れる一方で、検出専用の特殊なモデルです。インスタンスセグメンテーションやポーズ推定を必要とするチームは、より汎用性の高いフレームワークを検討する必要があります。
RTDETRv2:Detection Transformerの改良#
オリジナルのReal-Time Detection Transformerを基盤として、RTDETRv2はベースラインを改善するための「bag of freebies」を取り入れており、TransformerがリアルタイムのシナリオでCNNと競合できることを示しています。
技術仕様#
- 著者: Wenyu Lv、Yian Zhao、Qinyao Chang、Kui Huang、Guanzhong Wang、Yi Liu
- 組織: Baidu
- 日付: 2024-07-24
- ArXiv: RTDETRv2 Paper
- GitHub: lyuwenyu/RT-DETR
- Docs: RTDETRv2ドキュメント
アーキテクチャと手法#
RTDETRv2は、視覚的特徴抽出に畳み込みニューラルネットワーク(CNN)バックボーンを使用し、包括的なシーン理解のためにTransformerエンコーダー・デコーダーを組み合わせたハイブリッドアーキテクチャを採用しています。Transformerの自己注意機構により、モデルは画像全体をグローバルに捉えられるため、複雑なシーン、重なり合う物体、密集した群衆の処理に非常に効果的です。
長所と短所#
Transformerアーキテクチャは、特にパラメータ規模が大きい場合に優れた精度を提供し、NMSを使用せずに最終検出結果をネイティブに出力します。ただし、その代償もあります。Transformerモデルは従来、トレーニング中に大幅に多くのCUDAメモリを必要とし、純粋なCNNアーキテクチャと比較して収束が遅くなる場合があります。RTDETRv2は推論速度を改善していますが、軽量なYOLOバリアントよりも一般的に多くのメモリを消費します。
性能比較#
性能指標を評価すると、それぞれのモデルがどの領域で優れているかをより明確に把握できます。以下の表では、COCOデータセットにおける両モデルの能力を示します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
データを分析すると、同等のサイズで比較した場合、YOLOv10はパラメータ効率とTensorRT推論速度で明確な優位性を維持しています。RTDETRv2-xは精度では大規模なYOLOv10xに匹敵しますが、約2,000万個多いパラメータと大幅に高いFLOPsを必要とします。
ユースケースと推奨事項#
YOLOv10とRT-DETRのどちらを選択するかは、具体的なプロジェクト要件、デプロイ上の制約、エコシステムに関する好みに左右されます。
YOLOv10を選択する場合#
YOLOv10は次の用途に適しています:
- NMSフリーのリアルタイム検出: Non-Maximum Suppressionを使用しないエンドツーエンド検出のメリットを活かし、デプロイの複雑さを軽減できるアプリケーション。
- 速度と精度のバランスの取れたトレードオフ: さまざまなモデルスケールで、推論速度と検出精度の優れたバランスが求められるプロジェクト。
- レイテンシが一貫したアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が重要なデプロイシナリオ。
RT-DETRを選択するケース#
RT-DETRは次の用途に推奨されます。
- Transformerベースの検出研究: NMSを使用しないエンドツーエンド物体検出のために、アテンションメカニズムやTransformerアーキテクチャを研究するプロジェクト。
- 柔軟なレイテンシーを許容できる高精度シナリオ: 検出精度を最優先し、やや高い推論レイテンシーを許容できるアプリケーション。
- 大きな物体の検出: 主に中型から大型の物体が存在し、Transformerのグローバルアテンションメカニズムが本質的な優位性を発揮するシーン。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
Ultralyticsの優位性:エコシステムとイノベーション#
YOLOv10とRTDETRv2は堅牢な検出機能を提供しますが、モデルの選択では周辺のソフトウェアエコシステムが重要になることがよくあります。Ultralytics Platformは、ディープラーニングの複雑さを抽象化した、シームレスで統一されたインターフェースを提供します。
新たな標準:Ultralytics YOLO26#
最高の性能を求める開発者にとって、Ultralytics YOLO26は、近年のアーキテクチャ上の進歩の集大成です。2026年初頭にリリースされたYOLO26は、YOLOv10が先駆けたエンドツーエンドのNMSフリーデザインを継承し、NMSの後処理を完全に排除することで、より高速でシンプルなデプロイを実現します。
YOLO26は、MuSGD Optimizer(SGDとMuonのハイブリッド)を通じてLLMのトレーニングにおけるイノベーションをコンピュータービジョンにもたらし、より安定したトレーニングと高速な収束を実現します。また、CPU推論が最大43%高速であり、エッジコンピューティングに最適な選択肢です。
さらに、YOLO26は小さい物体の認識を大幅に改善するProgLoss + STALを導入しています。特殊なYOLOv10とは異なり、極めて高い汎用性も備えています。YOLO26は、物体検出、セグメンテーション、ポーズ、指向性バウンディングボックス(OBB)をネイティブにサポートし、セマンティックセグメンテーション損失や、ポーズ向けの残差対数尤度推定(RLE)など、タスク固有の改善を提供します。さらに、Distribution Focal Loss(DFL)を排除することで、エクスポートを簡素化し、低消費電力デバイスとの互換性を高めています。
使いやすさとトレーニング効率#
Ultralytics YOLO11のような旧世代のモデルを試す場合でも、最先端のYOLO26を使用する場合でも、合理化されたPython APIにより、トレーニング中のメモリ使用量を削減し、非常に高速なワークフローを実現できます。
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")適切に保守されたエコシステムにより、ハイパーパラメータチューニングのためのツールを簡単に利用でき、幅広いトラッキングソリューションやモデルデプロイオプションともシームレスに統合できます。
まとめ#
YOLOv10とRTDETRv2は、NMSフリーの物体検出を追求するうえで、いずれも注目すべきマイルストーンです。RTDETRv2は、より高いメモリ要件を伴うものの、Transformerが優れたグローバルコンテキスト理解とリアルタイムレイテンシを両立できることを実証しています。YOLOv10は、リソースに制約のある検出タスク向けに調整された、非常に効率的で高速なCNNの代替手段を提供します。
ただし、バランスの取れた性能、マルチタスクの汎用性、そして最も成熟したエコシステムを求める場合、開発者にはUltralytics YOLO26の活用を強くお勧めします。YOLO26は、先行モデルのアーキテクチャ上のイノベーションと、ビジョンAIのデプロイをシームレスに実現する堅牢で使いやすいツール群を見事に融合しています。