YOLO Vision 2026:

YOLOv7 と RTDETRv2 の比較#

コンピュータビジョンの分野は、畳み込みニューラルネットワーク(CNN)とVision Transformer(ViT)の競争により、急速な進化を続けています。この技術比較では、最適化されたCNNベースの物体検出器であるYOLOv7と、最先端のリアルタイムDetection TransformerであるRTDETRv2という、2つの強力なアーキテクチャについて掘り下げます。

そのアーキテクチャの違い、性能指標、および理想的な展開シナリオを分析することで、開発者はこれらのビジョンAIモデルを本番環境のパイプラインに統合する際に、十分な情報に基づいた意思決定が可能になります。

YOLOv7: Bag-of-Freebies CNNアーキテクチャ#

YOLOv7は、従来のYOLOファミリーに対してパラダイムシフトとなるいくつかの構造的最適化を導入し、「学習可能なBag-of-Freebies」の手法を通じてリアルタイム物体検出の限界を押し広げました。

主な特徴: 著者: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
組織: Institute of Information Science, Academia Sinica
日付: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: WongKinYiu/yolov7

アーキテクチャと強み#

YOLOv7は、Extended Efficient Layer Aggregation Network (E-ELAN) アーキテクチャを強みとしています。この構造設計により、モデルは元の勾配パスを損なうことなく、より多様な特徴を学習できます。さらに、計画された再パラメータ化畳み込みが組み込まれており、精度を低下させることなく推論速度を最適化します。トレーニング可能なbag-of-freebiesアプローチにより、速度と精度の間で優れたトレードオフを実現し、サーバーグレードのGPUでのリアルタイム物体検出タスクに非常に適しています。

また、YOLOv7は非常に汎用性が高いです。標準的なバウンディングボックス検出を超えて、リポジトリには姿勢推定インスタンスセグメンテーションのためのブランチが用意されており、その適応性を示しています。

制限事項#

多くのレガシーCNNモデルと同様に、YOLOv7は後処理にNon-Maximum Suppression (NMS) を使用します。NMSは、特に混雑したシーンで変動的なレイテンシを発生させるため、エッジデバイスでの厳密なリアルタイム性を保証する上で課題となる場合があります。

YOLOv7の詳細はこちら

RTDETRv2: リアルタイムTransformerの進化#

RTDETRv2は元のRT-DETRフレームワークを基盤としており、Transformerが高い空間精度を維持しながらリアルタイムレイテンシにおいてYOLOアーキテクチャと競合できることをさらに証明しています。

主な特徴: 著者: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
組織: Baidu
日付: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR

アーキテクチャと強み#

RTDETRv2は、ビジョンTransformerにとって大きな前進となります。柔軟なクエリ選択プロセスと効率的なハイブリッドエンコーダーを活用して、マルチスケール特徴を迅速に処理します。Detection Transformers (DETRs) 特有に合わせた新しい「bag-of-freebies」を導入することで、空間推論の限界を押し広げます。ネイティブでNMSフリーであるため、厳格なスマートシティアプリケーションや自動運転に不可欠な機能である、確定的推論時間を提供します。

制限事項#

進歩にもかかわらず、RTDETRv2にはTransformerベースのアーキテクチャの従来の負担が伴います。CNNと比較して、トレーニングと推論の両方で大幅に多くのCUDAメモリを必要とします。さらに、トレーニングの収束時間が著しく長く、大量の高品質なアノテーション付きデータ(COCO datasetなど)と膨大な計算リソースが必要になります。

RTDETRv2についてさらに詳しく学ぶ

パフォーマンスの比較#

これらのモデルをベンチマークする際は、精度、生の推論速度、コンピューティングフットプリントを包括的に捉える必要があります。以下に直接比較表を示します。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
ベンチマークの解釈

RTDETRv2-xはmAPvalにおいて最高値の54.3%を誇りますが、2590億FLOPsという莫大な計算量を必要とします。一方、YOLOv7アーキテクチャは優れたベースラインを提供しますが、純粋なネットワークレイテンシの指標では完全には捉えきれない、レガシーなNMSによるオーバーヘッドの影響を受けます。

Ultralyticsの利点: エコシステムと進化#

YOLOv7とRTDETRv2は強力な機能を提供しますが、本番環境への導入時にはしばしば運用上の摩擦が生じます。ここでUltralyticsエコシステムが優位性を発揮します。シームレスなエンドツーエンドの統合のために設計されたUltralyticsフレームワークは、コンピュータビジョンパイプライン特有の複雑さを抽象化する統一されたAPIを開発者に提供します。

比類なき汎用性とメモリ効率#

膨大なVRAMを消費する硬直したTransformerモデルとは異なり、Ultralytics YOLOモデルは厳格なメモリ効率を維持します。これにより、手頃なハードウェアで迅速なモデルトレーニングが可能になります。このエコシステムは、単一のコードベースから画像分類指向性バウンディングボックス(OBB)検出を含む複数のコンピュータビジョンタスクを本質的にサポートし、RTDETRv2には現在欠けている柔軟性を提供します。

シームレスなデプロイ#

研究からプロダクションへの移行には、堅牢なデプロイオプションが必要です。Ultralytics APIは、業界標準フォーマットへのワンクリックでのモデルエクスポートをネイティブで処理します。クロスプラットフォームの互換性のためにONNXをターゲットにする場合でも、最大化されたGPUアクセラレーションのためにTensorRTをターゲットにする場合でも、パイプラインは完全に自動化されており信頼性が高くなります。

究極のアップグレード: Ultralytics YOLO26#

YOLOv7とRTDETRv2の間で迷っている開発者にとって、進むべき最適な道はビジョンAIにおける新しい標準、Ultralytics YOLO26です。2026年1月にリリースされたYOLO26は、CNNの速度とTransformerの洗練された推論機能の間のギャップを埋め、それぞれの弱点を完全に解消しています。

YOLO26の詳細はこちら

YOLO26は、サーバーおよびエッジ環境の両方に対応した画期的なイノベーションを導入しています。

  • エンドツーエンドのNMSフリーデザイン: YOLOv10で初めて開拓されたYOLO26は、NMS後処理をネイティブで排除します。これにより、Transformerの負担となる計算オーバーヘッドなしで、RTDETRv2の決定論的なレイテンシが保証されます。
  • MuSGDオプティマイザー: 大規模言語モデルのトレーニング技術(Moonshot AIのKimi K2など)に触発され、YOLO26はSGDとMuonのハイブリッドを採用しています。これにより、ViTで使用される標準的なAdamWの実装と比較して、かつてないトレーニングの安定性と、大幅に高速な収束時間を実現します。
  • ProgLoss + STAL: これらの高度な損失関数は、小物体認識において顕著な改善をもたらし、ロボット自動化にとって不可欠なRTDETRv2のマルチスケール特徴の利点と直接競合します。
  • エッジ最適化とDFLの削除: Distribution Focal Loss (DFL) を削除することで、YOLO26は出力ヘッドを効率化しました。これによりCPU推論が最大43%高速化され、重いTransformerモデルよりもエッジデバイスへのデプロイがはるかに容易になっています。

Ultralyticsを使用したトレーニングの例#

Ultralytics Python APIのシンプルさにより、わずか数行のコードで最先端のYOLO26モデルをトレーニングできます。

from ultralytics import YOLO

# Load the highly efficient YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
# The framework automatically manages data augmentation and hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")

# Effortlessly export to TensorRT for deployment
model.export(format="engine", dynamic=True)

理想的なユースケース#

適切なアーキテクチャの選択は、デプロイメントの制約とハードウェアの可用性に大きく依存します。

YOLOv7を検討すべき場合:

  • YOLOv7が確立されたベースラインとなっているレガシー研究プロジェクト。
  • 生のGPUアクセラレーションが十分にあり、NMSレイテンシのジッターが許容できる環境。

RTDETRv2を検討すべき場合:

  • 絶対的な最大mAPを必要とするハイエンドサーバー環境。
  • Transformerバックボーンを支えるVRAMがあり、かつ決定論的な推論レイテンシ(NMSフリー)が厳密に求められるシナリオ。

Ultralytics YOLO26を選択すべき場合:

  • ほとんどの場合、そうです。 RTDETRv2のNMSフリーの決定論を提供し、YOLOv7の速度と精度を超え、VRAMの使用量が大幅に少なく、dataset管理、トレーニング、およびデプロイを簡単に行うためにUltralytics Platformに完全に統合されています。
他のモデルを探す

他のアーキテクチャがどのように比較されるか興味がありますか?YOLO11YOLOv8のような前世代の詳細な解説を探索するか、ハイパーパラメータチューニングを活用してプロジェクトの精度を最大化する方法を学びましょう。

コメント