YOLO Vision 2026:

YOLOv5 と RTDETRv2 の比較#

コンピュータビジョンの分野はここ数年で大幅に拡大し、複雑な視覚的タスクに取り組むための幅広いアーキテクチャを開発者に提供しています。最も人気のあるパラダイムの中には、畳み込みニューラルネットワーク(CNN)や検出Transformer(DETR)があります。

このガイドでは、これら カテゴリにおける2つの主要モデル、すなわち非常に効率的で広く採用されているCNNベースのモデルであるUltralytics YOLOv5と、最先端のTransformerベースのリアルタイム物体検出器であるRTDETRv2の間で、詳細な技術的比較を提供します。

Ultralytics YOLOv5:効率性における業界標準#

リリース以来、Ultralytics YOLOv5はAIコミュニティの礎となり、世界中の何千もの商用アプリケーションや研究プロジェクトを支えてきました。完全にPyTorchフレームワークに基づいて構築されており、リアルタイム性能を妥協することなく、直感的な開発者体験を優先しています。

主な特徴:

アーキテクチャと強み#

YOLOv5は、極めて低いメモリフットワークを維持しながら特徴抽出効率を最大化するように設計された、合理化されたCNNアーキテクチャを利用しています。CSPDarknetバックボーンとPANetネックを採用し、マルチスケール特徴融合のための強力な組み合わせを作り出しています。

YOLOv5の主な利点の1つは、そのPerformance Balanceです。速度と精度の間で優れたトレードオフを実現しており、NVIDIA Jetsonデバイスやスマートフォンなどのリソースが制限されたハードウェアへのmodel deploymentにおいて理想的な選択肢となります。

さらに、YOLOv5は比類のない汎用性を誇っています。バウンスボックスの予測に厳密に限定されたモデルとは異なり、YOLOv5は画像分類インスタンスセグメンテーションをネイティブでサポートし、多様な視覚的タスクのための統一されたフレームワークを提供します。そのトレーニング効率も優れており、Transformerベースのアーキテクチャと比較してトレーニング中のCUDAメモリ消費が大幅に少なくなります。

弱点#

古いCNNフレームワークに依存しているため、YOLOv5は重複するバウンスボックスを排除するために後処理中に非最大値抑制(NMS)に本質的に依存しています。Ultralyticsフレームワーク内で高度に最適化されていますが、NMSは特殊なエッジNPUでレイテンシのボトルネックを引き起こすことがあります。

YOLOv5の詳細はこちら

RTDETRv2:BaiduによるリアルタイムTransformer#

RTDETRv2 (Real-Time Detection Transformer v2) は、リアルタイム物体検出にTransformerアーキテクチャを適用する上で大きな進歩を遂げており、従来のDETRを悩ませていた計算上の非効率性に対処しています。

主な特徴:

アーキテクチャと強み#

RTDETRv2は、ハイブリッドエンコーダと柔軟なデコーダ設計を採用することで、画像を処理します。Transformerの自己注意機構(self-attention)が画像コンテキストのグローバルな理解を可能にし、物体が激しく遮蔽された複雑なシーンでも非常に高い性能を発揮します。

RTDETRv2の決定的な特徴は、エンドツーエンドのNMSフリーデザインです。anchor boxesやNMSの後処理を必要とせずにオブジェクトクエリを直接予測することで、推論パイプラインを簡素化します。このアーキテクチャは、COCOなどのベンチマークデータセットにおいて印象的なmAP (mean Average Precision)を達成します。

弱点#

リアルタイム機能にもかかわらず、RTDETRv2はYOLOモデルと比較してメモリ要件が著しく高くなります。Transformerのアテンションメカニズムはシーケンス長に対して二次関数的にスケールするため、大規模なGPUクラスターを使用しない限り、高解像度トレーニング中にメモリ不足エラーが発生する可能性があります。さらに、Ultralyticsエコシステムのすぐに使える汎用性が欠けており、セグメンテーションやポーズ推定のネイティブサポートなしに、主に2D物体検出のみに焦点を当てています。

RTDETRの詳細はこちら

性能比較テーブル#

これらのアーキテクチャを客観的に評価するために、性能指標をまとめました。太字で強調された値は、テストされたスケール全体で最も効率的、または最高性能の指標を示しています。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメータ
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
性能に関するコンテキスト

RTDETRv2-xは絶対的なmAPにおいて最高値を達成しますが、YOLOv5nの約30倍のパラメータを必要とします。制限されたハードウェアで実行される高速アプリケーションに対しては、Ultralyticsモデルが一貫して最高の計算効率を提供します。

Ultralyticsエコシステムの利点#

研究用ノートブックから本番環境へモデルを移行する場合、モデルを囲むソフトウェアはニューラルネットワークのアーキテクチャと同じくらい重要です。Ultralyticsが提供する十分にメンテナンスされたエコシステムは、開発ライフサイクルを劇的に加速させます。

比類なき使いやすさ#

Ultralyticsモデルは、非常に合理化されたユーザー体験を優先しています。カスタムモデルのトレーニング、検証の実行、またはTensorRTONNXなどのハードウェア固有のフォーマットへのエクスポートのいずれを行う場合でも、Ultralytics Python APIを使用すると、わずか数行のコードでそれを実現できます。

以下は、Ultralyticsモデルでのトレーニングと推論がいかにシンプルであるかを示す実践的なコード例です。

from ultralytics import YOLO

# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
inference_results[0].show()

このシンプルで統一されたAPIは、Weights & BiasesCometなどのツールとのexperiment tracking統合をネイティブでサポートしており、開発者は複雑なボイラープレートコードを書くことなく、シームレスにメトリクスを記録できます。

ユースケースと推奨事項#

YOLOv5とRT-DETRの選択は、プロジェクトの具体的な要件、デプロイの制約、およびエコシステムの好みに依存します。

YOLOv5を選択すべき場合#

YOLOv5は次の場合に強力な選択肢となります:

  • 実証済みの本番システム: YOLOv5の長期にわたる安定性の実績、広範なドキュメント、および膨大なコミュニティサポートが重視される既存のデプロイ環境。
  • リソースが制限されたトレーニング: GPUリソースが限られており、YOLOv5の効率的なトレーニングパイプラインと低いメモリ要件が有利に働く環境。
  • 豊富なエクスポートフォーマットのサポート: ONNXTensorRTCoreMLTFLiteを含む多くのフォーマットにわたるデプロイを必要とするプロジェクト。

RT-DETRを選択すべき時#

RT-DETRが推奨される場合:

  • Transformerベースの検出研究: NMSなしのエンドツーエンド物体検出に向けたアテンションメカニズムやTransformerアーキテクチャを探求するプロジェクト。
  • 高い精度が求められ、レイテンシに柔軟性があるシナリオ: 検出精度が最優先され、多少推論レイテンシが高くても許容されるアプリケーション。
  • 大きな物体の検出: 主に中規模から大規模な物体が中心となるシーンで、Transformerのグローバルアテンションメカニズムが自然な利点となる場合。

Ultralytics (YOLO26) を選択すべき時#

ほとんどの新しいプロジェクトにおいて、Ultralytics YOLO26はパフォーマンスと開発者体験の最高の組み合わせを提供します。

  • NMSフリーのエッジ展開: Non-Maximum Suppression後処理の複雑さを伴わずに、一貫した低レイテンシの推論が求められるアプリケーション。
  • CPUのみの環境: GPUアクセラレーションを利用できないデバイスにおいて、YOLO26の最大43%高速なCPU推論が決定的な利点となる場合。
  • 小物体検出: ProgLossとSTALにより極小オブジェクトの精度が大幅に向上する、空中ドローン画像やIoTセンサー分析などの困難なシナリオ。

今後の展望:YOLO11とYOLO26#

現在新しいビジョンプロジェクトを開始する場合は、最新世代のUltralyticsモデルを検討することを強く推奨します。

YOLOv5は非常に信頼性が高いままですが、YOLO11は精度の向上と、方向付きバウンディングボックス(OBB)検出を含む拡張されたタスクセットを提供します。

さらに重要なことに、最先端のYOLO26は両方の長所を融合しています。YOLOv10で最初に開拓されたエンドツーエンドのNMSフリー設計を実装しており、CNNの効率を維持しながら後処理のオーバーヘッドを排除します。YOLO26には、LLMトレーニングのイノベーションにインスパイアされた、より高速なコンバージェンスのためのMuSGDオプティマイザも導入されています。DFL削除(エクスポートの簡素化とエッジ/低電力デバイスの互換性の向上のためにディストリビューション焦点損失が削除されました)により、YOLO26は最大43%高速なCPU推論を実現し、エッジAIに絶対最適な選択肢となっています。さらに、ProgLoss + STALにより、IoT、ロボット工学、航空画像に不可欠な小物体認識の顕著な改善を伴う改良された損失関数が提供されます。

結論#

YOLOv5とRTDETRv2の選択は、デプロイの制約に大きく左右されます。RTDETRv2は強力なTransformerの注意機構を利用してmAPの限界を押し広げますが、メモリと計算のオーバーヘッドという大きなコストを伴います。

逆に、Ultralytics YOLOv5は、クラウドサーバーからマイクロコントローラーまで、どこでもスムーズに実行できる、実績のある高度に最適化された汎用性の高いソリューションを提供します。最高レベルの精度とシームレスなデプロイツールを求めるチームにとって、Ultralyticsエコシステム内でYOLO26にアップグレードすることは、現代のビジョンAIアプリケーションにとって決定的な最先端のソリューションを提供します。

コメント