YOLO Vision 2026:

YOLOv10: リアルタイム・エンドツーエンド物体検出#

2024年5月にリリースされ、Tsinghua Universityの研究者によってUltralytics Python packageを基に構築されたYOLOv10は、リアルタイム物体検出に対する新しいアプローチを導入し、従来のYOLOバージョンに見られた後処理とモデルアーキテクチャの欠点の両方に対処しています。非最大値抑制(NMS)を排除し、さまざまなモデルコンポーネントを最適化することにより、YOLOv10はリリース当時、計算オーバーヘッドを大幅に削減しながら優れたパフォーマンスを達成しました。そのNMSフリーのエンドツーエンド設計は、YOLO26でさらに発展させられたアプローチの先駆けとなりました。

YOLOv10 consistent dual assignment for NMS-free training



Watch: How to Train YOLOv10 on SKU-110k Dataset using Ultralytics | Retail Dataset

概要#

リアルタイム物体検出は、低遅延で画像内のオブジェクトのカテゴリと位置を正確に予測することを目的としています。YOLOシリーズは、パフォーマンスと効率のバランスに優れているため、この研究の最前線に立ってきました。しかし、NMSへの依存や構造上の非効率性が、最適なパフォーマンスの妨げとなっていました。YOLOv10は、NMSフリーのトレーニングに向けた一貫したデュアル割り当てと、効率と精度の両立を重視したモデル設計戦略を導入することで、これらの問題に対処しています。

アーキテクチャ#

YOLOv10のアーキテクチャは、これまでのYOLOモデルの強みを基盤としつつ、いくつかの主要な革新を導入しています。モデルのアーキテクチャは以下のコンポーネントで構成されています。

  1. Backbone: 特徴抽出を担当し、YOLOv10のバックボーンにはCSPNet(Cross Stage Partial Network)の拡張バージョンが使用されており、勾配の流動性を改善し、計算の冗長性を削減しています。
  2. Neck: ネックは、さまざまなスケールの特徴を集約し、ヘッドに渡すように設計されています。効果的なマルチスケール特徴融合のためのPAN(Path Aggregation Network)レイヤーが含まれています。
  3. One-to-Many Head: 学習中に物体ごとに複数の予測を生成し、豊富な教師信号を提供して学習精度を向上させます。
  4. One-to-One Head: 推論中に物体ごとに最適な予測を1つだけ生成することで、NMSの必要性を排除し、それによって遅延を削減し効率を向上させます。

主な特徴#

  1. NMSフリーのトレーニング: 一貫したデュアル割り当てを利用してNMSの必要性をなくし、推論遅延を削減します。
  2. Holistic Model Design: 軽量な分類ヘッド、空間チャネル分離ダウンサンプリング、ランク誘導ブロック設計など、効率と精度の両方の観点からさまざまなコンポーネントを包括的に最適化しています。
  3. モデル機能の強化: 大規模カーネル畳み込みと部分セルフアテンションモジュールを組み込み、大きな計算コストをかけずにパフォーマンスを向上させます。

モデルのバリエーション#

YOLOv10には、さまざまなアプリケーションのニーズに対応するために、複数のモデルスケールが用意されています。

  • YOLOv10n: リソースが極めて制限された環境向けのナノバージョン。
  • YOLOv10s: 速度と精度のバランスが取れたスモールバージョン。
  • YOLOv10m: 汎用的なミディアムバージョン。
  • YOLOv10b: 精度の向上のために幅を広げたバランスのとれたバージョン。
  • YOLOv10l: 計算リソースの増加を犠牲にして、より高い精度を実現するラージバージョン。
  • YOLOv10x: 最大限の精度とパフォーマンスを実現するエクストララージバージョン。

性能#

YOLOv10は、精度と効率の面で、従来のYOLOバージョンやその他の最先端モデルを凌駕します。例えば、YOLOv10sはCOCOデータセットにおいて同等のAPでRT-DETR-R18よりも1.8倍高速であり、YOLOv10bは同等のパフォーマンスを持ちながら、YOLOv9-Cに比べてレイテンシが46%低く、パラメータ数が25%少なくなっています。

性能

T4 GPU上でTensorRT FP16を使用して測定された遅延。

モデル入力サイズAPvalFLOPs (G)遅延 (ms)
[YOLOv10n][1]64038.56.71.84
[YOLOv10s][2]64046.321.62.49
[YOLOv10m][3]64051.159.14.74
[YOLOv10b][4]64052.592.05.74
[YOLOv10l][5]64053.2120.37.28
[YOLOv10x][6]64054.4160.410.70

手法#

NMSフリー学習のための整合性のある二重割り当て#

YOLOv10は、トレーニング中に1対多と1対1の戦略を組み合わせたデュアルラベル割り当てを採用し、豊富なスーパービジョンと効率的なエンドツーエンドのデプロイメントを確実にします。一貫したマッチング指標により、両戦略間のスーパービジョンが整合され、推論中の予測品質が向上します。

効率と精度を包括的に重視したモデル設計#

効率の向上#

  1. Lightweight Classification Head: デプスワイズ分離畳み込みを使用することで、分類ヘッドの計算オーバーヘッドを削減します。
  2. Spatial-Channel Decoupled Down sampling: 空間縮小とチャネル変調を分離することで、情報損失と計算コストを最小限に抑えます。
  3. Rank-Guided Block Design: 本質的なステージの冗長性に基づいてブロック設計を適応させ、最適なパラメータ利用を確保します。

精度の向上#

  1. 大規模カーネル畳み込み: 受容野を拡大し、特徴抽出機能を強化します。
  2. Partial Self-Attention (PSA): 自己注意モジュールを組み込み、最小限のオーバーヘッドでグローバルな表現学習を改善します。

実験と結果#

COCOなどの標準的なベンチマークで広範なテストが行われており、優れたパフォーマンスと効率が実証されています。このモデルはさまざまなバリエーションで最先端の結果を達成しており、従来のバージョンや他の現代的な検出器と比較して、レイテンシと精度の面で大幅な改善を示しています。

比較#

YOLOv10 comparison with SOTA object detectors

他の最先端検出器との比較:

  • YOLOv10s / xは、同等の精度でRT-DETR-R18 / R101より1.8倍 / 1.3倍高速
  • YOLOv10bは、同じ精度でYOLOv9-Cよりもパラメータ数が25%少なく、遅延が46%低い
  • YOLOv10l / x は、YOLOv8l / x と比較して 0.3 AP / 0.5 AP 高い精度を達成しつつ、パラメータ数を 1.8× / 2.3× 削減しています。
性能

以下は、YOLOv10のバリエーションと他の最先端モデルの詳細な比較です。

モデルパラメータ
(M)
FLOPs
(G)
mAPval
50-95
遅延
(ms)
遅延-forward
(ms)
YOLOv6-3.0-N4.711.437.02.691.76
Gold-YOLO-N5.612.139.62.921.82
YOLOv8n3.28.737.36.161.77
YOLOv10n2.36.739.51.841.79
YOLOv6-3.0-S18.545.344.33.422.35
Gold-YOLO-S21.546.045.43.822.73
YOLOv8s11.228.644.97.072.33
YOLOv10s7.221.646.82.492.39
RT-DETR-R1820.060.046.54.584.49
YOLOv6-3.0-M34.985.849.15.634.56
Gold-YOLO-M41.387.549.86.385.45
YOLOv8m25.978.950.69.505.09
YOLOv10m15.459.151.34.744.63
YOLOv6-3.0-L59.6150.751.89.027.90
Gold-YOLO-L75.1151.751.810.659.78
YOLOv8l43.7165.252.912.398.06
RT-DETR-R5042.0136.053.19.209.07
YOLOv10l24.4120.353.47.287.21
YOLOv8x68.2257.853.916.8612.83
RT-DETR-R10176.0259.054.313.7113.58
YOLOv10x29.5160.454.410.7010.60

パラメータ数および FLOPs の値は、Conv レイヤーと BatchNorm レイヤーを統合し、補助的な多対1(one-to-many)検出ヘッドを削除する model.fuse() 処理後の統合モデルに関するものです。事前学習済みチェックポイントは完全な学習アーキテクチャを保持しており、より高い数値を示す場合があります。

使用例#

YOLOv10を使用して新しい画像を予測します。モデルは、Ultralytics Platformを通じてクラウドGPU上でトレーニングすることもできます。

from ultralytics import YOLO

# Load a pretrained YOLOv10n model
model = YOLO("yolov10n.pt")

# Perform object detection on an image
results = model("image.jpg")

# Display the results
results[0].show()

カスタムデータセットでのYOLOv10のトレーニング用です:

from ultralytics import YOLO

# Load YOLOv10n model from scratch
model = YOLO("yolov10n.yaml")

# Train the model
model.train(data="coco8.yaml", epochs=100, imgsz=640)

サポートされるタスクとモード#

YOLOv10モデルシリーズにはさまざまなモデルが用意されており、それぞれが高性能な物体検出向けに最適化されています。これらのモデルは、さまざまな計算ニーズや精度の要件に対応するため、幅広いアプリケーションに対して汎用性を持っています。

モデルファイル名タスクトレーニングバリデーション推論エクスポート
YOLOv10yolov10n.pt yolov10s.pt yolov10m.pt yolov10l.pt yolov10x.ptObject Detection

YOLOv10のエクスポート#

YOLOv10で導入された新しいオペレーションにより、Ultralyticsが提供するすべてのエクスポート形式が現在サポートされているわけではありません。次の表は、YOLOv10に対してUltralyticsを使用して正常に変換された形式の概要を示しています。YOLOv10向けの追加形式のエクスポートサポートを追加するための貢献や変更の提供が可能な場合は、お気軽にプルリクエストを開いてください。

エクスポートフォーマットエクスポートサポートエクスポート済みモデルの推論注意点
TorchScript標準のPyTorchモデル形式。
ONNXデプロイメントに広く対応しています。
OpenVINOIntelハードウェア向けに最適化されています。
TensorRTNVIDIA GPU向けに最適化されています。
CoreMLAppleデバイスに限定されます。
TF SavedModelTensorFlowの標準モデル形式。
TF GraphDefレガシーなTensorFlowフォーマットです。
LiteRTモバイル、組み込み、ブラウザ(LiteRT.js)向けに最適化されています。
TF Edge TPUGoogleのEdge TPUデバイス専用です。
PaddlePaddle中国で普及しており、グローバルでのサポートは限定的です。
NCNNレイヤー torch.topk が存在しないか、登録されていません

結論#

YOLOv10は、従来のYOLOバージョンの欠点に対処し、革新的な設計戦略を取り入れることにより、リリース時にリアルタイム物体検出の新しい基準を打ち立てました。そのNMSフリーのアプローチは、YOLOファミリーにおけるエンドツーエンドの物体検出の先駆けとなりました。パフォーマンスが向上し、NMSフリーの推論に対応した最新のUltralyticsモデルについては、YOLO26をご覧ください。

引用と謝辞#

Tsinghua UniversityのYOLOv10著者らによる広範な研究と、Ultralyticsフレームワークへの多大な貢献に深く感謝いたします。

引用
@inproceedings{wang2024yolov10,
  title={YOLOv10: Real-Time End-to-End Object Detection},
  author={Wang, Ao and Chen, Hui and Liu, Lihao and Chen, Kai and Lin, Zijia and Han, Jungong and Ding, Guiguang},
  booktitle={Advances in Neural Information Processing Systems},
  doi = {10.52202/079017-3429},
  url = {https://proceedings.neurips.cc/paper_files/paper/2024/file/c34ddd05eb089991f06f3c5dc36836e0-Paper-Conference.pdf},
  volume={37},
  pages={107984--108011},
  year={2024}
}

詳細な実装、構造上の革新、および実験結果については、Tsinghua UniversityチームによるYOLOv10の研究論文およびGitHubリポジトリをご参照ください。

よくある質問 (FAQ)#

YOLOv10とは何ですか?また、以前のYOLOバージョンとどのように異なりますか?#

Tsinghua Universityの研究者によって開発されたYOLOv10は、リアルタイム物体検出にいくつかの重要なイノベーションを導入しています。トレーニング中に一貫したデュアル割り当てを採用し、最適化されたモデルコンポーネントを使用することで、非最大値抑制(NMS)の必要性をなくし、計算オーバーヘッドを削減しながら優れたパフォーマンスを実現しています。そのアーキテクチャと主な機能の詳細については、YOLOv10の概要セクションをご確認ください。

YOLOv10を使用して推論を開始するにはどうすればよいですか?#

簡単に推論を行うには、Ultralytics YOLO Pythonライブラリまたはコマンドラインインターフェース(CLI)をご利用いただけます。以下に、YOLOv10を使用して新しい画像を予測する例を示します:

from ultralytics import YOLO

# Load the pretrained YOLOv10n model
model = YOLO("yolov10n.pt")
results = model("image.jpg")
results[0].show()

その他の使用例については、使用例セクションをご覧ください。

YOLOv10はどのようなモデルバリエーションを提供しており、それぞれのユースケースは何ですか?#

YOLOv10は、様々なユースケースに対応するため、いくつかのモデルバリエーションを提供しています:

  • YOLOv10n: 非常にリソースが制限された環境に適しています
  • YOLOv10s: 速度と精度のバランスが取れています
  • YOLOv10m: 一般的な用途向けです
  • YOLOv10b: 幅を広げた高精度モデルです
  • YOLOv10l: 計算リソースを消費しますが、高い精度を実現します
  • YOLOv10x: 最大限の精度とパフォーマンスを実現します

各バリエーションは異なる計算ニーズや精度の要件に合わせて設計されており、多様なアプリケーションに対して柔軟に対応できます。詳細については、モデルのバリエーションセクションをご覧ください。

YOLOv10のNMSフリーアプローチは、どのようにパフォーマンスを向上させますか?#

YOLOv10は、トレーニングに一貫したデュアル割り当てを採用することで、推論時の非最大値抑制(NMS)の必要性をなくします。このアプローチにより、推論のレイテンシが短縮され、予測効率が向上します。また、このアーキテクチャには推論用の1対1のヘッドが含まれており、各オブジェクトに対して単一の最適な予測が確実に得られます。詳細な説明については、NMSフリートレーニングの一貫したデュアル割り当てセクションをご覧ください。

YOLOv10モデルのエクスポートオプションはどこで確認できますか?#

YOLOv10は、TorchScript、ONNX、OpenVINO、TensorRTなど、いくつかのエクスポート形式をサポートしています。ただし、新しいオペレーションがあるため、Ultralyticsが提供するすべてのエクスポート形式がYOLOv10で現在サポートされているわけではありません。サポートされている形式の詳細やエクスポートの手順については、YOLOv10のエクスポートセクションをご覧ください。

YOLOv10モデルのパフォーマンスベンチマークはどのようになっていますか?#

YOLOv10は、精度と効率の両面で、従来のYOLOバージョンやその他の最先端モデルを凌駕しています。例えば、YOLOv10sはCOCOデータセットにおいて同等のAPでRT-DETR-R18よりも1.8倍高速です。YOLOv10bは、同等のパフォーマンスでありながら、YOLOv9-Cと比較してレイテンシが46%低く、パラメータ数が25%少なくなっています。詳細なベンチマークは、比較セクションに記載されています。

コメント