YOLOv10とYOLOv9#
リアルタイムコンピュータビジョンの進化は、速度、精度、アーキテクチャの効率性における継続的なブレークスルーによって特徴づけられてきました。次のデプロイメント向けに最新のソリューションを評価する際、YOLOv10とYOLOv9を比較すると、ディープラーニングのボトルネックを解決する2つの異なるアプローチを興味深く理解できます。YOLOv9がトレーニング中の勾配情報フローの最大化に重点を置く一方で、YOLOv10は従来のポストプロセスにおける障壁を完全に排除する、ネイティブなエンドツーエンド設計を先駆的に導入しています。
この包括的なガイドでは、アーキテクチャ上の革新、パフォーマンス指標、および理想的なユースケースを分析し、開発者や研究者がそれぞれのコンピュータビジョンタスクに最適なモデルを選択できるよう支援します。
YOLOv10:NMS不要のエンドツーエンドの先駆者#
従来の物体検出器におけるレイテンシのボトルネックに対処するために開発されたYOLOv10は、非最大抑制 (NMS) の必要性をネイティブに排除する革新的なエンドツーエンドアーキテクチャを導入しています。
技術詳細と系譜:
- 著者: Ao Wang、Hui Chen、Lihao Liu、ほか
- 所属: 清華大学
- 日付: 2024年5月23日
- リンク: Arxiv論文、GitHubリポジトリ、Ultralytics Docs
アーキテクチャと強み#
YOLOv10のこの分野への最も重要な貢献は、NMS不要のトレーニングを実現する一貫したデュアルアサインメント戦略です。NMSを排除することで、特にポストプロセスがパイプライン全体のボトルネックになり得るエッジデバイス上で、モデルの推論レイテンシを大幅に短縮します。効率性と精度の両面からさまざまなコンポーネントを最適化した結果、注目すべき速度とパラメーターのトレードオフを実現するモデルとなっています。たとえば、YOLOv10-Sバリアントは非常に高速で、高速なビデオ解析やリアルタイムのロボットナビゲーションに非常に適しています。
弱点#
NMSフリー設計はバウンディングボックス検出において画期的ですが、YOLOv10は主に純粋なオブジェクト検出器として最適化されています。インスタンスセグメンテーションや姿勢推定をネイティブサポートする新しいエコシステムのような、すぐに使える汎用性が欠けています。
YOLOv10を本番環境向けに準備する際は、必ずモデルをTensorRTやONNXなどの最適化された形式にエクスポートしてください。デプロイメントで生のPyTorchウェイトを実行すると、グラフ処理が最適化されていないため、期待より推論が遅くなる可能性があります。
YOLOv9:プログラマブル勾配情報#
YOLOv10に先立ち、YOLOv9はディープニューラルネットワークに内在する情報ボトルネックの問題を解決するための新しいアーキテクチャ概念を導入し、パラメーターを非常に効率的に活用できるようにしました。
技術詳細と系譜:
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 所属機関: 台湾 中央研究院 情報科学研究所
- 日付: 2024年2月21日
- リンク: Arxiv論文、GitHubリポジトリ、Ultralytics Docs
アーキテクチャと強み#
YOLOv9は、一般化効率的層集約ネットワーク (GELAN) とともに、プログラマブル勾配情報 (PGI) を導入しています。PGIにより、データがネットワークの深い層を通過する際に重要なターゲット情報が失われず、重み更新に使用できる信頼性の高い勾配が生成されます。GELANはネットワークのパラメーター効率を最大化します。これらの革新により、YOLOv9はMS COCOデータセット上で非常に高い平均適合率 (mAP) を達成し、多くの場合、より少ないFLOPsでより大規模なモデルを上回ります。理論上の精度指標を最大化したい研究者にとって、非常に優れたモデルです。
弱点#
高い精度を備えている一方で、YOLOv9は依然として標準的なNMSポストプロセスに依存しています。つまり、ニューラルネットワークの処理は高速でも、最終的なバウンディングボックスのフィルタリングによって、シーン内の物体密度に応じた可変レイテンシが発生する可能性があります。さらに、後発のモデルと比較してトレーニングプロセスのメモリ消費が非常に大きくなる場合があり、カスタムデータセットのファインチューニングには、より強力なGPUリソースが必要です。
性能比較#
以下の表は、両モデルの主要な指標を示しています。YOLOv10は通常、TensorRTによって低いレイテンシを実現する一方、YOLOv9は最大構成で精度の上限を押し上げている点に注目してください。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター数 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
次世代:YOLO26が究極の推奨モデルである理由#
YOLOv9とYOLOv10は印象的なマイルストーンですが、機械学習の状況は急速に変化しています。最新の本番環境では、開発者はUltralytics Platformの統合された、適切にメンテナンスされたエコシステムをますます活用しています。2026年現在、研究とエンタープライズの両方に明確に推奨されるのは、新たにリリースされたYOLO26です。
YOLO26は、先行モデルの基盤となる概念を受け継ぎ、合理化されたユーザーエクスペリエンス、シンプルなAPI、そして大規模なTransformerベースのアーキテクチャと比較してトレーニング中のメモリ要件を大幅に低減することで、それらをさらに発展させています。
YOLO26の主な革新#
- エンドツーエンドのNMS不要設計: YOLOv10のブレークスルーを基盤として、YOLO26はネイティブなエンドツーエンドモデルとなっており、デプロイメントを簡素化し、レイテンシプロファイルを高い決定性にするため、NMSポストプロセスを完全に排除します。
- 最大43%高速なCPU推論: Edge AI向けにすぐに使える状態で最適化されており、専用GPUを持たない組み込みシステムに最適です。
- MuSGDオプティマイザー: SGDとMuonを組み合わせた画期的なハイブリッド(大規模言語モデルの最適化に着想を得ています)で、非常に安定したトレーニングプロセスと極めて高速な収束を実現します。
- DFLの除去: Distribution Focal Lossを除去することで、YOLO26はモデルのエクスポートプロセスを簡素化し、低消費電力デバイスやさまざまなエッジデプロイメントフレームワークとの互換性を大幅に高めます。
- タスク固有の拡張: 特定の単一タスクに特化した検出器とは異なり、YOLO26は汎用性に優れた強力なモデルです。セマンティックセグメンテーションの損失によってピクセルレベルの精度を高め、残差対数尤度推定 (RLE) によって高精度なポーズ推定を実現し、専用の角度損失によって有向バウンディングボックス (OBB) の境界に関する問題を解決します。
実践的な実装#
これらのモデルのトレーニングとデプロイメントは、Python SDKを使用して簡単に行えます。以下の例では、Ultralyticsエコシステムの非常に効率的なトレーニングプロセスを活用する方法を示します。このプロセスでは、ハイパーパラメーターのスケジューリングと最適なメモリ割り当てが自動的に処理されます。
from ultralytics import YOLO
# Load the recommended state-of-the-art model
model = YOLO("yolo26n.pt") # Also compatible with 'yolov10n.pt' or 'yolov9c.pt'
# Train the model efficiently on a custom dataset
train_results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=0, batch=16)
# Run ultra-fast inference
predictions = model.predict("https://ultralytics.com/images/bus.jpg")
# Export to ONNX for simplified edge deployment
model.export(format="onnx")ユースケースと推奨事項#
YOLOv10とYOLOv9のどちらを選ぶかは、具体的なプロジェクト要件、デプロイメント上の制約、エコシステムの好みによって決まります。
YOLOv10を選択する場合#
YOLOv10は次の用途に適しています:
- NMSフリーのリアルタイム検出: Non-Maximum Suppressionを使用しないエンドツーエンド検出のメリットを活かし、デプロイの複雑さを軽減できるアプリケーション。
- 速度と精度のバランスの取れたトレードオフ: さまざまなモデルスケールで、推論速度と検出精度の優れたバランスが求められるプロジェクト。
- レイテンシが一貫したアプリケーション: ロボティクスや自律システムなど、予測可能な推論時間が重要なデプロイシナリオ。
YOLOv9を選ぶタイミング#
YOLOv9は次の用途に推奨されます。
- 情報ボトルネックの研究: プログラマブル勾配情報(PGI)および汎用効率的レイヤー集約ネットワーク(GELAN)アーキテクチャを研究する学術プロジェクト。
- 勾配フロー最適化の研究: 学習中の深層ネットワーク層における情報損失の理解と軽減に重点を置く研究。
- 高精度検出のベンチマーク: アーキテクチャ比較の基準点として、YOLOv9の優れたCOCOベンチマーク性能が必要なシナリオ。
Ultralytics (YOLO26)を選ぶタイミング#
ほとんどの新規プロジェクトでは、Ultralytics YOLO26が性能と開発者エクスペリエンスの最適な組み合わせを提供します。
- NMSフリーのエッジデプロイ: Non-Maximum Suppressionの後処理を複雑にすることなく、一貫した低レイテンシー推論が必要なアプリケーション。
- CPUのみの環境: 専用GPUアクセラレーションを持たないデバイスで、YOLO26の最大43%高速なCPU推論が決定的な優位性となる場合。
- 小さな物体の検出: aerial drone imageryやIoTセンサー分析など、ProgLossとSTALによって微小物体の精度が大幅に向上する難しいシナリオ。
まとめ#
YOLOv9とYOLOv10は、どちらも独自の利点を備えています。YOLOv9は、ネットワークのパラメーター効率と理論的な勾配フローを最大化した成果であり、最高クラスの精度を実現します。一方、YOLOv10は、NMSによるレイテンシのペナルティなしにエンドツーエンドのバウンディングボックス検出を実現した、学術分野における先駆的なモデルです。
しかし、パフォーマンス、汎用性、使いやすさの完璧なバランスを求める開発者にとって、最新モデルへのアップグレードは極めて重要です。高度なMuSGDオプティマイザー、優れた小物体検出を実現するProgLoss + STAL機能、包括的なマルチタスクサポートを備えたYOLO26は、現実世界のあらゆるコンピュータビジョン課題に対応する決定的な最先端ソリューションです。