YOLOv9とYOLOv10#
リアルタイムコンピュータービジョンの分野は、研究者が性能と効率の限界を絶えず押し広げることで、大きく進歩してきました。最先端のビジョンモデルの進化を分析すると、YOLOv9とYOLOv10は重要な2つの節目にあたります。2024年初頭にリリースされた両モデルは、情報ボトルネックから後処理のレイテンシまで、ディープニューラルネットワークにおける長年の課題に対処する、パラダイムを変えるアーキテクチャ設計を導入しました。
この包括的な技術比較では、アーキテクチャ、性能指標、最適なデプロイシナリオを検討し、最新の物体検出エコシステムの複雑さを理解する手助けをします。
モデルの起源とアーキテクチャの画期的な進歩#
これらのモデルの系譜と理論的基盤を理解することは、特定のコンピュータービジョンプロジェクトに適したアーキテクチャを選択するうえで重要です。
YOLOv9:情報フローの最適化#
2024年2月21日に発表されたYOLOv9は、データが深層ニューラルネットワークを通過する際に生じる情報損失という理論的な課題に取り組んでいます。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織: 台湾、中央研究院情報科学研究所
- 参考資料: YOLOv9 arXiv 論文
- リポジトリ: YOLOv9 GitHub
YOLOv9は、CSPNetとELANの長所を組み合わせてパラメーターの利用効率を最大化する汎用効率的層集約ネットワーク(GELAN)を導入しています。さらに、補助的な監視メカニズムであるプログラム可能な勾配情報(PGI)を採用し、深層のレイヤーが重要な空間情報を保持できるようにします。そのため、医用画像解析や遠距離監視など、高い特徴忠実度が求められるタスクでYOLOv9は特に優れた性能を発揮します。
YOLOv10:リアルタイムのエンドツーエンド効率#
その後まもない2024年5月23日にリリースされたYOLOv10は、物体検出で特に知られるレイテンシのボトルネックの一つである非極大値抑制(NMS)を排除し、デプロイメントのパイプラインを再構築しています。
- 著者: Ao Wang、Hui Chen、Lihao Liuほか
- 組織: 清華大学
- 参考資料: YOLOv10 arXiv 論文
- リポジトリ: YOLOv10 GitHub
YOLOv10はトレーニング中に一貫性のあるデュアル割り当てを利用することで、ネイティブなNMSフリー設計を実現しています。これにより、推論時の後処理オーバーヘッドがなくなり、レイテンシが大幅に低減します。効率と精度を包括的に考慮したモデル設計と組み合わせることで、YOLOv10は競争力のある精度を維持しながら計算オーバーヘッド(FLOPs)を削減し、エッジコンピューティングアプリケーションにとって非常に魅力的なバランスを実現します。
パフォーマンスと指標の比較#
標準的なMS COCOデータセットでこの2つの強力なモデルをベンチマークすると、純粋な精度と推論レイテンシの間に明確なトレードオフが見られます。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
データの分析#
- レイテンシと精度: YOLOv10モデルは、一般に優れた推論速度を発揮します。たとえばYOLOv10sは、TensorRTでわずか2.49msで46.3%のmAPを達成します。一方、YOLOv9sは同程度の46.8%のmAPを得るのに3.54msを要します。
- 最高水準の精度: 検出精度を最大限に高める必要がある研究用途では、YOLOv9eが有力な選択肢であり、優れた55.6%のmAPを達成します。PGIアーキテクチャにより、微細な特徴を確実に抽出できます。
- 効率性: YOLOv10はFLOPs効率に優れています。これにより消費電力が直接低減され、ビジョンAIモデルを実行するバッテリー駆動デバイスでは特に重要な指標となります。
CPUやRaspberry Piのようなリソースに制約のあるエッジハードウェアにデプロイする場合、YOLOv10のNMSフリーアーキテクチャは、非決定論的な後処理ステップを排除するため、通常はよりスムーズなパイプラインを実現します。
Ultralyticsの強み:トレーニングとエコシステム#
アーキテクチャの違いは重要ですが、プロジェクトの成功は周辺のソフトウェアエコシステムに大きく左右されます。YOLOv9とYOLOv10はどちらもUltralyticsエコシステムに完全に統合されており、卓越した開発者エクスペリエンスを提供します。
使いやすさとメモリー効率#
大量のメモリーを消費する複雑なTransformerベースのアーキテクチャとは異なり、Ultralytics YOLOモデルはGPUメモリーを最適に利用できるよう設計されています。そのため、研究者は一般向けハードウェアでもより大きなバッチサイズを使用でき、最先端のAIを利用しやすくなります。
統合されたPython APIにより、データ拡張やハイパーパラメーター調整の複雑さが抽象化されます。重みファイルの文字列を変更するだけで、アーキテクチャをシームレスに切り替えられます。
from ultralytics import YOLO
# YOLOv10モデルを読み込みます(YOLOv9に切り替える場合は「yolov9c.pt」に簡単に変更できます)
model = YOLO("yolov10n.pt")
# COCO8データセットでモデルをトレーニングします
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# モデルの性能を検証します
metrics = model.val()
# トレーニング済みモデルをデプロイ用にONNX形式でエクスポートします
model.export(format="onnx")MLflowへのメトリクスの記録や、高速なハードウェアへのデプロイ用のTensorRTへのエクスポートなどを、Ultralytics Pythonパッケージでネイティブに処理できます。
最適なユースケース#
これらのモデルの選択は、デプロイメントの制約によって異なります。
- YOLOv9を選ぶ場合: 航空ドローン画像や小さな腫瘍の検出などの小物体検出タスクに取り組んでおり、GELANアーキテクチャの特徴保持による高い忠実度が必要な場合に適しています。
- YOLOv10を選ぶ場合: 主な用途がエッジデバイスでのリアルタイム推論である場合に適しています。NMSフリー設計は、自律型ロボット、リアルタイム交通監視、スマート監視に最適です。
将来を見据えて:YOLO26への移行#
YOLOv8、YOLOv9、YOLOv10はいずれも優れたモデルですが、最新のAIソリューションを構築する開発者には、2026年1月にリリースされたUltralytics YOLO26の検討をおすすめします。
YOLO26は、これまでの世代の長所を統合したモデルであり、YOLOv9の精度とYOLOv10の効率性を兼ね備えています。
YOLO26の主な革新点#
- エンドツーエンドのNMSフリー設計: YOLOv10の基盤を発展させたYOLO26では、オプションのワンツーワンヘッド(
nms=False)がNMSの後処理を省略し、デプロイメントを簡素化します。 - MuSGDオプティマイザー: SGDとMuonを組み合わせたハイブリッドで、LLMトレーニングの先進技術をコンピュータービジョンにもたらし、非常に安定した高速な収束を実現します。
- CPU推論が最大43%高速化: エッジコンピューティングや、専用GPUを搭載しないデバイス向けに特化して最適化されています。
- DFLの削除: モデルのエクスポートを簡素化し、低消費電力デバイスとの互換性を高めるため、分布焦点損失(DFL)が削除されました。
- ProgLoss + STAL: これらの改良された損失関数により、小物体認識が大幅に向上し、YOLOv9の性能に匹敵または上回ります。
従来のアーキテクチャを評価する研究者には、RT-DETRとYOLO11も、Ultralyticsエコシステム内で十分なドキュメントが整備された選択肢です。ただし、あらゆるビジョンタスクで最大限の汎用性を得るには、Ultralytics PlatformでYOLO26に移行することで、オープンソースのビジョンAIの最先端を活用できます。