YOLOv9とYOLOv10の比較#
リアルタイムコンピュータビジョンの分野では、研究者たちがパフォーマンスと効率の限界を絶えず押し広げることで、計り知れない進歩が遂げられてきました。最先端のビジョンモデルの進化を分析する際、YOLOv9とYOLOv10は2つの重要なマイルストーンとなります。2024年初頭にリリースされた両モデルは、情報のボトルネックから後処理のレイテンシまで、ディープニューラルネットワークにおける長年の課題に対処するためのパラダイムシフトとなるアーキテクチャ設計を導入しました。
この包括的な技術比較では、それらのアーキテクチャ、パフォーマンス指標、および理想的なデプロイシナリオを掘り下げ、現代のobject detectionエコシステムの複雑さをナビゲートするお手伝いをします。
モデルの起源とアーキテクチャのブレイクスルー#
これらのモデルの系譜と理論的基礎を理解することは、特定のcomputer visionプロジェクトに適したアーキテクチャを選択するために不可欠です。
YOLOv9: 情報フローの習得#
2024年2月21日に発表されたYOLOv9は、データがディープニューラルネットワークを通過する際の情報の損失という理論的問題に取り組んでいます。
- 著者: Chien-Yao Wang および Hong-Yuan Mark Liao
- 組織: Institute of Information Science, Academia Sinica, Taiwan
- 参考文献: YOLOv9 arXiv Paper
- リポジトリ: YOLOv9 GitHub
YOLOv9は、CSPNetとELANの強みを組み合わせることでパラメータ利用を最大化する**Generalized Efficient Layer Aggregation Network (GELAN)を導入しています。さらに、ディープ層が重要な空間情報を確実に保持する補助的監視メカニズムであるProgrammable Gradient Information (PGI)**を採用しています。これにより、YOLOv9はmedical image analysisや遠隔監視など、高い特徴量忠実度が求められるタスクにおいて非常に強力になります。
YOLOv10: リアルタイム・エンドツーエンドの効率性#
その直後の2024年5月23日にリリースされたYOLOv10は、物体検出における最も悪名高いレイテンシのボトルネックの1つであるNon-Maximum Suppression (NMS)を排除することで、デプロイメントパイプラインを再構築しました。
- 著者: Ao Wang, Hui Chen, Lihao Liu, 他
- 組織: Tsinghua University
- 参考文献: YOLOv10 arXiv Paper
- リポジトリ: YOLOv10 GitHub
YOLOv10は、トレーニング中に一貫したデュアル割り当てを活用し、ネイティブなNMSフリー設計を実現しています。これにより推論時の後処理のオーバーヘッドが排除され、レイテンシが大幅に削減されます。効率性と精度の両立を重視したモデル設計と組み合わせることで、YOLOv10は優れたバランスを達成し、競争力のある精度を維持しながら計算オーバーヘッド(FLOPs)を低減するため、edge computingアプリケーションにおいて非常に魅力的です。
パフォーマンスと指標の比較#
標準のMS COCOデータセットでこれら2つの強力なモデルをベンチマークすると、純粋な精度と推論レイテンシの間には明確なトレードオフが現れます。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
データの分析#
- レイテンシ vs. 精度: YOLOv10モデルは、一般的に優れた推論速度を提供します。例えば、YOLOv10sはTensorRT上でわずか2.66msで46.7%のmAPを達成しますが、YOLOv9sはほぼ同等の46.8%のmAPを得るのに3.54msを要します。
- トップクラスの精度: 最大限の検出精度が求められる研究シナリオでは、55.6%のmAPに達するYOLOv9eが強力な選択肢であり続けます。そのPGIアーキテクチャにより、微細な特徴が確実に抽出されます。
- 効率性: YOLOv10はFLOPs efficiencyに優れています。これは直接的に電力消費の削減につながり、vision AI modelsを実行するバッテリー駆動のデバイスにとって重要な指標となります。
CPUやRaspberry Piのようなリソースが制限されたエッジハードウェアに展開する場合、YOLOv10のNMSフリーアーキテクチャは、非決定論的な後処理ステップを排除することで、通常よりスムーズなパイプラインを提供します。
Ultralyticsの利点: トレーニングとエコシステム#
アーキテクチャの違いは重要ですが、それを囲むソフトウェアエコシステムがプロジェクトの成功を大きく左右します。YOLOv9とYOLOv10はいずれもUltralytics ecosystemに完全に統合されており、比類のない開発者体験を提供します。
使いやすさとメモリ効率#
膨大なメモリ肥大化に悩まされる複雑なTransformerベースのアーキテクチャとは異なり、Ultralytics YOLOモデルは最適なGPU memory使用量になるよう設計されています。これにより、研究者はコンシューマー向けハードウェアでより大きなbatch sizesを利用できるようになり、最先端のAIが身近なものになります。
統一されたPython APIにより、data augmentationやhyperparameter tuningの複雑さが抽象化されます。重みファイルの文字列を変更するだけで、アーキテクチャをシームレスに切り替えることができます。
from ultralytics import YOLO
# Load a YOLOv10 model (Easily swap to "yolov9c.pt" for YOLOv9)
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Validate the model's performance
metrics = model.val()
# Export the trained model to ONNX format for deployment
model.export(format="onnx")MLflowへのメトリクスの記録が必要な場合でも、高速なハードウェアデプロイのためにTensorRTへエクスポートする必要がある場合でも、Ultralyticsプラットフォームがネイティブに対応します。
理想的なユースケース#
これらのモデルのどちらを選択するかは、展開時の制約に依存します。
- 次の場合には YOLOv9 を選択してください: 空撮ドローン画像や小さな腫瘍の検出など、GELAN アーキテクチャの特徴保持が最高忠実度を提供する小物体検出タスクに取り組んでいる場合。
- YOLOv10を選ぶべき場合: 主なターゲットがエッジデバイス上でのreal-time inferenceである場合。NMSフリーの設計により、自律型ロボット、リアルタイム交通監視、smart surveillanceに最適です。
将来への備え: YOLO26への移行#
YOLOv8、YOLOv9、YOLOv10は優れたモデルですが、現代的なAIソリューションの構築を目指す開発者は、2026年1月にリリースされた**Ultralytics YOLO26**を検討する必要があります。
YOLO26は、YOLOv9の精度とYOLOv10の効率という両方の利点を融合させた、前世代の究極の統合形です。
YOLO26の主な革新点#
- エンドツーエンドのNMSフリー設計: YOLOv10で築かれた基盤の上に構築されており、YOLO26は展開を簡素化するためにネイティブでNMS後処理を排除しています。
- MuSGDオプティマイザー: SGDとMuonのハイブリッドであり、先進的なLLMトレーニングのイノベーションをコンピュータビジョンにもたらし、驚くほど安定した高速な収束を実現します。
- 最大43%高速なCPU推論: 専用GPUを持たないエッジコンピューティングやデバイス向けに特別に最適化されています。
- DFLの削除: model exportを簡素化し、低電力デバイスとの互換性を高めるために、Distribution Focal Lossが削除されました。
- ProgLoss + STAL: これらの改善された損失関数は、小物体認識において顕著な改善をもたらし、YOLOv9の能力に匹敵するか、それを上回ります。
レガシーアーキテクチャを評価している研究者向けに、RT-DETRとYOLO11もUltralyticsエコシステム内で十分にドキュメント化された代替手段です。ただし、あらゆるビジョンタスクで最大の汎用性を得るためには、Ultralytics Platform上でYOLO26へ移行することが、オープンソースのビジョンAIの最高峰を活用することにつながります。