YOLOv6-3.0 と YOLOv9 の比較#
リアルタイム物体検出の分野は、より高い精度、より低いレイテンシ、そして優れたハードウェア活用への要求に突き動かされ、進化を続けています。本比較では、この分野における2つの重要なマイルストーンを検証します。産業用途のスループットを目的として開発された YOLOv6-3.0 と、ディープラーニングの情報ボトルネックを克服するための新しいアーキテクチャを導入した YOLOv9 です。
両モデルとも独自のアーキテクチャの革新を提供しますが、パフォーマンスとデプロイの簡素化の究極のバランスを求める開発者は、しばしばモダンなエコシステムに移行します。新しいプロジェクトを始める場合、ネイティブにエンドツーエンドの Ultralytics YOLO26 が推奨される標準であり、最先端の精度をはるかに効率化された開発者体験とともに提供します。
YOLOv6-3.0: 産業用スループットの最適化#
MeituanのVision AI Departmentによって開発された YOLOv6-3.0 は、特にGPUハードウェア上での産業用アプリケーションにおける最大のスループットを実現するために徹底的に設計されました。
- 著者: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, and Xiangxiang Chu
- 組織: Meituan
- 日付: 2023年1月13日
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
アーキテクチャの革新#
YOLOv6-3.0 は、特徴融合とハードウェア効率を向上させるためにいくつかの重要な修正を導入しました。アーキテクチャのネック部分には、より正確な位置情報信号を提供する Bi-directional Concatenation (BiC) モジュールが組み込まれています。また、Anchor-Aided Training (AAT) 戦略も採用しています。このアプローチは、アンカーベース学習の豊富なガイダンスと、アンカーフリーパラダイムの推論速度を組み合わせたもので、デプロイ速度を落とすことなく、より優れたパフォーマンスを実現します。
バックボーンはEfficientRepデザインに基づいており、GPU推論用のハードウェアに最適化されるよう細心の注意を払って最適化されています。これにより、重いバッチ処理が常態化する産業用製造のシナリオで非常に高い能力を発揮します。
強みと弱み#
YOLOv6-3.0の最大の強みは、NVIDIA T4などのGPUでの高いフレームレートにあり、高密度のビデオ理解ストリームに適しています。しかし、特定のハードウェア最適化への依存度が高いため、CPUのみのエッジデバイスでは最適ではないレイテンシが発生する可能性があります。さらに、そのトレーニングパイプラインのセットアップは、より統合されたフレームワークに比べて複雑になる場合があります。
YOLOv9: プログラマブル勾配情報#
1年後にリリースされた YOLOv9 は、ディープニューラルネットワークに固有の情報ボトルネック問題の解決に焦点を当て、CNNアーキテクチャの理論的限界を押し広げています。
- 著者: Chien-Yao Wang および Hong-Yuan Mark Liao
- 組織: Institute of Information Science, Academia Sinica
- 日付: 2024年2月21日
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
アーキテクチャの革新#
YOLOv9 の主な貢献は、Programmable Gradient Information (PGI) です。これは、重要なデータがネットワーク層を通過する際も確実に保持されるようにし、より信頼性の高い重みの更新を可能にします。PGI に加え、このモデルは Generalized Efficient Layer Aggregation Network (GELAN) を特徴としています。GELAN はパラメータ効率を最大化し、YOLOv9 が多くの前身モデルよりも少ない計算FLOPsで優れた精度を達成できるようにします。
強みと弱み#
YOLOv9は、COCOなどのベンチマークデータセットで卓越した平均精度 (mAP) を達成し、生の精度を優先する研究者の間で人気を集めています。しかし、YOLOv6と同様に、後処理には依然として従来のNon-Maximum Suppression (NMS)に依存しています。これによりレイテンシが増加し、特にONNXやTensorRTなどのフォーマットを使用してエッジデバイスに移植する場合、モデルデプロイのパイプラインが複雑になります。
パフォーマンスの比較#
これらのモデルを比較する際には、精度、パラメータ数、推論速度のバランスを考慮することが不可欠です。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
Ultralyticsの優位性:YOLO26の紹介#
YOLOv6-3.0とYOLOv9は堅牢なアーキテクチャを提供しますが、本番環境では、よくメンテナンスされたエコシステム、低いメモリ要件、および卓越した使いやすさが求められます。ここで Ultralytics Platform や、YOLO11、最先端のYOLO26のようなモデルが真価を発揮します。
2026年初頭にリリースされた YOLO26 は、レガシーなボトルネックを排除することで、デプロイ効率を根本的に再定義します。
YOLO26 は End-to-End NMS-Free Design を特徴としており、Non-Maximum Suppression のポストプロセッシングを完全に不要にしました。これにより、推論レイテンシの変動が大幅に低減され、エッジデプロイのロジックが簡素化されます。
YOLO26の主な革新点#
- MuSGD オプティマイザ: LLM学習(Moonshot AIの Kimi K2 など)に触発された YOLO26 は、SGD と Muon のハイブリッドを使用しています。これにより、コンピュータビジョンタスクに比類のない学習の安定性と高速な収束をもたらします。
- 最大43%高速なCPU推論: YOLOv6の重いGPUフォーカスとは異なり、YOLO26はエッジデバイス向けに高度に最適化されています。Distribution Focal Loss (DFL)の排除によりヘッドが簡素化され、低電力CPUやエッジコンピューティングハードウェアとの高い互換性を実現しています。
- ProgLoss + STAL: 高度な損失関数により、小さなオブジェクトの検出が劇的に改善され、航空画像やロボティクスにおいて不可欠です。
- 比類のない汎用性: YOLOv6が純粋な検出エンジンであるのに対し、YOLO26はインスタンスセグメンテーション、分類、ポーズ推定、および方向付きバウンディングボックス (OBB) 検出をシームレスに処理します。
Ultralytics によるシームレスな学習#
最先端のモデルのトレーニングに複雑なbashスクリプトは必要ありません。Ultralytics Python APIは、自動データローディング、最小限のCUDAメモリ使用量、および組み込みのトラッキングを備えた効率的な体験を提供します。
from ultralytics import YOLO
# Load the cutting-edge YOLO26 nano model
model = YOLO("yolo26n.pt")
# Train on the COCO8 dataset using the robust MuSGD optimizer natively
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained model to ONNX with a single command
model.export(format="onnx")理想的なユースケース#
最適なアーキテクチャの選択は、ターゲットとなるデプロイ環境に完全に依存します。
- YOLOv6-3.0 を使用すべきケース: サーバーグレードのGPU(A100など)が十分にあり、バッチ処理でスループットを最大化する工場自動化や欠陥検出。
- YOLOv9 を使用すべきケース: COCO などの標準化されたデータセットで絶対的な最高 mAP を追求することが主目的となる学術研究やコンテスト。
- YOLO26の用途: ほぼすべての現代の商用アプリケーション。NMSフリーのアーキテクチャ、低いメモリフットプリント、および高速なCPU推論により、セキュリティアラームシステム、スマートリテール、および組込みデバイスでのリアルタイムのオブジェクトトラッキングに最適です。
包括的な Ultralyticsエコシステム を活用することで、開発者は YOLOv8、YOLO11、YOLO26を簡単に試して、特定の現実世界の課題に最適なパフォーマンスのバランスを見つけることができます。