YOLOv9 と YOLOv6-3.0 の比較#
リアルタイム物体検出の進化は、ニューラルネットワークアーキテクチャの絶え間ない革新によって推進されており、推論速度、精度、そして計算効率という繊細なバランスを最適化してきました。開発者や研究者がコンピュータビジョンのフレームワークという広大な領域を探索する中で、主要なアーキテクチャを比較することは、目的に最適なツールを選択するために不可欠です。
本テクニカルガイドでは、非常に優れた性能を持つ2つのモデル、すなわち情報の保持能力に長けた「YOLOv9」と、産業用途向けに特別に設計された「YOLOv6-3.0」を詳細に比較します。
YOLOv9 の概要: 特徴量保持の最大化#
2024年初頭に発表された YOLOv9 は、深層ニューラルネットワークにおける最も持続的な課題の一つである「フィードフォワード過程における情報損失」に取り組んでいます。勾配の信頼性を確保し、特徴マップが重要なデータを保持するように設計することで、理論上の精度の限界を押し広げています。
- 著者: Chien-Yao Wang および Hong-Yuan Mark Liao
- 組織: 台湾 中央研究院 情報科学研究所
- 日付: 2024年2月21日
- リンク: Arxiv論文、GitHubリポジトリ
アーキテクチャと手法#
YOLOv9 は、Generalized Efficient Layer Aggregation Network (GELAN) とともに、Programmable Gradient Information (PGI) という概念を導入しています。PGI は、推論オーバーヘッドを追加することなく、メインネットワークが堅牢で信頼性の高い特徴量を学習できるように補助的な監視を提供することで、情報ボトルネックに対処します。一方、GELAN はパラメータの利用効率を最適化し、計算コストを抑えながらモデルが最高水準の mean Average Precision (mAP) を達成できるようにします。これにより、特徴量の正確性が極めて重要な medical image analysis や極小オブジェクトの検出において、きわめて優れた選択肢となります。
YOLOv6-3.0 の概要: 産業規模向けに構築#
Meituan によって開発された YOLOv6-3.0 (v3.0とも呼ばれます) は、負荷の高い産業用アプリケーション向けにゼロから設計されました。2023年初頭にリリースされた本モデルは、展開の効率性に重点を置いており、エッジハードウェアで優れた性能を発揮する量子化対応モデル群を提供します。
- 著者: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, and Xiangxiang Chu
- 組織: Meituan
- 日付: 2023年1月13日
- リンク: Arxiv論文、GitHubリポジトリ
アーキテクチャと手法#
YOLOv6-3.0 は、RepOptimizer および Anchor-Aided Training (AAT) 戦略によって際立っています。このモデルは、RepVGG にインスパイアされたハードウェアアウェアなニューラルネットワーク設計を採用しており、推論時にレイヤーを統合することで GPU 上で非常に高速に動作します。3.0 アップデートでは、位置精度を向上させるために Bi-directional Concatenation (BiC) モジュールを導入し、アーキテクチャがさらに洗練されました。TensorRT や OpenVINO などのデプロイ形式向けに高度に最適化されているため、YOLOv6-3.0 は物流、manufacturing automation、および高スループットなサーバー環境で頻繁に採用されています。
パフォーマンスの比較#
標準的な COCO dataset でこれらのモデルを評価する場合、精度と実際の推論速度の間にある明確なトレードオフを確認できます。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
技術分析#
T4 ハードウェア上での実効速度では YOLOv6-3.0n が最速(1.17ms)ですが、YOLOv9t はパラメータ数が半分未満(2.0M 対 4.7M)でありながら、より少ない FLOPs でわずかに高い mAP(38.3%)を達成しています。複雑で高精度が要求される要件に対しては、大型の YOLOv9e が mAP を 55.6% まで引き上げ、ディープネットワークにおける PGI アーキテクチャの強力さを示しています。
新しいコンピュータビジョンプロジェクトを開始する場合は、YOLO26 の利用を強くお勧めします。2026 年にリリースされたこのモデルは、ネイティブな End-to-End NMS-Free Design を備えており、後処理のレイテンシを完全に排除し、最大 43% Faster CPU Inference を実現します。
Ultralyticsエコシステムの利点#
Ultralytics Python API を通じてネイティブに実装することで、どのモデルのアーキテクチャの理念に惹かれるかにかかわらず、優れた開発者体験が得られます。
使いやすさと学習の効率性#
複雑なディープラーニングモデルのトレーニングには、従来、膨大なボイラープレートコードが必要でした。Ultralytics Platform は、これらの複雑さを抽象化します。defect detection のために YOLOv9 をファインチューニングする場合でも、モバイルアプリ向けに YOLOv6 をエクスポートする場合でも、ワークフローは驚くほど一貫しています。
さらに、Ultralytics のアーキテクチャは一般的に、かさばる Transformer ベースのモデルと比較して、トレーニング中の CUDA memory requirements が少なくなっています。これにより、開発者はコンシューマー向け GPU でより大きなバッチサイズを使用できるようになり、トレーニング効率が大幅に向上します。
from ultralytics import YOLO
# Easily swap architectures by changing the weights file string
# model = YOLO("yolov6n.pt")
model = YOLO("yolov9c.pt")
# Train the model with built-in data augmentation and caching
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")
# Export to ONNX or TensorRT seamlessly
model.export(format="engine", quantize=16)ビジョンタスク全般にわたる比類のない汎用性#
YOLOv6-3.0 は高速なバウンドボックス生成向けに高度に最適化されていますが、現代のコンピュータビジョンプロジェクトではマルチタスクアプローチが求められることがよくあります。Ultralytics モデルは、その極めて高い汎用性で称賛されています。Ultralytics YOLOv8 や新しい YOLO26 などのツールを使用することで、単一のフレームワークで object detection、instance segmentation、image classification、pose estimation、および oriented bounding boxes (OBB) をシームレスに処理できます。
YOLO26 の紹介: 新しいスタンダード#
パフォーマンスとデプロイの容易さの両方を最大限に高めたい組織にとって、YOLO26 は速度と精度の究極の融合を表しています。
YOLO11 の成功を基盤として、YOLO26 はパラダイムを転換するいくつかの機能を導入しています。
- MuSGD Optimizer: Moonshot AI の Kimi K2 といった大規模言語モデル (LLM) の学習技術に着想を得たこのハイブリッドオプティマイザーは、非常に安定した学習と高速な収束を保証します。
- DFL Removal: Distribution Focal Loss を排除することにより、YOLO26 はエクスポートグラフを簡素化し、低電力の edge computing チップとの互換性を大幅に高めています。
- ProgLoss + STAL: これらの高度な損失関数は、小物体認識において顕著な改善をもたらし、drone operations や IoT アプリケーションにとって不可欠です。
- タスク固有の改善: YOLO26 には、セグメンテーション用のネイティブなマルチスケールプロトタイピング、スケルトントラッキング用の Residual Log-Likelihood Estimation (RLE)、および OBB 検出のエッジケースを解決するための専門的な角度損失アルゴリズムが含まれています。
理想的な展開シナリオ#
最適なアーキテクチャの選択は、最終的にはプロダクションの制約に帰着します。
産業製造における確立されたパイプラインがあり、量子化に大きく依存しており、サブミリ秒単位の最小ハードウェアレイテンシを必要とする特殊な推論アクセラレーターを使用している場合は、YOLOv6-3.0 を選択してください。
わずかなピクセルレベルの特徴を見落とすことが許されない、複雑な healthcare diagnostics や長距離監視に取り組んでいる場合は、YOLOv9 を選択してください。
しかし、最先端の精度と簡素化された NMS フリーの展開の両立という完璧なバランスを求めるなら、Ultralytics YOLO26 が現代のコンピュータビジョンエンジニアリングにとっての決定的な推奨モデルです。活発な開発サイクル、包括的なドキュメント、そして活気あるコミュニティサポートにより、研究者と開発者にとって欠かせないツールとなっています。