YOLOv6-3.0とYOLOv9#
リアルタイム物体検出の分野では、高精度、低レイテンシ、優れたハードウェア活用への要求に後押しされ、進化が続いています。この包括的な比較では、この分野における重要な2つの節目、産業用スループット向けに開発されたYOLOv6-3.0と、ディープラーニングの情報ボトルネックを克服する新たなアーキテクチャを導入したYOLOv9を取り上げます。
どちらのモデルも独自のアーキテクチャ革新を提供しますが、性能とデプロイの簡便さを両立したい開発者は、最新のエコシステムへ移行することがよくあります。新しいプロジェクトを始める場合は、ネイティブでエンドツーエンドに対応するUltralytics YOLO26を標準モデルとして推奨します。大幅に効率化された開発者体験とともに、最先端の精度を提供します。
YOLOv6-3.0:産業用スループットの最適化#
MeituanのVision AI Departmentが開発したYOLOv6-3.0は、特にGPUハードウェアを使う産業用途で最大のスループットを実現するために、徹底的に設計されています。
- 著者: Chuyi Li、Lulu Li、Yifei Geng、Hongliang Jiang、Meng Cheng、Bo Zhang、Zaidan Ke、Xiaoming Xu、Xiangxiang Chu
- 組織: Meituan
- 日付: 2023年1月13日
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
アーキテクチャの革新#
YOLOv6-3.0では、特徴融合とハードウェア効率を高めるために、いくつかの重要な変更が導入されました。アーキテクチャのネックには、より正確な位置特定の手がかりを提供する双方向連結(BiC)モジュールが組み込まれています。また、アンカー支援学習(AAT)戦略も採用しています。この手法は、アンカーベースの学習による豊富なガイダンスと、アンカーフリー方式の推論速度を組み合わせ、デプロイを遅くすることなく性能を向上させます。
バックボーンはEfficientRep設計をベースとしており、GPU推論でハードウェアとの親和性を高めるために入念に最適化されています。そのため、重いバッチ処理が一般的な産業製造のシナリオで高い能力を発揮します。
強みと弱み#
YOLOv6-3.0の主な強みは、NVIDIA T4などのGPUで高いフレームレートを実現することであり、高密度な動画理解ストリームに適しています。ただし、特定のハードウェア最適化への依存度が高いため、CPUのみのエッジデバイスではレイテンシが最適でない場合があります。また、統合性の高いフレームワークと比べて、学習パイプラインの構築が複雑になることがあります。
YOLOv9:プログラム可能な勾配情報#
1年後にリリースされたYOLOv9は、ディープニューラルネットワークに内在する情報ボトルネック問題の解決に取り組み、CNNアーキテクチャの理論上の限界を押し広げています。
- 著者: Chien-Yao Wang、Hong-Yuan Mark Liao
- 組織:中央研究院情報科学研究所
- 日付: 2024年2月21日
- Arxiv: 2402.13616
- GitHub: WongKinYiu/yolov9
アーキテクチャの革新#
YOLOv9の主な貢献はプログラム可能な勾配情報(PGI)です。重要なデータがネットワークの複数のレイヤーを通過する際に保持されることを保証し、より信頼性の高い重み更新を可能にします。PGIに加えて、このモデルは汎用効率的レイヤー集約ネットワーク(GELAN)を備えています。GELANはパラメーター効率を最大化し、YOLOv9が多くの従来モデルより少ない計算FLOPsで優れた精度を達成できるようにします。
強みと弱み#
YOLOv9はCOCOなどのベンチマークデータセットで優れた平均適合率(mAP)を達成するため、純粋な精度を重視する研究者に人気があります。ただし、YOLOv6と同様、後処理には従来型の非極大値抑制(NMS)が依然として必要です。そのため、レイテンシが増加し、特にONNXやTensorRTなどの形式を使ってエッジデバイスへ移植する際に、モデルのデプロイパイプラインが複雑になります。
パフォーマンス比較#
これらのモデルを比較する際は、精度、パラメーター数、推論速度のバランスを確認することが重要です。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
Ultralyticsの強み:YOLO26の紹介#
YOLOv6-3.0とYOLOv9は堅牢なアーキテクチャを提供しますが、本番環境では、十分に保守されたエコシステム、低いメモリ要件、優れた使いやすさが求められます。Ultralytics Platformと、YOLO11や最先端のYOLO26などのモデルは、こうした点で優れています。
2026年初頭にリリースされたYOLO26は、従来のボトルネックを取り除き、デプロイ効率を根本的に再定義します。
YOLO26はエンドツーエンドのNMSフリーデザインを採用しています。オプションの1対1ヘッド(nms=False)により、非極大値抑制の後処理が不要になります。これによって推論レイテンシのばらつきが大幅に減り、エッジへのデプロイロジックが簡素化されます。
YOLO26の主な革新点#
- MuSGDオプティマイザー:LLMの学習(Moonshot AIのKimi K2など)に着想を得たYOLO26は、SGDとMuonのハイブリッドを採用しています。これにより、コンピュータービジョンタスクで比類のない学習安定性と高速な収束を実現します。
- CPU推論を最大43%高速化:YOLOv6がGPUを重視しているのに対し、YOLO26はエッジデバイス向けに高度に最適化されています。Distribution Focal Loss(DFL)を削除してヘッドを簡素化することで、低消費電力CPUやエッジコンピューティングハードウェアとの互換性を高めています。
- ProgLoss + STAL:高度な損失関数により小さな物体の検出性能が大幅に向上します。これは航空画像やロボティクスで重要です。
- 比類のない汎用性:検出に特化したYOLOv6に対し、YOLO26はインスタンスセグメンテーション、分類、姿勢推定、方向付きバウンディングボックス(OBB)検出にシームレスに対応します。
Ultralyticsによるシームレスな学習#
最先端モデルの学習に複雑なbashスクリプトは必要ありません。Ultralytics Python APIは、自動データ読み込み、最小限のCUDAメモリ使用量、組み込みのトラッキング機能を備え、効率化された体験を提供します。
from ultralytics import YOLO
# 最先端のYOLO26 nanoモデルを読み込みます
model = YOLO("yolo26n.pt")
# COCO8データセットで学習します(optimizer='auto'は、学習時間が長い場合にMuSGDを選択します)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 1つのコマンドで学習済みモデルをONNXにエクスポートします
model.export(format="onnx")最適なユースケース#
適切なアーキテクチャは、対象とするデプロイ環境によって決まります。
- YOLOv6-3.0の用途:A100などのサーバーグレードGPUを豊富に利用でき、バッチ処理でスループットを最大化できる、工場のオートメーションや欠陥検出。
- YOLOv9の用途:COCOなどの標準データセットで最高のmAPを引き出すことが主な目標となる、学術研究やコンペティション。
- YOLO26の用途:現代の商用アプリケーションのほぼすべて。オプションのNMSフリー推論、少ないメモリ使用量、高速なCPU推論により、セキュリティ警報システム、スマートリテール、組み込みデバイスでのリアルタイム物体追跡に最適です。
包括的なUltralyticsエコシステムを活用することで、開発者はYOLOv8、YOLO11、YOLO26を簡単に試し、実環境の課題に最適な性能バランスを見つけられます。