YOLO11とYOLOv6-3.0の比較#
コンピュータービジョンの分野は急速に進化しており、適切なモデルアーキテクチャの選択は、機械学習の実務者にとって重要な判断です。リアルタイムの物体検出の発展における重要な節目が、YOLO11とYOLOv6-3.0です。どちらのモデルも視覚データから有益な情報を抽出する優れた機能を備えていますが、主な目的や設計思想は異なります。
このガイドでは、アーキテクチャ、性能指標、理想的なデプロイシナリオを詳細に技術分析し、次のAIプロジェクトで適切な判断を下せるよう支援します。
モデルの概要#
技術ベンチマークを詳しく見る前に、それぞれのモデルの起源と主な重点を理解しておくと役立ちます。
Ultralytics YOLO11#
Ultralyticsエコシステム内で開発されたYOLO11は、シームレスなエンドツーエンドの開発エクスペリエンスを提供するよう設計されています。単なる速度だけでなく、マルチタスクの汎用性、使いやすさ、最新のデプロイパイプラインとの統合も重視しています。
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: Ultralyticsリポジトリ
- ドキュメント: YOLO11ドキュメント
Meituan YOLOv6-3.0#
YOLOv6-3.0は、専用のグラフィックス処理ユニット(GPUs)を利用できる産業用途向けに明確に最適化されています。TensorRTでのデプロイを重点的に最適化し、制御された環境でスループットを最大化することに焦点を当てています。
- 著者: Chuyi Li、Lulu Li、Yifei Geng、Hongliang Jiang、Meng Cheng、Bo Zhang、Zaidan Ke、Xiaoming Xu、Xiangxiang Chu
- 組織: Meituan
- 日付: 2023-01-13
- Arxiv: 2301.05586
- GitHub: Meituan YOLOv6リポジトリ
- ドキュメント: YOLOv6ドキュメント
アーキテクチャの違い#
基盤となるアーキテクチャによって、モデルの学習方法やスケーリング方法が決まります。どちらのフレームワークも、従来のYOLOの手法に独自の改良を加えています。
YOLO11は長年の研究を基盤に、パラメーター効率に非常に優れたアーキテクチャを実現しています。高度なバックボーンと汎用性の高いヘッドを備えており、インスタンスセグメンテーションや姿勢推定などの多様なコンピュータービジョンタスクに、大規模な構造変更を行わずに対応できます。さらに、YOLO11はトレーニング時に必要なCUDAメモリが非常に少なく、RT-DETRのような大規模なTransformerモデルとは一線を画しています。
一方、YOLOv6-3.0は双方向連結(BiC)モジュールとアンカー支援トレーニング(AAT)戦略を採用しています。これらの仕組みは位置特定精度の向上を目的としています。アーキテクチャは主にデカップル化され、INT8のモデル推論を優先して高度に量子化されているため、レガシーなGPUスタックで稼働する高速な製造ラインに適しています。
迅速なプロトタイピング、多様なタスク(セグメンテーションや分類など)のサポート、さまざまなハードウェア(CPU、Edge TPU、モバイル)へのデプロイが必要なプロジェクトでは、Ultralyticsフレームワークによって開発者エクスペリエンスが大幅に向上します。
パフォーマンスとメトリクス#
モデルを評価する際は、平均適合率(mAP)と推論速度が最も重要です。次の表では、さまざまなモデルスケールでYOLO11とYOLOv6-3.0の性能を比較しています。最も優れた指標は太字で示しています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
示されているように、YOLO11は同等の規模で、パラメーター数とFLOPsを大幅に抑えながら、一貫して高い精度(mAP)を達成しています。このパラメーター効率により、モデルのトレーニングと推論の両方で必要なメモリを直接削減できます。
Ultralyticsの強み#
モデル選びでは、単純な指標だけでなく、機械学習のライフサイクル全体を考慮する必要があります。Ultralyticsモデルは、開発者と研究者の双方に明確なメリットをもたらします。
- 使いやすさ:Ultralytics Python APIを使えば、数行のコードでモデルのトレーニング、検証、エクスポートを実行できます。複雑な依存関係を手動で設定する必要はありません。
- 充実したメンテナンス体制のエコシステム:Ultralyticsは、頻繁に更新される統一エコシステムを提供しています。Ultralytics Platformを利用することで、開発者は共同でのデータセットアノテーション、クラウドトレーニング、シームレスなモデル監視を利用できます。
- 汎用性:主にバウンディングボックス検出器であるYOLOv6-3.0とは異なり、YOLO11は画像分類と方向付きバウンディングボックス(OBB)をネイティブにサポートし、技術スタックを統合できます。
- トレーニング効率:最新の最適化手法と自動バッチ処理を活用するYOLO11は、コンシューマー向けハードウェアでも効率的にトレーニングでき、最先端のビジョンAIを幅広く利用しやすくします。
コード例:トレーニングと推論#
Ultralyticsモデルは非常に直感的に使用できます。以下は、Ultralyticsパッケージを使ってトレーニングと推論を実行する方法を示す、完全に実行可能なサンプルです。
from ultralytics import YOLO
# 事前トレーニング済みのYOLO11小型モデルを読み込みます
model = YOLO("yolo11s.pt")
# COCO8データセットでモデルを効率的にトレーニングします
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# ウェブ上の画像で推論を実行します
prediction = model("https://ultralytics.com/images/bus.jpg")
# 簡単にデプロイできるよう、モデルをONNX形式にエクスポートします
model.export(format="onnx")最適なユースケース#
各モデルの得意分野を理解することで、目的に合ったツールを確実に選択できます。
YOLOv6-3.0を選ぶケース: 特定のTensorRT 7.x/8.xパイプラインを中心に構築されたレガシーな産業システムを維持しており、ハードウェアが高速な製造自動化向けの専用NVIDIA T4またはA100 GPUのみで構成されている場合、YOLOv6は引き続き実用的で高性能なエンジンです。
YOLO11を選ぶケース: 現代のほとんどのアプリケーションでは、YOLO11が優れた選択肢です。スマート製造ソリューションの構築、Raspberry PiデバイスへのエッジAIのデプロイ、医療画像の検出とセグメンテーションなどのマルチタスク処理のいずれにおいても、YOLO11は速度、精度、デプロイの柔軟性を最適なバランスで提供します。
今後の展望:最先端のYOLO26#
YOLO11は大きな進歩を遂げたモデルですが、Ultralyticsはコンピュータービジョンの可能性を絶えず広げています。2026年1月にリリースされた新しいYOLO26シリーズは、現時点で最高水準のモデルであり、すべての新規プロジェクトにおすすめです。
YOLO26は、現代のデプロイにおける課題に特化して設計された、画期的な複数の機能を導入しています。
- エンドツーエンドのNMSフリーデザイン:YOLOv10で先駆的に取り入れられた概念を基盤に、YOLO26はネイティブのエンドツーエンドヘッド(
nms=False)を備え、後処理の非最大値抑制(NMS)を取り除きます。これにより、デプロイパイプラインが高速化し、大幅に簡素化されます。 - DFLの削除:Distribution Focal Lossを取り除くことで、YOLO26はネットワークヘッドを簡素化し、低消費電力のモノのインターネット(IoT)デバイスやエッジデバイスとの互換性を大幅に高めます。
- MuSGD Optimizer: 大規模言語モデル(LLM)のトレーニングにおける革新(Moonshot AIのKimi K2など)に着想を得たYOLO26は、ハイブリッド型のMuon-SGDオプティマイザーを採用し、比類のないトレーニング安定性と高速な収束を実現します。
- CPU推論を最大43%高速化: 専用GPUアクセラレーターを使用せずに実行するアプリケーション向けに、YOLO26はCPUのスループットを最大限に高めるよう大幅に最適化されています。
- ProgLoss + STAL: これらの高度な損失関数は、小さな物体の認識を大幅に向上させます。これは、ドローン画像や空中監視において重要です。
- タスク固有の改善: YOLO26には、セグメンテーション向けのマルチスケールプロトタイピングや、姿勢推定向けの残差対数尤度推定(RLE)など、すべてのタスクにわたるカスタマイズされた機能強化が含まれています。
今すぐ新しいコンピュータービジョンプロジェクトを始める場合、Ultralytics Platformを活用してYOLO26モデルをトレーニングすることで、利用可能なアーキテクチャの中でも効率性、精度、将来性に最も優れた基盤の上にアプリケーションを構築できます。
オープンボキャブラリー検出に関心のある開発者は、YOLO-Worldに関するドキュメントもご覧ください。