YOLO11対YOLOv6-3.0#
computer vision の分野は急速に進化しており、適切なモデルアーキテクチャの選択は機械学習実務者にとって重要な決定です。リアルタイム object detection の進化における2つの重要なマイルストーンが YOLO11 と YOLOv6-3.0 です。どちらのモデルも視覚データからインサイトを抽出するための優れた能力を提供しますが、それぞれ異なる主要な目的と設計思想のもとで開発されました。
本ガイドでは、AIプロジェクトで情報に基づいた意思決定を行えるよう、両者のアーキテクチャ、パフォーマンス指標、および理想的なデプロイシナリオを比較する詳細な技術分析を提供します。
モデルの概要#
技術的なベンチマークの詳細に入る前に、各モデルの起源と主要な焦点を理解することが役立ちます。
Ultralytics YOLO11#
Ultralytics エコシステム内でネイティブに開発された YOLO11 は、シームレスでエンドツーエンドの開発エクスペリエンスを提供するように設計されました。単なる生得的な速度だけでなく、multi-task versatility、使いやすさ、および最新のデプロイパイプラインとの統合を重視しています。
- 著者: Glenn Jocher and Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: Ultralytics リポジトリ
- ドキュメント: YOLO11 Documentation
Meituan YOLOv6-3.0#
YOLOv6-3.0 は、専用の graphics processing units (GPUs) が利用可能な産業用アプリケーション向けに特別に調整されています。TensorRT のデプロイに向けて高度に最適化されており、管理された環境でのスループットの最大化に焦点を当てています。
- 著者: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, and Xiangxiang Chu
- 組織: Meituan
- 日付: 2023-01-13
- Arxiv: 2301.05586
- GitHub: Meituan YOLOv6 Repository
- ドキュメント: YOLOv6 Documentation
アーキテクチャの違い#
基礎となるアーキテクチャは、モデルがどのように学習しスケーリングするかを決定します。両フレームワークは、従来のYOLO方式に独自の強化を導入しています。
YOLO11は長年の研究を基盤として構築されており、パラメータ効率に優れた驚異的なアーキテクチャを実現しています。大規模な構造の変更を必要とせず、instance segmentationやpose estimationなどの多様なコンピュータビジョンタスクを処理できる高度なバックボーンと汎用ヘッドを備えています。さらに、YOLO11はトレーニング中のCUDAメモリ要件が非常に低いことを誇っており、RT-DETRのようなかさばるtransformer modelsとは一線を画しています。
一方、YOLOv6-3.0 は双方向連結 (BiC) モジュールとアンカー補助トレーニング (AAT) 戦略を採用しています。これらのメカニズムは、ローカライゼーションの精度を向上させるように設計されています。アーキテクチャは主に分離型であり、INT8 model inference を優先して高度に量子化されているため、レガシーな GPU スタックを実行する高速な製造ラインにとって強力な候補となっています。
プロジェクトに迅速なプロトタイピング、多様なタスクのサポート(セグメンテーションや分類など)、および異なるハードウェア(CPU、Edge TPU、モバイル)へのデプロイが必要な場合、Ultralyticsフレームワークは開発者にとって大幅にスムーズな体験を提供します。
パフォーマンスとメトリクス#
モデルを評価する際、mean Average Precision (mAP) と推論速度は極めて重要です。次の表では、さまざまなモデルスケールにおける YOLO11 と YOLOv6-3.0 のパフォーマンスを比較しています。最もパフォーマンスの高いメトリクスは 太字 で強調表示されています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
示されているように、YOLO11 は同等のティア全体で、大幅に少ないパラメータと FLOPs で一貫してより高い精度 (mAP) を達成します。このパラメータ効率は、model training と推論の両方におけるメモリ要件の低下に直接つながります。
Ultralyticsの利点#
モデルの選択は、単なる生得的なメトリクスにとどまらず、machine learning lifecycle 全体に関わるものです。Ultralytics モデルは、開発者と研究者の双方にとって明確な優位性を提供します。
- 使いやすさ: Ultralytics Python APIを使用すると、わずか数行のコードでモデルのトレーニング、検証、エクスポートが可能です。複雑な依存関係ツリーを手動で設定する必要はありません。
- 十分にメンテナンスされたエコシステム: Ultralytics は、頻繁なアップデートを受け取る統合されたエコシステムを提供します。Ultralytics Platform を活用することで、開発者は共同でのデータセット注釈、クラウドトレーニング、およびシームレスなモデル監視にアクセスできるようになります。
- 汎用性: 主にバウンディングボックス検出器である YOLOv6-3.0 とは異なり、YOLO11 は image classification と oriented bounding boxes (OBB) をネイティブでサポートしており、テクノロジースタックを統合することができます。
- トレーニングの効率性: 最新の最適化と自動バッチ処理を活用することで、YOLO11はコンシューマーグレードのハードウェアでも効率的にトレーニングでき、最先端のビジョンAIへのアクセスを民主化します。
コード例: 学習と推論#
Ultralyticsモデルの扱いは非常に直感的です。以下は、Ultralyticsパッケージを使用してトレーニングと推論を実行する方法を示す、完全に実行可能な例です。
from ultralytics import YOLO
# Load a pre-trained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model efficiently on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference on an image from the web
prediction = model("https://ultralytics.com/images/bus.jpg")
# Export the model to ONNX format for easy deployment
model.export(format="onnx")理想的なユースケース#
各モデルがどこに優れているかを理解することで、目的に合った正しいツールを確実に選択できます。
YOLOv6-3.0 を選択する場合: 特定の TensorRT 7.x/8.x パイプラインを中心に明示的に構築されたレガシーな産業用システムを維持しており、ハードウェアが高速な manufacturing automation 向けの専用 NVIDIA T4 または A100 GPU のみで構成されている場合、YOLOv6 は依然として実行可能で有能なエンジンです。
YOLO11 を選択する場合: ほぼすべての最新アプリケーションにおいて、YOLO11 は優れた選択肢です。smart manufacturing ソリューションの構築、Raspberry Pi デバイスへの edge AI のデプロイ、医療画像の検出とセグメンテーションなどのマルチタスク処理の実行のいずれにおいても、YOLO11 は速度、精度、およびデプロイの柔軟性の最適なバランスを提供します。
今後の展望: 最先端のYOLO26#
YOLO11 は大きな飛躍を表していますが、Ultralytics はコンピュービジョンの境界を絶えず押し広げています。2026年1月にリリースされた新しい YOLO26 モデルシリーズは絶対的な最先端であり、すべての新しいプロジェクトで推奨されるモデルです。
YOLO26は、最新のデプロイの課題に対応するために特別に設計されたいくつかの画期的な機能を導入しています。
- エンドツーエンドの NMS フリー設計: YOLOv10 によって開拓された概念を基に構築された YOLO26 は、ネイティブのエンドツーエンドです。非最大値抑制 (NMS) の後処理を完全に排除し、より高速で劇的にシンプルなデプロイパイプラインを実現します。
- DFL の削除: 分布焦点損失 (DFL) を削除することにより、YOLO26 はネットワークヘッドを簡素化し、低電力の Internet of Things (IoT) およびエッジデバイスとの互換性を大幅に向上させています。
- MuSGDオプティマイザ: 大規模言語モデル(LLM)のトレーニング革新(Moonshot AIのKimi K2など)に着想を得たYOLO26は、ハイブリッドなMuon-SGDオプティマイザを採用し、比類のないトレーニングの安定性とより高速な収束を保証します。
- 最大43%高速なCPU推論: 専用のGPUアクセラレータなしで実行されるアプリケーション向けに、YOLO26は生のCPUスループットに対して大幅な最適化が行われました。
- ProgLoss + STAL: これらの高度な損失関数は、drone imagery や空撮監視にとって重要な、小物体認識の顕著な改善をもたらします。
- タスク固有の改善: YOLO26には、セグメンテーションのためのマルチスケールプロトタイピングや、姿勢推定のためのResidual Log-Likelihood Estimation (RLE) など、すべてのタスクにわたるカスタマイズされた強化が含まれています。
今日新しいコンピュービジョンイニシアチブを開始する場合、Ultralytics Platform を活用して YOLO26 モデルをトレーニングすることで、アプリケーションが利用可能な最も効率的、正確、かつ将来性のあるアーキテクチャに基づいて構築されることが保証されます。
オープン語彙検出の探索に関心のある開発者向けに、YOLO-World に関するドキュメントも確認できます。