YOLO11とYOLOv5#
適切なニューラルネットワークアーキテクチャの選択は、あらゆるコンピュータービジョンプロジェクトにおける重要な決定事項です。人工知能の状況が進化するにつれて、開発者や研究者が利用できるツールも進化しています。この包括的なガイドでは、Ultralyticsエコシステムを代表する2つの画期的なモデル、広く高く評価されているYOLOv5と高度なYOLO11を技術的に詳しく比較します。
エッジAIアプリケーション向けに軽量モデルをデプロイする場合でも、クラウドGPUで高解像度のビデオストリームを処理する場合でも、各モデルのアーキテクチャ上の特徴、パフォーマンス指標、最適なユースケースを理解することで、特定のデプロイ制約に応じたデータに基づく選択ができます。
モデルの系譜と技術的な詳細#
どちらのモデルも、オープンソースでの協業、堅牢なパフォーマンス、卓越した使いやすさに対するUltralyticsの取り組みを反映しており、世界中の機械学習コミュニティで高く支持されています。
YOLO11の詳細#
- 著者: Glenn Jocher、Jing Qiu
- 組織: Ultralytics
- 日付: 2024-09-27
- GitHub: ultralytics/ultralytics
- ドキュメント: YOLO11ドキュメント
YOLOv5の詳細#
- 著者: Glenn Jocher
- 組織: Ultralytics
- 日付: 2020-06-26
- GitHub: ultralytics/yolov5
- ドキュメント: YOLOv5のドキュメント
アーキテクチャの違い#
YOLOv5からYOLO11への進化では、精度とパラメーター効率を最適化するため、アーキテクチャにいくつかの大きな変更が加えられています。
YOLOv5はPyTorchエコシステムの先駆けとなり、高度に最適化されたCSPNet(クロスステージ部分ネットワーク)バックボーンとPANet(パス集約ネットワーク)ネックを導入しました。YOLOv5はアンカーベースの検出を採用しており、物体の境界を予測するには事前定義されたアンカーボックスが必要でした。非常に効果的である一方、カスタムのコンピュータービジョンデータセットに合わせてこれらのアンカーを調整する作業は煩雑になる場合がありました。
一方、YOLO11はより現代的なアンカーフリー検出方式へ移行しています。これによりアンカーボックスの手動調整が不要になり、トレーニングプロセスが簡素化され、COCOデータセットのような多様なデータセットに対する汎化性能が向上します。さらに、YOLO11は分離型ヘッドを備えており、分類タスクとバウンディングボックス回帰タスクを別々のブランチで処理します。この分離によって収束速度と平均適合率(mAP)が大幅に向上し、特に複雑な物体検出のシナリオで効果を発揮します。
パフォーマンス指標とベンチマーク#
以下の表では、モデルサイズごとの主要な指標を比較しています。Ultralyticsのモデルはメモリ要件の低さで知られており、一般にトレーニング中のCUDAメモリ消費量は、大規模なTransformerベースの代替モデルよりも少なく、導入に必要なハードウェアのハードルを大幅に下げます。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
ご覧のとおり、YOLO11は非常に優れたパフォーマンスのバランスを実現しており、同程度のパラメーター数のYOLOv5モデルと比べて、一貫して高いmAPスコアを達成します。
トレーニング手法と使いやすさ#
Ultralyticsの理念の中核にあるのは、十分に保守されたエコシステムと充実したコミュニティサポートに支えられた、優れた使いやすさです。
YOLOv5は従来、実行に堅牢なコマンドラインインターフェース(CLI)スクリプト(train.py、detect.py)を使用していました。強力である一方、これらのスクリプトをカスタムPythonアプリケーションに直接統合するには、多くの場合、回避策が必要でした。
YOLO11は、YOLOv8で導入されたシンプルなultralytics Pythonパッケージを基盤としています。この統合APIは、トレーニングからモデルのエクスポートまでを扱い、ONNX、OpenVINO、TensorRTなどのフォーマットにネイティブ対応しています。
完全なノーコード環境を求める開発者は、Ultralytics Platformを利用して、データのアノテーション、クラウドでのモデルのトレーニング、エッジデバイスへのシームレスなデプロイを行えます。
コードの比較#
現在、Ultralyticsモデルのトレーニングは非常に効率的です。ネイティブのPython APIを使ってYOLO11をトレーニングする方法を以下に示します。
from ultralytics import YOLO
# 事前トレーニング済みのYOLO11 smallモデルを読み込みます
model = YOLO("yolo11s.pt")
# カスタムデータでモデルをトレーニングする
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# デプロイ用にモデルをONNXにエクスポートする
model.export(format="onnx")YOLOv5を利用するレガシーシステムでは、CLIによるトレーニングは次のようになります。
# Clone the repository and run the training script
git clone https://github.com/ultralytics/yolov5
cd yolov5
pip install -r requirements.txt
python train.py --img 640 --batch 16 --epochs 50 --data coco128.yaml --weights yolov5s.pt最適なユースケースと実際の応用例#
どちらのモデルにも、それぞれ異なる運用環境に適した強みがあります。
YOLOv5を使用する場面#
新世代のモデルが登場した現在も、YOLOv5は優れた性能を発揮します。特に次のような場合におすすめです。
- レガシーシステムとの統合: YOLOv5固有のテンソル構造やデプロイパイプラインと深く統合されており、容易にリファクタリングできない環境。
- 学術研究のベースライン: 医用画像解析に関する再現性の高い学術研究で、確立され長期にわたって使われているベースラインを必要とする研究者。
YOLO11を使用する場面#
YOLO11は優れた汎用性を備えているため、最新の本番パイプラインに最適です。
- マルチタスク環境: 主に検出器として設計され(後にセグメンテーション機能が追加された)YOLOv5とは異なり、YOLO11はインスタンスセグメンテーション、画像分類、姿勢推定、回転バウンディングボックス(OBB)検出を標準でネイティブサポートしています。
- 高密度ビデオ分析: 複雑なシーンから最大限の精度を引き出すことが重要となる、スマート交通システムや小売在庫管理に最適です。
今後の展望: YOLO26アーキテクチャ#
YOLO11は優れた標準モデルですが、コンピュータービジョンの最先端技術は急速に進歩し続けています。最高水準の効率性を求める開発者は、最新のUltralytics YOLO26(2026年1月リリース)もぜひご検討ください。
YOLO26は大きな飛躍を遂げたモデルであり、エッジ最適化とエンタープライズ規模の両方を明確に見据えて設計されています。主な革新点は次のとおりです。
- エンドツーエンドのNMSフリー設計: YOLO26はネイティブのエンドツーエンド推論をサポートし、
nms=Falseによって非最大抑制(NMS)の後処理を省略することで、より高速でシンプルなデプロイを実現します。 - DFLの削除: モデルのエクスポートを簡素化し、低消費電力デバイスとの互換性を高めるため、Distribution Focal Lossが削除されました。
- MuSGDオプティマイザー: SGDとMuonを組み合わせた画期的なハイブリッドで、LLMトレーニングの安定性をコンピュータービジョンにもたらし、収束を高速化します。
- CPU推論を最大43%高速化: IoTへのデプロイや専用GPUを搭載しないデバイス向けに、大幅に最適化されています。
- ProgLoss + STAL: 小さな物体の認識を大幅に向上させる損失関数です。空中ドローン画像に不可欠な性能を高めます。
概要#
YOLO11とYOLOv5のどちらを選ぶかは、最終的にはプロジェクトのライフサイクルの段階によって決まります。YOLOv5の実績は疑う余地がなく、非常に高い安定性と大規模なコミュニティの支援を備えています。しかし、新しいプロジェクトには、旧世代よりもYOLO11を強くおすすめします。最先端の精度、非常に洗練されたPython API、トレーニング時のメモリ使用量の少なさを兼ね備え、AIイノベーションの最前線におけるUltralyticsの地位を確立しています。さらに限界に挑む場合は、Ultralytics Platformで最先端のYOLO26をお試しいただくことで、比類のない成果が得られます。