YOLOv5とYOLOv8#
スケーラブルで効率的なコンピュータービジョンアプリケーションを構築する際、適切なアーキテクチャの選択は重要です。Ultralyticsエコシステムは継続的に進化し、速度と精度の限界を押し広げ、実環境へのデプロイに役立つ堅牢なツールを開発者に提供してきました。この技術比較では、YOLOv5とYOLOv8の違いを掘り下げ、アーキテクチャ、性能上のトレードオフ、最適な用途を解説し、次のAIプロジェクトで適切な判断を下せるよう支援します。
どちらのモデルも、リアルタイム物体検出の歴史における重要な節目であり、Ultralyticsエコシステムの特徴であるメモリ要件の高度な最適化と使いやすさの恩恵を受けています。
YOLOv5:信頼される業界標準#
2020年に登場したYOLOv5は、高速で利用しやすく、信頼性の高い物体検出モデルとして、急速に業界標準となりました。ネイティブのPyTorch実装を活用し、世界中のエンジニアにとって学習からデプロイまでのライフサイクルを効率化しました。
- 著者: Glenn Jocher
- 組織: Ultralytics
- 日付: 2020-06-26
- GitHub: ultralytics/yolov5
- ドキュメント: YOLOv5のドキュメント
アーキテクチャの強み#
YOLOv5はアンカーベースの検出方式を採用しており、事前定義されたアンカーボックスを使って物体の境界を予測します。そのアーキテクチャにはCross-Stage Partial(CSP)ネットワークのバックボーンが組み込まれており、勾配フローを最適化し、計算の重複を削減します。その結果、メモリ使用量を非常に低く抑えられ、一般消費者向けのGPUでも特に高速に学習できます。
最適なユースケース#
最大スループットと最小限のリソース使用を重視するプロジェクトには、YOLOv5を強くお勧めします。エッジAI環境、たとえばRaspberry Piやモバイルデバイスへのデプロイで優れた性能を発揮します。成熟したモデルであるため、数千件の商用デプロイで十分に検証されており、従来型の物体検出ワークフローに比類のない安定性をもたらします。
YOLOv8:統合型ビジョンフレームワーク#
2023年1月にリリースされたYOLOv8は、専用の物体検出器から汎用性の高いマルチタスクビジョンフレームワークへと進化し、アーキテクチャを大きく転換しました。
- 著者: Glenn Jocher、Ayush Chaurasia、Jing Qiu
- 組織: Ultralytics
- 日付: 2023-01-10
- GitHub: ultralytics/ultralytics
- ドキュメント: YOLOv8のドキュメント
アーキテクチャの革新#
前の世代とは異なり、YOLOv8はアンカーフリーの検出ヘッドを導入しています。データセットの分布に基づいてアンカー設定を手動で調整する必要がなくなり、広く使われているCOCOデータセットなど、多様なカスタムデータセットに対する汎化性能が向上します。
アーキテクチャではバックボーンも強化され、従来のC3モジュールに代わって、C2fモジュール(2つの畳み込みを持つCross-Stage Partialボトルネック)が導入されました。この改良により、メモリへの負荷を大きく増やすことなく特徴表現が向上します。さらに、分類タスクと回帰タスクを分離する非連結ヘッドの実装により、モデル学習時の収束が大幅に改善します。
汎用性とPython API#
YOLOv8では、最新のultralytics Python APIが導入され、さまざまなコンピュータービジョンタスクでワークフローが標準化されました。画像セグメンテーション、画像分類、姿勢推定のいずれを実行する場合も、統一APIではわずかな設定変更だけで対応できます。
from ultralytics import YOLO
# 事前学習済みのYOLOv8モデルを読み込みます
model = YOLO("yolov8n.pt")
# 組み込みのメモリ効率を活用してカスタムデータセットで学習します
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 推論を実行し、結果を簡単に解析します
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()詳細なパフォーマンス比較#
2つの世代を比較すると、典型的なトレードオフが見られます。YOLOv8は全般的に平均適合率(mAP)が高い一方、YOLOv5は絶対的な推論速度と、最小サイズのモデルにおけるパラメーター数で優位性を保っています。
以下に、画像サイズ640ピクセルでCOCOデータセットを使用した場合の性能指標を詳しく比較します。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメーター (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.1 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
データからは、YOLOv8の精度が大幅に向上していることが分かります。たとえば、YOLOv8sは44.9 mAPを達成し、YOLOv5sの37.4 mAPを大きく上回ります。この大幅な向上により、物体が密集する環境や小さな物体の識別性能が大きく改善します。ただし、極めて制約の厳しい環境では、YOLOv5nが最小のパラメーター数とFLOPsを誇り、非常に高い効率を維持します。
どちらのモデルも、Transformerモデルのような大規模なアーキテクチャと比べ、学習時のCUDAメモリ使用量が少なくなるよう高度に最適化されています。そのため、標準的なGPUでより大きなバッチサイズを使用でき、研究サイクルを短縮できます。
エコシステムの強み#
YOLOv5またはYOLOv8を選ぶと、開発者は十分に整備されたUltralytics Platformを利用できます。この統合環境には、データセットのアノテーション、クラウド学習、モデルのモニタリングを行うシンプルなツールが備わっています。また、ultralyticsパッケージにはハイパーパラメーター調整機能が組み込まれています。活発な開発と強力なコミュニティサポートにより、問題をすばやく解決し、Weights & BiasesやClearMLなどの外部ツールと連携できます。
ほかのフレームワークでは習得に時間がかかる場合がありますが、Ultralyticsは効率化されたユーザー体験を重視し、多様な実環境へのデプロイに適した速度と精度のバランスを実現します。
v8の先へ:YOLO11とYOLO26を探る#
YOLOv8は高性能なフレームワークですが、人工知能の分野は急速に進化しています。最先端の性能に関心のある開発者は、v8を基盤に精度と速度を向上させたYOLO11もぜひご検討ください。
コンピュータービジョン技術の最先端を求める方には、Ultralytics YOLO26を強くおすすめします。2026年にリリースされたYOLO26は、大きな飛躍を遂げています。
- エンドツーエンドのNMSフリーデザイン:実験的なアーキテクチャで先駆けて導入されたYOLO26のオプションのone-to-oneヘッド(
nms=False)は、後処理の非極大値抑制を不要にし、デプロイパイプラインを大幅にシンプルかつ高速にします。 - MuSGDオプティマイザー:Kimi K2などのモデルで見られるLLMトレーニングの革新に着想を得たYOLO26は、より安定したトレーニングと迅速な収束を実現するハイブリッドオプティマイザーを採用しています。
- エッジコンピューティングに最適:前世代と比べてCPU推論が最大43%高速で、専用GPUを搭載しないデバイスに最適なモデルです。
- 精度の向上:新しいProgLoss + STAL損失関数により、小物体認識が大幅に向上します。これはロボティクスやドローンの空撮画像において重要です。
YOLOv5でレガシーシステムを維持する場合も、YOLOv8で汎用性の高いアプリケーションを拡張する場合も、YOLO26の最先端機能で革新を進める場合も、Ultralyticsの製品群は現代のビジョンAIで成功するために必要な包括的ツールを提供します。