YOLO11とYOLOv5の比較#
適切なニューラルネットワークアーキテクチャの選択は、あらゆるcomputer visionの取り組みにおいて極めて重要な決定です。artificial intelligenceの動向が進化するにつれて、開発者や研究者が利用できるツールも進化しています。この包括的なガイドでは、Ultralyticsエコシステムにおける2つの画期的なモデル、広く称賛されているYOLOv5と高度なYOLO11の間で、詳細な技術的比較を提供します。
edge AIアプリケーション向けに軽量モデルをデプロイする場合でも、クラウドGPU上で高解像度のビデオストリームを処理する場合でも、これらのモデルのアーキテクチャのニュアンス、performance metrics、および理想的なユースケースを理解することで、特定のデプロイ制約に対してデータ駆動型の選択を行うことができます。
モデルの系譜と技術詳細#
両モデルとも、オープンソースのコラボレーション、堅牢なパフォーマンス、そして比類のない使いやすさに対するUltralyticsのコミットメントを反映しており、世界中の機械学習コミュニティから高く支持されています。
YOLO11の詳細#
- 作成者:Glenn JocherおよびJing Qiu
- 組織: Ultralytics
- 日付:2024年9月27日
- GitHub: ultralytics/ultralytics
- Docs: YOLO11 Documentation
YOLOv5の詳細#
- 作成者:Glenn Jocher
- 組織: Ultralytics
- 日付:2020年6月26日
- GitHub: ultralytics/yolov5
- Docs: YOLOv5 Documentation
アーキテクチャの違い#
YOLOv5からYOLO11への進化は、精度とパラメータ効率を最適化するために設計された、いくつかの重要なアーキテクチャの移行をもたらしました。
YOLOv5は、PyTorchエコシステムにおいて先駆者であり、高度に最適化されたCSPNet(Cross Stage Partial Network)バックボーンとPANet(Path Aggregation Network)ネックを導入しました。これはアンカーベースの検出に依存しており、オブジェクトの境界を予測するために事前定義されたanchor boxesを必要としていました。非常に効果的である一方で、カスタムのcomputer vision datasetsに合わせてこれらのアンカーをチューニングするのは煩雑になることがありました。
対照的に、YOLO11はよりモダンなアンカーフリーの検出パラダイムに移行しています。これにより手動でのアンカーボックスのチューニングが不要になり、トレーニングプロセスが効率化され、COCO datasetのような多様なデータセット全体での汎化性能が向上します。さらに、YOLO11はデカップルドヘッドを備えており、分類とバウンディングボックスの回帰タスクが別々のブランチで処理されます。この分離により、特に複雑なobject detectionのシナリオにおいて、収束速度とmean Average Precision (mAP)が大幅に向上します。
パフォーマンス指標とベンチマーク#
下の表は、さまざまなモデルサイズにおける主要な指標を比較しています。Ultralyticsのモデルはメモリ要件が低いことで有名であり、通常、重いTransformerベースの代替モデルと比較してトレーニング中のCUDAメモリ消費量が少なく、ハードウェア参入障壁を大幅に引き下げています。
| モデル | サイズ (ピクセル) | mAPval 50-95 | 速度 CPU ONNX (ms) | 速度 T4 TensorRT10 (ms) | パラメータ (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
観察されるように、YOLO11は非常に好ましいパフォーマンスバランスを達成しており、YOLOv5と同等のパラメータ数で一貫して高いmAPスコアを提供しています。
トレーニング手法と使いやすさ#
Ultralyticsの哲学の核心は、手厚く管理されたエコシステムと広範なコミュニティサポートに支えられた、極めて高い使いやすさです。
YOLOv5はこれまで、実行のために堅牢なコマンドラインインターフェイス(CLI)スクリプト(train.py、detect.py)に依存していました。強力ではあるものの、これらのスクリプトをカスタムのPythonアプリケーションに直接統合するには、多くの場合回避策が必要でした。
YOLO11は、合理化された ultralytics Pythonパッケージを導入することで、これに革命をもたらしました。この統一されたAPIは、トレーニングからONNX、OpenVINO、TensorRTのようなモデルのエクスポートフォーマットへの処理までをネイティブにすべて処理します。
完全にコード不要の体験のために、開発者はUltralytics Platformを利用して、データの注釈付け、クラウドでのモデルのトレーニング、およびエッジデバイスへのシームレスなデプロイを行うことができます。
コード比較#
今日のUltralyticsモデルのトレーニングは非常に効率的です。以下は、ネイティブのPython APIを使用してYOLO11をトレーニングする方法です。
from ultralytics import YOLO
# Load a pretrained YOLO11 small model
model = YOLO("yolo11s.pt")
# Train the model on custom data
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Export the model to ONNX for deployment
model.export(format="onnx")YOLOv5を利用するレガシーシステムの場合、CLIによるトレーニングは次のようになります。
# Clone the repository and run the training script
git clone https://github.com/ultralytics/yolov5
cd yolov5
pip install -r requirements.txt
python train.py --img 640 --batch 16 --epochs 50 --data coco128.yaml --weights yolov5s.pt理想的なユースケースと実世界のアプリケーション#
両モデルとも、異なる運用環境に合わせて調整された独自の強みを持っています。
YOLOv5を利用する場合#
新世代のモデルが登場しても、YOLOv5は依然として強力です。以下のような場合に推奨されます。
- レガシーシステムの統合: YOLOv5特有のテンソル構造や、簡単にはリファクタリングできない展開パイプラインと深く統合された環境。
- 学術的ベースライン: medical image analysisにおける再現可能な学術研究のために、確立された長年のベースラインを必要とする研究者。
YOLO11を利用する場合#
YOLO11は、その驚異的な汎用性により、現代のプロダクションパイプラインにおいて理想的な選択肢となります。
- マルチタスク環境: 主に検出器であるYOLOv5(後に追加されたセグメンテーション機能を除く)とは異なり、YOLO11はinstance segmentation、image classification、pose estimation、およびOriented Bounding Box (OBB)の検出をデフォルトでネイティブにサポートしています。
- 高密度ビデオアナリティクス: 複雑なシーンから最大の精度を引き出すことが不可欠である、インテリジェント交通システムやretail inventory managementに最適です。
未来に向けて:YOLO26アーキテクチャ#
YOLO11は卓越した標準として立っていますが、コンピュータビジョンのフロンティアは急速に前進し続けています。効率性の絶対的な頂点を求める開発者は、最新のUltralytics YOLO26(2026年1月リリース)も検討する必要があります。
YOLO26は大きな飛躍を遂げており、エッジの最適化とエンタープライズ規模の両方に向けて明示的に設計されています。主な革新点は以下の通りです。
- エンドツーエンドのNMSフリー設計: YOLO26はネイティブでエンドツーエンドであり、より高速でシンプルなデプロイのためにNon-Maximum Suppression (NMS)の後処理を排除しています。
- DFLの削除: Distribution Focal Lossが削除され、モデル出力の簡素化と低電力デバイスでの互換性が強化されました。
- MuSGDオプティマイザ: SGDとMuonの画期的なハイブリッドであり、LLMのトレーニング安定性をコンピュータビジョンにもたらし、収束を高速化します。
- 最大43%高速なCPU推論: IoTデプロイや、専用のGPUsを持たないデバイス向けに大幅に最適化されています。
- ProgLoss + STAL: 小さなオブジェクトの認識において著しい改善をもたらす損失関数。航空ドローンの画像において非常に重要です。
要約#
YOLO11とYOLOv5のどちらを選択するかは、最終的にプロジェクトのライフサイクルの段階によって異なります。YOLOv5のレガシーは否定できず、極めて高い安定性と大規模なコミュニティのサポートを提供します。しかし、新しいプロジェクトでは、古い世代よりもYOLO11が強く推奨されます。最先端の精度、非常に洗練されたPython API、およびより低いトレーニングメモリのオーバーヘッドを兼ね備えており、AIイノベーションの最前線におけるUltralyticsの位置を固めています。さらに限界を押し広げようとする人にとって、Ultralytics Platform上で最先端のYOLO26を探索することは、比類のない結果をもたらします。