Ultralytics YOLO27:
Get Started

YOLOv5とYOLO11#

新しいプロジェクトに適したコンピュータビジョンアーキテクチャを選ぶ際は、最先端モデルの進化を理解することが重要です。旧世代のアーキテクチャから最新の統合フレームワークへの発展は、アルゴリズムの効率と開発者の使いやすさの両面で大きな進歩を示しています。このガイドでは、Ultralyticsが開発した2つの画期的なモデル、先駆的なYOLOv5と大きく洗練されたYOLO11を技術的に詳しく比較します。

モデルの概要#

これら2つのアーキテクチャはいずれもリアルタイム物体検出の分野における重要な節目であり、デプロイ環境や既存システムの要件に応じて、それぞれ異なる利点があります。

YOLOv5:業界を支える主力モデル#

2020年夏にリリースされたYOLOv5は、ネイティブのPyTorch実装によって学習とデプロイの参入障壁を大幅に下げ、すぐに業界標準となりました。前世代の複雑なDarknet Cフレームワークから脱却し、Pythonらしいモデル構築手法を提供しました。

YOLOv5は使いやすさの強固なベースラインを築き、高度なモザイクデータ拡張や自動アンカー設定など、強力な学習手法を導入しました。十分に文書化され、広範なテストを経たコードベースを基盤にする研究者の間で、今も非常に人気があります。

YOLO11:統合型ビジョンフレームワーク#

長年にわたるフィードバックとアーキテクチャ研究を基に、YOLO11は複数のビジョンタスクにネイティブに対応する統合フレームワークの一部として登場しました。バウンディングボックスにとどまらず、汎用性と効率を最大限に高めることを目指して一から設計されています。

YOLO11は、ultralytics Pythonパッケージを通じて、洗練されたユーザーエクスペリエンスを提供します。シンプルなAPIで、物体検出、インスタンスセグメンテーション、分類、姿勢推定、方向付きバウンディングボックス(OBB)を統合します。速度と精度のバランスに優れているため、さまざまな実環境のデプロイシナリオに適しています。

統合プラットフォーム

どちらのモデルも、十分にメンテナンスされたUltralytics Platformのエコシステムを活用できます。この統合環境により、さまざまなハードウェア向けのデータセットアノテーション、クラウド学習、モデルエクスポートが簡素化されます。

パフォーマンスと指標の比較#

モデルを直接比較することで、アーキテクチャの改良が具体的なパフォーマンス向上にどのようにつながるかがわかります。以下の表では、COCOデータセットで評価した平均適合率(mAP)に加え、CPUとGPUの推論速度、パラメーター数を示します。

モデルサイズ
(ピクセル)
mAPval
50-95
速度
CPU ONNX
(ms)
速度
T4 TensorRT10
(ms)
パラメーター
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.6
YOLO11m64051.5183.24.720.168.1
YOLO11l64053.4238.66.225.387.2
YOLO11x64054.7462.811.356.9195.3

結果の分析#

指標からは、YOLO11が実現するパフォーマンスバランスの明確な向上がわかります。たとえば、YOLO11n(nano)モデルは39.5% mAPを達成し、YOLOv5nの28.0%を11.5ポイント上回ります。追加パラメーターはわずか0.7Mです。さらにYOLO11は、Transformerベースの大規模モデルと比較して学習時のメモリ要件が大幅に低く、一般向けハードウェアやエッジデバイスへのデプロイにも適しています。

アーキテクチャの違い#

YOLO11のパフォーマンス向上は、いくつかの主要なアーキテクチャの進化によるものです。YOLOv5がC3モジュールを備えた標準的なCSPNetバックボーンを使用していたのに対し、新しいUltralyticsモデルでは、勾配の流れを最適化し計算オーバーヘッドを削減するC2f(YOLOv8)やC3k2(YOLO11)など、より効率的な特徴抽出ブロックが導入されました。

YOLO11ではヘッドも大きく改良されています。従来のアンカーベース設計から脱却し、新しいUltralyticsアーキテクチャはアンカーフリー方式を採用しています。これによりボックス予測の数が減り、後処理パイプラインが簡素化され、さまざまなスケールやアスペクト比に対するモデルの汎化性能が向上します。さらに、これらのモデルは優れた学習効率を備え、ファインチューニングするデータセットの収束を速める事前学習済み重みもすぐに利用できます。

実装とコード例#

Ultralyticsエコシステムの際立った特長の一つは、そのシンプルさです。YOLOv5は高速な推論にtorch.hubを使う手法を普及させましたが、YOLO11では統合されたultralytics Pythonパッケージによって、さらに使いやすくなっています。

YOLO11での学習#

モデルの読み込み、学習、検証に必要な定型コードは最小限です。APIがハイパーパラメーターの調整とモデル管理をシームレスに処理します。

from ultralytics import YOLO

# 事前学習済みYOLO11モデルを読み込みます
model = YOLO("yolo11s.pt")

# カスタムデータセットで50エポック学習します
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# 高速な推論を実行し、結果を表示します
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()

# ハードウェアアクセラレーションのため、モデルを簡単にTensorRTへエクスポートできます
model.export(format="engine")

YOLOv5を使った従来型の推論#

古いパイプラインを保守している場合、YOLOv5はPyTorchのネイティブな読み込み機構と直接統合されているため、既存の推論スクリプトに簡単に組み込めます。

import torch

# PyTorch Hubからカスタムまたは事前学習済みのYOLOv5モデルを読み込みます
model = torch.hub.load("ultralytics/yolov5", "yolov5s")

# 画像URLに対して推論を実行します
results = model("https://ultralytics.com/images/zidane.jpg")

# 予測の詳細をコンソールに出力します
results.print()
デプロイの柔軟性

どちらのモデルも幅広いエクスポート形式に対応しています。TensorRTを使用するNVIDIA Jetsonをターゲットにする場合も、CoreMLを使用するiOSアプリケーションをターゲットにする場合も、デプロイ手順が十分に文書化され、コミュニティによるサポートも受けられます。

最適なユースケース#

どちらのモデルを選ぶかは、プロジェクトのライフサイクル段階と個別の要件によって大きく異なります。

YOLOv5を選ぶ場合#

  • 既存コードベースの保守:本番環境がYOLOv5リポジトリの構造や特定のハイパーパラメーター進化手法に大きくカスタマイズされている場合です。
  • 学術的ベースライン:2020~2022年に確立されたコンピュータビジョンの標準と直接比較するベンチマークが必要な研究を発表する場合です。

YOLO11を選ぶ場合#

  • マルチタスクプロジェクト:単一の統合APIを使って、姿勢推定やインスタンスセグメンテーションなど、複数のタスクを組み合わせる必要がある場合です。
  • エッジデプロイ:限られた計算予算(FLOPs)でmAPを最大化することが重要なエッジコンピューティングのシナリオです。
  • 商用AIソリューション:Ultralytics Platformの堅牢なサポートを活用する、小売業やセキュリティ分野のエンタープライズアプリケーションに最適です。

次世代モデル:Ultralytics YOLO26#

YOLO11は速度と精度の優れたバランスを実現していますが、人工知能の分野は急速に進化しています。現在新しいプロジェクトを始める開発者には、ビジョンAIの最新標準であるUltralytics YOLO26をぜひご検討いただくことをおすすめします。

2026年1月にリリースされたYOLO26は、最新のデプロイ要件に特化した、パラダイムを変える進歩をもたらします。

  • エンドツーエンドのNMSフリー設計:YOLOv10で初めて導入されたコンセプトを基に、YOLO26はネイティブにエンドツーエンド化されています。オプションのワンツーワンヘッド(nms=False)によって非極大値抑制(NMS)の後処理が不要になり、デプロイパイプラインが大幅に簡素化され、レイテンシーが低減します。
  • MuSGDオプティマイザー:Moonshot AIのKimi K2などのモデルによるLLM学習の革新に着想を得た、SGDとMuonのハイブリッド型です。非常に安定した学習と大幅に高速な収束を実現します。
  • CPU速度の飛躍的な向上:分布焦点損失(DFL)を削除することで、YOLO26はCPU推論を最大43%高速化します。専用GPUのないエッジデバイスや環境に最適です。
  • 高度な損失関数:ProgLossとSTALを組み合わせることで、小さな物体の認識が大きく向上します。これはドローン解析、IoT、ロボット工学で重要です。
  • タスク固有の拡張:姿勢推定向けの残差対数尤度推定(RLE)や、方向付きバウンディングボックス向けの専用角度損失など、特化した最適化を導入し、あらゆるコンピュータビジョンタスクで優れたパフォーマンスを実現します。

標準的な物体検出以外の専門的なアーキテクチャに関心がある場合は、Transformerベースの検出向けのRT-DETRや、オープンボキャブラリーの追跡・検出向けのYOLO-Worldなどのモデルもご検討ください。十分にメンテナンスされ、高度に最適化されたこれらのツールを活用することで、コンピュータビジョンのパイプラインを効率的かつスケーラブルに保ち、常に最新の状態にできます。

コントリビューター

コメント