YOLO Vision 2026:

デプロイ#

Ultralytics Platform は、YOLO モデルを本番環境に導入するための包括的な モデルデプロイオプション を提供します。ブラウザベースの推論でモデルをテストし、世界 42 か所のリージョンにある専用エンドポイントへデプロイし、パフォーマンスをリアルタイムでモニタリングできます。



Watch: Get Started with Ultralytics Platform - Deploy

概要#

デプロイセクションでは、以下のことができます。

  • Predict タブを使用してブラウザ上で直接モデルをテストします
  • 世界42のリージョンの専用エンドポイントへデプロイ
  • リクエストメトリクス、ログ、ヘルスチェックを監視する
  • アイドル時にゼロまでスケールさせる(デプロイメントは現在、単一のアクティブなインスタンスで実行されます)

Ultralytics Platform Deploy Page World Map With Overview Cards

デプロイオプション#

Ultralytics Platformは複数のデプロイパスを提供します。

オプション説明最適な用途
Predict タブ画像、ウェブカメラ、サンプルを使用したブラウザベースの推論開発、検証
共有推論3つのデータリージョンにまたがるマルチテナントサービス軽量な使用、テスト
専用エンドポイント42のリージョンにわたるシングルテナントサービス本番環境、低レイテンシ
Exportローカルまたはエッジランタイム向けに20種類のフォーマットで重みをダウンロードオフライン、オンデバイス

ワークフロー#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
ステージ説明
テストPredict タブ でモデルを検証します
設定リージョンを選択します。デプロイメント名はモデルと都市名から生成されます
デプロイDeploy タブ から専用エンドポイントを作成します
監視モニタリング でリクエスト、レイテンシ、エラー、およびログを追跡します

アーキテクチャ#

共有推論#

共有推論サービスは3つの主要リージョンで実行されます。モデルへのリクエストはそのモデルのデータリージョンにあるサービスにルーティングされるため、結果はモデルが保存されているリージョン内に留まります。

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
リージョンラベル場所最適な用途
USアメリカ大陸米国アイオワ州アメリカ大陸のユーザー向け、アメリカ大陸向けに最速
EUヨーロッパ、中東、アフリカヨーロッパ、ベルギーヨーロッパのユーザー向け、GDPRコンプライアンス対応
APアジア太平洋アジア太平洋、台湾アジア太平洋のユーザー向け、APACで最小のレイテンシ

専用エンドポイント#

Ultralytics Cloudを利用して世界42のリージョンへデプロイ:

  • 南北アメリカ: 14リージョン
  • 欧州: 13リージョン
  • アジア太平洋: 12リージョン
  • 中東およびアフリカ: 3リージョン

各エンドポイントは以下の特性を持つシングルテナントサービスです。

  • プラットフォーム管理によるサイズ調整(現在は設定不可)
  • アイドル時のゼロへのスケーリング
  • /docsに独自のインタラクティブなAPIリファレンスを持つ固有のエンドポイントURL
  • 独自のAPIキーバインディングを持ち、そのキーのみがエンドポイントを呼び出すことができます
  • 独立した監視、ログ、ヘルスチェック

デプロイメントページ#

サイドバーの Deploy からグローバルデプロイメントページにアクセスします。このページには以下が表示されます。

  • デプロイされたリージョンのピンが表示される世界地図。リージョンをクリックするとNew Deploymentダイアログが開きます
  • 概要カード:合計リクエスト数(24時間)、アクティブなデプロイメント数、エラー率(24時間)、P95レイテンシ(24時間)
  • デプロイメントリスト:カード、コンパクト、テーブルの3つの表示モード
  • **New Deployment(新規デプロイ)**ボタン:完了したモデルからエンドポイントを作成
  • ページヘッダーにあるRefreshボタンとUpdatedのタイムスタンプ

Ultralytics Platform Deploy Page Overview Cards And Deployments List

自動ポーリング

デプロイメントが移行状態(creatingdeploying、またはstopping)の間はより高頻度でポーリングを行い、ページが自動的に更新されます。詳細はMonitoringを参照してください。

主な特徴#

グローバルカバレッジ#

42のカバーリージョンでユーザーに近い場所へデプロイ:

  • 北米、南米
  • 欧州、中東、アフリカ
  • アジア太平洋、オセアニア

スケーリング動作#

エンドポイントは現在、以下の動作をします。

  • スケールトゥゼロ: アイドル状態のエンドポイントはゼロにスケールダウンし、次のリクエストでコールドスタートします
  • 単一アクティブインスタンス: 各エンドポイントは現在、すべてのプランで1つのインスタンスから提供されています
  • ロードシェディング: エンドポイントが一時的に容量オーバーになった場合、リクエストは429レスポンスを受け取ります。詳細はDirect Endpoint Requestsを参照してください
  • リクエストタイムアウト: 各リクエストは最大1時間実行可能であり、これはビデオ推論に十分な時間です

リージョン別デプロイメント#

測定されたリージョンのレイテンシを使用して、呼び出し元に近い位置にエンドポイントを配置します。実際の推論レイテンシは、モデル、入力サイズ、エンドポイントの状態、およびネットワークパスによって異なります。

ヘルスチェック#

実行中の各デプロイメントには、自動ヘルスチェックが含まれます。

  • ライブステータスインジケーター(正常/異常)
  • レスポンスレイテンシの表示
  • 異常時に自動再試行し、正常になり次第停止します
  • 手動更新ボタン

クイックスタート#

デプロイメントを作成します:

  1. プロジェクトにモデルをトレーニングまたはアップロードする
  2. モデルのDeployタブに移動する
  3. レイテンシテーブルからリージョンを選択する
  4. Deploy をクリックし、デプロイメントステータスが Ready になるまで待ちます
クイックデプロイ
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

デプロイメント名はモデル名とリージョンの都市名から生成されるため、命名のステップは不要です。デプロイ後、APIキー付きのエンドポイントURLを使用して、任意のアプリケーションから推論リクエストを送信できます。

クイックリンク#

  • 推論: ブラウザでモデルをテストする
  • エンドポイント: 専用エンドポイントをデプロイする
  • Monitoring:デプロイメントのパフォーマンスを追跡します

よくある質問 (FAQ)#

  • 機能共有専用
    サービスPlatform ユーザー間で共有されます1つのデプロイメント専用です
    スケールPlatform によって管理されますゼロへのスケール、1つのインスタンス
    リージョン3つのデータリージョン42のデプロイメントリージョンから選択します
    URLPlatform モデル API生成されたデプロイメントエンドポイント URL
    テストモデル Predict タブデプロイメントカードの Predict タブまたは API
    レート制限20リクエスト/分直接呼び出しに対するプラットフォームのレート制限はありません
    認証任意のワークスペースAPIキーデプロイメントに紐付けられたAPIキーのみ
  • サービスの起動中、デプロイメントは作成中またはデプロイ中の状態を維持します。ステータスがReadyに変わると使用可能になります。所要時間はモデルやリージョンによって異なりますが、通常は数分かかります。

  • はい、各モデルは異なるリージョンに複数のエンドポイントを持つことができます。デプロイメント数はプランによって制限されます:Free 3、Pro 10、Enterprise unlimited。クォータはモデルを所有するワークスペースに課金され、1つのエンドポイントは一度に正確に1つのモデルを提供します。URLを変更せずに切り替えるには、モデルの置き換えを使用してください。

  • スケール・トゥ・ゼロ(scale-to-zero)が有効な場合:

    • 非アクティブになるとエンドポイントはスケールダウンします
    • 最初のリクエストでコールドスタートがトリガーされます
    • その後のリクエストは高速です

    アイドル期間の後の最初のリクエストはコールドスタートを引き起こします。デプロイメントカードを開くとエンドポイントをウォームアップするヘルスチェックが実行されるため、その直後のテスト予測は迅速に応答します。

コメント