Ultralytics YOLO27:

デプロイ#

Ultralytics Platformは、YOLOモデルを本番環境で運用するための包括的なモデルデプロイオプションを提供します。ブラウザベースの推論でモデルをテストし、世界42地域の専用エンドポイントにデプロイして、パフォーマンスをリアルタイムで監視できます。



Watch: Get Started with Ultralytics Platform - Deploy

概要#

デプロイセクションでは、次の操作を行えます。

  • Predictタブを使用して、ブラウザからモデルを直接テストします
  • 世界42地域の専用エンドポイントにデプロイします
  • モニター: 有料エンドポイントにおけるリクエストメトリクス、ログ、ヘルスチェック、および一時的な予測の監視
  • リソースの選択: デフォルトのエンドポイントはゼロにスケールダウンし、カスタムサイズでは稼働時間に応じた課金でウォームインスタンスが維持されます

概要カード付きUltralytics Platformデプロイページの世界地図

デプロイオプション#

Ultralytics Platformでは、複数のデプロイ方法を利用できます。

オプション説明適した用途
Predictタブ画像、Webカメラ、サンプルを使用したブラウザベースの推論開発、検証
共有推論3つのデータリージョンにまたがるマルチテナントサービス軽微な利用、テスト
専用エンドポイント42地域にまたがるシングルテナントサービス本番環境、低レイテンシ
エクスポートローカルまたはエッジランタイム向けに20形式の重みをダウンロードオフライン、オンデバイス

ワークフロー#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
ステージ説明
TestPredictタブでモデルを検証します
設定モデル、リージョン、CPU、メモリを選択し、料金とデプロイメント名を確認します
デプロイDeployタブから専用エンドポイントを作成します
モニタリングモニタリングでエンドポイントのメトリクスと一時的な予測を確認します

アーキテクチャ#

共有推論#

共有推論サービスは3つの主要リージョンで実行されます。モデルへのリクエストは、そのモデルのdata regionにあるサービスへルーティングされるため、結果はモデルが保存されているリージョン内に保持されます。

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
リージョンラベル場所適した用途
USアメリカ大陸アイオワ、米国アメリカ大陸のユーザー、アメリカ大陸向けに最速
EUヨーロッパ、中東、アフリカベルギー、ヨーロッパヨーロッパのユーザー、GDPR準拠
APアジア太平洋台湾、アジア太平洋アジア太平洋のユーザー、APAC内で最低レイテンシ

専用エンドポイント#

Ultralytics Cloudで世界42地域にデプロイできます。

  • 南北アメリカ: 14地域
  • ヨーロッパ: 13地域
  • アジア太平洋: 12地域
  • 中東・アフリカ: 3地域

各エンドポイントは、次の özellikを備えたシングルテナントサービスです。

  • CPUとメモリは設定可能であり、デプロイ前に料金が表示されます
  • デフォルトリソースの場合はゼロにスケールダウンし、カスタムリソースの場合は稼働時間課金のウォームインスタンスが維持されます
  • /docsに独自のインタラクティブAPIリファレンスを備えた一意のエンドポイントURL
  • 専用のAPIキー紐付け。そのキーでのみエンドポイントを呼び出せます
  • 独立した監視、ログ、ヘルスチェック

デプロイメントページ#

サイドバーのDeployからグローバルデプロイメントページにアクセスできます。このページには次の情報が表示されます。

  • デプロイ済みリージョンのピンを示す世界地図。リージョンをクリックするとNew Deploymentダイアログが開きます
  • 概要カード: HTTPリクエスト (24h)、アクティブデプロイメント、HTTPエラー率 (24h)、HTTP P95レイテンシ (24h)
  • デプロイメントリスト。カード、コンパクト、テーブルの3つの表示モードがあります
  • 完了済みの任意のモデルからエンドポイントを作成するNew Deploymentボタン
  • Refreshボタンと、ページヘッダーのUpdatedタイムスタンプ

概要カードとデプロイメントリストを含むUltralytics Platformデプロイページ

自動ポーリング

ページは自動的に更新され、デプロイメントが遷移状態(creatingdeploying、またはstopping)にある間は、より頻繁にポーリングします。詳細はMonitoringをご覧ください。

軽量で一時的なモニタリング

有料エンドポイントでは、サービングインスタンスのメモリ内のみに保持されるチャートやサンプル画像が提供されます。モデルの停止、再起動、再デプロイ、サイズ変更、または置き換えによって、このデータが消去される場合があります。データを保持するには、サンプルをデータセットに保存し、取り込みが完了するまでお待ちください。詳細はモニタリングを参照してください。

主な特徴#

グローバルカバレッジ#

42地域で次の地域をカバーしているため、ユーザーの近くにデプロイできます。

  • 北米、南米
  • ヨーロッパ、中東、アフリカ
  • アジア太平洋、オセアニア

スケーリング動作#

エンドポイントは現在、次のように動作します。

  • デフォルトリソース: アイドル状態のエンドポイントはゼロにスケールダウンし、次のリクエストでコールドスタートします
  • カスタムリソース: 1つのインスタンスがウォーム状態で維持され、停止されるまで稼働時間に応じた料金が発生します
  • 単一のアクティブインスタンス: 各エンドポイントは現在、すべてのプランで1つのインスタンスからサービスを提供します
  • 負荷遮断: エンドポイントが一時的に容量上限に達している場合、リクエストは429レスポンスを受け取ります — Direct Endpoint Requestsをご覧ください
  • リクエストタイムアウト: ダイレクトエンドポイントリクエストの最大継続時間は1時間です。サポートされている入力については推論を参照してください

リージョナルデプロイ#

測定されたリージョンレイテンシを使用して、呼び出し元の近くにエンドポイントを配置します。実際の推論レイテンシは、モデル、入力サイズ、エンドポイントの状態、ネットワーク経路によって異なります。

ヘルスチェック#

実行中の各デプロイメントには、次の機能を備えた自動ヘルスチェックが含まれます。

  • ライブステータスインジケーター(正常/異常)
  • レスポンスレイテンシの表示
  • 異常時の自動再試行。正常になると停止します
  • 手動更新ボタン

クイックスタート#

デプロイメントを作成します。

  1. プロジェクトにモデルをトレーニングまたはアップロードします
  2. モデルのDeployタブに移動します
  3. レイテンシテーブルのリージョンでデプロイをクリックします
  4. デプロイメントダイアログでCPU、メモリ、料金、名前を確認します
  5. デプロイメントの作成をクリックし、デプロイメントステータスが準備完了になるのを待ちます
クイックデプロイ
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

デプロイメント名はモデル名とリージョンの都市から生成され、デプロイ前に編集できます。デプロイ後は、APIキーを指定したエンドポイントURLを使用して、任意のアプリケーションから推論リクエストを送信できます。

クイックリンク#

  • Inference: ブラウザでモデルをテストします
  • Endpoints: 専用エンドポイントをデプロイします
  • 監視:デプロイのパフォーマンスを追跡します

FAQ#

  • 機能共有専用
    サービスPlatformユーザー間で共有1つのデプロイメント専用
    スケールPlatformが管理デフォルト: ゼロにスケールダウン; カスタム: ウォーム状態を維持
    リージョン3つのデータリージョン42のデプロイリージョンから選択
    URLPlatformモデルAPI生成されたデプロイメントエンドポイントURL
    テストモデルのPredictタブデプロイメントカードのPredictタブまたはAPI
    レート制限20リクエスト/分直接呼び出しにはPlatformのレート制限なし
    認証任意のワークスペースAPIキーデプロイメントに紐付けられたAPIキーのみ
  • サービスの起動中、デプロイメントは作成中またはデプロイ中の状態になります。ステータスが Ready に変わると使用可能になります。所要時間はモデルやリージョンによって異なり、通常は数分です。

  • はい。各モデルには、異なるリージョンに複数のエンドポイントを設定できます。デプロイメント数はプランによって制限されます:Free 3、Pro 10、Enterprise unlimited。クォータはモデルを所有するワークスペースに対して適用され、1つのエンドポイントが同時に提供できるモデルは正確に 1つ בלבדです。URLを変更せずに入れ替えるには、モデルの置き換えを使用してください。

  • デフォルトリソースのエンドポイントは、アイドル時にゼロにスケールダウンします:

    • 非アクティブ状態が続くとエンドポイントがスケールダウンします
    • 最初のリクエストでコールドスタートが発生します
    • 後続のリクエストは高速です

    アイドル期間後の最初のリクエストでコールドスタートが発生します。デプロイメントカードを開くとヘルスチェックが実行され、 エンドポイントがウォームアップされるため、その直後のテスト推論にはすばやく応答します。

    カスタムリソースのエンドポイントはウォーム状態を維持し、アイドル時間を含めて稼働時間に応じた料金が発生します。稼働時間の課金を停止するには、エンドポイントを停止してください。

コメント