YOLO Vision 2026:

部署#

Ultralytics Platform 提供全面的模型部署选项,用于将你的 YOLO 模型投入生产。你可以使用基于浏览器的推理测试模型,将模型部署到全球 42 个区域的专用端点,并实时监控性能。



Watch: Get Started with Ultralytics Platform - Deploy

概述#

Deployment 部分可以帮助你:

  • 测试模型:直接在浏览器中使用 Predict 选项卡
  • 部署到全球 42 个区域的专用端点
  • 监控请求指标、日志和运行状况检查
  • 缩容至零:空闲时缩容至零(当前部署运行单个活动实例)

Ultralytics Platform 部署页面世界地图和概览卡片

部署选项#

Ultralytics Platform 提供多种部署方式:

选项描述最适用场景
Predict 选项卡基于浏览器的推理,支持图像、摄像头和示例开发、验证
共享推理跨 3 个数据区域的多租户服务轻量使用、测试
专用端点跨 42 个区域的单租户服务生产环境、低延迟
导出下载 20 种格式的权重,用于本地或边缘运行时离线、设备端运行

工作流#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
阶段描述
Test使用Predict 选项卡验证模型
配置选择一个区域;部署名称将根据模型和城市生成
部署Deploy 选项卡创建专用端点
监控监控中跟踪请求、延迟、错误和日志

架构#

共享推理#

共享推理服务运行在 3 个关键区域。对模型的请求会路由到该模型所在数据区域的服务,因此结果会保留在模型存储所在的区域内:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
区域标签位置最适用场景
US美洲美国爱荷华州美洲用户,美洲地区速度最快
EU欧洲、中东和非洲欧洲比利时欧洲用户,符合 GDPR
AP亚太地区亚洲台灣亚太地区用户,APAC 延迟最低

专用端点#

在 Ultralytics Cloud 上部署到全球 42 个区域:

  • 美洲:14 个区域
  • 欧洲:13 个区域
  • 亚太地区:12 个区域
  • 中东和非洲:3 个区域

每个端点都是单租户服务,具有以下特性:

  • 由平台管理的规格(目前不可配置)
  • 空闲时缩容至零
  • 唯一的端点 URL,并在 /docs 提供专属交互式 API 参考
  • 独立的 API 密钥绑定,只有该密钥可以调用端点
  • 独立的监控、日志和运行状况检查

部署页面#

从侧边栏的 Deploy 进入全局部署页面。此页面显示:

  • 世界地图:显示已部署区域的标记;点击区域可打开 New Deployment 对话框
  • 概览卡片:总请求数(24 小时)、活动部署数、错误率(24 小时)、P95 延迟(24 小时)
  • 部署列表:提供卡片、紧凑和表格三种视图模式
  • 用于从任何已完成模型创建端点的新建部署按钮
  • 刷新按钮,以及页面标题中的 Updated 时间戳

Ultralytics Platform 部署页面概览卡片和部署列表

自动轮询

页面会自动刷新;当部署处于过渡状态(creatingdeployingstopping)时,轮询频率会提高。详情请参阅监控

主要特性#

全球覆盖#

在靠近用户的位置部署,覆盖以下 42 个区域:

  • 北美、南美
  • 欧洲、中东、非洲
  • 亚太地区、大洋洲

扩缩容行为#

端点当前的行为如下:

  • 缩容至零:空闲端点会缩容至零,并在下一次请求时冷启动
  • 单个活动实例:每个端点当前在所有套餐中都由一个实例提供服务
  • 负载丢弃:当端点暂时达到容量上限时,请求会收到 429 响应——请参阅直接端点请求
  • 请求超时:每个请求最长可运行 1 小时,足以支持视频推理

区域部署#

使用测得的区域延迟,将端点部署在靠近调用方的位置。实际推理延迟取决于模型、 输入大小、端点状态和网络路径。

运行状况检查#

每个运行中的部署都包含自动运行状况检查,具体包括:

  • 实时状态指示器(正常/异常)
  • 响应延迟显示
  • 异常时自动重试,恢复正常后停止
  • 手动刷新按钮

快速开始#

创建部署:

  1. 在项目中训练或上传模型
  2. 转到模型的 Deploy 选项卡
  3. 从延迟表中选择一个区域
  4. 点击 Deploy,等待部署状态变为 Ready
快速部署
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

部署名称根据模型名称和区域城市生成,因此无需命名步骤。部署完成后,使用端点 URL 和 API 密钥,即可从任何应用发送推理请求。

快速链接#

  • 推理:在浏览器中测试模型
  • 端点:部署专用端点
  • 监控:跟踪部署性能

常见问题#

  • 特性共享专用
    服务由 Platform 用户共享专用于一个部署
    扩缩容由 Platform 管理缩容至零、单个实例
    区域3 个数据区域从 42 个部署区域中选择
    URLPlatform 模型 API生成的部署端点 URL
    测试模型 Predict 选项卡部署卡片中的 Predict 选项卡或 API
    速率限制每分钟 20 个请求直接调用不受 Platform 速率限制
    身份验证任意工作区 API 密钥仅限绑定到部署的 API 密钥
  • 服务启动期间,部署会保持在创建或部署状态。状态变为 Ready 后即可使用;所需时间因模型和区域而异,通常需要几分钟。

  • 可以,每个模型都可以在不同区域拥有多个端点。部署数量受套餐限制:免费版 3、专业版 10、企业版 unlimited。配额计入拥有该模型的工作区,并且一个端点一次只能提供 一个模型的服务——使用模型替换即可在不更改 URL 的情况下进行切换。

  • 启用缩容至零后:

    • 端点在一段时间无活动后缩容
    • 首次请求会触发冷启动
    • 后续请求响应快速

    空闲一段时间后,首次请求会触发冷启动。打开部署卡片会运行健康检查,使端点预热, 因此紧接着执行测试预测时会快速响应。

评论