Ultralytics YOLO27:
Get Started

部署#

Ultralytics Platform 提供全面的模型部署选项,帮助你将 YOLO 模型投入生产。通过浏览器推理测试模型,将模型部署到覆盖全球 42 个区域的专用端点,并实时监控性能。



观看: 开始使用 Ultralytics Platform - 部署

概述#

部署部分可帮助你:

  • 在浏览器中直接通过 Predict 选项卡测试模型
  • 将模型部署到覆盖全球 42 个区域的专用端点
  • 监控每个专用端点的请求指标、日志、运行状况检查和临时预测
  • 选择资源:默认端点会缩容至零;自定义规格会保留一个热实例,并按运行时长计费

Ultralytics Platform 部署选项卡中的世界地图和概览卡片

部署选项#

Ultralytics Platform 提供多种部署方式:

选项说明适用场景
Predict 选项卡图像、网络摄像头、示例;仅限自有端点上的 IP 摄像头开发、验证
共享推理覆盖 3 个数据区域的多租户服务轻量使用、测试
专用端点覆盖 42 个区域的单租户服务生产环境、低延迟
导出下载 22 种格式的权重,以便在本地或边缘运行时中使用离线、设备端

工作流#

阶段说明
测试集使用 Predict 选项卡验证模型
配置选择模型、区域、CPU 和内存;查看价格和部署名称
部署通过 Deploy 选项卡创建专用端点
监控在监控中查看端点指标和临时预测

架构#

共享推理#

共享推理服务运行在 3 个关键区域。发往某个模型的请求会路由到该模型数据区域中的服务,因此结果会保留在模型存储所在的区域内:

区域标签位置适用场景
美国美洲美国爱荷华州美洲用户;为美洲用户提供最快速度
欧盟欧洲、中东和非洲欧洲比利时欧洲用户;符合 GDPR 要求
亚太亚太地区亚太地区台湾亚太地区用户;提供最低的亚太地区延迟

专用端点#

在 Ultralytics Cloud 上部署到全球 42 个区域:

  • 美洲:14 个区域
  • 欧洲:13 个区域
  • 亚太地区:12 个区域
  • 中东和非洲:3 个区域

每个端点都是单租户服务,具有以下特性:

  • 可配置 CPU 和内存,并在部署前显示价格
  • 默认资源可缩容至零;自定义资源会保留一个热实例,并按运行时长计费
  • 唯一的端点 URL,并在 /docs 提供专属交互式 API 参考
  • 绑定独立的 API 密钥,因此只有该密钥才能调用此端点
  • 独立的监控、日志和运行状况检查

部署选项卡#

你所有的部署都列在个人资料的 Deployments 选项卡(/{username}?tab=deployments)中,位于 Datasets 和 Projects 旁边。侧边栏中的 Deployments 部分列出你的部署,每项都链接到相应的部署页面;其中有一个 + 按钮用于创建部署,还有一个链接可打开完整选项卡。此选项卡显示:

  • 显示已部署区域标记的世界地图;点击某个区域可打开 New Deployment 对话框
  • 概览卡片:活跃部署数、HTTP 请求数(24 小时)、HTTP 错误率(24 小时)、HTTP P95 延迟(24 小时)
  • 部署列表支持搜索、排序和三种视图模式:卡片、紧凑视图和表格;每个部署都链接到自己的页面,其中包含 Overview、Monitoring、Predict 和 Logs 选项卡
  • New Deployment 按钮,可从任何已完成的模型创建端点

Ultralytics Platform 部署选项卡中的概览卡片和部署列表

自动轮询

选项卡会自动刷新;部署状态发生变化时(creating、deploying 或 stopping),刷新频率会提高。详情请参阅监控。

轻量级临时监控

每个就绪的专用端点都会提供图表和示例图像,这些数据仅保存在服务实例的内存中。停止、重启、重新部署、调整规格或更换模型都可能清除这些数据。将示例保存到数据集并等待摄取完成,即可保留这些数据。请参阅监控。

主要功能#

全球覆盖#

在靠近用户的区域部署,覆盖以下地区的 42 个区域:

  • 北美、南美
  • 欧洲、中东、非洲
  • 亚太地区、大洋洲

扩缩容行为#

端点目前的运行方式如下:

  • 默认资源:空闲端点会缩容至零,并在收到下一个请求时冷启动
  • 自定义资源:一个实例会保持热状态并持续产生运行时长费用,直到停止为止
  • 单个活跃实例:目前所有套餐中的每个端点都由一个实例提供服务
  • 负载削减:当端点暂时达到容量上限时,请求会收到 429 响应 — 请参阅直接请求端点
  • 请求超时:直接请求端点的最长持续时间为 1 小时;支持的输入请参阅推理

区域部署#

根据测得的区域延迟,将端点部署在靠近调用方的位置。实际推理延迟取决于模型、输入大小、端点状态和网络路径。

运行状况检查#

每个运行中的部署都会自动进行运行状况检查,包括:

  • 实时状态指示器(健康/不健康)
  • 响应延迟显示
  • 状态不健康时自动重试,状态恢复健康后停止
  • 手动重新 Ping 按钮

快速入门#

创建部署:

  1. 在项目中训练或上传模型
  2. 转到模型的 部署 标签页
  3. 在延迟表中,点击某个区域对应的 部署
  4. 在部署对话框中检查 CPU、内存、价格和名称
  5. 点击 创建部署,并等待部署状态变为 就绪
快速部署
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

部署名称根据模型名称和区域所在城市生成,你可以在部署前编辑该名称。部署完成后,使用端点 URL 和 API 密钥,从任意应用发送推理请求。

  • 推理:在浏览器中测试模型
  • 端点:部署专用端点
  • 监控:跟踪部署性能

常见问题#

  • 特性共享专用
    服务由 Platform 用户共享专用于单个部署
    扩缩容由 Platform 管理默认:缩至零;自定义:保持预热
    区域3 个数据区域可从 42 个部署区域中选择
    URLPlatform 模型 API生成的部署端点 URL
    测试模型 Predict 标签页部署页面的 Predict 标签页或 API
    速率限制每分钟 20 个请求直接调用不受 Platform 速率限制
    身份验证任意工作区 API 密钥仅限绑定到该部署的 API 密钥
  • 服务启动期间,部署状态会保持为创建中或部署中。状态变为 就绪 后即可使用;所需时间因模型和区域而异,通常需要几分钟。

  • 可以,每个模型都可以在不同区域拥有多个端点。部署数量受套餐限制:免费版 3、专业版 10、企业版 unlimited。配额计入拥有该模型的工作区;一个端点一次只能提供一个模型的服务——使用模型替换即可更换模型,而无需更改 URL。

  • 使用默认资源的端点在空闲时会缩至零:

    • 端点在一段时间无活动后缩容
    • 首次请求会触发冷启动
    • 后续请求速度很快

    空闲一段时间后收到的首次请求会触发冷启动。打开部署页面会运行健康检查并预热端点,因此页面响应后立即进行测试预测,速度会很快。

    使用自定义资源的端点会保持预热,并按运行时长计费,包括空闲时间。停止端点即可停止计收运行时长费用。

评论