部署#
Ultralytics Platform 提供全面的模型部署选项,用于将你的 YOLO 模型投入生产。你可以使用基于浏览器的推理测试模型,将模型部署到全球 42 个区域的专用端点,并实时监控性能。
Watch: Get Started with Ultralytics Platform - Deploy
概述#
Deployment 部分可以帮助你:
- 测试模型:直接在浏览器中使用
Predict选项卡 - 部署到全球 42 个区域的专用端点
- 监控请求指标、日志和运行状况检查
- 缩容至零:空闲时缩容至零(当前部署运行单个活动实例)

部署选项#
Ultralytics Platform 提供多种部署方式:
| 选项 | 描述 | 最适用场景 |
|---|---|---|
| Predict 选项卡 | 基于浏览器的推理,支持图像、摄像头和示例 | 开发、验证 |
| 共享推理 | 跨 3 个数据区域的多租户服务 | 轻量使用、测试 |
| 专用端点 | 跨 42 个区域的单租户服务 | 生产环境、低延迟 |
| 导出 | 下载 20 种格式的权重,用于本地或边缘运行时 | 离线、设备端运行 |
工作流#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 阶段 | 描述 |
|---|---|
| Test | 使用Predict 选项卡验证模型 |
| 配置 | 选择一个区域;部署名称将根据模型和城市生成 |
| 部署 | 从Deploy 选项卡创建专用端点 |
| 监控 | 在监控中跟踪请求、延迟、错误和日志 |
架构#
共享推理#
共享推理服务运行在 3 个关键区域。对模型的请求会路由到该模型所在数据区域的服务,因此结果会保留在模型存储所在的区域内:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| 区域 | 标签 | 位置 | 最适用场景 |
|---|---|---|---|
| US | 美洲 | 美国爱荷华州 | 美洲用户,美洲地区速度最快 |
| EU | 欧洲、中东和非洲 | 欧洲比利时 | 欧洲用户,符合 GDPR |
| AP | 亚太地区 | 亚洲台灣 | 亚太地区用户,APAC 延迟最低 |
专用端点#
在 Ultralytics Cloud 上部署到全球 42 个区域:
- 美洲:14 个区域
- 欧洲:13 个区域
- 亚太地区:12 个区域
- 中东和非洲:3 个区域
每个端点都是单租户服务,具有以下特性:
- 由平台管理的规格(目前不可配置)
- 空闲时缩容至零
- 唯一的端点 URL,并在
/docs提供专属交互式 API 参考 - 独立的 API 密钥绑定,只有该密钥可以调用端点
- 独立的监控、日志和运行状况检查
部署页面#
从侧边栏的 Deploy 进入全局部署页面。此页面显示:
- 世界地图:显示已部署区域的标记;点击区域可打开
New Deployment对话框 - 概览卡片:总请求数(24 小时)、活动部署数、错误率(24 小时)、P95 延迟(24 小时)
- 部署列表:提供卡片、紧凑和表格三种视图模式
- 用于从任何已完成模型创建端点的新建部署按钮
- 刷新按钮,以及页面标题中的
Updated时间戳

页面会自动刷新;当部署处于过渡状态(creating、deploying 或 stopping)时,轮询频率会提高。详情请参阅监控。
主要特性#
全球覆盖#
在靠近用户的位置部署,覆盖以下 42 个区域:
- 北美、南美
- 欧洲、中东、非洲
- 亚太地区、大洋洲
扩缩容行为#
端点当前的行为如下:
- 缩容至零:空闲端点会缩容至零,并在下一次请求时冷启动
- 单个活动实例:每个端点当前在所有套餐中都由一个实例提供服务
- 负载丢弃:当端点暂时达到容量上限时,请求会收到
429响应——请参阅直接端点请求 - 请求超时:每个请求最长可运行 1 小时,足以支持视频推理
区域部署#
使用测得的区域延迟,将端点部署在靠近调用方的位置。实际推理延迟取决于模型、 输入大小、端点状态和网络路径。
运行状况检查#
每个运行中的部署都包含自动运行状况检查,具体包括:
- 实时状态指示器(正常/异常)
- 响应延迟显示
- 异常时自动重试,恢复正常后停止
- 手动刷新按钮
快速开始#
创建部署:
- 在项目中训练或上传模型
- 转到模型的 Deploy 选项卡
- 从延迟表中选择一个区域
- 点击 Deploy,等待部署状态变为 Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready部署名称根据模型名称和区域城市生成,因此无需命名步骤。部署完成后,使用端点 URL 和 API 密钥,即可从任何应用发送推理请求。
快速链接#
常见问题#
特性 共享 专用 服务 由 Platform 用户共享 专用于一个部署 扩缩容 由 Platform 管理 缩容至零、单个实例 区域 3 个数据区域 从 42 个部署区域中选择 URL Platform 模型 API 生成的部署端点 URL 测试 模型 Predict选项卡部署卡片中的 Predict选项卡或 API速率限制 每分钟 20 个请求 直接调用不受 Platform 速率限制 身份验证 任意工作区 API 密钥 仅限绑定到部署的 API 密钥 服务启动期间,部署会保持在创建或部署状态。状态变为 Ready 后即可使用;所需时间因模型和区域而异,通常需要几分钟。
可以,每个模型都可以在不同区域拥有多个端点。部署数量受套餐限制:免费版
3、专业版10、企业版unlimited。配额计入拥有该模型的工作区,并且一个端点一次只能提供 一个模型的服务——使用模型替换即可在不更改 URL 的情况下进行切换。启用缩容至零后:
- 端点在一段时间无活动后缩容
- 首次请求会触发冷启动
- 后续请求响应快速
空闲一段时间后,首次请求会触发冷启动。打开部署卡片会运行健康检查,使端点预热, 因此紧接着执行测试预测时会快速响应。