YOLO Vision 2026:

部署#

Ultralytics Platform 提供了全面的模型部署选项,助你将 YOLO 模型投入生产。通过基于浏览器的推理来测试模型,部署到横跨 42 个全球区域的专用端点,并实时监控性能。



Watch: Get Started with Ultralytics Platform - Deploy

概述#

“部署”部分可以帮助你:

  • 使用 Predict 标签页直接在浏览器中测试模型
  • 部署到全球 42 个区域的专用端点
  • 监控:监控请求指标、日志和健康检查
  • 缩容至零:闲置时自动缩容(当前部署运行单个活动实例)

Ultralytics Platform Deploy Page World Map With Overview Cards

部署选项#

Ultralytics Platform 提供多种部署路径:

选项描述最适用场景
预测标签页基于浏览器的推理,支持图像、摄像头和示例开发、验证
共享推理 (Shared Inference)跨 3 个数据区域的多租户服务轻量使用、测试
专用端点覆盖 42 个区域的单租户服务生产环境、低延迟
Export以 20 种格式下载权重,用于本地或边缘端运行时离线、端侧

工作流#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
阶段描述
测试使用 Predict 标签页验证模型
配置选择一个区域;部署名称由模型和城市自动生成
部署 (Deploy)Deploy 标签页创建专用端点
监控监控中跟踪请求、延迟、错误和日志

架构#

共享推理#

共享推理服务运行在 3 个关键区域。对模型的请求将被路由到该模型所在数据区域的服务中,因此结果会保留在存储模型的区域内:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
区域标签位置最适用场景
US美洲美国爱荷华州美洲用户,美洲地区访问速度最快
EU欧洲、中东及非洲欧洲,比利时欧洲用户,符合 GDPR 合规要求
AP亚太地区亚太地区,台湾亚太用户,亚太地区延迟最低

专用端点#

通过 Ultralytics Cloud 部署到全球 42 个区域:

  • 美洲:14 个区域
  • 欧洲:13 个区域
  • 亚太地区:12 个区域
  • 中东和非洲:3 个区域

每个端点都是一个单租户服务,具备:

  • 平台管理规格大小(当前暂不支持配置)
  • 闲置时缩容至零
  • 带有专属交互式 API 参考文档的唯一端点 URL,位于 /docs
  • 拥有独立的 API 密钥绑定,因此只有该密钥才能调用此端点
  • 独立的监控、日志和健康检查

部署页面#

从侧边栏的 Deploy 下访问全球部署页面。该页面显示:

  • 世界地图带有已部署区域的图钉;点击某个区域即可打开 New Deployment 对话框
  • 概览卡片:总请求数 (24h)、活动部署数、错误率 (24h)、P95 延迟 (24h)
  • 部署列表:具有三种视图模式:卡片、紧凑和表格
  • 新建部署按钮:用于从任何已完成的模型创建端点
  • 页面页眉中包含刷新按钮以及 Updated 时间戳

Ultralytics Platform Deploy Page Overview Cards And Deployments List

自动轮询

页面会自动刷新,当部署处于过渡状态(creatingdeployingstopping)时轮询频率会加快。详情请参阅监控

主要特性#

全球覆盖#

通过覆盖 42 个区域的节点,实现靠近用户的部署,覆盖范围包括:

  • 北美洲、南美洲
  • 欧洲、中东、非洲
  • 亚太地区、大洋洲

伸缩行为#

端点目前的运行方式如下:

  • 缩减至零:闲置端点会缩减至零,并在下一个请求到来时冷启动
  • 单个活动实例:目前在所有套餐中,每个端点均由一个实例提供服务
  • 负载卸载:当端点暂时满载时,请求会收到 429 响应 —— 详情请参阅直接端点请求
  • 请求超时:每个请求最长可运行 1 小时,这足以满足视频推理的需求

区域部署#

使用测得的区域延迟将端点放置在靠近其调用方的位置。实际推理延迟取决于模型、输入大小、端点状态和网络路径。

健康检查#

每个运行中的部署都包含自动健康检查,具有:

  • 实时状态指示器(健康/不健康)
  • 响应延迟显示
  • 在不健康时自动重试,恢复健康后停止
  • 手动刷新按钮

快速入门#

创建一个部署:

  1. 在项目中训练或上传模型
  2. 转到模型的 Deploy 选项卡
  3. 从延迟表中选择一个区域
  4. 点击 Deploy 并等待部署状态变为 Ready
快速部署
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

部署名称由模型名称和区域城市自动生成,因此无需执行命名步骤。部署完成后,使用端点 URL 和你的 API 密钥即可从任何应用程序发送推理请求。

快捷链接#

  • 推理:在浏览器中测试模型
  • 端点:部署专用端点
  • 监控:跟踪部署性能

常见问题解答#

  • 功能共享专用
    Service在 Platform 用户之间共享专用于一个部署
    规模由 Platform 管理可缩减到零,单实例
    区域3 个数据区域从 42 个部署区域中选择
    URLPlatform 模型 API生成的部署端点 URL
    测试模型 Predict 标签页部署卡片 Predict 标签页或 API
    速率限制20 次请求/分钟直接调用无平台速率限制
    认证任意工作空间 API 密钥仅限绑定到该部署的 API 密钥
  • 当服务启动时,部署将保持创建中或部署中状态。当状态变更为就绪时即可使用;具体时间因模型和区域而异,通常需要几分钟。

  • 可以,每个模型可以在不同区域拥有多个端点。部署数量受套餐限制:免费版 3、Pro 版 10、Enterprise 版 unlimited。配额计费归属于拥有该模型的工作空间,并且一个端点一次仅服务于一个模型 —— 使用模型替换可在不改变 URL 的情况下对其进行切换。

  • 如果启用了缩容至零(scale-to-zero):

    • 端点会在不活跃后缩容
    • 首次请求会触发冷启动
    • 后续请求响应迅速

    闲置期后的首个请求会触发冷启动。打开部署卡片会运行健康检查以预热端点,因此紧随其后的测试预测能够快速响应。

评论