智能体#
智能体可在可视化工作流中连接图像、模型、条件和操作。使用 YOLO 判断哪些图像需要进一步检查,让视觉语言模型解释图像,或将选定的图像收集到数据集中以供审核。
在侧边栏中打开 智能体,或前往 platform.ultralytics.com/agents。所有已登录用户都能在个人和团队工作区的侧边栏中看到智能体,无需启用“Early access”设置。

运行你的第一个工作流#
- 打开 智能体,点击 添加块 > 模板,然后选择 YOLO → VLM 监控。
- 选择 输入图像 块,选一个已上传的数据集,然后选择一张包含人物的图像。共享试用时,请使用不超过 400 万像素的图像。
- 保留默认的 YOLO26 nano 模型。当 YOLO 检测到至少一个人时,条件即通过。
- 选择 描述场景,挑选一个视觉语言模型并输入提示词。如果你还没有添加,请在 设置 > API 密钥 中添加对应的服务商密钥。在团队工作区中,请让工作区所有者添加或替换服务商密钥。
- 小规模运行时,保留选中的 共享试用 · 60 秒,然后点击 运行。
- 观察各个块的状态更新并检查 输出。如果没有检测到人,条件会直接结束,不会运行描述分支。
你可以先运行草稿,再保存。使用 保存工作流 为工作流命名并保存,以便稍后使用;修改后请再次保存。点击 Python 按钮可查看生成的工作流代码。
从模板开始#
| 模板 | 工作流程 | 适用场景 |
|---|---|---|
| YOLO → VLM 监控 | 图像 → YOLO → 条件 → 视觉语言模型 → 输出 | 仅在检测到人时描述场景 |
| 收集不确定的检测结果 | 数据集 → 部署 → 置信度条件 → 数据集 | 根据检测结果不确定的图像构建审核集 |
| 捕获并提醒 | 图像 → YOLO → 条件 → 数据集和 Slack | 根据同一条件保存图像并通知频道 |
模板是可编辑的起点。运行前,请为工作区选择图像、部署、目标数据集和集成。这些工作流会在你点击 运行 时启动;“监控”模板会分析选定的输入图像。

选择运行位置#
运行 旁边的执行方式选择器用于选择工作流运行所用的硬件。
| 选项 | 适用场景 | 限制和定价 |
|---|---|---|
| 共享试用 · 60 秒 | 试用小型工作流 | 最多运行 60 秒,输入图像总数不超过 20 张且每张不超过 400 万像素,模型/服务商调用次数不超过 20 次;使用一个本地 YOLO 模型,且必须是官方 YOLO26 nano 模型 |
| 现有专用部署 | 处理更大的数据集、运行更长时间或使用其他本地模型 | 使用该部署已有的硬件和定价,包括符合条件的免费专用部署;工作流总时长和图像数量没有上限 |
| 新建部署… | 通过构建器创建专用硬件 | 打开现有的部署创建和定价对话框;选择资源并等待部署就绪 |
共享试用每分钟最多可运行三次;专用部署上的运行没有频率限制。Platform 运行最多支持 20 个块。模型/服务商调用包括 YOLO、视觉语言模型、部署预测以及 Slack 和 Webhook 操作;分支可能增加每张输入图像的调用次数。
专用运行会在所选部署上通过带检查点的请求持续进行。关闭或重新加载浏览器不会停止运行。现有部署限制和服务商限制仍然适用;语言模型的使用费用由与你的密钥关联的服务商收取。查看部署定价,了解硬件选项。
部署 块用于选择预测步骤所使用的端点。执行方式选择器则用于选择工作流本身的运行位置。你可以为两者选择同一个专用部署。

配置块#
| 块 | 用途 |
|---|---|
| 图像 | 上传图像或视频(默认最多采样 10 帧),也可以从已上传的数据集中选择一张图像 |
| 数据集(无输入连接) | 从所选数据集和数据拆分中读取图像,并可配置输入数量上限 |
| YOLO | 运行官方模型或工作区中的训练模型 |
| 部署 | 通过现有且就绪的 Platform 部署进行预测 |
| LLM | 将图像和上游上下文发送到所选的语言模型或视觉语言模型 |
| 闸门 | 通过条件或执行频率控制下游执行 |
| 数据集(有输入连接) | 将传入图像添加到目标数据集 |
| Slack | 向工作区已连接的 Slack 频道发送消息 |
| Webhook | POST 发送到 HTTPS 端点的 JSON 请求正文 |
| 导出 | 使用 Platform 现有的导出工作流导出模型 |
| 输出 | 显示上游结果 |
选择一个块可编辑其设置。将一个输出连接到另一个块,即可把结果传递到下游。一个输出可以连接到多个块:例如,将同一个条件连接到目标数据集和 Slack。每个分支都会使用同一个已评估的条件。
使用条件筛选检测结果#
检测数量和置信度筛选都使用同一个 闸门 块。选择上游结果、任意类别或特定类别,再选择比较条件。例如:
- 人数 ≥ 1:检测到至少一个人时继续。
- 置信度介于 0.25 和 0.5 之间:至少有一个匹配的检测结果落在该闭区间内时继续。
- 指定类别且置信度处于某个范围内:仅收集该类别的不确定检测结果。
置信度筛选会逐个检查检测结果。一张图像的分数为 0.3 和 0.9 时,如果有一个检测结果匹配,就会通过 0.25–0.5 范围筛选。没有检测结果的图像无法通过置信度条件。请将预测模型的置信度阈值设得足够低,以保留你想要评估的检测结果。
条件不匹配时,执行会结束且不产生下游输出。连接到该条件的操作不会针对这张图像运行。

收集图像以供审核#
打开 收集不确定的检测结果,选择源数据集和数据拆分,选取预测部署,并设置置信度范围。在最后一个 数据集 块中选择现有的目标数据集。如有需要,请先前往 数据集页面创建数据集。
目标数据集会在其 train 拆分中接收未标注的原始图像。已有副本会被跳过,常规数据集存储配额仍然适用。源标签和模型预测不会作为标注复制。打开目标数据集中的现有标注编辑器,审核并标注收集到的图像。
请使用工作区可访问的托管图像,以及你有权限编辑的目标数据集。已连接的云存储数据集和本地部署数据集不能用作收集目标。
发送有条件的 Slack 提醒#
在 设置 > 集成 中连接 Slack,然后将一个条件连接到 Slack 块。输入消息,并使用 {output} 来包含上游结果。捕获并提醒 也会将同一个条件连接到数据集,因此匹配的图像会被收集,同时会向已连接的频道发送消息。
工作流 Slack 消息在块中配置,与“设置”中的训练、导出和部署通知选项相互独立。
发送 Webhook#
Webhook 块会针对每个结果向公开的 HTTPS URL 发送一个带有 Content-Type: application/json 的 POST,因此任何接受 JSON 请求的服务都可以接收条件执行结果。输入目标 URL 和不超过 10,000 个字符的 JSON 请求体,并在字符串中加入 {output};该内容会被上游结果替换。此块是终端块,不接受输出连接。不会跟随重定向;连接会在 5 秒后超时;非 2xx 响应会导致块执行失败。
跟踪进度并停止运行#
正在运行的块会显示绿色旋转图标。已完成的块会显示绿色勾号和绿色轮廓;失败的块会显示红色轮廓。计数会显示已到达各个块的输入数量;条件不匹配时,下游块不会执行。
重新加载页面后,会恢复运行进度和所选的执行部署。匹配工作流的已完成结果会继续显示。点击 停止 可取消正在运行的工作流;取消操作会等待正在执行的块到达可取消的位置。停止或删除其执行部署也会取消工作流。
