数据集#
Ultralytics Platform 数据集为管理训练数据提供了简化的解决方案。上传后,平台会自动处理图像、标签和统计信息。
处理完成后,如果数据集在 train 划分中至少包含一张图像,在 val 或 test 划分中的任一个至少包含一张图像,并且至少包含一张已标注图像,就可以开始训练。满足这三个条件时,数据集标题会显示 Ready 徽章,否则显示 Not Ready 徽章——点击徽章即可准确查看缺少哪个条件。
使用代理收集图像#
当模型检测满足某个条件(例如置信度在所选范围内)时,使用 代理 将图像添加到数据集。将条件连接到 数据集 块并选择你可以编辑的目标位置。图像将以无标签状态到达 train 拆分集中;现有的副本将被跳过。使用现有的 标注编辑器 审查并标注图像。
上传数据集#
Ultralytics Platform 支持多种上传格式,使用更加灵活。
如果你的数据集已存储在 Roboflow 中,可以使用 Integrations 直接导入,无需手动导出或重新上传。Google Cloud Storage、Amazon S3 或 Azure Blob Storage 中的数据可以通过 Cloud storage 原位使用。Enterprise 工作区可以使用 On Premise 为本地数据建立索引并进行训练,无需将像素数据发送到 Platform。
支持的格式#
| 格式 | 扩展名 | 备注 | 最大尺寸 |
|---|---|---|---|
| JPEG | .jpg、.jpeg | 最常见,推荐使用 | 50 MB |
| PNG | .png | 支持透明度 | 50 MB |
| WebP | .webp | 现代格式,压缩效果好 | 50 MB |
| BMP | .bmp | 未压缩 | 50 MB |
| TIFF | .tiff、.tif | 高质量 | 50 MB |
| HEIC | .heic | iPhone 照片 | 50 MB |
| AVIF | .avif | 下一代格式 | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | 相机原始格式 | 50 MB |
| MPO | .mpo | 多图片对象 | 50 MB |
视频编解码器支持#
仅凭文件扩展名并不足够:如果视频的编解码器在处理期间无法解码,视频仍可能处理失败。
MP4 容器中的 H.264 视频具有最广泛的解码器支持,是最稳妥的选择。如果视频无法处理,请使用 FFmpeg 重新编码:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4准备数据集#
平台支持 Ultralytics YOLO、COCO、语义 PNG 掩码、深度数据集、Ultralytics NDJSON 以及原始(未标注)上传:
使用包含 data.yaml 文件的标准 YOLO 目录结构:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlYAML 文件定义数据集配置:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogRaw:上传未标注图像(无标签)。如果你计划使用标注编辑器直接在平台上进行标注,这种方式非常有用。
系统会自动检测格式:包含 names、train 或 val 键的 data.yaml 的数据集会被视为 YOLO。包含 COCO JSON 文件(其中含有 images、annotations 和 categories 数组)的数据集会被视为 COCO。.ndjson 导出文件会作为 Ultralytics NDJSON 导入。仅包含图像且没有标注的数据集会被视为原始数据集。
当归档文件包含多个 YAML 文件时,Platform 会优先选择最接近归档根目录的标准名称(data.yaml、data.yml、dataset.yaml、dataset.yml)。每个归档文件只保留一个名称清晰的 YAML 文件,以避免歧义。
系统会检测 Pascal VOC XML 格式的标签文件,但其标注不会被导入,图像会作为未标注图像上传。上传开始前,Platform 会向你发出警告("Pascal VOC labels detected")。请先将 VOC XML 转换为 YOLO 或 COCO;详见格式转换工具。
如果标签引用了类别 ID,但未提供类别名称,Platform 会生成连续的占位名称(class0、class1、…),你之后可以在Classes tab中重命名这些名称。
上传流程#
创建数据集:
- 在侧边栏中导航至
Annotate - 点击
New Dataset - 选择一个数据源选项卡(见下方的数据源)
- 添加名称——URL slug 会自动生成,也可以编辑——并可选择添加描述
- 选择任务类型(见支持的任务)、可选许可证(见可用许可证)以及可见性(公开或私有)
- 对于本地文件,点击
Create & Upload;对于 URL 或已连接的数据源,点击Create & Import;或者点击Create Dataset以空数据集开始

要向现有数据集添加文件,请打开该数据集页面,然后将文件拖放到图库中,或者点击页面标题中的上传图标。上传图标会直接打开浏览器的原生文件选择器,因为数据集任务已经定义。
数据来源#
New Dataset 对话框提供四种来源:
| 来源 | 描述 |
|---|---|
| 上传 | 拖入文件或浏览选择文件——图像、视频、归档文件或 NDJSON |
| URL | 粘贴指向 .zip、.tar、.tar.gz、.tgz 或 .ndjson 文件的直接链接;Platform 会在服务器端下载并摄取该文件 |
| Cloud | 原位使用 Google Cloud Storage、Amazon S3 或 Azure Blob Storage 中的数据(Pro 和 Enterprise) |
| On Premise | 通过 On Premise 工作节点,在数据始终不离开你自己的设备的情况下建立索引并进行训练(Enterprise) |
URL 导入同时受套餐的单次上传限制(Free 10 GB / Pro 20 GB / Enterprise 50 GB)和剩余存储配额限制,以较小者为准。链接必须可通过 HTTP 或 HTTPS 公开访问,并且以受支持的扩展名结尾。
上传开始前#
Platform 会在上传任何内容之前在浏览器中验证你的文件,因此常见问题会立即显现,而不是在长时间传输后才发现。系统会检查归档文件是否损坏、为空或受密码保护,以及 YAML 语法是否存在错误,并按名称列出超大文件。
随后可能会出现两个对话框:
当归档文件声明了类别名称,而你的数据集已经包含类别时,Map imported classes 对话框会为每个传入类别列出一行。对于每个类别,你可以选择要合并到的现有类别、创建新类别,或跳过该类别。名称完全匹配的类别会被预先选中,被跳过的类别及其标注不会被导入。
上传后,平台会自动处理你的数据:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- 验证:检查格式和大小
- 规范化:将大图调整大小(最大 4096px,最小尺寸 28px),将灰度图扩展为 RGB,将透明背景铺到白色背景上,并应用 EXIF 方向
- 缩略图:生成 256px WebP 预览图
- 标签解析:提取 YOLO、COCO 和 NDJSON 标签
- 统计信息:计算类别分布和图像尺寸
如果不需要调整大小或更改颜色,AVIF 和 WebP 原图会逐字节存储。其他所有图像都会重新编码——WebP 源文件仍保留为 WebP,其他所有格式(JPEG、PNG、BMP、TIFF、HEIC、JP2、DNG、MPO)都会以质量 92 转换为 JPEG。原始文件名和源扩展名会作为元数据保留。

上传前验证
你可以在上传前在本地验证数据集:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")图像最短边必须至少为 28px。小于此尺寸的图像会在处理过程中被拒绝。最长边大于 4096px 的图像会在保持宽高比的情况下自动调整大小。
浏览图像#
以多种布局查看数据集图像。
从图库工具栏打开 聚类面板,以交互式 2D 散点图的形式探索数据集。
| 查看 | 描述 |
|---|---|
| 网格 | 带有标注叠加层的缩略图网格(默认) |
| 紧凑 | 更小的缩略图,便于快速浏览 |
| 表格 | 显示缩略图、文件名、尺寸、大小、数据集划分、类别和标签数量的列表 |

排序和筛选#
你可以对图像进行排序和筛选,以便高效浏览:
每个选项可在升序(↑)和降序(↓)之间切换:
| 排序 | 描述 |
|---|---|
| 创建时间 ↑/↓ | 上传顺序(默认 ↓) |
| 名称 ↑/↓ | 文件名按字母排序 |
| 高度 ↑/↓ | 以像素为单位的图像高度 |
| 宽度 ↑/↓ | 以像素为单位的图像宽度 |
| 大小 ↑/↓ | 磁盘上的文件大小 |
| 标注 ↑/↓ | 每张图像的标注数量 |
对于超过 100,000 张图像的数据集,为保持图库响应速度,会隐藏名称、宽度、高度和大小排序。创建时间和标注数量排序仍然可用。
将 Annotations 筛选器设置为 Unannotated,即可快速查找仍需标注的图像。这对于需要跟踪标注进度的大型数据集尤其有用。
搜索框位于图库工具栏右侧,可筛选每种视图模式——网格、紧凑和表格。它会匹配图像文件名(文件扩展名可选),以及自定义元数据键、标量值和数组条目,因此名为 img_0042 且包含 {"ship_type": "yacht"} 的图像,通过搜索 img_0042 或 yacht 均可找到。
不会匹配嵌套在子对象中的值。粘贴 24 个字符的图像 ID 会直接查找该图像,跳过文本搜索。
全屏查看器#
点击任意图像,即可打开全屏查看器,其中包含:
- 导航:使用箭头键或缩略图预览进行浏览
- 图像信息:查看平台生成的属性、自定义元数据,以及 EXIF 等嵌入式文件元数据
- 自定义元数据:所有者和编辑者可以添加或替换 JSON 对象,其中嵌套值最多包含 500,000 个序列化字符,顶层键最多包含 128 个字符
- 标注:切换标注叠加层的可见性
- 类别明细:显示每个类别的标签数量及颜色指示器
- 标注:拥有编辑权限时,在桌面设备上打开全屏查看器后,标注控件会立即处于激活状态
- 下载:下载原始图像文件
- 删除:从数据集中删除图像
- 缩放:使用
Cmd/Ctrl+Scroll、Cmd/Ctrl++或Cmd/Ctrl+=放大,使用Cmd/Ctrl+-缩小 - 重置视图:使用
Cmd/Ctrl + 0或重置按钮,使图像适应查看器 - 平移:按住
Space并拖动,以在缩放后平移画布 - 像素视图:切换像素化渲染,以便近距离检查
- 深度幕帘:在深度数据集中,可拖动分隔线,在 RGB 图像与其彩色深度图之间擦除切换

按数据集划分筛选#
按数据集划分筛选图像:
| 划分 | 用途 |
|---|---|
| 训练 | 用于模型训练 |
| Val | 用于训练期间的验证 |
| Test | 用于最终评估 |
聚类#
Clustering 面板会将数据集投影为交互式 2D 散点图,视觉上相似的图像会彼此靠近。你可以利用它发现图像簇、识别重复项和离群点,并检查数据集中各数据集划分或类别的分布,而无需离开图库。在任意数据集页面的图库工具栏中,点击散点图图标即可打开该面板。

运行分析#
开始分析:
- 打开数据集,然后点击图库工具栏中的散点图图标
- 点击
Analyze Dataset - 等待进度条完成——结果会显示在同一面板中
分析在后台分两个阶段运行:Computing embeddings 和 Clustering。根据数据集大小,可能需要几分钟。你可以关闭面板或离开页面,稍后再回来。
数据集必须至少包含 20 张、最多包含 200,000 张未发生错误的图像才能进行分析。由云存储或本地部署存储支持的已连接数据集目前尚不受支持。
可视化#
分析完成后,面板会显示所有已分析图像的 2D 散点图、图例和点计数器。图库筛选器(数据集划分、类别、已标注/未标注)会将筛选范围之外的点调暗,方便你专注于所需子集——此时计数器会显示 visible / total points。

颜色依据#
使用面板工具栏中的 Color by 下拉菜单更改数据点的着色方式。你可以随时切换视图模式——图表会立即重新着色,帮助你查看各个聚类中的数据集划分、类别或图像属性分布:
| 选项 | 着色 |
|---|---|
| 划分 | 训练 / 验证 / 测试 |
| 类别 | 每张图像中的第一个标注类别 |
| 宽度 | 图像宽度 |
| 高度 | 图像高度 |
| 大小 | 文件大小 |
| 标注 | 每张图像的标注数量 |

套索选择#
在某个区域周围绘制自由形状的选区,以突出显示图表中的点。图库会筛选出匹配的图像,你可以使用常用的图像操作检查、重新标注、移动或删除这些图像。
图表上方的标签会显示已选点的数量——点击 × 清除套索,并返回完整的图库视图。
一次套索选择最多解析 1,000 张图像。如果你的选择匹配了更多图像,Platform 会显示其中采样的 1,000 张,并建议你绘制更小的区域。
平移和缩放#
你可以直接使用鼠标和键盘浏览大型散点图,也可以使用图表左下角的缩放按钮:
| 输入 | 操作 |
|---|---|
| 滚动 | 在 2D 中平移图表 |
| Cmd/Ctrl+滚动 | 以光标位置为中心放大或缩小 |
| 按住空格键 | 切换到拖动平移模式 |
| 重置按钮 | 返回图表的完整范围 |
重新分析#
如果你的数据集在分析后发生变化——例如新增图像,或已分析数量不再与数据集匹配——所有者和编辑者可以在面板顶部看到 Re-analyze 按钮。
点击 Re-analyze,从头重新计算嵌入和 2D 投影。
查找相似图像#
相同的嵌入支持跨公共数据集的相似性搜索。在可编辑的数据集中,右键单击网格或紧凑视图中的图像(或表格视图中单个选定的行),然后选择查找相似图像。该对话框最多列出 24 个最近的公共图像及其源数据集、许可证和相似度得分,排除了数据集中已有的图像以及选定图像在其他数据集中的副本。选择你想要的图像并点击添加到数据集:它们将作为未标注图像添加到 train 拆分中,计入你的存储空间,并准备好进行标注。
没有嵌入的图像——在尚未分析的数据集中,或者在上次分析之后添加的图像——显示 Analyze this dataset in Clustering to find similar images。该对话框在连接的数据集上不可用。模型的每张图像验证诊断从其表现最差的图像开始运行相同的搜索。
数据集选项卡#
每个数据集页面最多可显示六个选项卡,具体取决于数据集状态和你的权限:
图像选项卡#
默认视图,显示带有标注叠加层的图像图库。支持网格、紧凑和表格视图模式。将文件拖放到此处即可添加更多图像。
类别选项卡#
当数据集包含图像且其任务包含类别时,会显示此选项卡。
管理数据集的标注类别:
- 类别直方图:显示每个类别标注数量的柱状图,按频率排序,并支持在线性/对数刻度之间切换
- 类别表格:可排序、可搜索的表格,包含索引、名称、标注数量和图像数量
- 编辑类别名称:点击任意类别名称即可直接重命名
- 编辑类别颜色:点击颜色样本即可更改类别颜色
- 添加新类别:使用底部的输入框添加类别
- 合并类别:选择两行或更多行,然后点击
Merge into one - 删除类别:选择一行或更多行,然后点击
Delete

如果你的数据集存在类别不平衡(例如有 10,000 个 "person" 标注,但只有 50 个 "bicycle" 标注),请使用类别直方图中的 Log Scale 开关,以清晰地可视化所有类别。
合并类别#
合并会整合重复或重叠的标签——例如将 car、automobile 和 vehicle 合并为一个类别:
- 使用行复选框选择两个或更多类别
- 点击表头中的
Merge into one,或右键点击所选内容 - 选择所选类别中的一个作为其他类别合并到的目标类别
- 确认
属于源类别的每个标注都会重新分配到目标类别,源类别也会被移除。不会删除任何标注,因此数据集的标注总数保持不变。
删除类别#
- 使用行复选框选择一个或更多类别
- 点击表头中的
Delete,或右键点击所选内容 - 确认
删除类别会移除该类别及其所有标注。对于分类数据集,标签会被移除,但图像仍会保留,并变为无标注状态。
类别 ID 按位置确定。合并或删除类别时,所有更高的类别索引都会向下移动以填补空缺,因此在更改前写出的导出文件和标签文件将不再与新索引对应。如果需要保留旧编号,请先创建一个版本。
类别计数最多根据 100,000 张图像计算。在更大的数据集上,直方图上方会显示“基于此数据集的 100,000 张图像子集”。
图表选项卡#
当数据集包含图像时,会显示此选项卡。
根据你的数据集自动计算的统计信息:
图表按以下顺序显示;当数据集没有相应数据时,会省略对应图表——原始图像数据集不会显示标注图表,Points per Instance 仅在分割和姿态数据中显示:
| 图表 | 描述 |
|---|---|
| 划分分布 | 环形图,显示训练/验证/测试图像数量和已标注百分比 |
| 主要类别 | 环形图,显示频率最高的 10 个标注类别,其余类别归为“其他” |
| 图像尺寸 | 图像宽度和高度分布的直方图(叠加显示),并显示平均值 |
| 图像文件大小 | 图像文件大小分布的直方图 |
| 图像尺寸 2D | 宽度与高度的 2D 热力图,并带有宽高比参考线 |
| 标注位置 | 边界框中心位置的 2D 热力图 |
| 图像格式 | 源图像格式的分布(JPG、PNG 等) |
| 边界框尺寸 | 边界框宽度和高度的直方图(叠加显示) |
| 每张图像的对象数 | 每张图像标注数量的直方图 |
| 每个实例的点数 | 每个标注的多边形顶点数或关键点数(分割/姿态) |

Platform 会缓存计算出的统计信息,并在图像、标注、类别或划分发生变化时使其失效。对于超过 100,000 张图像的数据集,图表根据 100,000 张图像的子集计算,网格上方会对此进行说明。
点击任意热力图上的展开按钮,即可全屏查看。这样可以获得更大、更详细的视图,有助于理解大型数据集中的空间模式。
模型选项卡#
在可搜索的表格中查看在此数据集上训练的所有模型:
| 列 | 描述 |
|---|---|
| 名称 | 带链接的模型名称 |
| 项目 | 带图标的父项目 |
| 版本 | 用于训练的不可变数据集版本(如果有) |
| 状态 | 训练状态徽章 |
| 任务 | YOLO 任务类型 |
| 训练轮数 | 最佳训练轮数 / 总训练轮数 |
| mAP50-95 | 平均精度 |
| mAP50 | IoU 为 0.50 时的 mAP |
| 创建时间 | 创建日期 |

错误选项卡#
仅当一个或多个文件处理失败时,此选项卡才会显示。
处理失败的图像会列在这里,并包含:
- 错误横幅:失败图像的总数和指导信息
- 错误表格:文件名、易于理解的错误描述、修复提示和预览缩略图
- 常见错误包括文件损坏、格式不受支持、图像过小(最小 28px)以及不受支持的色彩模式

常见处理错误
| 错误 | 原因 | 修复方法 |
|---|---|---|
| 无法读取图像文件 | 文件损坏或格式不受支持 | 从图像编辑器重新导出 |
| 文件不完整或已损坏 | 文件在传输过程中被截断 | 重新下载原始文件 |
| 不受支持的图像格式 | 平台无法解码的格式 | 转换为 JPG、PNG 或 WebP |
| 文件权限错误 | 文件已锁定或受读保护 | 解锁文件后重新上传 |
| 图像过小 | 最小尺寸低于 28px | 使用更高分辨率的源图像 |
| 不受支持的色彩模式 | CMYK 或索引色模式 | 转换为 RGB 模式 |
版本选项卡#
创建数据集的不可变 NDJSON 快照,以实现可复现训练。每个版本都会记录创建时的图像数量、类别数量、标注数量和文件大小。
| 列 | 描述 |
|---|---|
| 版本 | 版本号(v1、v2、……) |
| 描述 | 用户提供的描述(可编辑) |
| 图像 | 快照创建时的图像数量 |
| 类别 | 快照创建时的类别数量 |
| 标注 | 快照创建时的标注数量 |
| 大小 | NDJSON 导出文件大小 |
| 创建时间 | 版本创建时间 |
| 操作 | 下载或恢复 |
创建版本:
- 打开 Versions 选项卡
- 可选:输入描述(例如,"添加了 500 张训练图像" 或 "修复了错误标注的类别")
- 点击 New Version
- 新版本会显示在表格中
每个版本都会按顺序编号(v1、v2、v3……),并且不可变——版本不能编辑或删除,只能更改其描述。你可以随时使用行操作下载或恢复任意版本。
恢复操作会将数据集当前的图像、划分、类别和标注替换为所选快照;除非你先将当前状态另存为其他版本,否则无法撤销。重建期间,数据集会处于 processing 状态并被锁定。恢复过程中不会重新上传任何内容,因此即使数据集很大,恢复通常也很快。
在 Cloud Training dialog 中启用 Save Dataset Version,将模型关联到训练时使用的确切数据集。当数据集内容未发生变化时,平台会重复使用匹配的版本;只有内容发生变化时才会创建新版本。
数据集达到 ready 状态后,才能创建和恢复版本。connected 云数据集或 On Premise 数据集不支持版本。
在对数据集进行重大更改前后创建版本,例如添加图像、修复标注或重新平衡划分。这样你就可以比较模型在不同数据集状态下的性能。
显示的大小是 NDJSON 导出文件的大小,其中包含图像 URL 和标注,而不是图像本身。实际图像数据单独存储,并通过签名 URL 访问。快照文件仍会计入你的工作区存储配额,因此如果剩余空间不足,版本创建会失败。
导出数据集#
从数据集页眉或 Versions 选项卡下载 NDJSON,将数据集导出以供离线使用。
导出步骤:
- 点击数据集页眉中的 Download 按钮(下载图标)
- 直接下载当前 NDJSON 快照
- 如果你需要一个可在之后重新下载的不可变编号快照,请使用 Versions 选项卡

NDJSON 格式每行存储一个 JSON 对象。第一行包含数据集元数据,随后每行对应一张图像:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}将 NDJSON 文件导入平台时,会保留可选的图像级 metadata 对象。你可以在图像的全屏信息面板中查看或编辑它。对于以编程方式上传存档,Ingest Dataset Data API 接受等效的 imageMetadata 路径映射。
Pose 数据集还会在数据集页眉行中包含 kpt_shape 字段;如果该字段尚未设置,则会根据标注推断。
Depth 导出会在数据集行中声明 "task": "depth" 和 "depth_scale": 1000。每个图像行都包含一个
depth.url,对应其配对的纯 uint16 PNG。Ultralytics 会并发下载图像和深度 URL,并以相同的缩放比例写入
训练 YAML,因此可以将 NDJSON 文件直接传递给 model.train(data=...)。
导出的 NDJSON 中的图像 URL 带有签名,有效期为 7 天。当数据集未发生变化时,平台会重复使用缓存的导出文件,最长可达 6 天,因此新下载的文件始终至少还剩一天有效期。如果你需要更早获取新的 URL,请更改数据集或创建新版本。
On Premise 数据集不支持导出,因为其图像字节数据不会到达平台。
如需完整规范,请参阅 Ultralytics NDJSON format documentation。
图像操作#
快速操作#
在 Grid 或 Compact 视图中右键点击任意图像,即可访问快速操作:
| 操作 | 描述 |
|---|---|
| Move to Split | 将图像重新分配到 Train、Val 或 Test 划分 |
| 查找相似图像 | 在公共数据集中搜索相似图像并添加它们(请参阅查找相似图像) |
| 生成相似图像 | 创建该图像最多 16 个 AI 生成的变体(默认四个),并将你保留的变体作为未标注图像添加 |
| Download | 下载原始图像文件 |
| Delete | 从数据集中删除图像 |

图像上下文菜单仅作用于单张图像。要对多张图像执行批量操作,请使用带复选框选择功能的 Table 视图。
批量移动到划分#
将选中的图像重新分配到同一数据集中的其他划分:
- 切换到 表格 视图
- 使用复选框选择图像
- 右键单击以打开上下文菜单
- 选择
Move to split> 训练、验证 或 测试
你也可以在网格视图中将图像拖放到划分筛选标签上。如果移动图像会与目标划分中已有的相同图像发生冲突,Platform 会询问你是跳过、保留两者还是替换。
将所有图像上传到一个数据集,然后使用批量移动到划分功能,将子集整理到训练、验证和测试划分中。
重新分配划分#
使用自定义比例在训练、验证和测试划分之间重新分配所有图像:
- 点击数据集工具栏中的 划分栏,打开 重新分配划分 对话框
- 使用以下任一方法调整划分百分比
- 查看实时图像数量预览,确认分配结果
- 点击 应用,根据你设置的百分比随机重新分配所有图像

该对话框提供三种设置目标拆分比例的方法:
| 方法 | 描述 |
|---|---|
| 拖动 | 拖动彩色分段之间的控制柄,以直观调整划分边界 |
| 输入 | 编辑任意划分的百分比输入值(另外两个划分会自动按比例重新平衡) |
| 自动 | 一键立即设置 80/20 的训练/验证划分,并将测试划分设为 0% |
实时预览会显示应用更改前每个划分中将包含的确切图像数量。
点击 自动 按钮,立即设置推荐的 80/20 训练/验证划分。这是最常用的训练比例。
批量删除#
一次删除多张图像:
- 在表格视图中选择图像
- 右键单击并选择
Delete,或按Cmd/Ctrl+Delete - 确认删除
数据集 URI#
使用 ul:// URI 格式引用 Platform 数据集(请参阅使用 Platform 数据集:
ul://username/datasets/dataset-slug你也可以直接粘贴数据集或模型网页 URL(例如 https://platform.ultralytics.com/username/datasets/dataset-slug);它会自动重写为 ul:// URI。传入数据集列表会依次在每个数据集上微调同一个基础模型,例如 model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"])。
使用此 URI 从任何位置训练模型:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100ul:// URI 可在任何环境中使用:
- 本地计算机:使用你的硬件进行训练,数据会自动下载
- Google Colab:在 notebook 中访问你的 Platform 数据集
- 远程服务器:在云端 VM 上训练,并获得完整的数据集访问权限
可用许可证#
Platform 支持以下数据集许可证:
| 许可证 | 类型 |
|---|---|
| 无 | 未选择许可证 |
| CC0-1.0 | 公共领域 |
| PDM-1.0 | 公共领域 |
| CC-BY-2.5 | 宽松型 |
| CC-BY-3.0 | 宽松型 |
| CC-BY-4.0 | 宽松型 |
| CC-BY-NC-2.0 | 非商业用途 |
| CC-BY-NC-3.0 | 非商业用途 |
| CC-BY-NC-4.0 | 非商业用途 |
| CC-BY-SA-3.0 | 相同方式共享 |
| CC-BY-SA-4.0 | 相同方式共享 |
| CC-BY-NC-SA-3.0 | 相同方式共享 |
| CC-BY-NC-SA-4.0 | 相同方式共享 |
| CC-BY-ND-4.0 | 禁止演绎 |
| CC-BY-NC-ND-2.0 | 非商业用途 |
| CC-BY-NC-ND-4.0 | 非商业用途 |
| Apache-2.0 | 宽松型 |
| MIT | 宽松型 |
| BSD-3-Clause | 宽松型 |
| AGPL-3.0 | 相同方式共享 |
| GPL-2.0 | 相同方式共享 |
| GPL-3.0 | 相同方式共享 |
| LGPL-3.0 | 相同方式共享 |
| ODbL-1.0 | 相同方式共享 |
| DbCL-1.0 | 需要 ODbL |
| 仅限研究 | 受限 |
| 其他 | 自定义 |
当克隆带有 copyleft 许可证(AGPL-3.0、GPL-2.0、GPL-3.0、LGPL-3.0、ODbL-1.0、CC-BY-SA-3.0、CC-BY-SA-4.0、CC-BY-NC-SA-3.0、CC-BY-NC-SA-4.0)的数据集时,克隆将继承该许可证,且许可证选择器将被锁定。
可见性设置#
控制谁可以查看你的数据集:
| 设置 | 描述 |
|---|---|
| 私有 | 你和获准的工作区成员可以访问 |
| 公开 | 任何人都可以查看,包括从 Explore 页面查看 |
创建数据集时,你可以在 New Dataset 对话框中使用切换开关设置可见性。公开数据集会显示在 Explore 页面上。
编辑数据集#
数据集元数据可直接在数据集页面中内联编辑,无需对话框:
- 名称:点击数据集名称进行编辑。更改会在失去焦点或按下
Enter时自动保存。名称最多包含 100 个字符。 - 描述:点击描述(或“添加描述...”占位符)进行编辑。更改会自动保存。描述最多包含 1,000 个字符。
- 任务类型:点击任务徽章,选择其他任务类型。
- 许可证:点击许可证选择器,更改数据集许可证。
- 图标:点击数据集图标,上传你自己的图像、将数据集中的某张图像设为图标,或选择字母和颜色。
每张图像都会同时存储所有任务类型的标注。更改数据集任务类型会控制编辑器中可见的标注,以及导出和训练中包含的标注。其他任务类型的标注会保留在数据库中,切换回来时会重新显示。深度是例外:其真实值是配对文件而不是标注,因此只有在数据集不包含任何图像时,才能切换到深度任务或从深度任务切换回来;请改为重新导入。
自定义元数据#
打开 更多操作,选择 信息,查看以下两个部分:
- Ultralytics 元数据:只读的 Platform 详细信息,例如数据集 ID、所有者、任务、图像和标注数量、存储区域及时间戳
- 自定义元数据:你自己的 JSON 对象,可用于记录来源、采集条件、客户 ID、治理信息或其他上下文数据
工作区查看者可以检查元数据,而拥有编辑权限的成员可以替换自定义元数据对象。序列化后的元数据对象最多包含 500,000 个字符,每个顶级键最多包含 128 个字符。保存空对象({})即可清除自定义元数据。
克隆数据集#
查看你不拥有的公开数据集时,点击 Clone Dataset 打开克隆对话框。检查目标工作区、名称、可见性和许可证,然后确认克隆。副本包含所有图像、标注和类别定义。默认可见性为公开的工作区中的公开源数据集默认保持公开;Enterprise 工作区中的克隆数据集默认为私有。如果原始数据集采用相同方式共享许可证,克隆数据集会继承该许可证,并且许可证选择器会被锁定。
如果目标 slug 已被占用,系统会自动重命名;克隆需要有足够的剩余存储配额来容纳副本。
收藏和分享#
- 收藏:点击星标按钮,将数据集加入书签。所有用户都可以看到收藏数。
- 分享:对于公开数据集,点击分享按钮即可复制链接、获取嵌入代码片段或分享到社交平台。
删除数据集#
删除不再需要的数据集:
- 在数据集标头中打开 更多操作(
…按钮) - 选择 Delete Dataset
- 在对话框中确认:"这会将 [name] 移至回收站。你可以在 30 天内恢复它。"
同一菜单中还有 Information,它会打开 Custom Metadata 中所述的元数据对话框,以及 Refresh,用于从服务器重新读取数据集。
已删除的数据集会移至回收站,而不会被永久删除。你可以在 30 天内从 Settings > Trash 恢复它们。
在数据集上训练#
直接从数据集开始训练:
- 在数据集页面上点击
New Model - 选择一个项目或创建新项目
- 配置训练参数
- 开始训练
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff详情请参阅 Cloud Training。
常见问题#
你的数据会在所选区域(US、EU 或 AP)中进行处理和存储。图像会:
- 验证格式和大小
- 如果最小尺寸小于 28px,则被拒绝
- 如果大于 4096px,则进行归一化处理(保持宽高比;编码以优化存储)
- 通过去重进行存储,因此相同的图像只保留一份
- 生成 256px 的 WebP 缩略图,以便快速浏览
Ultralytics Platform 高效管理存储:
- 去重:同一数据区域中的相同图像只存储一份
- 完整性:上传内容会经过数据完整性验证
- 效率:克隆会复用已存储的图像,而不是复制图像,但仍会计入目标工作区的存储配额
- 区域性:数据会保留在你选择的区域(US、EU 或 AP)中
可以。将文件拖到数据集图库中,或点击页面标题栏中的上传图标,这会直接打开浏览器的原生文件选择器。处理完成后会自动计算新的统计信息。
使用批量移动到数据集划分功能:
- 在表格视图中选择图像
- 右键点击并选择
Move to split - 选择目标划分(Train、Validation 或 Test)
Ultralytics Platform 支持 YOLO 标签、COCO JSON、Ultralytics NDJSON 和原始图像上传。系统会检测 Pascal VOC XML 标签,但不会导入:
每张图像对应一个
.txt文件,使用归一化坐标(0-1 范围):任务 格式 示例 Detect class cx cy w h0 0.5 0.5 0.2 0.3Segment class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9语义分割 class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9姿态 class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9分类 目录结构 train/cats/、train/dogs/姿态可见性标志:0=未标注,1=已标注但被遮挡,2=已标注且可见。语义数据集还接受 PNG 掩码来代替多边形文件(请参阅语义掩码)。
可以。每张图像会同时存储全部 6 种标注任务类型(检测、分割、语义分割、分类、姿态、OBB)的标注。你可以随时切换数据集的活动任务类型,而不会丢失现有标注。编辑器中只会显示与活动任务类型匹配的标注,导出和训练时也只会包含这些标注;其他任务的标注会被保留,并在你切换回来时重新显示。
是:
限制 值 每个数据集的类别数 25,000 每张图像的标注数 10,000 每个标注的坐标数 10,000 数据集名称 100 个字符 数据集描述 1,000 个字符 自定义元数据 500,000 个序列化字符 元数据顶层键 128 个字符