数据集#
Ultralytics Platform 数据集为你管理训练数据提供了一个简化的解决方案。上传后,平台会自动处理图像、标签和统计信息。
一旦处理完成且数据集中在 train 划分中至少包含一张图像、在 val 或 test 划分中至少包含一张图像,并且至少有一张带标签的图像,数据集便准备好进行训练。当满足这三个条件时,数据集标题会显示一个 Ready 徽章,否则显示一个 Not Ready 徽章 —— 点击徽章即可精确查看缺少哪个条件。
上传数据集#
Ultralytics Platform 接受多种上传格式,以提供灵活性。
如果你在 Roboflow 中已有数据集,请使用集成直接导入它们,无需手动导出或重新上传。Google Cloud Storage、Amazon S3 或 Azure Blob Storage 中的数据可以通过云存储在原地使用。企业工作区可以使用本地部署来索引和训练本地数据,而无需将像素发送到平台。
支持的格式#
| 格式 | 扩展名 | 注意事项 | 最大尺寸 |
|---|---|---|---|
| JPEG | .jpg、.jpeg | 最常见,推荐使用 | 50 MB |
| PNG | .png | 支持透明度 | 50 MB |
| WebP | .webp | 现代格式,压缩效果好 | 50 MB |
| BMP | .bmp | 未压缩 | 50 MB |
| TIFF | .tiff、.tif | 高质量 | 50 MB |
| HEIC | .heic | iPhone 照片 | 50 MB |
| AVIF | .avif | 下一代格式 | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | 原始相机格式 | 50 MB |
| MPO | .mpo | 多图片对象 | 50 MB |
视频编解码器支持#
仅凭文件扩展名是不够的:如果在处理过程中其编解码器无法解码,视频仍然可能会失败。
MP4 容器中的 H.264 视频具有最广泛的解码器支持,是最安全的选。如果视频无法处理,请使用 FFmpeg 对其进行重新编码:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4准备你的数据集#
该平台支持 Ultralytics YOLO、COCO、深度数据集、Ultralytics NDJSON 以及原始(未标注)上传:
使用包含 data.yaml 文件的标准 YOLO 目录结构:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlYAML 文件定义了你的数据集配置:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dog原始:上传未标注的图像(无标签)。当你打算使用标注编辑器直接在平台上进行标注时,这非常有用。
系统会自动检测格式:包含带有 names、train 或 val 键的 data.yaml 的数据集会被处理为 YOLO。带有 COCO JSON 文件(包含 images、annotations 和 categories 数组)的数据集会被处理为 COCO。.ndjson 导出文件会作为 Ultralytics NDJSON 导入。只有图像而没有标注的数据集会被处理为原始数据。
当归档文件包含多个 YAML 文件时,Platform 会优先选择离归档根目录最近的标准名称(data.yaml、data.yml、dataset.yaml、dataset.yml)。每个归档文件保留一个命名清晰的 YAML 文件以避免混淆。
Pascal VOC XML 格式的标签文件会被检测到,但它们的标注不会被导入 —— 图像将作为无标注状态上传。Platform 会在上传开始前发出警告(“检测到 Pascal VOC 标签”)。请先将 VOC XML 转换为 YOLO 或 COCO;参见格式转换工具。
如果标签引用了类别 ID 但未提供类别名称,Platform 将生成密集的占位符名称(class0、class1……),你稍后可以在类别选项卡中对其进行重命名。
有关特定于任务的格式详细信息,请参阅支持的任务和数据集概述。
上传流程#
要创建一个数据集:
- 在侧边栏中导航至
Annotate - 点击
New Dataset - 选择一个数据源选项卡(见下文数据源)
- 添加名称 —— URL 路径别名(slug)会自动派生并且可以进行编辑 —— 另外添加一个可选的描述
- 选择任务类型(参见支持的任务)、可选的许可证(参见可用许可证)以及可见性(公开或私有)
- 点击
Create & Upload选择本地文件,点击Create & Import获取 URL 或连接的源,或者点击Create Dataset从空数据集开始
要将文件添加到现有数据集,请打开其数据集页面,然后将文件拖放到图库中,或者点击页面标题中的上传图标。由于数据集任务已经定义,上传图标会直接打开你浏览器的原生文件选择器。
数据源#
New Dataset 对话框提供四个来源:
| 来源 | 描述 |
|---|---|
| 上传 | 拖入文件或浏览查找 —— 图像、视频、归档文件或 NDJSON |
| URL | 粘贴指向 .zip、.tar、.tar.gz、.tgz 或 .ndjson 文件的直接链接;Platform 会在服务器端下载并提取它 |
| Cloud | 就地使用来自 Google Cloud Storage、Amazon S3 或 Azure Blob Storage(Pro 和 Enterprise 版)的数据 |
| On Premise | 通过 On Premise 工作线程(Enterprise 版)对从不离开你自己的机器的数据进行索引和训练 |
URL 导入受你套餐的每个上传限制(免费版 10 GB / 专业版 20 GB / 企业版 50 GB)以及你剩余的存储配额(以较小者为准)的限制。该链接必须可通过 HTTP 或 HTTPS 公开访问,并以支持的扩展名结尾。
上传开始前#
Platform 会在上传任何内容之前在浏览器中验证你的文件,因此常见问题会立即显现,而不是在漫长的传输之后才出现。系统会检查归档文件是否存在损坏、空内容、密码保护以及 YAML 语法错误,超大文件会按名称列出。
随后可能会出现两个对话框:
当归档文件声明了类别名称且你的数据集已经有类别时,Map imported classes 对话框会为每个传入的类别列出一行。对于每一个类别,选择一个要合并入的现有类别、创建一个新类别,或将其跳过。精确名称匹配会被预先选中,跳过的类别及其标注将不会被导入。
上传后,平台会自动处理你的数据:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- 验证:格式和尺寸检查
- 标准化:大图像调整大小(最大 4096px,最小尺寸 28px),灰度图扩展为 RGB,透明度扁平化到白色上,并应用 EXIF 方向
- 缩略图:生成 256px WebP 预览图
- 标签解析:提取 YOLO、COCO 和 NDJSON 标签
- 统计信息:计算类分布和图像维度
当无需调整大小或颜色更改时,AVIF 和 WebP 原件将按字节原样存储。所有其他内容都会重新编码 —— WebP 源保持为 WebP,所有其他格式(JPEG、PNG、BMP、TIFF、HEIC、JP2、DNG、MPO)都将转换为质量为 92 的 JPEG。你的原始文件名和源扩展名将作为元数据保留。

上传前验证
你可以在上传前在本地验证你的数据集:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")图像的最短边必须至少为 28px。小于此尺寸的图像在处理过程中会被拒绝。最长边大于 4096px 的图像会在保持长宽比的情况下自动调整尺寸。
浏览图像#
以多种布局查看你的数据集图像。
从图库工具栏打开聚类面板,以交互式 2D 散点图的形式浏览你的数据集。
| 查看 | 描述 |
|---|---|
| 网格 | 带有标注叠加的缩略图网格(默认) |
| 紧凑 | 用于快速扫描的较小缩略图 |
| 表格 | 带有缩略图、文件名、维度、大小、拆分、类和标签计数的列表 |

排序和过滤#
图像可以进行排序和过滤,以便高效浏览:
每个选项都可以在升序(↑)和降序(↓)之间切换:
| 排序 | 描述 |
|---|---|
| 创建时间 ↑/↓ | 上传顺序(默认 ↓) |
| 名称 ↑/↓ | 文件名按字母顺序 |
| 高度 ↑/↓ | 图像高度(以像素为单位) |
| 宽度 ↑/↓ | 图像宽度(以像素为单位) |
| 大小 ↑/↓ | 磁盘文件大小 |
| 标注 ↑/↓ | 每张图像的标注数量 |
对于超过 100,000 张图像的数据集,名称、宽度、高度和大小排序将被隐藏,以保持图库的响应速度。创建时间和标注数量排序仍然可用。
使用设为 Unannotated 的 Annotations 过滤器,可以快速找到仍需标注的图像。这对于想要跟踪标注进度的庞大数据集特别有用。
搜索框位于图库工具栏的右侧,可过滤所有视图模式 —— 网格、紧凑和表格。它匹配图像文件名(文件扩展名是可选的)以及自定义元数据键、标量值和数组条目,因此携带 {"ship_type": "yacht"} 的名为 img_0042 的图像可以通过搜索 img_0042 或 yacht 来找到。
嵌套在子对象内部的值不参与匹配。粘贴 24 个字符的图像 ID 可以直接查找该特定图像,从而绕过文本搜索。
全屏查看器#
点击任意图像以打开全屏查看器,并提供以下功能:
- 导航:使用方向键或缩略图预览进行浏览
- 图像信息:查看平台生成的属性、自定义元数据以及嵌入的文件元数据(如 EXIF)
- 自定义元数据:所有者和编辑者可以添加或替换 JSON 对象,包括最多 500,000 个序列化字符的嵌套值以及最多 128 个字符的顶级键
- 标注:切换标注覆盖层的可见性
- 类别细分:带颜色指示的每类标签计数
- Annotate:当你拥有编辑权限时,在桌面上打开全屏查看器时,标注控件会立即处于激活状态
- 下载:下载原始图像文件
- 删除:从数据集中删除图像
- 缩放:
Cmd/Ctrl+Scroll、Cmd/Ctrl++或Cmd/Ctrl+=用于放大,Cmd/Ctrl+-用于缩小 - 重置视图:
Cmd/Ctrl + 0或重置按钮可使图像适应查看器 - 平移:缩放时按住
Space并拖动以平移画布 - 像素视图:切换像素化渲染以进行仔细检查
- 深度帘幕:在深度数据集上,一个可拖动的分隔条可以在 RGB 图像与其彩色深度图之间进行擦除对比

按拆分筛选#
按数据集拆分筛选图像:
| 拆分 | 用途 |
|---|---|
| 训练 | 用于模型训练 |
| Val | 用于训练期间的验证 |
| 测试 | 用于最终评估 |
聚类#
Clustering 面板将你的数据集投影到一个交互式的 2D 散点图中,其中视觉上相似的图像靠得很近。无需离开图库,即可使用它来浮现集群、发现重复项和异常值,以及检查划分或类别在数据中的分布情况。在任何数据集页面上,从图库工具栏中的散点图图标打开它。

运行分析#
开始分析:
- 打开数据集并点击图库工具栏中的散点图图标
- 点击
Analyze Dataset - 等待进度条完成——结果将出现在同一个面板中
分析在后台分两个阶段(Computing embeddings 和 Clustering)运行,根据数据集的大小可能需要几分钟。你可以关闭面板或离开页面稍后再回来。
数据集需要至少 20 个且最多 200,000 个无错误的图像才能进行分析。尚不支持由云存储或 On Premise 存储支持的连接数据集。
可视化#
分析完成后,面板会显示所有已分析图像的 2D 散点图,配有图例和点计数器。图库过滤器(划分、类别、已标注/未标注)会使过滤范围之外的点变暗,以便你专注于关心的子集 —— 随后计数器会显示 visible / total points。

着色依据#
使用面板工具栏中的 Color by 下拉菜单更改数据点的着色方式。随时切换视图模式——图表会立即重新着色,以便你查看划分、类别或图像属性如何在集群中分布:
| 选项 | 着色 |
|---|---|
| Splits | 训练 / 验证 / 测试 |
| Classes | 每张图像上的第一个标注类别 |
| Width | 图像宽度 |
| Height | 图像高度 |
| Size | 文件大小 |
| 标注 | 每张图像的标注数量 |

套索选择#
在区域周围绘制自由形状的选择框以突出显示图表上的点。图库会向下过滤出匹配的图像,以便你可以使用常规的图像操作来检查、重新标注、移动或删除它们。
图表上方的一个芯片显示了选中的点数——点击 × 以清除套索并返回完整的图库视图。
套索选择最多解析为 1,000 张图像。如果你的选择匹配更多,Platform 会显示抽样的 1,000 张并建议绘制一个更小的区域。
平移和缩放#
直接使用鼠标和键盘,或者使用图表左下角的缩放按钮来导航大型散点图:
| 输入 | 操作 |
|---|---|
| 滚动 | 在 2D 中平移图表 |
| Cmd/Ctrl+滚动 | 以光标为中心放大或缩小 |
| 按住 Space | 切换至拖拽平移模式 |
| 重置按钮 | 返回图表的完整范围 |
重新分析#
如果数据集在分析后发生更改 —— 传入了新图像,或者分析的计数不再与数据集匹配 —— 面板顶部会为所有者和编辑者显示一个 Re-analyze 按钮。
点击 Re-analyze 从头开始重新计算嵌入和 2D 投影。
数据集标签页#
根据数据集状态和你的权限,每个数据集页面最多可以显示六个标签页:
图像标签页#
显示带标注覆盖层的图像图库的默认视图。支持网格、紧凑和表格视图模式。在此处拖放文件以添加更多图像。
类别标签页#
当数据集包含图像且其任务具有类别时,此标签页会显示。
管理数据集的标注类别:
- 类别直方图:显示每个类别标注数量的条形图,按频率排序,带有线性/对数刻度切换开关
- 类别表:可排序、可搜索的表格,包含索引、名称、标注数量和图像数量
- 编辑类别名称:点击任意类别名称即可直接重命名
- 编辑类别颜色:点击颜色样本即可更改类别颜色
- 添加新类别:使用底部的输入框添加类别
- 合并类别:选择两行或多行并点击
Merge into one - 删除类别:选择一行或多行并点击
Delete

如果你的数据集存在类别不平衡(例如,10,000 个“person”标注但只有 50 个“bicycle”),请使用类别直方图上的 Log Scale 切换开关清晰地可视化所有类别。
合并类别#
合并可整合重复或重叠的标签 —— 例如将 car、automobile 和 vehicle 折叠为一个类别:
- 使用行复选框选择两个或更多类别
- 点击表头中的
Merge into one,或右键点击所选项 - 选择所选类别中的哪一个作为其他类别合并入的目标
- 确认
属于源类别的每个标注都会被重新分配给目标类别,并且源类别将被移除。不会删除任何标注,因此数据集的总标注数量保持不变。
删除类别#
- 使用行复选框选择一个或多个类别
- 点击表头中的
Delete,或右键点击所选项 - 确认
删除类别会移除该类别及其所有标注。对于分类数据集,标签会被移除,但图像会保留,变为未标注状态。
类别 ID 是基于位置的。合并或删除类别会使每个更高类别的索引向下移动以填补空缺,因此在更改之前编写的导出和标签文件将不再与新索引对齐。如果需要旧的编号,请先创建一个版本。
类别计数是根据最多 100,000 张图像计算的。在较大的数据集上,直方图上方会出现一条提示:“基于该数据集的 100,000 张图像子集。”
图表标签页#
当数据集包含图像时,会出现此标签页。
从你的数据集中自动计算的统计数据:
图表按此顺序出现,当数据集没有相关数据时,每个图表都会被省略 —— 原始图像数据集不显示标注图表,而 Points per Instance 仅对分割和姿态数据出现:
| 图表 | 描述 |
|---|---|
| 数据集划分分布 | 训练集/验证集/测试集图像数量及标注百分比的圆环图 |
| 热门类别 | 前 10 个最频繁标注类别的圆环图,其余部分显示为“其他” |
| 图像尺寸 | 图像宽度和高度分布直方图(重叠显示),带有均值标注 |
| 图像文件大小 | 图像文件大小分布直方图 |
| 2D 图像尺寸 | 带有长宽比参考线的宽度与高度 2D 热力图 |
| 注释位置 | 边界框中心位置的 2D 热力图 |
| 图像格式 | 源图像格式分布(JPG、PNG 等) |
| 边界框尺寸 | 边界框宽度和高度直方图(重叠显示) |
| 每张图像的对象数 | 每张图像注释数量的直方图 |
| 每个实例的点数 | 每个注释(分割/姿态)的多边形顶点或关键点数量 |

平台会缓存计算出的统计信息,并在图像、标注、类别或划分发生更改时使其失效。在大于 100,000 张图像的数据集上,图表是根据 100,000 张图像的子集计算得出的,这会在网格上方注明。
点击任意热力图上的展开按钮以全屏模式查看。这能提供更大、更详细的视图,有助于理解大型数据集中的空间模式。
模型标签页#
在可搜索的表格中查看在此数据集上训练的所有模型:
| 列 | 描述 |
|---|---|
| 名称 | 带有链接的模型名称 |
| 项目 | 带有图标的父项目 |
| 版本 | 训练所使用的不可变数据集版本(如有) |
| 状态 | 训练状态徽章 |
| 任务 | YOLO 任务类型 |
| Epochs | 最佳 epoch / 总 epoch 数 |
| mAP50-95 | 平均精度均值 |
| mAP50 | IoU 为 0.50 时的 mAP |
| 已创建 | 创建日期 |

错误标签页#
此标签页仅在有一个或多个文件处理失败时出现。
处理失败的图像会在此处列出,并包含:
- 错误横幅:失败图像的总数和指导信息
- 错误表格:文件名、用户友好的错误描述、修复提示和预览缩略图
- 常见错误包括文件损坏、格式不支持、图像太小(最小 28px)以及不支持的颜色模式

常见处理错误
| 错误 | 原因 | 修复 |
|---|---|---|
| 无法读取图像文件 | 文件损坏或格式不受支持 | 从图像编辑器重新导出 |
| 不完整或已损坏 | 文件在传输过程中被截断 | 重新下载原始文件 |
| 不支持的图像格式 | 平台无法解码的格式 | 转换为 JPG、PNG 或 WebP |
| 文件权限错误 | 文件被锁定或受读取保护 | 解锁文件并重新上传 |
| 图像太小 | 最小尺寸低于 28px | 使用更高分辨率的源图像 |
| 不支持的颜色模式 | CMYK 或索引颜色模式 | 转换为 RGB 模式 |
版本标签页#
为你的数据集创建不可变的 NDJSON 快照,以实现可复现的训练。每个版本都会记录创建时的图像数量、类别数量、注释数量和文件大小。
| 列 | 描述 |
|---|---|
| 版本 | 版本号 (v1, v2, ...) |
| 描述 | 用户提供的描述(可编辑) |
| 图像 | 快照时的图像数量 |
| 类别 | 快照时的类别数量 |
| 注释 | 快照时的注释数量 |
| 大小 | NDJSON 导出文件大小 |
| 已创建 | 版本创建时间 |
| 操作 | 下载或恢复 |
创建版本:
- 打开 Versions 标签页
- 可选择输入描述(例如:“添加了 500 张训练图像”或“修复了错误标签的类别”)
- 点击新版本
- 新版本会出现在表格中
每个版本都按顺序编号(v1、v2、v3...)并且是不可变的 —— 版本无法编辑或移除,只能更改其描述。随时可以使用行操作来下载或恢复任何版本。
恢复操作会用所选的快照替换数据集当前的图像、划分、类别和标注,并且此操作无法撤消,除非你首先将当前状态保存为另一个版本。数据集在重建时会锁定在 processing 状态。恢复期间不会重新上传任何内容,因此即使在大型数据集上,恢复通常也很快。
在云训练对话框中启用保存数据集版本,以将模型链接到用于训练的精确数据集。当数据集内容未更改时,平台会复用匹配的版本,仅在内容更改时才创建新版本。
版本创建和恢复功能在数据集达到 ready 状态后可用。版本不适用于连接的云数据集或 On Premise 数据集。
在对数据集进行重大更改(添加图像、修复注释或重新平衡划分)前后创建一个版本。这使你能够对比不同数据集状态下的模型性能。
显示的大小是 NDJSON 导出文件的大小,其中包含图像 URL 和标注 —— 而不是图像本身。实际图像数据是单独存储的并通过签名 URL 进行访问。快照文件仍然计入你的工作区存储配额,因此如果你没有剩余空间,版本创建将失败。
导出数据集#
从数据集标题或版本标签页下载 NDJSON,即可导出数据集以供离线使用。
导出步骤:
- 点击数据集标题中的 Download 按钮(下载图标)
- 直接下载当前的 NDJSON 快照
- 当你需要一个可以稍后重新下载的不可变编号快照时,请使用 Versions(版本)选项卡
NDJSON 格式每行存储一个 JSON 对象。第一行包含数据集元数据,随后每行对应一个图像:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}当 NDJSON 文件导入到 Platform 时,可选的图像级 metadata 对象会被保留。你可以在图像的全屏信息面板中检查或编辑它。对于程序化的归档上传,提取数据集数据 API 接受等效的 imageMetadata 路径映射。
姿态数据集在数据集标题行中也包含一个 kpt_shape 字段,当未预先设置时,它会从标注中推断出来。
深度导出在数据集行中声明 "task": "depth" 和 "depth_scale": 1000。每张图像行包含一个用于其配对的纯 uint16 PNG 的 depth.url。Ultralytics 会并发下载图像和深度 URL,并写入具有相同比例的训练 YAML,因此 NDJSON 文件可以直接传递给 model.train(data=...)。
导出的 NDJSON 中的图像 URL 是带签名的,有效期为 7 天。当数据集未更改时,Platform 会重命名长达 6 天的缓存导出,因此新鲜下载始终至少有一天的剩余有效期。如果你需要更早获取新 URL,请更改数据集或创建新版本。
On Premise 数据集不支持导出,其图像字节从不到达 Platform。
有关完整规范,请参阅 Ultralytics NDJSON 格式文档。
图像操作#
快速操作#
右键单击 Grid(网格)或 Compact(紧凑)视图中的任意图像以访问快捷操作:
| 操作 | 描述 |
|---|---|
| Move to Split(移动至拆分) | 将图像重新分配到 Train(训练)、Val(验证)或 Test(测试)拆分 |
| 下载 | 下载原始图像文件 |
| Delete(删除) | 从数据集中删除该图像 |

图像上下文菜单仅针对单个图像进行操作。如需对多个图像进行批量操作,请使用带有复选框选择的 Table(表格)视图。
批量移动至拆分#
将选定的图像重新分配到同一数据集内的不同拆分中:
- 切换到 Table(表格)视图
- 使用复选框选择图像
- 右键单击以打开上下文菜单
- 选择
Move to split> Train、Validation 或 Test
你也可以将图像拖放到网格视图中的划分过滤选项卡上。如果移动图像会与目标划分中已存在的相同图像冲突,Platform 会询问是跳过、保留两者还是替换。
将所有图像上传到一个数据集,然后使用批量移动至拆分功能将子集组织到训练、验证和测试拆分中。
拆分重新分配#
使用自定义比例重新分配训练、验证和测试拆分中的所有图像:
- 单击数据集工具栏中的 split bar(拆分栏)以打开 Redistribute Splits(重新分配拆分)对话框
- 使用以下任意一种方法调整拆分百分比
- 查看实时图像计数预览以确认分配情况
- 单击 Apply(应用)以根据你的百分比随机重新分配所有图像
该对话框提供了三种设置目标划分比例的方法:
| 方法 | 描述 |
|---|---|
| Drag(拖动) | 拖动彩色段之间的手柄以直观地调整拆分边界 |
| Type(输入) | 编辑任何拆分的百分比输入(其他两个拆分会自动按比例重新平衡) |
| Auto(自动) | 一键立即设置 80/20 的训练/验证拆分,并将测试拆分设置为 0% |
实时预览显示了在应用之前每种拆分将包含的确切图像数量。
单击 Auto(自动)按钮可立即设置建议的 80/20 训练/验证拆分。这是最常见的训练比例。
批量删除#
一次删除多个图像:
- 在表格视图中选择图像
- 右键点击并选择
Delete,或者按下Cmd/Ctrl+Delete - 确认删除
数据集 URI#
使用 ul:// URI 格式引用平台数据集(请参阅使用平台数据集):
ul://username/datasets/dataset-slug你也可以直接粘贴数据集或模型的网页 URL(例如 https://platform.ultralytics.com/username/datasets/dataset-slug);它会自动重写为 ul:// URI。传递数据集列表可以依次微调各个基础模型,例如 model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"])。
使用此 URI 在任何地方训练模型:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100ul:// URI 在任何环境中均可工作:
- 本地机器:在你的硬件上进行训练,数据会自动下载
- Google Colab:在笔记本中访问你的 Platform 数据集
- 远程服务器:在云端虚拟机上进行训练,并可完全访问数据集
可用许可#
该 Platform 支持以下数据集许可:
| 许可 | 类型 |
|---|---|
| 无 | 未选择许可 |
| CC0-1.0 | 公有领域 |
| PDM-1.0 | 公有领域 |
| CC-BY-2.5 | 许可型 |
| CC-BY-4.0 | 许可型 |
| CC-BY-NC-2.0 | 非商业性 |
| CC-BY-SA-4.0 | Copyleft(著作权左) |
| CC-BY-NC-4.0 | 非商业性 |
| CC-BY-NC-SA-3.0 | Copyleft(著作权左) |
| CC-BY-NC-SA-4.0 | Copyleft(著作权左) |
| CC-BY-ND-4.0 | 禁止衍生 |
| CC-BY-NC-ND-4.0 | 非商业性 |
| Apache-2.0 | 许可型 |
| MIT | 许可型 |
| AGPL-3.0 | Copyleft(著作权左) |
| GPL-3.0 | Copyleft(著作权左) |
| 仅限研究 | 受限 |
| 其他 | 自定义 |
当克隆带有 copyleft 许可证(AGPL-3.0、GPL-3.0、CC-BY-SA-4.0、CC-BY-NC-SA-3.0、CC-BY-NC-SA-4.0)的数据集时,克隆体将继承该许可证,且许可证选择器将被锁定。
可见性设置#
控制谁可以看到你的数据集:
| 设置 | 描述 |
|---|---|
| Private(私有) | 你和被授权的工作区成员可以访问 |
| Public(公开) | 任何人都可以查看,包括从 Explore 页面 |
可见性是在 New Dataset 对话框中创建数据集时使用切换开关设置的。公开数据集在探索页面上可见。
编辑数据集#
数据集元数据直接在数据集页面内进行在线编辑——无需对话框:
- 名称:点击数据集名称进行编辑。更改会在失去焦点或按下
Enter时自动保存。名称限制为 100 个字符。 - 描述:点击描述(或“Add a description...”占位符)进行编辑。更改会自动保存。描述限制为 1,000 个字符。
- Task type(任务类型):单击任务徽章以选择不同的任务类型。
- License(许可):单击许可选择器以更改数据集许可。
- 图标:点击数据集图标上传你自己的图片、将数据集自身的某张图片设为图标,或者选择一个字母和颜色。
每张图像将所有任务类型的标注存储在一起。更改数据集任务类型可控制在编辑器中可见、并包含在导出和训练中的标注。其他任务类型的标注会保留在数据库中,并在你切回时重新出现。深度是个例外:它的真值是一个配对文件而不是标注,因此数据集只有在不包含图像时才能切换到深度或从深度切出——请改用重新导入。
自定义元数据#
打开更多操作并选择信息以查看以下两个部分:
- Ultralytics 元数据:只读的 Platform 详情,例如数据集 ID、所有者、任务、图像和标注数量、存储区域以及时间戳
- 自定义元数据:你自己的 JSON 对象,用于溯源、采集条件、客户 ID、治理或其他上下文数据
工作区查看者可以检查元数据,而拥有编辑权限的成员可以替换自定义元数据对象。序列化元数据对象限制为 500,000 个字符,每个顶级键限制为 128 个字符。保存空对象({})以清除自定义元数据。
克隆数据集#
当查看你不拥有的公开数据集时,点击 Clone Dataset 打开克隆对话框。检查目标工作区、名称、可见性和许可证,然后确认克隆。此副本包含所有图像、标注和类别定义。在默认可见性为公开的工作区中,公开源数据集默认保持公开;企业工作区克隆默认设为私有。如果原始数据集具有 copyleft 许可证,克隆将继承它且许可证选择器会被锁定。
如果目标别名已被占用,系统会自动重命名,且克隆需要有足够的剩余存储配额来容纳副本。
收藏与分享#
- 收藏 (Star):点击星标按钮以收藏数据集。收藏数量对所有用户可见。
- 分享:对于公共数据集,点击分享按钮以复制链接、获取嵌入代码片段或分享到社交平台。
删除数据集#
删除你不再需要的数据集:
- 打开数据集标题中的 更多操作(
…按钮) - 选择 删除数据集
- 在对话框中确认:“这会将 [name] 移至回收站。你可以在 30 天内将其恢复。”
同一个菜单中还包含 信息(打开自定义元数据中所述的元数据对话框)以及 刷新(从服务器重新读取数据集)。
已删除的数据集会移至回收站,而不是被永久删除。你可以在 30 天内从 Settings > Trash 恢复它们。
基于数据集进行训练#
直接从你的数据集开始训练:
- 在数据集页面上点击
New Model - 选择一个项目或创建一个新项目
- 配置训练参数
- 开始训练
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff有关详细信息,请参阅云训练。
常见问题解答#
你的数据会在你选择的区域(美国、欧盟或亚太地区)进行处理和存储。图像处理如下:
- 验证格式和大小
- 如果最小尺寸低于 28px,则会被拒绝
- 如果大于 4096px,则会进行标准化处理(保持宽高比;编码以优化存储)
- 采用去重存储,因此相同的图片只保留一份
- 生成 256px 的 WebP 缩略图以加快浏览速度
Ultralytics Platform 高效管理存储:
- 去重:同一数据区域内的相同图像只存储一次
- 完整性:验证上传数据的数据完整性
- 效率:克隆会复用已存储的图片而不是复制它们,同时仍然计入目标工作区的存储配额
- 区域性:数据保留在你选择的区域(美国、欧盟或亚太地区)
可以。将文件拖放到数据集图库中,或者点击页面标题中的上传图标,这会直接打开你浏览器的原生文件选择器。处理完成后会自动计算新的统计信息。
使用批量“移动到拆分集”功能:
- 在表格视图中选择图像
- 右键点击并选择
Move to split - 选择目标拆分集(训练集、验证集或测试集)
Ultralytics Platform 支持 YOLO 标签、COCO JSON、Ultralytics NDJSON 以及原始图片上传。系统会检测到 Pascal VOC XML 标签,但不会导入:
每个图像一个带有归一化坐标(0-1 范围)的
.txt文件:任务 格式 示例 检测 class cx cy w h0 0.5 0.5 0.2 0.3分割 class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9姿态 class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9分类 目录结构 train/cats/、train/dogs/姿态可见性标志:0=未标注,1=已标注但被遮挡,2=已标注且可见。
可以。每张图像将所有 6 种标注任务类型(detect、segment、semantic、classify、pose、OBB)的标注存储在一起。你可以随时切换数据集的活动任务类型,而不会丢失现有的标注。只有与活动任务类型匹配的标注才会显示在编辑器中并包含在导出和训练中——其他任务的标注会得到保留,并在你切回时重新出现。
有:
限制 值 每个数据集的类别数 25,000 每张图片的标注数 10,000 每个标注的坐标数 10,000 数据集名称 100 个字符 数据集描述 1,000 个字符 自定义元数据 500,000 个序列化字符 元数据顶级键 128 个字符