Ultralytics YOLO27:

数据集#

Ultralytics Platform 数据集为管理训练数据提供了简化的解决方案。上传后,平台会自动处理图像、标签和统计信息。

处理完成后,如果数据集在 train 划分中至少包含一张图像,在 valtest 划分中的任一个至少包含一张图像,并且至少包含一张已标注图像,就可以开始训练。满足这三个条件时,数据集标题会显示 Ready 徽章,否则显示 Not Ready 徽章——点击徽章即可准确查看缺少哪个条件。

使用代理收集图像#

当模型检测满足某个条件(例如置信度在所选范围内)时,使用 代理 将图像添加到数据集。将条件连接到 数据集 块并选择你可以编辑的目标位置。图像将以无标签状态到达 train 拆分集中;现有的副本将被跳过。使用现有的 标注编辑器 审查并标注图像。

上传数据集#

Ultralytics Platform 支持多种上传格式,使用更加灵活。

数据已经存储在其他位置?

如果你的数据集已存储在 Roboflow 中,可以使用 Integrations 直接导入,无需手动导出或重新上传。Google Cloud StorageAmazon S3Azure Blob Storage 中的数据可以通过 Cloud storage 原位使用。Enterprise 工作区可以使用 On Premise 为本地数据建立索引并进行训练,无需将像素数据发送到 Platform。

支持的格式#

格式扩展名备注最大尺寸
JPEG.jpg.jpeg最常见,推荐使用50 MB
PNG.png支持透明度50 MB
WebP.webp现代格式,压缩效果好50 MB
BMP.bmp未压缩50 MB
TIFF.tiff.tif高质量50 MB
HEIC.heiciPhone 照片50 MB
AVIF.avif下一代格式50 MB
JP2.jp2JPEG 200050 MB
DNG.dng相机原始格式50 MB
MPO.mpo多图片对象50 MB

视频编解码器支持#

仅凭文件扩展名并不足够:如果视频的编解码器在处理期间无法解码,视频仍可能处理失败。

使用 H.264 MP4

MP4 容器中的 H.264 视频具有最广泛的解码器支持,是最稳妥的选择。如果视频无法处理,请使用 FFmpeg 重新编码:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

准备数据集#

平台支持 Ultralytics YOLOCOCO语义 PNG 掩码深度数据集Ultralytics NDJSON 以及原始(未标注)上传:

使用包含 data.yaml 文件的标准 YOLO 目录结构:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

YAML 文件定义数据集配置:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
原始上传

Raw:上传未标注图像(无标签)。如果你计划使用标注编辑器直接在平台上进行标注,这种方式非常有用。

扁平目录结构

你也可以在没有明确划分文件夹的情况下上传图像。Platform 会在上传期间遵循当前激活的划分目标。如果未设置划分目标,并且上传后 val 为空,或深度数据集的配对图不足两组,则非分类数据集会自动将训练图像移至 val,使数据集立即可训练。分类数据集会被跳过,因为它们使用基于目录的划分。你始终可以通过批量移动到划分重新分配划分稍后重新分配图像。

格式自动检测

系统会自动检测格式:包含 namestrainval 键的 data.yaml 的数据集会被视为 YOLO。包含 COCO JSON 文件(其中含有 imagesannotationscategories 数组)的数据集会被视为 COCO。.ndjson 导出文件会作为 Ultralytics NDJSON 导入。仅包含图像且没有标注的数据集会被视为原始数据集。

当归档文件包含多个 YAML 文件时,Platform 会优先选择最接近归档根目录的标准名称(data.yamldata.ymldataset.yamldataset.yml)。每个归档文件只保留一个名称清晰的 YAML 文件,以避免歧义。

不导入 Pascal VOC XML

系统会检测 Pascal VOC XML 格式的标签文件,但其标注不会被导入,图像会作为未标注图像上传。上传开始前,Platform 会向你发出警告("Pascal VOC labels detected")。请先将 VOC XML 转换为 YOLO 或 COCO;详见格式转换工具

如果标签引用了类别 ID,但未提供类别名称,Platform 会生成连续的占位名称(class0class1、…),你之后可以在Classes tab中重命名这些名称。

有关特定任务的格式详情,请参阅支持的任务数据集概览

上传流程#

创建数据集:

  1. 在侧边栏中导航至 Annotate
  2. 点击 New Dataset
  3. 选择一个数据源选项卡(见下方的数据源
  4. 添加名称——URL slug 会自动生成,也可以编辑——并可选择添加描述
  5. 选择任务类型(见支持的任务)、可选许可证(见可用许可证)以及可见性(公开或私有)
  6. 对于本地文件,点击 Create & Upload;对于 URL 或已连接的数据源,点击 Create & Import;或者点击 Create Dataset 以空数据集开始

Ultralytics Platform Datasets Upload Dialog Task Selector

要向现有数据集添加文件,请打开该数据集页面,然后将文件拖放到图库中,或者点击页面标题中的上传图标。上传图标会直接打开浏览器的原生文件选择器,因为数据集任务已经定义。

数据来源#

New Dataset 对话框提供四种来源:

来源描述
上传拖入文件或浏览选择文件——图像、视频、归档文件或 NDJSON
URL粘贴指向 .zip.tar.tar.gz.tgz.ndjson 文件的直接链接;Platform 会在服务器端下载并摄取该文件
Cloud原位使用 Google Cloud StorageAmazon S3Azure Blob Storage 中的数据(Pro 和 Enterprise)
On Premise通过 On Premise 工作节点,在数据始终不离开你自己的设备的情况下建立索引并进行训练(Enterprise)
URL 导入限制

URL 导入同时受套餐的单次上传限制(Free 10 GB / Pro 20 GB / Enterprise 50 GB)和剩余存储配额限制,以较小者为准。链接必须可通过 HTTP 或 HTTPS 公开访问,并且以受支持的扩展名结尾。

上传开始前#

Platform 会在上传任何内容之前在浏览器中验证你的文件,因此常见问题会立即显现,而不是在长时间传输后才发现。系统会检查归档文件是否损坏、为空或受密码保护,以及 YAML 语法是否存在错误,并按名称列出超大文件。

随后可能会出现两个对话框:

当归档文件声明了类别名称,而你的数据集已经包含类别时,Map imported classes 对话框会为每个传入类别列出一行。对于每个类别,你可以选择要合并到的现有类别、创建新类别,或跳过该类别。名称完全匹配的类别会被预先选中,被跳过的类别及其标注不会被导入。

上传后,平台会自动处理你的数据:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. 验证:检查格式和大小
  2. 规范化:将大图调整大小(最大 4096px,最小尺寸 28px),将灰度图扩展为 RGB,将透明背景铺到白色背景上,并应用 EXIF 方向
  3. 缩略图:生成 256px WebP 预览图
  4. 标签解析:提取 YOLO、COCO 和 NDJSON 标签
  5. 统计信息:计算类别分布和图像尺寸
存储的图像编码

如果不需要调整大小或更改颜色,AVIF 和 WebP 原图会逐字节存储。其他所有图像都会重新编码——WebP 源文件仍保留为 WebP,其他所有格式(JPEG、PNG、BMP、TIFF、HEIC、JP2、DNG、MPO)都会以质量 92 转换为 JPEG。原始文件名和源扩展名会作为元数据保留。

Ultralytics Platform 数据集上传进度条

上传前验证

你可以在上传前在本地验证数据集:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
图像尺寸要求

图像最短边必须至少为 28px。小于此尺寸的图像会在处理过程中被拒绝。最长边大于 4096px 的图像会在保持宽高比的情况下自动调整大小。

浏览图像#

以多种布局查看数据集图像。

从图库工具栏打开 聚类面板,以交互式 2D 散点图的形式探索数据集。

查看描述
网格带有标注叠加层的缩略图网格(默认)
紧凑更小的缩略图,便于快速浏览
表格显示缩略图、文件名、尺寸、大小、数据集划分、类别和标签数量的列表

带标注的 Ultralytics Platform 数据集图库网格视图

排序和筛选#

你可以对图像进行排序和筛选,以便高效浏览:

每个选项可在升序(↑)和降序(↓)之间切换:

排序描述
创建时间 ↑/↓上传顺序(默认 ↓)
名称 ↑/↓文件名按字母排序
高度 ↑/↓以像素为单位的图像高度
宽度 ↑/↓以像素为单位的图像宽度
大小 ↑/↓磁盘上的文件大小
标注 ↑/↓每张图像的标注数量
大型数据集

对于超过 100,000 张图像的数据集,为保持图库响应速度,会隐藏名称、宽度、高度和大小排序。创建时间和标注数量排序仍然可用。

查找未标注图像

Annotations 筛选器设置为 Unannotated,即可快速查找仍需标注的图像。这对于需要跟踪标注进度的大型数据集尤其有用。

搜索自定义元数据

搜索框位于图库工具栏右侧,可筛选每种视图模式——网格、紧凑和表格。它会匹配图像文件名(文件扩展名可选),以及自定义元数据键、标量值和数组条目,因此名为 img_0042 且包含 {"ship_type": "yacht"} 的图像,通过搜索 img_0042yacht 均可找到。

不会匹配嵌套在子对象中的值。粘贴 24 个字符的图像 ID 会直接查找该图像,跳过文本搜索。

全屏查看器#

点击任意图像,即可打开全屏查看器,其中包含:

  • 导航:使用箭头键或缩略图预览进行浏览
  • 图像信息:查看平台生成的属性、自定义元数据,以及 EXIF 等嵌入式文件元数据
  • 自定义元数据:所有者和编辑者可以添加或替换 JSON 对象,其中嵌套值最多包含 500,000 个序列化字符,顶层键最多包含 128 个字符
  • 标注:切换标注叠加层的可见性
  • 类别明细:显示每个类别的标签数量及颜色指示器
  • 标注:拥有编辑权限时,在桌面设备上打开全屏查看器后,标注控件会立即处于激活状态
  • 下载:下载原始图像文件
  • 删除:从数据集中删除图像
  • 缩放:使用 Cmd/Ctrl+ScrollCmd/Ctrl++Cmd/Ctrl+= 放大,使用 Cmd/Ctrl+- 缩小
  • 重置视图:使用 Cmd/Ctrl + 0 或重置按钮,使图像适应查看器
  • 平移:按住 Space 并拖动,以在缩放后平移画布
  • 像素视图:切换像素化渲染,以便近距离检查
  • 深度幕帘:在深度数据集中,可拖动分隔线,在 RGB 图像与其彩色深度图之间擦除切换

带元数据面板的 Ultralytics Platform 数据集全屏查看器

按数据集划分筛选#

按数据集划分筛选图像:

划分用途
训练用于模型训练
Val用于训练期间的验证
Test用于最终评估

聚类#

Clustering 面板会将数据集投影为交互式 2D 散点图,视觉上相似的图像会彼此靠近。你可以利用它发现图像簇、识别重复项和离群点,并检查数据集中各数据集划分或类别的分布,而无需离开图库。在任意数据集页面的图库工具栏中,点击散点图图标即可打开该面板。

Ultralytics Platform 数据集聚类空状态

运行分析#

开始分析:

  1. 打开数据集,然后点击图库工具栏中的散点图图标
  2. 点击 Analyze Dataset
  3. 等待进度条完成——结果会显示在同一面板中

分析在后台分两个阶段运行:Computing embeddingsClustering。根据数据集大小,可能需要几分钟。你可以关闭面板或离开页面,稍后再回来。

分析要求

数据集必须至少包含 20 张、最多包含 200,000 张未发生错误的图像才能进行分析。由云存储或本地部署存储支持的已连接数据集目前尚不受支持。

可视化#

分析完成后,面板会显示所有已分析图像的 2D 散点图、图例和点计数器。图库筛选器(数据集划分、类别、已标注/未标注)会将筛选范围之外的点调暗,方便你专注于所需子集——此时计数器会显示 visible / total points

Ultralytics 平台数据集聚类散点图

颜色依据#

使用面板工具栏中的 Color by 下拉菜单更改数据点的着色方式。你可以随时切换视图模式——图表会立即重新着色,帮助你查看各个聚类中的数据集划分、类别或图像属性分布:

选项着色
划分训练 / 验证 / 测试
类别每张图像中的第一个标注类别
宽度图像宽度
高度图像高度
大小文件大小
标注每张图像的标注数量

Ultralytics 平台数据集聚类颜色模式

套索选择#

在某个区域周围绘制自由形状的选区,以突出显示图表中的点。图库会筛选出匹配的图像,你可以使用常用的图像操作检查、重新标注、移动或删除这些图像。

清除选择

图表上方的标签会显示已选点的数量——点击 × 清除套索,并返回完整的图库视图。

选择大小

一次套索选择最多解析 1,000 张图像。如果你的选择匹配了更多图像,Platform 会显示其中采样的 1,000 张,并建议你绘制更小的区域。

平移和缩放#

你可以直接使用鼠标和键盘浏览大型散点图,也可以使用图表左下角的缩放按钮:

输入操作
滚动在 2D 中平移图表
Cmd/Ctrl+滚动以光标位置为中心放大或缩小
按住空格键切换到拖动平移模式
重置按钮返回图表的完整范围

重新分析#

如果你的数据集在分析后发生变化——例如新增图像,或已分析数量不再与数据集匹配——所有者和编辑者可以在面板顶部看到 Re-analyze 按钮。

点击 Re-analyze,从头重新计算嵌入和 2D 投影。

查找相似图像#

相同的嵌入支持跨公共数据集的相似性搜索。在可编辑的数据集中,右键单击网格紧凑视图中的图像(或表格视图中单个选定的行),然后选择查找相似图像。该对话框最多列出 24 个最近的公共图像及其源数据集、许可证和相似度得分,排除了数据集中已有的图像以及选定图像在其他数据集中的副本。选择你想要的图像并点击添加到数据集:它们将作为未标注图像添加到 train 拆分中,计入你的存储空间,并准备好进行标注

没有嵌入的图像——在尚未分析的数据集中,或者在上次分析之后添加的图像——显示 Analyze this dataset in Clustering to find similar images。该对话框在连接的数据集上不可用。模型的每张图像验证诊断从其表现最差的图像开始运行相同的搜索。

数据集选项卡#

每个数据集页面最多可显示六个选项卡,具体取决于数据集状态和你的权限:

图像选项卡#

默认视图,显示带有标注叠加层的图像图库。支持网格、紧凑和表格视图模式。将文件拖放到此处即可添加更多图像。

类别选项卡#

当数据集包含图像且其任务包含类别时,会显示此选项卡。

管理数据集的标注类别:

  • 类别直方图:显示每个类别标注数量的柱状图,按频率排序,并支持在线性/对数刻度之间切换
  • 类别表格:可排序、可搜索的表格,包含索引、名称、标注数量和图像数量
  • 编辑类别名称:点击任意类别名称即可直接重命名
  • 编辑类别颜色:点击颜色样本即可更改类别颜色
  • 添加新类别:使用底部的输入框添加类别
  • 合并类别:选择两行或更多行,然后点击 Merge into one
  • 删除类别:选择一行或更多行,然后点击 Delete

Ultralytics 平台数据集类别选项卡直方图和表格

不平衡数据集的对数刻度

如果你的数据集存在类别不平衡(例如有 10,000 个 "person" 标注,但只有 50 个 "bicycle" 标注),请使用类别直方图中的 Log Scale 开关,以清晰地可视化所有类别。

合并类别#

合并会整合重复或重叠的标签——例如将 carautomobilevehicle 合并为一个类别:

  1. 使用行复选框选择两个或更多类别
  2. 点击表头中的 Merge into one,或右键点击所选内容
  3. 选择所选类别中的一个作为其他类别合并到的目标类别
  4. 确认

属于源类别的每个标注都会重新分配到目标类别,源类别也会被移除。不会删除任何标注,因此数据集的标注总数保持不变。

删除类别#

  1. 使用行复选框选择一个或更多类别
  2. 点击表头中的 Delete,或右键点击所选内容
  3. 确认

删除类别会移除该类别及其所有标注。对于分类数据集,标签会被移除,但图像仍会保留,并变为无标注状态。

类别索引变化

类别 ID 按位置确定。合并或删除类别时,所有更高的类别索引都会向下移动以填补空缺,因此在更改前写出的导出文件和标签文件将不再与新索引对应。如果需要保留旧编号,请先创建一个版本

统计采样

类别计数最多根据 100,000 张图像计算。在更大的数据集上,直方图上方会显示“基于此数据集的 100,000 张图像子集”。

图表选项卡#

当数据集包含图像时,会显示此选项卡。

根据你的数据集自动计算的统计信息:

图表按以下顺序显示;当数据集没有相应数据时,会省略对应图表——原始图像数据集不会显示标注图表,Points per Instance 仅在分割和姿态数据中显示:

图表描述
划分分布环形图,显示训练/验证/测试图像数量和已标注百分比
主要类别环形图,显示频率最高的 10 个标注类别,其余类别归为“其他”
图像尺寸图像宽度和高度分布的直方图(叠加显示),并显示平均值
图像文件大小图像文件大小分布的直方图
图像尺寸 2D宽度与高度的 2D 热力图,并带有宽高比参考线
标注位置边界框中心位置的 2D 热力图
图像格式源图像格式的分布(JPG、PNG 等)
边界框尺寸边界框宽度和高度的直方图(叠加显示)
每张图像的对象数每张图像标注数量的直方图
每个实例的点数每个标注的多边形顶点数或关键点数(分割/姿态)

Ultralytics 平台数据集图表选项卡统计网格

统计信息缓存

Platform 会缓存计算出的统计信息,并在图像、标注、类别或划分发生变化时使其失效。对于超过 100,000 张图像的数据集,图表根据 100,000 张图像的子集计算,网格上方会对此进行说明。

全屏热力图

点击任意热力图上的展开按钮,即可全屏查看。这样可以获得更大、更详细的视图,有助于理解大型数据集中的空间模式。

模型选项卡#

在可搜索的表格中查看在此数据集上训练的所有模型:

描述
名称带链接的模型名称
项目带图标的父项目
版本用于训练的不可变数据集版本(如果有)
状态训练状态徽章
任务YOLO 任务类型
训练轮数最佳训练轮数 / 总训练轮数
mAP50-95平均精度
mAP50IoU 为 0.50 时的 mAP
创建时间创建日期

Ultralytics Platform Datasets Models Tab Trained Models Table

错误选项卡#

仅当一个或多个文件处理失败时,此选项卡才会显示。

处理失败的图像会列在这里,并包含:

  • 错误横幅:失败图像的总数和指导信息
  • 错误表格:文件名、易于理解的错误描述、修复提示和预览缩略图
  • 常见错误包括文件损坏、格式不受支持、图像过小(最小 28px)以及不受支持的色彩模式

Ultralytics Platform Datasets Errors Tab Processing Failures

常见处理错误
错误原因修复方法
无法读取图像文件文件损坏或格式不受支持从图像编辑器重新导出
文件不完整或已损坏文件在传输过程中被截断重新下载原始文件
不受支持的图像格式平台无法解码的格式转换为 JPG、PNG 或 WebP
文件权限错误文件已锁定或受读保护解锁文件后重新上传
图像过小最小尺寸低于 28px使用更高分辨率的源图像
不受支持的色彩模式CMYK 或索引色模式转换为 RGB 模式

版本选项卡#

创建数据集的不可变 NDJSON 快照,以实现可复现训练。每个版本都会记录创建时的图像数量、类别数量、标注数量和文件大小。

描述
版本版本号(v1、v2、……)
描述用户提供的描述(可编辑)
图像快照创建时的图像数量
类别快照创建时的类别数量
标注快照创建时的标注数量
大小NDJSON 导出文件大小
创建时间版本创建时间
操作下载或恢复

创建版本:

  1. 打开 Versions 选项卡
  2. 可选:输入描述(例如,"添加了 500 张训练图像" 或 "修复了错误标注的类别")
  3. 点击 New Version
  4. 新版本会显示在表格中

每个版本都会按顺序编号(v1、v2、v3……),并且不可变——版本不能编辑或删除,只能更改其描述。你可以随时使用行操作下载或恢复任意版本。

恢复版本

恢复操作会将数据集当前的图像、划分、类别和标注替换为所选快照;除非你先将当前状态另存为其他版本,否则无法撤销。重建期间,数据集会处于 processing 状态并被锁定。恢复过程中不会重新上传任何内容,因此即使数据集很大,恢复通常也很快。

训练期间保存版本

Cloud Training dialog 中启用 Save Dataset Version,将模型关联到训练时使用的确切数据集。当数据集内容未发生变化时,平台会重复使用匹配的版本;只有内容发生变化时才会创建新版本。

仅限就绪数据集

数据集达到 ready 状态后,才能创建和恢复版本。connected 云数据集或 On Premise 数据集不支持版本。

何时创建版本

在对数据集进行重大更改前后创建版本,例如添加图像、修复标注或重新平衡划分。这样你就可以比较模型在不同数据集状态下的性能。

NDJSON 文件大小

显示的大小是 NDJSON 导出文件的大小,其中包含图像 URL 和标注,而不是图像本身。实际图像数据单独存储,并通过签名 URL 访问。快照文件仍会计入你的工作区存储配额,因此如果剩余空间不足,版本创建会失败。

导出数据集#

从数据集页眉或 Versions 选项卡下载 NDJSON,将数据集导出以供离线使用。

导出步骤:

  1. 点击数据集页眉中的 Download 按钮(下载图标)
  2. 直接下载当前 NDJSON 快照
  3. 如果你需要一个可在之后重新下载的不可变编号快照,请使用 Versions 选项卡

Ultralytics Platform Datasets Export Ndjson Download

NDJSON 格式每行存储一个 JSON 对象。第一行包含数据集元数据,随后每行对应一张图像:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

将 NDJSON 文件导入平台时,会保留可选的图像级 metadata 对象。你可以在图像的全屏信息面板中查看或编辑它。对于以编程方式上传存档,Ingest Dataset Data API 接受等效的 imageMetadata 路径映射。

Pose 数据集还会在数据集页眉行中包含 kpt_shape 字段;如果该字段尚未设置,则会根据标注推断。

Depth 导出会在数据集行中声明 "task": "depth""depth_scale": 1000。每个图像行都包含一个 depth.url,对应其配对的纯 uint16 PNG。Ultralytics 会并发下载图像和深度 URL,并以相同的缩放比例写入 训练 YAML,因此可以将 NDJSON 文件直接传递给 model.train(data=...)

签名 URL

导出的 NDJSON 中的图像 URL 带有签名,有效期为 7 天。当数据集未发生变化时,平台会重复使用缓存的导出文件,最长可达 6 天,因此新下载的文件始终至少还剩一天有效期。如果你需要更早获取新的 URL,请更改数据集或创建新版本。

本地部署数据集

On Premise 数据集不支持导出,因为其图像字节数据不会到达平台。

如需完整规范,请参阅 Ultralytics NDJSON format documentation

图像操作#

快速操作#

GridCompact 视图中右键点击任意图像,即可访问快速操作:

操作描述
Move to Split将图像重新分配到 Train、Val 或 Test 划分
查找相似图像在公共数据集中搜索相似图像并添加它们(请参阅查找相似图像
生成相似图像创建该图像最多 16 个 AI 生成的变体(默认四个),并将你保留的变体作为未标注图像添加
Download下载原始图像文件
Delete从数据集中删除图像

Ultralytics Platform Datasets Image Card Context Menu

单张与批量

图像上下文菜单仅作用于单张图像。要对多张图像执行批量操作,请使用带复选框选择功能的 Table 视图。

批量移动到划分#

将选中的图像重新分配到同一数据集中的其他划分:

  1. 切换到 表格 视图
  2. 使用复选框选择图像
  3. 右键单击以打开上下文菜单
  4. 选择 Move to split > 训练验证测试

你也可以在网格视图中将图像拖放到划分筛选标签上。如果移动图像会与目标划分中已有的相同图像发生冲突,Platform 会询问你是跳过、保留两者还是替换。

整理训练/验证划分

将所有图像上传到一个数据集,然后使用批量移动到划分功能,将子集整理到训练、验证和测试划分中。

重新分配划分#

使用自定义比例在训练、验证和测试划分之间重新分配所有图像:

  1. 点击数据集工具栏中的 划分栏,打开 重新分配划分 对话框
  2. 使用以下任一方法调整划分百分比
  3. 查看实时图像数量预览,确认分配结果
  4. 点击 应用,根据你设置的百分比随机重新分配所有图像

Ultralytics Platform Datasets Split Redistribution Dialog

该对话框提供三种设置目标拆分比例的方法:

方法描述
拖动拖动彩色分段之间的控制柄,以直观调整划分边界
输入编辑任意划分的百分比输入值(另外两个划分会自动按比例重新平衡)
自动一键立即设置 80/20 的训练/验证划分,并将测试划分设为 0%

实时预览会显示应用更改前每个划分中将包含的确切图像数量。

快速 80/20 划分

点击 自动 按钮,立即设置推荐的 80/20 训练/验证划分。这是最常用的训练比例。

批量删除#

一次删除多张图像:

  1. 在表格视图中选择图像
  2. 右键单击并选择 Delete,或按 Cmd/Ctrl+Delete
  3. 确认删除

数据集 URI#

使用 ul:// URI 格式引用 Platform 数据集(请参阅使用 Platform 数据集

ul://username/datasets/dataset-slug

你也可以直接粘贴数据集或模型网页 URL(例如 https://platform.ultralytics.com/username/datasets/dataset-slug);它会自动重写为 ul:// URI。传入数据集列表会依次在每个数据集上微调同一个基础模型,例如 model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"])

使用此 URI 从任何位置训练模型:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
使用 Platform 数据随处训练

ul:// URI 可在任何环境中使用:

  • 本地计算机:使用你的硬件进行训练,数据会自动下载
  • Google Colab:在 notebook 中访问你的 Platform 数据集
  • 远程服务器:在云端 VM 上训练,并获得完整的数据集访问权限

可用许可证#

Platform 支持以下数据集许可证:

许可证类型
未选择许可证
CC0-1.0公共领域
PDM-1.0公共领域
CC-BY-2.5宽松型
CC-BY-3.0宽松型
CC-BY-4.0宽松型
CC-BY-NC-2.0非商业用途
CC-BY-NC-3.0非商业用途
CC-BY-NC-4.0非商业用途
CC-BY-SA-3.0相同方式共享
CC-BY-SA-4.0相同方式共享
CC-BY-NC-SA-3.0相同方式共享
CC-BY-NC-SA-4.0相同方式共享
CC-BY-ND-4.0禁止演绎
CC-BY-NC-ND-2.0非商业用途
CC-BY-NC-ND-4.0非商业用途
Apache-2.0宽松型
MIT宽松型
BSD-3-Clause宽松型
AGPL-3.0相同方式共享
GPL-2.0相同方式共享
GPL-3.0相同方式共享
LGPL-3.0相同方式共享
ODbL-1.0相同方式共享
DbCL-1.0需要 ODbL
仅限研究受限
其他自定义
相同方式共享许可证

当克隆带有 copyleft 许可证(AGPL-3.0、GPL-2.0、GPL-3.0、LGPL-3.0、ODbL-1.0、CC-BY-SA-3.0、CC-BY-SA-4.0、CC-BY-NC-SA-3.0、CC-BY-NC-SA-4.0)的数据集时,克隆将继承该许可证,且许可证选择器将被锁定。

可见性设置#

控制谁可以查看你的数据集:

设置描述
私有你和获准的工作区成员可以访问
公开任何人都可以查看,包括从 Explore 页面查看

创建数据集时,你可以在 New Dataset 对话框中使用切换开关设置可见性。公开数据集会显示在 Explore 页面上。

编辑数据集#

数据集元数据可直接在数据集页面中内联编辑,无需对话框:

  • 名称:点击数据集名称进行编辑。更改会在失去焦点或按下 Enter 时自动保存。名称最多包含 100 个字符。
  • 描述:点击描述(或“添加描述...”占位符)进行编辑。更改会自动保存。描述最多包含 1,000 个字符。
  • 任务类型:点击任务徽章,选择其他任务类型。
  • 许可证:点击许可证选择器,更改数据集许可证。
  • 图标:点击数据集图标,上传你自己的图像、将数据集中的某张图像设为图标,或选择字母和颜色。
更改任务类型

每张图像都会同时存储所有任务类型的标注。更改数据集任务类型会控制编辑器中可见的标注,以及导出和训练中包含的标注。其他任务类型的标注会保留在数据库中,切换回来时会重新显示。深度是例外:其真实值是配对文件而不是标注,因此只有在数据集不包含任何图像时,才能切换到深度任务或从深度任务切换回来;请改为重新导入。

自定义元数据#

打开 更多操作,选择 信息,查看以下两个部分:

  • Ultralytics 元数据:只读的 Platform 详细信息,例如数据集 ID、所有者、任务、图像和标注数量、存储区域及时间戳
  • 自定义元数据:你自己的 JSON 对象,可用于记录来源、采集条件、客户 ID、治理信息或其他上下文数据

工作区查看者可以检查元数据,而拥有编辑权限的成员可以替换自定义元数据对象。序列化后的元数据对象最多包含 500,000 个字符,每个顶级键最多包含 128 个字符。保存空对象({})即可清除自定义元数据。

克隆数据集#

查看你不拥有的公开数据集时,点击 Clone Dataset 打开克隆对话框。检查目标工作区、名称、可见性和许可证,然后确认克隆。副本包含所有图像、标注和类别定义。默认可见性为公开的工作区中的公开源数据集默认保持公开;Enterprise 工作区中的克隆数据集默认为私有。如果原始数据集采用相同方式共享许可证,克隆数据集会继承该许可证,并且许可证选择器会被锁定。

如果目标 slug 已被占用,系统会自动重命名;克隆需要有足够的剩余存储配额来容纳副本。

已连接的数据集

云存储本地部署源支持的数据集无法克隆,因为 Platform 不持有其图像字节数据。

收藏和分享#

  • 收藏:点击星标按钮,将数据集加入书签。所有用户都可以看到收藏数。
  • 分享:对于公开数据集,点击分享按钮即可复制链接、获取嵌入代码片段或分享到社交平台。

删除数据集#

删除不再需要的数据集:

  1. 在数据集标头中打开 更多操作 按钮)
  2. 选择 Delete Dataset
  3. 在对话框中确认:"这会将 [name] 移至回收站。你可以在 30 天内恢复它。"

同一菜单中还有 Information,它会打开 Custom Metadata 中所述的元数据对话框,以及 Refresh,用于从服务器重新读取数据集。

回收站与恢复

已删除的数据集会移至回收站,而不会被永久删除。你可以在 30 天内从 Settings > Trash 恢复它们。

在数据集上训练#

直接从数据集开始训练:

  1. 在数据集页面上点击 New Model
  2. 选择一个项目或创建新项目
  3. 配置训练参数
  4. 开始训练
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

详情请参阅 Cloud Training

常见问题#

  • 你的数据会在所选区域(US、EU 或 AP)中进行处理和存储。图像会:

    1. 验证格式和大小
    2. 如果最小尺寸小于 28px,则被拒绝
    3. 如果大于 4096px,则进行归一化处理(保持宽高比;编码以优化存储)
    4. 通过去重进行存储,因此相同的图像只保留一份
    5. 生成 256px 的 WebP 缩略图,以便快速浏览
  • Ultralytics Platform 高效管理存储:

    • 去重:同一数据区域中的相同图像只存储一份
    • 完整性:上传内容会经过数据完整性验证
    • 效率:克隆会复用已存储的图像,而不是复制图像,但仍会计入目标工作区的存储配额
    • 区域性:数据会保留在你选择的区域(US、EU 或 AP)中
  • 可以。将文件拖到数据集图库中,或点击页面标题栏中的上传图标,这会直接打开浏览器的原生文件选择器。处理完成后会自动计算新的统计信息。

  • 使用批量移动到数据集划分功能:

    1. 在表格视图中选择图像
    2. 右键点击并选择 Move to split
    3. 选择目标划分(Train、Validation 或 Test)
  • Ultralytics Platform 支持 YOLO 标签、COCO JSON、Ultralytics NDJSON 和原始图像上传。系统会检测 Pascal VOC XML 标签,但不会导入:

    每张图像对应一个 .txt 文件,使用归一化坐标(0-1 范围):

    任务格式示例
    Detectclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    语义分割class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    姿态class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    分类目录结构train/cats/train/dogs/

    姿态可见性标志:0=未标注,1=已标注但被遮挡,2=已标注且可见。语义数据集还接受 PNG 掩码来代替多边形文件(请参阅语义掩码)。

  • 可以。每张图像会同时存储全部 6 种标注任务类型(检测、分割、语义分割、分类、姿态、OBB)的标注。你可以随时切换数据集的活动任务类型,而不会丢失现有标注。编辑器中只会显示与活动任务类型匹配的标注,导出和训练时也只会包含这些标注;其他任务的标注会被保留,并在你切换回来时重新显示。

  • 是:

    限制
    每个数据集的类别数25,000
    每张图像的标注数10,000
    每个标注的坐标数10,000
    数据集名称100 个字符
    数据集描述1,000 个字符
    自定义元数据500,000 个序列化字符
    元数据顶层键128 个字符
  • 云存储本地部署源读取的数据集会将像素保留在 Platform 外部,因此需要 Platform 拥有图像字节副本的功能不可用:

    特性云连接本地部署
    智能和批量标注不可用不可用
    聚类分析不可用不可用
    克隆不可用不可用
    版本快照不可用不可用
    NDJSON 导出可用不可用
    语义 PNG 掩码导入不可用可用

    浏览、手动标注、类别管理、数据集划分、统计和训练都可以正常使用。

评论