YOLO Vision 2026:

数据集#

Ultralytics Platform 数据集为你管理训练数据提供了一个简化的解决方案。上传后,平台会自动处理图像、标签和统计信息。

一旦处理完成且数据集中在 train 划分中至少包含一张图像、在 valtest 划分中至少包含一张图像,并且至少有一张带标签的图像,数据集便准备好进行训练。当满足这三个条件时,数据集标题会显示一个 Ready 徽章,否则显示一个 Not Ready 徽章 —— 点击徽章即可精确查看缺少哪个条件。

上传数据集#

Ultralytics Platform 接受多种上传格式,以提供灵活性。

已经在其他地方有数据了吗?

如果你在 Roboflow 中已有数据集,请使用集成直接导入它们,无需手动导出或重新上传。Google Cloud StorageAmazon S3Azure Blob Storage 中的数据可以通过云存储在原地使用。企业工作区可以使用本地部署来索引和训练本地数据,而无需将像素发送到平台。

支持的格式#

格式扩展名注意事项最大尺寸
JPEG.jpg.jpeg最常见,推荐使用50 MB
PNG.png支持透明度50 MB
WebP.webp现代格式,压缩效果好50 MB
BMP.bmp未压缩50 MB
TIFF.tiff.tif高质量50 MB
HEIC.heiciPhone 照片50 MB
AVIF.avif下一代格式50 MB
JP2.jp2JPEG 200050 MB
DNG.dng原始相机格式50 MB
MPO.mpo多图片对象50 MB

视频编解码器支持#

仅凭文件扩展名是不够的:如果在处理过程中其编解码器无法解码,视频仍然可能会失败。

使用 H.264 MP4

MP4 容器中的 H.264 视频具有最广泛的解码器支持,是最安全的选。如果视频无法处理,请使用 FFmpeg 对其进行重新编码:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

准备你的数据集#

该平台支持 Ultralytics YOLOCOCO深度数据集Ultralytics NDJSON 以及原始(未标注)上传:

使用包含 data.yaml 文件的标准 YOLO 目录结构:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

YAML 文件定义了你的数据集配置:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
原始上传

原始:上传未标注的图像(无标签)。当你打算使用标注编辑器直接在平台上进行标注时,这非常有用。

扁平目录结构

你也可以在没有显式划分文件夹的情况下上传图像。平台在上传期间会尊重当前的划分目标。如果未设置划分目标且上传导致 val 为空,或者深度配对图少于两张,非分类数据集会自动将训练图像移动到 val,以便数据集能够立即用于训练。分类数据集将被跳过,因为它们使用基于目录的划分。你随时可以使用批量移动到划分划分重新分配来重新分配图像。

格式自动检测

系统会自动检测格式:包含带有 namestrainval 键的 data.yaml 的数据集会被处理为 YOLO。带有 COCO JSON 文件(包含 imagesannotationscategories 数组)的数据集会被处理为 COCO。.ndjson 导出文件会作为 Ultralytics NDJSON 导入。只有图像而没有标注的数据集会被处理为原始数据。

当归档文件包含多个 YAML 文件时,Platform 会优先选择离归档根目录最近的标准名称(data.yamldata.ymldataset.yamldataset.yml)。每个归档文件保留一个命名清晰的 YAML 文件以避免混淆。

Pascal VOC XML 不会被导入

Pascal VOC XML 格式的标签文件会被检测到,但它们的标注不会被导入 —— 图像将作为无标注状态上传。Platform 会在上传开始前发出警告(“检测到 Pascal VOC 标签”)。请先将 VOC XML 转换为 YOLO 或 COCO;参见格式转换工具

如果标签引用了类别 ID 但未提供类别名称,Platform 将生成密集的占位符名称(class0class1……),你稍后可以在类别选项卡中对其进行重命名。

有关特定于任务的格式详细信息,请参阅支持的任务数据集概述

上传流程#

要创建一个数据集:

  1. 在侧边栏中导航至 Annotate
  2. 点击 New Dataset
  3. 选择一个数据源选项卡(见下文数据源
  4. 添加名称 —— URL 路径别名(slug)会自动派生并且可以进行编辑 —— 另外添加一个可选的描述
  5. 选择任务类型(参见支持的任务)、可选的许可证(参见可用许可证)以及可见性(公开或私有)
  6. 点击 Create & Upload 选择本地文件,点击 Create & Import 获取 URL 或连接的源,或者点击 Create Dataset 从空数据集开始

Ultralytics Platform Datasets Upload Dialog Task Selector 要将文件添加到现有数据集,请打开其数据集页面,然后将文件拖放到图库中,或者点击页面标题中的上传图标。由于数据集任务已经定义,上传图标会直接打开你浏览器的原生文件选择器。

数据源#

New Dataset 对话框提供四个来源:

来源描述
上传拖入文件或浏览查找 —— 图像、视频、归档文件或 NDJSON
URL粘贴指向 .zip.tar.tar.gz.tgz.ndjson 文件的直接链接;Platform 会在服务器端下载并提取它
Cloud就地使用来自 Google Cloud StorageAmazon S3Azure Blob Storage(Pro 和 Enterprise 版)的数据
On Premise通过 On Premise 工作线程(Enterprise 版)对从不离开你自己的机器的数据进行索引和训练
URL 导入限制

URL 导入受你套餐的每个上传限制(免费版 10 GB / 专业版 20 GB / 企业版 50 GB)以及你剩余的存储配额(以较小者为准)的限制。该链接必须可通过 HTTP 或 HTTPS 公开访问,并以支持的扩展名结尾。

上传开始前#

Platform 会在上传任何内容之前在浏览器中验证你的文件,因此常见问题会立即显现,而不是在漫长的传输之后才出现。系统会检查归档文件是否存在损坏、空内容、密码保护以及 YAML 语法错误,超大文件会按名称列出。

随后可能会出现两个对话框:

当归档文件声明了类别名称且你的数据集已经有类别时,Map imported classes 对话框会为每个传入的类别列出一行。对于每一个类别,选择一个要合并入的现有类别、创建一个新类别,或将其跳过。精确名称匹配会被预先选中,跳过的类别及其标注将不会被导入。

上传后,平台会自动处理你的数据:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. 验证:格式和尺寸检查
  2. 标准化:大图像调整大小(最大 4096px,最小尺寸 28px),灰度图扩展为 RGB,透明度扁平化到白色上,并应用 EXIF 方向
  3. 缩略图:生成 256px WebP 预览图
  4. 标签解析:提取 YOLO、COCO 和 NDJSON 标签
  5. 统计信息:计算类分布和图像维度
存储的图像编码

当无需调整大小或颜色更改时,AVIF 和 WebP 原件将按字节原样存储。所有其他内容都会重新编码 —— WebP 源保持为 WebP,所有其他格式(JPEG、PNG、BMP、TIFF、HEIC、JP2、DNG、MPO)都将转换为质量为 92 的 JPEG。你的原始文件名和源扩展名将作为元数据保留。

Ultralytics Platform Datasets Upload Progress Bar

上传前验证

你可以在上传前在本地验证你的数据集:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
图像尺寸要求

图像的最短边必须至少为 28px。小于此尺寸的图像在处理过程中会被拒绝。最长边大于 4096px 的图像会在保持长宽比的情况下自动调整尺寸。

浏览图像#

以多种布局查看你的数据集图像。

从图库工具栏打开聚类面板,以交互式 2D 散点图的形式浏览你的数据集。

查看描述
网格带有标注叠加的缩略图网格(默认)
紧凑用于快速扫描的较小缩略图
表格带有缩略图、文件名、维度、大小、拆分、类和标签计数的列表

Ultralytics Platform Datasets Gallery Grid View With Annotations

排序和过滤#

图像可以进行排序和过滤,以便高效浏览:

每个选项都可以在升序(↑)和降序(↓)之间切换:

排序描述
创建时间 ↑/↓上传顺序(默认 ↓)
名称 ↑/↓文件名按字母顺序
高度 ↑/↓图像高度(以像素为单位)
宽度 ↑/↓图像宽度(以像素为单位)
大小 ↑/↓磁盘文件大小
标注 ↑/↓每张图像的标注数量
大型数据集

对于超过 100,000 张图像的数据集,名称、宽度、高度和大小排序将被隐藏,以保持图库的响应速度。创建时间和标注数量排序仍然可用。

查找未标记图像

使用设为 UnannotatedAnnotations 过滤器,可以快速找到仍需标注的图像。这对于想要跟踪标注进度的庞大数据集特别有用。

搜索自定义元数据

搜索框位于图库工具栏的右侧,可过滤所有视图模式 —— 网格、紧凑和表格。它匹配图像文件名(文件扩展名是可选的)以及自定义元数据键、标量值和数组条目,因此携带 {"ship_type": "yacht"} 的名为 img_0042 的图像可以通过搜索 img_0042yacht 来找到。

嵌套在子对象内部的值不参与匹配。粘贴 24 个字符的图像 ID 可以直接查找该特定图像,从而绕过文本搜索。

全屏查看器#

点击任意图像以打开全屏查看器,并提供以下功能:

  • 导航:使用方向键或缩略图预览进行浏览
  • 图像信息:查看平台生成的属性、自定义元数据以及嵌入的文件元数据(如 EXIF)
  • 自定义元数据:所有者和编辑者可以添加或替换 JSON 对象,包括最多 500,000 个序列化字符的嵌套值以及最多 128 个字符的顶级键
  • 标注:切换标注覆盖层的可见性
  • 类别细分:带颜色指示的每类标签计数
  • Annotate:当你拥有编辑权限时,在桌面上打开全屏查看器时,标注控件会立即处于激活状态
  • 下载:下载原始图像文件
  • 删除:从数据集中删除图像
  • 缩放Cmd/Ctrl+ScrollCmd/Ctrl++Cmd/Ctrl+= 用于放大,Cmd/Ctrl+- 用于缩小
  • 重置视图Cmd/Ctrl + 0 或重置按钮可使图像适应查看器
  • 平移:缩放时按住 Space 并拖动以平移画布
  • 像素视图:切换像素化渲染以进行仔细检查
  • 深度帘幕:在深度数据集上,一个可拖动的分隔条可以在 RGB 图像与其彩色深度图之间进行擦除对比

Ultralytics Platform Datasets Fullscreen Viewer With Metadata Panel

按拆分筛选#

按数据集拆分筛选图像:

拆分用途
训练用于模型训练
Val用于训练期间的验证
测试用于最终评估

聚类#

Clustering 面板将你的数据集投影到一个交互式的 2D 散点图中,其中视觉上相似的图像靠得很近。无需离开图库,即可使用它来浮现集群、发现重复项和异常值,以及检查划分或类别在数据中的分布情况。在任何数据集页面上,从图库工具栏中的散点图图标打开它。

Ultralytics Platform Datasets Clustering Empty State

运行分析#

开始分析:

  1. 打开数据集并点击图库工具栏中的散点图图标
  2. 点击 Analyze Dataset
  3. 等待进度条完成——结果将出现在同一个面板中

分析在后台分两个阶段(Computing embeddingsClustering)运行,根据数据集的大小可能需要几分钟。你可以关闭面板或离开页面稍后再回来。

分析要求

数据集需要至少 20 个且最多 200,000 个无错误的图像才能进行分析。尚不支持由云存储或 On Premise 存储支持的连接数据集

可视化#

分析完成后,面板会显示所有已分析图像的 2D 散点图,配有图例和点计数器。图库过滤器(划分、类别、已标注/未标注)会使过滤范围之外的点变暗,以便你专注于关心的子集 —— 随后计数器会显示 visible / total points

Ultralytics Platform Datasets Clustering Scatter Plot

着色依据#

使用面板工具栏中的 Color by 下拉菜单更改数据点的着色方式。随时切换视图模式——图表会立即重新着色,以便你查看划分、类别或图像属性如何在集群中分布:

选项着色
Splits训练 / 验证 / 测试
Classes每张图像上的第一个标注类别
Width图像宽度
Height图像高度
Size文件大小
标注每张图像的标注数量

Ultralytics Platform Datasets Clustering Color Modes

套索选择#

在区域周围绘制自由形状的选择框以突出显示图表上的点。图库会向下过滤出匹配的图像,以便你可以使用常规的图像操作来检查、重新标注、移动或删除它们。

清除选择

图表上方的一个芯片显示了选中的点数——点击 × 以清除套索并返回完整的图库视图。

选择大小

套索选择最多解析为 1,000 张图像。如果你的选择匹配更多,Platform 会显示抽样的 1,000 张并建议绘制一个更小的区域。

平移和缩放#

直接使用鼠标和键盘,或者使用图表左下角的缩放按钮来导航大型散点图:

输入操作
滚动在 2D 中平移图表
Cmd/Ctrl+滚动以光标为中心放大或缩小
按住 Space切换至拖拽平移模式
重置按钮返回图表的完整范围

重新分析#

如果数据集在分析后发生更改 —— 传入了新图像,或者分析的计数不再与数据集匹配 —— 面板顶部会为所有者和编辑者显示一个 Re-analyze 按钮。

点击 Re-analyze 从头开始重新计算嵌入和 2D 投影。

数据集标签页#

根据数据集状态和你的权限,每个数据集页面最多可以显示六个标签页:

图像标签页#

显示带标注覆盖层的图像图库的默认视图。支持网格、紧凑和表格视图模式。在此处拖放文件以添加更多图像。

类别标签页#

当数据集包含图像且其任务具有类别时,此标签页会显示。

管理数据集的标注类别:

  • 类别直方图:显示每个类别标注数量的条形图,按频率排序,带有线性/对数刻度切换开关
  • 类别表:可排序、可搜索的表格,包含索引、名称、标注数量和图像数量
  • 编辑类别名称:点击任意类别名称即可直接重命名
  • 编辑类别颜色:点击颜色样本即可更改类别颜色
  • 添加新类别:使用底部的输入框添加类别
  • 合并类别:选择两行或多行并点击 Merge into one
  • 删除类别:选择一行或多行并点击 Delete

Ultralytics Platform Datasets Classes Tab Histogram And Table

针对不平衡数据集的对数刻度

如果你的数据集存在类别不平衡(例如,10,000 个“person”标注但只有 50 个“bicycle”),请使用类别直方图上的 Log Scale 切换开关清晰地可视化所有类别。

合并类别#

合并可整合重复或重叠的标签 —— 例如将 carautomobilevehicle 折叠为一个类别:

  1. 使用行复选框选择两个或更多类别
  2. 点击表头中的 Merge into one,或右键点击所选项
  3. 选择所选类别中的哪一个作为其他类别合并入的目标
  4. 确认

属于源类别的每个标注都会被重新分配给目标类别,并且源类别将被移除。不会删除任何标注,因此数据集的总标注数量保持不变。

删除类别#

  1. 使用行复选框选择一个或多个类别
  2. 点击表头中的 Delete,或右键点击所选项
  3. 确认

删除类别会移除该类别及其所有标注。对于分类数据集,标签会被移除,但图像会保留,变为未标注状态。

类别索引位移

类别 ID 是基于位置的。合并或删除类别会使每个更高类别的索引向下移动以填补空缺,因此在更改之前编写的导出和标签文件将不再与新索引对齐。如果需要旧的编号,请先创建一个版本

统计抽样

类别计数是根据最多 100,000 张图像计算的。在较大的数据集上,直方图上方会出现一条提示:“基于该数据集的 100,000 张图像子集。”

图表标签页#

当数据集包含图像时,会出现此标签页。

从你的数据集中自动计算的统计数据:

图表按此顺序出现,当数据集没有相关数据时,每个图表都会被省略 —— 原始图像数据集不显示标注图表,而 Points per Instance 仅对分割和姿态数据出现:

图表描述
数据集划分分布训练集/验证集/测试集图像数量及标注百分比的圆环图
热门类别前 10 个最频繁标注类别的圆环图,其余部分显示为“其他”
图像尺寸图像宽度和高度分布直方图(重叠显示),带有均值标注
图像文件大小图像文件大小分布直方图
2D 图像尺寸带有长宽比参考线的宽度与高度 2D 热力图
注释位置边界框中心位置的 2D 热力图
图像格式源图像格式分布(JPG、PNG 等)
边界框尺寸边界框宽度和高度直方图(重叠显示)
每张图像的对象数每张图像注释数量的直方图
每个实例的点数每个注释(分割/姿态)的多边形顶点或关键点数量

Ultralytics Platform Datasets Charts Tab Statistics Grid

统计数据缓存

平台会缓存计算出的统计信息,并在图像、标注、类别或划分发生更改时使其失效。在大于 100,000 张图像的数据集上,图表是根据 100,000 张图像的子集计算得出的,这会在网格上方注明。

全屏热力图

点击任意热力图上的展开按钮以全屏模式查看。这能提供更大、更详细的视图,有助于理解大型数据集中的空间模式。

模型标签页#

在可搜索的表格中查看在此数据集上训练的所有模型:

描述
名称带有链接的模型名称
项目带有图标的父项目
版本训练所使用的不可变数据集版本(如有)
状态训练状态徽章
任务YOLO 任务类型
Epochs最佳 epoch / 总 epoch 数
mAP50-95平均精度均值
mAP50IoU 为 0.50 时的 mAP
已创建创建日期

Ultralytics Platform Datasets Models Tab Trained Models Table

错误标签页#

此标签页仅在有一个或多个文件处理失败时出现。

处理失败的图像会在此处列出,并包含:

  • 错误横幅:失败图像的总数和指导信息
  • 错误表格:文件名、用户友好的错误描述、修复提示和预览缩略图
  • 常见错误包括文件损坏、格式不支持、图像太小(最小 28px)以及不支持的颜色模式

Ultralytics Platform Datasets Errors Tab Processing Failures

常见处理错误
错误原因修复
无法读取图像文件文件损坏或格式不受支持从图像编辑器重新导出
不完整或已损坏文件在传输过程中被截断重新下载原始文件
不支持的图像格式平台无法解码的格式转换为 JPG、PNG 或 WebP
文件权限错误文件被锁定或受读取保护解锁文件并重新上传
图像太小最小尺寸低于 28px使用更高分辨率的源图像
不支持的颜色模式CMYK 或索引颜色模式转换为 RGB 模式

版本标签页#

为你的数据集创建不可变的 NDJSON 快照,以实现可复现的训练。每个版本都会记录创建时的图像数量、类别数量、注释数量和文件大小。

描述
版本版本号 (v1, v2, ...)
描述用户提供的描述(可编辑)
图像快照时的图像数量
类别快照时的类别数量
注释快照时的注释数量
大小NDJSON 导出文件大小
已创建版本创建时间
操作下载或恢复

创建版本:

  1. 打开 Versions 标签页
  2. 可选择输入描述(例如:“添加了 500 张训练图像”或“修复了错误标签的类别”)
  3. 点击新版本
  4. 新版本会出现在表格中

每个版本都按顺序编号(v1、v2、v3...)并且是不可变的 —— 版本无法编辑或移除,只能更改其描述。随时可以使用行操作来下载或恢复任何版本。

恢复版本

恢复操作会用所选的快照替换数据集当前的图像、划分、类别和标注,并且此操作无法撤消,除非你首先将当前状态保存为另一个版本。数据集在重建时会锁定在 processing 状态。恢复期间不会重新上传任何内容,因此即使在大型数据集上,恢复通常也很快。

在训练时保存版本

云训练对话框中启用保存数据集版本,以将模型链接到用于训练的精确数据集。当数据集内容未更改时,平台会复用匹配的版本,仅在内容更改时才创建新版本。

仅限就绪数据集

版本创建和恢复功能在数据集达到 ready 状态后可用。版本不适用于连接的云数据集或 On Premise 数据集。

何时创建版本

在对数据集进行重大更改(添加图像、修复注释或重新平衡划分)前后创建一个版本。这使你能够对比不同数据集状态下的模型性能。

NDJSON 文件大小

显示的大小是 NDJSON 导出文件的大小,其中包含图像 URL 和标注 —— 而不是图像本身。实际图像数据是单独存储的并通过签名 URL 进行访问。快照文件仍然计入你的工作区存储配额,因此如果你没有剩余空间,版本创建将失败。

导出数据集#

从数据集标题或版本标签页下载 NDJSON,即可导出数据集以供离线使用。

导出步骤:

  1. 点击数据集标题中的 Download 按钮(下载图标)
  2. 直接下载当前的 NDJSON 快照
  3. 当你需要一个可以稍后重新下载的不可变编号快照时,请使用 Versions(版本)选项卡

Ultralytics Platform Datasets Export Ndjson Download NDJSON 格式每行存储一个 JSON 对象。第一行包含数据集元数据,随后每行对应一个图像:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

当 NDJSON 文件导入到 Platform 时,可选的图像级 metadata 对象会被保留。你可以在图像的全屏信息面板中检查或编辑它。对于程序化的归档上传,提取数据集数据 API 接受等效的 imageMetadata 路径映射。

姿态数据集在数据集标题行中也包含一个 kpt_shape 字段,当未预先设置时,它会从标注中推断出来。

深度导出在数据集行中声明 "task": "depth""depth_scale": 1000。每张图像行包含一个用于其配对的纯 uint16 PNG 的 depth.url。Ultralytics 会并发下载图像和深度 URL,并写入具有相同比例的训练 YAML,因此 NDJSON 文件可以直接传递给 model.train(data=...)

签名 URL

导出的 NDJSON 中的图像 URL 是带签名的,有效期为 7 天。当数据集未更改时,Platform 会重命名长达 6 天的缓存导出,因此新鲜下载始终至少有一天的剩余有效期。如果你需要更早获取新 URL,请更改数据集或创建新版本。

On Premise 数据集

On Premise 数据集不支持导出,其图像字节从不到达 Platform。

有关完整规范,请参阅 Ultralytics NDJSON 格式文档

图像操作#

快速操作#

右键单击 Grid(网格)或 Compact(紧凑)视图中的任意图像以访问快捷操作:

操作描述
Move to Split(移动至拆分)将图像重新分配到 Train(训练)、Val(验证)或 Test(测试)拆分
下载下载原始图像文件
Delete(删除)从数据集中删除该图像

Ultralytics Platform Datasets Image Card Context Menu

单项与批量

图像上下文菜单仅针对单个图像进行操作。如需对多个图像进行批量操作,请使用带有复选框选择的 Table(表格)视图。

批量移动至拆分#

将选定的图像重新分配到同一数据集内的不同拆分中:

  1. 切换到 Table(表格)视图
  2. 使用复选框选择图像
  3. 右键单击以打开上下文菜单
  4. 选择 Move to split > TrainValidationTest

你也可以将图像拖放到网格视图中的划分过滤选项卡上。如果移动图像会与目标划分中已存在的相同图像冲突,Platform 会询问是跳过、保留两者还是替换。

组织 Train/Val 拆分

将所有图像上传到一个数据集,然后使用批量移动至拆分功能将子集组织到训练、验证和测试拆分中。

拆分重新分配#

使用自定义比例重新分配训练、验证和测试拆分中的所有图像:

  1. 单击数据集工具栏中的 split bar(拆分栏)以打开 Redistribute Splits(重新分配拆分)对话框
  2. 使用以下任意一种方法调整拆分百分比
  3. 查看实时图像计数预览以确认分配情况
  4. 单击 Apply(应用)以根据你的百分比随机重新分配所有图像

Ultralytics Platform Datasets Split Redistribution Dialog 该对话框提供了三种设置目标划分比例的方法:

方法描述
Drag(拖动)拖动彩色段之间的手柄以直观地调整拆分边界
Type(输入)编辑任何拆分的百分比输入(其他两个拆分会自动按比例重新平衡)
Auto(自动)一键立即设置 80/20 的训练/验证拆分,并将测试拆分设置为 0%

实时预览显示了在应用之前每种拆分将包含的确切图像数量。

快速 80/20 拆分

单击 Auto(自动)按钮可立即设置建议的 80/20 训练/验证拆分。这是最常见的训练比例。

批量删除#

一次删除多个图像:

  1. 在表格视图中选择图像
  2. 右键点击并选择 Delete,或者按下 Cmd/Ctrl+Delete
  3. 确认删除

数据集 URI#

使用 ul:// URI 格式引用平台数据集(请参阅使用平台数据集):

ul://username/datasets/dataset-slug

你也可以直接粘贴数据集或模型的网页 URL(例如 https://platform.ultralytics.com/username/datasets/dataset-slug);它会自动重写为 ul:// URI。传递数据集列表可以依次微调各个基础模型,例如 model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"])

使用此 URI 在任何地方训练模型:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
使用 Platform 数据随时随地训练

ul:// URI 在任何环境中均可工作:

  • 本地机器:在你的硬件上进行训练,数据会自动下载
  • Google Colab:在笔记本中访问你的 Platform 数据集
  • 远程服务器:在云端虚拟机上进行训练,并可完全访问数据集

可用许可#

该 Platform 支持以下数据集许可:

许可类型
未选择许可
CC0-1.0公有领域
PDM-1.0公有领域
CC-BY-2.5许可型
CC-BY-4.0许可型
CC-BY-NC-2.0非商业性
CC-BY-SA-4.0Copyleft(著作权左)
CC-BY-NC-4.0非商业性
CC-BY-NC-SA-3.0Copyleft(著作权左)
CC-BY-NC-SA-4.0Copyleft(著作权左)
CC-BY-ND-4.0禁止衍生
CC-BY-NC-ND-4.0非商业性
Apache-2.0许可型
MIT许可型
AGPL-3.0Copyleft(著作权左)
GPL-3.0Copyleft(著作权左)
仅限研究受限
其他自定义
Copyleft 许可

当克隆带有 copyleft 许可证(AGPL-3.0、GPL-3.0、CC-BY-SA-4.0、CC-BY-NC-SA-3.0、CC-BY-NC-SA-4.0)的数据集时,克隆体将继承该许可证,且许可证选择器将被锁定。

可见性设置#

控制谁可以看到你的数据集:

设置描述
Private(私有)你和被授权的工作区成员可以访问
Public(公开)任何人都可以查看,包括从 Explore 页面

可见性是在 New Dataset 对话框中创建数据集时使用切换开关设置的。公开数据集在探索页面上可见。

编辑数据集#

数据集元数据直接在数据集页面内进行在线编辑——无需对话框:

  • 名称:点击数据集名称进行编辑。更改会在失去焦点或按下 Enter 时自动保存。名称限制为 100 个字符。
  • 描述:点击描述(或“Add a description...”占位符)进行编辑。更改会自动保存。描述限制为 1,000 个字符。
  • Task type(任务类型):单击任务徽章以选择不同的任务类型。
  • License(许可):单击许可选择器以更改数据集许可。
  • 图标:点击数据集图标上传你自己的图片、将数据集自身的某张图片设为图标,或者选择一个字母和颜色。
更改任务类型

每张图像将所有任务类型的标注存储在一起。更改数据集任务类型可控制在编辑器中可见、并包含在导出和训练中的标注。其他任务类型的标注会保留在数据库中,并在你切回时重新出现。深度是个例外:它的真值是一个配对文件而不是标注,因此数据集只有在不包含图像时才能切换到深度或从深度切出——请改用重新导入。

自定义元数据#

打开更多操作并选择信息以查看以下两个部分:

  • Ultralytics 元数据:只读的 Platform 详情,例如数据集 ID、所有者、任务、图像和标注数量、存储区域以及时间戳
  • 自定义元数据:你自己的 JSON 对象,用于溯源、采集条件、客户 ID、治理或其他上下文数据

工作区查看者可以检查元数据,而拥有编辑权限的成员可以替换自定义元数据对象。序列化元数据对象限制为 500,000 个字符,每个顶级键限制为 128 个字符。保存空对象({})以清除自定义元数据。

克隆数据集#

当查看你不拥有的公开数据集时,点击 Clone Dataset 打开克隆对话框。检查目标工作区、名称、可见性和许可证,然后确认克隆。此副本包含所有图像、标注和类别定义。在默认可见性为公开的工作区中,公开源数据集默认保持公开;企业工作区克隆默认设为私有。如果原始数据集具有 copyleft 许可证,克隆将继承它且许可证选择器会被锁定。

如果目标别名已被占用,系统会自动重命名,且克隆需要有足够的剩余存储配额来容纳副本。

已连接的数据集

云存储本地部署源支持的数据集无法被克隆,因为平台不保存它们的图像字节。

收藏与分享#

  • 收藏 (Star):点击星标按钮以收藏数据集。收藏数量对所有用户可见。
  • 分享:对于公共数据集,点击分享按钮以复制链接、获取嵌入代码片段或分享到社交平台。

删除数据集#

删除你不再需要的数据集:

  1. 打开数据集标题中的 更多操作 按钮)
  2. 选择 删除数据集
  3. 在对话框中确认:“这会将 [name] 移至回收站。你可以在 30 天内将其恢复。”

同一个菜单中还包含 信息(打开自定义元数据中所述的元数据对话框)以及 刷新(从服务器重新读取数据集)。

回收站与恢复

已删除的数据集会移至回收站,而不是被永久删除。你可以在 30 天内从 Settings > Trash 恢复它们。

基于数据集进行训练#

直接从你的数据集开始训练:

  1. 在数据集页面上点击 New Model
  2. 选择一个项目或创建一个新项目
  3. 配置训练参数
  4. 开始训练
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

有关详细信息,请参阅云训练

常见问题解答#

  • 你的数据会在你选择的区域(美国、欧盟或亚太地区)进行处理和存储。图像处理如下:

    1. 验证格式和大小
    2. 如果最小尺寸低于 28px,则会被拒绝
    3. 如果大于 4096px,则会进行标准化处理(保持宽高比;编码以优化存储)
    4. 采用去重存储,因此相同的图片只保留一份
    5. 生成 256px 的 WebP 缩略图以加快浏览速度
  • Ultralytics Platform 高效管理存储:

    • 去重:同一数据区域内的相同图像只存储一次
    • 完整性:验证上传数据的数据完整性
    • 效率:克隆会复用已存储的图片而不是复制它们,同时仍然计入目标工作区的存储配额
    • 区域性:数据保留在你选择的区域(美国、欧盟或亚太地区)
  • 可以。将文件拖放到数据集图库中,或者点击页面标题中的上传图标,这会直接打开你浏览器的原生文件选择器。处理完成后会自动计算新的统计信息。

  • 使用批量“移动到拆分集”功能:

    1. 在表格视图中选择图像
    2. 右键点击并选择 Move to split
    3. 选择目标拆分集(训练集、验证集或测试集)
  • Ultralytics Platform 支持 YOLO 标签、COCO JSON、Ultralytics NDJSON 以及原始图片上传。系统会检测到 Pascal VOC XML 标签,但不会导入:

    每个图像一个带有归一化坐标(0-1 范围)的 .txt 文件:

    任务格式示例
    检测class cx cy w h0 0.5 0.5 0.2 0.3
    分割class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    姿态class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    分类目录结构train/cats/train/dogs/

    姿态可见性标志:0=未标注,1=已标注但被遮挡,2=已标注且可见。

  • 可以。每张图像将所有 6 种标注任务类型(detect、segment、semantic、classify、pose、OBB)的标注存储在一起。你可以随时切换数据集的活动任务类型,而不会丢失现有的标注。只有与活动任务类型匹配的标注才会显示在编辑器中并包含在导出和训练中——其他任务的标注会得到保留,并在你切回时重新出现。

  • 有:

    限制
    每个数据集的类别数25,000
    每张图片的标注数10,000
    每个标注的坐标数10,000
    数据集名称100 个字符
    数据集描述1,000 个字符
    自定义元数据500,000 个序列化字符
    元数据顶级键128 个字符
  • 云存储本地部署源读取数据的数据集将其像素保留在平台之外,因此需要平台拥有图像字节副本的功能将不可用:

    功能云端连接本地部署
    智能标注不可用不可用
    聚类分析不可用不可用
    克隆不可用不可用
    版本快照不可用不可用
    NDJSON 导出可用不可用

    浏览、手动标注、类别管理、数据集划分、统计和训练均可正常运行。

评论