数据准备#
数据准备是成功构建计算机视觉模型的基础。Ultralytics Platform提供全面的工具来管理你的训练数据,从上传、标注到分析。
Watch: Get Started with Ultralytics Platform - Data
概述#
Ultralytics Platform 的数据部分可以帮助你:
- 上传图像、视频和数据集文件(ZIP、包含
.tar.gz/.tgz的 TAR、NDJSON) - 从 URL 导入:粘贴存档或 NDJSON 导出的直接链接,或从 Roboflow 导入
- 连接 Google Cloud Storage、Amazon S3 或 Azure Blob Storage,直接使用原位置的数据,无需上传副本
- 借助 Enterprise 本地部署 CPU/GPU 工作节点,让像素保留在本地
- 使用手动绘制工具和由 SAM 驱动的智能标注进行标注 — 从 SAM 2.1、SAM 3 或默认的 SAM 3.1 中进行选择
- 通过重命名、重新着色、合并和删除,在整个数据集中管理类别
- 使用统计信息、可视化和基于嵌入的聚类来分析数据
- 以 NDJSON 格式导出,用于本地训练

工作流#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 阶段 | 描述 |
|---|---|
| 上传 | 导入图像、视频或存档,并自动处理 |
| 标注 | 使用手动工具标注数据,或使用 SAM 标注来支持检测、分割、语义分割和 OBB |
| 分析 | 查看类别分布、空间热力图、尺寸统计信息和嵌入聚类 |
| 导出 | 以 NDJSON 格式下载,用于离线使用 |
支持的任务#
Ultralytics Platform 数据集支持全部 7 种 YOLO 任务类型:
| 任务 | 描述 | 标注工具 |
|---|---|---|
| 检测 | 使用边界框进行目标检测 | 矩形工具 |
| 分割 | 使用像素掩码进行实例分割 | 多边形工具 |
| 语义分割 | 使用按类别划分的像素区域进行语义分割 | 多边形工具 |
| 深度 | 逐像素度量深度图 | 导入的目标 |
| 分类 | 图像级分类 | 类别选择器 |
| 姿态 | 使用内置和自定义骨架模板进行关键点估计 | 关键点工具 |
| OBB | 用于旋转目标的定向边界框 | 定向框工具 |
创建数据集时会设置任务类型,并决定可用的标注工具。你之后可以通过数据集标题栏中的任务选择器进行更改,但切换后将不会显示不兼容的标注。只有在数据集为空时,才允许切换到深度任务或从深度任务切换出去——请参阅编辑数据集。
主要特性#
智能存储#
Ultralytics Platform 高效管理存储:
- 去重:同一数据区域中的相同图像只存储一份
- 完整性:上传内容会经过数据完整性验证
- 效率:优化存储并实现快速处理
数据集 URI#
使用 ul:// URI 格式引用数据集(请参阅使用 Platform 数据集):
yolo train data=ul://username/datasets/my-dataset配置好你的 API 密钥后,即可从任何机器上使用 Platform 数据集进行训练。
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)数据集版本控制#
为数据集创建不可变的 NDJSON 快照,以实现可复现训练。每个版本都会记录创建时的图像数量、类别数量和标注数量。详情请参阅版本选项卡。
数据集选项卡#
根据数据集状态和你的权限,数据集页面最多可以显示六个选项卡:
| 选项卡 | 描述 |
|---|---|
| 图像 | 以网格、紧凑或表格视图浏览带有标注叠加层的图像 |
| 类别 | 查看、重命名、重新着色、合并和删除类别,并查看每个类别的标签数量 |
| Charts | 自动统计信息:数据集划分分布、类别数量、热力图 |
| 模型 | 在此数据集上训练的模型,以及相关指标和状态 |
| 版本 | 创建、下载和恢复不可变的 NDJSON 快照,以确保可复现性 |
| 错误 | 处理失败的图像,以及错误详情和修复指导 |
当数据集包含图像且其任务包含类别时,会显示 Classes;只要数据集包含图像,就会显示 Charts。仅当存在处理失败时,才会显示 Errors。当你拥有编辑权限,或在只读模式下已有版本时,会显示 Versions。
聚类#
以交互式 2D 散点图形式探索你的数据集,视觉上相似的图像在图中靠得很近——这对于发现聚类、重复项和异常值,以及检查数据集中的拆分或类别分布情况非常有用。用套索工具圈出图表的一个区域,即可将图库过滤为该区域的图像。分析需要 20 到 200,000 张无错误的图像。利用相同的嵌入,你可以在公共数据集中find similar images并将其添加到你的数据集中。详见Clustering。
统计与可视化#
Charts 选项卡提供包括以下内容的自动分析:
- 数据划分分布:训练/验证/测试图像数量的环形图
- 主要类别:出现频率最高的 10 个标注类别的环形图
- 图像尺寸:图像宽度和高度分布的直方图(以像素为单位)
- 图像尺寸二维分布:宽度与高度的二维热力图,并带有宽高比参考线
- 标注位置:边界框中心位置的二维热力图
- 每个实例的点数:多边形顶点数或关键点数量的分布(分割/姿态数据集)
完整列表请参阅图表选项卡。
快速链接#
常见问题#
Ultralytics Platform 支持:
图像: JPEG、PNG、WebP、BMP、TIFF、HEIC、AVIF、JP2、DNG、MPO(每个最大 50MB)
视频: MP4、WebM、MOV、MKV、M4V(最大 1GB,以 1 FPS 提取帧,最多 100 帧)
Dataset files: ZIP 或 TAR 归档文件,包含
.tar.gz和.tgz(Free 版最大 10GB,Pro 版 20GB,Enterprise 版 50GB),内含带有可选的YOLO-format或 COCO JSON 标签或semantic PNG masks的图像,外加NDJSON导出文件你也可以将这些存档或 NDJSON 格式中的任意一种,通过在
New Dataset对话框的URL选项卡中粘贴直接 HTTP(S) 链接来导入。系统可以检测 Pascal VOC XML 标签,但不会导入这些标签。存储限制取决于你的套餐:
套餐 存储限制 免费版 100 GB 专业版 500 GB Enterprise 无限制 单个文件限制:图像 50MB,视频 1GB,数据集在 Free 上为 10GB / Pro 上为 20GB / Enterprise 上为 50GB
可以!使用数据集 URI 格式进行本地训练:
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100或者以 NDJSON 格式导出你的数据集,以传输其元数据、数据集划分、标注和带签名的图像 URL。