数据准备#
数据准备是成功构建计算机视觉模型的基础。Ultralytics Platform 提供了全面的工具来管理你的训练数据,涵盖从上传、标注到分析的全过程。
Watch: Get Started with Ultralytics Platform - Data
概述#
Ultralytics Platform 的“数据”部分可帮你完成以下任务:
- 上传图像、视频和数据集文件(包含
.tar.gz/.tgz的 ZIP、TAR 以及 NDJSON) - 通过网址导入:粘贴压缩包或 NDJSON 导出的直接链接,或者从 Roboflow 导入
- 连接 Google Cloud Storage、Amazon S3 或 Azure Blob Storage,直接使用你的数据而无需上传副本
- 通过企业级私有化部署 CPU/GPU 工作节点将像素保留在本地
- 使用手动绘图工具和 SAM 驱动的智能标注功能进行标注——可选择 SAM 2.1 或全新的 SAM 3
- 管理类别:在整个数据集中对类别进行重命名、重新着色、合并和删除
- 分析你的数据,使用统计数据、可视化图表以及基于嵌入的聚类
- 以NDJSON 格式导出以便进行本地训练

工作流#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 阶段 | 描述 |
|---|---|
| 上传 | 导入图像、视频或压缩包,并进行自动处理 |
| 标注 | 使用手动工具标记数据,或使用 SAM 标注进行检测、分割、语义和 OBB |
| 分析 | 查看类别分布、空间热力图、尺寸统计数据和嵌入聚类 |
| 导出 | 以NDJSON 格式下载以供离线使用 |
支持的任务#
Ultralytics Platform 数据集支持全部 7 种 YOLO 任务类型:
| 任务 | 描述 | 标注工具 |
|---|---|---|
| 检测 | 带有边界框的目标检测 | 矩形工具 |
| 分割 | 带有像素掩码的实例分割 | 多边形工具 |
| 语义 | 带有按类划分的像素区域的语义分割 | 多边形工具 |
| Depth | 逐像素公制深度图 | 导入的目标 |
| 分类 | 图像级分类 | 类别选择器 |
| 姿态 | 带有内置和自定义骨架模板的关键点估计 | 关键点工具 |
| 旋转框 (OBB) | 用于旋转物体的定向边界框 | 定向框工具 |
任务类型在创建数据集时设置,决定了可用的标注工具。你之后可以从数据集标题的任务选择器中更改它,但切换后不兼容的标注将不会显示。仅当数据集为空时才允许切换到深度或从深度切换 — 请参阅 Edit Dataset。
主要特性#
智能存储#
Ultralytics Platform 高效管理存储:
- 去重:同一数据区域内的相同图像只存储一次
- 完整性:验证上传数据的数据完整性
- 效率:优化的存储和快速的处理能力
数据集 URI#
使用 ul:// URI 格式引用数据集(参见使用 Platform 数据集):
yolo train data=ul://username/datasets/my-dataset这允许你在配置了API 密钥的任意机器上使用该平台的datasets进行训练。
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)数据集版本控制#
为你的数据集创建不可变的 NDJSON 快照以实现可重复的训练。每个版本都在创建时捕获图像数量、类别数量和标注数量。详见版本标签页。
数据集标签页#
根据数据集的状态和你的权限,数据集页面最多可显示六个选项卡:
| 标签页 | 描述 |
|---|---|
| 图像 | 以网格、紧凑或表格视图浏览带有标注叠加层的图像 |
| Classes | 查看、重命名、重新着色、合并和删除类别,并显示每个类别的标签数量 |
| 图表 | 自动统计:分割分布、类别计数、热力图 |
| 模型 | 在此数据集上训练的模型及其指标和状态 |
| 版本 | 创建、下载和恢复不可变的 NDJSON 快照以确保可重复性 |
| Errors | 处理失败的图像及其错误详情和修复指南 |
Classes 在数据集包含图像且其任务具有类别时出现,而 Charts 在只要包含图像时就会出现。Errors 仅在存在处理失败时出现。Versions 在你拥有编辑权限时出现,或者在版本已经存在时以只读模式出现。
聚类#
将你的数据集探索为一个交互式的 2D 散点图,其中视觉上相似的图像靠得很近 —— 这对于发现聚类、重复项和异常值,以及检查拆分或类别如何在你的数据中分布非常有用。用套索工具圈出图表的一个区域,将图库过滤为这些图像。分析需要 20 到 200,000 张无错误的图像。详情请参见 Clustering。
统计与可视化#
Charts 标签页提供自动分析,包括:
- 分割分布:训练集/验证集/测试集图像数量的环形图
- 热门类别:包含 10 个最常见标注类别的圆环图
- 图像维度:图像宽度和高度分布的直方图(单位:像素)
- 图像维度 2D:宽度与高度的 2D 热力图,配有宽高比参考线
- 标注位置:边界框中心位置的 2D 热力图
- 每个实例的点数:多边形顶点或关键点数量分布(用于分割/姿态数据集)
完整列表请参见 Charts tab。
快捷链接#
常见问题解答#
Ultralytics Platform 支持:
图像: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO(每张最大 50MB)
视频: MP4、WebM、MOV、MKV、M4V(最大 1GB,以 1 FPS 提取帧,最多 100 帧)
**数据集文件:**包含
.tar.gz和.tgz的 ZIP 或 TAR 压缩包(Free 版最大 10GB,Pro 版最大 20GB,Enterprise 版最大 50GB),其中包含带有可选 YOLO-format 或 COCO JSON 标签的图像,以及 NDJSON 导出也可以通过在
New Dataset对话框的URL选项卡中粘贴直接的 HTTP(S) 链接来导入这些压缩包或 NDJSON 格式的任意一种。Pascal VOC XML 标签会被检测到,但不会被导入。存储限制取决于你的套餐:
方案 存储限制 免费版 100 GB Pro 版 500 GB 企业版 无限制 单个文件限制:图像 50MB,视频 1GB,数据集在 Free 版上为 10GB / Pro 版 20GB / Enterprise 版 50GB
可以!使用数据集 URI 格式进行本地训练:
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100或者以NDJSON 格式导出你的数据集以传输其元数据、数据集划分、标注和签名的图像 URL。