Ultralytics YOLO27:
Get Started

数据准备#

数据准备是成功的计算机视觉模型的基础。Ultralytics Platform提供全面的数据管理工具,涵盖从上传、标注到分析的各个环节。



观看: 开始使用 Ultralytics Platform - 数据

概述#

Ultralytics Platform 的数据部分可帮助你:

  • 上传图像、视频和数据集文件(ZIP、TAR,包括 .tar.gz/.tgz、NDJSON)
  • 从 URL 导入:粘贴存档文件或 NDJSON 导出的直接链接,或从 Roboflow 导入
  • 连接Google Cloud Storage、Amazon S3或 Azure Blob Storage,无需上传副本,即可直接使用其中的数据
  • 通过企业版本地部署 CPU/GPU 工作器,让像素数据保留在本地
  • 在包含 1–200 个类别的检测数据集上,使用手动绘图工具和 SAM 智能标注(SAM 2.1、SAM 3或默认的 SAM 3.1)、YOLO 模型或按类别提示的模型进行标注;模型可以是托管的开源模型或付费提供商模型
  • 通过重命名、重新着色、合并和删除类别,在整个数据集中管理类别
  • 通过查找相似图像或生成相似图像扩充数据集,然后标注保留的图像
  • 对现有图像或之后上传的图像进行人脸模糊处理
  • 通过统计数据、可视化和基于嵌入的聚类分析数据
  • 以 NDJSON 格式导出,用于本地训练

Ultralytics Platform 数据概览侧边栏中的数据集

工作流#

阶段说明
上传导入图像、视频或存档文件并自动处理
标注使用手动工具标注数据,或在包含 1–200 个类别的检测数据集上使用 SAM 智能标注(检测、分割、语义和 OBB)、YOLO 或按类别提示的模型;模型可以是托管的开源模型或付费提供商模型
分析查看类别分布、空间热力图、尺寸统计数据和嵌入聚类
导出下载NDJSON 格式的数据以供离线使用

支持的任务#

Ultralytics Platform 数据集支持全部 7 种 YOLO 任务类型:

任务说明标注工具
检测使用边界框进行目标检测矩形工具
实例分割使用像素掩码进行实例分割多边形工具
语义分割按类别划分像素区域的语义分割多边形工具
深度逐像素度量深度图导入的目标
分类图像级分类类别选择器
姿态使用内置和自定义骨架模板进行关键点估计关键点工具
OBB用于旋转目标的有向边界框有向框工具
任务类型选择

创建数据集时会设置任务类型,并据此确定可用的标注工具。之后,你可以通过数据集标题栏中的任务选择器更改任务类型,但切换后将不会显示不兼容的标注。只有数据集为空时,才允许切换到深度任务或从深度任务切换到其他任务——详见编辑数据集。

主要功能#

智能存储#

Ultralytics Platform 会高效管理存储:

  • 重复数据删除:同一数据区域中的相同图像只存储一次
  • 完整性:验证上传内容以确保数据完整性
  • 效率:优化存储并加快处理速度

数据集 URI#

使用 ul:// URI 格式引用数据集(参见使用 Platform 数据集):

yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset

配置好API 密钥后,你就可以从任何计算机上使用 Platform 数据集进行训练。

通过 Python 使用 Platform 数据
from ultralytics import YOLO

model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)

数据集版本控制#

创建不可变的 NDJSON 快照,以便进行可复现训练。每个版本都会记录创建时的图像数量、类别数量和标注数量。详情请参阅版本选项卡。

数据集选项卡#

根据数据集状态和你的权限,数据集页面最多可显示六个选项卡:

选项卡说明
图像以网格、紧凑或表格视图浏览图像,并叠加显示标注
类别查看、重命名、重新着色、合并和删除类别,并查看每个类别的标签数量
图表自动统计数据:数据划分分布、类别数量、热力图
模型在此数据集上训练的模型,包含指标和状态
版本创建、比较、下载和还原不可变的 NDJSON 快照
错误处理失败的图像,以及错误详情和修复指南

当数据集包含图像且其任务设有类别时,会显示 Classes;只要数据集包含图像,就会显示 Charts。只有存在处理失败时,才会显示 Errors。当你拥有编辑权限时会显示 Versions;如果已有版本,则只读模式下也会显示。

聚类#

将数据集作为交互式二维散点图进行探索:视觉上相似的图像会彼此靠近,有助于发现聚类、重复图像和离群值,并检查数据划分或类别在数据中的分布情况。套索选取一个区域或点击某个点,即可筛选图库,只显示对应图像。分析要求图像数量在 20 到 200,000 张之间,且这些图像不能有处理错误。借助相同的嵌入,你可以在公开数据集、自己的数据集和团队数据集中查找相似图像,并将图像添加到自己的数据集中。详情请参阅聚类。

统计与可视化#

Charts 选项卡会提供自动分析,包括:

  • 数据划分分布:以环形图显示训练/验证/测试图像数量
  • 热门类别:以环形图显示标注数量最多的 10 个类别
  • 图像尺寸:图像宽度和高度分布直方图(单位:像素)
  • 图像尺寸 2D:宽度与高度的二维热力图,带有宽高比参考线
  • 标注位置:边界框中心位置的二维热力图
  • 每个实例的点数:多边形顶点或关键点数量分布(分割/姿态数据集)

查看 Charts 选项卡 获取完整列表。

  • 数据集:上传、管理和导出训练数据
  • 标注:使用手动和 AI 辅助工具标注数据
  • 云端训练:使用已标注的数据集训练模型
  • 数据集 URI:使用 ul:// URI 从任何位置开始训练

常见问题#

  • Ultralytics Platform 支持:

    图像: JPEG、PNG、WebP、BMP、TIFF、HEIC、AVIF、JP2、DNG、MPO(每个文件最大 50MB)

    视频: MP4、WebM、MOV、MKV、M4V(最大 1GB,按 1 FPS 抽取帧,最多 100 帧)

    数据集文件: ZIP 或 TAR 压缩包,包含 .tar.gz 和 .tgz(Free 版最大 10GB、Pro 版 20GB、Enterprise 版 50GB),其中可包含图像以及可选的 YOLO 格式、COCO JSON 或 LabelMe JSON 标签、语义 PNG 掩码或深度图,以及 Ultralytics NDJSON 或 Labelbox NDJSON 导出文件

    也可以在 New Dataset 对话框的 URL 选项卡中粘贴直接 HTTP(S) 链接,导入上述任意压缩包或 NDJSON 格式。系统会检测 Pascal VOC XML 标签,但不会导入。

  • 存储限制取决于你的套餐:

    套餐存储上限
    Free100 GB
    Pro500 GB
    Enterprise无限

    单个文件限制:图像 50MB,视频 1GB,数据集 Free 版 10GB / Pro 版 20GB / Enterprise 版 50GB

  • 可以!使用数据集 URI 格式进行本地训练:

    export ULTRALYTICS_API_KEY="YOUR_API_KEY"
    yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100

    或者,将数据集导出为 NDJSON 格式,以便传输元数据、数据划分、标注和签名图像 URL。

评论