Ultralytics YOLO27:
Get Started

云端训练#

Ultralytics Platform 云端训练支持一键式云 GPU 训练,无需复杂设置即可轻松训练模型。训练 YOLO 模型时,可实时查看指标流并自动保存检查点。

graph LR
    A[Configure]:::start --> B[Start Training]:::proc
    B --> C[Provision GPU]:::proc
    C --> D[Download Dataset]:::proc
    D --> E[Train]:::proc
    E --> F[Stream Metrics]:::proc
    F --> G[Save Checkpoints]:::proc
    G --> H[Complete]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

训练对话框#

在任意项目或数据集页面点击 New Model,即可通过平台 UI 开始训练。训练对话框有两个选项卡:Cloud Training 和 Local Training。如果所选数据集位于 On Premise 主机上,第一个选项卡会变为 On Premise,而 Local Training 选项卡会隐藏——该数据集只能在其所在主机上训练,这需要 Enterprise 计划以及已连接且在线的工作节点。

Ultralytics Platform 训练对话框的云端选项卡

对于当前浏览器中的每个数据集任务和工作区,对话框都会记住你上次关闭时选择的基础模型和所有非默认参数,并在下次为该任务打开对话框时恢复这些设置。GPU 选择不会被记住;如果运行失败,点击 Retry Training 则会恢复该次运行使用的参数。

第 1 步:选择基础模型#

选择官方 Ultralytics 模型或你自己已完成的模型:

选项卡说明
官方YOLO26(推荐)、YOLO11、YOLOv8 和 YOLOv5 项目模型
我的模型按项目分组的你已完成或已上传的模型,可用于微调

在每个选项卡中,模型按规范顺序按任务分组,并按尺寸排序。两个选项卡都只会列出能够训练所选数据集任务的模型。YOLO26 提供从 nano 到 xlarge 尺寸的检测、分割、语义、深度、分类、姿态和 OBB变体。

深度训练

深度数据集可上传以米为单位的浮点 NPY 标签,或使用数据集的 depth_scale 上传 uint16 PNG 标签。请参阅深度数据集格式。深度模型默认采用微调方案(optimizer: AdamW、lr0: 0.0001、warmup_bias_lr: 0.0001),除非你自行设置这些参数。

第 2 步:选择数据集#

选择用于训练的数据集(请参阅数据集):

选项说明
官方Ultralytics 精选数据集
我的数据集工作区中的数据集
数据集要求

数据集必须处于 ready 状态,训练拆分中至少有 1 张图像,验证或测试拆分中至少有 1 张图像,至少有 1 张已标注图像,并且至少包含一个类别名称。分类数据集还要求训练拆分中的图像已标注;姿态数据集必须定义关键点形状。深度数据集则需要 train 中有一组配对图,以及 val 中有两组配对图;未配对图像将被排除。

任务不匹配

如果所选模型无法训练该数据集任务,系统会显示任务不匹配警告;在你选择兼容模型之前,Start Training 按钮会保持禁用状态。分割数据集可使用分割或语义模型;其他数据集任务必须使用对应任务的模型。请参阅任务指南。

第 3 步:配置参数#

设置核心训练参数:

参数说明默认值
Epochs训练迭代次数(1-10000)100
Batch Size每次迭代的样本数(-1 会根据可用 VRAM 自动适配,或者指定固定图像数量)-1(自动)
图像尺寸输入分辨率滑块,范围为 32-1280,步长为 32640
名称训练运行的可选名称自动

在参数范围之外输入的值会在输入框失去焦点时自动限制到有效范围内。

高于 1280 的图像尺寸

滑块上限为 1280,但 YAML 编辑器接受最高 4096 的尺寸。高于 1280 时会显示警告,因为更高的分辨率会显著增加 GPU 内存用量、训练时间和成本。

第 4 步:高级设置(可选)#

展开 Advanced Settings,即可使用基于 YAML 的参数编辑器,其中包含 Training Settings 和 Image Augmentations 部分下的 50 多个训练参数(请参阅配置参考):

分组参数量
学习率lr0、lrf、momentum、weight_decay、warmup_epochs、warmup_momentum、warmup_bias_lr
优化器auto(默认)、SGD、MuSGD、Adam、AdamW、NAdam、RAdam、RMSProp、Adamax
损失权重box、cls、cls_pw、dfl、pose、kobj、rle、angle、dlog、dgrad、dlam
颜色增强hsv_h、hsv_s、hsv_v
几何增强degrees、translate、scale、shear、perspective
翻转与混合增强flipud, fliplr, mosaic, mixup, copy_paste, bgr, cutmix, copy_paste_mode, auto_augment, erasing
训练控制epochs, batch, imgsz, pretrained, patience, seed, deterministic, amp, cos_lr, compile, close_mosaic, save_period, nbs, cls_remap, channels_last, profile, overlap_mask, mask_ratio
数据集fraction, freeze, single_cls, rect, multi_scale, resume
验证max_det

这些参数会根据任务类型显示(例如,copy_paste 仅适用于分割、语义分割和 OBB 任务;pose/kobj 仅适用于姿态任务;auto_augment/erasing 仅适用于分类任务)。编辑器会忽略 device、cache、workers、iou、dropout、val 和 time,粘贴或拖入配置时也会忽略这些参数;在本地训练时,请在你自己的 yolo train 命令中设置这些参数。值与默认值不同时会显示 Modified 徽标,你也可以使用重置按钮将所有值恢复为默认值。只有非默认的高级参数会发送到训练作业(epochs、batch 和图像尺寸这几个基本参数始终会包含在内),因此生成的命令更易读。

示例:调整小型数据集的增强设置

对于小型数据集(<1000 张图像),请增加数据增强以减少过拟合:

mosaic: 1.0       # Keep mosaic on
mixup: 0.3        # Add mixup blending
copy_paste: 0.3   # Add copy-paste (segment, semantic, OBB)
fliplr: 0.5       # Horizontal flip
degrees: 10.0     # Slight rotation
scale: 0.9        # Aggressive scaling

保存数据集版本(可选)#

启用 保存数据集版本,即可将模型关联到托管在 Platform 上的不可变数据集版本。Platform 会检查数据集内容是否发生变化;如果内容未变,就会复用匹配的版本,只有在需要时才会创建新的编号版本。之后,训练会使用该确切的 NDJSON 快照,并在模型上记录其版本号和内容哈希值。

即使你之后添加或删除图像、编辑标注或更改数据集划分,这样也能保留本次运行所用的数据。你可以在数据集的 模型 和 版本 选项卡中找到关联的版本。

仅适用于托管在 Platform 上的数据集

保存数据集版本不适用于已连接的云存储和 On Premise 数据集。你也可以通过版本选项卡手动创建快照。

第 5 步:选择 GPU(云端选项卡)#

在 Ultralytics Cloud 中选择你的 GPU:

Ultralytics Platform 训练对话框 GPU 选择器和费用

GPU代际显存每小时费用适用场景
RTX 2000 AdaAda16 GB$0.24小型数据集、测试
RTX A4500Ampere20 GB$0.25小型到中型数据集
RTX 4000 AdaAda20 GB$0.26中型数据集
RTX A5000Ampere24 GB$0.27中型数据集
L4Ada24 GB$0.39针对推理优化
A40Ampere48 GB$0.44较大的批次大小
RTX 3090Ampere24 GB$0.46通用训练
RTX A6000Ampere48 GB$0.49大型模型
RTX PRO 4000Blackwell24 GB$0.57经济型 Blackwell
RTX PRO 4500Blackwell32 GB$0.64性价比出色
RTX 4090Ada24 GB$0.69性价比最佳
RTX 6000 AdaAda48 GB$0.77大批次训练
L40SAda48 GB$0.86大批次训练
RTX PRO 5000Blackwell48 GB$0.96大批次训练
RTX 5090Blackwell32 GB$0.99最新一代消费级产品
L40Ada48 GB$0.99大型模型
A100 PCIeAmpere80 GB$1.39生产环境训练
A100 SXMAmpere80 GB$1.49生产环境训练
RTX PRO 6000Blackwell96 GB$2.09推荐默认选项
H100 PCIeHopper80 GB$2.89高性能训练
H100 NVLHopper94 GB$3.19最高性能
H100 SXMHopper80 GB$3.29最快的训练
H200 NVLHopper143 GB$3.39最大显存
H200 SXMHopper141 GB$4.39最高性能
B200Blackwell180 GB$5.89大型模型(Pro+)
B300Blackwell288 GB$7.39最大型模型(Pro+)
GPU 选择
  • RTX PRO 6000:96 GB Blackwell,大多数作业的推荐默认选项
  • A100 SXM:80 GB HBM2e,适合较大的批次或更大的模型
  • H100 PCIe / H100 SXM / H100 NVL:80–94 GB Hopper,适合对训练时间敏感的场景(所有套餐均可用)
  • H200 NVL / H200 SXM:141–143 GB Hopper,适合高内存负载(所有套餐均可用)
  • B200 / B300:180–288 GB NVIDIA Blackwell,适用于前沿工作负载——需要Pro 或 Enterprise

对话框会显示你当前的余额和充值按钮。费用卡片会根据你的配置(模型大小、数据集图像数量、epochs、图像尺寸、批次大小、优化器和 GPU 速度)估算总时长和价格,还会报告每个 epoch 的预计秒数以及数据集图像数量。

实时容量与自动故障转移

GPU 选择器会反映云端的实时库存,因此容量不足的选项会被标记。如果作业仍无法安排到你选择的 GPU 上,Platform 会报告容量不足,并将你的选择切换为最接近的可用 GPU——优先匹配 VRAM,其次是速度,最后是价格——同时告知你新的 VRAM 和每小时费率,让你可以立即开始训练或另选 GPU。

免费升级 GPU

选择价格低于 RTX PRO 6000 的 GPU 后,你的作业就有资格使用由 Ultralytics 管理的基础设施。当该基础设施有空闲容量时,作业会在 RTX PRO 6000 上运行,但仍按你所选 GPU 的费率计费,因此作业可能比使用所选 GPU 更快完成、花费更少;升级本身绝不会让作业变慢或增加费用。

第 6 步:开始训练#

点击开始训练以启动作业。Platform 将:

  1. 启用保存数据集版本时,解析不可变的数据集版本
  2. 配置 GPU 实例
  3. 下载你的数据集
  4. 开始训练
  5. 实时传输指标

重新训练现有模型时,会沿用同一个模型页面;新作业创建后,上一次运行的图表、控制台输出、系统指标和错误状态都会清除。如果作业在配置计算资源之前就失败,则先前的结果会保持不变。

训练作业生命周期#

训练作业会经历以下状态:

状态说明
正在启动已提交作业,正在配置 GPU、下载数据集和模型
运行中训练进行中,指标实时传输
已完成训练成功完成
失败训练失败(请查看控制台日志了解详情)
已取消用户已取消训练

如果控制台输出中出现致命 Python 错误——例如回溯信息、CUDA 显存不足错误或 CUDA 初始化失败——运行会立即结束,而不会等待超时;提取出的错误消息会显示在模型页面的错误横幅中,并提供查看完整控制台日志和重试训练操作。连续 4 小时没有活动报告的运行会自动标记为失败,并释放其计算资源。

如需在不保持此页面打开的情况下接收运行成功或失败的结果,请接入 Slack 提醒。

免费额度

新账户会获得注册额度:个人邮箱为 5 美元,公司邮箱为 25 美元。前往“设置”>“账单”查看余额。

Ultralytics Platform 训练进度和图表

监控训练#

在模型页面的训练选项卡中查看实时训练进度:

图表子标签页#

Ultralytics Platform 模型训练实时图表

图表按指标类别分组,显示哪些分组取决于本次运行报告的内容:

分组内容
指标任务指标——检测任务的 mAP50、mAP50-95、精确率和召回率;其他任务请参阅模型
损失每个损失分量对应一张图表,训练数据系列为实线,验证数据系列为虚线
学习率lr/pg0、lr/pg1、lr/pg2

每个分组都可以折叠;你可以从分组菜单中隐藏或显示单张图表,也可以拖动并调整图表大小——布局会被保存,以便下次使用。

控制台子标签页#

实时控制台输出支持 ANSI 颜色、进度条和致命错误检测。系统会保留最后 2000 行日志;你可以切换时间戳的显示状态,也可以将整个日志复制为纯文本。

系统子标签页#

实时主机卡片(主机名、CPU、GPU、RAM 和磁盘总量),以及按 epoch 显示的 CPU 和 RAM 使用量、GPU 利用率和内存、GPU 温度、网络 I/O 和磁盘 I/O 图表。

检查点#

最佳检查点(best.pt)会在训练期间定期上传到 Platform,并在运行结束时再次上传,因此下载、导出和部署始终会使用迄今为止产生的最佳 epoch。如果运行被取消,则会保留取消前上传的检查点。

取消训练#

点击模型页面“运行信息”卡片中的取消,然后确认操作。对于云端训练,Platform 会停止作业、释放其计算资源,并按取消前已使用的 GPU 时间计费。对于本地训练,系统会发送信号,让进程在下一个 epoch 边界停止,并保留部分结果——运行退出前会上传现有结果。

远程训练#

graph LR
    A[Local GPU]:::start --> B[ultralytics Package]:::proc
    B --> C[Train]:::proc
    C --> D[Stream Metrics]:::proc
    D --> E[Platform Dashboard]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

在你自己的硬件上训练,同时将指标实时传输到平台。

软件包版本要求

Platform 集成要求 Python>=3.11 和 ultralytics>=8.4.120。较低版本无法与 Platform 配合使用。

pip install -U ultralytics

设置 API 密钥#

  1. 前往 Settings > API Keys
  2. 创建新密钥(或者在你打开“本地训练”选项卡时,平台会自动创建一个密钥)
  3. 设置环境变量:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"

使用指标流式传输进行训练#

使用 project 和 name 参数流式传输指标:

yolo train model=yolo26n.pt data=coco.yaml epochs=100 \
  project=username/my-project name=experiment-1

训练对话框中的本地训练选项卡会显示预先配置的命令,其中包含你的 API 密钥、所选参数和高级参数。

使用 Platform 数据集#

使用存储在平台上的数据集进行训练,格式为 ul:// URI:

yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100 \
  project=username/my-project name=exp1

ul:// URI 格式会自动下载并配置你的数据集。模型会自动关联到平台上的数据集(参阅使用 Platform 数据集)。

计费#

训练费用根据 GPU 使用量计算:

费用估算#

训练开始前,平台会根据数据集大小、模型大小、图像尺寸、批次大小、epochs 和所选 GPU 估算总时长和费用。估算值仅供参考;实际用量才是计费依据。

影响费用的因素:

因素影响
数据集大小图像越多,训练时间越长(计算量大致随数据集大小线性增长)
模型大小较大的模型(m、l、x)比(n、s)训练得慢
Epoch 数量训练时间的直接倍数因子
图像尺寸较大的 imgsz 会显著增加计算量——1280px 的开销是 640px 的数倍
Batch Size大批次比小批次训练效率更高
GPU 速度更快的 GPU 可以缩短训练时间,部分抵消较高的每小时费率
优化器MuSGD 所需时间大约是其他优化器的两倍
启动开销实例初始化、数据下载和预热最多需要 5 分钟(耗时随数据集大小增长)

估算值基于真实的云端训练运行,而且始终使用你所选的 GPU 进行估算——因此,若作业被分配到速度更快的 Ultralytics 基础设施上,就会比估算时间更早完成。

费用示例#

估算

费用估算仅供参考,具体费用取决于多种因素。开始训练前,训练对话框会显示实时估算。

场景GPU预估费用
500 张图像,YOLO26n,50 个 epochsRTX 4090~$0.03
1000 张图像,YOLO26n,100 个训练周期RTX PRO 6000~$0.23
5000 张图像,YOLO26s,100 个训练周期H100 SXM~$1.56

计费流程#

graph LR
    A[Estimate Cost]:::start --> B[Balance Check]:::decide
    B --> C[Train and Meter GPU Time]:::proc
    C --> D[Settle at Terminal State]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff

云端训练计费流程:

  1. 预估:在训练开始前计算费用
  2. 余额检查:启动前检查可用额度
  3. 训练与计量:作业在所选计算资源上运行,运行期间产生的 GPU 使用时长会分批从你的余额中扣除
  4. 结算:作业进入终止状态时,扣除剩余时长的费用,并为整个训练作业记入一笔 Training 交易
消费者保护

计费会根据实际 GPU 使用时长进行,包括云端 GPU 启动后取消或失败的部分运行作业。

按作业状态计费#

状态是否收费?
已完成是 — 按实际 GPU 使用时长计费
已取消是 — 按从开始到取消期间的 GPU 使用时长计费
失败是,云端计算资源启动后 — 按已使用的 GPU 时长计费
卡住是 — 按自动终止前经过的 GPU 使用时长计费

如果运行作业连续 4 小时未报告活动,系统会自动将其标记为失败,终止实例并结算已产生的 GPU 使用时长。在你自己的硬件上运行的远程作业只会被标记为失败,不会产生费用。

计算资源启动前发生的故障

云端 GPU 启动前发生验证或启动故障,不会产生可计费的计算资源使用量。GPU 启动后,已完成、已取消、失败和自动终止的作业都会按经过的 GPU 墙钟时间结算。

付款方式#

云端训练费用从你的 Platform 额度余额中扣除。

最低余额

开始训练需要有正数的可用余额,并且额度足以支付作业的预估费用;每次预估至少按 15 分钟的 GPU 使用时长计算。如果同时有多个运行作业,检查时也会计入这些作业尚未计费的剩余时长。

查看训练费用#

开始云端作业前,训练对话框会显示你当前的额度余额,并根据所选模型、数据集、训练周期数、图像尺寸和 GPU 预估作业时长及费用。此预估仅供参考;实际费用按 GPU 使用时长收取。之后,你可以在 Settings > Billing 中查看相应的额度交易。

Ultralytics Platform 训练计费详情

训练技巧#

选择合适的模型尺寸#

模型参数量适用场景
YOLO26n2.4M实时应用、边缘设备
YOLO26s9.5M速度与准确率均衡
YOLO26m20.4M更高准确率
YOLO26l24.8M生产级准确率
YOLO26x55.7M最高准确率

优化训练时间#

节省成本的策略
  1. 从小规模开始:先使用经济型 GPU 训练 10-20 个周期,验证数据集和配置是否正常
  2. 使用合适的 GPU:RTX PRO 6000 能很好地处理大多数工作负载
  3. 验证数据集:在投入训练费用前修复标注问题
  4. 尽早监控:如果损失趋于平稳,就取消训练 — 你只需为已使用的计算时长付费

故障排除#

问题解决方案
训练卡在 0%检查数据集格式,然后重试
内存不足减小批次大小或使用更大的 GPU
准确率较低增加训练周期数,检查数据质量
训练速度慢考虑使用速度更快的 GPU
任务不匹配错误确保模型与数据集的任务类型一致

训练参数参考#

参数类型默认值范围说明
epochs整数1001-10000训练周期数
batch整数/浮点数-1(自动)-1、0-1 或 >=1批次大小(-1 = 自动适配可用 VRAM,0-1 = GPU 内存占比)
imgsz整数64032-4096输入图像尺寸
pretrained布尔值True-从预训练权重开始训练,而不是随机初始化
patience整数1000-1000提前停止的耐心值(0 表示禁用)
time浮点数null0.1-720以小时为单位的墙钟训练时限,会覆盖训练周期数
seed整数00-2147483647用于复现的随机种子
deterministic布尔值True-确定性训练模式
amp布尔值/字符串Truetrue/false/fp16/bf16/fp32训练精度
compile布尔值False-使用 torch.compile 编译(第一个训练周期较慢)
close_mosaic整数10>=0在最后 N 个训练周期中禁用马赛克增强
save_period整数-1>=-1每 N 个训练周期保存一次检查点
device选择自动auto/0/cpu/mps训练设备
workers整数80-64数据加载器工作进程数
cache选择falseram/disk/false缓存图像
dropout浮点数0.00.0-1.0分类头 dropout(仅用于分类)
iou浮点数0.70.1-0.9验证期间 NMS 使用的 IoU 阈值
max_det整数3001-10000每张图像的最大检测数
特定任务参数

部分参数仅适用于特定任务:

  • 检测、分割、姿态和 OBB:box、cls、dfl、single_cls、iou、max_det
  • 除深度和分类外的所有任务(检测、分割、语义分割、姿态、OBB):mosaic、mixup、close_mosaic
  • 除分类外的所有任务(检测、分割、语义分割、深度、姿态、OBB):degrees、translate、shear、perspective
  • 分割、语义分割和 OBB:copy_paste
  • 仅深度:dlog、dgrad、dlam
  • 仅分类:dropout
  • 仅姿态:pose(损失权重)、kobj(关键点目标置信度)、rle
  • 仅 OBB:angle

常见问题#

  • 训练时间取决于:

    • 数据集大小
    • 模型大小
    • 轮数
    • 所选 GPU

    典型耗时(1000 张图像,100 个周期):

    模型RTX PRO 6000A100 SXM
    YOLO26n~6 分钟~5 分钟
    YOLO26m~15 分钟~12 分钟
    YOLO26x~30 分钟~25 分钟
    预计耗时

    训练耗时为估算值,会因数据集复杂度、增强设置和批次大小而异。请使用训练对话框中的费用估算,以获得更准确的预测。

  • 可以。只要资金充足,训练就能无人值守运行;Platform 会记录完成或失败事件。如果计量扣费使余额低于零,正在运行的付费云端任务会停止,并结算已使用的 GPU 时间。

  • 云端用量会随着训练进度计量。如果扣费导致余额低于零,正在运行的付费云端训练任务会停止,并结算已使用的 GPU 时间。添加积分或启用自动充值,以确保长时间运行的任务资金充足。

    负余额

    余额为零或负数时,无法启动新的付费云端训练任务。计量产生的负余额也会触发正在运行的付费云端训练任务关闭。

  • 费用估算为近似值——实际训练时间可能会因数据加载速度、GPU 预热和模型收敛行为等因素而异。如果实际用量耗尽可用余额,Platform 会在余额变为负数后停止正在运行的付费云端任务。

    管理费用的方法:

    • 实时监控训练进度,并在需要时提前取消
    • 启用自动充值,自动补充积分
    • 先运行较短的训练(减少周期数),以校准预期
  • 可以,在训练对话框中展开 高级设置 部分,即可使用包含 50 多个可配置参数的 YAML 编辑器。非默认值会包含在云端和本地训练命令中。

    YAML 编辑器还支持导入之前训练任务的配置:

    • 从现有模型复制:在任何已完成模型的页面上,训练配置卡片中的 导出数据 菜单提供 复制 JSON 选项。将 JSON 直接粘贴到 YAML 编辑器中——编辑器会自动检测 JSON 格式并导入所有参数。同一菜单还可将配置下载为 CSV 或 JSON。
    • 粘贴 YAML 或 JSON:将任何有效的 YAML 或 JSON 训练配置粘贴到编辑器中。参数会自动验证,超出范围的值会被限制在有效范围内,并显示警告。
    • 拖放文件:将 .yaml 或 .json 文件直接拖到编辑器中,以导入其中的参数。

    Ultralytics Platform 训练对话框:复制训练配置 JSON

    这样一来,无需手动重新输入每个参数,就能轻松复现或迭代之前的训练配置。

  • 可以。失败的模型会显示错误横幅和 重试训练 操作。点击后会重新打开训练对话框,其中保留相同的基础模型、数据集和参数,因此你可以调整一个值后重新开始。重试会沿用同一个模型页面:新任务创建后,之前运行的图表、控制台输出、系统指标和错误都会清除;新任务生成更优检查点时,模型权重也会被替换。

  • 可以,数据集页面上的 新建模型 按钮会打开训练对话框,并预先选定且锁定该数据集。然后选择项目和模型即可开始训练。

评论