模型训练#
Ultralytics Platform 提供了全面的工具来训练 YOLO 模型,从组织实验到运行带有实时指标流的云端训练任务。
Watch: Get Started with Ultralytics Platform - Train
概述#
训练部分可以帮助你:

工作流#
graph LR
A[📁 Project]:::start --> B[⚙️ Configure]:::proc
B --> C[🚀 Train]:::proc
C --> D[📈 Monitor]:::proc
D --> E[📦 Export]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff训练选项#
Ultralytics Platform 支持多种训练方式:
| 方法 | 描述 | 最适用场景 |
|---|---|---|
| 云端训练 | 在 Ultralytics 云端 GPU 上进行训练 | 无需本地 GPU,具备可扩展性 |
| 本地训练 | 在本地进行训练,将指标流式传输到平台 | 利用现有硬件,保护隐私 |
| Colab 训练 | 使用集成平台的 Google Colab | 免费的 GPU 访问权限 |
当你选择比 RTX PRO 6000 便宜的 GPU 且 Ultralytics 管理的容量空闲时,平台会在 RTX PRO 6000 上运行你的任务,同时仍按照你所选 GPU 的每小时费率计费。运行速度可能会更快,成本也比在你所选的 GPU 上运行更低 —— 这种升级绝不会增加时间或成本。
GPU 选项#
Ultralytics Cloud 上可用于云端训练的 GPU:
| GPU | 架构 | 显存 (VRAM) | 每小时费用 | 最适用场景 |
|---|---|---|---|---|
| RTX 2000 Ada | Ada | 16 GB | $0.24 | 小规模数据集、测试 |
| RTX A4500 | Ampere | 20 GB | $0.25 | 中小型数据集 |
| RTX 4000 Ada | Ada | 20 GB | $0.26 | 中等规模数据集 |
| RTX A5000 | Ampere | 24 GB | $0.27 | 中等规模数据集 |
| L4 | Ada | 24 GB | $0.39 | 推理优化 |
| A40 | Ampere | 48 GB | $0.44 | 较大的批次大小 |
| RTX 3090 | Ampere | 24 GB | $0.46 | 通用训练 |
| RTX A6000 | Ampere | 48 GB | $0.49 | 大型模型 |
| RTX PRO 4000 | Blackwell | 24 GB | $0.57 | 预算级 Blackwell |
| RTX PRO 4500 | Blackwell | 32 GB | $0.64 | 出色的性价比 |
| RTX 4090 | Ada | 24 GB | $0.69 | 最佳性价比 |
| RTX 6000 Ada | Ada | 48 GB | $0.77 | 大批量训练 |
| L40S | Ada | 48 GB | $0.86 | 大批量训练 |
| RTX PRO 5000 | Blackwell | 48 GB | $0.96 | 大批量训练 |
| RTX 5090 | Blackwell | 32 GB | $0.99 | 最新一代消费级显卡 |
| L40 | Ada | 48 GB | $0.99 | 大型模型 |
| A100 PCIe | Ampere | 80 GB | $1.39 | 生产环境训练 |
| A100 SXM | Ampere | 80 GB | $1.49 | 生产环境训练 |
| RTX PRO 6000 | Blackwell | 96 GB | $2.09 | 推荐默认配置 |
| H100 PCIe | Hopper | 80 GB | $2.89 | 高性能训练 |
| H100 NVL | Hopper | 94 GB | $3.19 | 极致性能 |
| H100 SXM | Hopper | 80 GB | $3.29 | 最快训练 |
| H200 NVL | Hopper | 143 GB | $3.39 | 最大内存 |
| H200 SXM | Hopper | 141 GB | $4.39 | 极致性能 |
| B200 | Blackwell | 180 GB | $5.89 | 大型模型 (Pro+) |
| B300 | Blackwell | 288 GB | $7.39 | 超大型模型 (Pro+) |
B200 和 B300 GPU 需要Pro 或 Enterprise 计划。所有其他 GPU 在所有计划(包括 Free)中均可使用。
新账户会获得用于训练的注册赠送额度。查看账单了解详情。
实时指标#
训练期间,可在三个子标签页中查看实时指标:
graph LR
A[Charts]:::start --> B[Loss Curves]:::out
A --> C[Task Metrics]:::out
D[Console]:::start --> E[Live Logs]:::out
D --> F[Error Detection]:::out
G[System]:::start --> H[GPU, CPU & Memory]:::out
G --> I[Network & Disk I/O]:::out
classDef start fill:#4CAF50,color:#fff
classDef out fill:#9C27B0,color:#fff| 子标签页 | 指标 |
|---|---|
| 图表 | 任务指标(mAP50、mAP50-95、检测的精度、召回率)、训练/验证损失、学习率 |
| 控制台 | 带有 ANSI 颜色和自动错误检测功能的实时训练日志 |
| 系统 | GPU 利用率、GPU 内存和温度、CPU、RAM、网络以及磁盘 I/O |
最佳检查点(best.pt,即适应度最高的轮次)会在训练运行期间定期上传到平台,并在运行结束时再次上传,因此下载、导出和部署始终使用迄今为止产生的最佳轮次。已取消的运行将保留最后完成上传的检查点。
快速入门#
不到一分钟即可开启云训练:
- 在侧边栏中创建一个项目
- 点击 新建模型
- 选择模型、数据集和 GPU
- 点击 开始训练
快捷链接#
常见问题解答#
训练时间取决于:
- 数据集大小(图片数量)
- 模型大小 (n, s, m, l, x)
- Epoch(轮次)数量
- 所选 GPU 类型
当前估算器预测,在 RTX PRO 6000 上针对 1000 张图像、YOLO26n、100 个 epoch 大约需要 6 分钟,在 RTX 4090 上针对 500 张图像、YOLO26n、50 个 epoch 大约需要 2 分钟。实际持续时间会有所不同;请使用所选数据集和配置的训练对话框中的实时估算。参见成本示例。
可以。并发云训练限制取决于你的计划:Free 允许 3 个,Pro 允许 10 个,Enterprise 无限制。如需进行更多的并行训练,请从多台机器使用远程训练。
如果训练失败:
- 该模型被标记为失败,计算实例已终止
- 模型页面会显示一个包含所捕获错误的错误横幅、指向控制台输出的链接,以及一个重试操作,该操作会使用相同的配置重新打开训练对话框
- 停止报告活动达数小时的运行将自动被标记为失败并释放其计算资源
- 如果云端计算已启动,则会收取已耗费的 GPU 时间费用;在计算启动前失败则不会产生 GPU 使用费
场景 推荐 GPU 大多数训练任务 RTX PRO 6000 大型数据集或大批量 (batch sizes) H100 SXM 或 H200 注重预算 RTX 4090