快速入门指南:搭配 Ultralytics YOLO26 使用 NVIDIA DGX Spark#
本综合指南将详细介绍如何在 NVIDIA DGX Spark(NVIDIA 紧凑型桌面 AI 超级计算机)上部署 Ultralytics YOLO26。此外,指南还展示了性能基准测试,以说明 YOLO26 在这一强大系统上的能力。
本指南已在运行基于 Ubuntu 的 DGX OS 的 NVIDIA DGX Spark Founders Edition 上完成测试。预计它也适用于最新的 DGX OS 版本。
什么是 NVIDIA DGX Spark?#
NVIDIA DGX Spark 是一款由 NVIDIA GB10 Grace Blackwell Superchip 驱动的紧凑型桌面 AI 超级计算机。它采用 FP4 精度时可提供高达 1 petaFLOP 的 AI 计算性能,非常适合需要在桌面设备形态中使用强大 AI 能力的开发者、研究人员和数据科学家。
Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference
主要规格#
| 规格 | 详细信息 |
|---|---|
| AI 性能 | 最高 1 PFLOP(FP4) |
| GPU | NVIDIA Blackwell 架构,配备第 5 代 Tensor Core 和第 4 代 RT Core |
| CPU | 20 核 Arm 处理器(10 个 Cortex-X925 + 10 个 Cortex-A725) |
| 内存 | 128 GB LPDDR5x 统一系统内存,256 位接口,4266 MHz,带宽 273 GB/s |
| 存储 | 1 TB 或 4 TB NVMe M.2,支持自加密 |
| 网络 | 1 个 RJ-45(10 GbE)、ConnectX-7 Smart NIC、Wi-Fi 7、Bluetooth 5.4 |
| 连接性 | 4 个 USB Type-C、1 个 HDMI 2.1a、HDMI 多声道音频 |
| 视频处理 | 1 个 NVENC、1 个 NVDEC |
DGX OS#
NVIDIA DGX OS 是一个定制的 Linux 发行版,为在 DGX 系统上运行 AI、机器学习和分析应用提供稳定、经过测试且受支持的操作系统基础。它包括:
- 针对 AI 工作负载优化的稳健 Linux 基础
- 为 NVIDIA 硬件预配置的驱动程序和系统设置
- 安全更新和系统维护功能
- 与更广泛的 NVIDIA 软件生态系统兼容
DGX OS 遵循定期发布计划,通常每年提供两次更新(约在 2 月和 8 月),并在主要版本之间提供额外的安全补丁。
DGX Dashboard#
DGX Spark 内置了 DGX Dashboard,可提供:
- 实时系统监控:概览系统当前的运行指标
- 系统更新:可直接从控制面板应用更新
- 系统设置:更改设备名称和其他配置
- 集成式 JupyterLab:访问本地 Jupyter Notebook 进行开发
访问控制面板#
点击 Ubuntu 桌面左下角的“Show Apps”按钮,然后选择“DGX Dashboard”,在浏览器中打开它。
控制面板包含一个集成式 JupyterLab 实例,启动时会自动创建虚拟环境并安装推荐的软件包。每个用户账户都会分配一个专用端口,用于访问 JupyterLab。
使用 Docker 快速开始#
在 NVIDIA DGX Spark 上快速上手 Ultralytics YOLO26 的方法是使用预构建的 docker 镜像。NVIDIA ARM64 镜像支持搭载 DGX OS 的 DGX Spark。
t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $t上述 CDI 设备请求适用于运行 DGX OS 的 DGX Spark。有关 Jetson AGX Thor 上的 PyTorch 工作负载,请参阅NVIDIA Jetson 指南中的单独主机要求和 TensorRT 限制。
该镜像使用 NVIDIA PyTorch 26.08、CUDA 13.4 和 TensorRT 11。将 DGX OS 主机驱动程序更新至NVIDIA PyTorch 26.08支持的版本,并在更改镜像或目标 GPU 后重新构建 TensorRT 引擎。
完成后,跳转到在 NVIDIA DGX Spark 上使用 TensorRT部分。
从原生安装开始#
如需不使用 Docker 进行原生安装,请按照以下步骤操作。
安装 Ultralytics 包#
这里将在 DGX Spark 上安装 Ultralytics 软件包。首次导出模型时会自动安装导出依赖,因此这里仅需安装基础软件包。我们将主要关注 NVIDIA TensorRT 导出,因为 TensorRT 能确保充分发挥 DGX Spark 的最大性能。
-
更新软件包列表、安装 pip 并升级到最新版本
sudo apt update sudo apt install python3-pip -y pip install -U pip -
安装
ultralyticspip 包pip install ultralytics -
重启设备
sudo reboot
安装 PyTorch 和 Torchvision#
上述 ultralytics 安装会安装 Torch 和 Torchvision。不过,通过 pip 安装的这些软件包可能未针对 DGX Spark 的 ARM64 架构和 CUDA 13 进行完全优化。因此,我们建议安装兼容 CUDA 13 的版本:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130在 NVIDIA DGX Spark 上运行 PyTorch 2.9.1 时,初始化 CUDA 可能会遇到以下 UserWarning(例如运行 yolo checks、yolo predict 等时):
UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)可以安全地忽略此警告。要永久解决此问题,PyTorch PR #164590 中已提交修复方案,该修复将包含在 PyTorch 2.10 版本中。
安装 onnxruntime-gpu#
当前的ONNX Runtime GPU 发布版本提供 Linux ARM64 whl 包(包含 Python 3.12)。NVIDIA ARM64 Docker 镜像会安装官方软件包;对于本机 CUDA 13 安装,请使用:
pip install onnxruntime-gpu在 NVIDIA DGX Spark 上使用 TensorRT#
在 Ultralytics 支持的所有模型导出格式中,TensorRT 在 NVIDIA DGX Spark 上提供最高的推理性能,因此是我们对部署的首选推荐。有关设置说明和高级用法,请参阅我们的专用 TensorRT 集成指南。
将模型转换为 TensorRT 并运行推理#
PyTorch 格式的 YOLO26n 模型会转换为 TensorRT,以便使用导出的模型运行推理。
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Export the model to TensorRT
model.export(format="engine") # creates 'yolo26n.engine'
# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")
# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")访问导出页面,获取将模型导出为不同模型格式时的其他参数
NVIDIA DGX Spark YOLO11 基准测试#
Ultralytics 团队在多种模型格式下对 YOLO11 进行了基准测试,测量速度和准确率:PyTorch、TorchScript、ONNX、OpenVINO、TensorRT、TF SavedModel、TF GraphDef、TF Lite、MNN、NCNN、ExecuTorch。基准测试在 NVIDIA DGX Spark 上以 FP32 精度运行,默认输入图像大小为 640。
详细对比表#
下表展示了五种不同模型(YOLO11n、YOLO11s、YOLO11m、YOLO11l、YOLO11x)在多种格式下的基准测试结果,列出了每种组合的状态、大小、mAP50-95(B) 指标和推理时间。
| 格式 | 状态 | 磁盘占用大小(MB) | mAP50-95(B) | 推理时间(ms/图像) |
|---|---|---|---|---|
| PyTorch | ✅ | 5.4 | 0.5071 | 2.67 |
| TorchScript | ✅ | 10.5 | 0.5083 | 2.62 |
| ONNX | ✅ | 10.2 | 0.5074 | 5.92 |
| OpenVINO | ✅ | 10.4 | 0.5058 | 14.95 |
| TensorRT (FP32) | ✅ | 12.8 | 0.5085 | 1.95 |
| TensorRT (FP16) | ✅ | 7.0 | 0.5068 | 1.01 |
| TensorRT (INT8) | ✅ | 18.6 | 0.4880 | 1.62 |
| TF SavedModel | ✅ | 25.7 | 0.5076 | 36.39 |
| TF GraphDef | ✅ | 10.3 | 0.5076 | 41.06 |
| TF Lite | ✅ | 10.3 | 0.5075 | 64.36 |
| MNN | ✅ | 10.1 | 0.5075 | 12.14 |
| NCNN | ✅ | 10.2 | 0.5041 | 12.31 |
| ExecuTorch | ✅ | 10.2 | 0.5075 | 27.61 |
使用 Ultralytics 8.3.249 进行基准测试
复现我们的结果#
要在所有导出格式上复现上述 Ultralytics 基准测试,请运行以下代码:
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)请注意,基准测试结果可能因系统的确切硬件和软件配置,以及运行基准测试时系统的当前工作负载而有所不同。为获得最可靠的结果,请使用包含大量图像的数据集,例如 data='coco.yaml'(5000 张验证图像)。
NVIDIA DGX Spark 最佳实践#
使用 NVIDIA DGX Spark 运行 YOLO26 时,应遵循一些最佳实践,以实现最高性能。
-
监控系统性能
使用 NVIDIA 的监控工具跟踪 GPU 和 CPU 利用率:
nvidia-smi -
优化内存使用
DGX Spark 具有 128GB 统一内存,可处理较大的批量大小和模型。可以考虑增大批量大小,以提高吞吐量:
from ultralytics import YOLO model = YOLO("yolo26n.engine") results = model.predict(source="path/to/images", batch=16) -
使用 FP16 或 INT8 的 TensorRT
为获得最佳性能,请以 FP16 或 INT8 精度导出模型:
yolo export model=yolo26n.pt format=engine quantize=16 # FP16 yolo export model=yolo26n.pt format=engine quantize=8 # INT8
系统更新(Founders Edition)#
及时更新 DGX Spark Founders Edition 对性能和安全性至关重要。NVIDIA 提供两种主要方法,用于更新系统操作系统、驱动程序和固件。
使用 DGX Dashboard(推荐)#
建议使用 DGX Dashboard 执行系统更新,以确保兼容性。你可以通过它:
- 查看可用的系统更新
- 安装安全补丁和系统更新
- 管理 NVIDIA 驱动程序和固件更新
手动系统更新#
对于高级用户,可以通过终端手动执行更新:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot执行更新前,请确保系统已连接到稳定的电源,并且已备份关键数据。
后续步骤#
如需进一步学习和支持,请参阅 Ultralytics YOLO26 文档。
常见问题#
在 NVIDIA DGX Spark 上部署 Ultralytics YOLO26 非常简单。你可以使用预构建的 Docker 镜像快速设置,也可以手动安装所需的软件包。每种方法的详细步骤请参阅使用 Docker 快速开始和开始原生安装部分。
得益于 GB10 Grace Blackwell Superchip,YOLO26 模型在 DGX Spark 上能够提供出色的性能。TensorRT 格式可提供最佳推理性能。请查看详细对比表部分,了解不同模型大小和格式下的具体基准测试结果。
由于性能出色,强烈建议使用 TensorRT 在 DGX Spark 上部署 YOLO26 模型。它利用 Blackwell GPU 的能力加速推理,确保最高效率和速度。请在在 NVIDIA DGX Spark 上使用 TensorRT部分了解更多信息。
DGX Spark 可提供最高 1 PFLOP 的 AI 性能和 128GB 统一内存,而 Jetson AGX Thor 提供 2070 TFLOPS 和 128GB 内存。DGX Spark 是一款桌面 AI 超级计算机,而 Jetson 设备是针对边缘部署进行优化的嵌入式系统。
对于 PyTorch 工作负载,
ultralytics/ultralytics:latest-nvidia-arm64支持搭载 DGX OS 的 DGX Spark 以及搭载 JetPack 7.1 的 Thor。由于捆绑的 TensorRT 11.2 不支持 JetPack,Jetson TensorRT 工作负载必须为其 JetPack 版本使用受支持的 TensorRT 10.x 运行时。请参阅Jetson Docker 要求。