Ultralytics YOLO27:

快速入门指南:搭配 Ultralytics YOLO26 使用 NVIDIA DGX Spark#

本综合指南将详细介绍如何在 NVIDIA DGX Spark(NVIDIA 紧凑型桌面 AI 超级计算机)上部署 Ultralytics YOLO26。此外,指南还展示了性能基准测试,以说明 YOLO26 在这一强大系统上的能力。

NVIDIA DGX Spark AI workstation overview

注意

本指南已在运行基于 Ubuntu 的 DGX OS 的 NVIDIA DGX Spark Founders Edition 上完成测试。预计它也适用于最新的 DGX OS 版本。

什么是 NVIDIA DGX Spark?#

NVIDIA DGX Spark 是一款由 NVIDIA GB10 Grace Blackwell Superchip 驱动的紧凑型桌面 AI 超级计算机。它采用 FP4 精度时可提供高达 1 petaFLOP 的 AI 计算性能,非常适合需要在桌面设备形态中使用强大 AI 能力的开发者、研究人员和数据科学家。



Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference

主要规格#

规格详细信息
AI 性能最高 1 PFLOP(FP4)
GPUNVIDIA Blackwell 架构,配备第 5 代 Tensor Core 和第 4 代 RT Core
CPU20 核 Arm 处理器(10 个 Cortex-X925 + 10 个 Cortex-A725)
内存128 GB LPDDR5x 统一系统内存,256 位接口,4266 MHz,带宽 273 GB/s
存储1 TB 或 4 TB NVMe M.2,支持自加密
网络1 个 RJ-45(10 GbE)、ConnectX-7 Smart NIC、Wi-Fi 7、Bluetooth 5.4
连接性4 个 USB Type-C、1 个 HDMI 2.1a、HDMI 多声道音频
视频处理1 个 NVENC、1 个 NVDEC

DGX OS#

NVIDIA DGX OS 是一个定制的 Linux 发行版,为在 DGX 系统上运行 AI、机器学习和分析应用提供稳定、经过测试且受支持的操作系统基础。它包括:

  • 针对 AI 工作负载优化的稳健 Linux 基础
  • 为 NVIDIA 硬件预配置的驱动程序和系统设置
  • 安全更新和系统维护功能
  • 与更广泛的 NVIDIA 软件生态系统兼容

DGX OS 遵循定期发布计划,通常每年提供两次更新(约在 2 月和 8 月),并在主要版本之间提供额外的安全补丁。

DGX Dashboard#

DGX Spark 内置了 DGX Dashboard,可提供:

  • 实时系统监控:概览系统当前的运行指标
  • 系统更新:可直接从控制面板应用更新
  • 系统设置:更改设备名称和其他配置
  • 集成式 JupyterLab:访问本地 Jupyter Notebook 进行开发

NVIDIA DGX management dashboard interface

访问控制面板#

点击 Ubuntu 桌面左下角的“Show Apps”按钮,然后选择“DGX Dashboard”,在浏览器中打开它。

集成式 JupyterLab

控制面板包含一个集成式 JupyterLab 实例,启动时会自动创建虚拟环境并安装推荐的软件包。每个用户账户都会分配一个专用端口,用于访问 JupyterLab。

使用 Docker 快速开始#

在 NVIDIA DGX Spark 上快速上手 Ultralytics YOLO26 的方法是使用预构建的 docker 镜像。NVIDIA ARM64 镜像支持搭载 DGX OS 的 DGX Spark。

t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $t

上述 CDI 设备请求适用于运行 DGX OS 的 DGX Spark。有关 Jetson AGX Thor 上的 PyTorch 工作负载,请参阅NVIDIA Jetson 指南中的单独主机要求和 TensorRT 限制。

该镜像使用 NVIDIA PyTorch 26.08、CUDA 13.4 和 TensorRT 11。将 DGX OS 主机驱动程序更新至NVIDIA PyTorch 26.08支持的版本,并在更改镜像或目标 GPU 后重新构建 TensorRT 引擎。

完成后,跳转到在 NVIDIA DGX Spark 上使用 TensorRT部分。

从原生安装开始#

如需不使用 Docker 进行原生安装,请按照以下步骤操作。

安装 Ultralytics 包#

这里将在 DGX Spark 上安装 Ultralytics 软件包。首次导出模型时会自动安装导出依赖,因此这里仅需安装基础软件包。我们将主要关注 NVIDIA TensorRT 导出,因为 TensorRT 能确保充分发挥 DGX Spark 的最大性能。

  1. 更新软件包列表、安装 pip 并升级到最新版本

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. 安装 ultralytics pip 包

    pip install ultralytics
  3. 重启设备

    sudo reboot

安装 PyTorch 和 Torchvision#

上述 ultralytics 安装会安装 Torch 和 Torchvision。不过,通过 pip 安装的这些软件包可能未针对 DGX Spark 的 ARM64 架构和 CUDA 13 进行完全优化。因此,我们建议安装兼容 CUDA 13 的版本:

pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130
信息

在 NVIDIA DGX Spark 上运行 PyTorch 2.9.1 时,初始化 CUDA 可能会遇到以下 UserWarning(例如运行 yolo checksyolo predict 等时):

UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)

可以安全地忽略此警告。要永久解决此问题,PyTorch PR #164590 中已提交修复方案,该修复将包含在 PyTorch 2.10 版本中。

安装 onnxruntime-gpu#

当前的ONNX Runtime GPU 发布版本提供 Linux ARM64 whl 包(包含 Python 3.12)。NVIDIA ARM64 Docker 镜像会安装官方软件包;对于本机 CUDA 13 安装,请使用:

pip install onnxruntime-gpu

在 NVIDIA DGX Spark 上使用 TensorRT#

在 Ultralytics 支持的所有模型导出格式中,TensorRT 在 NVIDIA DGX Spark 上提供最高的推理性能,因此是我们对部署的首选推荐。有关设置说明和高级用法,请参阅我们的专用 TensorRT 集成指南

将模型转换为 TensorRT 并运行推理#

PyTorch 格式的 YOLO26n 模型会转换为 TensorRT,以便使用导出的模型运行推理。

示例
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Export the model to TensorRT
model.export(format="engine")  # creates 'yolo26n.engine'

# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")

# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")
注意

访问导出页面,获取将模型导出为不同模型格式时的其他参数

NVIDIA DGX Spark YOLO11 基准测试#

Ultralytics 团队在多种模型格式下对 YOLO11 进行了基准测试,测量速度和准确率:PyTorch、TorchScript、ONNX、OpenVINO、TensorRT、TF SavedModel、TF GraphDef、TF Lite、MNN、NCNN、ExecuTorch。基准测试在 NVIDIA DGX Spark 上以 FP32 精度运行,默认输入图像大小为 640。

详细对比表#

下表展示了五种不同模型(YOLO11n、YOLO11s、YOLO11m、YOLO11l、YOLO11x)在多种格式下的基准测试结果,列出了每种组合的状态、大小、mAP50-95(B) 指标和推理时间。

性能
格式状态磁盘占用大小(MB)mAP50-95(B)推理时间(ms/图像)
PyTorch5.40.50712.67
TorchScript10.50.50832.62
ONNX10.20.50745.92
OpenVINO10.40.505814.95
TensorRT (FP32)12.80.50851.95
TensorRT (FP16)7.00.50681.01
TensorRT (INT8)18.60.48801.62
TF SavedModel25.70.507636.39
TF GraphDef10.30.507641.06
TF Lite10.30.507564.36
MNN10.10.507512.14
NCNN10.20.504112.31
ExecuTorch10.20.507527.61

使用 Ultralytics 8.3.249 进行基准测试

复现我们的结果#

要在所有导出格式上复现上述 Ultralytics 基准测试,请运行以下代码:

示例
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)

请注意,基准测试结果可能因系统的确切硬件和软件配置,以及运行基准测试时系统的当前工作负载而有所不同。为获得最可靠的结果,请使用包含大量图像的数据集,例如 data='coco.yaml'(5000 张验证图像)。

NVIDIA DGX Spark 最佳实践#

使用 NVIDIA DGX Spark 运行 YOLO26 时,应遵循一些最佳实践,以实现最高性能。

  1. 监控系统性能

    使用 NVIDIA 的监控工具跟踪 GPU 和 CPU 利用率:

    nvidia-smi
  2. 优化内存使用

    DGX Spark 具有 128GB 统一内存,可处理较大的批量大小和模型。可以考虑增大批量大小,以提高吞吐量:

    from ultralytics import YOLO
    
    model = YOLO("yolo26n.engine")
    results = model.predict(source="path/to/images", batch=16)
  3. 使用 FP16 或 INT8 的 TensorRT

    为获得最佳性能,请以 FP16 或 INT8 精度导出模型:

    yolo export model=yolo26n.pt format=engine quantize=16 # FP16
    yolo export model=yolo26n.pt format=engine quantize=8  # INT8

系统更新(Founders Edition)#

及时更新 DGX Spark Founders Edition 对性能和安全性至关重要。NVIDIA 提供两种主要方法,用于更新系统操作系统、驱动程序和固件。

使用 DGX Dashboard(推荐)#

建议使用 DGX Dashboard 执行系统更新,以确保兼容性。你可以通过它:

  • 查看可用的系统更新
  • 安装安全补丁和系统更新
  • 管理 NVIDIA 驱动程序和固件更新

手动系统更新#

对于高级用户,可以通过终端手动执行更新:

sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot
警告

执行更新前,请确保系统已连接到稳定的电源,并且已备份关键数据。

后续步骤#

如需进一步学习和支持,请参阅 Ultralytics YOLO26 文档

常见问题#

  • 在 NVIDIA DGX Spark 上部署 Ultralytics YOLO26 非常简单。你可以使用预构建的 Docker 镜像快速设置,也可以手动安装所需的软件包。每种方法的详细步骤请参阅使用 Docker 快速开始开始原生安装部分。

  • 得益于 GB10 Grace Blackwell Superchip,YOLO26 模型在 DGX Spark 上能够提供出色的性能。TensorRT 格式可提供最佳推理性能。请查看详细对比表部分,了解不同模型大小和格式下的具体基准测试结果。

  • 由于性能出色,强烈建议使用 TensorRT 在 DGX Spark 上部署 YOLO26 模型。它利用 Blackwell GPU 的能力加速推理,确保最高效率和速度。请在在 NVIDIA DGX Spark 上使用 TensorRT部分了解更多信息。

  • DGX Spark 可提供最高 1 PFLOP 的 AI 性能和 128GB 统一内存,而 Jetson AGX Thor 提供 2070 TFLOPS 和 128GB 内存。DGX Spark 是一款桌面 AI 超级计算机,而 Jetson 设备是针对边缘部署进行优化的嵌入式系统。

  • 对于 PyTorch 工作负载,ultralytics/ultralytics:latest-nvidia-arm64 支持搭载 DGX OS 的 DGX Spark 以及搭载 JetPack 7.1 的 Thor。由于捆绑的 TensorRT 11.2 不支持 JetPack,Jetson TensorRT 工作负载必须为其 JetPack 版本使用受支持的 TensorRT 10.x 运行时。请参阅Jetson Docker 要求

评论