Ultralytics YOLO27:

快速入门指南:使用 Ultralytics YOLO26 的 NVIDIA Jetson#

本综合指南详细介绍了如何在 NVIDIA Jetson 设备上部署 Ultralytics YOLO26。此外,指南还展示了性能基准测试,以说明 YOLO26 在这些小型高性能设备上的能力。

新增产品支持

我们已使用最新的 NVIDIA Jetson AGX Thor Developer Kit 更新本指南。该设备可提供高达 2070 FP4 TFLOPS 的 AI 算力和 128 GB 内存,功耗可在 40 W 至 130 W 之间配置。与 NVIDIA Jetson AGX Orin 相比,其 AI 算力提升超过 7.5 倍,能效提升 3.5 倍,可无缝运行最热门的 AI 模型。



Watch: How to use Ultralytics YOLO26 on NVIDIA Jetson Devices
NVIDIA Jetson Ecosystem
注意

本指南已在运行最新稳定版 JetPack 7.2NVIDIA Jetson AGX Thor Developer Kit (Jetson T5000)NVIDIA Jetson AGX Orin Developer Kit (64GB)、运行 JetPack JP6.1 版本的 NVIDIA Jetson Orin Nano Super Developer Kit、基于 NVIDIA Jetson Orin NX 16GB 且运行 JetPack JP6.0 版本 / JetPack JP5.1.3 版本的 Seeed Studio reComputer J4012,以及基于 NVIDIA Jetson Nano 4GB 且运行 JetPack JP4.6.1 版本的 Seeed Studio reComputer J1020 v2 上进行了测试。预计它可适用于 NVIDIA Jetson 的完整硬件产品线,包括最新设备和旧款设备。

什么是 NVIDIA Jetson?#

NVIDIA Jetson 是一系列嵌入式计算板卡,旨在将加速 AI(人工智能)计算带到边缘设备。这些小巧而高性能的设备基于 NVIDIA 的 GPU 架构构建,可直接在设备上运行复杂的 AI 算法和深度学习模型,而无需依赖云计算资源。Jetson 板卡常用于机器人、自动驾驶车辆、工业自动化以及其他需要在本地以低延迟和高效率执行 AI 推理的应用场景。此外,这些板卡基于 ARM64 架构运行,相比传统 GPU 计算设备功耗更低。

NVIDIA Jetson 系列对比#

NVIDIA Jetson AGX Thor 是 NVIDIA Jetson 系列的最新版本,基于 NVIDIA Blackwell 架构,与前几代产品相比,AI 性能大幅提升。下表对比了该生态系统中的几款 Jetson 设备。

Jetson AGX Thor(T5000)Jetson AGX Orin 64GBJetson Orin NX 16GBJetson Orin Nano SuperJetson AGX XavierJetson Xavier NXJetson Nano
AI 性能2070 TFLOPS275 TOPS100 TOPS67 TOPS32 TOPS21 TOPS472 GFLOPS
GPU采用 NVIDIA Blackwell 架构的 2560 核 GPU,配备 96 个 Tensor Cores采用 NVIDIA Ampere 架构的 2048 核 GPU,配备 64 个 Tensor Cores采用 NVIDIA Ampere 架构的 1024 核 GPU,配备 32 个 Tensor Cores采用 NVIDIA Ampere 架构的 1024 核 GPU,配备 32 个 Tensor Cores采用 NVIDIA Volta 架构的 512 核 GPU,配备 64 个 Tensor Cores采用 NVIDIA Volta™ 架构的 384 核 GPU,配备 48 个 Tensor Cores采用 NVIDIA Maxwell™ 架构的 128 核 GPU
GPU 最大频率1.57 GHz1.3 GHz918 MHz1020 MHz1377 MHz1100 MHz921MHz
CPU14 核 Arm® Neoverse®-V3AE 64 位 CPU,1MB L2 + 16MB L312 核 NVIDIA Arm® Cortex A78AE v8.2 64 位 CPU,3MB L2 + 6MB L38 核 NVIDIA Arm® Cortex A78AE v8.2 64 位 CPU,2MB L2 + 4MB L36 核 Arm® Cortex®-A78AE v8.2 64 位 CPU,1.5MB L2 + 4MB L38 核 NVIDIA Carmel Arm®v8.2 64 位 CPU,8MB L2 + 4MB L36 核 NVIDIA Carmel Arm®v8.2 64 位 CPU,6MB L2 + 4MB L3四核 Arm® Cortex®-A57 MPCore 处理器
CPU 最大频率2.6 GHz2.2 GHz2.0 GHz1.7 GHz2.2 GHz1.9 GHz1.43GHz
内存128GB 256 位 LPDDR5X 273GB/s64GB 256 位 LPDDR5 204.8GB/s16GB 128 位 LPDDR5 102.4GB/s8GB 128 位 LPDDR5 102 GB/s32GB 256 位 LPDDR4x 136.5GB/s8GB 128 位 LPDDR4x 59.7GB/s4GB 64 位 LPDDR4 25.6GB/s

如需查看更详细的对比表,请访问 NVIDIA Jetson 官方页面中的 比较规格 部分。

什么是 NVIDIA JetPack?#

为 Jetson 模组提供支持的 NVIDIA JetPack SDK 是最全面的解决方案,为构建端到端加速 AI 应用提供完整的开发环境,并缩短产品上市时间。JetPack 包含 Jetson Linux,以及引导加载程序、Linux 内核、Ubuntu 桌面环境和一整套用于加速 GPU 计算、多媒体、图形和计算机视觉的库。此外,它还包含主机计算机和开发套件所需的示例、文档和开发者工具,并支持用于流式视频分析的 DeepStream、用于机器人技术的 Isaac 以及用于对话式 AI 的 Riva 等更高级别的 SDK。

将 JetPack 刷写到 NVIDIA Jetson#

拿到 NVIDIA Jetson 设备后,第一步是将 NVIDIA JetPack 刷写到设备中。刷写 NVIDIA Jetson 设备有多种不同方式。

  1. 对于官方 Jetson AGX Thor、AGX Orin 或 Orin Nano Developer Kit 上的 JetPack 7.2,请下载统一版 Jetson ISO,将其写入 USB 闪存盘,然后按照 AGX ThorAGX OrinOrin Nano 的设备专用快速入门指南操作。从 JetPack 7.2 开始,Orin Nano 不再使用可下载的 SD 卡镜像;ISO USB 会将 Jetson Linux 安装到设备的 microSD 卡或 NVMe SSD 上。
  2. 如果你确实要在 Jetson Orin Nano Developer Kit 上使用 JetPack 6,请遵循 NVIDIA 的 JetPack 6.x 更新和 SD 卡说明
  3. 如果你拥有其他 NVIDIA Development Kit,可以使用 SDK Manager 将 JetPack 刷写到设备
  4. 如果你拥有 Seeed Studio reComputer J4012 设备,可以将 JetPack 刷写到随附的 SSD;如果你拥有 Seeed Studio reComputer J1020 v2 设备,则可以将 JetPack 刷写到 eMMC/ SSD
  5. 如果你拥有其他由 NVIDIA Jetson 模组驱动的第三方设备,建议遵循命令行刷写方式。
注意

对于上述第 1、4 和 5 种方法,在刷写系统并启动设备后,请在设备终端中输入 "sudo apt update && sudo apt install nvidia-jetpack -y",以安装所需的其余全部 JetPack 组件。

基于 Jetson 设备的 JetPack 支持#

下表列出了不同 NVIDIA Jetson 设备支持的 NVIDIA JetPack 版本。

JetPack 4JetPack 5JetPack 6JetPack 7
Jetson Nano
Jetson TX2
Jetson Xavier NX
Jetson AGX Xavier
Jetson AGX Orin
Jetson Orin NX
Jetson Orin Nano
Jetson AGX Thor

使用 Docker 快速开始#

在 NVIDIA Jetson 上开始使用 Ultralytics YOLO26 的最快方式,是运行为 Jetson 预构建的 Docker 镜像。请参考上表,并根据你拥有的 Jetson 设备选择相应的 JetPack 版本。

t=ultralytics/ultralytics:latest-jetson-jetpack4
sudo docker pull $t && sudo docker run -it --ipc=host --runtime=nvidia $t
JetPack 7 Docker 和 TensorRT 支持

latest-nvidia-arm64 镜像使用 NVIDIA PyTorch 26.08,包含 CUDA 13.4 和 TensorRT 11.2。NVIDIA 在其兼容性表格中列出了适用于 PyTorch 的 JetPack 7.1,但TensorRT 11.2.1 不支持 JetPack(包括 Thor)。此镜像仅适用于支持的主机上的 PyTorch 工作负载。对于 Jetson TensorRT 导出,请使用下方的原生安装,并配合 JetPack 版本支持的 TensorRT 10.x 运行时。Thor 或 Orin 上的 JetPack 7.2 需要单独的容器验证。为目标 GPU 和 TensorRT 版本重新构建引擎。

对于 JetPack 4、5 和 6 镜像,请继续参考在 NVIDIA Jetson 上使用 TensorRT。上方的 JetPack 7.1 镜像仅用于 PyTorch 工作负载。

从原生安装开始#

如需不使用 Docker 进行原生安装,请参考以下步骤。

在 JetPack 7.2 上运行#

安装 Ultralytics 包#

这里将在 Jetson 上安装 Ultralytics 包。导出依赖项会在你首次导出模型时自动安装,因此此处只需安装基础包。我们将主要关注 NVIDIA TensorRT 导出,因为 TensorRT 可确保充分发挥 Jetson 设备的性能。

  1. 更新软件包列表、安装 pip 并升级到最新版本

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. 安装 ultralytics pip 包

    pip install ultralytics
  3. 重启设备

    sudo reboot

安装 PyTorch 和 Torchvision#

上述 ultralytics 安装会安装 Torch 和 Torchvision。不过,通过 pip 安装的这两个包与使用 CUDA 13 的 JetPack 7.2 设备不兼容。因此,我们需要手动安装它们。

根据 JP7.2 安装 torchtorchvision

pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130

安装 onnxruntime-gpu#

使用与你的 JetPack、Python 和 CUDA 版本匹配的 ONNX Runtime GPU wheel。当前的 PyPI 版本包含 ARM64 wheel,但它们不能替代每个 JetPack 版本的设备专用软件包。

这里将下载并安装支持 Python3.12onnxruntime-gpu 1.24.0

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/onnxruntime_gpu-1.24.0-cp312-cp312-linux_aarch64.whl

在 JetPack 6.1 上运行#

安装 Ultralytics 包#

这里将在 Jetson 上安装 Ultralytics 包。导出依赖项会在你首次导出模型时自动安装,因此此处只需安装基础包。我们将主要关注 NVIDIA TensorRT 导出,因为 TensorRT 可确保充分发挥 Jetson 设备的性能。

  1. 更新软件包列表、安装 pip 并升级到最新版本

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. 安装 ultralytics pip 包

    pip install ultralytics
  3. 重启设备

    sudo reboot

安装 PyTorch 和 Torchvision#

上述 ultralytics 安装会安装 Torch 和 Torchvision。不过,通过 pip 安装的这两个包与基于 ARM64 架构的 Jetson 平台不兼容。因此,我们需要手动安装预构建的 PyTorch pip wheel,并从源代码编译或安装 Torchvision。

根据 JP6.1 安装 torch 2.10.0torchvision 0.25.0

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torch-2.10.0-cp310-cp310-linux_aarch64.whl
pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torchvision-0.25.0-cp310-cp310-linux_aarch64.whl
注意

访问 Jetson PyTorch 页面,获取适用于不同 JetPack 版本的所有 PyTorch 版本。如需查看更详细的 PyTorch 和 Torchvision 兼容性列表,请访问 PyTorch 和 Torchvision 兼容性页面

安装 cuDSS 以修复与 torch 2.10.0 的依赖问题

wget https://developer.download.nvidia.com/compute/cudss/0.7.1/local_installers/cudss-local-tegra-repo-ubuntu2204-0.7.1_0.7.1-1_arm64.deb
sudo dpkg -i cudss-local-tegra-repo-ubuntu2204-0.7.1_0.7.1-1_arm64.deb
sudo cp /var/cudss-local-tegra-repo-ubuntu2204-0.7.1/cudss-*-keyring.gpg /usr/share/keyrings/
sudo apt-get update
sudo apt-get -y install cudss

安装 onnxruntime-gpu#

使用与你的 JetPack、Python 和 CUDA 版本匹配的 ONNX Runtime GPU wheel。当前的 PyPI 版本包含 ARM64 wheel,但它们不能替代每个 JetPack 版本的设备专用软件包。

你可以在 Jetson Zoo ONNX Runtime 兼容性矩阵中找到所有可用的 onnxruntime-gpu 包,这些包按 JetPack 版本、Python 版本及其他兼容性详细信息进行整理。

对于支持 Python 3.10JetPack 6,你可以安装 onnxruntime-gpu 1.23.0

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/onnxruntime_gpu-1.23.0-cp310-cp310-linux_aarch64.whl

或者,对于 onnxruntime-gpu 1.20.0

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/onnxruntime_gpu-1.20.0-cp310-cp310-linux_aarch64.whl

在 JetPack 5.1.2 上运行#

安装 Ultralytics 包#

这里将在 Jetson 上安装 Ultralytics 包。导出依赖项会在你首次导出模型时自动安装,因此此处只需安装基础包。我们将主要关注 NVIDIA TensorRT 导出,因为 TensorRT 可确保充分发挥 Jetson 设备的性能。

  1. 更新软件包列表、安装 pip 并升级到最新版本

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. 安装 ultralytics pip 包

    pip install ultralytics
  3. 重启设备

    sudo reboot

安装 PyTorch 和 Torchvision#

上述 ultralytics 安装会安装 Torch 和 Torchvision。不过,通过 pip 安装的这两个包与基于 ARM64 架构的 Jetson 平台不兼容。因此,我们需要手动安装预构建的 PyTorch pip wheel,并从源代码编译或安装 Torchvision。

  1. 卸载当前已安装的 PyTorch 和 Torchvision

    pip uninstall torch torchvision
  2. 根据 JP5.1.2 安装 torch 2.1.0torchvision 0.16.2

    pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torch-2.1.0a0+41361538.nv23.06-cp38-cp38-linux_aarch64.whl
    pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torchvision-0.16.2+c6f3977-cp38-cp38-linux_aarch64.whl
注意

访问 Jetson PyTorch 页面,获取适用于不同 JetPack 版本的所有 PyTorch 版本。如需查看更详细的 PyTorch 和 Torchvision 兼容性列表,请访问 PyTorch 和 Torchvision 兼容性页面

安装 onnxruntime-gpu#

使用与你的 JetPack、Python 和 CUDA 版本匹配的 ONNX Runtime GPU wheel。当前的 PyPI 版本包含 ARM64 wheel,但它们不能替代每个 JetPack 版本的设备专用软件包。

你可以在 Jetson Zoo ONNX Runtime 兼容性矩阵中找到所有可用的 onnxruntime-gpu 包,这些包按 JetPack 版本、Python 版本及其他兼容性详细信息进行整理。这里将下载并安装支持 Python3.8onnxruntime-gpu 1.17.0

wget https://nvidia.box.com/shared/static/zostg6agm00fb6t5uisw51qi6kpcuwzd.whl -O onnxruntime_gpu-1.17.0-cp38-cp38-linux_aarch64.whl
pip install onnxruntime_gpu-1.17.0-cp38-cp38-linux_aarch64.whl
注意

onnxruntime-gpu 会自动将 NumPy 版本恢复到最新版本。因此,我们需要将 NumPy 重新安装为 1.23.5,以通过执行以下命令修复相关问题:

pip install numpy==1.23.5

在 NVIDIA Jetson 上使用 TensorRT#

在 Ultralytics 支持的所有模型导出格式中,TensorRT 在 NVIDIA Jetson 设备上提供最高的推理性能,使其成为你进行 Jetson 部署的首选推荐。在导出之前,安装为你的 JetPack 版本提供的 TensorRT Python 绑定,并使用 python3 -c "import tensorrt; print(tensorrt.__version__)" 进行验证。在 JetPack 6/7 上保留受支持的 TensorRT 10.x 运行时;不要将其替换为 TensorRT 11.2.1。有关设置说明和高级用法,请参阅我们的专属 TensorRT 集成指南

你也可以直接在浏览器中导出,无需在本地配置构建环境。在 Ultralytics Platform 模型导出选项卡中选择 TensorRT 和目标 Jetson 设备。Thor 选项会在实体 Thor 硬件上进行验证。目前,六个 Orin 选项会生成基于 AGX-Orin 构建的候选引擎;部署前请在目标 Orin SKU 上对其进行验证。

TensorRT 引擎具有设备特异性

TensorRT 会在其构建所用的 GPU 上配置并调优引擎。请匹配目标设备的 GPU 架构以及 TensorRT/CUDA 运行时,并在部署设备上验证每个下载的引擎。同架构的 Orin SKU 并不自动保证可移植性;为获得最佳结果,INT8 校准应使用目标设备。

将模型转换为 TensorRT 并运行推理#

PyTorch 格式的 YOLO26n 模型会转换为 TensorRT,以便使用导出的模型运行推理。

示例
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Export the model to TensorRT
model.export(format="engine")  # creates 'yolo26n.engine'

# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")

# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")
注意

访问导出页面,获取将模型导出为不同模型格式时的其他参数

使用 NVIDIA 深度学习加速器 (DLA)#

NVIDIA 深度学习加速器 (DLA) 是内置于 NVIDIA Jetson 设备中的专用硬件组件,可优化深度学习推理的能效和性能。通过将任务从 GPU 转移出去(为 GPU 释放资源以处理更繁重的任务),DLA 可让模型在保持高吞吐量的同时降低功耗,非常适合嵌入式系统和实时 AI 应用。

TensorRT 与 DLA 兼容性

NVIDIA 将 TensorRT 10.7 列为具有DLA 支持的最后一个版本;TensorRT 11.0、11.1 和 11.2 不支持 DLA。使用你的 JetPack 版本支持的具备 DLA 能力的 TensorRT 版本。TensorRT 11.2.1 不支持 JetPack,包括仅 GPU 导出。

以下 Jetson 设备配备了 DLA 硬件:

Jetson 设备DLA 核心数DLA 最大频率
Jetson AGX Orin 系列21.6 GHz
Jetson Orin NX 16GB2614 MHz
Jetson Orin NX 8GB1614 MHz
Jetson AGX Xavier 系列21.4 GHz
Jetson Xavier NX 系列21.1 GHz
示例
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Export the model to TensorRT with DLA enabled (only works with FP16 or INT8)
model.export(format="engine", device="dla:0", quantize=16)  # dla:0 or dla:1 corresponds to the DLA cores

# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")

# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")
注意

使用 DLA 导出时,某些层可能不支持在 DLA 上运行,并会回退到 GPU 执行。这种回退可能引入额外延迟,并影响整体推理性能。因此,与完全在 GPU 上运行的 TensorRT 相比,DLA 的主要设计目标并不是降低推理延迟,而是提高吞吐量和能效。

NVIDIA Jetson YOLO26 基准测试#

Ultralytics 团队在 11 种不同的模型格式上运行了 YOLO26 基准测试,以测量速度和精度:PyTorch、TorchScript、ONNX、OpenVINO、TensorRT、TF SavedModel、TF GraphDef、TF Lite、MNN、NCNN、ExecuTorch。基准测试是在 NVIDIA Jetson AGX Thor Developer Kit、NVIDIA Jetson AGX Orin Developer Kit (64GB)、NVIDIA Jetson Orin Nano Super Developer Kit 以及由 Jetson Orin NX 16GB 设备驱动的 Seeed Studio reComputer J4012 上以 FP32精度且默认输入图像大小为 640 的条件下运行的。

对比图表#

尽管所有模型导出格式都能在 NVIDIA Jetson 上运行,但由于 PyTorch、TorchScript、TensorRT 使用 Jetson 上的 GPU,并且可以确保获得最佳结果,因此我们在下面的对比图表中仅列出了这三种格式。其他所有导出格式仅使用 CPU,性能不如上述三种格式。你可以在本图表之后的部分中查看所有导出格式的基准测试结果。

NVIDIA Jetson AGX Thor Developer Kit#

Jetson AGX Thor Benchmarks
Benchmarked with Ultralytics 8.3.226

NVIDIA Jetson AGX Orin Developer Kit (64GB)#

Jetson AGX Orin Benchmarks
Benchmarked with Ultralytics 8.4.32

NVIDIA Jetson Orin Nano Super Developer Kit#

Jetson Orin Nano Super Benchmarks
Benchmarked with Ultralytics 8.4.33

NVIDIA Jetson Orin NX 16GB#

Jetson Orin NX 16GB Benchmarks
Benchmarked with Ultralytics 8.4.33

详细对比表#

下表展示了五种不同模型(YOLO26n、YOLO26s、YOLO26m、YOLO26l、YOLO26x)在 11 种不同格式(PyTorch、TorchScript、ONNX、OpenVINO、TensorRT、TF SavedModel、TF GraphDef、TF Lite、MNN、NCNN、ExecuTorch)下的基准测试结果,给出了每种组合的状态、大小、mAP50-95(B) 指标和推理时间。

NVIDIA Jetson AGX Thor Developer Kit#

性能
格式状态磁盘占用大小(MB)mAP50-95(B)推理时间(ms/图像)
PyTorch5.30.47987.39
TorchScript9.80.47894.21
ONNX9.50.47676.58
OpenVINO10.10.479417.50
TensorRT (FP32)13.90.47911.90
TensorRT (FP16)7.60.47971.39
TensorRT (INT8)6.50.42731.52
TF SavedModel25.70.476447.24
TF GraphDef9.50.476445.98
TF Lite9.90.4764182.04
MNN9.40.478421.83

使用 Ultralytics 8.4.7 进行基准测试

注意

推理时间不包括预处理和后处理。

NVIDIA Jetson AGX Orin Developer Kit (64GB)#

性能
格式状态磁盘占用大小(MB)mAP50-95(B)推理时间(ms/图像)
PyTorch5.30.479011.58
TorchScript9.80.47704.60
ONNX9.50.47709.87
OpenVINO9.60.482028.80
TensorRT (FP32)11.50.04504.18
TensorRT (FP16)7.90.04502.62
TensorRT (INT8)5.40.46402.30
TF SavedModel24.60.476071.10
TF GraphDef9.50.476070.02
TF Lite9.90.4760227.94
MNN9.40.476032.46
NCNN9.30.481029.93

使用 Ultralytics 8.4.32 进行基准测试

注意

推理时间不包括预处理和后处理。

NVIDIA Jetson Orin Nano Super Developer Kit#

性能
格式状态磁盘占用大小(MB)mAP50-95(B)推理时间(ms/图像)
PyTorch5.30.479015.60
TorchScript9.80.477012.60
ONNX9.50.476015.76
OpenVINO9.60.482056.23
TensorRT (FP32)11.30.47707.53
TensorRT (FP16)8.10.48004.57
TensorRT (INT8)5.30.44903.80
TF SavedModel24.60.4760118.33
TF GraphDef9.50.4760116.30
TF Lite9.90.4760286.00
MNN9.40.476068.77
NCNN9.30.481047.50

使用 Ultralytics 8.4.33 进行基准测试

注意

推理时间不包括预处理和后处理。

NVIDIA Jetson Orin NX 16GB#

性能
格式状态磁盘占用大小(MB)mAP50-95(B)推理时间(ms/图像)
PyTorch5.30.479913.90
TorchScript9.80.478711.60
ONNX9.50.476314.18
OpenVINO9.60.481940.19
TensorRT (FP32)11.40.47707.01
TensorRT (FP16)8.00.47894.13
TensorRT (INT8)5.50.44893.49
TF SavedModel24.60.476492.34
TF GraphDef9.50.476492.06
TF Lite9.90.4764254.43
MNN9.40.476048.55
NCNN9.30.480534.31

使用 Ultralytics 8.4.33 进行基准测试

注意

推理时间不包括预处理和后处理。

探索 Seeed Studio 在不同版本 NVIDIA Jetson 硬件上开展的更多基准测试工作

复现我们的结果#

要在所有导出格式上复现上述 Ultralytics 基准测试,请运行以下代码:

示例
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)

请注意,基准测试结果可能因系统的确切硬件和软件配置,以及运行基准测试时系统的当前工作负载而有所不同。为获得最可靠的结果,请使用包含大量图像的数据集,例如 data='coco.yaml'(5000 张验证图像)。

使用 NVIDIA Jetson 时的最佳实践#

使用 NVIDIA Jetson 运行 YOLO26 时,请遵循以下几项最佳实践,以实现 NVIDIA Jetson 的最高性能。

  1. 启用 MAX Power Mode

    在 Jetson 上启用 MAX Power Mode 可确保所有 CPU、GPU 核心都处于启用状态。

    sudo nvpmodel -m 0
  2. 启用 Jetson Clocks

    启用 Jetson Clocks 可确保所有 CPU、GPU 核心以最高频率运行。

    sudo jetson_clocks
  3. 安装 Jetson Stats 应用

    我们可以使用 jetson stats 应用来监控系统组件的温度,并检查其他系统详细信息,例如查看 CPU、GPU、RAM 利用率,更改电源模式,设置最高时钟频率,以及检查 JetPack 信息

    sudo apt update
    sudo pip install jetson-stats
    sudo reboot
    jtop
Jetson Stats

NVIDIA Jetson 内存优化技巧#

可用内存通常是 Jetson 设备上的限制因素,尤其是在 Jetson Orin Nano (8 GB) 或 Orin NX 8 GB 等低内存版本上。下面的技巧都是实用且风险较低的更改,结合使用后通常可以释放数百 MB 内存,让你运行更大的 YOLO 模型或支持更多并行工作负载。如需全面了解,请参阅 NVIDIA 关于最大化 Jetson 内存效率的博客

1. 切换到无头(无 GUI)启动#

如果你的 Jetson 通过 SSH 连接,或作为未连接显示器的生产设备运行,移除桌面环境和显示服务器最多可以释放 865 MB RAM:

sudo systemctl set-default multi-user.target
sudo reboot

稍后恢复桌面:

sudo systemctl set-default graphical.target
sudo reboot

2. 禁用未使用的系统服务#

非必要的后台服务(蓝牙、连接管理器、未使用的硬件守护进程)合计约占用 32 MB。列出活动服务,并禁用部署不需要的服务:

# List running services
systemctl list-units --type=service --state=running

# Disable a service
sudo systemctl disable SERVICE_NAME

3. 分析内存使用情况#

在进行优化之前,先确定哪些进程实际消耗了 RAM。procrank 会按 PSS(比例集大小)对进程排序。与 RSS(常驻集大小,即进程映射的物理 RAM 页面总量,包括与其他进程共享的页面)相比,PSS 能更准确地反映每个进程的实际内存占用:

git clone https://github.com/csimmonds/procrank_linux.git
cd procrank_linux && make
sudo ./procrank

查看每个进程的 GPU 和 NvMap(CUDA/视频管线)分配情况:

sudo cat /sys/kernel/debug/nvmap/iovmm/clients

4. 在生产环境中无显示器运行推理#

对于不需要实时预览的推理管线,禁用显示相关组件(Tiler、OSD、DisplaySink)仅管线本身就可以节省 200+ MB。使用 Ultralytics YOLO 时,抑制查看器并将结果写入磁盘:

示例
from ultralytics import YOLO

model = YOLO("yolo26n.engine")

# show=False prevents any display window; save=True writes annotated output to disk
results = model.predict(source="video.mp4", show=False, save=True)

累计影响#

优化项预计节省的内存
禁用桌面 GUI~865 MB
禁用未使用的操作系统服务~32 MB
无头推理管线(无显示)~200+ MB
总计(轻松可实现的优化)~1 GB+

在内存受限的设备上部署 TensorRT INT8 模型时,结合使用这些更改尤其有价值——这可能决定你能否将更大的模型变体装入内存。

后续步骤#

如需进一步学习和支持,请参阅 Ultralytics YOLO26 文档

常见问题#

  • 在 NVIDIA Jetson 设备上部署 Ultralytics YOLO26 的过程很简单。首先,使用 NVIDIA JetPack SDK 为你的 Jetson 设备刷写系统。然后,你可以使用预构建的 Docker 镜像快速设置,也可以手动安装所需的软件包。每种方法的详细步骤请参阅 使用 Docker 快速开始从原生安装开始部分。

  • YOLO26 模型已经在各种 NVIDIA Jetson 设备上进行了基准测试,显示出显着的性能提升。例如,TensorRT 格式可提供最佳的推理性能。详细对比表部分的表格全面展示了诸如 mAP50-95 和不同模型格式的推理时间等性能指标。

  • 由于性能出色,强烈推荐使用 TensorRT 在 NVIDIA Jetson 上部署 YOLO26 模型。它利用 Jetson 的 GPU 能力加速推理,确保最高效率和速度。你可以在在 NVIDIA Jetson 上使用 TensorRT部分详细了解如何转换为 TensorRT 并运行推理。

  • 要在 NVIDIA Jetson 上安装 PyTorch 和 Torchvision,请先卸载可能通过 pip 安装的任何现有版本。然后,针对 Jetson 的 ARM64 架构手动安装兼容的 PyTorch 和 Torchvision 版本。相关详细说明请参阅安装 PyTorch 和 Torchvision部分。

  • 要在 NVIDIA Jetson 上使用 YOLO26 最大化性能,请遵循以下最佳实践:

    1. 启用 MAX Power Mode,以利用所有 CPU 和 GPU 核心。
    2. 启用 Jetson Clocks,使所有核心以最高频率运行。
    3. 安装 Jetson Stats 应用,以监控系统指标。

    有关命令和其他详细信息,请参阅使用 NVIDIA Jetson 时的最佳实践部分。

  • 可用 RAM 通常是低内存 Jetson 设备上的瓶颈。以下三项简单优化结合起来可释放超过 1 GB 内存:

    1. 切换到无头启动sudo systemctl set-default multi-user.target),以移除桌面 GUI(节省 ~865 MB)。
    2. 禁用未使用的服务,例如蓝牙或连接管理器(节省 ~32 MB)。
    3. 在无显示器的情况下运行推理:在 YOLO 的 predict 调用中设置 show=False,避免分配显示管线内存(节省 ~200+ MB)。

    使用 procrank 分析每个进程的 RAM 使用情况,并使用 sudo cat /sys/kernel/debug/nvmap/iovmm/clients 检查 GPU 分配。有关完整详情,请参阅内存优化技巧部分。

  • JetPack 6 附带的 TensorRT 10.3.0 存在一个已知问题,当启用 nms=False 时,该问题会阻止 INT8 引擎构建。当 Ultralytics 检测到此组合时,它会自动选择一到多头以确保导出成功。

    要恢复无 NMS 的 INT8 导出,请将 TensorRT 升级到更新的版本(例如 10.7.0+):

    wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/arm64/cuda-keyring_1.1-1_all.deb
    sudo dpkg -i cuda-keyring_1.1-1_all.deb
    sudo apt-get update
    sudo apt-get install -y tensorrt

    升级后,重新运行导出操作。有关更多详情,请参阅 GitHub issue #23841

评论