Ultralytics YOLO27:

Ultralytics YOLO 模型的 DEEPX 导出#

在专用 NPU 硬件上部署计算机视觉模型,需要兼容且经过优化的模型格式。将 Ultralytics YOLO 模型导出为 DEEPX 格式,可在 DEEPX NPU 加速器上实现高效的 INT8 量化推理。本指南将介绍如何将 YOLO 模型转换为 DEEPX 格式,并部署到由 DEEPX 驱动的硬件上。

什么是 DEEPX?#

DEEPX NPU Inference

DEEPX 是一家专注于人工智能半导体的公司,专门研发为边缘端低功耗 深度学习 推理设计的神经处理器(NPUs)。DEEPX NPU 专为要求严苛的嵌入式和工业 AI 应用打造,能以极低功耗实现高吞吐量。DEEPX 硬件非常适合云连接不可靠或不受欢迎的部署场景,例如机器人、智能摄像头和工业自动化系统。

DEEPX 导出格式#

DEEPX 导出会生成已编译的 .dxnn 模型二进制文件,该文件针对 DEEPX NPU 硬件上的运行进行了优化。编译流程使用 dx_com 工具包执行 INT8 量化和硬件专属优化,并生成可直接部署的独立模型目录。

DEEPX 模型的主要特性#

DEEPX 模型为边缘部署带来多项优势:

  • INT8 量化:导出时会将模型量化为 INT8 精度,大幅减小模型体积并最大限度提高 NPU 吞吐量。了解更多关于模型量化的信息。
  • 针对 NPU 优化:.dxnn 格式专门为 DEEPX NPU 硬件编译,利用专用加速单元实现快速、高效的推理。
  • 低功耗:通过将推理任务交由 NPU 处理,DEEPX 模型的功耗远低于同等的 CPU 或 GPU 推理。
  • 基于校准的精度:导出过程使用真实数据集图像进行基于 EMA 的校准,以尽量减少量化过程中的精度损失。
  • 独立输出:导出的模型目录包含已编译的二进制文件、校准配置和元数据,可轻松完成部署。

支持的任务#

DEEPX 导出支持 Ultralytics 的全部七种任务。语义分割和深度估计仅适用于 YOLO26,因为只有 YOLO26 系列提供这两种任务头。

任务YOLOv8YOLO11YOLO26
检测✅✅✅
分割✅✅✅
语义分割❌❌✅
深度估计❌❌✅
分类✅✅✅
姿态✅✅✅
OBB✅✅✅

导出为 DEEPX 格式:转换 YOLO 模型#

将 Ultralytics YOLO 模型导出为 DEEPX 格式,并使用导出的模型运行推理。

注意

DEEPX 导出仅支持在 x86-64 Linux 计算机上进行。导出步骤不支持 ARM64 (aarch64)。不过,导出的 dxnn 模型完全兼容 ARM64 平台,并可在 ARM64 平台上运行。

安装#

要安装所需的软件包,请运行:

安装
# Install the required package for YOLO
pip install ultralytics

首次导出时,系统会自动从 DEEPX SDK 仓库安装 dx_com 编译器。目前的导出工作流使用 DX-COM 2.3.0,该版本为运行 glibc 2.31 或更高版本的 x86-64 Linux 提供 Python 3.8–3.12 对应的 wheel。

该编译器在 PyPI 上发布的版本已撤回。如需预先安装导出依赖,请使用 --find-links 指定 SDK wheel 页面;这种方式适用于 pip 和 uv pip:

pip install "ultralytics[export-deepx]" --find-links https://sdk.deepx.ai/release/dxcom/v2.3.0/index.html

如需以可编辑模式安装仓库,请将 "ultralytics[export-deepx]" 替换为 -e ".[export-base,export-deepx]"。如需复现 CI 使用的 Python 3.12 环境和导出冒烟测试,请从仓库根目录运行现有的环境构建器:

ULTRALYTICS_ISOLATED_VENVS="$PWD/.venvs" python .github/scripts/create-export-env.py --env isolated-deepx

环境构建器需要安装 uv 和 Ultralytics 源代码仓库。它会从 SDK 源安装编译器,并自动应用经过测试的依赖约束。

用法#

DEEPX 格式支持 导出、预测和验证模式。推理和验证都在 DEEPX NPU 硬件上运行。先导出模型,然后加载导出的模型以运行推理或验证模型精度。

导出
from ultralytics import YOLO

# 加载 YOLO26 模型
model = YOLO("yolo26n.pt")

# 将模型导出为 DEEPX 格式(会自动强制启用 quantize=8)
model.export(format="deepx")  # creates 'yolo26n_deepx_model/'
预测
from ultralytics import YOLO

# 加载导出的 DEEPX 模型
model = YOLO("yolo26n_deepx_model")

# 运行推理
results = model("https://ultralytics.com/images/bus.jpg")
验证
from ultralytics import YOLO

# 加载导出的 DEEPX 模型
model = YOLO("yolo26n_deepx_model")

# 在 COCO8 数据集上验证精度
metrics = model.val(data="coco8.yaml")

导出参数#

参数类型默认值说明
formatstr'deepx'导出模型的目标格式,用于定义其与 DEEPX NPU 硬件的兼容性。
imgszint 或 tuple640模型输入所需的图像尺寸。DEEPX 导出要求输入为正方形——传入整数(例如 640),或传入高宽相等的元组。
quantizeint 或 str8/自动量化精度。DEEPX 导出必须使用 8 (INT8);如果未指定,系统会自动启用。此参数取代已弃用的 half/int8 标志。
simplifyboolTrue使用 onnxslim 简化中间 ONNX 图。
opsetintNone指定中间 ONNX 图的 ONNX opset 版本。如果未设置,则使用最新的受支持版本。
datastrNone用于 INT8 校准的数据集 YAML;分类任务则需要数据集目录或内置数据集名称。如果使用 quantize=8 时未提供该参数,Ultralytics 会为相应模型任务选择默认校准数据集。
devicestrNone指定导出设备:GPU(device=0)或 CPU(device=cpu)。
optimizeboolFalse启用更高级别的编译器优化,以降低推理延迟,但会延长编译时间。
提示

务必在 x86-64 Linux 主机上运行 DEEPX 导出。dx_com 编译器不支持 ARM64。

有关导出流程的更多详情,请参阅 Ultralytics 导出文档页面。

输出结构#

导出成功后,系统会创建具有以下结构的模型目录:

yolo26n_deepx_model/
├── yolo26n.dxnn     # Compiled DEEPX model binary (NPU executable)
├── config.json      # Calibration and preprocessing configuration
└── metadata.yaml    # Model metadata (classes, image size, task, etc.)

.dxnn 文件是已编译的模型二进制文件,dx_engine 运行时会直接将其加载到 NPU。metadata.yaml 包含 Ultralytics 推理流程使用的类别名称、图像尺寸和其他信息。

部署导出的 YOLO DEEPX 模型#

成功将 Ultralytics YOLO 模型导出为 DEEPX 格式后,下一步是在 DEEPX NPU 硬件上部署这些模型。

运行时安装#

运行推理需要 DEEPX NPU 驱动、libdxrt 运行时和 dx_engine Python 包。

注意

DEEPX 运行时同时支持 x86-64 Linux 和 ARM64(例如 Raspberry Pi 5)。

# Install the NPU driver and libdxrt runtime
sudo apt update
wget https://github.com/DEEPX-AI/dx_rt_npu_linux_driver/raw/main/release/2.4.1/dxrt-driver-dkms_2.4.1-2_all.deb
sudo apt install ./dxrt-driver-dkms_2.4.1-2_all.deb
wget https://github.com/DEEPX-AI/dx_rt/raw/main/release/3.3.2/libdxrt_3.3.2_all.deb
sudo apt install ./libdxrt_3.3.2_all.deb

# Create dx-engine wheel
cd /usr/share/libdxrt/python_package && sudo ./make_whl.sh

# Install the bundled dx_engine Python wheel
pip install dx_engine-*.whl

使用 dxrt-cli --version 检查运行时是否正确安装。你应该会看到类似以下的输出:

DXRT v3.3.2
Minimum Driver Versions
Device Driver: v2.4.0
PCIe Driver: v2.2.0
Firmware: v2.5.2
Minimum Compiler Versions
Compiler: v1.18.1
.dxnn File Format: v6

安装运行时后,请按照上文使用方法部分的说明,在 DEEPX 设备上运行推理和验证——导出的 _deepx_model 可通过 YOLO(...) 直接加载。

使用 dxtron 进行可视化#

dxtron 是 DEEPX 的图可视化工具,可用于检查已编译的 .dxnn 模型。

在 x86-64 Linux 上,从 DEEPX SDK 下载 .deb 软件包,并通过 dpkg 安装 dxtron:

wget https://sdk.deepx.ai/release/dxtron/v2.0.1/dxtron_2.0.1_amd64.deb
sudo dpkg -i dxtron_2.0.1_amd64.deb

然后打开导出的模型:

dxtron yolo26n_deepx_model/yolo26n.dxnn
注意

dxtron 同时适用于 x86-64 和 aarch64 平台。

基准测试#

Ultralytics 团队对 YOLO26 模型进行了基准测试,比较了 PyTorch 和 DEEPX 的速度与精度。

性能
Raspberry Pi 5 DEEPX M1 NPU vs PyTorch benchmarks
模型格式状态大小 (MB)metrics/mAP50-95(B)推理时间(毫秒/图像)
YOLO26nPyTorch✅5.30.4760315.2
YOLO26nDEEPX✅6.60.466034.6
YOLO26n-segPyTorch✅6.50.4080485.4
YOLO26n-segDEEPX✅7.90.392053.8
YOLO26n-posePyTorch✅7.60.4230506.3
YOLO26n-poseDEEPX✅8.80.459037.6
YOLO26n-obbPyTorch✅5.70.8171094.4
YOLO26n-obbDEEPX✅7.30.78356.4
模型格式状态大小 (MB)精度 (top1)精度 (top5)推理时间(毫秒/图像)
YOLO26n-clsPyTorch✅5.60.4310.71623.8
YOLO26n-clsDEEPX✅5.90.3330.6862.7
注意

上述基准测试使用 COCO128 验证目标检测,使用 COCO128-seg 验证分割,使用 COCO8-pose 验证姿势估计,使用 ImageNet100 验证分类,并使用 DOTA128 验证 OBB 模型。推理时间不包括预处理和后处理。

性能优化技巧

若要充分发挥连接到 Raspberry Pi 5 的 DX-M1 NPU 的推理吞吐量,请打开启动配置文件并启用 PCIe Gen 3 支持。

sudo nano /boot/firmware/config.txt

在文件末尾添加以下几行:

dtparam=pciex1
dtparam=pciex1_gen=3

保存并退出(Ctrl+X,然后按 Y,再按 Enter),随后重启:

sudo reboot

检查 PCIe 代际。PCIe Gen3 的预期速度为 8GT/s。

sudo lspci -vvv | grep -iA 33 accelerators | grep -E "LnkCap|LnkSta"

推荐工作流#

  1. 使用 Ultralytics 训练模式训练模型
  2. 使用 model.export(format="deepx") 导出为 DEEPX 格式
  3. 使用 yolo val 验证准确率,确认量化损失极小
  4. 使用 yolo predict 预测,进行定性验证
  5. 使用 dx_engine 运行时将导出的 _deepx_model/ 目录部署到 DEEPX NPU 硬件

实际应用#

部署在 DEEPX NPU 硬件上的 YOLO 模型适用于各种边缘 AI 应用:

  • 智能监控:通过低功耗且无需依赖云端的目标检测,为安防和监控系统提供实时检测能力。
  • 工业自动化:在工厂环境中进行设备端质量控制、缺陷检测和流程监控。
  • 机器人:为自主机器人和无人机提供基于视觉的导航、避障和目标识别。
  • 智慧农业:利用农业计算机视觉监测作物健康状况、检测害虫并估算产量。
  • 零售分析:通过实时边缘推理分析客流、监控货架并跟踪库存。

总结#

在本指南中,你学习了如何将 Ultralytics YOLO 模型导出为 DEEPX 格式,并部署到 DEEPX NPU 硬件上。导出流程使用 INT8 校准和 dx_com 编译器,生成针对硬件优化的 .dxnn 二进制文件;dx_engine 运行时则负责在设备上执行推理。

Ultralytics YOLO 与 DEEPX NPU 技术相结合,可有效地在嵌入式和边缘设备上运行高级计算机视觉工作负载——为实时应用提供高吞吐量和低功耗。

如需了解更多使用详情,请访问 DEEPX 官方网站。

此外,如果你想进一步了解其他 Ultralytics YOLO 集成,请访问我们的集成指南页面。你可以在其中找到许多实用资源和见解。

常见问题#

  • 你可以在 Python 中使用 export() 方法导出模型,也可以通过 CLI 导出。导出时会自动启用 INT8 量化,并使用校准数据集尽量减少精度损失。如果尚未安装,系统会自动安装 dx_com 编译器包。

    示例
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    model.export(format="deepx")
  • DEEPX NPU 专为以最高效率执行 INT8 计算而设计。dx_com 编译器会在导出过程中使用真实数据集图像进行基于 EMA 的校准,对模型进行量化,从而充分发挥 NPU 的性能。DEEPX 导出始终强制使用 INT8——如果你请求其他精度,系统会发出警告并将其覆盖为 INT8。

  • 导出(编译)DEEPX 模型需要 x86-64 Linux 主机。导出步骤不支持 ARM64 (aarch64) 和 Windows 计算机。使用导出的 .dxnn 模型进行推理,则可在任何受 dx_engine 运行时支持的 Linux 平台(x86-64 和 ARM64)上运行。

  • 导出会创建一个目录(例如 yolo26n_deepx_model/),其中包含:

    • yolo26n.dxnn — 已编译的 NPU 二进制文件
    • config.json — 校准和预处理设置
    • metadata.yaml — 模型元数据,包括类别名称和图像尺寸
  • 可以。使用 Ultralytics 训练模式训练并通过 format="deepx" 导出的任何模型,只要使用受支持的层操作,就可以部署到 DEEPX NPU 硬件上。导出支持 Ultralytics 的全部七种任务:目标检测、实例分割、语义分割、深度估计、分类、姿势估计和有向边界框(OBB)。

  • DEEPX 导出流程会将 dx_com 编译器配置为使用校准数据集中的图像执行 100 个 EMA 校准步骤。通常,数百张图像就足以获得良好的量化精度。如果大型数据集导致编译时间过长,可以将 data 指向较小的数据集。

  • DEEPX 运行时不包含在 ultralytics 中,运行推理前必须单独安装。在 x86-64 Linux 和 ARM64 Linux 计算机上(例如 Raspberry Pi 5),从 DEEPX-AI GitHub Releases 安装 NPU 驱动(dxrt-driver-dkms)和运行时(libdxrt),然后安装随附的 dx_engine Python wheel。有关逐步安装命令,请参阅上文的运行时安装部分。

评论