YOLO Vision 2026:

使用 Neural Magic 的 DeepSparse 部署 YOLOv5#

欢迎使用软件交付的 AI。

本指南介绍如何使用 Neural Magic 的 DeepSparse 部署 YOLOv5。

DeepSparse 是一款在 CPU 上具有出色性能的推理运行时。例如,与 ONNX Runtime 基线相比,DeepSparse 在 YOLOv5s 上可实现 5.8 倍加速,而且运行在同一台机器上!

YOLOv5 DeepSparse vs ONNX Runtime speed comparison chart

你的深度学习工作负载首次可以在不依赖硬件加速器的复杂性和成本的情况下满足生产环境的性能需求。简单来说,DeepSparse 能为你提供 GPU 级别的性能和软件的简易性:

  • 灵活部署:使用从 Intel 到 AMD 再到 ARM 的任意硬件提供商,在云端、数据中心和边缘设备上保持一致运行
  • 无限扩展:垂直扩展至数百个核心,使用标准 Kubernetes 横向扩展,或通过 Serverless 实现完全抽象化
  • 轻松集成:提供简洁的 API,将模型集成到应用程序中并在生产环境中监控模型

DeepSparse 如何实现 GPU 级别的性能?#

DeepSparse 利用模型稀疏性来提升性能。

通过剪枝和量化实现稀疏化是一种经过广泛研究的技术,可以在保持较高准确率的同时,将执行网络所需的大小和计算量降低一个数量级。DeepSparse 能感知稀疏性,这意味着它会跳过置零的参数,从而减少前向传播中的计算量。由于稀疏计算现在受内存带宽限制,DeepSparse 会按深度执行网络,将问题拆分为 Tensor Columns,即适合放入缓存的垂直计算条带。

DeepSparse tensor columns for sparse neural network inference

经过压缩计算并在缓存中按深度执行的稀疏网络,使 DeepSparse 能够在 CPU 上提供 GPU 级别的性能!

如何创建使用我的数据训练的 YOLOv5 稀疏版本?#

Neural Magic 的开源模型仓库 SparseZoo 包含每个 YOLOv5 模型的预稀疏化检查点。借助与 Ultralytics 集成的 SparseML,你可以使用一条 CLI 命令在自己的数据上微调稀疏检查点。

查看 Neural Magic 的 YOLOv5 文档,了解更多详情

DeepSparse 使用方法#

下面将通过一个示例,演示如何使用 DeepSparse 对 YOLOv5s 的稀疏版本进行基准测试和部署。

安装 DeepSparse#

运行以下命令安装 DeepSparse。我们建议你使用包含 Python 的虚拟环境。

pip install "deepsparse[server,yolo,onnxruntime]"

获取 ONNX 文件#

DeepSparse 接受 ONNX 格式的模型,模型可以通过以下任一方式传入:

  • 用于标识 SparseZoo 中 ONNX 文件的 SparseZoo stub
  • 文件系统中 ONNX 模型的本地路径

下面的示例使用标准的密集型 YOLOv5s 检查点以及剪枝量化的 YOLOv5s 检查点,它们由以下 SparseZoo stub 标识:

zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none

部署模型#

DeepSparse 提供便捷的 API,帮助你将模型集成到应用程序中。

要尝试下面的部署示例,请下载一张示例图像,并使用以下命令将其保存为 basilica.jpg

wget -O basilica.jpg https://raw.githubusercontent.com/neuralmagic/deepsparse/main/src/deepsparse/yolo/sample_images/basilica.jpg

Python API#

Pipelines 在运行时前后分别封装预处理和输出后处理,为将 DeepSparse 添加到应用程序提供简洁的接口。DeepSparse-Ultralytics 集成开箱即用地提供了一个 Pipeline,可接受原始图像并输出边界框。

创建一个 Pipeline 并运行推理:

from deepsparse import Pipeline

# list of images in local filesystem
images = ["basilica.jpg"]

# create Pipeline
model_stub = "zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none"
yolo_pipeline = Pipeline.create(
    task="yolo",
    model_path=model_stub,
)

# run inference on images, receive bounding boxes + classes
pipeline_outputs = yolo_pipeline(images=images, iou_thres=0.6, conf_thres=0.001)
print(pipeline_outputs)

如果你在云端运行,可能会遇到 OpenCV 找不到 libGL.so.1 的错误。你可以安装缺少的库:

apt-get install libgl1

或者使用完全避免 GUI 依赖的无头 Ultralytics 软件包:

pip install ultralytics-opencv-headless

HTTP 服务器#

DeepSparse Server 构建于热门的 FastAPI Web 框架和 Uvicorn Web 服务器之上。只需一条 CLI 命令,你就可以轻松使用 DeepSparse 设置模型服务端点。该 Server 支持 DeepSparse 中的任何 Pipeline,包括使用 YOLOv5 进行目标检测,让你可以向端点发送原始图像并接收边界框。

使用剪枝量化的 YOLOv5s 启动 Server:

deepsparse.server \
  --task yolo \
  --model_path zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none

使用 Python 的 requests 软件包发送请求的示例:

import json
from contextlib import ExitStack

import requests

# list of images for inference (local files on client side)
path = ["basilica.jpg"]

# send request over HTTP to /predict/from_files endpoint
url = "http://0.0.0.0:5543/predict/from_files"
with ExitStack() as stack:
    files = [("request", stack.enter_context(open(img, "rb"))) for img in path]
    resp = requests.post(url=url, files=files)

# response is returned in JSON
annotations = json.loads(resp.text)  # dictionary of annotation results
bounding_boxes = annotations["boxes"]
labels = annotations["labels"]

Annotate CLI#

你还可以使用 annotate 命令,让引擎将带注释的照片保存到磁盘。尝试使用 --source 0 为实时摄像头画面添加注释!

deepsparse.object_detection.annotate --model_filepath zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none --source basilica.jpg

运行上述命令将创建一个 annotation-results 文件夹,并将带注释的图像保存在其中。

YOLOv5 detection results with bounding boxes

性能基准测试#

我们将使用 DeepSparse 的基准测试脚本,在 YOLOv5s 上比较 DeepSparse 与 ONNX Runtime 的吞吐量。

基准测试在 AWS c6i.8xlarge 实例(16 个核心)上运行。

批量大小为 32 时的性能对比#

ONNX Runtime 基线#

批量大小为 32 时,ONNX Runtime 使用标准密集型 YOLOv5s 可达到每秒 42 张图像:

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none -s sync -b 32 -nstreams 1 -e onnxruntime

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
# Batch Size: 32
# Scenario: sync
# Throughput (items/sec): 41.9025

DeepSparse 密集型性能#

虽然 DeepSparse 在优化后的稀疏模型上性能最佳,但它在标准密集型 YOLOv5s 上同样表现良好。

批量大小为 32 时,DeepSparse 使用标准密集型 YOLOv5s 可达到每秒 70 张图像,相比 ORT 性能提升 1.7 倍

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none -s sync -b 32 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
# Batch Size: 32
# Scenario: sync
# Throughput (items/sec): 69.5546

DeepSparse 稀疏型性能#

对模型应用稀疏化后,DeepSparse 相较于 ONNX Runtime 的性能优势更加明显。

批量大小为 32 时,DeepSparse 使用剪枝量化的 YOLOv5s 可达到每秒 241 张图像,相比 ORT 性能提升 5.8 倍

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none -s sync -b 32 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none
# Batch Size: 32
# Scenario: sync
# Throughput (items/sec): 241.2452

批量大小为 1 时的性能对比#

对于对延迟敏感的批量大小为 1 的场景,DeepSparse 同样能够实现相较于 ONNX Runtime 的加速。

ONNX Runtime 基线#

批量大小为 1 时,ONNX Runtime 使用标准密集型 YOLOv5s 可达到每秒 48 张图像。

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none -s sync -b 1 -nstreams 1 -e onnxruntime

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
# Batch Size: 1
# Scenario: sync
# Throughput (items/sec): 48.0921

DeepSparse 稀疏型性能#

批量大小为 1 时,DeepSparse 使用剪枝量化的 YOLOv5s 可达到每秒 135 个项目,性能比 ONNX Runtime 提升 2.8 倍!

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none -s sync -b 1 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none
# Batch Size: 1
# Scenario: sync
# Throughput (items/sec): 134.9468

由于 c6i.8xlarge 实例具有 VNNI 指令,如果将权重按 4 个为一组进行剪枝,DeepSparse 的吞吐量还可以进一步提升。

批量大小为 1 时,DeepSparse 使用 4 块剪枝量化的 YOLOv5s 可达到每秒 180 个项目,相比 ONNX Runtime 性能提升 3.7 倍

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned35_quant-none-vnni -s sync -b 1 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned35_quant-none-vnni
# Batch Size: 1
# Scenario: sync
# Throughput (items/sec): 179.7375

开始使用 DeepSparse#

研究或测试? DeepSparse Community 可免费用于研究和测试。通过其文档开始使用。

如需了解更多关于使用 DeepSparse 部署 YOLOv5 的信息,请查看 Neural Magic 的 DeepSparse 文档Ultralytics 关于 DeepSparse 集成的博客文章

评论