YOLO Vision 2026:

Despliega YOLOv5 con DeepSparse de Neural Magic#

Bienvenido a la IA suministrada por software.

Esta guía explica cómo desplegar YOLOv5 con DeepSparse de Neural Magic.

DeepSparse es un motor de inferencia con un rendimiento excepcional en CPUs. Por ejemplo, en comparación con la línea base de ONNX Runtime, ¡DeepSparse ofrece una aceleración de 5.8x para YOLOv5s ejecutándose en la misma máquina!

YOLOv5 DeepSparse vs ONNX Runtime speed comparison chart

Por primera vez, tus cargas de trabajo de deep learning pueden cumplir con los requisitos de rendimiento de la producción sin la complejidad ni los costes de los aceleradores de hardware. En pocas palabras, DeepSparse te ofrece el rendimiento de las GPU y la simplicidad del software:

  • Despliegues flexibles: Ejecuta de forma consistente en la nube, centros de datos y el borde (edge) con cualquier proveedor de hardware, desde Intel hasta AMD o ARM.
  • Escalabilidad infinita: Escala verticalmente a cientos de núcleos, horizontalmente con Kubernetes estándar o de forma totalmente abstraída con Serverless.
  • Integración sencilla: APIs limpias para integrar tu modelo en una aplicación y monitorizarlo en producción.

¿Cómo logra DeepSparse un rendimiento de clase GPU?#

DeepSparse aprovecha la dispersión (sparsity) del modelo para obtener su aceleración de rendimiento.

La escasez mediante poda y cuantización es una técnica ampliamente estudiada que permite reducciones de órdenes de magnitud en el tamaño y el cálculo necesarios para ejecutar una red, manteniendo al mismo tiempo una gran accuracy. DeepSparse es consciente de la escasez, lo que significa que omite los parámetros en cero, reduciendo la cantidad de cálculo en una pasada hacia adelante. Dado que el cálculo disperso ahora está limitado por la memoria, DeepSparse ejecuta la red en profundidad, dividiendo el problema en columnas de tensores, que son franjas verticales de cálculo que caben en la caché.

DeepSparse tensor columns for sparse neural network inference

¡Las redes dispersas con computación comprimida, ejecutadas capa por capa en la caché, permiten a DeepSparse ofrecer un rendimiento de clase GPU en CPUs!

¿Cómo creo una versión dispersa de YOLOv5 entrenada con mis datos?#

El repositorio de modelos de código abierto de Neural Magic, SparseZoo, contiene puntos de control previamente dispersos de cada modelo YOLOv5. Utilizando SparseML, que está integrado con Ultralytics, puedes ajustar un punto de control disperso en tus datos con un solo comando de CLI.

Consulta la documentación de YOLOv5 de Neural Magic para obtener más detalles.

Uso de DeepSparse#

Haremos un ejemplo de benchmarking y despliegue de una versión dispersa de YOLOv5s con DeepSparse.

Instala DeepSparse#

Ejecuta lo siguiente para instalar DeepSparse. Recomendamos usar un entorno virtual con Python.

pip install "deepsparse[server,yolo,onnxruntime]"

Obtén un archivo ONNX#

DeepSparse acepta un modelo en formato ONNX, pasado de cualquiera de estas formas:

  • Un stub de SparseZoo que identifica un archivo ONNX en SparseZoo
  • Una ruta local a un modelo ONNX en un sistema de archivos

Los ejemplos a continuación usan los puntos de control estándar densos y podados-cuantizados de YOLOv5s, identificados por los siguientes stubs de SparseZoo:

zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none

Despliega un modelo#

DeepSparse ofrece APIs convenientes para integrar tu modelo en una aplicación.

Para probar los siguientes ejemplos de despliegue, descarga una imagen de muestra y guárdala como basilica.jpg con lo siguiente:

wget -O basilica.jpg https://raw.githubusercontent.com/neuralmagic/deepsparse/main/src/deepsparse/yolo/sample_images/basilica.jpg

API de Python#

Pipelines envuelve el preprocesamiento y el postprocesamiento de la salida alrededor del tiempo de ejecución, proporcionando una interfaz limpia para añadir DeepSparse a una aplicación. La integración de DeepSparse con Ultralytics incluye un Pipeline listo para usar que acepta imágenes en bruto y devuelve los cuadros delimitadores.

Crea un Pipeline y ejecuta la inferencia:

from deepsparse import Pipeline

# list of images in local filesystem
images = ["basilica.jpg"]

# create Pipeline
model_stub = "zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none"
yolo_pipeline = Pipeline.create(
    task="yolo",
    model_path=model_stub,
)

# run inference on images, receive bounding boxes + classes
pipeline_outputs = yolo_pipeline(images=images, iou_thres=0.6, conf_thres=0.001)
print(pipeline_outputs)

Si estás ejecutando en la nube, es posible que recibas un error indicando que OpenCV no puede encontrar libGL.so.1. Puedes instalar la biblioteca faltante:

apt-get install libgl1

O usa el paquete headless de Ultralytics que evita por completo las dependencias de GUI:

pip install ultralytics-opencv-headless

Servidor HTTP#

DeepSparse Server se ejecuta sobre el popular marco web FastAPI y el servidor web Uvicorn. Con un solo comando de CLI, puedes configurar fácilmente un punto de conexión de servicio de modelos con DeepSparse. El servidor admite cualquier Pipeline de DeepSparse, incluida la object detection con YOLOv5, lo que te permite enviar imágenes en bruto al punto de conexión y recibir los cuadros delimitadores.

Inicia el servidor con el YOLOv5s podado-cuantizado:

deepsparse.server \
  --task yolo \
  --model_path zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none

Una solicitud de ejemplo, utilizando el paquete requests de Python:

import json
from contextlib import ExitStack

import requests

# list of images for inference (local files on client side)
path = ["basilica.jpg"]

# send request over HTTP to /predict/from_files endpoint
url = "http://0.0.0.0:5543/predict/from_files"
with ExitStack() as stack:
    files = [("request", stack.enter_context(open(img, "rb"))) for img in path]
    resp = requests.post(url=url, files=files)

# response is returned in JSON
annotations = json.loads(resp.text)  # dictionary of annotation results
bounding_boxes = annotations["boxes"]
labels = annotations["labels"]

CLI de anotación#

También puedes usar el comando annotate para que el motor guarde una foto anotada en el disco. ¡Prueba --source 0 para anotar tu transmisión de cámara web en directo!

deepsparse.object_detection.annotate --model_filepath zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none --source basilica.jpg

Al ejecutar el comando anterior se creará una carpeta annotation-results y se guardará la imagen anotada en su interior.

YOLOv5 detection results with bounding boxes

Benchmarking de rendimiento#

Compararemos el rendimiento (throughput) de DeepSparse con el de ONNX Runtime en YOLOv5s, usando el script de benchmarking de DeepSparse.

Las pruebas de rendimiento se ejecutaron en una instancia AWS c6i.8xlarge (16 núcleos).

Comparación de rendimiento del lote 32#

Línea base de ONNX Runtime#

Con un tamaño de lote de 32, ONNX Runtime alcanza 42 imágenes/seg con el YOLOv5s denso estándar:

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none -s sync -b 32 -nstreams 1 -e onnxruntime

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
# Batch Size: 32
# Scenario: sync
# Throughput (items/sec): 41.9025

Rendimiento denso de DeepSparse#

Si bien DeepSparse ofrece su mejor rendimiento con modelos dispersos optimizados, también funciona bien con el YOLOv5s denso estándar.

Con un lote de 32, DeepSparse alcanza 70 imágenes/seg con el YOLOv5s denso estándar, ¡una mejora de rendimiento de 1.7x sobre ORT!

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none -s sync -b 32 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
# Batch Size: 32
# Scenario: sync
# Throughput (items/sec): 69.5546

Rendimiento disperso de DeepSparse#

Cuando se aplica la dispersión al modelo, las ganancias de rendimiento de DeepSparse sobre ONNX Runtime son aún más fuertes.

Con un lote de 32, DeepSparse alcanza 241 imágenes/seg con el YOLOv5s podado-cuantizado, ¡una mejora de rendimiento de 5.8x sobre ORT!

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none -s sync -b 32 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none
# Batch Size: 32
# Scenario: sync
# Throughput (items/sec): 241.2452

Comparación de rendimiento del lote 1#

DeepSparse también puede obtener una aceleración sobre ONNX Runtime para el escenario sensible a la latencia de lote 1.

Línea base de ONNX Runtime#

Con un lote de 1, ONNX Runtime alcanza 48 imágenes/seg con el YOLOv5s denso estándar.

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none -s sync -b 1 -nstreams 1 -e onnxruntime

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/base-none
# Batch Size: 1
# Scenario: sync
# Throughput (items/sec): 48.0921

Rendimiento disperso de DeepSparse#

Con un lote de 1, DeepSparse alcanza 135 elementos/seg con un YOLOv5s podado-cuantizado, ¡una ganancia de rendimiento de 2.8x sobre ONNX Runtime!

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none -s sync -b 1 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned65_quant-none
# Batch Size: 1
# Scenario: sync
# Throughput (items/sec): 134.9468

Dado que las instancias c6i.8xlarge tienen instrucciones VNNI, el rendimiento de DeepSparse se puede impulsar aún más si los pesos se podan en bloques de 4.

Con un lote de 1, DeepSparse alcanza 180 elementos/seg con un YOLOv5s podado-cuantizado en bloques de 4, ¡una ganancia de rendimiento de 3.7x sobre ONNX Runtime!

deepsparse.benchmark zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned35_quant-none-vnni -s sync -b 1 -nstreams 1

# Original Model Path: zoo:cv/detection/yolov5-s/pytorch/ultralytics/coco/pruned35_quant-none-vnni
# Batch Size: 1
# Scenario: sync
# Throughput (items/sec): 179.7375

Empieza con DeepSparse#

¿Investigación o pruebas? DeepSparse Community es gratuito para investigación y pruebas. Comienza con su Documentation.

Para obtener más información sobre el despliegue de YOLOv5 con DeepSparse, consulta la Neural Magic's DeepSparse documentation y la Ultralytics blog post on DeepSparse integration.

Comentarios