YOLO Vision 2026:

Tối ưu hóa suy luận YOLO26 với DeepSparse Engine của Neural Magic#

Khi triển khai các mô hình object detection như Ultralytics YOLO26 trên nhiều phần cứng khác nhau, bạn có thể gặp phải các vấn đề độc đáo như tối ưu hóa. Đây là lúc sự tích hợp của YOLO26 với DeepSparse Engine của Neural Magic phát huy tác dụng. Nó biến đổi cách thức thực thi các mô hình YOLO26 và mang lại hiệu năng cấp độ GPU trực tiếp trên CPU.

Hướng dẫn này chỉ cho bạn cách triển khai YOLO26 sử dụng DeepSparse của Neural Magic, cách chạy suy luận, cũng như cách benchmark hiệu suất để đảm bảo mô hình đã được tối ưu hóa.

EOL của SparseML

Neural Magic đã được Red Hat mua lại vào tháng 1 năm 2025, và đang ngừng hỗ trợ các phiên bản cộng đồng của các thư viện deepsparse, sparseml, sparsezoosparsify. Để biết thêm thông tin, hãy xem thông báo được đăng trong phần Readme trên kho lưu trữ GitHub sparsify.

DeepSparse của Neural Magic#

Neural Magic's DeepSparse Overview

Neural Magic's DeepSparse là một runtime suy luận được thiết kế để tối ưu hóa việc thực thi các mạng nơ-ron trên CPU. Nó áp dụng các kỹ thuật tiên tiến như độ thưa (sparsity), tỉa mạng (pruning) và lượng tử hóa (quantization) để giảm đáng kể nhu cầu tính toán trong khi vẫn duy trì độ chính xác. DeepSparse cung cấp một giải pháp linh hoạt để thực thi mạng nơ-ron hiệu quả và có thể mở rộng trên các thiết bị khác nhau.

Lợi ích của việc tích hợp DeepSparse của Neural Magic với YOLO26#

Trước khi đi sâu vào cách triển khai YOLO26 sử dụng DeepSparse, hãy cùng tìm hiểu các lợi ích khi sử dụng DeepSparse. Một số ưu điểm chính bao gồm:

  • Tốc độ suy luận được cải thiện: Đạt tới 525 FPS (trên YOLO11n), tăng tốc đáng kể khả năng suy luận của YOLO so với các phương pháp truyền thống.

Neural Magic DeepSparse inference acceleration

  • Hiệu quả mô hình được tối ưu hóa: Sử dụng việc tỉa mạng và lượng tử hóa để nâng cao hiệu quả của YOLO26, giảm kích thước mô hình và yêu cầu tính toán trong khi vẫn duy trì accuracy.

Neural Magic model optimization and pruning

  • Hiệu suất cao trên CPU tiêu chuẩn: Mang lại hiệu suất tương đương GPU trên các CPU, cung cấp một tùy chọn dễ tiếp cận và tiết kiệm chi phí cho nhiều ứng dụng.

  • Tích hợp và triển khai hợp lý: Cung cấp các công cụ thân thiện với người dùng để tích hợp YOLO26 vào ứng dụng một cách dễ dàng, bao gồm các tính năng chú thích hình ảnh và video.

  • Hỗ trợ nhiều loại mô hình: Tương thích với cả các mô hình YOLO26 tiêu chuẩn và mô hình đã được tối ưu hóa độ thưa, tăng tính linh hoạt khi triển khai.

  • Giải pháp tiết kiệm chi phí và có khả năng mở rộng: Giảm chi phí vận hành và cung cấp khả năng triển khai linh hoạt cho các mô hình nhận diện đối tượng tiên tiến.

Công nghệ DeepSparse của Neural Magic hoạt động như thế nào?#

Công nghệ DeepSparse của Neural Magic được lấy cảm hứng từ hiệu suất tính toán của não người trong mạng thần kinh. Nó áp dụng hai nguyên tắc chính từ não bộ như sau:

  • Độ thưa (Sparsity): Quá trình làm thưa bao gồm việc tỉa bỏ các thông tin dư thừa từ các mạng deep learning, dẫn đến các mô hình nhỏ hơn và nhanh hơn mà không làm giảm độ chính xác. Kỹ thuật này làm giảm đáng kể kích thước và nhu cầu tính toán của mạng.

  • Tính cục bộ của tham chiếu (Locality of Reference): DeepSparse sử dụng một phương pháp thực thi độc đáo, chia nhỏ mạng thành các Tensor Columns. Các cột này được thực thi theo chiều sâu, nằm gọn trong bộ nhớ đệm (cache) của CPU. Cách tiếp cận này bắt chước hiệu suất của não bộ, giảm thiểu sự di chuyển dữ liệu và tối đa hóa việc sử dụng bộ nhớ đệm của CPU.

How Neural Magic's DeepSparse Technology Works

Tạo một phiên bản Sparse của YOLO26 được huấn luyện trên tập dữ liệu tùy chỉnh#

SparseZoo, một kho lưu trữ mô hình mã nguồn mở bởi Neural Magic, cung cấp một bộ sưu tập các điểm kiểm tra mô hình YOLO26 đã được làm thưa trước. Với SparseML, được tích hợp liền mạch với Ultralytics, người dùng có thể dễ dàng tinh chỉnh các điểm kiểm tra thưa này trên các tập dữ liệu cụ thể của họ bằng một giao diện dòng lệnh đơn giản.

Hãy xem tài liệu SparseML YOLO26 của Neural Magic để biết thêm chi tiết.

Cách sử dụng: Triển khai YOLO26 sử dụng DeepSparse#

Triển khai YOLO26 với DeepSparse của Neural Magic bao gồm một vài bước đơn giản. Trước khi đi sâu vào hướng dẫn sử dụng, hãy nhớ xem qua phạm vi các mô hình YOLO26 được cung cấp bởi Ultralytics. Điều này sẽ giúp bạn chọn mô hình phù hợp nhất cho các yêu cầu dự án của mình. Dưới đây là cách bạn có thể bắt đầu.

Bước 1: Cài đặt#

Để cài đặt các gói cần thiết, hãy chạy:

Cài đặt
# Install the required packages
pip install deepsparse[yolov8]

Bước 2: Xuất YOLO26 sang định dạng ONNX#

DeepSparse Engine yêu cầu các mô hình YOLO26 ở định dạng ONNX. Xuất mô hình của bạn sang định dạng này là điều cần thiết để tương thích với DeepSparse. Sử dụng lệnh sau để xuất các mô hình YOLO26:

Xuất mô hình
# Export YOLO26 model to ONNX format
yolo task=detect mode=export model=yolo26n.pt format=onnx opset=13

Lệnh này sẽ lưu mô hình yolo26n.onnx vào đĩa của bạn.

Bước 3: Triển khai và chạy suy luận#

Với mô hình YOLO26 ở định dạng ONNX, bạn có thể triển khai và chạy suy luận bằng DeepSparse. Điều này có thể được thực hiện dễ dàng bằng Python API trực quan của họ:

Triển khai và chạy suy luận
from deepsparse import Pipeline

# Specify the path to your YOLO26 ONNX model
model_path = "path/to/yolo26n.onnx"

# Set up the DeepSparse Pipeline
yolo_pipeline = Pipeline.create(task="yolov8", model_path=model_path)

# Run the model on your images
images = ["path/to/image.jpg"]
pipeline_outputs = yolo_pipeline(images=images)

Bước 4: Benchmark hiệu suất#

Điều quan trọng là phải kiểm tra xem mô hình YOLO26 của bạn có đang hoạt động tối ưu trên DeepSparse hay không. Bạn có thể đánh giá hiệu năng hiệu suất của mô hình để phân tích thông lượng và độ trễ:

Benchmarking
# Benchmark performance
deepsparse.benchmark model_path="path/to/yolo26n.onnx" --scenario=sync --input_shapes="[1,3,640,640]"

Bước 5: Các tính năng bổ sung#

DeepSparse cung cấp các tính năng bổ sung cho việc tích hợp thực tế YOLO26 vào các ứng dụng, chẳng hạn như chú thích hình ảnh và đánh giá tập dữ liệu.

Các tính năng bổ sung
# For image annotation
deepsparse.yolov8.annotate --source "path/to/image.jpg" --model_filepath "path/to/yolo26n.onnx"

# For evaluating model performance on a dataset
deepsparse.yolov8.eval --model_path "path/to/yolo26n.onnx"

Việc chạy lệnh annotate sẽ xử lý hình ảnh được chỉ định của bạn, nhận diện các đối tượng và lưu hình ảnh đã được chú thích với các khung bao (bounding boxes) và phân loại. Hình ảnh đã chú thích sẽ được lưu trữ trong thư mục annotation-results. Điều này giúp cung cấp một biểu diễn trực quan về khả năng nhận diện của mô hình.

Neural Magic annotation feature interface

Sau khi chạy lệnh đánh giá, bạn sẽ nhận được các chỉ số đầu ra chi tiết như precision, recallmAP (mean Average Precision). Điều này cung cấp cái nhìn toàn diện về hiệu suất của mô hình trên tập dữ liệu và đặc biệt hữu ích để tinh chỉnh và tối ưu hóa các mô hình YOLO26 của bạn cho các trường hợp sử dụng cụ thể, đảm bảo độ chính xác và hiệu quả cao.

Tóm tắt#

Hướng dẫn này đã khám phá việc tích hợp YOLO26 của Ultralytics với DeepSparse Engine của Neural Magic. Nó nhấn mạnh cách tích hợp này nâng cao hiệu suất của YOLO26 trên các nền tảng CPU, mang lại hiệu suất cấp độ GPU và các kỹ thuật độ thưa mạng thần kinh tiên tiến.

Để biết thêm thông tin chi tiết và cách sử dụng nâng cao, hãy truy cập tài liệu DeepSparse của Neural Magic. Bạn cũng có thể khám phá hướng dẫn tích hợp YOLO26xem video hướng dẫn chi tiết trên YouTube.

Ngoài ra, để có cái nhìn rộng hơn về các tích hợp YOLO26 khác nhau, hãy truy cập trang hướng dẫn tích hợp Ultralytics, nơi bạn có thể khám phá hàng loạt khả năng tích hợp thú vị khác.

Câu hỏi thường gặp#

  • DeepSparse Engine của Neural Magic là một runtime suy luận được thiết kế để tối ưu hóa việc thực thi các mạng nơ-ron trên CPU thông qua các kỹ thuật tiên tiến như độ thưa, tỉa mạng và lượng tử hóa. Bằng cách tích hợp DeepSparse với YOLO26, bạn có thể đạt được hiệu năng giống như GPU trên các CPU tiêu chuẩn, nâng cao đáng kể tốc độ suy luận, hiệu quả mô hình và hiệu suất tổng thể trong khi vẫn duy trì độ chính xác. Để biết thêm chi tiết, hãy xem phần DeepSparse của Neural Magic.

  • Việc cài đặt các gói cần thiết để triển khai YOLO26 với DeepSparse của Neural Magic rất đơn giản. Bạn có thể dễ dàng cài đặt chúng bằng CLI. Đây là lệnh bạn cần chạy:

    pip install deepsparse[yolov8]

    Sau khi cài đặt, hãy làm theo các bước được cung cấp trong phần Cài đặt để thiết lập môi trường của bạn và bắt đầu sử dụng DeepSparse với YOLO26.

  • Để chuyển đổi các mô hình YOLO26 sang định dạng ONNX, điều này là bắt buộc để tương thích với DeepSparse, bạn có thể sử dụng lệnh CLI sau:

    yolo task=detect mode=export model=yolo26n.pt format=onnx opset=13

    Lệnh này sẽ xuất mô hình YOLO26 của bạn (yolo26n.pt) sang một định dạng (yolo26n.onnx) có thể được sử dụng bởi DeepSparse Engine. Bạn có thể tìm thêm thông tin về việc xuất mô hình trong phần Xuất mô hình.

  • Việc benchmark hiệu suất YOLO26 trên DeepSparse giúp bạn phân tích thông lượng và độ trễ để đảm bảo mô hình của bạn đã được tối ưu hóa. Bạn có thể sử dụng lệnh CLI sau để chạy benchmark:

    deepsparse.benchmark model_path="path/to/yolo26n.onnx" --scenario=sync --input_shapes="[1,3,640,640]"

    Lệnh này sẽ cung cấp cho bạn các chỉ số hiệu suất quan trọng. Để biết thêm chi tiết, hãy xem phần Đánh giá hiệu năng.

  • Việc tích hợp DeepSparse của Neural Magic với YOLO26 mang lại một số lợi ích:

    • Tốc độ suy luận được nâng cao: Đạt tới 525 FPS (trên YOLO11n), minh chứng cho khả năng tối ưu hóa của DeepSparse.
    • Hiệu suất mô hình được tối ưu: Sử dụng các kỹ thuật độ thưa, cắt tỉa và lượng tử hóa để giảm kích thước mô hình và nhu cầu tính toán trong khi vẫn duy trì độ chính xác.
    • Hiệu suất cao trên CPU tiêu chuẩn: Mang lại hiệu suất tương đương GPU trên phần cứng CPU tiết kiệm chi phí.
    • Tích hợp hợp lý: Các công cụ thân thiện với người dùng giúp triển khai và tích hợp dễ dàng.
    • Tính linh hoạt: Hỗ trợ cả các mô hình YOLO26 tiêu chuẩn và mô hình được tối ưu hóa độ thưa.
    • Tiết kiệm chi phí: Giảm chi phí vận hành thông qua việc sử dụng tài nguyên hiệu quả.

    Để tìm hiểu sâu hơn về những ưu điểm này, hãy truy cập phần Lợi ích của việc tích hợp DeepSparse của Neural Magic với YOLO26.

Bình luận