Hướng dẫn bắt đầu nhanh: NVIDIA DGX Spark với Ultralytics YOLO26#
Hướng dẫn toàn diện này cung cấp quy trình chi tiết để triển khai Ultralytics YOLO26 trên NVIDIA DGX Spark, siêu máy tính AI để bàn nhỏ gọn của NVIDIA. Ngoài ra, hướng dẫn trình bày các benchmark hiệu năng để minh họa khả năng của YOLO26 trên hệ thống mạnh mẽ này.
Hướng dẫn này đã được kiểm thử với NVIDIA DGX Spark Founders Edition chạy DGX OS dựa trên Ubuntu. Dự kiến hướng dẫn cũng hoạt động với các bản phát hành DGX OS mới nhất.
NVIDIA DGX Spark là gì?#
NVIDIA DGX Spark là siêu máy tính AI để bàn nhỏ gọn, được trang bị NVIDIA GB10 Grace Blackwell Superchip. Thiết bị cung cấp hiệu năng điện toán AI lên đến 1 petaFLOP với độ chính xác FP4, rất phù hợp cho developer, nhà nghiên cứu và nhà khoa học dữ liệu cần năng lực AI mạnh mẽ trong một thiết bị để bàn.
Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference
Thông số kỹ thuật chính#
| Thông số kỹ thuật | Chi tiết |
|---|---|
| Hiệu năng AI | Lên đến 1 PFLOP (FP4) |
| GPU | Kiến trúc NVIDIA Blackwell với Tensor Cores thế hệ thứ 5 và RT Cores thế hệ thứ 4 |
| CPU | Bộ xử lý Arm 20 nhân (10 Cortex-X925 + 10 Cortex-A725) |
| Bộ nhớ | Bộ nhớ hệ thống hợp nhất LPDDR5x 128 GB, giao diện 256-bit, 4266 MHz, băng thông 273 GB/s |
| Lưu trữ | NVMe M.2 1 TB hoặc 4 TB với khả năng tự mã hóa |
| Mạng | 1x RJ-45 (10 GbE), ConnectX-7 Smart NIC, Wi-Fi 7, Bluetooth 5.4 |
| Kết nối | 4x USB Type-C, 1x HDMI 2.1a, âm thanh đa kênh HDMI |
| Xử lý video | 1x NVENC, 1x NVDEC |
DGX OS#
NVIDIA DGX OS là một bản phân phối Linux tùy chỉnh, cung cấp nền tảng hệ điều hành ổn định, đã được kiểm thử và hỗ trợ để chạy các ứng dụng AI, machine learning và phân tích trên hệ thống DGX. Nền tảng này bao gồm:
- Nền tảng Linux mạnh mẽ được tối ưu cho workload AI
- Driver và cài đặt hệ thống được cấu hình sẵn cho phần cứng NVIDIA
- Các bản cập nhật bảo mật và khả năng bảo trì hệ thống
- Khả năng tương thích với hệ sinh thái phần mềm NVIDIA rộng hơn
DGX OS tuân theo lịch phát hành định kỳ, với các bản cập nhật thường được cung cấp hai lần mỗi năm (khoảng tháng 2 và tháng 8), cùng các bản vá bảo mật bổ sung giữa những bản phát hành chính.
DGX Dashboard#
DGX Spark đi kèm DGX Dashboard tích hợp, cung cấp:
- Giám sát hệ thống theo thời gian thực: Tổng quan về các chỉ số vận hành hiện tại của hệ thống
- Cập nhật hệ thống: Khả năng áp dụng các bản cập nhật trực tiếp từ dashboard
- Cài đặt hệ thống: Thay đổi tên thiết bị và các cấu hình khác
- JupyterLab tích hợp: Truy cập Jupyter Notebook cục bộ để phát triển
Truy cập Dashboard#
Nhấp vào nút "Show Apps" ở góc dưới bên trái màn hình Ubuntu, sau đó chọn "DGX Dashboard" để mở dashboard trong trình duyệt.
Dashboard bao gồm một phiên bản JupyterLab tích hợp, tự động tạo virtual environment và cài đặt các package được khuyến nghị khi khởi động. Mỗi tài khoản người dùng được cấp một port riêng để truy cập JupyterLab.
Bắt đầu nhanh với Docker#
Cách nhanh nhất để bắt đầu với Ultralytics YOLO26 trên NVIDIA DGX Spark là chạy bằng các hình ảnh docker dựng sẵn. Hình ảnh NVIDIA ARM64 hỗ trợ DGX Spark với DGX OS.
t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $tYêu cầu thiết bị CDI ở trên áp dụng cho DGX Spark chạy DGX OS. Đối với các khối lượng công việc PyTorch trên Jetson AGX Thor, hãy xem các yêu cầu máy chủ riêng biệt và giới hạn TensorRT trong hướng dẫn NVIDIA Jetson.
Hình ảnh này sử dụng NVIDIA PyTorch 26.08, CUDA 13.4 và TensorRT 11. Cập nhật trình điều khiển máy chủ DGX OS lên phiên bản được hỗ trợ bởi NVIDIA PyTorch 26.08, và xây dựng lại các công cụ TensorRT sau khi thay đổi hình ảnh hoặc GPU mục tiêu.
Sau khi hoàn tất, chuyển đến phần Sử dụng TensorRT trên NVIDIA DGX Spark.
Bắt đầu với cài đặt native#
Để cài đặt native không dùng Docker, hãy thực hiện các bước sau.
Cài đặt package Ultralytics#
Tại đây, chúng ta sẽ cài đặt package Ultralytics trên DGX Spark. Các dependency phục vụ export sẽ được tự động cài đặt lần đầu tiên bạn export một model, vì vậy ở đây chỉ cần package cơ sở. Chúng ta sẽ chủ yếu tập trung vào export NVIDIA TensorRT vì TensorRT giúp đảm bảo khai thác hiệu năng tối đa từ DGX Spark.
-
Cập nhật danh sách package, cài đặt pip và nâng cấp lên phiên bản mới nhất
sudo apt update sudo apt install python3-pip -y pip install -U pip -
Cài đặt package pip
ultralyticspip install ultralytics -
Khởi động lại thiết bị
sudo reboot
Cài đặt PyTorch và Torchvision#
Lệnh cài đặt ultralytics ở trên sẽ cài đặt Torch và Torchvision. Tuy nhiên, các package được cài qua pip có thể chưa được tối ưu hoàn toàn cho kiến trúc ARM64 với CUDA 13 của DGX Spark. Do đó, chúng tôi khuyến nghị cài đặt các phiên bản tương thích với CUDA 13:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130Khi chạy PyTorch 2.9.1 trên NVIDIA DGX Spark, bạn có thể gặp UserWarning sau đây khi khởi tạo CUDA (ví dụ: khi chạy yolo checks, yolo predict, v.v.):
UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)Có thể an toàn bỏ qua cảnh báo này. Để xử lý lâu dài, một bản sửa lỗi đã được gửi trong PyTorch PR #164590 và sẽ được đưa vào bản phát hành PyTorch 2.10.
Cài đặt onnxruntime-gpu#
Các phát hành ONNX Runtime GPU hiện tại cung cấp các wheel Linux ARM64, bao gồm Python 3.12. Hình ảnh Docker NVIDIA ARM64 cài đặt gói chính thức; đối với các cài đặt CUDA 13 gốc, hãy sử dụng:
pip install onnxruntime-gpuSử dụng TensorRT trên NVIDIA DGX Spark#
Trong tất cả các định dạng export model được Ultralytics hỗ trợ, TensorRT mang lại hiệu năng inference cao nhất trên NVIDIA DGX Spark, khiến đây trở thành lựa chọn khuyến nghị hàng đầu cho deployment. Để xem hướng dẫn thiết lập và cách sử dụng nâng cao, hãy tham khảo hướng dẫn tích hợp TensorRT chuyên biệt của chúng tôi.
Chuyển đổi Model sang TensorRT và chạy Inference#
Model YOLO26n ở định dạng PyTorch được chuyển đổi sang TensorRT để chạy inference với model đã export.
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Export the model to TensorRT
model.export(format="engine") # creates 'yolo26n.engine'
# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")
# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")Truy cập trang Export để xem các tham số bổ sung khi export model sang những định dạng model khác nhau
Benchmark NVIDIA DGX Spark YOLO11#
Đội ngũ Ultralytics đã chạy benchmark YOLO11 trên nhiều định dạng model, đo tốc độ và độ chính xác: PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch. Benchmark được chạy trên NVIDIA DGX Spark ở độ chính xác FP32 với kích thước ảnh đầu vào mặc định là 640.
Bảng so sánh chi tiết#
Bảng dưới đây thể hiện kết quả benchmark của năm model khác nhau (YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x) trên nhiều định dạng, cung cấp trạng thái, kích thước, chỉ số mAP50-95(B) và thời gian inference cho từng tổ hợp.
| Định dạng | Trạng thái | Kích thước trên ổ đĩa (MB) | mAP50-95(B) | Thời gian suy luận (ms/im) |
|---|---|---|---|---|
| PyTorch | ✅ | 5.4 | 0.5071 | 2.67 |
| TorchScript | ✅ | 10.5 | 0.5083 | 2.62 |
| ONNX | ✅ | 10.2 | 0.5074 | 5.92 |
| OpenVINO | ✅ | 10.4 | 0.5058 | 14.95 |
| TensorRT (FP32) | ✅ | 12.8 | 0.5085 | 1.95 |
| TensorRT (FP16) | ✅ | 7.0 | 0.5068 | 1.01 |
| TensorRT (INT8) | ✅ | 18.6 | 0.4880 | 1.62 |
| TF SavedModel | ✅ | 25.7 | 0.5076 | 36.39 |
| TF GraphDef | ✅ | 10.3 | 0.5076 | 41.06 |
| TF Lite | ✅ | 10.3 | 0.5075 | 64.36 |
| MNN | ✅ | 10.1 | 0.5075 | 12.14 |
| NCNN | ✅ | 10.2 | 0.5041 | 12.31 |
| ExecuTorch | ✅ | 10.2 | 0.5075 | 27.61 |
Được benchmark bằng Ultralytics 8.3.249
Tái tạo kết quả của chúng tôi#
Để tái tạo các benchmark Ultralytics ở trên trên tất cả định dạng export, hãy chạy đoạn code này:
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)Lưu ý rằng kết quả benchmark có thể thay đổi tùy theo cấu hình phần cứng và phần mềm cụ thể của hệ thống, cũng như workload hiện tại của hệ thống tại thời điểm chạy benchmark. Để có kết quả đáng tin cậy nhất, hãy sử dụng dataset có số lượng ảnh lớn, chẳng hạn như data='coco.yaml' (5000 ảnh val).
Best Practice cho NVIDIA DGX Spark#
Khi sử dụng NVIDIA DGX Spark, cần tuân thủ một số best practice để đạt hiệu năng tối đa khi chạy YOLO26.
-
Giám sát hiệu năng hệ thống
Sử dụng các công cụ giám sát của NVIDIA để theo dõi mức sử dụng GPU và CPU:
nvidia-smi -
Tối ưu mức sử dụng bộ nhớ
Với 128GB bộ nhớ hợp nhất, DGX Spark có thể xử lý batch size và model lớn. Hãy cân nhắc tăng batch size để cải thiện throughput:
from ultralytics import YOLO model = YOLO("yolo26n.engine") results = model.predict(source="path/to/images", batch=16) -
Sử dụng TensorRT với FP16 hoặc INT8
Để đạt hiệu năng tốt nhất, hãy export model với độ chính xác FP16 hoặc INT8:
yolo export model=yolo26n.pt format=engine quantize=16 # FP16 yolo export model=yolo26n.pt format=engine quantize=8 # INT8
Cập nhật hệ thống (Founders Edition)#
Việc duy trì DGX Spark Founders Edition luôn được cập nhật là yếu tố quan trọng đối với hiệu năng và bảo mật. NVIDIA cung cấp hai phương pháp chính để cập nhật hệ điều hành, driver và firmware của hệ thống.
Sử dụng DGX Dashboard (Khuyến nghị)#
DGX Dashboard là phương thức được khuyến nghị để thực hiện cập nhật hệ thống nhằm đảm bảo khả năng tương thích. Công cụ này cho phép bạn:
- Xem các bản cập nhật hệ thống khả dụng
- Cài đặt bản vá bảo mật và bản cập nhật hệ thống
- Quản lý các bản cập nhật driver và firmware của NVIDIA
Cập nhật hệ thống thủ công#
Đối với người dùng nâng cao, có thể thực hiện cập nhật thủ công qua terminal:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo rebootĐảm bảo hệ thống được kết nối với nguồn điện ổn định và bạn đã sao lưu dữ liệu quan trọng trước khi thực hiện cập nhật.
Các bước tiếp theo#
Để tìm hiểu thêm và nhận hỗ trợ, hãy xem Tài liệu Ultralytics YOLO26.
FAQ#
Việc triển khai Ultralytics YOLO26 trên NVIDIA DGX Spark rất đơn giản. Bạn có thể sử dụng Docker image dựng sẵn để thiết lập nhanh hoặc cài đặt thủ công các package cần thiết. Các bước chi tiết cho từng phương pháp có trong các phần Bắt đầu nhanh với Docker và Bắt đầu với cài đặt native.
Các model YOLO26 mang lại hiệu năng xuất sắc trên DGX Spark nhờ GB10 Grace Blackwell Superchip. Định dạng TensorRT cung cấp hiệu năng inference tốt nhất. Hãy xem phần Bảng so sánh chi tiết để biết kết quả benchmark cụ thể trên các kích thước và định dạng model khác nhau.
TensorRT được khuyến nghị mạnh mẽ để triển khai các model YOLO26 trên DGX Spark nhờ hiệu năng tối ưu. TensorRT tăng tốc inference bằng cách tận dụng khả năng của GPU Blackwell, đảm bảo hiệu quả và tốc độ tối đa. Tìm hiểu thêm trong phần Sử dụng TensorRT trên NVIDIA DGX Spark.
DGX Spark cung cấp hiệu năng AI lên đến 1 PFLOP và bộ nhớ hợp nhất 128GB, trong khi Jetson AGX Thor cung cấp 2070 TFLOPS và bộ nhớ 128GB. DGX Spark được thiết kế như một siêu máy tính AI để bàn, còn các thiết bị Jetson là những hệ thống nhúng được tối ưu cho deployment tại edge.
Đối với các khối lượng công việc PyTorch,
ultralytics/ultralytics:latest-nvidia-arm64hỗ trợ DGX Spark với DGX OS và Thor với JetPack 7.1. TensorRT 11.2 được gói kèm không hỗ trợ JetPack, vì vậy các quy trình làm việc TensorRT trên Jetson phải sử dụng thời gian chạy TensorRT 10.x được hỗ trợ cho bản phát hành JetPack của họ. Xem yêu cầu Docker trên Jetson.