Ultralytics YOLO27:
Get Started

Hướng dẫn bắt đầu nhanh: NVIDIA DGX Spark với Ultralytics YOLO26#

Hướng dẫn toàn diện này trình bày chi tiết cách triển khai Ultralytics YOLO26 trên NVIDIA DGX Spark, siêu máy tính AI để bàn nhỏ gọn của NVIDIA. Ngoài ra, hướng dẫn còn giới thiệu các benchmark hiệu năng để minh họa khả năng của YOLO26 trên hệ thống mạnh mẽ này.

NVIDIA DGX Spark AI workstation overview

Lưu ý

Hướng dẫn này đã được kiểm thử trên NVIDIA DGX Spark Founders Edition chạy DGX OS dựa trên Ubuntu. Hướng dẫn dự kiến cũng hoạt động với các bản phát hành DGX OS mới nhất.

NVIDIA DGX Spark là gì?#

NVIDIA DGX Spark là siêu máy tính AI để bàn nhỏ gọn, được trang bị NVIDIA GB10 Grace Blackwell Superchip. Thiết bị cung cấp hiệu năng tính toán AI lên đến 1 petaFLOP với độ chính xác FP4, phù hợp cho nhà phát triển, nhà nghiên cứu và nhà khoa học dữ liệu cần khả năng AI mạnh mẽ trong một thiết bị để bàn.



Xem: Cách đạt đến 1000 FPS với Ultralytics YOLO26 trên NVIDIA DGX Spark | TensorRT và batch inference

Thông số kỹ thuật chính#

Thông số kỹ thuậtChi tiết
Hiệu năng AILên đến 1 PFLOP (FP4)
GPUKiến trúc NVIDIA Blackwell với Tensor Core thế hệ thứ 5 và RT Core thế hệ thứ 4
CPUBộ xử lý Arm 20 lõi (10 Cortex-X925 + 10 Cortex-A725)
Bộ nhớBộ nhớ hệ thống hợp nhất LPDDR5x 128 GB, giao tiếp 256-bit, 4266 MHz, băng thông 273 GB/s
Lưu trữNVMe M.2 1 TB hoặc 4 TB có tính năng tự mã hóa
Mạng1x RJ-45 (10 GbE), Smart NIC ConnectX-7, Wi-Fi 7, Bluetooth 5.4
Kết nối4x USB Type-C, 1x HDMI 2.1a, âm thanh đa kênh HDMI
Xử lý video1x NVENC, 1x NVDEC

DGX OS#

NVIDIA DGX OS là bản phân phối Linux tùy chỉnh, cung cấp nền tảng hệ điều hành ổn định, đã được kiểm thử và hỗ trợ để chạy các ứng dụng AI, machine learning và phân tích trên hệ thống DGX. Bản phân phối này bao gồm:

  • Nền tảng Linux mạnh mẽ được tối ưu hóa cho workload AI
  • Driver và cài đặt hệ thống được cấu hình sẵn cho phần cứng NVIDIA
  • Các bản cập nhật bảo mật và khả năng bảo trì hệ thống
  • Khả năng tương thích với hệ sinh thái phần mềm NVIDIA rộng lớn hơn

DGX OS tuân theo lịch phát hành định kỳ, thường cung cấp bản cập nhật hai lần mỗi năm (khoảng tháng 2 và tháng 8), cùng các bản vá bảo mật bổ sung giữa những lần phát hành chính.

DGX Dashboard#

DGX Spark tích hợp sẵn DGX Dashboard, cung cấp:

  • Giám sát hệ thống theo thời gian thực: Tổng quan về các chỉ số vận hành hiện tại của hệ thống
  • Cập nhật hệ thống: Khả năng áp dụng bản cập nhật trực tiếp từ dashboard
  • Cài đặt hệ thống: Thay đổi tên thiết bị và các cấu hình khác
  • JupyterLab tích hợp: Truy cập Jupyter Notebook cục bộ để phát triển

NVIDIA DGX management dashboard interface

Truy cập Dashboard#

Nhấp vào nút "Show Apps" ở góc dưới bên trái màn hình Ubuntu, sau đó chọn "DGX Dashboard" để mở dashboard trong trình duyệt.

JupyterLab tích hợp

Dashboard bao gồm một phiên bản JupyterLab tích hợp, tự động tạo môi trường ảo và cài đặt các package được đề xuất khi khởi chạy. Mỗi tài khoản người dùng được cấp một cổng riêng để truy cập JupyterLab.

Bắt đầu nhanh với Docker#

Cách nhanh nhất để bắt đầu với Ultralytics YOLO26 trên NVIDIA DGX Spark là chạy bằng các Docker image dựng sẵn. Image NVIDIA ARM64 hỗ trợ DGX Spark chạy DGX OS.

t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $t

Yêu cầu thiết bị CDI ở trên áp dụng cho DGX Spark chạy DGX OS. Đối với workload PyTorch trên Jetson AGX Thor, hãy xem các yêu cầu riêng của host và giới hạn TensorRT trong hướng dẫn NVIDIA Jetson.

Image này sử dụng NVIDIA PyTorch 26.08, CUDA 13.4 và TensorRT 11.2. Hãy cập nhật driver host DGX OS lên phiên bản được NVIDIA PyTorch 26.08 hỗ trợ, đồng thời dựng lại TensorRT engine sau khi thay đổi image hoặc GPU mục tiêu.

Sau khi hoàn tất, chuyển đến phần Sử dụng TensorRT trên NVIDIA DGX Spark.

Bắt đầu với cài đặt gốc#

Để cài đặt native không dùng Docker, hãy làm theo các bước sau.

Cài đặt package Ultralytics#

Ở đây, chúng ta sẽ cài đặt package Ultralytics trên DGX Spark. Các dependency phục vụ export sẽ được cài đặt tự động khi bạn export model lần đầu, vì vậy ở đây chỉ cần package cơ bản. Chúng ta sẽ tập trung chủ yếu vào các bản export NVIDIA TensorRT, vì TensorRT giúp khai thác tối đa hiệu năng của DGX Spark.

  1. Cập nhật danh sách package, cài đặt pip và nâng cấp lên phiên bản mới nhất

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. Cài đặt package pip ultralytics

    pip install ultralytics
  3. Khởi động lại thiết bị

    sudo reboot

Cài đặt PyTorch và Torchvision#

Quá trình cài đặt ultralytics ở trên sẽ cài đặt Torch và Torchvision. Tuy nhiên, các package được cài qua pip này có thể chưa được tối ưu đầy đủ cho kiến trúc ARM64 và CUDA 13 của DGX Spark. Vì vậy, chúng tôi khuyến nghị cài đặt các phiên bản tương thích với CUDA 13:

pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130
Thông tin

Khi chạy PyTorch 2.9.1 trên NVIDIA DGX Spark, bạn có thể gặp UserWarning sau đây khi khởi tạo CUDA (ví dụ: chạy yolo checks, yolo predict, v.v.):

UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)

Bạn có thể bỏ qua cảnh báo này một cách an toàn. Để khắc phục triệt để, bản sửa lỗi đã được gửi trong PyTorch PR #164590 và sẽ được đưa vào bản phát hành PyTorch 2.10.

Cài đặt onnxruntime-gpu#

Các bản phát hành ONNX Runtime GPU hiện tại cung cấp wheel Linux ARM64, bao gồm cả Python 3.12. Image NVIDIA ARM64 Docker cài đặt package chính thức; đối với cài đặt native CUDA 13, hãy dùng:

pip install onnxruntime-gpu

Sử dụng TensorRT trên NVIDIA DGX Spark#

Trong số tất cả các định dạng export model được Ultralytics hỗ trợ, TensorRT mang lại hiệu năng inference cao nhất trên NVIDIA DGX Spark, nên đây là lựa chọn hàng đầu của chúng tôi cho các bản triển khai. Để xem hướng dẫn thiết lập và cách sử dụng nâng cao, hãy tham khảo hướng dẫn tích hợp TensorRT chuyên biệt.

Chuyển đổi model sang TensorRT và chạy inference#

Model YOLO26n ở định dạng PyTorch được chuyển đổi sang TensorRT để chạy inference bằng model đã export.

Ví dụ
from ultralytics import YOLO

# Tải model YOLO26n PyTorch
model = YOLO("yolo26n.pt")

# Export model sang TensorRT
model.export(format="engine")  # # tạo 'yolo26n.engine'

# Tải model TensorRT đã export
trt_model = YOLO("yolo26n.engine")

# Chạy suy luận
results = trt_model("https://ultralytics.com/images/bus.jpg")
Lưu ý

Truy cập trang Export để xem các tham số bổ sung khi export model sang những định dạng model khác nhau

Benchmark YOLO11 trên NVIDIA DGX Spark#

Nhóm Ultralytics đã chạy benchmark YOLO11 trên nhiều định dạng model để đo tốc độ và độ chính xác: PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch. Benchmark được chạy trên NVIDIA DGX Spark ở độ chính xác FP32 với kích thước ảnh đầu vào mặc định là 640.

Bảng so sánh chi tiết#

Bảng dưới đây thể hiện kết quả benchmark của năm model khác nhau (YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x) trên nhiều định dạng, bao gồm trạng thái, kích thước, chỉ số mAP50-95(B) và thời gian inference cho từng tổ hợp.

Hiệu năng
Định dạngTrạng tháiDung lượng trên ổ đĩa (MB)mAP50-95(B)Thời gian suy luận (ms/ảnh)
PyTorch✅5.40.50712.67
TorchScript✅10.50.50832.62
ONNX✅10.20.50745.92
OpenVINO✅10.40.505814.95
TensorRT (FP32)✅12.80.50851.95
TensorRT (FP16)✅7.00.50681.01
TensorRT (INT8)✅18.60.48801.62
TF SavedModel✅25.70.507636.39
TF GraphDef✅10.30.507641.06
TF Lite✅10.30.507564.36
MNN✅10.10.507512.14
NCNN✅10.20.504112.31
ExecuTorch✅10.20.507527.61

Được benchmark bằng Ultralytics 8.3.249

Tái tạo kết quả của chúng tôi#

Để tái tạo các benchmark Ultralytics ở trên trên tất cả định dạng xuất, hãy chạy đoạn mã này:

Ví dụ
from ultralytics import YOLO

# Tải model YOLO26n PyTorch
model = YOLO("yolo26n.pt")

# Benchmark tốc độ và độ chính xác của YOLO26n trên tập dữ liệu COCO128 cho tất cả định dạng xuất
results = model.benchmark(data="coco128.yaml", imgsz=640)

Lưu ý rằng kết quả benchmark có thể thay đổi tùy theo cấu hình phần cứng và phần mềm cụ thể của hệ thống, cũng như khối lượng công việc hiện tại của hệ thống tại thời điểm chạy benchmark. Để có kết quả đáng tin cậy nhất, hãy sử dụng tập dữ liệu có nhiều ảnh, ví dụ: data='coco.yaml' (5000 ảnh val).

Các phương pháp hay nhất cho NVIDIA DGX Spark#

Khi sử dụng NVIDIA DGX Spark, bạn nên tuân theo một số phương pháp hay nhất để đạt hiệu năng tối đa khi chạy YOLO26.

  1. Giám sát hiệu năng hệ thống

    Sử dụng các công cụ giám sát của NVIDIA để theo dõi mức sử dụng GPU và CPU:

    nvidia-smi
  2. Tối ưu hóa mức sử dụng bộ nhớ

    Với bộ nhớ hợp nhất 128 GB, DGX Spark có thể xử lý batch size và model lớn. Hãy cân nhắc tăng batch size để cải thiện thông lượng:

    from ultralytics import YOLO
    
    model = YOLO("yolo26n.engine")
    results = model.predict(source="path/to/images", batch=16)
  3. Sử dụng TensorRT với FP16 hoặc INT8

    Để đạt hiệu năng tốt nhất, hãy export model với độ chính xác FP16 hoặc INT8:

    yolo export model=yolo26n.pt format=engine quantize=16 # FP16
    yolo export model=yolo26n.pt format=engine quantize=8  # INT8

Cập nhật hệ thống (Founders Edition)#

Việc cập nhật DGX Spark Founders Edition là điều thiết yếu để đảm bảo hiệu năng và bảo mật. NVIDIA cung cấp hai phương thức chính để cập nhật hệ điều hành, driver và firmware của hệ thống.

DGX Dashboard là phương thức được khuyến nghị để cập nhật hệ thống, đảm bảo khả năng tương thích. Công cụ này cho phép bạn:

  • Xem các bản cập nhật hệ thống hiện có
  • Cài đặt bản vá bảo mật và bản cập nhật hệ thống
  • Quản lý các bản cập nhật driver và firmware NVIDIA

Cập nhật hệ thống thủ công#

Người dùng nâng cao có thể cập nhật thủ công qua terminal:

sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot
Cảnh báo

Trước khi cập nhật, hãy đảm bảo hệ thống được kết nối với nguồn điện ổn định và bạn đã sao lưu dữ liệu quan trọng.

Các bước tiếp theo#

Để tìm hiểu thêm và nhận hỗ trợ, hãy xem Tài liệu Ultralytics YOLO26.

Câu hỏi thường gặp#

  • Việc triển khai Ultralytics YOLO26 trên NVIDIA DGX Spark rất đơn giản. Bạn có thể dùng Docker image dựng sẵn để thiết lập nhanh hoặc tự cài đặt các package cần thiết. Hướng dẫn chi tiết cho từng phương thức có trong các phần Bắt đầu nhanh với Docker và Bắt đầu với cài đặt native.

  • Các model YOLO26 mang lại hiệu năng vượt trội trên DGX Spark nhờ GB10 Grace Blackwell Superchip. Định dạng TensorRT cho hiệu năng inference tốt nhất. Hãy xem phần Bảng so sánh chi tiết để biết kết quả benchmark YOLO11 trên DGX Spark với các kích thước model và định dạng khác nhau.

  • TensorRT được khuyến nghị mạnh mẽ để triển khai các model YOLO26 trên DGX Spark nhờ hiệu năng tối ưu. TensorRT tăng tốc inference bằng cách tận dụng khả năng của GPU Blackwell, đảm bảo hiệu quả và tốc độ tối đa. Tìm hiểu thêm trong phần Sử dụng TensorRT trên NVIDIA DGX Spark.

  • DGX Spark cung cấp hiệu năng AI lên đến 1 PFLOP và bộ nhớ hợp nhất 128 GB, so với 2070 TFLOPS và bộ nhớ 128 GB của Jetson AGX Thor. DGX Spark được thiết kế như một siêu máy tính AI để bàn, trong khi các thiết bị Jetson là hệ thống nhúng được tối ưu hóa cho triển khai biên.

  • Đối với workload PyTorch, ultralytics/ultralytics:latest-nvidia-arm64 hỗ trợ DGX Spark chạy DGX OS và Thor chạy JetPack 7.1. TensorRT 11.2 đi kèm không hỗ trợ JetPack, vì vậy quy trình TensorRT trên Jetson phải dùng runtime TensorRT 10.x được hỗ trợ cho bản JetPack tương ứng. Xem các yêu cầu về Docker trên Jetson.

Bình luận