クイックスタートガイド:NVIDIA DGX SparkでUltralytics YOLO26を使用する#
この包括的なガイドでは、NVIDIAの小型デスクトップAIスーパーコンピューターであるNVIDIA DGX SparkにUltralytics YOLO26をデプロイする手順を詳しく説明します。また、YOLO26がこの高性能システムで発揮する能力を示す性能ベンチマークも紹介します。
このガイドは、UbuntuベースのDGX OSを実行するNVIDIA DGX Spark Founders Editionでテストされています。最新のDGX OSリリースでも動作する見込みです。
NVIDIA DGX Sparkとは何ですか?#
NVIDIA DGX Sparkは、NVIDIA GB10 Grace Blackwell Superchipを搭載した小型のデスクトップAIスーパーコンピューターです。FP4精度で最大1ペタFLOPのAI計算性能を提供し、デスクトップサイズの環境で高いAI性能を必要とする開発者、研究者、データサイエンティストに最適です。
主な仕様#
| 仕様 | 詳細 |
|---|---|
| AI性能 | 最大1 PFLOP(FP4) |
| GPU | 第5世代Tensor Coreと第4世代RT Coreを備えたNVIDIA Blackwellアーキテクチャ |
| CPU | 20コアArmプロセッサー(Cortex-X925×10 + Cortex-A725×10) |
| メモリ | 128 GB LPDDR5xユニファイドシステムメモリ、256-bitインターフェース、4266 MHz、273 GB/sの帯域幅 |
| ストレージ | 自己暗号化機能を備えた1 TBまたは4 TBのNVMe M.2 |
| ネットワーク | RJ-45(10 GbE)×1、ConnectX-7 Smart NIC、Wi-Fi 7、Bluetooth 5.4 |
| 接続性 | USB Type-C×4、HDMI 2.1a×1、HDMIマルチチャンネルオーディオ |
| ビデオ処理 | NVENC×1、NVDEC×1 |
DGX OS#
NVIDIA DGX OSは、DGXシステムでAI、機械学習、分析アプリケーションを実行するための、安定性と検証済みのサポートを備えたOS基盤を提供する、カスタマイズされたLinuxディストリビューションです。次の機能が含まれています:
- AIワークロード向けに最適化された堅牢なLinux基盤
- NVIDIAハードウェア向けに事前設定されたドライバーとシステム設定
- セキュリティアップデートとシステムメンテナンス機能
- NVIDIAの幅広いソフトウェアエコシステムとの互換性
DGX OSは定期的なリリーススケジュールに従っており、通常は年2回(2月頃と8月頃)アップデートが提供されます。また、メジャーリリースの間にも追加のセキュリティパッチが提供されます。
DGX Dashboard#
DGX Sparkには、次の機能を提供するDGX Dashboardが組み込まれています:
- リアルタイムのシステム監視: システムの現在の稼働状況を示すメトリクスの概要
- システムアップデート: ダッシュボードから直接アップデートを適用できます
- システム設定: デバイス名やその他の設定を変更できます
- JupyterLabの統合: 開発用のローカルJupyter Notebookにアクセスできます
ダッシュボードへのアクセス#
Ubuntuデスクトップの左下にある「Show Apps」ボタンをクリックし、「DGX Dashboard」を選択すると、ブラウザーで開きます。
ダッシュボードにはJupyterLabが統合されており、起動時に仮想環境を自動的に作成し、推奨パッケージをインストールします。各ユーザーアカウントには、JupyterLabへのアクセス専用ポートが割り当てられます。
Dockerでクイックスタート#
NVIDIA DGX SparkでUltralytics YOLO26を使い始める最も速い方法は、事前構築済みのDockerイメージを実行することです。NVIDIA ARM64イメージは、DGX OSを搭載したDGX Sparkに対応しています。
t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $t上記のCDIデバイスリクエストは、DGX OSを実行するDGX Sparkに適用されます。Jetson AGX ThorでPyTorchワークロードを実行する場合は、ホスト要件とTensorRTの制限について、NVIDIA Jetsonガイドを参照してください。
このイメージでは、NVIDIA PyTorch 26.08、CUDA 13.4、TensorRT 11.2を使用します。DGX OSホストドライバーをNVIDIA PyTorch 26.08がサポートするバージョンに更新し、イメージまたは対象GPUを変更した後はTensorRTエンジンを再構築してください。
これが完了したら、NVIDIA DGX SparkでTensorRTを使用するセクションに進んでください。
ネイティブインストールを開始する#
Dockerを使わずにネイティブインストールする場合は、次の手順に従ってください。
Ultralyticsパッケージをインストールする#
ここでは、DGX SparkにUltralyticsパッケージをインストールします。エクスポートに必要な依存関係は、モデルを初めてエクスポートするときに自動でインストールされるため、ここでは基本パッケージのみが必要です。DGX Sparkの性能を最大限に引き出せるTensorRTを中心に、NVIDIA TensorRTエクスポートについて説明します。
-
パッケージリストを更新し、pipをインストールして最新バージョンにアップグレードする
sudo apt update sudo apt install python3-pip -y pip install -U pip -
ultralyticspipパッケージをインストールするpip install ultralytics -
デバイスを再起動する
sudo reboot
PyTorchとTorchvisionをインストールする#
上記のUltralyticsのインストールでは、TorchとTorchvisionがインストールされます。ただし、pipでインストールされるこれらのパッケージは、CUDA 13を搭載したDGX SparkのARM64アーキテクチャ向けに十分最適化されていない場合があります。そのため、CUDA 13対応バージョンのインストールを推奨します:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130NVIDIA DGX SparkでPyTorch 2.9.1を実行すると、CUDAの初期化時(たとえば、yolo checksやyolo predictなどの実行時)に、次のUserWarningが発生する場合があります:
UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)この警告は無視しても問題ありません。この問題を恒久的に解決する修正は、PyTorch PR #164590として提出されており、PyTorch 2.10リリースに含まれる予定です。
onnxruntime-gpuをインストールする#
現在のONNX Runtime GPUリリースでは、Python 3.12を含むLinux ARM64用wheelが提供されています。NVIDIA ARM64 Dockerイメージでは公式パッケージがインストールされます。ネイティブ環境にCUDA 13をインストールする場合は、次を使用してください:
pip install onnxruntime-gpuNVIDIA DGX SparkでTensorRTを使用する#
Ultralyticsがサポートするすべてのモデルエクスポート形式の中で、TensorRTはNVIDIA DGX Spark上で最も高い推論性能を発揮するため、デプロイには最もおすすめの形式です。セットアップ手順と高度な使い方については、TensorRT専用の統合ガイドを参照してください。
モデルをTensorRTに変換して推論を実行する#
PyTorch形式のYOLO26nモデルをTensorRTに変換し、エクスポートしたモデルで推論を実行します。
from ultralytics import YOLO
# YOLO26n PyTorchモデルを読み込む
model = YOLO("yolo26n.pt")
# モデルをTensorRTにエクスポートする
model.export(format="engine") # 'yolo26n.engine'を作成します
# エクスポートしたTensorRTモデルを読み込む
trt_model = YOLO("yolo26n.engine")
# 推論を実行
results = trt_model("https://ultralytics.com/images/bus.jpg")さまざまなモデル形式にエクスポートする際に使用できる追加引数については、エクスポートページをご覧ください。
NVIDIA DGX SparkでのYOLO11ベンチマーク#
Ultralyticsチームは、PyTorch、TorchScript、ONNX、OpenVINO、TensorRT、TF SavedModel、TF GraphDef、TF Lite、MNN、NCNN、ExecuTorchの各モデル形式について、速度と精度を測定するYOLO11ベンチマークを実施しました。ベンチマークはNVIDIA DGX Spark上でFP32精度、デフォルトの入力画像サイズ640で実施しました。
詳細比較表#
以下の表は、5種類のモデル(YOLO11n、YOLO11s、YOLO11m、YOLO11l、YOLO11x)について複数の形式でベンチマークした結果を示しており、各組み合わせのステータス、サイズ、mAP50-95(B)メトリクス、推論時間を掲載しています。
| 形式 | ステータス | ディスク上のサイズ(MB) | mAP50-95(B) | 推論時間(ms/im) |
|---|---|---|---|---|
| PyTorch | ✅ | 5.4 | 0.5071 | 2.67 |
| TorchScript | ✅ | 10.5 | 0.5083 | 2.62 |
| ONNX | ✅ | 10.2 | 0.5074 | 5.92 |
| OpenVINO | ✅ | 10.4 | 0.5058 | 14.95 |
| TensorRT(FP32) | ✅ | 12.8 | 0.5085 | 1.95 |
| TensorRT(FP16) | ✅ | 7.0 | 0.5068 | 1.01 |
| TensorRT(INT8) | ✅ | 18.6 | 0.4880 | 1.62 |
| TF SavedModel | ✅ | 25.7 | 0.5076 | 36.39 |
| TF GraphDef | ✅ | 10.3 | 0.5076 | 41.06 |
| TF Lite | ✅ | 10.3 | 0.5075 | 64.36 |
| MNN | ✅ | 10.1 | 0.5075 | 12.14 |
| NCNN | ✅ | 10.2 | 0.5041 | 12.31 |
| ExecuTorch | ✅ | 10.2 | 0.5075 | 27.61 |
Ultralytics 8.3.249でベンチマークを実施
結果を再現する#
すべてのエクスポート形式で上記のUltralyticsベンチマークを再現するには、次のコードを実行してください。
from ultralytics import YOLO
# YOLO26n PyTorchモデルを読み込む
model = YOLO("yolo26n.pt")
# すべてのエクスポート形式でCOCO128データセットを使用してYOLO26nの速度と精度をベンチマークします
results = model.benchmark(data="coco128.yaml", imgsz=640)ベンチマーク結果は、システムのハードウェアとソフトウェアの構成や、ベンチマーク実行時のシステムの負荷によって異なる場合があります。最も信頼性の高い結果を得るには、data='coco.yaml'(検証画像5000枚)のような、画像数の多いデータセットを使用してください。
NVIDIA DGX Sparkのベストプラクティス#
NVIDIA DGX SparkでYOLO26を実行して最高の性能を引き出すには、いくつかのベストプラクティスに従う必要があります。
-
システム性能を監視する
NVIDIAの監視ツールを使って、GPUとCPUの使用率を追跡します:
nvidia-smi -
メモリ使用量を最適化する
128GBのユニファイドメモリを搭載するDGX Sparkでは、大きなバッチサイズやモデルを扱えます。スループットの向上を目指して、バッチサイズの拡大を検討してください:
from ultralytics import YOLO model = YOLO("yolo26n.engine") results = model.predict(source="path/to/images", batch=16) -
TensorRTをFP16またはINT8で使用する
最高の性能を得るには、FP16またはINT8精度でモデルをエクスポートします:
yolo export model=yolo26n.pt format=engine quantize=16 # FP16 yolo export model=yolo26n.pt format=engine quantize=8 # INT8
システムアップデート(Founders Edition)#
DGX Spark Founders Editionを最新の状態に保つことは、性能とセキュリティのために重要です。NVIDIAは、システムOS、ドライバー、ファームウェアをアップデートする主な方法を2つ提供しています。
DGX Dashboardを使用する(推奨)#
互換性を確保してシステムをアップデートするには、DGX Dashboardの使用が推奨されます。次の操作ができます:
- 利用可能なシステムアップデートの確認
- セキュリティパッチとシステムアップデートのインストール
- NVIDIAドライバーとファームウェアのアップデート管理
システムを手動でアップデートする#
上級ユーザーは、ターミナルから手動でアップデートできます:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo rebootアップデートを実施する前に、システムが安定した電源に接続されていることを確認し、重要なデータをバックアップしてください。
次のステップ#
詳しい情報やサポートについては、Ultralytics YOLO26ドキュメントをご覧ください。
よくある質問#
NVIDIA DGX SparkへのUltralytics YOLO26のデプロイは簡単です。すばやくセットアップするには事前構築済みのDockerイメージを使用するか、必要なパッケージを手動でインストールできます。それぞれの方法の詳しい手順については、Dockerでクイックスタートとネイティブインストールで開始の各セクションを参照してください。
GB10 Grace Blackwell Superchipを搭載したDGX Sparkでは、YOLO26モデルが優れた性能を発揮します。TensorRT形式が最も優れた推論性能を提供します。DGX SparkでのYOLO11のベンチマーク結果をモデルサイズや形式ごとに確認するには、詳細比較表のセクションを参照してください。
DGX SparkでYOLO26モデルをデプロイする場合、最適な性能が得られるTensorRTを強くおすすめします。Blackwell GPUの機能を活用して推論を高速化し、効率と速度を最大限に高めます。詳しくは、NVIDIA DGX SparkでTensorRTを使用するセクションを参照してください。
DGX Sparkは最大1 PFLOPのAI性能と128GBのユニファイドメモリを備えています。一方、Jetson AGX Thorは2070 TFLOPSと128GBのメモリを備えています。DGX SparkはデスクトップAIスーパーコンピューターとして設計されているのに対し、Jetsonデバイスはエッジデプロイ向けに最適化された組み込みシステムです。
PyTorchワークロードの場合、
ultralytics/ultralytics:latest-nvidia-arm64はDGX OS搭載のDGX SparkとJetPack 7.1搭載のThorに対応しています。バンドルされているTensorRT 11.2はJetPackに対応していないため、JetsonでTensorRTを使用するワークフローでは、各JetPackリリースがサポートするTensorRT 10.xランタイムを使用する必要があります。JetsonのDocker要件を参照してください。