Schnellstartanleitung: NVIDIA DGX Spark mit Ultralytics YOLO26#
Diese umfassende Anleitung führt dich detailliert durch die Bereitstellung von Ultralytics YOLO26 auf NVIDIA DGX Spark, NVIDIA kompakt gebautem Desktop-KI-Supercomputer. Zusätzlich stellt sie Leistungsbenchmarks vor, um die Fähigkeiten von YOLO26 auf diesem leistungsstarken System zu veranschaulichen.
Diese Anleitung wurde mit der NVIDIA DGX Spark Founders Edition getestet, auf der ein auf Ubuntu basierendes DGX OS ausgeführt wird. Es wird erwartet, dass sie mit den neuesten DGX OS-Versionen funktioniert.
Was ist NVIDIA DGX Spark?#
NVIDIA DGX Spark ist ein kompakter Desktop-KI-Supercomputer, der vom NVIDIA GB10 Grace Blackwell Superchip angetrieben wird. Er liefert bis zu 1 PetaFLOP KI-Rechenleistung mit FP4-Genauigkeit und ist damit ideal für Entwickler, Forschende und Datenwissenschaftler, die leistungsstarke KI-Funktionen in einem Desktop-Format benötigen.
Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference
Wichtige technische Daten#
| Technische Daten | Details |
|---|---|
| AI-Leistung | Bis zu 1 PFLOP (FP4) |
| GPU | NVIDIA Blackwell-Architektur mit Tensor Cores der 5. Generation und RT Cores der 4. Generation |
| CPU | Arm-Prozessor mit 20 Kernen (10 Cortex-X925 + 10 Cortex-A725) |
| Speicher | 128 GB gemeinsamer LPDDR5x-Arbeitsspeicher, 256-Bit-Schnittstelle, 4266 MHz, 273 GB/s Bandbreite |
| Speicher | 1 TB oder 4 TB NVMe M.2 mit Selbstverschlüsselung |
| Netzwerk | 1x RJ-45 (10 GbE), ConnectX-7 Smart NIC, Wi-Fi 7, Bluetooth 5.4 |
| Konnektivität | 4x USB Type-C, 1x HDMI 2.1a, mehrkanaliges HDMI-Audio |
| Videoverarbeitung | 1x NVENC, 1x NVDEC |
DGX OS#
NVIDIA DGX OS ist eine angepasste Linux-Distribution, die eine stabile, getestete und unterstützte Betriebssystemgrundlage für die Ausführung von KI-, maschinellen Lern- und Analyseanwendungen auf DGX-Systemen bereitstellt. Sie umfasst:
- Eine robuste, für KI-Workloads optimierte Linux-Grundlage
- Vorkonfigurierte Treiber und Systemeinstellungen für NVIDIA-Hardware
- Sicherheitsupdates und Funktionen zur Systemwartung
- Kompatibilität mit dem umfassenderen NVIDIA-Softwareökosystem
DGX OS folgt einem regelmäßigen Veröffentlichungsplan. Updates werden in der Regel zweimal jährlich (etwa im Februar und August) bereitgestellt, zusätzliche Sicherheitspatches zwischen den Hauptversionen.
DGX Dashboard#
DGX Spark enthält ein integriertes DGX Dashboard, das Folgendes bereitstellt:
- Systemüberwachung in Echtzeit: Übersicht über die aktuellen Betriebsmetriken des Systems
- Systemupdates: Möglichkeit, Updates direkt über das Dashboard anzuwenden
- Systemeinstellungen: Gerätenamen und andere Konfigurationen ändern
- Integriertes JupyterLab: Zugriff auf lokale Jupyter Notebooks für die Entwicklung
Auf das Dashboard zugreifen#
Klicke unten links auf dem Ubuntu-Desktop auf die Schaltfläche „Show Apps“ und wähle anschließend „DGX Dashboard“ aus, um es in deinem Browser zu öffnen.
Das Dashboard enthält eine integrierte JupyterLab-Instanz, die beim Start automatisch eine virtuelle Umgebung erstellt und empfohlene Pakete installiert. Jedem Benutzerkonto wird ein eigener Port für den Zugriff auf JupyterLab zugewiesen.
Schnellstart mit Docker#
Der schnellste Weg, um mit Ultralytics YOLO26 auf NVIDIA DGX Spark zu starten, ist die Verwendung vorgefertigter Docker-Images. Das NVIDIA-ARM64-Image unterstützt DGX Spark mit DGX OS.
t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $tDie obige CDI-Geräteanforderung gilt für DGX Spark mit DGX OS. Für PyTorch-Workloads auf Jetson AGX Thor findest du die separaten Host-Anforderungen und TensorRT-Beschränkungen im NVIDIA Jetson guide.
Dieses Image verwendet NVIDIA PyTorch 26.08, CUDA 13.4 und TensorRT 11. Aktualisiere den DGX-OS-Host-Treiber auf eine von NVIDIA PyTorch 26.08 unterstützte Version und baue TensorRT-Engines nach dem Ändern des Images oder der Ziel-GPU neu auf.
Springe anschließend zum Abschnitt TensorRT auf NVIDIA DGX Spark verwenden.
Mit der nativen Installation beginnen#
Führe für eine native Installation ohne Docker die folgenden Schritte aus.
Ultralytics-Paket installieren#
Hier installieren wir das Ultralytics-Paket auf DGX Spark. Abhängigkeiten für den Export werden beim ersten Export eines Modells automatisch installiert, daher wird hier nur das Basispaket benötigt. Wir konzentrieren uns hauptsächlich auf NVIDIA TensorRT-Exporte, da TensorRT sicherstellt, dass wir die maximale Leistung aus DGX Spark herausholen können.
-
Paketliste aktualisieren, pip installieren und auf die neueste Version aktualisieren
sudo apt update sudo apt install python3-pip -y pip install -U pip -
ultralytics-Paket mit pip installierenpip install ultralytics -
Gerät neu starten
sudo reboot
PyTorch und Torchvision installieren#
Bei der oben beschriebenen Installation von ultralytics werden Torch und Torchvision installiert. Diese über pip installierten Pakete sind jedoch möglicherweise nicht vollständig für die ARM64-Architektur von DGX Spark mit CUDA 13 optimiert. Daher empfehlen wir, die kompatiblen Versionen für CUDA 13 zu installieren:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130Bei der Ausführung von PyTorch 2.9.1 auf NVIDIA DGX Spark kann beim Initialisieren von CUDA der folgende UserWarning auftreten (z. B. bei der Ausführung von yolo checks, yolo predict usw.):
UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)Diese Warnung kann bedenkenlos ignoriert werden. Um sie dauerhaft zu beheben, wurde in PyTorch PR #164590 eine Korrektur eingereicht, die in der PyTorch-Version 2.10 enthalten sein wird.
onnxruntime-gpu installieren#
Aktuelle ONNX Runtime GPU releases bieten Linux-ARM64-Wheels einschließlich Python 3.12. Das NVIDIA-ARM64-Docker-Image installiert das offizielle Paket; verwende für native CUDA-13-Installation:
pip install onnxruntime-gpuTensorRT auf NVIDIA DGX Spark verwenden#
Von allen von Ultralytics unterstützten Modell-Exportformaten bietet TensorRT die höchste Inferenzleistung auf NVIDIA DGX Spark und ist daher unsere wichtigste Empfehlung für Bereitstellungen. Anleitungen zur Einrichtung und zur erweiterten Nutzung findest du in unserem speziellen TensorRT-Integrationsleitfaden.
Modell in TensorRT konvertieren und Inferenz ausführen#
Das YOLO26n-Modell im PyTorch-Format wird in TensorRT konvertiert, um die Inferenz mit dem exportierten Modell auszuführen.
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Export the model to TensorRT
model.export(format="engine") # creates 'yolo26n.engine'
# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")
# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")Auf der Export-Seite findest du weitere Argumente für den Export von Modellen in verschiedene Modellformate.
YOLO11-Benchmarks auf NVIDIA DGX Spark#
Das Ultralytics-Team hat YOLO11-Benchmarks in mehreren Modellformaten durchgeführt und dabei Geschwindigkeit und Genauigkeit gemessen: PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch. Die Benchmarks wurden auf NVIDIA DGX Spark mit FP32-Genauigkeit und einer standardmäßigen Eingabebildgröße von 640 durchgeführt.
Detaillierte Vergleichstabelle#
Die folgende Tabelle zeigt die Benchmark-Ergebnisse für fünf verschiedene Modelle (YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x) über mehrere Formate hinweg und enthält für jede Kombination den Status, die Größe, die Metrik mAP50-95(B) und die Inferenzzeit.
| Format | Status | Größe auf der Festplatte (MB) | mAP50-95(B) | Inferenzzeit (ms/Bild) |
|---|---|---|---|---|
| PyTorch | ✅ | 5.4 | 0.5071 | 2.67 |
| TorchScript | ✅ | 10.5 | 0.5083 | 2.62 |
| ONNX | ✅ | 10.2 | 0.5074 | 5.92 |
| OpenVINO | ✅ | 10.4 | 0.5058 | 14.95 |
| TensorRT (FP32) | ✅ | 12.8 | 0.5085 | 1.95 |
| TensorRT (FP16) | ✅ | 7.0 | 0.5068 | 1.01 |
| TensorRT (INT8) | ✅ | 18.6 | 0.4880 | 1.62 |
| TF SavedModel | ✅ | 25.7 | 0.5076 | 36.39 |
| TF GraphDef | ✅ | 10.3 | 0.5076 | 41.06 |
| TF Lite | ✅ | 10.3 | 0.5075 | 64.36 |
| MNN | ✅ | 10.1 | 0.5075 | 12.14 |
| NCNN | ✅ | 10.2 | 0.5041 | 12.31 |
| ExecuTorch | ✅ | 10.2 | 0.5075 | 27.61 |
Getestet mit Ultralytics 8.3.249
Unsere Ergebnisse reproduzieren#
Um die obigen Ultralytics-Benchmarks für alle Export-Formate zu reproduzieren, führe diesen Code aus:
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)Beachte, dass die Benchmark-Ergebnisse je nach exakter Hardware- und Softwarekonfiguration eines Systems sowie dessen aktueller Auslastung zum Zeitpunkt der Benchmarks variieren können. Für die zuverlässigsten Ergebnisse solltest du einen Datensatz mit einer großen Anzahl von Bildern verwenden, z. B. data='coco.yaml' (5000 Validierungsbilder).
Bewährte Vorgehensweisen für NVIDIA DGX Spark#
Bei der Verwendung von NVIDIA DGX Spark solltest du einige bewährte Vorgehensweisen beachten, um beim Ausführen von YOLO26 maximale Leistung zu erzielen.
-
Systemleistung überwachen
Verwende die Überwachungstools von NVIDIA, um die Auslastung von GPU und CPU zu verfolgen:
nvidia-smi -
Speichernutzung optimieren
Mit 128 GB gemeinsamem Speicher kann DGX Spark große Batchgrößen und Modelle verarbeiten. Ziehe eine Erhöhung der Batchgröße in Betracht, um den Durchsatz zu verbessern:
from ultralytics import YOLO model = YOLO("yolo26n.engine") results = model.predict(source="path/to/images", batch=16) -
TensorRT mit FP16 oder INT8 verwenden
Für die beste Leistung exportierst du Modelle mit FP16- oder INT8-Genauigkeit:
yolo export model=yolo26n.pt format=engine quantize=16 # FP16 yolo export model=yolo26n.pt format=engine quantize=8 # INT8
Systemupdates (Founders Edition)#
Es ist entscheidend für Leistung und Sicherheit, deine DGX Spark Founders Edition auf dem neuesten Stand zu halten. NVIDIA bietet zwei primäre Methoden zur Aktualisierung des Betriebssystems, der Treiber und der Firmware.
DGX Dashboard verwenden (empfohlen)#
Das DGX Dashboard ist die empfohlene Methode für kompatible Systemupdates. Es ermöglicht dir:
- Verfügbare Systemupdates anzeigen
- Sicherheitspatches und Systemupdates installieren
- NVIDIA-Treiber- und Firmwareupdates verwalten
Manuelle Systemupdates#
Fortgeschrittene Benutzer können Updates manuell über das Terminal durchführen:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo rebootStelle vor der Durchführung von Updates sicher, dass dein System an eine stabile Stromquelle angeschlossen ist und du wichtige Daten gesichert hast.
Nächste Schritte#
Weitere Informationen und Support findest du in der Ultralytics YOLO26-Dokumentation.
FAQ#
Die Bereitstellung von Ultralytics YOLO26 auf NVIDIA DGX Spark ist unkompliziert. Du kannst für eine schnelle Einrichtung das vorgefertigte Docker-Image verwenden oder die erforderlichen Pakete manuell installieren. Detaillierte Schritte für beide Ansätze findest du in den Abschnitten Schnellstart mit Docker und Mit der nativen Installation beginnen.
YOLO26-Modelle liefern dank des GB10 Grace Blackwell Superchip eine hervorragende Leistung auf DGX Spark. Das TensorRT-Format bietet die beste Inferenzleistung. Im Abschnitt Detaillierte Vergleichstabelle findest du konkrete Benchmark-Ergebnisse für verschiedene Modellgrößen und Formate.
TensorRT wird für die Bereitstellung von YOLO26-Modellen auf DGX Spark aufgrund seiner optimalen Leistung dringend empfohlen. Es beschleunigt die Inferenz, indem es die GPU-Funktionen von Blackwell nutzt, und gewährleistet so maximale Effizienz und Geschwindigkeit. Weitere Informationen findest du im Abschnitt TensorRT auf NVIDIA DGX Spark verwenden.
DGX Spark bietet bis zu 1 PFLOP KI-Leistung und 128 GB gemeinsamen Speicher, verglichen mit 2070 TFLOPS und 128 GB Speicher beim Jetson AGX Thor. DGX Spark ist als Desktop-KI-Supercomputer konzipiert, während Jetson-Geräte eingebettete Systeme sind, die für Edge-Bereitstellungen optimiert wurden.
Für PyTorch-Workloads unterstützt
ultralytics/ultralytics:latest-nvidia-arm64DGX Spark mit DGX OS sowie Thor mit JetPack 7.1. Das gebündelte TensorRT 11.2 unterstützt JetPack nicht, daher müssen Jetson-TensorRT-Workloads die unterstützte TensorRT-10.x-Laufzeitumgebung für ihre JetPack-Version verwenden. Siehe die Jetson Docker requirements.