Schnellstartanleitung: NVIDIA DGX Spark mit Ultralytics YOLO26#
Dieser umfassende Leitfaden bietet eine detaillierte Anleitung zur Bereitstellung von Ultralytics YOLO26 auf NVIDIA DGX Spark, dem kompakten Desktop-KI-Supercomputer von NVIDIA. Darüber hinaus zeigt er Leistungs-Benchmarks, um die Fähigkeiten von YOLO26 auf diesem leistungsstarken System zu demonstrieren.
Dieser Leitfaden wurde mit der NVIDIA DGX Spark Founders Edition unter Verwendung von DGX OS auf Ubuntu-Basis getestet. Es wird erwartet, dass er mit den neuesten DGX OS-Versionen funktioniert.
Was ist NVIDIA DGX Spark?#
NVIDIA DGX Spark ist ein kompakter Desktop-KI-Supercomputer, der vom NVIDIA GB10 Grace Blackwell Superchip angetrieben wird. Er liefert bis zu 1 PetaFLOP KI-Rechenleistung bei FP4-Präzision und ist damit ideal für Entwickler, Forscher und Datenwissenschaftler, die leistungsstarke KI-Funktionen im Desktop-Format benötigen.
Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference
Wichtige Spezifikationen#
| Spezifikation | Details |
|---|---|
| KI-Leistung | Bis zu 1 PFLOP (FP4) |
| GPU | NVIDIA Blackwell-Architektur mit Tensor Cores der 5. Generation, RT Cores der 4. Generation |
| CPU | 20-Kern Arm-Prozessor (10 Cortex-X925 + 10 Cortex-A725) |
| Speicher | 128 GB LPDDR5x vereinheitlichter Systemspeicher, 256-Bit-Schnittstelle, 4266 MHz, 273 GB/s Bandbreite |
| Speicherkapazität | 1 TB oder 4 TB NVMe M.2 mit Selbstverschlüsselung |
| Netzwerk | 1x RJ-45 (10 GbE), ConnectX-7 Smart NIC, Wi-Fi 7, Bluetooth 5.4 |
| Konnektivität | 4x USB Type-C, 1x HDMI 2.1a, HDMI-Mehrkanal-Audio |
| Videoverarbeitung | 1x NVENC, 1x NVDEC |
DGX OS#
NVIDIA DGX OS ist eine angepasste Linux-Distribution, die eine stabile, getestete und unterstützte Betriebssystemgrundlage für die Ausführung von KI-, Maschinenlern- und Analyseanwendungen auf DGX-Systemen bietet. Sie umfasst:
- Eine robuste Linux-Grundlage, optimiert für KI-Workloads
- Vorkonfigurierte Treiber und Systemeinstellungen für NVIDIA-Hardware
- Sicherheitsupdates und Funktionen für die Systemwartung
- Kompatibilität mit dem breiteren NVIDIA-Software-Ökosystem
DGX OS folgt einem regelmäßigen Veröffentlichungszyklus, wobei Updates typischerweise zweimal pro Jahr (etwa Februar und August) bereitgestellt werden, ergänzt durch zusätzliche Sicherheits-Patches zwischen den Hauptversionen.
DGX Dashboard#
DGX Spark verfügt über ein integriertes DGX Dashboard, das Folgendes bietet:
- Echtzeit-Systemüberwachung: Überblick über die aktuellen Betriebskennzahlen des Systems
- Systemupdates: Möglichkeit, Updates direkt über das Dashboard anzuwenden
- Systemeinstellungen: Ändern des Gerätenamens und anderer Konfigurationen
- Integriertes JupyterLab: Zugriff auf lokale Jupyter Notebooks für die Entwicklung
Zugriff auf das Dashboard#
Klicke auf die Schaltfläche "Anwendungen anzeigen" in der unteren linken Ecke des Ubuntu-Desktops und wähle dann "DGX Dashboard", um es in deinem Browser zu öffnen.
Das Dashboard enthält eine integrierte JupyterLab-Instanz, die beim Start automatisch eine virtuelle Umgebung erstellt und empfohlene Pakete installiert. Jedem Benutzerkonto wird ein dedizierter Port für den JupyterLab-Zugriff zugewiesen.
Schnellstart mit Docker#
Der schnellste Weg, mit Ultralytics YOLO26 auf NVIDIA DGX Spark zu starten, ist die Verwendung von vorgefertigten Docker-Images. Dasselbe Docker-Image, das Jetson AGX Thor (JetPack 7.0) unterstützt, funktioniert auch auf DGX Spark mit DGX OS.
t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $tDie obige CDI-Geräteanforderung gilt für DGX Spark unter DGX OS. Auf Jetson AGX Thor startest du stattdessen dasselbe Image mit --runtime=nvidia, wie im NVIDIA Jetson-Leitfaden gezeigt.
Überspringe danach den Abschnitt TensorRT auf NVIDIA DGX Spark verwenden.
Start mit nativer Installation#
Für eine native Installation ohne Docker befolge diese Schritte.
Ultralytics-Paket installieren#
Hier installieren wir das Ultralytics-Paket auf DGX Spark mit optionalen Abhängigkeiten, damit wir die PyTorch-Modelle in andere verschiedene Formate exportieren können. Wir konzentrieren uns hauptsächlich auf NVIDIA TensorRT-Exporte, da TensorRT sicherstellt, dass wir die maximale Leistung aus dem DGX Spark herausholen können.
-
Paketliste aktualisieren, pip installieren und auf die neueste Version aktualisieren
sudo apt update sudo apt install python3-pip -y pip install -U pip -
Installiere das
ultralytics-pip-Paket mit optionalen Abhängigkeitenpip install ultralytics[export] -
Gerät neu starten
sudo reboot
PyTorch und Torchvision installieren#
Die oben genannte Ultralytics-Installation installiert Torch und Torchvision. Diese via pip installierten Pakete sind jedoch möglicherweise nicht vollständig für die ARM64-Architektur des DGX Spark mit CUDA 13 optimiert. Daher empfehlen wir die Installation der CUDA 13-kompatiblen Versionen:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130Beim Ausführen von PyTorch 2.9.1 auf NVIDIA DGX Spark stößt du möglicherweise beim Initialisieren von CUDA auf folgende UserWarning (z. B. beim Ausführen von yolo checks, yolo predict usw.):
UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)Diese Warnung kann bedenkenlos ignoriert werden. Um dies dauerhaft zu beheben, wurde in PyTorch PR #164590 ein Fix eingereicht, der im PyTorch 2.10-Release enthalten sein wird.
Installiere onnxruntime-gpu#
Das auf PyPI gehostete Paket onnxruntime-gpu verfügt über keine aarch64-Binärdateien für ARM64-Systeme. Daher müssen wir dieses Paket manuell installieren. Dieses Paket wird für einige der Exporte benötigt.
Hier laden wir onnxruntime-gpu 1.24.0 herunter und installieren es mit Python3.12-Unterstützung.
pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/onnxruntime_gpu-1.24.0-cp312-cp312-linux_aarch64.whlVerwendung von TensorRT auf NVIDIA DGX Spark#
Unter allen von Ultralytics unterstützten Modellexportformaten bietet TensorRT die höchste Inferenzleistung auf NVIDIA DGX Spark, was es zu unserer Empfehlung Nummer eins für Bereitstellungen macht. Installationsanweisungen und fortgeschrittene Verwendung findest du in unserem speziellen TensorRT-Integrationsleitfaden.
Modell in TensorRT konvertieren und Inferenz ausführen#
Das YOLO26n-Modell im PyTorch-Format wird in TensorRT konvertiert, um die Inferenz mit dem exportierten Modell auszuführen.
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Export the model to TensorRT
model.export(format="engine") # creates 'yolo26n.engine'
# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")
# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")Besuche die Exportseite, um auf zusätzliche Argumente beim Exportieren von Modellen in verschiedene Modellformate zuzugreifen
NVIDIA DGX Spark YOLO11 Benchmarks#
YOLO11-Benchmarks wurden vom Ultralytics-Team zu mehreren Modellformaten durchgeführt, wobei Geschwindigkeit und Genauigkeit gemessen wurden: PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch. Die Benchmarks wurden auf NVIDIA DGX Spark bei FP32-Präzision mit einer Standard-Eingabebildgröße von 640 ausgeführt.
Detaillierte Vergleichstabelle#
Die folgende Tabelle zeigt die Benchmark-Ergebnisse für fünf verschiedene Modelle (YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x) über mehrere Formate hinweg und liefert uns Status, Größe, mAP50-95(B)-Metrik und Inferenzzeit für jede Kombination.
| Format | Status | Größe auf dem Datenträger (MB) | mAP50-95(B) | Inferenzzeit (ms/im) |
|---|---|---|---|---|
| PyTorch | ✅ | 5.4 | 0.5071 | 2.67 |
| TorchScript | ✅ | 10.5 | 0.5083 | 2.62 |
| ONNX | ✅ | 10.2 | 0.5074 | 5.92 |
| OpenVINO | ✅ | 10.4 | 0.5058 | 14.95 |
| TensorRT (FP32) | ✅ | 12.8 | 0.5085 | 1.95 |
| TensorRT (FP16) | ✅ | 7.0 | 0.5068 | 1.01 |
| TensorRT (INT8) | ✅ | 18.6 | 0.4880 | 1.62 |
| TF SavedModel | ✅ | 25.7 | 0.5076 | 36.39 |
| TF GraphDef | ✅ | 10.3 | 0.5076 | 41.06 |
| TF Lite | ✅ | 10.3 | 0.5075 | 64.36 |
| MNN | ✅ | 10.1 | 0.5075 | 12.14 |
| NCNN | ✅ | 10.2 | 0.5041 | 12.31 |
| ExecuTorch | ✅ | 10.2 | 0.5075 | 27.61 |
Getestet mit Ultralytics 8.3.249
Unsere Ergebnisse reproduzieren#
Um die obigen Ultralytics-Benchmarks für alle Exportformate zu reproduzieren, führe diesen Code aus:
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)Beachte, dass Benchmarking-Ergebnisse je nach genauer Hardware- und Softwarekonfiguration eines Systems sowie der aktuellen Auslastung des Systems zum Zeitpunkt der Benchmark-Ausführung variieren können. Verwende für die zuverlässigsten Ergebnisse einen Datensatz mit einer großen Anzahl von Bildern, z. B. data='coco.yaml' (5000 Validierungsbilder).
Best Practices für NVIDIA DGX Spark#
Bei der Verwendung von NVIDIA DGX Spark gibt es einige Best Practices, die du befolgen solltest, um die maximale Leistung beim Ausführen von YOLO26 zu erzielen.
-
Systemleistung überwachen
Nutze die Monitoring-Tools von NVIDIA, um die GPU- und CPU-Auslastung zu verfolgen:
nvidia-smi -
Speicherausnutzung optimieren
Mit 128GB Unified Memory kann DGX Spark große Batch-Größen und Modelle verarbeiten. Erwäge, die Batch-Größe für einen verbesserten Durchsatz zu erhöhen:
from ultralytics import YOLO model = YOLO("yolo26n.engine") results = model.predict(source="path/to/images", batch=16) -
Verwende TensorRT mit FP16 oder INT8
Für die beste Leistung exportiere Modelle mit FP16- oder INT8-Präzision:
yolo export model=yolo26n.pt format=engine quantize=16 # FP16 yolo export model=yolo26n.pt format=engine quantize=8 # INT8
System-Updates (Founders Edition)#
Dein DGX Spark Founders Edition auf dem neuesten Stand zu halten, ist entscheidend für Leistung und Sicherheit. NVIDIA bietet zwei primäre Methoden zum Aktualisieren von System-OS, Treibern und Firmware an.
Verwendung des DGX Dashboard (Empfohlen)#
Das DGX Dashboard wird empfohlen, um Systemaktualisierungen zur Gewährleistung der Kompatibilität durchzuführen. Damit kannst du:
- Verfügbare System-Updates anzuzeigen
- Sicherheitspatches und System-Updates zu installieren
- NVIDIA-Treiber- und Firmware-Updates zu verwalten
Manuelle System-Updates#
Für fortgeschrittene Benutzer können Updates manuell über das Terminal durchgeführt werden:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo rebootStelle sicher, dass dein System an eine stabile Stromquelle angeschlossen ist und du kritische Daten gesichert hast, bevor du Updates durchführst.
Nächste Schritte#
Für weiteres Lernen und Support siehe die Ultralytics YOLO26 Docs.
FAQ#
Die Bereitstellung von Ultralytics YOLO26 auf NVIDIA DGX Spark ist unkompliziert. Du kannst das vorgefertigte Docker-Image für eine schnelle Einrichtung verwenden oder die erforderlichen Pakete manuell installieren. Detaillierte Schritte für jeden Ansatz findest du in den Abschnitten Schnellstart mit Docker und Mit nativer Installation beginnen.
YOLO26-Modelle liefern dank des GB10 Grace Blackwell Superchip eine hervorragende Leistung auf DGX Spark. Das TensorRT-Format bietet die beste Inferenzleistung. Sieh dir den Abschnitt Detaillierte Vergleichstabelle für spezifische Benchmark-Ergebnisse über verschiedene Modellgrößen und -formate hinweg an.
TensorRT wird aufgrund seiner optimalen Leistung dringend für die Bereitstellung von YOLO26-Modellen auf DGX Spark empfohlen. Es beschleunigt die Inferenz durch die Nutzung der Blackwell-GPU-Funktionen und sorgt für maximale Effizienz und Geschwindigkeit. Erfahre mehr im Abschnitt TensorRT auf NVIDIA DGX Spark verwenden.
DGX Spark bietet bis zu 1 PFLOP an KI-Leistung und 128GB Unified Memory, verglichen mit 2070 TFLOPS und 128GB Speicher des Jetson AGX Thor. DGX Spark ist als Desktop-KI-Supercomputer konzipiert, während Jetson-Geräte eingebettete Systeme sind, die für den Edge-Einsatz optimiert wurden.
Ja! Das Docker-Image
ultralytics/ultralytics:latest-nvidia-arm64unterstützt sowohl NVIDIA DGX Spark (mit DGX OS) als auch Jetson AGX Thor (mit JetPack 7.0), da beide die ARM64-Architektur mit CUDA 13 und ähnlichen Software-Stacks verwenden.