Краткое руководство: NVIDIA DGX Spark с Ultralytics YOLO26#
Это подробное руководство содержит пошаговое описание развертывания Ultralytics YOLO26 на NVIDIA DGX Spark — компактном настольном суперкомпьютере NVIDIA для задач AI. Кроме того, в нем представлены результаты тестов производительности, демонстрирующие возможности YOLO26 в этой мощной системе.
Это руководство протестировано на NVIDIA DGX Spark Founders Edition под управлением DGX OS на базе Ubuntu. Ожидается, что оно будет работать с последними выпусками DGX OS.
Что такое NVIDIA DGX Spark?#
NVIDIA DGX Spark — компактный настольный суперкомпьютер для задач AI на базе суперчипа NVIDIA GB10 Grace Blackwell. Он обеспечивает до 1 петафлопса вычислительной производительности AI при точности FP4, что делает его идеальным для разработчиков, исследователей и специалистов по данным, которым нужны мощные возможности AI в настольном форм-факторе.
Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference
Основные характеристики#
| Характеристика | Подробности |
|---|---|
| Производительность AI | До 1 PFLOP (FP4) |
| GPU | Архитектура NVIDIA Blackwell с Tensor Cores 5-го поколения и RT Cores 4-го поколения |
| CPU | 20-ядерный процессор Arm (10 Cortex-X925 + 10 Cortex-A725) |
| Память | 128 ГБ унифицированной системной памяти LPDDR5x, 256-битный интерфейс, 4266 МГц, пропускная способность 273 ГБ/с |
| Хранилище | NVMe M.2 объемом 1 или 4 ТБ с самошифрованием |
| Сеть | 1x RJ-45 (10 GbE), Smart NIC ConnectX-7, Wi-Fi 7, Bluetooth 5.4 |
| Подключение | 4x USB Type-C, 1x HDMI 2.1a, многоканальный звук HDMI |
| Обработка видео | 1x NVENC, 1x NVDEC |
DGX OS#
NVIDIA DGX OS — это настраиваемый дистрибутив Linux, который предоставляет стабильную, протестированную и поддерживаемую основу операционной системы для запуска приложений AI, машинного обучения и аналитики в системах DGX. Он включает:
- Надежную основу Linux, оптимизированную для рабочих нагрузок AI
- Предварительно настроенные драйверы и системные параметры для оборудования NVIDIA
- Обновления безопасности и возможности обслуживания системы
- Совместимость с широкой программной экосистемой NVIDIA
DGX OS выпускается по регулярному графику: обновления обычно предоставляются дважды в год (примерно в феврале и августе), а дополнительные исправления безопасности выпускаются между основными релизами.
DGX Dashboard#
DGX Spark поставляется со встроенной системой DGX Dashboard, которая предоставляет:
- Мониторинг системы в реальном времени: обзор текущих рабочих показателей системы
- Обновления системы: возможность устанавливать обновления непосредственно из панели мониторинга
- Системные настройки: изменение имени устройства и других параметров
- Интегрированный JupyterLab: доступ к локальным Jupyter Notebook для разработки
Доступ к панели мониторинга#
Нажми кнопку "Show Apps" в левом нижнем углу рабочего стола Ubuntu, затем выбери "DGX Dashboard", чтобы открыть ее в браузере.
Панель мониторинга включает интегрированный экземпляр JupyterLab, который при запуске автоматически создает виртуальную среду и устанавливает рекомендуемые пакеты. Для каждой учетной записи пользователя назначается отдельный порт для доступа к JupyterLab.
Быстрый старт с Docker#
Самый быстрый способ начать работу с Ultralytics YOLO26 на NVIDIA DGX Spark — запустить всё с помощью готовых образов Docker. Образ NVIDIA ARM64 поддерживает DGX Spark с DGX OS.
t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $tЗапрос устройства CDI выше применим к DGX Spark под управлением DGX OS. Информацию о рабочих нагрузках PyTorch на Jetson AGX Thor см. в отдельном руководстве по требованиям к хосту и ограничениям TensorRT в руководстве по NVIDIA Jetson.
Этот образ использует NVIDIA PyTorch 26.08, CUDA 13.4 и TensorRT 11. Обнови до версии драйвера хоста DGX OS, поддерживаемой NVIDIA PyTorch 26.08, и пересобери движки TensorRT после изменения образа или целевого графического процессора.
После этого перейди к разделу Использование TensorRT на NVIDIA DGX Spark.
Начало нативной установки#
Для нативной установки без Docker выполни следующие шаги.
Установка пакета Ultralytics#
Здесь мы установим пакет Ultralytics на DGX Spark. Зависимости для экспорта устанавливаются автоматически при первом экспорте модели, поэтому здесь нужен только базовый пакет. Мы сосредоточимся главным образом на экспорте в NVIDIA TensorRT, поскольку TensorRT обеспечит максимальную производительность DGX Spark.
-
Обнови список пакетов, установи pip и выполни обновление до последней версии
sudo apt update sudo apt install python3-pip -y pip install -U pip -
Установи pip-пакет
ultralyticspip install ultralytics -
Перезагрузи устройство
sudo reboot
Установка PyTorch и Torchvision#
Описанная выше установка ultralytics установит Torch и Torchvision. Однако эти пакеты, установленные через pip, могут быть не полностью оптимизированы для архитектуры ARM64 DGX Spark с CUDA 13. Поэтому мы рекомендуем установить совместимые с CUDA 13 версии:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130При запуске PyTorch 2.9.1 на NVIDIA DGX Spark во время инициализации CUDA может появиться следующее UserWarning (например, при запуске yolo checks, yolo predict и т. д.):
UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)Это предупреждение можно безопасно игнорировать. Для окончательного устранения проблемы в PyTorch PR #164590 было отправлено исправление, которое войдет в выпуск PyTorch 2.10.
Установи onnxruntime-gpu#
Текущие релизы ONNX Runtime GPU предоставляют колеса Linux ARM64, включая Python 3.12. Образ Docker NVIDIA ARM64 устанавливает официальный пакет; для нативных установок CUDA 13 используй:
pip install onnxruntime-gpuИспользование TensorRT на NVIDIA DGX Spark#
Среди всех форматов экспорта моделей, поддерживаемых Ultralytics, TensorRT обеспечивает наивысшую производительность инференса на NVIDIA DGX Spark, поэтому мы рекомендуем его в первую очередь для развертывания. Инструкции по настройке и расширенному использованию см. в нашем отдельном руководстве по интеграции TensorRT.
Преобразование модели в TensorRT и запуск инференса#
Модель YOLO26n в формате PyTorch преобразуется в TensorRT для запуска инференса с экспортированной моделью.
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Export the model to TensorRT
model.export(format="engine") # creates 'yolo26n.engine'
# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")
# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")Перейди на страницу экспорта, чтобы получить доступ к дополнительным аргументам при экспорте моделей в разные форматы
Тесты YOLO11 на NVIDIA DGX Spark#
Команда Ultralytics провела тесты YOLO11 в нескольких форматах моделей, измерив скорость и точность: PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch. Тесты проводились на NVIDIA DGX Spark с точностью FP32 и размером входного изображения по умолчанию 640.
Подробная сравнительная таблица#
В таблице ниже представлены результаты тестирования пяти разных моделей (YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x) в нескольких форматах с указанием статуса, размера, метрики mAP50-95(B) и времени инференса для каждой комбинации.
| Формат | Статус | Размер на диске (МБ) | mAP50-95(B) | Время инференции (мс/изображение) |
|---|---|---|---|---|
| PyTorch | ✅ | 5.4 | 0.5071 | 2.67 |
| TorchScript | ✅ | 10.5 | 0.5083 | 2.62 |
| ONNX | ✅ | 10.2 | 0.5074 | 5.92 |
| OpenVINO | ✅ | 10.4 | 0.5058 | 14.95 |
| TensorRT (FP32) | ✅ | 12.8 | 0.5085 | 1.95 |
| TensorRT (FP16) | ✅ | 7.0 | 0.5068 | 1.01 |
| TensorRT (INT8) | ✅ | 18.6 | 0.4880 | 1.62 |
| TF SavedModel | ✅ | 25.7 | 0.5076 | 36.39 |
| TF GraphDef | ✅ | 10.3 | 0.5076 | 41.06 |
| TF Lite | ✅ | 10.3 | 0.5075 | 64.36 |
| MNN | ✅ | 10.1 | 0.5075 | 12.14 |
| NCNN | ✅ | 10.2 | 0.5041 | 12.31 |
| ExecuTorch | ✅ | 10.2 | 0.5075 | 27.61 |
Тестирование выполнено с Ultralytics 8.3.249
Воспроизведение наших результатов#
Чтобы воспроизвести приведённые выше бенчмарки Ultralytics для всех форматов экспорта, выполни этот код:
from ultralytics import YOLO
# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")
# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)Учти, что результаты тестирования могут различаться в зависимости от точной конфигурации аппаратного и программного обеспечения системы, а также ее текущей нагрузки во время тестов. Для наиболее надежных результатов используй датасет с большим количеством изображений, например data='coco.yaml' (5000 изображений для валидации).
Рекомендации по работе с NVIDIA DGX Spark#
При использовании NVIDIA DGX Spark следует соблюдать несколько рекомендаций, чтобы обеспечить максимальную производительность YOLO26.
-
Отслеживай производительность системы
Используй инструменты мониторинга NVIDIA для отслеживания загрузки GPU и CPU:
nvidia-smi -
Оптимизируй использование памяти
Благодаря 128 ГБ унифицированной памяти DGX Spark может работать с большими размерами пакетов и моделями. Для повышения пропускной способности попробуй увеличить размер пакета:
from ultralytics import YOLO model = YOLO("yolo26n.engine") results = model.predict(source="path/to/images", batch=16) -
Используй TensorRT с FP16 или INT8
Для лучшей производительности экспортируй модели с точностью FP16 или INT8:
yolo export model=yolo26n.pt format=engine quantize=16 # FP16 yolo export model=yolo26n.pt format=engine quantize=8 # INT8
Обновления системы (Founders Edition)#
Поддержание NVIDIA DGX Spark Founders Edition в актуальном состоянии крайне важно для производительности и безопасности. NVIDIA предоставляет два основных способа обновления ОС системы, драйверов и встроенного ПО.
Использование DGX Dashboard (рекомендуется)#
DGX Dashboard — рекомендуемый способ выполнять обновления системы, обеспечивая совместимость. Он позволяет:
- Просматривать доступные обновления системы
- Устанавливать исправления безопасности и обновления системы
- Управлять обновлениями драйверов и встроенного ПО NVIDIA
Обновление системы вручную#
Опытные пользователи могут выполнять обновления вручную через терминал:
sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo rebootПеред обновлением убедись, что система подключена к стабильному источнику питания и что ты создал резервную копию критически важных данных.
Следующие шаги#
Дополнительные материалы и поддержку смотри в документации Ultralytics YOLO26.
Часто задаваемые вопросы#
Развернуть Ultralytics YOLO26 на NVIDIA DGX Spark несложно. Для быстрой настройки можно использовать предварительно собранный образ Docker или вручную установить необходимые пакеты. Подробные инструкции для каждого подхода приведены в разделах Быстрый старт с Docker и Начало работы с нативной установкой.
Модели YOLO26 обеспечивают отличную производительность на DGX Spark благодаря суперчипу GB10 Grace Blackwell. Формат TensorRT обеспечивает лучшую производительность инференса. Конкретные результаты тестов для моделей разных размеров и форматов см. в разделе Подробная сравнительная таблица.
TensorRT настоятельно рекомендуется для развертывания моделей YOLO26 на DGX Spark благодаря оптимальной производительности. Он ускоряет инференс, используя возможности GPU Blackwell, и обеспечивает максимальную эффективность и скорость. Подробнее см. в разделе Использование TensorRT на NVIDIA DGX Spark.
DGX Spark обеспечивает до 1 PFLOP производительности AI и имеет 128 ГБ унифицированной памяти, тогда как Jetson AGX Thor обеспечивает 2070 TFLOPS и имеет 128 ГБ памяти. DGX Spark разработан как настольный суперкомпьютер для задач AI, а устройства Jetson представляют собой встраиваемые системы, оптимизированные для развертывания на периферии.
Для рабочих нагрузок PyTorch
ultralytics/ultralytics:latest-nvidia-arm64поддерживает DGX Spark с DGX OS и Thor с JetPack 7.1. Поставляемый в комплекте TensorRT 11.2 не поддерживает JetPack, поэтому рабочие процессы Jetson TensorRT должны использовать поддерживаемую среду выполнения TensorRT 10.x для своего релиза JetPack. См. требования к Docker для Jetson.