Ultralytics YOLO27:

빠른 시작 가이드: Ultralytics YOLO26을 NVIDIA DGX Spark에서 사용하기#

이 종합 가이드에서는 소형 데스크톱 AI 슈퍼컴퓨터인 NVIDIA DGX Spark에 Ultralytics YOLO26을 배포하는 과정을 자세히 안내합니다. 또한 이 강력한 시스템에서 YOLO26의 성능을 입증하기 위한 성능 벤치마크도 제공합니다.

NVIDIA DGX Spark AI workstation overview

참고

이 가이드는 Ubuntu 기반 DGX OS를 실행하는 NVIDIA DGX Spark Founders Edition에서 테스트되었습니다. 최신 DGX OS 릴리스에서도 작동할 것으로 예상됩니다.

NVIDIA DGX Spark란 무엇인가요?#

NVIDIA DGX Spark는 NVIDIA GB10 Grace Blackwell Superchip으로 구동되는 소형 데스크톱 AI 슈퍼컴퓨터입니다. FP4 정밀도에서 최대 1 petaFLOP의 AI 컴퓨팅 성능을 제공하므로, 데스크톱 폼 팩터에서 강력한 AI 기능이 필요한 개발자, 연구자 및 데이터 과학자에게 적합합니다.



Watch: How to Get up to 1000 FPS with Ultralytics YOLO26 on NVIDIA DGX Spark | TensorRT & Batch Inference

주요 사양#

사양세부 정보
AI 성능최대 1 PFLOP (FP4)
GPU5세대 Tensor Cores 및 4세대 RT Cores를 탑재한 NVIDIA Blackwell Architecture
CPU20코어 Arm 프로세서(10 Cortex-X925 + 10 Cortex-A725)
메모리128 GB LPDDR5x 통합 시스템 메모리, 256비트 인터페이스, 4266 MHz, 273 GB/s 대역폭
스토리지자체 암호화를 지원하는 1 TB 또는 4 TB NVMe M.2
네트워크RJ-45 1개(10 GbE), ConnectX-7 Smart NIC, Wi-Fi 7, Bluetooth 5.4
연결USB Type-C 4개, HDMI 2.1a 1개, HDMI 멀티채널 오디오
비디오 처리NVENC 1개, NVDEC 1개

DGX OS#

NVIDIA DGX OS는 DGX 시스템에서 AI, 머신 러닝 및 분석 애플리케이션을 실행하기 위한 안정적이고 테스트되었으며 지원되는 운영 체제 기반을 제공하는 맞춤형 Linux 배포판입니다. 다음을 포함합니다:

  • AI 워크로드에 최적화된 강력한 Linux 기반
  • NVIDIA 하드웨어용으로 사전 구성된 드라이버 및 시스템 설정
  • 보안 업데이트 및 시스템 유지 관리 기능
  • 더 광범위한 NVIDIA 소프트웨어 생태계와의 호환성

DGX OS는 정기적인 릴리스 일정을 따르며, 일반적으로 연 2회(2월과 8월경) 업데이트가 제공되고 주요 릴리스 사이에는 추가 보안 패치가 제공됩니다.

DGX Dashboard#

DGX Spark에는 다음 기능을 제공하는 내장 DGX Dashboard가 포함되어 있습니다:

  • 실시간 시스템 모니터링: 시스템의 현재 운영 지표 개요
  • 시스템 업데이트: 대시보드에서 직접 업데이트를 적용하는 기능
  • 시스템 설정: 장치 이름 및 기타 구성 변경
  • 통합 JupyterLab: 개발을 위한 로컬 Jupyter Notebook 액세스

NVIDIA DGX management dashboard interface

대시보드 액세스#

Ubuntu 데스크톱의 왼쪽 하단에서 "Show Apps" 버튼을 클릭한 다음 "DGX Dashboard"를 선택하여 브라우저에서 엽니다.

통합 JupyterLab

대시보드에는 통합 JupyterLab 인스턴스가 포함되어 있으며, 시작할 때 가상 환경을 자동으로 생성하고 권장 패키지를 설치합니다. 각 사용자 계정에는 JupyterLab 액세스를 위한 전용 포트가 할당됩니다.

Docker로 빠르게 시작하기#

NVIDIA DGX Spark에서 Ultralytics YOLO26을 가장 빠르게 시작하는 방법은 미리 빌드된 도커 이미지를 실행하는 것입니다. NVIDIA ARM64 이미지는 DGX OS가 탑재된 DGX Spark를 지원합니다.

t=ultralytics/ultralytics:latest-nvidia-arm64
sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all $t

위의 CDI 장치 요청은 DGX OS를 실행하는 DGX Spark에 적용됩니다. Jetson AGX Thor에서의 PyTorch 워크로드에 대해서는 NVIDIA Jetson 가이드의 별도 호스트 요구 사항 및 TensorRT 제한 사항을 참조하십시오.

이 이미지는 NVIDIA PyTorch 26.08, CUDA 13.4, TensorRT 11을 사용합니다. DGX OS 호스트 드라이버를 NVIDIA PyTorch 26.08에서 지원하는 버전으로 업데이트하고, 이미지나 타겟 GPU를 변경한 후 TensorRT 엔진을 다시 빌드하십시오.

이 작업을 완료한 후 NVIDIA DGX Spark에서 TensorRT 사용 섹션으로 이동합니다.

네이티브 설치로 시작하기#

Docker 없이 네이티브 설치를 수행하려면 다음 단계를 따릅니다.

Ultralytics 패키지 설치#

여기서는 DGX Spark에 Ultralytics 패키지를 설치합니다. 모델을 처음 export할 때 export 종속성이 자동으로 설치되므로 여기서는 기본 패키지만 필요합니다. TensorRT를 사용하면 DGX Spark에서 최고의 성능을 얻을 수 있으므로 주로 NVIDIA TensorRT export에 중점을 둡니다.

  1. 패키지 목록을 업데이트하고 pip를 설치한 후 최신 버전으로 업그레이드하기

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. ultralytics pip 패키지 설치

    pip install ultralytics
  3. 디바이스 재부팅

    sudo reboot

PyTorch 및 Torchvision 설치#

위의 ultralytics 설치 과정에서 Torch와 Torchvision이 설치됩니다. 그러나 pip를 통해 설치되는 이러한 패키지는 CUDA 13을 사용하는 DGX Spark의 ARM64 아키텍처에 완전히 최적화되지 않을 수 있습니다. 따라서 다음 CUDA 13 호환 버전을 설치하는 것이 좋습니다:

pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130
정보

NVIDIA DGX Spark에서 PyTorch 2.9.1을 실행할 때 CUDA를 초기화하면 다음 UserWarning이 발생할 수 있습니다(예: yolo checks, yolo predict 등을 실행하는 경우):

UserWarning: Found GPU0 NVIDIA GB10 which is of cuda capability 12.1.
Minimum and Maximum cuda capability supported by this version of PyTorch is (8.0) - (12.0)

이 경고는 안전하게 무시해도 됩니다. 이 문제를 영구적으로 해결하기 위한 수정 사항이 PyTorch PR #164590에 제출되었으며 PyTorch 2.10 릴리스에 포함될 예정입니다.

onnxruntime-gpu 설치#

현재 ONNX Runtime GPU 릴리스는 Python 3.12를 포함하여 Linux ARM64 휠을 제공합니다. NVIDIA ARM64 도커 이미지는 공식 패키지를 설치하며, 네이티브 CUDA 13 설치를 위해서는 다음을 사용하십시오:

pip install onnxruntime-gpu

NVIDIA DGX Spark에서 TensorRT 사용#

Ultralytics가 지원하는 모든 모델 export 형식 중 TensorRT는 NVIDIA DGX Spark에서 가장 높은 inference 성능을 제공하므로 배포에 가장 권장되는 형식입니다. 설정 지침과 고급 사용법은 TensorRT 전용 통합 가이드를 참조하세요.

모델을 TensorRT로 변환하고 inference 실행#

PyTorch 형식의 YOLO26n 모델을 TensorRT로 변환하여 export된 모델로 inference를 실행합니다.

예시
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Export the model to TensorRT
model.export(format="engine")  # creates 'yolo26n.engine'

# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")

# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")
참고

모델을 다른 모델 형식으로 export할 때 사용할 수 있는 추가 인수는 Export 페이지에서 확인하세요.

NVIDIA DGX Spark YOLO11 벤치마크#

Ultralytics 팀은 여러 모델 형식에서 속도와 정확도를 측정하는 YOLO11 벤치마크를 실행했습니다: PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch. 벤치마크는 기본 입력 이미지 크기 640, FP32 정밀도로 NVIDIA DGX Spark에서 실행되었습니다.

상세 비교 표#

아래 표는 여러 형식에 걸쳐 5가지 모델(YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x)의 벤치마크 결과를 보여주며, 각 조합의 상태, 크기, mAP50-95(B) metric 및 inference 시간을 제공합니다.

성능
형식상태디스크 크기(MB)mAP50-95(B)추론 시간 (ms/im)
PyTorch5.40.50712.67
TorchScript10.50.50832.62
ONNX10.20.50745.92
OpenVINO10.40.505814.95
TensorRT (FP32)12.80.50851.95
TensorRT (FP16)7.00.50681.01
TensorRT (INT8)18.60.48801.62
TF SavedModel25.70.507636.39
TF GraphDef10.30.507641.06
TF Lite10.30.507564.36
MNN10.10.507512.14
NCNN10.20.504112.31
ExecuTorch10.20.507527.61

Ultralytics 8.3.249로 벤치마크됨

결과 재현#

위의 Ultralytics 벤치마크를 모든 export 형식에서 재현하려면 다음 코드를 실행합니다:

예시
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Benchmark YOLO26n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)

벤치마크 결과는 시스템의 정확한 하드웨어 및 소프트웨어 구성과 벤치마크 실행 당시 시스템의 현재 워크로드에 따라 달라질 수 있습니다. 가장 신뢰할 수 있는 결과를 얻으려면 이미지 수가 많은 데이터셋(예: data='coco.yaml'(val 이미지 5000개))을 사용하세요.

NVIDIA DGX Spark 모범 사례#

NVIDIA DGX Spark에서 YOLO26을 실행할 때 최고의 성능을 달성하려면 몇 가지 모범 사례를 따라야 합니다.

  1. 시스템 성능 모니터링

    NVIDIA의 모니터링 도구를 사용하여 GPU 및 CPU 사용률을 추적합니다:

    nvidia-smi
  2. 메모리 사용량 최적화

    128GB의 통합 메모리를 갖춘 DGX Spark는 대규모 batch size와 모델을 처리할 수 있습니다. 처리량을 향상하려면 batch size를 늘리는 것을 고려하세요:

    from ultralytics import YOLO
    
    model = YOLO("yolo26n.engine")
    results = model.predict(source="path/to/images", batch=16)
  3. FP16 또는 INT8과 함께 TensorRT 사용

    최상의 성능을 위해 FP16 또는 INT8 정밀도로 모델을 export합니다:

    yolo export model=yolo26n.pt format=engine quantize=16 # FP16
    yolo export model=yolo26n.pt format=engine quantize=8  # INT8

시스템 업데이트(Founders Edition)#

성능과 보안을 위해 DGX Spark Founders Edition을 최신 상태로 유지하는 것이 중요합니다. NVIDIA는 시스템 OS, 드라이버 및 펌웨어를 업데이트하는 두 가지 주요 방법을 제공합니다.

DGX Dashboard 사용(권장)#

DGX Dashboard는 호환성을 보장하면서 시스템 업데이트를 수행하는 권장 방법입니다. 다음 작업을 수행할 수 있습니다:

  • 사용 가능한 시스템 업데이트 확인
  • 보안 패치 및 시스템 업데이트 설치
  • NVIDIA 드라이버 및 펌웨어 업데이트 관리

수동 시스템 업데이트#

고급 사용자는 터미널을 통해 수동으로 업데이트를 수행할 수 있습니다:

sudo apt update
sudo apt dist-upgrade
sudo fwupdmgr refresh
sudo fwupdmgr upgrade
sudo reboot
경고

업데이트를 수행하기 전에 시스템이 안정적인 전원에 연결되어 있고 중요한 데이터를 백업했는지 확인하세요.

다음 단계#

추가 학습 및 지원은 Ultralytics YOLO26 Docs를 참조하세요.

FAQ#

  • NVIDIA DGX Spark에 Ultralytics YOLO26을 배포하는 과정은 간단합니다. 빠른 설정에는 사전 빌드된 Docker 이미지를 사용하거나 필요한 패키지를 수동으로 설치할 수 있습니다. 각 접근 방식에 대한 자세한 단계는 Docker로 빠르게 시작하기네이티브 설치로 시작하기 섹션에서 확인할 수 있습니다.

  • YOLO26 모델은 GB10 Grace Blackwell Superchip 덕분에 DGX Spark에서 뛰어난 성능을 제공합니다. TensorRT 형식이 가장 우수한 inference 성능을 제공합니다. 다양한 모델 크기와 형식에 대한 구체적인 벤치마크 결과는 상세 비교 표 섹션에서 확인하세요.

  • TensorRT는 최적의 성능을 제공하므로 DGX Spark에 YOLO26 모델을 배포할 때 적극 권장됩니다. Blackwell GPU의 기능을 활용하여 inference를 가속하고 효율성과 속도를 극대화합니다. 자세한 내용은 NVIDIA DGX Spark에서 TensorRT 사용 섹션에서 확인하세요.

  • DGX Spark는 최대 1 PFLOP의 AI 성능과 128GB의 통합 메모리를 제공하는 반면, Jetson AGX Thor는 2070 TFLOPS와 128GB 메모리를 제공합니다. DGX Spark는 데스크톱 AI 슈퍼컴퓨터로 설계되었으며, Jetson 장치는 엣지 배포에 최적화된 임베디드 시스템입니다.

  • PyTorch 워크로드의 경우, ultralytics/ultralytics:latest-nvidia-arm64은 DGX OS가 탑재된 DGX Spark 및 JetPack 7.1이 탑재된 Thor를 지원합니다. 번들된 TensorRT 11.2는 JetPack을 지원하지 않으므로, Jetson TensorRT 워크로드는 해당 JetPack 릴리스에서 지원되는 TensorRT 10.x 런타임을 사용해야 합니다. Jetson 도커 요구 사항을 참조하십시오.

댓글