YOLO Vision 2026:

빠른 시작 가이드: NVIDIA Jetson 및 Ultralytics YOLO26#

이 종합 가이드는 NVIDIA Jetson 기기에 Ultralytics YOLO26을 배포하기 위한 상세한 단계별 안내를 제공합니다. 또한, 작고 강력한 이 기기들에서 YOLO26의 성능을 입증하기 위한 성능 벤치마크를 보여줍니다.

신제품 지원

본 가이드는 최대 2070 FP4 TFLOPS의 AI 연산 성능과 128GB 메모리를 제공하며 40W에서 130W 사이로 전력 설정을 할 수 있는 최신 NVIDIA Jetson AGX Thor Developer Kit을 반영하여 업데이트되었습니다. 이 키트는 NVIDIA Jetson AGX Orin 대비 7.5배 이상 높은 AI 연산 성능을 제공하며, 3.5배 향상된 에너지 효율성으로 가장 인기 있는 AI 모델들을 원활하게 실행할 수 있습니다.



Watch: How to use Ultralytics YOLO26 on NVIDIA Jetson Devices
NVIDIA Jetson Ecosystem
참고

본 가이드는 최신 안정 버전의 JetPack 7.2를 실행하는 NVIDIA Jetson AGX Thor Developer Kit (Jetson T5000)NVIDIA Jetson AGX Orin Developer Kit (64GB), JP6.1 JetPack 릴리스를 실행하는 NVIDIA Jetson Orin Nano Super Developer Kit, NVIDIA Jetson Orin NX 16GB 기반이며 JetPack 릴리스 JP6.0/JetPack 릴리스 JP5.1.3을 실행하는 Seeed Studio reComputer J4012, 그리고 NVIDIA Jetson Nano 4GB 기반이며 JetPack 릴리스 JP4.6.1을 실행하는 Seeed Studio reComputer J1020 v2를 대상으로 테스트되었습니다. 최신 및 구형 장치를 포함한 모든 NVIDIA Jetson 하드웨어 라인업에서 작동할 것으로 예상됩니다.

NVIDIA Jetson이란 무엇인가요?#

NVIDIA Jetson은 엣지 디바이스에 가속화된 AI(인공 지능) 컴퓨팅을 제공하도록 설계된 임베디드 컴퓨팅 보드 시리즈입니다. 이 작고 강력한 디바이스들은 NVIDIA의 GPU 아키텍처를 기반으로 구축되었으며, 클라우드 컴퓨팅 리소스에 의존하지 않고 디바이스에서 직접 복잡한 AI 알고리즘과 딥 러닝 모델을 실행할 수 있습니다. Jetson 보드는 로컬에서 낮은 지연 시간과 높은 효율성으로 AI 추론을 수행해야 하는 로보틱스, 자율주행 차량, 산업 자동화 및 기타 응용 분야에서 자주 사용됩니다. 또한 이 보드들은 ARM64 아키텍처를 기반으로 하며 전통적인 GPU 컴퓨팅 디바이스에 비해 더 낮은 전력으로 실행됩니다.

NVIDIA Jetson 시리즈 비교#

NVIDIA Jetson AGX Thor는 이전 세대에 비해 대폭 향상된 AI 성능을 제공하는 NVIDIA Blackwell 아키텍처 기반의 NVIDIA Jetson 패밀리의 최신 버전입니다. 아래 표는 생태계 내의 일부 Jetson 장치들을 비교합니다.

Jetson AGX Thor(T5000)Jetson AGX Orin 64GBJetson Orin NX 16GBJetson Orin Nano SuperJetson AGX XavierJetson Xavier NXJetson Nano
AI 성능2070 TFLOPS275 TOPS100 TOPS67 TOPS32 TOPS21 TOPS472 GFLOPS
GPU96 Tensor Core를 탑재한 2560코어 NVIDIA Blackwell 아키텍처 GPU64 Tensor Core를 탑재한 2048코어 NVIDIA Ampere 아키텍처 GPU32 Tensor Core를 탑재한 1024코어 NVIDIA Ampere 아키텍처 GPU32 Tensor Core를 탑재한 1024코어 NVIDIA Ampere 아키텍처 GPU64 Tensor Core를 탑재한 512코어 NVIDIA Volta 아키텍처 GPU48 Tensor Core를 탑재한 384코어 NVIDIA Volta™ 아키텍처 GPU128코어 NVIDIA Maxwell™ 아키텍처 GPU
GPU 최대 클럭1.57 GHz1.3 GHz918 MHz1020 MHz1377 MHz1100 MHz921MHz
CPU14코어 Arm® Neoverse®-V3AE 64비트 CPU 1MB L2 + 16MB L312코어 NVIDIA Arm® Cortex A78AE v8.2 64비트 CPU 3MB L2 + 6MB L38코어 NVIDIA Arm® Cortex A78AE v8.2 64비트 CPU 2MB L2 + 4MB L36코어 Arm® Cortex®-A78AE v8.2 64비트 CPU 1.5MB L2 + 4MB L38코어 NVIDIA Carmel Arm®v8.2 64비트 CPU 8MB L2 + 4MB L36코어 NVIDIA Carmel Arm®v8.2 64비트 CPU 6MB L2 + 4MB L3쿼드 코어 Arm® Cortex®-A57 MPCore 프로세서
CPU 최대 클럭2.6 GHz2.2 GHz2.0 GHz1.7 GHz2.2 GHz1.9 GHz1.43GHz
메모리128GB 256비트 LPDDR5X 273GB/s64GB 256비트 LPDDR5 204.8GB/s16GB 128비트 LPDDR5 102.4GB/s8GB 128비트 LPDDR5 102 GB/s32GB 256비트 LPDDR4x 136.5GB/s8GB 128비트 LPDDR4x 59.7GB/s4GB 64비트 LPDDR4 25.6GB/s

더 자세한 비교표를 보려면 공식 NVIDIA Jetson 페이지사양 비교(Compare Specifications) 섹션을 방문해 주세요.

NVIDIA JetPack이란 무엇인가요?#

Jetson 모듈을 구동하는 NVIDIA JetPack SDK는 가장 포괄적인 솔루션이며, 엔드투엔드 가속화된 AI 애플리케이션을 구축하고 출시 기간을 단축하기 위한 완전한 개발 환경을 제공합니다. JetPack에는 부트머신이 포함된 Jetson Linux, Linux 커널, Ubuntu 데스크톱 환경, 그리고 GPU 컴퓨팅, 멀티미디어, 그래픽 및 컴퓨터 비전 가속화를 위한 완전한 라이브러리 세트가 포함되어 있습니다. 또한 호스트 컴퓨터와 개발자 키트 모두를 위한 예제, 문서, 개발자 도구를 포함하며, 스트리밍 비디오 분석을 위한 DeepStream, 로보틱스를 위한 Isaac, 대화형 AI를 위한 Riva 같은 상위 수준의 SDK를 지원합니다.

NVIDIA Jetson에 JetPack 플래싱하기#

NVIDIA Jetson 장치를 확보한 후 첫 번째 단계는 장치에 NVIDIA JetPack을 플래싱하는 것입니다. NVIDIA Jetson 장치를 플래싱하는 방법은 여러 가지가 있습니다.

  1. 공식 Jetson AGX Thor, AGX Orin 또는 Orin Nano 개발자 키트에서 JetPack 7.2를 사용하려면 통합 Jetson ISO를 다운로드하여 USB 플래시 드라이브에 기록한 후, AGX Thor, AGX Orin 또는 Orin Nano용 장치별 빠른 시작 가이드를 따르세요. JetPack 7.2부터 Orin Nano는 더 이상 다운로드 가능한 SD 카드 이미지를 사용하지 않으며, ISO USB를 통해 장치의 microSD 카드나 NVMe SSD에 Jetson Linux를 설치합니다.
  2. Jetson Orin Nano 개발자 키트에서 의도적으로 JetPack 6을 사용하는 경우 NVIDIA의 JetPack 6.x 업데이트 및 SD 카드 지침을 따르세요.
  3. 다른 NVIDIA 개발자 키트를 소유하고 있는 경우 SDK Manager를 사용하여 장치에 JetPack을 플래시할 수 있습니다.
  4. Seeed Studio reComputer J4012 기기를 소유하고 있다면 포함된 SSD에 JetPack을 플래시할 수 있으며, Seeed Studio reComputer J1020 v2 기기를 소유하고 있다면 eMMC/SSD에 JetPack을 플래시할 수 있습니다.
  5. NVIDIA Jetson 모듈로 구동되는 기타 타사 장치를 소유하고 있는 경우 명령줄 플래싱(command-line flashing)을 따르는 것이 좋습니다.
참고

위의 1, 4, 5번 방법의 경우, 시스템을 플래싱하고 장치를 부팅한 후 장치 터미널에 "sudo apt update && sudo apt install nvidia-jetpack -y"를 입력하여 필요한 나머지 JetPack 구성 요소를 모두 설치하십시오.

Jetson 장치별 JetPack 지원#

아래 표는 각 NVIDIA Jetson 장치에서 지원하는 NVIDIA JetPack 버전을 보여줍니다.

JetPack 4JetPack 5JetPack 6JetPack 7
Jetson Nano
Jetson TX2
Jetson Xavier NX
Jetson AGX Xavier
Jetson AGX Orin
Jetson Orin NX
Jetson Orin Nano
Jetson AGX Thor

Docker를 사용한 빠른 시작#

NVIDIA Jetson에서 Ultralytics YOLO26을 시작하는 가장 빠른 방법은 Jetson용 사전 빌드된 도커 이미지를 실행하는 것입니다. 위 표를 참조하여 보유한 Jetson 장치에 맞는 JetPack 버전을 선택하십시오.

t=ultralytics/ultralytics:latest-jetson-jetpack4
sudo docker pull $t && sudo docker run -it --ipc=host --runtime=nvidia $t
JetPack 7 Docker 범위

공개된 latest-nvidia-arm64 이미지는 현재 JetPack 7.0 Thor/DGX Spark 경로만 지원합니다. Thor 또는 Orin에서 JetPack 7.2를 사용하는 경우 해당 조합에 대해 공개 이미지가 명시적으로 검증되고 업데이트될 때까지 아래의 네이티브 설치 방식을 사용하세요.

이 작업이 완료되면 NVIDIA Jetson에서 TensorRT 사용 섹션으로 건너뛰세요.

네이티브 설치로 시작하기#

Docker를 사용하지 않는 네이티브 설치를 원하시면 아래 단계를 참조하십시오.

JetPack 7.2에서 실행#

Ultralytics 패키지 설치#

PyTorch 모델을 다른 다양한 형식으로 내보내기(export)할 수 있도록 선택적 종속성(optional dependencies)과 함께 Jetson에 Ultralytics 패키지를 설치합니다. TensorRT는 Jetson 기기에서 최대 성능을 발휘할 수 있도록 보장하므로, 주로 NVIDIA TensorRT 내보내기에 초점을 맞출 것입니다.

  1. 패키지 목록 업데이트, pip 설치 및 최신 버전으로 업그레이드

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. 선택적 종속성과 함께 ultralytics pip 패키지 설치

    pip install ultralytics[export]
  3. 장치 재부팅

    sudo reboot

PyTorch 및 Torchvision 설치#

위의 Ultralytics 설치 과정에서 Torch와 Torchvision이 설치됩니다. 그러나 pip를 통해 설치된 이 두 패키지는 CUDA 13이 탑재된 JetPack 7.2 장치에서 실행하기에 호환되지 않습니다. 따라서 수동으로 설치해야 합니다.

JP7.2에 따라 torchtorchvision 설치

pip install torch torchvision --index-url https://download.pytorch.org/whl/cu130

onnxruntime-gpu 설치#

PyPI에 호스팅된 onnxruntime-gpu 패키지에는 Jetson용 aarch64 바이너리가 포함되어 있지 않습니다. 따라서 이 패키지를 수동으로 설치해야 합니다. 이 패키지는 일부 내보내기 작업에 필요합니다.

여기서는 Python3.12 지원과 함께 onnxruntime-gpu 1.24.0을 다운로드하고 설치합니다.

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/onnxruntime_gpu-1.24.0-cp312-cp312-linux_aarch64.whl

JetPack 6.1에서 실행#

Ultralytics 패키지 설치#

PyTorch 모델을 다른 다양한 형식으로 내보내기(export)할 수 있도록 선택적 종속성(optional dependencies)과 함께 Jetson에 Ultralytics 패키지를 설치합니다. TensorRT는 Jetson 기기에서 최대 성능을 발휘할 수 있도록 보장하므로, 주로 NVIDIA TensorRT 내보내기에 초점을 맞출 것입니다.

  1. 패키지 목록 업데이트, pip 설치 및 최신 버전으로 업그레이드

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. 선택적 종속성과 함께 ultralytics pip 패키지 설치

    pip install ultralytics[export]
  3. 장치 재부팅

    sudo reboot

PyTorch 및 Torchvision 설치#

위의 Ultralytics 설치 과정에서 Torch와 Torchvision이 설치됩니다. 하지만 pip를 통해 설치된 이 두 패키지는 ARM64 아키텍처 기반의 Jetson 플랫폼과 호환되지 않습니다. 따라서 사전 빌드된 PyTorch pip 휠을 수동으로 설치하고, Torchvision은 소스에서 직접 컴파일하거나 설치해야 합니다.

JP6.1에 따라 torch 2.10.0torchvision 0.25.0 설치

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torch-2.10.0-cp310-cp310-linux_aarch64.whl
pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torchvision-0.25.0-cp310-cp310-linux_aarch64.whl
참고

다양한 JetPack 버전을 위한 모든 PyTorch 버전에 접근하려면 PyTorch for Jetson 페이지를 방문하세요. PyTorch와 Torchvision 호환성에 대한 더 자세한 목록은 PyTorch 및 Torchvision 호환성 페이지를 방문하세요.

torch 2.10.0와의 종속성 문제를 해결하기 위해 cuDSS을(를) 설치합니다.

wget https://developer.download.nvidia.com/compute/cudss/0.7.1/local_installers/cudss-local-tegra-repo-ubuntu2204-0.7.1_0.7.1-1_arm64.deb
sudo dpkg -i cudss-local-tegra-repo-ubuntu2204-0.7.1_0.7.1-1_arm64.deb
sudo cp /var/cudss-local-tegra-repo-ubuntu2204-0.7.1/cudss-*-keyring.gpg /usr/share/keyrings/
sudo apt-get update
sudo apt-get -y install cudss

onnxruntime-gpu 설치#

PyPI에 호스팅된 onnxruntime-gpu 패키지에는 Jetson용 aarch64 바이너리가 포함되어 있지 않습니다. 따라서 이 패키지를 수동으로 설치해야 합니다. 이 패키지는 일부 내보내기 작업에 필요합니다.

JetPack 버전, Python 버전 및 기타 호환성 세부 정보별로 구성된 사용 가능한 모든 onnxruntime-gpu 패키지는 Jetson Zoo ONNX Runtime 호환성 매트릭스에서 확인할 수 있습니다.

Python 3.10을 지원하는 JetPack 6의 경우 onnxruntime-gpu 1.23.0을 설치할 수 있습니다:

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/onnxruntime_gpu-1.23.0-cp310-cp310-linux_aarch64.whl

또는 onnxruntime-gpu 1.20.0의 경우:

pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/onnxruntime_gpu-1.20.0-cp310-cp310-linux_aarch64.whl

JetPack 5.1.2에서 실행#

Ultralytics 패키지 설치#

여기서는 PyTorch 모델을 다른 다양한 형식으로 내보낼 수 있도록 선택적 종속성(optional dependencies)과 함께 Jetson에 Ultralytics 패키지를 설치합니다. TensorRT는 Jetson 기기에서 최대 성능을 낼 수 있도록 보장해주므로, 주로 NVIDIA TensorRT 내보내기에 집중할 것입니다.

  1. 패키지 목록 업데이트, pip 설치 및 최신 버전으로 업그레이드

    sudo apt update
    sudo apt install python3-pip -y
    pip install -U pip
  2. 선택적 종속성과 함께 ultralytics pip 패키지 설치

    pip install ultralytics[export]
  3. 장치 재부팅

    sudo reboot

PyTorch 및 Torchvision 설치#

위의 Ultralytics 설치 과정에서 Torch와 Torchvision이 설치됩니다. 하지만 pip를 통해 설치된 이 두 패키지는 ARM64 아키텍처 기반의 Jetson 플랫폼과 호환되지 않습니다. 따라서 사전 빌드된 PyTorch pip 휠을 수동으로 설치하고, Torchvision은 소스에서 직접 컴파일하거나 설치해야 합니다.

  1. 현재 설치된 PyTorch 및 Torchvision 삭제

    pip uninstall torch torchvision
  2. JP5.1.2에 따라 torch 2.1.0torchvision 0.16.2 설치

    pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torch-2.1.0a0+41361538.nv23.06-cp38-cp38-linux_aarch64.whl
    pip install https://github.com/ultralytics/assets/releases/download/v0.0.0/torchvision-0.16.2+c6f3977-cp38-cp38-linux_aarch64.whl
참고

다양한 JetPack 버전을 위한 모든 PyTorch 버전에 접근하려면 PyTorch for Jetson 페이지를 방문하세요. PyTorch와 Torchvision 호환성에 대한 더 자세한 목록은 PyTorch 및 Torchvision 호환성 페이지를 방문하세요.

onnxruntime-gpu 설치#

PyPI에 호스팅된 onnxruntime-gpu 패키지에는 Jetson용 aarch64 바이너리가 포함되어 있지 않습니다. 따라서 이 패키지를 수동으로 설치해야 합니다. 이 패키지는 일부 내보내기 작업에 필요합니다.

JetPack 버전, Python 버전 및 기타 호환성 세부 정보별로 구성된 사용 가능한 모든 onnxruntime-gpu 패키지는 Jetson Zoo ONNX Runtime 호환성 매트릭스에서 확인할 수 있습니다. 여기서는 Python3.8 지원과 함께 onnxruntime-gpu 1.17.0를 다운로드하고 설치합니다.

wget https://nvidia.box.com/shared/static/zostg6agm00fb6t5uisw51qi6kpcuwzd.whl -O onnxruntime_gpu-1.17.0-cp38-cp38-linux_aarch64.whl
pip install onnxruntime_gpu-1.17.0-cp38-cp38-linux_aarch64.whl
참고

onnxruntime-gpu은 NumPy 버전을 자동으로 최신 버전으로 되돌립니다. 따라서 문제를 해결하려면 다음 명령을 실행하여 NumPy를 1.23.5(으)로 다시 설치해야 합니다.

pip install numpy==1.23.5

NVIDIA Jetson에서 TensorRT 사용#

Ultralytics에서 지원하는 모든 모델 내보내기 형식 중 TensorRT는 NVIDIA Jetson 기기에서 가장 높은 추론 성능을 제공하므로, Jetson 배포 시 가장 추천하는 방식입니다. 설정 지침 및 고급 사용법은 전용 TensorRT 통합 가이드를 참조하세요.

로컬에서 빌드 환경을 설정하지 않고 브라우저에서 직접 내보낼 수도 있습니다. Ultralytics 플랫폼 모델 내보내기(Export) 탭에서 TensorRT와 원하는 Jetson 타겟을 선택하세요. Thor 선택 항목은 실제 Thor 하드웨어에서 검증되었습니다. 6개의 Orin 선택 항목은 현재 AGX-Orin 빌드 후보 엔진을 생성하므로 배포 전에 대상 Orin SKU에서 검증하세요.

TensorRT 엔진은 장치별로 다릅니다

TensorRT는 빌드 GPU에서 엔진을 프로파일링하고 튜닝합니다. 대상 장치의 GPU 아키텍처 및 TensorRT/CUDA 런타임과 일치시켜야 하며, 다운로드한 모든 엔진은 배포 장치에서 검증해야 합니다. 동일한 아키텍처의 Orin SKU라고 해서 이식성이 자동으로 보장되는 것은 아니며, 최상의 결과를 위해 INT8 교정은 대상 장치에서 수행해야 합니다.

모델을 TensorRT로 변환 및 추론 실행#

PyTorch 형식의 YOLO26n 모델이 TensorRT로 변환되어 내보낸 모델로 추론을 실행합니다.

예시
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Export the model to TensorRT
model.export(format="engine")  # creates 'yolo26n.engine'

# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")

# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")
참고

모델을 다양한 모델 형식으로 내보낼 때 추가 인수에 접근하려면 내보내기 페이지(Export page)를 방문하세요.

NVIDIA Deep Learning Accelerator (DLA) 사용#

NVIDIA Deep Learning Accelerator (DLA)는 NVIDIA Jetson 기기에 내장된 특수 하드웨어 컴포넌트로, 에너지 효율성과 성능을 위해 딥 러닝 추론을 최적화합니다. GPU의 작업을 오프로드하여(GPU가 더 집약적인 프로세스를 처리할 수 있도록 여유 공간을 확보함) 높은 처리량을 유지하면서 더 낮은 전력 소비로 모델을 실행할 수 있게 해주며, 임베디드 시스템 및 실시간 AI 애플리케이션에 이상적입니다.

TensorRT 11.0 및 DLA

DLA는 TensorRT 11.0에서 지원되지 않으며 이후 릴리스에서 다시 지원될 예정이므로, DLA 내보내기에는 TensorRT 10.x가 필요합니다. JetPack 6.x/7.x에서는 DLA를 사용하려면 TensorRT 10.x 빌드로 내보내거나, TensorRT 11.0 엔진에 GPU를 사용하십시오.

다음 Jetson 장치에는 DLA 하드웨어가 장착되어 있습니다:

Jetson 장치DLA 코어DLA 최대 주파수
Jetson AGX Orin 시리즈21.6 GHz
Jetson Orin NX 16GB2614 MHz
Jetson Orin NX 8GB1614 MHz
Jetson AGX Xavier 시리즈21.4 GHz
Jetson Xavier NX 시리즈21.1 GHz
예시
from ultralytics import YOLO

# Load a YOLO26n PyTorch model
model = YOLO("yolo26n.pt")

# Export the model to TensorRT with DLA enabled (only works with FP16 or INT8)
model.export(format="engine", device="dla:0", quantize=16)  # dla:0 or dla:1 corresponds to the DLA cores

# Load the exported TensorRT model
trt_model = YOLO("yolo26n.engine")

# Run inference
results = trt_model("https://ultralytics.com/images/bus.jpg")
참고

DLA 내보내기를 사용할 때, 일부 레이어는 DLA 실행을 지원하지 않아 GPU로 대체(fallback)될 수 있습니다. 이 대체 과정에서 추가적인 지연 시간이 발생하여 전체 추론 성능에 영향을 줄 수 있습니다. 따라서 DLA는 전체적으로 GPU에서 실행되는 TensorRT와 비교하여 추론 지연 시간을 줄이기 위해 설계된 것이 아닙니다. 오히려 처리량을 증가시키고 에너지 효율성을 높이는 것이 주된 목적입니다.

NVIDIA Jetson YOLO11/ YOLO26 벤치마크#

YOLO11/ YOLO26 벤치마크는 Ultralytics 팀이 PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch 등 11가지 모델 형식을 대상으로 속도와 정확도를 측정하여 실행했습니다. 벤치마크는 NVIDIA Jetson AGX Thor Developer Kit, NVIDIA Jetson AGX Orin Developer Kit (64GB), NVIDIA Jetson Orin Nano Super Developer Kit, 그리고 Jetson Orin NX 16GB 장치로 구동되는 Seeed Studio reComputer J4012에서 기본 입력 이미지 크기 640과 FP32 정밀도(precision)로 실행되었습니다.

비교 차트#

모든 모델 내보내기가 NVIDIA Jetson에서 작동하지만, 아래 비교 차트에는 PyTorch, TorchScript, TensorRT만 포함했습니다. 이들은 Jetson의 GPU를 활용하여 최상의 결과를 보장하기 때문입니다. 다른 모든 내보내기 형식은 CPU만 활용하며 성능이 위 세 가지보다 우수하지 않습니다. 이 차트 이후 섹션에서 모든 내보내기에 대한 벤치마크를 확인할 수 있습니다.

NVIDIA Jetson AGX Thor Developer Kit#

Jetson AGX Thor Benchmarks
Benchmarked with Ultralytics 8.3.226

NVIDIA Jetson AGX Orin Developer Kit (64GB)#

Jetson AGX Orin Benchmarks
Benchmarked with Ultralytics 8.4.32

NVIDIA Jetson Orin Nano Super Developer Kit#

Jetson Orin Nano Super Benchmarks
Benchmarked with Ultralytics 8.4.33

NVIDIA Jetson Orin NX 16GB#

Jetson Orin NX 16GB Benchmarks
Benchmarked with Ultralytics 8.4.33

상세 비교 테이블#

아래 표는 11가지 형식(PyTorch, TorchScript, ONNX, OpenVINO, TensorRT, TF SavedModel, TF GraphDef, TF Lite, MNN, NCNN, ExecuTorch)에 걸친 5가지 모델(YOLO11n, YOLO11s, YOLO11m, YOLO11l, YOLO11x)에 대한 벤치마크 결과를 나타내며, 각 조합에 대한 상태, 크기, mAP50-95(B) 메트릭 및 추론 시간을 제공합니다.

NVIDIA Jetson AGX Thor Developer Kit#

성능
형식상태디스크 크기 (MB)mAP50-95(B)추론 시간(ms/im)
PyTorch5.30.47987.39
TorchScript9.80.47894.21
ONNX9.50.47676.58
OpenVINO10.10.479417.50
TensorRT (FP32)13.90.47911.90
TensorRT (FP16)7.60.47971.39
TensorRT (INT8)6.50.42731.52
TF SavedModel25.70.476447.24
TF GraphDef9.50.476445.98
TF Lite9.90.4764182.04
MNN9.40.478421.83

Ultralytics 8.4.7을 사용하여 벤치마킹했습니다.

참고

추론 시간은 전처리/후처리 과정을 포함하지 않습니다.

NVIDIA Jetson AGX Orin Developer Kit (64GB)#

성능
형식상태디스크 크기 (MB)mAP50-95(B)추론 시간(ms/im)
PyTorch5.30.479011.58
TorchScript9.80.47704.60
ONNX9.50.47709.87
OpenVINO9.60.482028.80
TensorRT (FP32)11.50.04504.18
TensorRT (FP16)7.90.04502.62
TensorRT (INT8)5.40.46402.30
TF SavedModel24.60.476071.10
TF GraphDef9.50.476070.02
TF Lite9.90.4760227.94
MNN9.40.476032.46
NCNN9.30.481029.93

Ultralytics 8.4.32 버전으로 벤치마킹되었습니다

참고

추론 시간은 전처리/후처리 과정을 포함하지 않습니다.

NVIDIA Jetson Orin Nano Super Developer Kit#

성능
형식상태디스크 크기 (MB)mAP50-95(B)추론 시간(ms/im)
PyTorch5.30.479015.60
TorchScript9.80.477012.60
ONNX9.50.476015.76
OpenVINO9.60.482056.23
TensorRT (FP32)11.30.47707.53
TensorRT (FP16)8.10.48004.57
TensorRT (INT8)5.30.44903.80
TF SavedModel24.60.4760118.33
TF GraphDef9.50.4760116.30
TF Lite9.90.4760286.00
MNN9.40.476068.77
NCNN9.30.481047.50

Ultralytics 8.4.33 버전으로 벤치마킹함

참고

추론 시간은 전처리/후처리 과정을 포함하지 않습니다.

NVIDIA Jetson Orin NX 16GB#

성능
형식상태디스크 크기 (MB)mAP50-95(B)추론 시간(ms/im)
PyTorch5.30.479913.90
TorchScript9.80.478711.60
ONNX9.50.476314.18
OpenVINO9.60.481940.19
TensorRT (FP32)11.40.47707.01
TensorRT (FP16)8.00.47894.13
TensorRT (INT8)5.50.44893.49
TF SavedModel24.60.476492.34
TF GraphDef9.50.476492.06
TF Lite9.90.4764254.43
MNN9.40.476048.55
NCNN9.30.480534.31

Ultralytics 8.4.33 버전으로 벤치마킹함

참고

추론 시간은 전처리/후처리 과정을 포함하지 않습니다.

다양한 버전의 NVIDIA Jetson 하드웨어에서 실행되는 Seeed Studio의 추가 벤치마킹 작업 살펴보기.

결과 재현하기#

모든 내보내기 형식(formats)에서 위 Ultralytics 벤치마크를 재현하려면 이 코드를 실행하세요:

예시
from ultralytics import YOLO

# Load a YOLO11n PyTorch model
model = YOLO("yolo11n.pt")

# Benchmark YOLO11n speed and accuracy on the COCO128 dataset for all export formats
results = model.benchmark(data="coco128.yaml", imgsz=640)

벤치마크 결과는 시스템의 정확한 하드웨어 및 소프트웨어 구성뿐만 아니라 벤치마크 실행 시점의 시스템 현재 워크로드에 따라 달라질 수 있다는 점에 유의하세요. 가장 신뢰할 수 있는 결과를 얻으려면 data='coco.yaml'(5000개의 검증 이미지)과 같이 이미지가 많은 데이터셋을 사용하세요.

NVIDIA Jetson 사용 시 모범 사례#

NVIDIA Jetson을 사용할 때 YOLO26을 실행하는 NVIDIA Jetson에서 최고의 성능을 구현하기 위해 따라야 할 몇 가지 모범 사례가 있습니다.

  1. 최대 전원 모드 활성화

    Jetson에서 최대 전원 모드를 활성화하면 모든 CPU 및 GPU 코어가 켜져 있는지 확인할 수 있습니다.

    sudo nvpmodel -m 0
  2. Jetson 클록 활성화

    Jetson 클록을 활성화하면 모든 CPU 및 GPU 코어가 최대 주파수로 작동합니다.

    sudo jetson_clocks
  3. Jetson 통계 애플리케이션 설치

    jetson stats 애플리케이션을 사용하여 시스템 구성 요소의 온도를 모니터링하고 CPU, GPU, RAM 사용량 확인, 전원 모드 변경, 최대 클록 설정, JetPack 정보 확인 등 기타 시스템 세부 정보를 확인할 수 있습니다.

    sudo apt update
    sudo pip install jetson-stats
    sudo reboot
    jtop
Jetson Stats

NVIDIA Jetson을 위한 메모리 최적화 팁#

사용 가능한 메모리는 종종 Jetson 기기, 특히 Jetson Orin Nano (8 GB) 또는 Orin NX 8 GB와 같은 저메모리 변형 제품에서 제한 요소가 됩니다. 아래의 팁들은 종합적으로 수백 메가바이트를 확보하여 더 큰 YOLO 모델을 실행하거나 추가적인 병렬 워크로드를 지원할 수 있게 해주는 실용적이고 위험 부담이 낮은 변경 사항입니다. 자세한 내용은 Jetson에서 메모리 효율성을 극대화하는 방법에 대한 NVIDIA 블로그를 참조하세요.

헤드리스(GUI 없음) 부팅으로 전환#

Jetson이 SSH를 통해 연결되어 있거나 디스플레이가 연결되지 않은 상태로 운영 환경에서 실행 중인 경우, 데스크톱 환경과 디스플레이 서버를 제거하면 최대 865 MB의 RAM을 복구할 수 있습니다:

sudo systemctl set-default multi-user.target
sudo reboot

나중에 데스크톱을 복원하려면:

sudo systemctl set-default graphical.target
sudo reboot

사용하지 않는 시스템 서비스 비활성화#

필수적이지 않은 백그라운드 서비스(Bluetooth, 연결 관리자, 사용하지 않는 하드웨어 데몬)는 합쳐서 약 32 MB를 소비합니다. 활성 서비스를 나열하고 배포에 필요하지 않은 서비스를 비활성화하십시오:

# List running services
systemctl list-units --type=service --state=running

# Disable a service
sudo systemctl disable SERVICE_NAME

메모리 사용량 프로파일링#

최적화하기 전에 실제로 RAM을 소비하고 있는 프로세스가 무엇인지 식별하세요. procrank은 프로세스별 메모리 점유율을 RSS(프로세스가 매핑한 총 물리적 RAM 페이지로, 다른 프로세스와 공유되는 페이지 포함)보다 더 정확하게 반영하는 PSS(Proportional Set Size)를 기준으로 프로세스를 정렬합니다:

git clone https://github.com/csimmonds/procrank_linux.git
cd procrank_linux && make
sudo ./procrank

프로세스별 GPU 및 NvMap(CUDA/비디오 파이프라인) 할당을 보려면 다음을 실행하십시오:

sudo cat /sys/kernel/debug/nvmap/iovmm/clients

프로덕션 환경에서 디스플레이 없이 추론 실행#

실시간 미리보기가 필요 없는 추론 파이프라인의 경우 디스플레이 관련 구성 요소(Tiler, OSD, DisplaySink)를 비활성화하면 파이프라인만으로 200 MB 이상을 절약할 수 있습니다. Ultralytics YOLO에서는 뷰어를 억제하고 결과를 대신 디스크에 기록하십시오:

예시
from ultralytics import YOLO

model = YOLO("yolo11n.engine")

# show=False prevents any display window; save=True writes annotated output to disk
results = model.predict(source="video.mp4", show=False, save=True)

누적 효과#

최적화절약된 예상 메모리
데스크톱 GUI 비활성화~865 MB
사용하지 않는 OS 서비스 비활성화~32 MB
헤드리스 추론 파이프라인(디스플레이 없음)~200+ MB
합계 (쉽게 얻을 수 있는 이득)~1 GB+

이러한 변경 사항을 결합하는 것은 메모리 제약이 있는 장치에서 TensorRT INT8 모델을 타겟팅할 때 특히 유용하며, 더 큰 모델 변형을 메모리에 맞출 수 있는지 여부를 결정짓는 차이가 될 수 있습니다.

다음 단계#

추가적인 학습 및 지원을 보려면 Ultralytics YOLO26 문서(Docs)를 참조하세요.

FAQ#

  • NVIDIA Jetson 기기에 Ultralytics YOLO26을 배포하는 것은 간단한 과정입니다. 먼저, NVIDIA JetPack SDK로 Jetson 기기에 플래싱을 진행합니다. 그 다음, 빠른 설정을 위해 사전 제작된 Docker 이미지를 사용하거나 필요한 패키지를 수동으로 설치합니다. 각 접근 방식에 대한 자세한 단계는 Docker로 빠른 시작네이티브 설치로 시작 섹션에서 확인할 수 있습니다.

  • YOLO11 모델은 다양한 NVIDIA Jetson 기기에서 벤치마크가 실행되었으며 상당한 성능 향상을 보여주었습니다. 예를 들어, TensorRT 형식은 최고의 추론 성능을 제공합니다. 상세 비교표(Detailed Comparison Tables) 섹션의 표는 mAP50-95 및 다양한 모델 형식에 걸친 추론 시간과 같은 성능 지표에 대한 포괄적인 보기를 제공합니다.

  • TensorRT는 최적의 성능 덕분에 NVIDIA Jetson에 YOLO26 모델을 배포할 때 강력히 권장됩니다. Jetson의 GPU 기능을 활용하여 추론을 가속화하며, 최대의 효율성과 속도를 보장합니다. TensorRT로 변환하고 추론을 실행하는 방법에 대한 자세한 내용은 NVIDIA Jetson에서 TensorRT 사용 섹션을 참조하세요.

  • NVIDIA Jetson에 PyTorch와 Torchvision을 설치하려면 먼저 pip를 통해 설치되었을 수 있는 기존 버전을 모두 제거하세요. 그런 다음 Jetson의 ARM64 아키텍처와 호환되는 PyTorch 및 Torchvision 버전을 수동으로 설치합니다. 이 과정에 대한 자세한 지침은 PyTorch 및 Torchvision 설치 섹션에 제공되어 있습니다.

  • NVIDIA Jetson에서 YOLO26의 성능을 극대화하려면 다음 모범 사례를 따르십시오:

    1. 모든 CPU 및 GPU 코어를 활용하려면 MAX Power Mode를 활성화하십시오.
    2. 모든 코어를 최대 주파수로 실행하려면 Jetson Clocks를 활성화하십시오.
    3. 시스템 지표를 모니터링하려면 Jetson Stats 애플리케이션을 설치하십시오.

    명령어 및 추가 세부 정보는 NVIDIA Jetson 사용 시 모범 사례 섹션을 참조하세요.

  • 가용 RAM은 메모리가 적은 Jetson 장치에서 종종 병목 현상의 원인이 됩니다. 총 1GB 이상을 확보할 수 있는 세 가지 간단한 방법은 다음과 같습니다:

    1. 데스크톱 GUI를 제거하려면 헤드리스 부팅으로 전환 (sudo systemctl set-default multi-user.target) 하세요 (~865 MB 절약).
    2. Bluetooth나 연결 관리자와 같이 사용하지 않는 서비스를 비활성화하십시오 (~32 MB 확보).
    3. YOLO predict 호출에서 show=False을(를) 설정하여 디스플레이 없이 추론을 실행하면 디스플레이 파이프라인 메모리 할당을 방지할 수 있습니다(~200MB 이상 절약).

    procrank을 사용하여 프로세스별 RAM 사용량을 프로파일링하고 sudo cat /sys/kernel/debug/nvmap/iovmm/clients을 사용하여 GPU 할당을 검사하세요. 자세한 내용은 메모리 최적화 팁 섹션을 참조하세요.

  • JetPack 6과 함께 제공된 TensorRT 10.3.0에는 end2end=True이 활성화된 경우 INT8 엔진 빌드를 방지하는 알려진 문제가 있습니다. Ultralytics가 이 조합을 감지하면 내보내기가 성공적으로 완료되도록 end2end 브랜치를 자동으로 비활성화합니다.

    end2end INT8 내보내기를 복구하려면 TensorRT를 최신 버전(예: 10.7.0 이상)으로 업그레이드하십시오:

    wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/arm64/cuda-keyring_1.1-1_all.deb
    sudo dpkg -i cuda-keyring_1.1-1_all.deb
    sudo apt-get update
    sudo apt-get install -y tensorrt

    업그레이드 후 내보내기를 다시 실행하세요. 자세한 내용은 GitHub 이슈 #23841을 참조하세요.

댓글