Ultralytics YOLO27:

Ultralytics YOLO 모델용 DEEPX 내보내기#

특수 NPU 하드웨어에 컴퓨터 비전 모델을 배포하려면 호환되고 최적화된 모델 형식이 필요합니다. Ultralytics YOLO 모델을 DEEPX 형식으로 내보내면 DEEPX NPU 가속기에서 효율적인 INT8 양자화 추론을 수행할 수 있습니다. 이 가이드에서는 YOLO 모델을 DEEPX 형식으로 변환하고 DEEPX 기반 하드웨어에 배포하는 방법을 안내합니다.

DEEPX란 무엇인가요?#

DEEPX NPU Inference

DEEPX는 엣지에서 전력 효율적인 딥러닝 추론을 위해 설계된 신경망 처리 장치(NPUs)를 전문으로 하는 AI 반도체 기업입니다. DEEPX NPU는 까다로운 임베디드 및 산업용 AI 애플리케이션에 맞게 설계되어 전력 소비를 최소화하면서 높은 처리량을 제공합니다. 로보틱스, 스마트 카메라, 산업 자동화 시스템처럼 클라우드 연결이 불안정하거나 바람직하지 않은 배포 환경에 적합한 하드웨어입니다.

DEEPX 내보내기 형식#

DEEPX 내보내기를 수행하면 DEEPX NPU 하드웨어에서 실행되도록 최적화된 컴파일된 .dxnn 모델 바이너리가 생성됩니다. 컴파일 파이프라인은 dx_com 툴킷을 사용해 INT8 양자화와 하드웨어별 최적화를 수행하고, 배포에 바로 사용할 수 있는 독립형 모델 디렉터리를 생성합니다.

DEEPX 모델의 주요 기능#

DEEPX 모델은 엣지 배포에 다음과 같은 여러 이점을 제공합니다.

  • INT8 양자화: 내보내는 동안 모델을 INT8 정밀도로 양자화하여 모델 크기를 크게 줄이고 NPU 처리량을 극대화합니다. 모델 양자화에 대해 자세히 알아보세요.
  • NPU 최적화: .dxnn 형식은 DEEPX NPU 하드웨어용으로 특별히 컴파일되며, 전용 가속 장치를 활용해 빠르고 효율적으로 추론합니다.
  • 낮은 전력 소비: 추론을 NPU로 오프로드하므로 DEEPX 모델은 동급의 CPU 또는 GPU 추론보다 훨씬 적은 전력을 소비합니다.
  • 보정 기반 정확도: 내보내기 과정에서 실제 데이터셋 이미지를 사용한 EMA 기반 보정을 수행해 양자화 과정의 정확도 손실을 최소화합니다.
  • 독립형 출력: 내보낸 모델 디렉터리에는 컴파일된 바이너리, 보정 설정, 메타데이터가 포함되어 간편하게 배포할 수 있습니다.

지원 작업#

DEEPX 내보내기는 Ultralytics의 7가지 작업을 모두 지원합니다. 시맨틱 분할과 깊이 추정은 해당 헤드가 포함된 유일한 모델 계열인 YOLO26에서만 사용할 수 있습니다.

작업YOLOv8YOLO11YOLO26
감지✅✅✅
분할✅✅✅
의미론적 분할❌❌✅
깊이❌❌✅
분류✅✅✅
포즈✅✅✅
OBB✅✅✅

DEEPX로 내보내기: YOLO 모델 변환#

Ultralytics YOLO 모델을 DEEPX 형식으로 내보낸 다음 내보낸 모델로 추론을 실행합니다.

참고

DEEPX 내보내기는 x86-64 Linux 머신에서만 지원됩니다. 내보내기 단계에서는 ARM64(aarch64)를 지원하지 않습니다. 하지만 내보낸 dxnn 모델은 ARM64 플랫폼과 완벽하게 호환되며 실행할 수 있습니다.

설치#

필요한 패키지를 설치하려면 다음을 실행합니다:

설치
# Install the required package for YOLO
pip install ultralytics

처음 내보낼 때 dx_com 컴파일러가 DEEPX SDK 저장소에서 자동으로 설치됩니다. 현재 내보내기 워크플로에서는 glibc 2.31 이상이 설치된 x86-64 Linux에서 Python 3.8–3.12용 휠을 제공하는 DX-COM 2.3.0을 사용합니다.

컴파일러의 PyPI 릴리스는 배포 목록에서 제외되었습니다. 내보내기 종속성을 사전 설치하려면 SDK 휠 페이지에 --find-links을 지정하세요. 이 방법은 pip 및 uv pip 모두에서 사용할 수 있습니다.

pip install "ultralytics[export-deepx]" --find-links https://sdk.deepx.ai/release/dxcom/v2.3.0/index.html

편집 가능한 저장소 설치를 수행하려면 "ultralytics[export-deepx]"을 -e ".[export-base,export-deepx]"로 바꾸세요. Python 3.12 환경과 CI에서 사용된 내보내기 스모크 테스트를 재현하려면 저장소 루트에서 기존 환경 빌더를 실행하세요.

ULTRALYTICS_ISOLATED_VENVS="$PWD/.venvs" python .github/scripts/create-export-env.py --env isolated-deepx

환경 빌더를 사용하려면 uv와 설치된 Ultralytics 체크아웃이 필요합니다. SDK 소스에서 컴파일러를 설치하고 테스트된 종속성 제약 조건을 자동으로 적용합니다.

사용 방법#

DEEPX 형식은 내보내기, 예측, 검증 모드를 지원합니다. 추론과 검증은 DEEPX NPU 하드웨어에서 실행됩니다. 모델을 내보낸 다음 내보낸 모델을 로드해 추론을 실행하거나 정확도를 검증하세요.

내보내기
from ultralytics import YOLO

# YOLO26 모델 로드
model = YOLO("yolo26n.pt")

# 모델을 DEEPX 형식으로 내보냅니다(quantize=8이 자동으로 적용됨).
model.export(format="deepx")  # creates 'yolo26n_deepx_model/'
예측
from ultralytics import YOLO

# 내보낸 DEEPX 모델을 로드합니다.
model = YOLO("yolo26n_deepx_model")

# 추론 실행
results = model("https://ultralytics.com/images/bus.jpg")
검증
from ultralytics import YOLO

# 내보낸 DEEPX 모델을 로드합니다.
model = YOLO("yolo26n_deepx_model")

# COCO8 데이터셋에서 정확도 검증
metrics = model.val(data="coco8.yaml")

내보내기 인수#

인수유형기본값설명
formatstr'deepx'내보낸 모델의 대상 형식으로, DEEPX NPU 하드웨어와의 호환성을 정의합니다.
imgszint 또는 tuple640모델 입력에 사용할 이미지 크기입니다. DEEPX 내보내기에는 정사각형 입력이 필요합니다. 정수(예: 640) 또는 높이와 너비가 같은 튜플을 전달하세요.
quantizeint 또는 str8/자동양자화 정밀도입니다. DEEPX 내보내기에는 8(INT8)이 필요하며, 지정하지 않으면 자동으로 활성화됩니다. 더 이상 사용되지 않는 half/int8 플래그를 대체합니다.
simplifyboolTrueonnxslim을 사용해 중간 ONNX 그래프를 단순화합니다.
opsetintNone중간 ONNX 그래프의 ONNX opset 버전을 지정합니다. 설정하지 않으면 지원되는 최신 버전을 사용합니다.
datastrNoneINT8 보정에 사용할 데이터셋 YAML입니다. 분류 작업에서는 데이터셋 디렉터리 또는 기본 제공 데이터셋 이름을 사용합니다. quantize=8과 함께 지정하지 않으면 Ultralytics가 모델 작업에 맞는 기본 보정 데이터셋을 선택합니다.
devicestrNone내보내기에 사용할 장치를 지정합니다. GPU(device=0) 또는 CPU(device=cpu)를 선택할 수 있습니다.
optimizeboolFalse컴파일러 최적화 수준을 높여 추론 지연 시간을 줄이는 대신 컴파일 시간을 늘립니다.
팁

DEEPX 내보내기는 항상 x86-64 Linux 호스트에서 실행하세요. dx_com 컴파일러는 ARM64를 지원하지 않습니다.

내보내기 과정에 대한 자세한 내용은 내보내기에 관한 Ultralytics 문서 페이지를 참조하세요.

출력 구조#

내보내기가 성공하면 다음과 같은 구조의 모델 디렉터리가 생성됩니다.

yolo26n_deepx_model/
├── yolo26n.dxnn     # Compiled DEEPX model binary (NPU executable)
├── config.json      # Calibration and preprocessing configuration
└── metadata.yaml    # Model metadata (classes, image size, task, etc.)

.dxnn 파일은 컴파일된 모델 바이너리로, dx_engine 런타임이 NPU에서 직접 로드합니다. metadata.yaml에는 Ultralytics 추론 파이프라인에서 사용하는 클래스 이름, 이미지 크기 등의 정보가 포함됩니다.

내보낸 YOLO DEEPX 모델 배포#

Ultralytics YOLO 모델을 DEEPX 형식으로 성공적으로 내보냈다면, 다음 단계는 해당 모델을 DEEPX NPU 하드웨어에 배포하는 것입니다.

런타임 설치#

추론을 실행하려면 DEEPX NPU 드라이버, libdxrt 런타임, dx_engine Python 패키지가 필요합니다.

참고

DEEPX 런타임은 x86-64 Linux와 ARM64(예: Raspberry Pi 5)를 모두 지원합니다.

# Install the NPU driver and libdxrt runtime
sudo apt update
wget https://github.com/DEEPX-AI/dx_rt_npu_linux_driver/raw/main/release/2.4.1/dxrt-driver-dkms_2.4.1-2_all.deb
sudo apt install ./dxrt-driver-dkms_2.4.1-2_all.deb
wget https://github.com/DEEPX-AI/dx_rt/raw/main/release/3.3.2/libdxrt_3.3.2_all.deb
sudo apt install ./libdxrt_3.3.2_all.deb

# Create dx-engine wheel
cd /usr/share/libdxrt/python_package && sudo ./make_whl.sh

# Install the bundled dx_engine Python wheel
pip install dx_engine-*.whl

dxrt-cli --version으로 런타임이 올바르게 설치되었는지 확인하세요. 다음과 비슷한 출력이 표시됩니다.

DXRT v3.3.2
Minimum Driver Versions
Device Driver: v2.4.0
PCIe Driver: v2.2.0
Firmware: v2.5.2
Minimum Compiler Versions
Compiler: v1.18.1
.dxnn File Format: v6

런타임이 설치되면 위의 사용법 섹션에 설명된 대로 DEEPX 장치에서 추론과 검증을 실행하세요. 내보낸 _deepx_model은 YOLO(...)로 직접 로드됩니다.

dxtron으로 시각화#

dxtron은 컴파일된 .dxnn 모델을 검사하는 DEEPX 그래프 시각화 도구입니다.

DEEPX SDK에서 .deb 패키지를 다운로드하고 dpkg를 통해 설치하여 x86-64 Linux에 dxtron을 설치하세요.

wget https://sdk.deepx.ai/release/dxtron/v2.0.1/dxtron_2.0.1_amd64.deb
sudo dpkg -i dxtron_2.0.1_amd64.deb

그런 다음 내보낸 모델을 엽니다.

dxtron yolo26n_deepx_model/yolo26n.dxnn
참고

dxtron은 x86-64 및 aarch64 플랫폼 모두에서 사용할 수 있습니다.

벤치마크#

Ultralytics 팀은 YOLO26 모델의 속도와 정확도를 PyTorch 및 DEEPX 간에 비교하는 벤치마크를 수행했습니다.

성능
Raspberry Pi 5 DEEPX M1 NPU vs PyTorch benchmarks
모델형식상태크기(MB)metrics/mAP50-95(B)추론 시간(ms/im)
YOLO26nPyTorch✅5.30.4760315.2
YOLO26nDEEPX✅6.60.466034.6
YOLO26n-segPyTorch✅6.50.4080485.4
YOLO26n-segDEEPX✅7.90.392053.8
YOLO26n-posePyTorch✅7.60.4230506.3
YOLO26n-poseDEEPX✅8.80.459037.6
YOLO26n-obbPyTorch✅5.70.8171094.4
YOLO26n-obbDEEPX✅7.30.78356.4
모델형식상태크기(MB)정확도(top1)정확도(top5)추론 시간(ms/im)
YOLO26n-clsPyTorch✅5.60.4310.71623.8
YOLO26n-clsDEEPX✅5.90.3330.6862.7
참고

위 벤치마크의 검증에는 탐지에 COCO128, 분할에 COCO128-seg, 포즈 추정에 COCO8-pose, 분류에 ImageNet100, OBB 모델에 DOTA128을 사용했습니다. 추론 시간에는 전처리와 후처리가 포함되지 않습니다.

성능 최적화 팁

Raspberry Pi 5에 연결된 DX-M1 NPU에서 최상의 추론 처리량을 얻으려면 부팅 구성 파일을 열고 PCIe Gen 3 지원을 활성화하세요.

sudo nano /boot/firmware/config.txt

파일 끝에 다음 줄을 추가하세요.

dtparam=pciex1
dtparam=pciex1_gen=3

저장하고 종료한 다음(Ctrl+X, Y, Enter 순서) 재부팅하세요.

sudo reboot

PCIe 세대를 확인하세요. PCIe Gen3의 예상 속도는 8GT/s입니다.

sudo lspci -vvv | grep -iA 33 accelerators | grep -E "LnkCap|LnkSta"

권장 워크플로#

  1. Ultralytics 학습 모드를 사용해 모델을 학습합니다.
  2. model.export(format="deepx")을 사용해 DEEPX 형식으로 내보냅니다.
  3. yolo val으로 정확도를 검증해 양자화 손실이 최소인지 확인합니다.
  4. 정성적 검증을 위해 yolo predict으로 예측합니다.
  5. 내보낸 _deepx_model/ 디렉터리를 dx_engine 런타임을 사용해 DEEPX NPU 하드웨어에 배포합니다.

실제 적용 사례#

DEEPX NPU 하드웨어에 배포된 YOLO 모델은 다양한 엣지 AI 애플리케이션에 적합합니다.

  • 스마트 감시: 전력 소비가 적고 클라우드에 의존하지 않는 보안 및 모니터링 시스템용 실시간 객체 탐지입니다.
  • 산업 자동화: 공장 환경에서 장치 내 품질 관리, 결함 탐지, 공정 모니터링에 활용할 수 있습니다.
  • 로보틱스: 자율 로봇과 드론에서 비전 기반 내비게이션, 장애물 회피, 객체 인식을 지원합니다.
  • 스마트 농업: 농업 분야의 컴퓨터 비전을 활용해 작물 생육 상태를 모니터링하고, 해충을 탐지하며, 수확량을 추정합니다.
  • 리테일 분석: 실시간 엣지 추론으로 고객 동선 분석, 매대 모니터링, 재고 추적을 수행합니다.

요약#

이 가이드에서는 Ultralytics YOLO 모델을 DEEPX 형식으로 내보내고 DEEPX NPU 하드웨어에 배포하는 방법을 살펴보았습니다. 내보내기 파이프라인은 INT8 보정과 dx_com 컴파일러를 사용해 하드웨어에 최적화된 .dxnn 바이너리를 생성하며, dx_engine 런타임은 장치에서 추론을 처리합니다.

Ultralytics YOLO와 DEEPX의 NPU 기술을 결합하면 임베디드 및 엣지 장치에서 고급 컴퓨터 비전 워크로드를 실행할 수 있는 효과적인 솔루션을 제공합니다. 실시간 애플리케이션에서 전력 소비를 낮게 유지하면서 높은 처리량을 구현합니다.

사용법에 대한 자세한 내용은 DEEPX 공식 웹사이트를 참조하세요.

다른 Ultralytics YOLO 통합에 대해 더 알고 싶다면 통합 가이드 페이지를 방문하세요. 유용한 자료와 인사이트를 확인할 수 있습니다.

자주 묻는 질문#

  • Python의 export() 메서드나 CLI를 사용해 모델을 내보낼 수 있습니다. 내보내기 과정에서 INT8 양자화가 자동으로 활성화되며, 정확도 손실을 최소화하기 위해 보정 데이터셋을 사용합니다. dx_com 컴파일러 패키지가 아직 설치되지 않았다면 자동으로 설치됩니다.

    예시
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    model.export(format="deepx")
  • DEEPX NPU는 INT8 연산을 최대 효율로 실행하도록 설계되었습니다. dx_com 컴파일러는 내보내는 동안 실제 데이터셋 이미지를 사용한 EMA 기반 보정으로 모델을 양자화하여 NPU가 최대 성능을 발휘하도록 합니다. DEEPX 내보내기에는 항상 INT8이 적용되므로 다른 정밀도를 요청하면 경고와 함께 INT8로 변경됩니다.

  • DEEPX 모델 내보내기(컴파일)에는 x86-64 Linux 호스트가 필요합니다. ARM64(aarch64) 및 Windows 머신에서는 내보내기 단계를 지원하지 않습니다. 내보낸 .dxnn 모델을 사용한 추론은 dx_engine 런타임이 지원하는 모든 Linux 플랫폼(x86-64 및 ARM64)에서 실행할 수 있습니다.

  • 내보내기를 수행하면 다음 항목이 포함된 디렉터리(예: yolo26n_deepx_model/)가 생성됩니다.

    • yolo26n.dxnn — 컴파일된 NPU 바이너리
    • config.json — 보정 및 전처리 설정
    • metadata.yaml — 클래스 이름과 이미지 크기를 포함한 모델 메타데이터
  • 예. Ultralytics 학습 모드를 사용해 학습하고 format="deepx"로 내보낸 모델은 지원되는 레이어 연산을 사용하는 경우 DEEPX NPU 하드웨어에 배포할 수 있습니다. 내보내기는 탐지, 인스턴스 분할, 시맨틱 분할, 깊이 추정, 분류, 포즈 추정, 방향성 바운딩 박스(OBB)의 7가지 Ultralytics 작업을 모두 지원합니다.

  • DEEPX 내보내기 파이프라인은 dx_com 컴파일러가 보정 데이터셋의 이미지를 사용해 EMA 보정 단계를 100회 수행하도록 설정합니다. 양자화 정확도를 확보하려면 보통 수백 장의 이미지면 충분합니다. 대규모 데이터셋에서 컴파일 시간이 문제가 된다면 data에 더 작은 데이터셋을 지정하세요.

  • DEEPX 런타임은 ultralytics에 포함되어 있지 않으므로 추론을 실행하기 전에 별도로 설치해야 합니다. x86-64 Linux 및 ARM64 Linux 머신(예: Raspberry Pi 5)에서 DEEPX-AI GitHub 릴리스로부터 NPU 드라이버(dxrt-driver-dkms)와 런타임(libdxrt)을 설치한 다음, 함께 제공되는 dx_engine Python 휠을 설치하세요. 단계별 명령은 위의 런타임 설치 섹션을 참조하세요.

댓글