엣지 및 웹 배포를 위한 YOLO 모델을 LiteRT로 내보내기#
LiteRT(Lite Runtime의 약어)는 온디바이스 AI를 위한 Google의 고성능 런타임입니다. TensorFlow Lite(TFLite)의 차세대 버전이자 새로운 이름이며, 동일한 .tflite 모델 형식으로 실행됩니다. LiteRT를 사용하면 하나의 내보낸 Ultralytics YOLO 모델을 모바일, 임베디드, 엣지 및 브라우저 전반에 배포할 수 있어, 이전의 tflite 및 tfjs 내보내기 형식이 각각 처리하던 모든 대상을 이제 하나의 통합 형식으로 지원합니다.
Watch: How to Export Ultralytics YOLO26 to Google LiteRT | Deploy Vision AI on Android & iOS | Mobile AI 📱🚀
LiteRT 내보내기 형식은 객체 탐지, 세그멘테이션, 포즈 추정, 분류와 같은 작업에 맞게 모델을 최적화하므로, 다양한 장치에서 빠르고 오프라인으로 실행할 수 있습니다.
공식 Ultralytics YOLO Flutter 플러그인은 Android에서 LiteRT .tflite 내보내기를 별도의 설정 없이 실행합니다. 실시간 카메라 추론, 단일 이미지 예측, GPU 가속 및 자동 모델 다운로드를 지원하며, Depth를 포함한 7가지 YOLO26 작업을 모두 지원합니다. Apple 장치에는 CoreML 내보내기를 사용하고, Qualcomm Snapdragon NPU에는 Qualcomm QNN 통합을 참조하십시오.
분류 모델은 imgsz=224에서 내보냅니다. 탐지, 세그먼트, 시맨틱, 깊이, 포즈 및 OBB 모델은
imgsz=640에서 내보냅니다. 이 224/640 표준은 공식 LiteRT, CoreML 및 QNN 모바일 자산에서 공유됩니다.
공식 Ultralytics YOLO NPM 패키지는 LiteRT.js를 통해 브라우저에서 LiteRT .tflite 내보내기를 서버나 Python 없이 직접 실행합니다. 실시간 웹캠 추론, 단일 이미지 예측 및 WebGPU 가속(CPU/WASM 자동 대체)을 지원하며, YOLO26의 6가지 작업(탐지, 세그먼트, 포즈, OBB, 분류, 시맨틱)을 모두 지원합니다. WebGPU에서는 ONNX Runtime Web보다 약 ~2배 빠른 경우가 많습니다.
npm i @ultralytics/yolo @litertjs/coreLiteRT로 내보내야 하는 이유#
LiteRT는 엣지 컴퓨팅이라고도 하는 온디바이스 추론을 위해 설계된 오픈 소스 프레임워크입니다. 개발자는 이를 통해 모바일, 임베디드 및 IoT 장치, 기존 컴퓨터에서 학습된 모델을 실행할 수 있으며, LiteRT.js를 사용하면 웹 브라우저와 Node.js에서 직접 실행할 수 있습니다.
하나의 모델 형식으로 모든 대상 지원:
- 모바일 및 임베디드: Android, iOS, 임베디드 Linux 및 마이크로컨트롤러(MCU)입니다.
- 엣지 가속기: 추가 가속을 위해 Coral Edge TPU와 호환됩니다.
- 브라우저 및 Node.js: LiteRT.js는 WebGPU/WASM 가속을 사용하여 웹에서 동일한
.tflite모델을 실행하므로, 별도의 TensorFlow.js 내보내기가 필요하지 않습니다.
LiteRT 모델의 주요 기능#
- 온디바이스 최적화: 데이터를 로컬에서 처리하여 지연 시간을 줄이고, 개인 데이터를 전송하지 않아 개인정보 보호를 강화하며, 모델 크기를 최소화하여 저장 공간을 절약합니다.
- 다중 플랫폼 지원: Android, iOS, 임베디드 Linux, 마이크로컨트롤러 및 최신 웹 브라우저에서 실행됩니다.
- 하드웨어 가속: CPU에서는 XNNPACK을 사용하고, OpenCL, Metal 및 WebGPU를 통해 GPU 가속을 활용합니다. 추가 속도 향상을 위해 GPU delegate는 기본적으로 FP16으로 실행됩니다.
- 양자화: FP32, 정적 INT8(
quantize=8, int8 가중치 + int8 활성화), 정적 INT16-activation(quantize="w8a16", int8 가중치 + 더 높은 정확도를 위한 int16 활성화), 동적 INT8(quantize="w8a32", int8 가중치 + FP32 활성화, calibration 데이터 불필요)을 지원하여 모델을 압축하고 정확도 손실을 최소화하면서 추론 속도를 높입니다. - 다양한 언어 지원: Java/Kotlin, Swift, Objective-C, C++, Python 및 JavaScript와 호환됩니다.
측정된 성능#
하드웨어: 12GB LPDDR5X 메모리와 Android 16 / API 36을 탑재한 Xiaomi 17입니다. 3nm Snapdragon 8 Elite Gen 5 (SM8850)은 8코어 Qualcomm Oryon CPU(최대 4.6GHz의 Prime 코어 2개 및 최대 3.62GHz의 Performance 코어 6개), Adreno GPU 및 Hexagon NPU를 탑재합니다.
| 모델 | 태스크 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 52.2 1.8 / 48.1 / 2.4 | 15.8 2.3 / 8.9 / 4.6 |
| YOLO26n-seg | Segment | 640 | 73.4 1.8 / 65.6 / 6.0 | 33.2 1.8 / 23.8 / 7.6 |
| YOLO26n-sem | 시맨틱 | 640 | 61.2 1.8 / 51.1 / 8.3 | 34.2 1.8 / 24.0 / 8.3 |
| YOLO26n-depth | 깊이 | 640 | 124.4 1.9 / 115.1 / 7.4 | 23.0 1.8 / 13.5 / 7.7 |
| YOLO26n-cls | 분류 | 224 | 4.4 0.4 / 4.0 / 0.0 | 3.1 0.8 / 2.1 / 0.2 |
| YOLO26n-pose | 포즈 | 640 | 57.4 1.8 / 53.8 / 1.8 | 16.6 2.7 / 10.1 / 3.9 |
| YOLO26n-obb | OBB | 640 | 50.3 1.8 / 47.2 / 1.4 | 11.7 1.8 / 7.8 / 2.0 |
- Speed 값은 단일 이미지 버스트 지연 시간입니다.
bus.jpg에서 3회의 워밍업 실행 후 15회 실행한 평균이며, Ultralytics Flutter 플러그인0.6.10와 표준화된v0.6.6자산을 사용하여 측정했습니다. 하나의 순차 스윕에서 작업 간 CPU/GPU 순서를 번갈아 적용했습니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다. - LiteRT 내보내기는 PyTorch 모델을 직접 추적하여 부동 소수점 입력을 사용하는 NCHW
.tflite을 생성합니다. GPU delegate는 전체 그래프를 컴파일하며(여기서는 7가지 작업이 모두 Adreno GPU에서 실행됨),w8a32에는 calibration 데이터가 필요하지 않습니다. 사용자는 기존 onnx2tf NHWC 레이아웃이나Identity출력 이름을 가정하지 말고 텐서 형태와 signature 이름을 읽어야 합니다. RGB 데이터는 planar CHW 형식으로 직접 패킹하거나 추론 전에 transpose해야 합니다. 시맨틱 내보내기는 NCHW logits를 반환하며 호스트 측 class argmax가 필요합니다. 공식 Android 자산은 yolo-flutter-appv0.6.6release에 호스팅되어 있으며, 자세한 벤치마크 기록은 Flutter 성능 문서에서 확인할 수 있습니다. - 해당 Snapdragon Hexagon NPU 및 LiteRT CPU/GPU 수치는 Qualcomm QNN 통합에 나와 있습니다.
- Apple CPU/가속기 결과는 CoreML 통합에서 비교할 수 있습니다.
다음 장치 스윕은 동일한 표준화 v0.6.6 자산을 사용합니다.
Google Pixel 10#
하드웨어: 12GB 메모리와 Android 16 / API 36을 탑재한 Google Pixel 10입니다. 3nm Google Tensor G5는 8코어 CPU(최대 3.78GHz의 Prime 코어 1개, 최대 3.05GHz의 Performance 코어 5개, 최대 2.25GHz의 Efficiency 코어 2개), PowerVR D-Series GPU 및 Google TPU를 탑재합니다. Google은 연결된 사양에 코어 클럭과 GPU 드라이버 이름을 공개하지 않으므로 벤치마크 장치에서 해당 정보를 확인했습니다.
| 모델 | 태스크 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 53.3 1.5 / 50.2 / 1.6 | 45.5 3.8 / 37.7 / 4.0 |
| YOLO26n-seg | Segment | 640 | 87.7 1.8 / 78.5 / 7.5 | 50.9 3.0 / 36.9 / 10.9 |
| YOLO26n-sem | 시맨틱 | 640 | 68.6 1.5 / 59.0 / 8.0 | 71.6 1.5 / 59.5 / 10.6 |
| YOLO26n-depth | 깊이 | 640 | 120.3 1.5 / 112.5 / 6.3 | 52.5 2.0 / 37.5 / 13.0 |
| YOLO26n-cls | 분류 | 224 | 4.0 0.3 / 3.4 / 0.2 | 17.6 0.9 / 16.7 / 0.1 |
| YOLO26n-pose | 포즈 | 640 | 59.7 1.5 / 57.0 / 1.2 | 46.6 3.8 / 39.2 / 3.5 |
| YOLO26n-obb | OBB | 640 | 52.0 1.5 / 48.9 / 1.7 | 45.5 4.0 / 38.5 / 2.9 |
벤치마크: bus.jpg에서 3회 워밍업 후 predict()을 15회 호출한 평균이며, ultralytics_yolo 0.6.10 및 공식 v0.6.6 자산을 사용했습니다. 하나의 순차 스윕에서 작업 간 CPU/GPU 순서를 번갈아 적용합니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다.
Samsung Galaxy S26#
하드웨어: 12GB 메모리와 Android 16 / API 36을 탑재한 Samsung Galaxy S26(SM-S942B)입니다. 2nm Exynos 2600은 10코어 Armv9.3 CPU(최대 3.8GHz의 C1-Ultra 코어 1개, 최대 3.26GHz의 performance C1-Pro 코어 3개, 최대 2.76GHz의 efficiency C1-Pro 코어 6개), Xclipse 960 GPU 및 Samsung NPU를 탑재합니다.
| 모델 | 태스크 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 36.7 1.3 / 33.8 / 1.7 | 16.4 1.4 / 12.3 / 2.6 |
| YOLO26n-seg | Segment | 640 | 54.6 1.2 / 48.0 / 5.3 | 32.8 1.3 / 24.5 / 7.0 |
| YOLO26n-sem | 시맨틱 | 640 | 47.8 1.2 / 38.4 / 8.1 | 34.2 1.3 / 24.9 / 8.0 |
| YOLO26n-depth | 깊이 | 640 | 92.9 1.2 / 84.8 / 6.9 | 33.5 1.3 / 22.4 / 9.8 |
| YOLO26n-cls | 분류 | 224 | 2.7 0.2 / 2.3 / 0.2 | 2.6 0.2 / 2.4 / 0.0 |
| YOLO26n-pose | 포즈 | 640 | 42.8 1.3 / 40.5 / 1.0 | 18.4 1.4 / 14.1 / 2.9 |
| YOLO26n-obb | OBB | 640 | 37.5 1.3 / 35.1 / 1.2 | 18.8 2.5 / 14.6 / 1.8 |
벤치마크: bus.jpg에서 3회 워밍업 후 predict()을 15회 호출한 평균이며, ultralytics_yolo 0.6.10 및 공식 v0.6.6 자산을 사용했습니다. 하나의 순차 스윕에서 작업 간 CPU/GPU 순서를 번갈아 적용합니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다.
Xiaomi 17T Pro#
하드웨어: 12GB LPDDR5X 메모리와 Android 16 / API 36을 탑재한 Xiaomi 17T Pro(2602EPTC0G)입니다. 3nm MediaTek Dimensity 9500(MT6993)은 8코어 Armv9.3 CPU(최대 4.21GHz의 C1-Ultra 코어 1개, 최대 3.5GHz의 C1-Premium 코어 3개, 최대 2.7GHz의 C1-Pro 코어 4개), Mali-G1 Ultra MC12 GPU 및 MediaTek NPU 990을 탑재합니다.
| 모델 | 태스크 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 45.4 1.3 / 42.1 / 2.0 | 26.6 1.9 / 22.0 / 2.7 |
| YOLO26n-seg | Segment | 640 | 126.2 2.6 / 113.9 / 9.7 | 46.7 2.6 / 33.3 / 10.8 |
| YOLO26n-sem | 시맨틱 | 640 | 117.9 2.6 / 98.8 / 16.5 | 74.3 2.6 / 54.7 / 17.0 |
| YOLO26n-depth | 깊이 | 640 | 182.4 2.5 / 167.6 / 12.3 | 47.8 2.5 / 32.3 / 12.9 |
| YOLO26n-cls | 분류 | 224 | 6.2 0.4 / 5.3 / 0.4 | 7.4 0.4 / 6.9 / 0.1 |
| YOLO26n-pose | 포즈 | 640 | 97.6 2.5 / 93.3 / 1.8 | 28.6 2.5 / 23.3 / 2.8 |
| YOLO26n-obb | OBB | 640 | 91.5 2.6 / 85.8 / 3.2 | 27.5 2.7 / 21.8 / 2.9 |
벤치마크: bus.jpg에서 3회 워밍업 후 predict()을 15회 호출한 평균이며, ultralytics_yolo 0.6.10 및 공식 v0.6.6 자산을 사용했습니다. 하나의 순차 스윕에서 작업 간 CPU/GPU 순서를 번갈아 적용합니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다.
지원되는 작업#
LiteRT 내보내기는 7가지 Ultralytics 작업을 모두 지원합니다. 시맨틱 세그멘테이션과 깊이 추정은 해당 헤드를 제공하는 유일한 제품군인 YOLO26에서만 사용할 수 있습니다.
LiteRT로 내보내기: YOLO 모델 변환#
모델을 LiteRT 형식으로 변환하면 온디바이스 실행 효율성을 높이고 배포 옵션을 확장할 수 있습니다.
설치#
필요한 package를 설치하려면 다음을 실행하십시오:
# Install the required package for YOLO
pip install ultralytics자세한 지침과 모범 사례는 Ultralytics 설치 가이드를 참조하십시오. 문제가 발생하면 일반적인 문제 가이드를 확인하십시오.
현재 LiteRT 내보내기는 Linux x86_64 및 macOS에서 지원됩니다. 내보낸 .tflite 모델 자체는 LiteRT가 지원하는 모든 플랫폼(모바일, 임베디드, 엣지 및 브라우저)에서 실행됩니다.
사용법#
모든 Ultralytics YOLO 모델은 별도의 설정 없이 내보내기를 지원합니다. LiteRT 형식은 내보내기, 예측 및 검증 모드를 지원하므로, 모델을 내보낸 다음 로드하여 로컬에서 추론을 실행하거나 정확도를 검증할 수 있습니다.
from ultralytics import YOLO
# Load a YOLO26 model
model = YOLO("yolo26n.pt")
# Export the model to LiteRT format
model.export(format="litert", imgsz=640) # use imgsz=224 for classificationfrom ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Dynamic INT8: int8 weights, FP32 activations - no calibration data needed
model.export(format="litert", quantize="w8a32", imgsz=640) # use imgsz=224 for classification
# Static INT8: int8 weights + int8 activations - needs calibration data
model.export(format="litert", quantize=8, data="coco8.yaml", imgsz=640) # use 224 for classification
# Static w8a16: int8 weights + int16 activations (higher accuracy) - needs calibration data
model.export(format="litert", quantize="w8a16", data="coco8.yaml", imgsz=640) # use 224 for classificationfrom ultralytics import YOLO
# Load the exported LiteRT model
model = YOLO("yolo26n.tflite")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")from ultralytics import YOLO
# Load the exported LiteRT model
model = YOLO("yolo26n.tflite")
# Validate accuracy on the COCO8 dataset
metrics = model.val(data="coco8.yaml")내보내기 인수#
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
format | str | 'litert' | 내보낸 모델의 대상 형식으로, 다양한 deployment environment와의 호환성을 정의합니다. |
imgsz | int 또는 tuple | 640 | 모델 입력에 사용할 이미지 크기입니다. 정사각형 이미지에는 정수를 사용하고, 특정 크기에는 (height, width) tuple을 사용할 수 있습니다. |
quantize | int 또는 str | None | 양자화 정밀도: 8(정적 INT8, int8 가중치 + int8 활성화; calibration data/fraction 필요), 'w8a16'(정적, int8 가중치 + int16 활성화; calibration data/fraction 필요), 'w8a32'(동적 INT8, int8 가중치 + FP32 활성화; calibration 불필요) 또는 32/설정되지 않음(FP32)입니다. FP16은 별도로 내보내지 않습니다(아래 참고 사항 참조). 더 이상 사용되지 않는 half/int8 플래그를 대체합니다. |
batch | int | 1 | 내보낼 모델의 배치 추론 크기 또는 predict 모드에서 내보낸 모델이 동시에 처리할 최대 이미지 수를 지정합니다. |
data | str | None | INT8 calibration에 사용되는 Dataset YAML이며, classification의 경우에는 dataset directory 또는 내장 dataset 이름을 사용합니다. quantize=8 또는 'w8a16'과 함께 생략하면 Ultralytics가 모델 task에 맞는 기본 calibration dataset을 선택합니다. |
device | str | None | export에 사용할 device를 지정합니다. LiteRT export는 CPU(device=cpu)에서 실행됩니다. |
레거시 tflite export와 달리 LiteRT에는 별도의 FP16 export가 필요하지 않습니다. FP32 .tflite 모델은 GPU delegate(WebGPU, OpenCL, Metal)를 사용할 때 runtime에 half precision으로 실행되며, 이는 FP16 inference를 위한 공식 LiteRT 방식입니다.
내보내기 프로세스에 대한 자세한 내용은 Ultralytics 내보내기 문서 페이지를 참조하십시오.
export된 YOLO LiteRT 모델 배포#
Ultralytics YOLO 모델을 LiteRT로 export한 후 여러 플랫폼에 배포할 수 있습니다. 로컬에서 이를 확인하는 가장 빠른 방법은 위에 설명된 YOLO("yolo26n.tflite") method입니다. 다른 환경에 배포하려면 다음 리소스를 참조하십시오:
모바일 및 임베디드#
- Android: Android 애플리케이션에 LiteRT를 통합하는 빠른 시작 가이드입니다.
- iOS: iOS 애플리케이션에서 LiteRT 모델을 통합하고 배포하는 가이드입니다.
- 임베디드 Linux 및 Raspberry Pi: single-board computer에서 LiteRT 모델을 실행하며, Coral Edge TPU를 사용해 선택적으로 가속할 수 있습니다.
- Microcontroller: 메모리가 몇 KB에 불과한 MCU에 배포할 수 있으며, 핵심 runtime은 Arm Cortex-M3에서 약 16KB에 맞습니다.
브라우저 및 Node.js(LiteRT.js)#
- LiteRT.js 개요: WebGPU/WASM 가속을 사용하여 동일한
.tflite모델을 브라우저에서 직접 실행할 수 있으므로, 서버 측 연산을 제거하고 사용자의 device에 데이터를 유지합니다. - End-to-End 예제: 모바일, edge 및 웹 전반에서 LiteRT를 구현하기 위한 실용적인 예제와 튜토리얼입니다.
요약#
이 가이드에서는 Ultralytics YOLO 모델을 LiteRT format으로 export하는 방법을 살펴보았습니다. 모바일/edge(이전의 TFLite) 및 브라우저(이전의 TF.js) 배포를 하나의 .tflite 모델로 통합함으로써 LiteRT는 YOLO 모델을 더 빠르고 작게 만들며 거의 모든 on-device target에서 이식 가능하게 합니다.
자세한 내용은 LiteRT 공식 문서를 참조하십시오.
또한 다른 Ultralytics YOLO integration이 궁금하다면 유용한 리소스가 풍부한 integration guide page를 확인해 보십시오.
FAQ#
Ultralytics library를 사용하여 YOLO 모델을 LiteRT(
.tflite)로 export합니다. 먼저 package를 설치합니다:pip install ultralytics그런 다음 모델을 export합니다:
from ultralytics import YOLO # Load a YOLO26 model model = YOLO("yolo26n.pt") # Export the model to LiteRT format model.export(format="litert", imgsz=640) # use imgsz=224 for classificationCLI 사용자의 경우:
yolo export model=yolo26n.pt format=litert imgsz=640 # use imgsz=224 for classification자세한 내용은 Ultralytics export guide를 참조하십시오.
LiteRT는 TensorFlow Lite의 새로운 이름으로, 동일한
.tflite모델 format과 동일한 runtime 계보를 유지하면서 Google이 브랜드를 변경한 것입니다. Ultralytics에서는 이제 하나의litertexport format이 이전에 별도의 두 format이 필요했던 다음 두 가지 사용 사례를 모두 지원합니다:- 이전
tfliteformat → 모바일, 임베디드 및 edge 배포입니다. - 이전
tfjsformat → 브라우저 및 Node.js 배포이며, 이제 동일한.tflite파일을 실행하는 LiteRT.js가 처리합니다.
기존
.tflite파일이 있다면YOLO("model.tflite")로 직접 로드할 수 있으며, LiteRT backend를 통해 실행됩니다.- 이전
예. 모델을 LiteRT format으로 export한 다음 Raspberry Pi에서 실행하여 inference 속도를 높일 수 있습니다. 추가 최적화를 위해 Coral Edge TPU를 고려해 보십시오. 자세한 단계는 Raspberry Pi 배포 가이드를 참조하십시오.
예. LiteRT.js는 동일하게 export된
.tflite모델을 WebGPU/WASM 가속과 함께 웹 브라우저 또는 Node.js 애플리케이션에서 직접 실행합니다. 이는 이전의 TensorFlow.js workflow를 대체하며, 별도의 브라우저 export 없이 LiteRT.js runtime으로 LiteRT 모델을 배포하면 됩니다.예. runtime에서 지원합니다. FP32 LiteRT 모델은 GPU delegate(WebGPU, OpenCL 또는 Metal)에서 실행될 때 자동으로 FP16으로 실행되며, 이것이 공식 LiteRT 방식입니다. 따라서 전용 FP16 export가 필요하지 않으며, 추가 압축을 위해서는
quantize=8을 사용한 INT8 quantization을 적용하십시오.YOLO 모델을 LiteRT로 export하는 중 오류가 발생하면 일반적인 해결 방법은 다음과 같습니다:
- 플랫폼 확인: LiteRT export는 Linux x86_64 및 macOS에서 지원됩니다. 환경이 이에 맞는지 확인하십시오.
- package 호환성 확인: 호환되는 버전의 Ultralytics를 사용하고 있는지 확인하십시오. 설치 가이드를 참조하십시오.
- Quantization 문제: INT8 quantization을 사용할 때
dataparameter에 dataset path가 올바르게 지정되어 있는지 확인하십시오.
추가 문제 해결 팁은 Common Issues guide를 참조하십시오.