엣지 및 웹 배포를 위해 YOLO 모델을 LiteRT로 내보내기#
LiteRT는 기기 내 AI를 위한 Google의 고성능 런타임입니다. 이 런타임은 차세대 제품이자 TensorFlow Lite(TFLite)의 새 이름이며, 동일한 .tflite 모델 형식을 실행합니다. LiteRT를 사용하면 내보낸 Ultralytics YOLO 모델 하나로 모바일, 임베디드, 엣지 및 브라우저에 배포할 수 있습니다. 이전에는 별도로 처리하던 tflite 및 tfjs 내보내기 형식의 모든 기능을 이제 하나의 통합 환경에서 제공합니다.
시청: Ultralytics YOLO26을 Google LiteRT로 내보내는 방법 | Android 및 iOS에 Vision AI 배포하기 | 모바일 AI 📱🚀
LiteRT 내보내기 형식은 객체 감지, 세그멘테이션, 자세 추정, 분류와 같은 작업에 맞게 모델을 최적화하여 다양한 기기에서 빠르게 오프라인으로 실행할 수 있도록 합니다.
공식 Ultralytics YOLO Flutter 플러그인은 LiteRT .tflite 내보내기를 Android에서 별도 설정 없이 실행합니다. 실시간 카메라 추론, 단일 이미지 예측, GPU 가속, Depth를 포함한 7가지 YOLO26 작업의 자동 모델 다운로드를 지원합니다. Apple 기기에는 CoreML 내보내기를 사용하고, Qualcomm Snapdragon NPU에는 Qualcomm QNN 통합을 참조하세요.
분류 모델은 imgsz=224 형식으로 내보냅니다. 감지, 세그먼트, 시맨틱, 깊이, 자세 및 OBB 모델은 imgsz=640 형식으로 내보냅니다. 이 224/640 표준은 공식 LiteRT, CoreML 및 QNN 모바일 에셋에서 공유됩니다.
공식 Ultralytics YOLO NPM 패키지는 LiteRT.js를 통해 LiteRT .tflite 내보내기를 서버나 Python 없이 브라우저에서 직접 실행합니다. 실시간 웹캠 추론, 단일 이미지 예측, WebGPU 가속(자동 CPU/WASM 대체)을 지원하며, 감지, 세그먼트, 시맨틱, 분류, 자세 및 OBB 등 6가지 YOLO26 작업을 처리합니다. WebGPU에서는 ONNX Runtime Web보다 약 ~2배 빠른 경우가 많습니다.
npm i @ultralytics/yolo @litertjs/coreLiteRT로 내보내야 하는 이유#
LiteRT는 기기 내 추론을 위해 설계된 오픈 소스 프레임워크이며, 엣지 컴퓨팅이라고도 합니다. 개발자는 이 프레임워크를 통해 학습된 모델을 모바일, 임베디드 및 IoT 기기와 기존 컴퓨터에서 실행할 수 있으며, LiteRT.js를 사용하면 웹 브라우저와 Node.js에서도 직접 실행할 수 있습니다.
하나의 모델 형식으로 모든 대상 플랫폼 지원:
- 모바일 및 임베디드: Android, iOS, 임베디드 Linux 및 마이크로컨트롤러(MCU).
- 엣지 가속기: 추가 가속을 위해 Coral Edge TPU와 호환됩니다.
- 브라우저 및 Node.js: LiteRT.js는 동일한
.tflite모델을 웹에서 WebGPU/WASM 가속으로 실행하므로 별도의 TensorFlow.js 내보내기가 필요하지 않습니다.
LiteRT 모델의 주요 기능#
- 온디바이스 최적화: 데이터를 로컬에서 처리해 지연 시간을 줄이고, 개인 데이터를 전송하지 않아 개인정보 보호를 강화하며, 공간을 절약하도록 모델 크기를 최소화합니다.
- 다중 플랫폼 지원: Android, iOS, 임베디드 Linux, 마이크로컨트롤러 및 최신 웹 브라우저에서 실행됩니다.
- 하드웨어 가속: CPU에서는 XNNPACK을 활용하고, OpenCL, Metal 및 WebGPU를 통해 GPU 가속을 제공합니다. GPU delegate는 추가 속도 향상을 위해 기본적으로 FP16으로 실행됩니다.
- 양자화: FP32, 정적 INT8 (
quantize=8, int8 가중치 + int8 활성화), 정적 INT16 활성화 (quantize="w8a16", 정확도 향상을 위한 int8 가중치 + int16 활성화), 동적 INT8 (quantize="w8a32", int8 가중치 + FP32 활성화, 보정 데이터 불필요)을 지원하여 모델을 압축하고 정확도 손실을 최소화하면서 추론 속도를 높입니다. - 다양한 언어 지원: Java/Kotlin, Swift, Objective-C, C++, Python 및 JavaScript와 호환됩니다.
측정 성능#
하드웨어: 12 GB LPDDR5X 메모리와 Android 16 / API 36을 탑재한 Xiaomi 17. 3 nm Snapdragon 8 Elite Gen 5 (SM8850)에는 8코어 Qualcomm Oryon CPU(최대 4.6 GHz의 Prime 코어 2개 및 최대 3.62 GHz의 Performance 코어 6개), Adreno GPU 및 Hexagon NPU가 탑재되어 있습니다.
| 모델 | 작업 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | 감지 | 640 | 52.2 1.8 / 48.1 / 2.4 | 15.8 2.3 / 8.9 / 4.6 |
| YOLO26n-seg | 분할 | 640 | 73.4 1.8 / 65.6 / 6.0 | 33.2 1.8 / 23.8 / 7.6 |
| YOLO26n-sem | 의미론적 | 640 | 61.2 1.8 / 51.1 / 8.3 | 34.2 1.8 / 24.0 / 8.3 |
| YOLO26n-depth | 깊이 | 640 | 124.4 1.9 / 115.1 / 7.4 | 23.0 1.8 / 13.5 / 7.7 |
| YOLO26n-cls | 분류 | 224 | 4.4 0.4 / 4.0 / 0.0 | 3.1 0.8 / 2.1 / 0.2 |
| YOLO26n-pose | 포즈 | 640 | 57.4 1.8 / 53.8 / 1.8 | 16.6 2.7 / 10.1 / 3.9 |
| YOLO26n-obb | OBB | 640 | 50.3 1.8 / 47.2 / 1.4 | 11.7 1.8 / 7.8 / 2.0 |
- 속도 값은 단일 이미지 버스트 지연 시간으로,
bus.jpg에서 3회 워밍업 실행 후 15회 실행한 평균이며, Ultralytics Flutter 플러그인0.6.10와 표준화된v0.6.6에셋을 사용해 측정했습니다. 하나의 순차 스윕에서 작업별 CPU/GPU 순서를 번갈아 적용했습니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다. - LiteRT 내보내기는 PyTorch 모델을 직접 추적하여 float 입력을 사용하는 NCHW
.tflite을 생성합니다. GPU delegate는 전체 그래프를 컴파일하며(여기서는 7개 작업 모두 Adreno GPU에서 실행됨),w8a32에는 보정 데이터가 필요하지 않습니다. 기존 onnx2tf NHWC 레이아웃이나Identity출력 이름을 가정하지 말고 텐서 shape와 시그니처 이름을 확인해야 합니다. RGB 데이터는 평면형 CHW 형식으로 바로 패킹하거나 추론 전에 전치합니다. 시맨틱 내보내기는 NCHW 로짓을 반환하므로 호스트 측에서 클래스 argmax를 수행해야 합니다. 공식 Android 에셋은 yolo-flutter-appv0.6.6릴리스에서 호스팅되며, 자세한 벤치마크 기록은 Flutter 성능 문서에서 확인할 수 있습니다. - 이에 해당하는 Snapdragon Hexagon NPU 및 LiteRT CPU/GPU 수치는 Qualcomm QNN 통합에서 확인할 수 있습니다.
- Apple CPU/가속기 결과는 CoreML 통합에서 비교해 보세요.
다음 디바이스 스윕에서는 동일한 표준화 v0.6.6 에셋을 사용합니다.
Google Pixel 10#
하드웨어: 12 GB 메모리와 Android 16 / API 36을 탑재한 Google Pixel 10. 3 nm Google Tensor G5에는 8코어 CPU(최대 3.78 GHz의 Prime 코어 1개, 최대 3.05 GHz의 Performance 코어 5개, 최대 2.25 GHz의 Efficiency 코어 2개), PowerVR D-Series GPU 및 Google TPU가 탑재되어 있습니다. Google은 링크된 사양에 코어 클록과 GPU 드라이버 이름을 공개하지 않았으므로 벤치마크 디바이스에서 확인했습니다.
| 모델 | 작업 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | 감지 | 640 | 53.3 1.5 / 50.2 / 1.6 | 45.5 3.8 / 37.7 / 4.0 |
| YOLO26n-seg | 분할 | 640 | 87.7 1.8 / 78.5 / 7.5 | 50.9 3.0 / 36.9 / 10.9 |
| YOLO26n-sem | 의미론적 | 640 | 68.6 1.5 / 59.0 / 8.0 | 71.6 1.5 / 59.5 / 10.6 |
| YOLO26n-depth | 깊이 | 640 | 120.3 1.5 / 112.5 / 6.3 | 52.5 2.0 / 37.5 / 13.0 |
| YOLO26n-cls | 분류 | 224 | 4.0 0.3 / 3.4 / 0.2 | 17.6 0.9 / 16.7 / 0.1 |
| YOLO26n-pose | 포즈 | 640 | 59.7 1.5 / 57.0 / 1.2 | 46.6 3.8 / 39.2 / 3.5 |
| YOLO26n-obb | OBB | 640 | 52.0 1.5 / 48.9 / 1.7 | 45.5 4.0 / 38.5 / 2.9 |
벤치마크: bus.jpg에서 워밍업 3회 후 predict() 호출 15회의 평균이며, ultralytics_yolo 0.6.10과 공식 v0.6.6 에셋을 사용했습니다. 하나의 순차 스윕에서 작업별 CPU/GPU 순서를 번갈아 적용합니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다.
Samsung Galaxy S26#
하드웨어: 12 GB 메모리와 Android 16 / API 36을 탑재한 Samsung Galaxy S26(SM-S942B). 2 nm Exynos 2600에는 10코어 Armv9.3 CPU(최대 3.8 GHz의 C1-Ultra 코어 1개, 최대 3.26 GHz의 C1-Pro 성능 코어 3개, 최대 2.76 GHz의 C1-Pro 효율 코어 6개), Xclipse 960 GPU 및 Samsung NPU가 탑재되어 있습니다.
| 모델 | 작업 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | 감지 | 640 | 36.7 1.3 / 33.8 / 1.7 | 16.4 1.4 / 12.3 / 2.6 |
| YOLO26n-seg | 분할 | 640 | 54.6 1.2 / 48.0 / 5.3 | 32.8 1.3 / 24.5 / 7.0 |
| YOLO26n-sem | 의미론적 | 640 | 47.8 1.2 / 38.4 / 8.1 | 34.2 1.3 / 24.9 / 8.0 |
| YOLO26n-depth | 깊이 | 640 | 92.9 1.2 / 84.8 / 6.9 | 33.5 1.3 / 22.4 / 9.8 |
| YOLO26n-cls | 분류 | 224 | 2.7 0.2 / 2.3 / 0.2 | 2.6 0.2 / 2.4 / 0.0 |
| YOLO26n-pose | 포즈 | 640 | 42.8 1.3 / 40.5 / 1.0 | 18.4 1.4 / 14.1 / 2.9 |
| YOLO26n-obb | OBB | 640 | 37.5 1.3 / 35.1 / 1.2 | 18.8 2.5 / 14.6 / 1.8 |
벤치마크: bus.jpg에서 워밍업 3회 후 predict() 호출 15회의 평균이며, ultralytics_yolo 0.6.10과 공식 v0.6.6 에셋을 사용했습니다. 하나의 순차 스윕에서 작업별 CPU/GPU 순서를 번갈아 적용합니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다.
Xiaomi 17T Pro#
하드웨어: 12 GB LPDDR5X 메모리와 Android 16 / API 36을 탑재한 Xiaomi 17T Pro(2602EPTC0G). 3 nm MediaTek Dimensity 9500(MT6993)에는 8코어 Armv9.3 CPU(최대 4.21 GHz의 C1-Ultra 코어 1개, 최대 3.5 GHz의 C1-Premium 코어 3개, 최대 2.7 GHz의 C1-Pro 코어 4개), Mali-G1 Ultra MC12 GPU 및 MediaTek NPU 990이 탑재되어 있습니다.
| 모델 | 작업 | 크기 (픽셀) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | 감지 | 640 | 45.4 1.3 / 42.1 / 2.0 | 26.6 1.9 / 22.0 / 2.7 |
| YOLO26n-seg | 분할 | 640 | 126.2 2.6 / 113.9 / 9.7 | 46.7 2.6 / 33.3 / 10.8 |
| YOLO26n-sem | 의미론적 | 640 | 117.9 2.6 / 98.8 / 16.5 | 74.3 2.6 / 54.7 / 17.0 |
| YOLO26n-depth | 깊이 | 640 | 182.4 2.5 / 167.6 / 12.3 | 47.8 2.5 / 32.3 / 12.9 |
| YOLO26n-cls | 분류 | 224 | 6.2 0.4 / 5.3 / 0.4 | 7.4 0.4 / 6.9 / 0.1 |
| YOLO26n-pose | 포즈 | 640 | 97.6 2.5 / 93.3 / 1.8 | 28.6 2.5 / 23.3 / 2.8 |
| YOLO26n-obb | OBB | 640 | 91.5 2.6 / 85.8 / 3.2 | 27.5 2.7 / 21.8 / 2.9 |
벤치마크: bus.jpg에서 워밍업 3회 후 predict() 호출 15회의 평균이며, ultralytics_yolo 0.6.10과 공식 v0.6.6 에셋을 사용했습니다. 하나의 순차 스윕에서 작업별 CPU/GPU 순서를 번갈아 적용합니다. 네이티브 로그를 통해 모든 CPU 행이 LiteRT CPU/XNNPACK을 사용하고 모든 GPU 행이 전체 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했음을 확인했습니다.
지원 작업#
LiteRT 내보내기는 Ultralytics의 7개 작업을 모두 지원합니다. 시맨틱 분할과 깊이 추정은 해당 헤드가 포함된 유일한 제품군인 YOLO26에서만 사용할 수 있습니다.
LiteRT로 내보내기: YOLO 모델 변환#
모델을 LiteRT 형식으로 변환하면 온디바이스 실행 효율을 높이고 배포 옵션을 확장할 수 있습니다.
설치#
필수 패키지를 설치하려면 다음을 실행하세요:
# Install the required package for YOLO
pip install ultralytics자세한 안내와 모범 사례는 Ultralytics 설치 가이드를 확인하세요. 문제가 발생하면 일반적인 문제 가이드를 참조하세요.
현재 LiteRT 내보내기는 Linux x86_64 및 macOS에서 지원됩니다. 내보낸 .tflite 모델 자체는 LiteRT가 지원하는 모든 플랫폼(모바일, 임베디드, 엣지 및 브라우저)에서 실행됩니다.
사용법#
모든 Ultralytics YOLO 모델은 기본적으로 내보내기를 지원합니다. LiteRT 형식은 내보내기, 예측 및 검증 모드를 지원하므로 모델을 내보낸 다음 로드하여 추론을 실행하거나 로컬에서 정확도를 검증할 수 있습니다.
from ultralytics import YOLO
# YOLO26 모델 로드
model = YOLO("yolo26n.pt")
# 모델을 LiteRT 형식으로 내보내기
model.export(format="litert", imgsz=640) # 'yolo26n.tflite' 생성; 분류에는 imgsz=224 사용from ultralytics import YOLO
model = YOLO("yolo26n.pt")
# 동적 INT8: int8 가중치, FP32 활성화 - 보정 데이터 불필요
model.export(format="litert", quantize="w8a32", imgsz=640) # 'yolo26n_w8a32.tflite' 생성
# 정적 INT8: int8 가중치 + int8 활성화 - 보정 데이터 필요
model.export(format="litert", quantize=8, data="coco8.yaml", imgsz=640) # 'yolo26n_int8.tflite' 생성
# 정적 w8a16: int8 가중치 + int16 활성화(정확도 향상) - 보정 데이터 필요
model.export(format="litert", quantize="w8a16", data="coco8.yaml", imgsz=640) # 'yolo26n_w8a16.tflite' 생성from ultralytics import YOLO
# 내보낸 LiteRT 모델 로드
model = YOLO("yolo26n.tflite")
# 추론 실행
results = model("https://ultralytics.com/images/bus.jpg")from ultralytics import YOLO
# 내보낸 LiteRT 모델 로드
model = YOLO("yolo26n.tflite")
# COCO8 데이터셋에서 정확도 검증
metrics = model.val(data="coco8.yaml")내보내기 인수#
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
format | str | 'litert' | 내보낸 모델의 대상 형식으로, 다양한 배포 환경과의 호환성을 정의합니다. |
imgsz | int 또는 tuple | 640 | 모델 입력에 사용할 이미지 크기입니다. 정사각형 이미지에는 정수를 사용하고, 특정 크기에는 튜플 (height, width)을 사용할 수 있습니다. |
quantize | int 또는 str | None | 양자화 정밀도: 8 (정적 INT8, int8 가중치 + int8 활성화; 보정 data/fraction 필요), 'w8a16' (정적, int8 가중치 + int16 활성화; 보정 data/fraction 필요), 'w8a32' (동적 INT8, int8 가중치 + FP32 활성화; 보정 불필요), 또는 32/미설정(FP32)입니다. FP16은 별도로 내보내지 않습니다(아래 참고). 더 이상 사용되지 않는 half/int8 플래그를 대체합니다. |
batch | int | 1 | 내보내기 모델의 배치 추론 크기 또는 predict 모드에서 내보낸 모델이 동시에 처리할 최대 이미지 수를 지정합니다. |
data | str | None | INT8 보정에 사용되는 데이터셋 YAML입니다. 분류 작업에는 데이터셋 디렉터리 또는 기본 제공 데이터셋 이름을 사용합니다. quantize=8 또는 'w8a16'을 사용하는 경우 이를 생략하면 Ultralytics가 해당 모델 작업에 맞는 기본 보정 데이터셋을 선택합니다. |
fraction | float, int 또는 list | 1.0 | 비율, 이미지 수 또는 [train, val, test] 비율/개수로 지정하는 보정 하위 집합입니다. 항목이 두 개인 목록에서는 test이 전체로 설정되고, 0는 건너뜁니다. |
device | str | None | 내보내기에 사용할 디바이스를 지정합니다. LiteRT 내보내기는 CPU에서 실행됩니다(device=cpu). |
기존 tflite 내보내기와 달리 LiteRT에는 별도의 FP16 내보내기가 필요하지 않습니다. GPU delegate(WebGPU, OpenCL, Metal)를 사용하면 FP32 .tflite 모델이 런타임에 반정밀도로 실행됩니다. 이것이 FP16 추론을 위한 공식 LiteRT 방식입니다.
내보내기 프로세스에 관한 자세한 내용은 내보내기에 관한 Ultralytics 문서 페이지를 참조하세요.
내보낸 YOLO LiteRT 모델 배포#
Ultralytics YOLO 모델을 LiteRT로 내보낸 후 여러 플랫폼에 배포할 수 있습니다. 로컬에서 빠르게 확인하려면 위에 표시된 YOLO("yolo26n.tflite") 방식을 사용하세요. 다른 환경에 배포하려면 다음 자료를 참조하세요.
모바일 및 임베디드#
- Android: Android 애플리케이션에 LiteRT를 통합하는 빠른 시작 가이드입니다.
- iOS: iOS 애플리케이션에 LiteRT 모델을 통합하고 배포하는 가이드입니다.
- 임베디드 Linux 및 Raspberry Pi: 단일 보드 컴퓨터에서 LiteRT 모델을 실행하고, 선택적으로 Coral Edge TPU로 가속할 수 있습니다.
- 마이크로컨트롤러: 메모리가 몇 킬로바이트에 불과한 MCU에 배포합니다. 핵심 런타임은 Arm Cortex-M3에서 약 16KB를 차지합니다.
브라우저 및 Node.js (LiteRT.js)#
- LiteRT.js 개요: 동일한
.tflite모델을 WebGPU/WASM 가속을 사용해 브라우저에서 직접 실행하여 서버 측 연산을 없애고 데이터를 사용자의 기기에 보관합니다. - 엔드 투 엔드 예제: 모바일, 엣지, 웹 전반에 LiteRT를 구현하는 실용적인 예제와 튜토리얼입니다.
요약#
이 가이드에서는 Ultralytics YOLO 모델을 LiteRT 형식으로 내보내는 방법을 살펴보았습니다. 이전의 모바일/엣지(TFLite)와 브라우저(TF.js) 배포를 단일 .tflite 모델로 통합함으로써, LiteRT는 YOLO 모델을 더 빠르고 작게 만들며 거의 모든 온디바이스 대상에서 이식 가능하도록 합니다.
자세한 내용은 LiteRT 공식 문서를 참조하세요.
또한 다른 Ultralytics YOLO 통합에 관심이 있다면 유용한 자료가 풍부한 통합 가이드 페이지를 확인하세요.
자주 묻는 질문#
Ultralytics 라이브러리를 사용해 YOLO 모델을 LiteRT(
.tflite)로 내보냅니다. 먼저 패키지를 설치합니다.pip install ultralytics그런 다음 모델을 내보냅니다.
from ultralytics import YOLO # YOLO26 모델 로드 model = YOLO("yolo26n.pt") # 모델을 LiteRT 형식으로 내보내기 model.export(format="litert", imgsz=640) # 분류에는 imgsz=224 사용CLI 사용자의 경우:
yolo export model=yolo26n.pt format=litert imgsz=640 # use imgsz=224 for classification자세한 내용은 Ultralytics 내보내기 가이드를 참조하세요.
LiteRT는 TensorFlow Lite의 새 이름으로, 동일한
.tflite모델 형식과 동일한 런타임 계보를 유지하며 Google이 브랜드를 변경한 것입니다. Ultralytics에서는 이제 단일litert내보내기 형식으로 이전에 별도의 두 형식이 필요했던 다음 두 가지 사용 사례를 모두 지원합니다.- 이전
tflite형식 → 모바일, 임베디드 및 엣지 배포입니다. - 이전
tfjs형식 → 브라우저 및 Node.js 배포입니다. 이제 동일한.tflite파일을 사용하는 LiteRT.js가 이를 처리합니다.
기존
.tflite파일이 있다면YOLO("model.tflite")로 직접 로드할 수 있으며, LiteRT 백엔드에서 실행됩니다.- 이전
예. 모델을 LiteRT 형식으로 내보낸 다음 Raspberry Pi에서 실행하면 추론 속도를 높일 수 있습니다. 추가로 최적화하려면 Coral Edge TPU를 고려하세요. 자세한 단계는 Raspberry Pi 배포 가이드를 참조하세요.
예. LiteRT.js는 내보낸 동일한
.tflite모델을 WebGPU/WASM 가속으로 웹 브라우저 또는 Node.js 애플리케이션에서 직접 실행합니다. 이를 통해 기존 TensorFlow.js 워크플로를 대체합니다. 별도의 브라우저 내보내기는 필요 없으며 LiteRT.js 런타임으로 LiteRT 모델을 배포하기만 하면 됩니다.예. 런타임에서 지원합니다. FP32 LiteRT 모델은 GPU delegate(WebGPU, OpenCL 또는 Metal)에서 실행될 때 자동으로 FP16으로 실행되며, 이것이 공식 LiteRT 접근 방식입니다. 따라서 별도의 FP16 내보내기는 필요하지 않습니다. 추가로 압축하려면
quantize=8을 사용해 INT8 양자화를 적용하세요.YOLO 모델을 LiteRT로 내보내는 중 오류가 발생하면 다음과 같은 일반적인 해결 방법을 시도해 보세요.
- 플랫폼 확인: LiteRT 내보내기는 Linux x86_64 및 macOS에서 지원됩니다. 환경이 이에 부합하는지 확인하세요.
- 패키지 호환성 확인: 호환되는 버전의 Ultralytics를 사용하고 있는지 확인하세요. 설치 가이드를 참조하세요.
- 양자화 문제: INT8 양자화를 사용할 때는
data매개변수에 데이터셋 경로가 올바르게 지정되어 있는지 확인하세요.
추가 문제 해결 팁은 일반적인 문제 가이드를 참조하세요.