YOLO Vision 2026:

배포를 위한 TFLite 모델 내보내기 (지원 중단)#

사용 중단됨 — LiteRT로 대체되었습니다.

Ultralytics 8.4.83 버전부터 독립형 tflite 내보내기 형식은 제거되었으며 통합형 Google LiteRT 형식으로 대체되었습니다. LiteRT(Lite Runtime)는 TensorFlow Lite의 차세대 버전이자 새로운 이름이며, 모바일, 임베디드, 엣지, 브라우저 배포를 하나의 형식으로 커버하는 동일한 .tflite 모델을 내보냅니다.

format="tflite" 명령어는 여전히 작동하지만 지원 중단(deprecation) 경고를 발생시키며 대신 LiteRT 모델을 내보냅니다. 앞으로는 **format="litert"**를 사용하시기 바랍니다. 최신 내보내기 지침 및 옵션은 **LiteRT export guide**를 참고하세요.

TensorFlow Lite edge deployment framework

엣지 디바이스나 임베디드 디바이스에 컴퓨터 비전 모델을 배포하려면 원활한 성능을 보장할 수 있는 형식이 필요합니다.

기존 TensorFlow Lite 또는 TFLite 내보내기 형식은 엣지 애플리케이션의 object detectionimage classification 같은 태스크에 Ultralytics YOLO26 모델을 최적화했습니다. 이 가이드는 레거시 TFLite 배포 컨텍스트를 유지하며, 신규 내보내기의 경우 LiteRT를 사용하세요.

TFLite가 내보내기에 사용된 이유는 무엇입니까?#

2017년 5월 Google이 TensorFlow 프레임워크의 일부로 소개한 TensorFlow Lite(줄여서 TFLite)는 엣지 컴퓨팅이라고도 하는 온디바이스 추론을 위해 설계된 오픈소스 딥러닝 프레임워크입니다. 이를 통해 개발자는 모바일, 임베디드, IoT 디바이스뿐만 아니라 전통적인 컴퓨터에서도 학습된 모델을 실행할 수 있는 도구를 얻게 되었습니다.

TensorFlow Lite는 임베디드 Linux, Android, iOS 및 마이크로컨트롤러(MCU)를 포함한 다양한 플랫폼을 지원했습니다. TFLite 내보내기를 통해 애플리케이션은 로컬 및 오프라인에서 모델을 실행할 수 있었습니다.

TFLite 모델의 주요 기능#

TFLite 모델은 개발자가 모바일, 임베디드 및 엣지 디바이스에서 모델을 실행할 수 있도록 지원하여 온디바이스 머신러닝을 구현하는 다양한 핵심 기능을 제공합니다.

  • 온디바이스 최적화: TFLite는 온디바이스 ML에 최적화되어 데이터를 로컬에서 처리함으로써 지연 시간을 줄이고, 개인 데이터를 전송하지 않아 개인정보 보호를 강화하며, 모델 크기를 최소화하여 공간을 절약합니다.

  • 다중 플랫폼 지원: TFLite는 Android, iOS, 임베디드 Linux 및 마이크로컨트롤러를 지원하여 광범위한 플랫폼 호환성을 제공합니다.

  • 다양한 언어 지원: TFLite는 Java, Swift, Objective-C, C++, Python 등 다양한 프로그래밍 언어와 호환됩니다.

  • 고성능: 하드웨어 가속과 모델 최적화를 통해 뛰어난 성능을 달성합니다.

측정된 성능 (과거 기록)#

마이그레이션 전후 기록 고정

이 결과는 12 GB LPDDR5X 메모리가 탑재된 Xiaomi 17에서 Ultralytics Flutter 플러그인 0.6.8과 LiteRT 2.1.5을 사용하여 Android 16/API 36 환경에서 기록되었습니다. 3 nm Snapdragon 8 Elite Gen 5 (SM8850) 프로세서는 8코어 Qualcomm Oryon CPU(최대 4.6 GHz의 Prime 코어 2개 및 최대 3.62 GHz의 Performance 코어 6개), Adreno GPU, 그리고 Hexagon NPU를 탑재하고 있습니다. 이 표들은 마이그레이션 중에 평가된 후보 litert-torch 내보내기와 레거시 onnx2tf INT8 TFLite 에셋을 비교합니다. 릴리스 에셋은 이후 표준화된 내보내기로 덮어씌워졌으므로, 이 수치들은 현재의 v0.6.6 에셋 바이트를 설명하지 않습니다. 현재 측정값은 LiteRT performance tables를 참고하세요.

두 형식 모두 표시된 입력 크기에서 동일한 연속 GPU 스윕으로 실행되었습니다. 각 셀은 전체 시간(전처리 + 추론 + 후처리)을 나타내며 각 단계별 분할이 그 아래에 표시됩니다. 네이티브 로그에 따르면 두 형식 모두 Adreno GPU에서 완전한 그래프를 LiteRT OpenCL(LITERT_CL)에 위임했습니다.

모델작업크기
(픽셀)
레거시
onnx2tf INT8 TFLite
(ms)
후보
w8a32 LiteRT
(ms)
YOLO26n탐지(Detect)64014.0
1.8 / 8.1 / 4.2
13.5
1.9 / 8.1 / 3.5
YOLO26n-seg세그멘테이션(Segment)64030.1
1.9 / 20.3 / 8.0
28.6
1.8 / 20.1 / 6.7
YOLO26n-sem의미론적(Semantic)64026.4
1.9 / 16.4 / 8.1
32.9
1.8 / 23.0 / 8.2
YOLO26n-cls분류(Classify)2243.5
0.9 / 2.2 / 0.4
3.2
1.0 / 2.2 / 0.1
YOLO26n-pose포즈(Pose)64017.4
2.4 / 9.9 / 5.1
14.0
1.9 / 9.3 / 2.8
YOLO26n-obbOBB(방향성 경계 상자)64013.9
3.0 / 8.3 / 2.7
13.0
2.9 / 7.9 / 2.3

동일한 마이그레이션 실행에서 YOLO26n 탐지 양자화 형식도 비교했습니다. 추론은 비교 가능한 형식 종속 메트릭입니다.

Android 형식GPU 추론 (ms)GPU 컴파일 여부
onnx2tf INT8 (레거시 TFLite)8.6
LiteRT w8a32(후보)8.4
LiteRT INT8 (quantize=8)11.0
LiteRT FP328.8
LiteRT w8a16 (quantize="w8a16")CPU 폴백아니오

이 실행에서 w8a16은 GPU 형식의 약 17 ms에 비해 총 약 660 ms로 CPU로 폴백(fallback)되었습니다. 이러한 결과로 w8a32을 배포하게 되었으나, 델리게이트(delegate) 호환성과 성능은 디바이스 및 런타임 버전에 따라 다릅니다. 대상 디바이스를 벤치마크하고 런타임 로그에서 가속기 배치를 확인하십시오.

TFLite의 배포 옵션#

LiteRT 대체 내보내기 예제를 살펴보기 전에 TFLite 모델이 일반적으로 어떻게 사용되는지 알아보겠습니다.

TFLite는 머신러닝 모델을 위한 다음과 같은 다양한 온디바이스 배포 옵션을 제공합니다.

  • Android 및 iOS로 배포: TFLite를 사용하는 Android 및 iOS 애플리케이션 모두 엣지 기반 카메라 피드와 센서를 분석하여 객체를 감지하고 식별할 수 있습니다. TFLite는 또한 SwiftObjective-C로 작성된 네이티브 iOS 라이브러리를 제공합니다. 아래 아키텍처 다이어그램은 TensorFlow Lite를 사용하여 학습된 모델을 Android 및 iOS 플랫폼에 배포하는 과정을 보여줍니다.

TensorFlow Lite deployment architecture for mobile

  • 임베디드 Linux로 구현하기: Raspberry Pi에서 Ultralytics Guide를 사용하여 추론을 실행할 때 사용 사례의 속도 요구사항을 충족하지 못하는 경우, 내보낸 TFLite 모델을 사용하여 추론 속도를 가속할 수 있습니다. 또한 Coral Edge TPU device를 활용하여 성능을 더욱 향상시키는 것도 가능합니다.

  • 마이크로컨트롤러 배포: TFLite 모델은 단 몇 KB의 메모리만 있는 마이크로컨트롤러 및 기타 디바이스에도 배포할 수 있습니다. 핵심 런타임은 Arm Cortex M3에서 16 KB 공간만 차지하며 많은 기본 모델을 실행할 수 있습니다. 운영 체제 지원이나 표준 C 또는 C++ 라이브러리, 동적 메모리 할당이 필요하지 않습니다.

TFLite 내보내기를 LiteRT로 대체#

새로운 내보내기의 경우 모델을 LiteRT로 변환하십시오. 결과 모델은 .tflite 파일 확장자를 유지합니다.

설치#

필수 패키지를 설치하려면 다음을 실행하십시오:

설치
# Install the required package for YOLO26
pip install ultralytics

설치 과정과 관련된 자세한 지침과 모범 사례는 Ultralytics Installation guide를 확인하세요. YOLO26에 필요한 패키지를 설치하는 동안 문제가 발생하면 Common Issues guide에서 해결 방법과 팁을 참고하세요.

사용법#

모든 Ultralytics YOLO26 모델은 기본적으로 내보내기를 지원하도록 설계되어 선호하는 배포 워크플로에 쉽게 통합할 수 있습니다. 지원되는 내보내기 형식 및 구성 옵션 전체 목록 보기를 통해 애플리케이션에 가장 적합한 설정을 선택할 수 있습니다.

대체된 LiteRT 형식은 Export, Predict, Validate 모드를 지원합니다. 모델을 내보낸 다음 내보낸 .tflite 모델을 로드하여 추론을 실행하거나 정확도를 검증하십시오.

내보내기(Export)
from ultralytics import YOLO

# Load a YOLO26 model
model = YOLO("yolo26n.pt")

# Export the model to LiteRT format
model.export(format="litert", imgsz=640)  # use imgsz=224 for classification
추론(Predict)
from ultralytics import YOLO

# Load the exported TFLite model
model = YOLO("yolo26n.tflite")

# Run inference
results = model("https://ultralytics.com/images/bus.jpg")
검증
from ultralytics import YOLO

# Load the exported TFLite model
model = YOLO("yolo26n.tflite")

# Validate accuracy on the COCO8 dataset
metrics = model.val(data="coco8.yaml")

내보내기 인수#

인수유형기본값설명
formatstr'litert'내보낸 모델의 대상 형식이며, 다양한 배포 환경과의 호환성을 정의합니다.
imgszint 또는 tuple640모델 입력에 사용할 원하는 이미지 크기입니다. 정방형 이미지의 경우 정수일 수 있으며, 특정 치수의 경우 튜플 (height, width)일 수 있습니다.
quantizeint 또는 strNone양자화 정밀도: 8(정적 INT8, int8 가중치 + int8 활성화 값; 보정 필요 data/fraction), 'w8a16'(정적, int8 가중치 + int16 활성화 값; 보정 필요 data/fraction), 'w8a32'(동적 INT8, int8 가중치 + FP32 활성화 값; 보정 불필요), 또는 32/미설정(FP32). FP16은 별도로 내보내지지 않으며, FP32 모델은 GPU 델리게이트에서 자동으로 FP16으로 실행됩니다. 더 이상 사용되지 않는 half/int8 플래그를 대체합니다.
batchint1내보낸 모델의 배치 추론 크기 또는 predict 모드에서 내보낸 모델이 동시에 처리할 최대 이미지 수를 지정합니다.
datastrNonedataset YAML의 경로로 양자화에 필수적이며, 분류의 경우 데이터셋 디렉토리 또는 내장 데이터셋 이름을 대신 사용합니다. quantize=8 또는 'w8a16'에서 생략할 경우, Ultralytics는 모델 태스크에 맞는 기본 캘리브레이션 데이터셋을 선택합니다.
fractionfloat1.0INT8 양자화 보정에 사용할 데이터셋의 비율을 지정합니다. 전체 데이터셋의 하위 집합으로 보정할 수 있게 하여 실험이나 리소스가 제한된 경우에 유용합니다. INT8을 활성화하고 지정하지 않으면 전체 데이터셋이 사용됩니다.
devicestrNone내보내기용 디바이스를 지정합니다: CPU (device=cpu), Apple 실리콘용 MPS (device=mps).

내보내기 프로세스에 대한 자세한 내용은 내보내기에 관한 Ultralytics 문서 페이지를 방문하세요.

내보낸 YOLO26 TFLite 모델 배포#

Ultralytics YOLO26 모델을 LiteRT 형식으로 내보낸 후, 결과로 나온 .tflite 모델을 배포할 수 있습니다. TFLite 모델을 실행하기 위한 기본이자 권장되는 첫 번째 단계는 이전 사용법 코드 스니펫에 설명된 대로 YOLO("model.tflite") 메서드를 사용하는 것입니다. 그러나 다양한 다른 설정에서 TFLite 모델을 배포하는 방법에 대한 자세한 지침은 다음 리소스를 살펴보십시오.

  • Android: TensorFlow Lite를 Android 애플리케이션에 통합하기 위한 빠른 시작 가이드로, 머신러닝 모델을 설정하고 실행하기 위한 따라하기 쉬운 단계를 제공합니다.

  • iOS: iOS 애플리케이션에서 TensorFlow Lite 모델을 통합하고 배포하는 방법에 대한 개발자용 상세 가이드를 확인하여 단계별 지침과 리소스를 확인하십시오.

  • 엔드투엔드 예제: 이 페이지는 다양한 TensorFlow Lite 예제에 대한 개요를 제공하며, 개발자가 모바일 및 엣지 디바이스의 머신러닝 프로젝트에 TensorFlow Lite를 구현할 수 있도록 설계된 실용적인 애플리케이션과 튜토리얼을 선보입니다.

요약#

본 가이드는 레거시 TFLite 배포 워크플로를 보존합니다. 새로운 내보내기의 경우 LiteRT를 사용하여 엣지 컴퓨팅 환경용 .tflite 모델을 만드십시오.

사용법에 대한 자세한 내용은 TFLite 공식 문서를 방문하십시오.

또한 다른 Ultralytics YOLO26 통합에 관심이 있으신 경우 당사의 통합 가이드 페이지를 확인하십시오. 거기서 유용한 정보와 통찰력을 많이 찾으실 수 있습니다.

FAQ#

TFLite 내보내기를 LiteRT로 어떻게 교체합니까?#

새로운 내보내기를 위해서는 LiteRT 형식을 사용하십시오. 먼저 다음을 사용하여 필수 패키지를 설치하십시오:

pip install ultralytics

그런 다음, 다음 코드 스니펫을 사용하여 모델을 내보내십시오:

from ultralytics import YOLO

# Load a YOLO26 model
model = YOLO("yolo26n.pt")

# Export the model to LiteRT format
model.export(format="litert", imgsz=640)  # use imgsz=224 for classification

CLI 사용자의 경우 다음을 통해 수행할 수 있습니다:

yolo export model=yolo26n.pt format=litert imgsz=640 # use imgsz=224 for classification

자세한 내용은 Ultralytics 내보내기 가이드를 방문하세요.

YOLO26 모델 배포에 TensorFlow Lite를 사용하면 어떤 이점이 있나요?#

TensorFlow Lite(TFLite)는 온디바이스 추론을 위해 설계된 오픈소스 딥러닝 프레임워크로, 모바일, 임베디드, IoT 디바이스에 YOLO26 모델을 배포하는 데 이상적입니다. 주요 이점은 다음과 같습니다:

  • 온디바이스 최적화: 데이터를 로컬에서 처리하여 지연 시간을 최소화하고 개인정보 보호를 강화합니다.
  • 플랫폼 호환성: Android, iOS, 임베디드 Linux 및 MCU를 지원합니다.
  • 성능: 하드웨어 가속을 활용하여 모델의 속도와 효율성을 최적화합니다.

자세히 알아보려면 TFLite 가이드를 확인하십시오.

Raspberry Pi에서 YOLO26 TFLite 모델을 실행할 수 있나요?#

예, Raspberry Pi에서 YOLO26 TFLite 모델을 실행하여 추론 속도를 향상할 수 있습니다. 먼저 위에서 설명한 대로 모델을 LiteRT 형식으로 내보내십시오. 그런 다음 TensorFlow Lite Interpreter와 같은 도구를 사용하여 Raspberry Pi에서 모델을 실행하십시오.

추가 최적화를 위해 Coral Edge TPU 사용을 고려할 수 있습니다. 자세한 단계는 Raspberry Pi 배포 가이드Edge TPU 통합 가이드를 참조하십시오.

YOLO26 예측을 위해 마이크로컨트롤러에서 TFLite 모델을 사용할 수 있나요?#

네, TFLite는 리소스가 제한된 마이크로컨트롤러에서의 배포를 지원합니다. TFLite의 핵심 런타임은 Arm Cortex M3에서 16 KB의 메모리만 필요로 하며 기본적인 YOLO26 모델을 실행할 수 있습니다. 이로 인해 최소한의 컴퓨팅 성능과 메모리를 갖춘 디바이스에 배포하는 데 적합합니다.

시작하려면 TFLite Micro 마이크로컨트롤러 가이드를 방문하십시오.

TFLite로 내보낸 YOLO26 모델과 호환되는 플랫폼은 무엇인가요?#

TensorFlow Lite는 광범위한 플랫폼 호환성을 제공하여 다음과 같은 다양한 디바이스에 YOLO26 모델을 배포할 수 있도록 합니다:

  • Android 및 iOS: TFLite Android 및 iOS 라이브러리를 통한 네이티브 지원.
  • 임베디드 Linux: Raspberry Pi와 같은 싱글 보드 컴퓨터에 이상적.
  • 마이크로컨트롤러: 리소스가 제한된 MCU에 적합.

배포 옵션에 대한 자세한 정보는 상세 배포 가이드를 참조하십시오.

YOLO26 모델을 LiteRT로 내보내는 동안 발생하는 일반적인 문제를 어떻게 해결합니까?#

YOLO26 모델을 LiteRT로 내보내는 중에 오류가 발생하면 일반적인 해결 방법은 다음과 같습니다:

  • 패키지 호환성 확인: Ultralytics, litert-torch, ai-edge-litert의 호환 버전을 사용하고 있는지 확인하십시오. 설치 가이드를 참조하십시오.
  • 모델 지원: 특정 YOLO26 모델이 LiteRT 내보내기를 지원하는지 Ultralytics 내보내기 문서 페이지를 확인하여 검증하십시오.
  • 양자화 문제: INT8 양자화를 사용할 때 data 파라미터에 데이터셋 경로가 올바르게 지정되었는지 확인하세요.

추가적인 문제 해결 팁은 일반적인 문제 가이드를 방문하세요.

댓글