用于部署的 TFLite 模型导出(已弃用)#
自 Ultralytics 8.4.83 起,独立的 tflite 导出格式已被移除,并由统一的 Google LiteRT 格式取代。LiteRT(Lite Runtime)是 TensorFlow Lite 的下一代产品和新名称,它导出相同的 .tflite 模型——现在将移动端、嵌入式、边缘端和浏览器部署统一整合在一个格式中。
format="tflite" 仍然可用,但会发出弃用警告并改为导出 LiteRT 模型。建议今后使用 format="litert";有关当前的导出说明和选项,请参阅 LiteRT 导出指南。
在边缘设备或嵌入式设备上部署 计算机视觉 模型需要能够确保无缝性能的格式。
以往的 TensorFlow Lite 或 TFLite 导出格式针对边缘应用中的 目标检测 和 图像分类 等任务对 Ultralytics YOLO26 模型进行了优化。本指南保留了旧版 TFLite 部署上下文;对于新的导出,请使用 LiteRT。
为什么过去使用 TFLite 进行导出?#
由 Google 于 2017 年 5 月在其 TensorFlow 框架中推出的 TensorFlow Lite(简称 TFLite)是一个开源深度学习框架,专为端侧推理(也称为 边缘计算)而设计。它为开发者提供了在移动设备、嵌入式设备、物联网设备以及传统计算机上执行训练后模型的工具。
TensorFlow Lite 支持多种平台,包括嵌入式 Linux、Android、iOS 和微控制器 (MCU)。通过 TFLite 导出,应用程序可以在本地和离线状态下运行模型。
TFLite 模型的主要特性#
TFLite 模型提供了广泛的关键特性,通过帮助开发者在移动、嵌入式和边缘设备上运行模型,从而实现设备端机器学习:
-
设备端优化:TFLite 针对设备端 ML 进行了优化,通过本地处理数据来减少延迟,通过不传输个人数据来增强隐私,并最小化模型大小以节省空间。
-
多平台支持:TFLite 提供广泛的平台兼容性,支持 Android、iOS、嵌入式 Linux 和微控制器。
-
多样化的语言支持:TFLite 与多种编程语言兼容,包括 Java、Swift、Objective-C、C++ 和 Python。
-
高性能:通过硬件加速和模型优化实现卓越的性能。
性能实测(历史数据)#
这些结果是在搭载 12 GB LPDDR5X 内存的 Xiaomi 17 上使用 Android 16/API 36 的 Ultralytics Flutter 插件 0.6.8 和 LiteRT 2.1.5 录制的。其 3 nm Snapdragon 8 Elite Gen 5(SM8850)拥有一个 8 核 Qualcomm Oryon CPU(2 个最高 4.6 GHz 的超大核和 6 个最高 3.62 GHz 的性能核)、Adreno GPU 和 Hexagon NPU。这些表格将迁移过程中评估的旧版 onnx2tf INT8 TFLite 资产与候选 litert-torch 导出进行了比较。发布资产随后被标准化导出覆盖,因此这些数字并不描述当前的 v0.6.6 资产字节。有关当前的测量结果,请参阅 LiteRT 性能表格。
这两种格式在所示输入尺寸下以相同的背靠背 GPU 扫描运行。每个单元格是总时间(预处理 + 推理 + 后处理),其下方附有各阶段的拆分;原生日志确认这两种格式都将完整图表委托给 Adreno GPU 上的 LiteRT OpenCL(LITERT_CL)。
| 模型 | 任务 | 尺寸 (像素) | 传统 onnx2tf INT8 TFLite (ms) | 候选 w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | 检测 | 640 | 14.0 1.8 / 8.1 / 4.2 | 13.5 1.9 / 8.1 / 3.5 |
| YOLO26n-seg | 分割 | 640 | 30.1 1.9 / 20.3 / 8.0 | 28.6 1.8 / 20.1 / 6.7 |
| YOLO26n-sem | 语义 | 640 | 26.4 1.9 / 16.4 / 8.1 | 32.9 1.8 / 23.0 / 8.2 |
| YOLO26n-cls | 分类 | 224 | 3.5 0.9 / 2.2 / 0.4 | 3.2 1.0 / 2.2 / 0.1 |
| YOLO26n-pose | 姿态 | 640 | 17.4 2.4 / 9.9 / 5.1 | 14.0 1.9 / 9.3 / 2.8 |
| YOLO26n-obb | OBB | 640 | 13.9 3.0 / 8.3 / 2.7 | 13.0 2.9 / 7.9 / 2.3 |
同一次迁移运行还比较了 YOLO26n 检测量化格式。推理是可比的、与格式相关的指标:
| Android 格式 | GPU 推理 (ms) | GPU 编译 |
|---|---|---|
| onnx2tf INT8 (旧版 TFLite) | 8.6 | 是 |
| LiteRT w8a32(候选) | 8.4 | 是 |
LiteRT INT8(quantize=8) | 11.0 | 是 |
| LiteRT FP32 | 8.8 | 是 |
LiteRT w8a16(quantize="w8a16") | CPU 回退 | 否 |
在此运行中,w8a16 回退到 CPU,总耗时约为 660 毫秒,而 GPU 格式约为 17 毫秒。这些结果促成了 w8a32 的发布,但委托兼容性和性能取决于设备和运行时版本。请在目标设备上进行基准测试,并在其运行时日志中确认加速器的放置。
TFLite 中的部署选项#
在查看 LiteRT 替代导出示例之前,让我们先了解一下 TFLite 模型通常是如何使用的。
TFLite 为机器学习模型提供了各种设备端部署选项,包括:
- 通过 Android 和 iOS 进行部署:带有 TFLite 的 Android 和 iOS 应用程序都可以分析边缘摄像头的源数据和传感器,以检测和识别对象。TFLite 还提供用 Swift 和 Objective-C 编写的原生 iOS 库。下面的架构图展示了使用 TensorFlow Lite 将训练好的模型部署到 Android 和 iOS 平台的过程。
-
使用嵌入式 Linux 进行实现:如果在 Raspberry Pi 上运行推理时使用 Ultralytics Guide 不满足你的用例的速度要求,你可以使用导出的 TFLite 模型来加速推理时间。此外,通过利用 Coral Edge TPU device,还可以进一步提高性能。
-
在微控制器上部署:TFLite 模型也可以部署在只有几千字节内存的微控制器和其他设备上。其核心运行时在 Arm Cortex M3 上仅占 16 KB,并可运行许多基础模型。它不需要操作系统支持、任何标准的 C 或 C++ 库,也不需要动态内存分配。
使用 LiteRT 替换 TFLite 导出#
对于新的导出,请将你的模型转换为 LiteRT。生成的模型保留 .tflite 文件扩展名。
安装#
要安装所需的软件包,请运行:
# Install the required package for YOLO26
pip install ultralytics有关安装过程的详细说明和最佳实践,请查阅我们的 Ultralytics Installation guide。在安装 YOLO26 所需的软件包时,如果遇到任何困难,请参考我们的 Common Issues guide 获取解决方案和提示。
用法#
所有Ultralytics YOLO26 模型都旨在开箱即用支持导出,这使得将它们集成到你首选的部署工作流中变得轻而易举。你可以查看支持的导出格式和配置选项完整列表,为你的应用选择最佳设置。
替换后的 LiteRT 格式支持 Export、Predict 和 Validate 模式。导出你的模型,然后加载导出的 .tflite 模型以运行推理或验证其准确性。
from ultralytics import YOLO
# Load a YOLO26 model
model = YOLO("yolo26n.pt")
# Export the model to LiteRT format
model.export(format="litert", imgsz=640) # use imgsz=224 for classificationfrom ultralytics import YOLO
# Load the exported TFLite model
model = YOLO("yolo26n.tflite")
# Run inference
results = model("https://ultralytics.com/images/bus.jpg")from ultralytics import YOLO
# Load the exported TFLite model
model = YOLO("yolo26n.tflite")
# Validate accuracy on the COCO8 dataset
metrics = model.val(data="coco8.yaml")导出参数#
| 参数 | 类型 | 默认值 | 描述 |
|---|---|---|---|
format | str | 'litert' | 导出模型的目标格式,定义了与各种部署环境的兼容性。 |
imgsz | int 或 tuple | 640 | 模型输入的所需图像大小。对于正方形图像可以是整数,或者对于特定尺寸可以是元组 (height, width)。 |
quantize | int 或 str | None | 量化精度:8(静态 INT8,int8 权重 + int8 激活;需要校准 data/fraction)、'w8a16'(静态,int8 权重 + int16 激活;需要校准 data/fraction)、'w8a32'(动态 INT8,int8 权重 + FP32 激活;无需校准),或 32/未设置(FP32)。FP16 不会单独导出——FP32 模型在 GPU 委托上会自动以 FP16 运行。替代了已弃用的 half/int8 标志。 |
batch | int | 1 | 指定导出模型的批处理推理大小,或导出的模型在 predict 模式下同时处理的最大图像数量。 |
data | str | None | dataset YAML 的路径,对量化至关重要;分类则采用数据集目录或内置数据集名称。如果在 quantize=8 或 'w8a16' 中省略,Ultralytics 将为模型任务选择默认的校准数据集。 |
fraction | float、int 或 list | 1.0 | 校准子集,可作为比例、图像数量或 [train, val, test] 比例/数量。两项列表使 test 保持完整,而 0 则会跳过它。 |
device | str | None | 指定用于导出的设备:CPU (device=cpu),用于 Apple 芯片的 MPS (device=mps)。 |
有关导出过程的更多详细信息,请访问 Ultralytics 关于导出的文档页面。
部署导出的 YOLO26 TFLite 模型#
将 Ultralytics YOLO26 模型导出为 LiteRT 格式后,你可以部署生成的 .tflite 模型。运行 TFLite 模型的主要且推荐的第一步是使用 YOLO("model.tflite") 方法,如前一个用法代码片段中所述。但是,有关在各种其他设置中部署 TFLite 模型的深入说明,请查看以下资源:
-
Android:将 TensorFlow Lite 集成到 Android 应用程序中的快速入门指南,提供易于遵循的步骤来设置和运行 machine learning 模型。
-
iOS:查看这份面向开发人员的详细指南,了解如何在 iOS 应用程序中集成和部署 TensorFlow Lite 模型,其中提供了分步说明和资源。
-
End-To-End Examples:此页面概述了各种 TensorFlow Lite 示例,展示了旨在帮助开发人员在移动设备和边缘设备的机器学习项目中实现 TensorFlow Lite 的实际应用和教程。
总结#
本指南保留了旧版 TFLite 部署工作流。对于新的导出,请使用 LiteRT 为边缘计算环境创建 .tflite 模型。
有关用法的更多详细信息,请访问 TFLite official documentation。
此外,如果你对其他 Ultralytics YOLO26 集成感兴趣,请查看我们的 integration guide page。你会在那里找到许多有用的信息和见解。
常见问题解答#
对于新的导出任务,请使用 LiteRT 格式。首先,使用以下命令安装所需的包:
pip install ultralytics然后,使用以下代码片段导出你的模型:
from ultralytics import YOLO # Load a YOLO26 model model = YOLO("yolo26n.pt") # Export the model to LiteRT format model.export(format="litert", imgsz=640) # use imgsz=224 for classification对于 CLI 用户,你可以通过以下命令实现:
yolo export model=yolo26n.pt format=litert imgsz=640 # use imgsz=224 for classification有关更多详情,请访问 Ultralytics 导出指南。
TensorFlow Lite (TFLite) 是一个开源的 deep learning 框架,专为端侧推理而设计,非常适合在移动设备、嵌入式设备和物联网设备上部署 YOLO26 模型。主要优点包括:
- 设备端优化:通过本地处理数据来最小化延迟并增强隐私。
- 平台兼容性:支持 Android、iOS、嵌入式 Linux 和 MCU。
- 性能:利用硬件加速来优化模型速度和效率。
要了解更多信息,请查看 TFLite guide。
是的,你可以在 Raspberry Pi 上运行 YOLO26 TFLite 模型以提高推理速度。首先,按照上述说明将模型导出为 LiteRT 格式。然后,使用诸如 TensorFlow Lite Interpreter 之类的工具在你的 Raspberry Pi 上执行模型。
如需进一步优化,你可能会考虑使用 Coral Edge TPU。有关详细步骤,请参阅我们的 Raspberry Pi deployment guide 和 Edge TPU integration guide。
可以,TFLite 支持在资源受限的微控制器上进行部署。TFLite 的核心运行时在 Arm Cortex M3 上仅需要 16 KB 的内存,并且可以运行基本的 YOLO26 模型。这使得它非常适合部署在计算能力和内存有限的设备上。
要开始使用,请访问 TFLite Micro for Microcontrollers guide。
TensorFlow Lite 提供广泛的平台兼容性,允许你在各种设备上部署 YOLO26 模型,包括:
- Android 和 iOS:通过 TFLite Android 和 iOS 库提供原生支持。
- 嵌入式 Linux:非常适合 Raspberry Pi 等单板计算机。
- 微控制器:适用于资源受限的 MCU。
有关部署选项的更多信息,请参阅我们的详细 deployment guide。
如果在将 YOLO26 模型导出到 LiteRT 时遇到错误,常见的解决方法包括:
- 检查包兼容性:确保你使用的是兼容版本的 Ultralytics、
litert-torch和ai-edge-litert。请参考我们的 installation guide。 - 模型支持:通过查看 Ultralytics export documentation page,验证特定的 YOLO26 模型是否支持 LiteRT 导出。
- 量化问题:当使用 INT8 量化时,请确保在
data参数中正确指定了你的数据集路径。
有关其他故障排除提示,请访问我们的常见问题指南。
- 检查包兼容性:确保你使用的是兼容版本的 Ultralytics、