Xuất Model YOLO sang LiteRT để triển khai trên Edge và Web#
LiteRT (viết tắt của Lite Runtime) là runtime hiệu năng cao của Google dành cho AI trên thiết bị. Đây là thế hệ tiếp theo và tên mới của TensorFlow Lite (TFLite), đồng thời chạy cùng định dạng model .tflite. Với LiteRT, một model Ultralytics YOLO được export duy nhất có thể triển khai trên thiết bị di động, hệ thống nhúng, edge và trình duyệt — bao quát mọi trường hợp mà các định dạng export tflite và tfjs trước đây xử lý riêng lẻ, nay được hợp nhất trong một giải pháp.
Xem: Cách export Ultralytics YOLO26 sang Google LiteRT | Triển khai Vision AI trên Android và iOS | AI di động 📱🚀
Định dạng export LiteRT tối ưu hóa model cho các tác vụ như phát hiện đối tượng, phân đoạn, ước tính tư thế và phân loại, giúp model chạy nhanh và ngoại tuyến trên nhiều loại thiết bị.
Plugin Ultralytics YOLO Flutter chính thức chạy các bản export LiteRT .tflite trên Android ngay sau khi cài đặt — hỗ trợ suy luận camera theo thời gian thực, dự đoán ảnh đơn, tăng tốc GPU và tự động tải model cho cả bảy tác vụ YOLO26, bao gồm Depth. Với thiết bị Apple, hãy dùng bản export CoreML; với NPU Qualcomm Snapdragon, hãy xem tích hợp Qualcomm QNN.
Export model phân loại ở imgsz=224. Export model detect, segment, semantic, depth, pose và OBB ở imgsz=640. Chuẩn 224/640 này được dùng chung cho các asset di động LiteRT, CoreML và QNN chính thức.
Package NPM Ultralytics YOLO chính thức chạy trực tiếp các bản export LiteRT .tflite trong trình duyệt thông qua LiteRT.js, không cần server hay Python — hỗ trợ suy luận webcam theo thời gian thực, dự đoán ảnh đơn và tăng tốc WebGPU (tự động chuyển dự phòng sang CPU/WASM) cho sáu tác vụ YOLO26 (detect, segment, semantic, classify, pose, OBB). Trên WebGPU, tốc độ thường nhanh hơn ONNX Runtime Web khoảng ~2×.
npm i @ultralytics/yolo @litertjs/coreTại sao nên export sang LiteRT?#
LiteRT là framework mã nguồn mở được thiết kế cho suy luận trên thiết bị, còn gọi là điện toán biên. LiteRT cung cấp cho nhà phát triển các công cụ để chạy model đã huấn luyện trên thiết bị di động, hệ thống nhúng và IoT, máy tính thông thường, cũng như — thông qua LiteRT.js — trực tiếp trong trình duyệt web và Node.js.
Một định dạng model, mọi mục tiêu triển khai:
- Thiết bị di động và hệ thống nhúng: Android, iOS, Linux nhúng và vi điều khiển (MCU).
- Bộ tăng tốc edge: Tương thích với Coral Edge TPU để tăng tốc thêm.
- Trình duyệt và Node.js: LiteRT.js chạy cùng model
.tflitetrên web với tăng tốc WebGPU/WASM — không cần định dạng export TensorFlow.js riêng.
Các tính năng chính của model LiteRT#
- Tối ưu hóa trên thiết bị: Giảm độ trễ bằng cách xử lý dữ liệu cục bộ, tăng cường quyền riêng tư bằng cách không truyền dữ liệu cá nhân và giảm kích thước model để tiết kiệm dung lượng.
- Hỗ trợ nhiều nền tảng: Chạy trên Android, iOS, Linux nhúng, vi điều khiển và các trình duyệt web hiện đại.
- Tăng tốc phần cứng: Tận dụng XNNPACK trên CPU và tăng tốc GPU thông qua OpenCL, Metal và WebGPU. GPU delegate chạy ở FP16 theo mặc định để tăng tốc hơn nữa.
- Lượng tử hóa: Hỗ trợ FP32, INT8 tĩnh (
quantize=8, trọng số int8 + activation int8), INT16-activation tĩnh (quantize="w8a16", trọng số int8 + activation int16 để đạt độ chính xác cao hơn) và INT8 động (quantize="w8a32", trọng số int8 + activation FP32, không cần dữ liệu hiệu chuẩn) để nén model và tăng tốc suy luận với mức suy giảm độ chính xác tối thiểu. - Hỗ trợ đa dạng ngôn ngữ: Tương thích với Java/Kotlin, Swift, Objective-C, C++, Python và JavaScript.
Hiệu năng đo được#
Phần cứng: Xiaomi 17 với bộ nhớ LPDDR5X 12 GB và Android 16 / API 36. Snapdragon 8 Elite Gen 5 tiến trình 3 nm (SM8850) có CPU Qualcomm Oryon 8 lõi (2 lõi Prime tối đa 4.6 GHz và 6 lõi Performance tối đa 3.62 GHz), GPU Adreno và NPU Hexagon.
| Model | Tác vụ | kích thước (pixel) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 52.2 1.8 / 48.1 / 2.4 | 15.8 2.3 / 8.9 / 4.6 |
| YOLO26n-seg | Segment | 640 | 73.4 1.8 / 65.6 / 6.0 | 33.2 1.8 / 23.8 / 7.6 |
| YOLO26n-sem | Ngữ nghĩa | 640 | 61.2 1.8 / 51.1 / 8.3 | 34.2 1.8 / 24.0 / 8.3 |
| YOLO26n-depth | Độ sâu | 640 | 124.4 1.9 / 115.1 / 7.4 | 23.0 1.8 / 13.5 / 7.7 |
| YOLO26n-cls | Phân loại | 224 | 4.4 0.4 / 4.0 / 0.0 | 3.1 0.8 / 2.1 / 0.2 |
| YOLO26n-pose | Tư thế | 640 | 57.4 1.8 / 53.8 / 1.8 | 16.6 2.7 / 10.1 / 3.9 |
| YOLO26n-obb | OBB | 640 | 50.3 1.8 / 47.2 / 1.4 | 11.7 1.8 / 7.8 / 2.0 |
- Các giá trị tốc độ là độ trễ burst cho một ảnh — giá trị trung bình của 15 lần chạy sau 3 lượt warmup trên
bus.jpg, được đo bằng plugin Flutter của Ultralytics0.6.10và các tài nguyênv0.6.6đã được chuẩn hóa. Thứ tự CPU/GPU được luân phiên giữa các tác vụ trong một lượt chạy tuần tự. Nhật ký native xác nhận rằng mọi hàng CPU đều sử dụng LiteRT CPU/XNNPACK và mọi hàng GPU đều giao toàn bộ đồ thị cho LiteRT OpenCL (LITERT_CL). - Quá trình xuất LiteRT truy vết trực tiếp model PyTorch, tạo ra
.tfliteNCHW với đầu vào float — GPU delegate biên dịch toàn bộ đồ thị (cả bảy tác vụ đều chạy trên GPU Adreno ở đây), cònw8a32không cần dữ liệu hiệu chuẩn. Người dùng nên đọc shape tensor và tên signature thay vì giả định bố cục NHWC của onnx2tf cũ hoặc tên đầu raIdentity; hãy đóng gói dữ liệu RGB trực tiếp theo dạng CHW phẳng hoặc chuyển vị trước khi suy luận. Các bản xuất ngữ nghĩa trả về logits NCHW và cần thực hiện argmax lớp ở phía host. Các tài nguyên Android chính thức được lưu trữ trong bản phát hànhv0.6.6của yolo-flutter-app, cùng với hồ sơ benchmark chi tiết trong tài liệu hiệu năng Flutter. - Các số liệu tương ứng của NPU Hexagon trên Snapdragon và LiteRT CPU/GPU có trong tích hợp Qualcomm QNN.
- So sánh kết quả CPU/bộ tăng tốc của Apple trong tích hợp CoreML.
Các lượt kiểm tra thiết bị sau đây sử dụng cùng bộ tài nguyên v0.6.6 đã được chuẩn hóa.
Google Pixel 10#
Phần cứng: Google Pixel 10 với bộ nhớ 12 GB và Android 16 / API 36. Google Tensor G5 tiến trình 3 nm có CPU 8 lõi (1 lõi Prime tối đa 3.78 GHz, 5 lõi Performance tối đa 3.05 GHz và 2 lõi Efficiency tối đa 2.25 GHz), GPU PowerVR D-Series và Google TPU. Xung nhịp lõi và tên trình điều khiển GPU được đọc từ thiết bị benchmark vì Google không công bố các thông tin này trong thông số kỹ thuật được liên kết.
| Model | Tác vụ | kích thước (pixel) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 53.3 1.5 / 50.2 / 1.6 | 45.5 3.8 / 37.7 / 4.0 |
| YOLO26n-seg | Segment | 640 | 87.7 1.8 / 78.5 / 7.5 | 50.9 3.0 / 36.9 / 10.9 |
| YOLO26n-sem | Ngữ nghĩa | 640 | 68.6 1.5 / 59.0 / 8.0 | 71.6 1.5 / 59.5 / 10.6 |
| YOLO26n-depth | Độ sâu | 640 | 120.3 1.5 / 112.5 / 6.3 | 52.5 2.0 / 37.5 / 13.0 |
| YOLO26n-cls | Phân loại | 224 | 4.0 0.3 / 3.4 / 0.2 | 17.6 0.9 / 16.7 / 0.1 |
| YOLO26n-pose | Tư thế | 640 | 59.7 1.5 / 57.0 / 1.2 | 46.6 3.8 / 39.2 / 3.5 |
| YOLO26n-obb | OBB | 640 | 52.0 1.5 / 48.9 / 1.7 | 45.5 4.0 / 38.5 / 2.9 |
Benchmark: Trung bình của 15 lần gọi predict() sau 3 lượt warmup trên bus.jpg, sử dụng ultralytics_yolo 0.6.10 và các tài nguyên v0.6.6 chính thức. Thứ tự CPU/GPU luân phiên giữa các tác vụ trong một lượt chạy tuần tự. Nhật ký native xác nhận rằng mọi hàng CPU đều sử dụng LiteRT CPU/XNNPACK và mọi hàng GPU đều giao toàn bộ đồ thị cho LiteRT OpenCL (LITERT_CL).
Samsung Galaxy S26#
Phần cứng: Samsung Galaxy S26 (SM-S942B) với bộ nhớ 12 GB và Android 16 / API 36. Exynos 2600 tiến trình 2 nm có CPU Armv9.3 10 lõi (1 lõi C1-Ultra tối đa 3.8 GHz, 3 lõi C1-Pro hiệu năng cao tối đa 3.26 GHz và 6 lõi C1-Pro tiết kiệm năng lượng tối đa 2.76 GHz), GPU Xclipse 960 và NPU Samsung.
| Model | Tác vụ | kích thước (pixel) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 36.7 1.3 / 33.8 / 1.7 | 16.4 1.4 / 12.3 / 2.6 |
| YOLO26n-seg | Segment | 640 | 54.6 1.2 / 48.0 / 5.3 | 32.8 1.3 / 24.5 / 7.0 |
| YOLO26n-sem | Ngữ nghĩa | 640 | 47.8 1.2 / 38.4 / 8.1 | 34.2 1.3 / 24.9 / 8.0 |
| YOLO26n-depth | Độ sâu | 640 | 92.9 1.2 / 84.8 / 6.9 | 33.5 1.3 / 22.4 / 9.8 |
| YOLO26n-cls | Phân loại | 224 | 2.7 0.2 / 2.3 / 0.2 | 2.6 0.2 / 2.4 / 0.0 |
| YOLO26n-pose | Tư thế | 640 | 42.8 1.3 / 40.5 / 1.0 | 18.4 1.4 / 14.1 / 2.9 |
| YOLO26n-obb | OBB | 640 | 37.5 1.3 / 35.1 / 1.2 | 18.8 2.5 / 14.6 / 1.8 |
Benchmark: Trung bình của 15 lần gọi predict() sau 3 lượt warmup trên bus.jpg, sử dụng ultralytics_yolo 0.6.10 và các tài nguyên v0.6.6 chính thức. Thứ tự CPU/GPU luân phiên giữa các tác vụ trong một lượt chạy tuần tự. Nhật ký native xác nhận rằng mọi hàng CPU đều sử dụng LiteRT CPU/XNNPACK và mọi hàng GPU đều giao toàn bộ đồ thị cho LiteRT OpenCL (LITERT_CL).
Xiaomi 17T Pro#
Phần cứng: Xiaomi 17T Pro (2602EPTC0G) với bộ nhớ LPDDR5X 12 GB và Android 16 / API 36. MediaTek Dimensity 9500 tiến trình 3 nm (MT6993) có CPU Armv9.3 8 lõi (1 lõi C1-Ultra tối đa 4.21 GHz, 3 lõi C1-Premium tối đa 3.5 GHz và 4 lõi C1-Pro tối đa 2.7 GHz), GPU Mali-G1 Ultra MC12 và NPU MediaTek 990.
| Model | Tác vụ | kích thước (pixel) | CPU w8a32 LiteRT (ms) | GPU w8a32 LiteRT (ms) |
|---|---|---|---|---|
| YOLO26n | Detect | 640 | 45.4 1.3 / 42.1 / 2.0 | 26.6 1.9 / 22.0 / 2.7 |
| YOLO26n-seg | Segment | 640 | 126.2 2.6 / 113.9 / 9.7 | 46.7 2.6 / 33.3 / 10.8 |
| YOLO26n-sem | Ngữ nghĩa | 640 | 117.9 2.6 / 98.8 / 16.5 | 74.3 2.6 / 54.7 / 17.0 |
| YOLO26n-depth | Độ sâu | 640 | 182.4 2.5 / 167.6 / 12.3 | 47.8 2.5 / 32.3 / 12.9 |
| YOLO26n-cls | Phân loại | 224 | 6.2 0.4 / 5.3 / 0.4 | 7.4 0.4 / 6.9 / 0.1 |
| YOLO26n-pose | Tư thế | 640 | 97.6 2.5 / 93.3 / 1.8 | 28.6 2.5 / 23.3 / 2.8 |
| YOLO26n-obb | OBB | 640 | 91.5 2.6 / 85.8 / 3.2 | 27.5 2.7 / 21.8 / 2.9 |
Benchmark: Trung bình của 15 lần gọi predict() sau 3 lượt warmup trên bus.jpg, sử dụng ultralytics_yolo 0.6.10 và các tài nguyên v0.6.6 chính thức. Thứ tự CPU/GPU luân phiên giữa các tác vụ trong một lượt chạy tuần tự. Nhật ký native xác nhận rằng mọi hàng CPU đều sử dụng LiteRT CPU/XNNPACK và mọi hàng GPU đều giao toàn bộ đồ thị cho LiteRT OpenCL (LITERT_CL).
Các tác vụ được hỗ trợ#
Xuất LiteRT hỗ trợ cả bảy tác vụ của Ultralytics. Phân đoạn ngữ nghĩa và ước tính độ sâu chỉ khả dụng với YOLO26, dòng model duy nhất cung cấp các head này.
Xuất sang LiteRT: Chuyển đổi model YOLO của bạn#
Bạn có thể cải thiện hiệu quả thực thi trên thiết bị và mở rộng các tùy chọn triển khai bằng cách chuyển đổi model sang định dạng LiteRT.
Cài đặt#
Để cài đặt package cần thiết, hãy chạy:
# Install the required package for YOLO
pip install ultralyticsĐể biết hướng dẫn chi tiết và các phương pháp tối ưu, hãy xem hướng dẫn cài đặt Ultralytics. Nếu gặp khó khăn, hãy tham khảo hướng dẫn xử lý các vấn đề thường gặp.
Hiện tại, xuất LiteRT được hỗ trợ trên Linux x86_64 và macOS. Bản thân model .tflite đã xuất có thể chạy trên mọi nền tảng được LiteRT hỗ trợ (thiết bị di động, hệ thống nhúng, thiết bị biên và trình duyệt).
Cách sử dụng#
Tất cả model YOLO của Ultralytics đều hỗ trợ xuất sẵn. Định dạng LiteRT hỗ trợ các chế độ Export, Predict và Validate, vì vậy bạn có thể xuất model rồi tải model để chạy suy luận hoặc xác thực độ chính xác cục bộ.
from ultralytics import YOLO
# Nạp model YOLO26
model = YOLO("yolo26n.pt")
# Xuất model sang định dạng LiteRT
model.export(format="litert", imgsz=640) # tạo tệp 'yolo26n.tflite'; dùng imgsz=224 cho phân loạifrom ultralytics import YOLO
model = YOLO("yolo26n.pt")
# INT8 động: trọng số int8, activation FP32 - không cần dữ liệu hiệu chuẩn
model.export(format="litert", quantize="w8a32", imgsz=640) # tạo tệp 'yolo26n_w8a32.tflite'
# INT8 tĩnh: trọng số int8 + activation int8 - cần dữ liệu hiệu chuẩn
model.export(format="litert", quantize=8, data="coco8.yaml", imgsz=640) # tạo tệp 'yolo26n_int8.tflite'
# w8a16 tĩnh: trọng số int8 + activation int16 (độ chính xác cao hơn) - cần dữ liệu hiệu chuẩn
model.export(format="litert", quantize="w8a16", data="coco8.yaml", imgsz=640) # tạo tệp 'yolo26n_w8a16.tflite'from ultralytics import YOLO
# Tải model LiteRT đã xuất
model = YOLO("yolo26n.tflite")
# Chạy suy luận
results = model("https://ultralytics.com/images/bus.jpg")from ultralytics import YOLO
# Tải model LiteRT đã xuất
model = YOLO("yolo26n.tflite")
# # Đánh giá độ chính xác trên bộ dữ liệu COCO8
metrics = model.val(data="coco8.yaml")Các tham số xuất model#
| Đối số | Kiểu | Mặc định | Mô tả |
|---|---|---|---|
format | str | 'litert' | Định dạng đích của model đã xuất, xác định khả năng tương thích với nhiều môi trường triển khai. |
imgsz | int hoặc tuple | 640 | Kích thước ảnh mong muốn cho đầu vào model. Có thể là số nguyên cho ảnh vuông hoặc tuple (height, width) để chỉ định kích thước cụ thể. |
quantize | int hoặc str | None | Độ chính xác lượng tử hóa: 8 (INT8 tĩnh, trọng số int8 + activation int8; cần dữ liệu hiệu chuẩn data/fraction), 'w8a16' (tĩnh, trọng số int8 + activation int16; cần dữ liệu hiệu chuẩn data/fraction), 'w8a32' (INT8 động, trọng số int8 + activation FP32; không cần hiệu chuẩn) hoặc 32/không đặt (FP32). FP16 không được xuất riêng (xem ghi chú bên dưới). Thay thế các cờ half/int8 đã bị khai tử. |
batch | int | 1 | Chỉ định kích thước batch suy luận của model khi xuất hoặc số lượng ảnh tối đa mà model đã xuất xử lý đồng thời ở chế độ predict. |
data | str | None | YAML của dataset dùng để hiệu chuẩn INT8; với phân loại, thay vào đó hãy cung cấp thư mục dataset hoặc tên dataset tích hợp sẵn. Nếu không được chỉ định cùng quantize=8 hoặc 'w8a16', Ultralytics sẽ chọn dataset hiệu chuẩn mặc định cho tác vụ của model. |
fraction | float, int hoặc list | 1.0 | Tập con hiệu chuẩn dưới dạng tỷ lệ, số lượng ảnh hoặc tỷ lệ/số lượng [train, val, test]. Danh sách gồm hai mục giữ test ở dạng đầy đủ, còn 0 sẽ bỏ qua mục này. |
device | str | None | Chỉ định thiết bị dùng để xuất. Quá trình xuất LiteRT chạy trên CPU (device=cpu). |
Không giống như quá trình xuất tflite cũ, LiteRT không yêu cầu xuất FP16 riêng. Model .tflite FP32 chạy ở độ chính xác bán phần trong thời gian chạy khi sử dụng GPU delegate (WebGPU, OpenCL, Metal) — đây là cách LiteRT chính thức hỗ trợ suy luận FP16.
Để biết thêm chi tiết về quy trình xuất, hãy truy cập trang tài liệu Ultralytics về xuất model.
Triển khai model YOLO LiteRT đã xuất#
Sau khi xuất model YOLO của Ultralytics sang LiteRT, bạn có thể triển khai model trên nhiều nền tảng. Cách nhanh nhất để xác minh cục bộ là phương thức YOLO("yolo26n.tflite") được trình bày ở trên. Để triển khai trong các môi trường khác, hãy xem các tài nguyên sau:
Di động & Nhúng#
- Android: Hướng dẫn bắt đầu nhanh để tích hợp LiteRT vào ứng dụng Android.
- iOS: Hướng dẫn tích hợp và triển khai model LiteRT trong ứng dụng iOS.
- Linux nhúng & Raspberry Pi: Chạy model LiteRT trên máy tính bo mạch đơn, có thể tăng tốc bằng Coral Edge TPU.
- Vi điều khiển: Triển khai trên MCU chỉ với vài kilobyte bộ nhớ — runtime lõi chỉ chiếm khoảng 16 KB trên Arm Cortex-M3.
Trình duyệt & Node.js (LiteRT.js)#
- Tổng quan về LiteRT.js: Chạy cùng model
.tflitetrực tiếp trong trình duyệt với khả năng tăng tốc WebGPU/WASM, loại bỏ tính toán phía máy chủ và giữ dữ liệu trên thiết bị của người dùng. - Ví dụ từ đầu đến cuối: Các ví dụ thực tế và hướng dẫn triển khai LiteRT trên thiết bị di động, edge và web.
Tóm tắt#
Trong hướng dẫn này, chúng ta đã tìm hiểu cách xuất model Ultralytics YOLO sang định dạng LiteRT. Bằng cách hợp nhất triển khai trên di động/edge (trước đây là TFLite) và trình duyệt (trước đây là TF.js) vào một model .tflite duy nhất, LiteRT giúp model YOLO chạy nhanh hơn, nhỏ gọn hơn và có thể triển khai trên hầu hết mọi thiết bị.
Để biết thêm chi tiết, hãy truy cập tài liệu chính thức của LiteRT.
Ngoài ra, nếu bạn muốn tìm hiểu các tích hợp Ultralytics YOLO khác, hãy xem trang hướng dẫn tích hợp của chúng tôi để tham khảo nhiều tài nguyên hữu ích.
Câu hỏi thường gặp#
Sử dụng thư viện Ultralytics để xuất model YOLO sang LiteRT (
.tflite). Trước tiên, hãy cài đặt package:pip install ultralyticsSau đó xuất model của bạn:
from ultralytics import YOLO # Nạp model YOLO26 model = YOLO("yolo26n.pt") # Xuất model sang định dạng LiteRT model.export(format="litert", imgsz=640) # dùng imgsz=224 cho phân loạiDành cho người dùng CLI:
yolo export model=yolo26n.pt format=litert imgsz=640 # use imgsz=224 for classificationĐể biết thêm chi tiết, hãy truy cập hướng dẫn xuất model của Ultralytics.
LiteRT là tên mới của TensorFlow Lite — cùng định dạng model
.tflite, cùng dòng runtime, được Google đổi tên thương hiệu. Trong Ultralytics, định dạng xuấtlitertduy nhất hiện bao gồm cả hai trường hợp sử dụng trước đây cần đến hai định dạng riêng biệt:- Định dạng
tflitecũ → triển khai trên di động, hệ thống nhúng và edge. - Định dạng
tfjscũ → triển khai trên trình duyệt và Node.js, hiện được xử lý bằng LiteRT.js chạy cùng tệp.tflite.
Nếu bạn có tệp
.tflitehiện có, bạn có thể tải trực tiếp tệp đó bằngYOLO("model.tflite"); tệp sẽ chạy thông qua backend LiteRT.- Định dạng
Có. Xuất model sang định dạng LiteRT, sau đó chạy trên Raspberry Pi để cải thiện tốc độ suy luận. Để tối ưu hóa thêm, hãy cân nhắc dùng Coral Edge TPU. Để xem các bước chi tiết, hãy tham khảo hướng dẫn triển khai trên Raspberry Pi của chúng tôi.
Có. LiteRT.js chạy cùng model
.tfliteđã xuất trực tiếp trong trình duyệt web hoặc ứng dụng Node.js, với khả năng tăng tốc WebGPU/WASM. Cách này thay thế quy trình TensorFlow.js trước đây — không cần xuất riêng cho trình duyệt, chỉ cần triển khai model LiteRT bằng runtime LiteRT.js.Có — ở thời điểm runtime. Model LiteRT FP32 sẽ tự động chạy ở FP16 khi được thực thi trên GPU delegate (WebGPU, OpenCL hoặc Metal), đây là cách tiếp cận chính thức của LiteRT. Do đó, bạn không cần xuất riêng model FP16; để nén thêm, hãy dùng lượng tử hóa INT8 với
quantize=8.Nếu gặp lỗi khi xuất model YOLO sang LiteRT, các cách khắc phục phổ biến bao gồm:
- Kiểm tra nền tảng: LiteRT hỗ trợ xuất trên Linux x86_64 và macOS. Hãy xác minh môi trường của bạn phù hợp.
- Kiểm tra tính tương thích của package: Đảm bảo bạn đang sử dụng phiên bản Ultralytics tương thích. Tham khảo hướng dẫn cài đặt của chúng tôi.
- Sự cố lượng tử hóa: Khi sử dụng lượng tử hóa INT8, hãy đảm bảo đường dẫn dataset được chỉ định chính xác trong tham số
data.
Để biết thêm mẹo khắc phục sự cố, hãy truy cập hướng dẫn Các sự cố thường gặp của chúng tôi.