Phân tích so sánh các tùy chọn triển khai YOLO26#
YOLO26 hỗ trợ hơn 20 tùy chọn triển khai, mỗi tùy chọn được tối ưu cho một runtime, phần cứng đích hoặc nền tảng khác nhau — từ PyTorch và ONNX đến TensorRT, OpenVINO, CoreML và các định dạng NPU biên chuyên dụng. Việc chọn tùy chọn phù hợp cần cân bằng tốc độ suy luận, giới hạn phần cứng và mức độ dễ tích hợp. Hướng dẫn này so sánh mọi tùy chọn để bạn có thể chọn phương án phù hợp nhất cho ứng dụng của mình, sau đó tham khảo các phương pháp tốt nhất khi triển khai model để triển khai đáng tin cậy.
Xem: Cách chọn định dạng triển khai Ultralytics YOLO26 phù hợp nhất cho dự án của bạn | TensorRT | OpenVINO 🚀
Triển khai là giai đoạn trong quy trình dự án thị giác máy tính mà model đã huấn luyện bắt đầu thực hiện công việc thực tế, vì vậy định dạng xuất có ảnh hưởng trực tiếp đến tốc độ, chi phí và tính di động.
Cách chọn tùy chọn triển khai phù hợp cho model YOLO26 của bạn#
Khi đến lúc triển khai model YOLO26, việc chọn định dạng export phù hợp là rất quan trọng. Như được trình bày trong tài liệu export Ultralytics YOLO26, hàm model.export() chuyển đổi model đã huấn luyện sang nhiều định dạng phù hợp với các môi trường và yêu cầu hiệu năng khác nhau.
Định dạng lý tưởng phụ thuộc vào bối cảnh vận hành dự kiến của model và phần cứng.
Để triển khai được quản lý mà không cần export thủ công, Ultralytics Platform cung cấp các endpoint suy luận sẵn sàng sử dụng với khả năng tự động mở rộng quy mô trên 42 khu vực toàn cầu.
Các tùy chọn triển khai của YOLO26#
Sau đây là mô tả ngắn về từng định dạng và thời điểm nên sử dụng. Để xem hướng dẫn export đầy đủ, hãy tham khảo tài liệu export; để xem các tiêu chí được đặt cạnh nhau, hãy chuyển đến bảng so sánh.
- PyTorch (
.pt): Định dạng huấn luyện và suy luận gốc, mang lại độ linh hoạt tối đa và khả năng tăng tốc GPU thông qua NVIDIA CUDA hoặc AMD ROCm — lý tưởng cho nghiên cứu và tạo prototype mà không cần bước export. - TorchScript (
torchscript): Tuần tự hóa model để chạy trên runtime C++ không cần Python, phù hợp với các hệ thống production không có Python. - ONNX (
onnx): Định dạng trao đổi không phụ thuộc framework, hỗ trợ rộng rãi nhiều nền tảng và phần cứng thông qua ONNX Runtime, bao gồm GPU NVIDIA qua CUDA và GPU AMD qua MIGraphX. - OpenVINO (
openvino): Bộ công cụ của Intel để tối ưu suy luận trên CPU, GPU tích hợp và NPU Intel, thường được dùng trong IoT và điện toán biên. - TensorRT (
engine): Runtime hiệu năng cao của NVIDIA, mang lại khả năng suy luận GPU hàng đầu với tối ưu hóa FP16 và INT8. - CoreML (
coreml): Định dạng chạy trực tiếp trên thiết bị của Apple dành cho iOS, macOS, watchOS và tvOS, sử dụng Apple Neural Engine. - Core AI (
coreai): Định dạng.aimodelmới của Apple dành cho iOS 27 và macOS 27, được lên lịch chạy trên CPU, GPU và Apple Neural Engine; để export, cần macOS 26 trở lên trên Apple silicon hoặc x86_64 Linux với glibc 2.34 trở lên, cùng Python 3.11 đến 3.14. - TF SavedModel (
saved_model): Định dạng tiêu chuẩn của TensorFlow để phục vụ model phía máy chủ có khả năng mở rộng với TensorFlow Serving. - TF GraphDef (
pb): Định dạng TensorFlow đồ thị tĩnh đã đóng băng dành cho các môi trường cần đồ thị tính toán cố định. - TF Edge TPU (
edgetpu): Biên dịch model.tflitecho bộ tăng tốc Google Coral Edge TPU. - LiteRT (
litert): Runtime chạy trực tiếp trên thiết bị của Google (trước đây là TensorFlow Lite) dành cho suy luận trên thiết bị di động, hệ thống nhúng và trình duyệt từ một model.tfliteduy nhất, hỗ trợ FP32 và INT8, đồng thời thực thi trong trình duyệt thông qua LiteRT.js. - PaddlePaddle (
paddle): Framework deep learning của Baidu, phổ biến tại Trung Quốc và hỗ trợ rộng rãi nhiều phần cứng. - MNN (
mnn): Engine suy luận gọn nhẹ, hiệu năng cao, được tối ưu cho các hệ thống di động và nhúng ARM, x86-64. - NCNN (
ncnn): Framework suy luận gọn nhẹ, hiệu năng cao, được tối ưu cho thiết bị di động ARM. - Sony IMX500 (
imx): Export model cho cảm biến thị giác thông minh IMX500 của Sony với khả năng xử lý trên chip, chẳng hạn như Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Nhắm đến NPU Rockchip trên các bo mạch nhúng với lượng tử hóa FP16 và INT8. - ExecuTorch (
executorch): Runtime chạy trực tiếp trên thiết bị gốc của PyTorch dành cho thiết bị di động (iOS và Android) và hệ thống nhúng thông qua XNNPACK. - Axelera AI (
axelera): Biên dịch cho AIPU Metis của Axelera (tối đa 856 TOPS) qua PCIe hoặc M.2 để suy luận biên thông lượng cao. - DEEPX (
deepx): Nhắm đến phần cứng NPU DEEPX với lượng tử hóa INT8 để suy luận biên trên hệ thống nhúng. - Qualcomm QNN (
qnn): Suy luận trực tiếp trên thiết bị với NPU Snapdragon Hexagon, GPU Adreno và CPU thông qua bộ công cụ AI của Qualcomm.
Tích hợp Hailo export trực tiếp các model YOLO detection, segmentation, semantic segmentation, depth estimation, classification, pose và OBB sang Hailo HEF; xem bảng tương thích để biết các model và mục tiêu đã được xác thực. Tích hợp Ambarella sử dụng quy trình ưu tiên ONNX và biên dịch các bản export ONNX sang format AmbaPB bằng toolchain CVflow của Ambarella dành cho các SoC CVflow® như CV72, có thể sử dụng thêm quá trình huấn luyện nhận biết nén SpongeTorch. Tích hợp Huawei Ascend biên dịch các bản export ONNX sang format offline .om bằng compiler CANN ATC để inference FP16 trên Ascend AI Processors. Tích hợp AMD Xilinx lượng tử hóa các bản export ONNX bằng AMD Quark cho NPU dòng Versal AI Edge Series Gen 2; Vitis AI Execution Provider biên dịch các bản export này thành model .rai.
So sánh các tùy chọn triển khai#
Bảng sau đây tóm tắt các tùy chọn triển khai cho model YOLO26 theo những tiêu chí thường quyết định lựa chọn. Để tìm hiểu sâu về từng định dạng, hãy xem tài liệu về định dạng export.
| Tùy chọn triển khai | Đánh giá hiệu năng | Khả năng tương thích và tích hợp | Hỗ trợ cộng đồng và hệ sinh thái | Nghiên cứu tình huống | Bảo trì và cập nhật | Các cân nhắc về bảo mật | Tăng tốc phần cứng |
|---|---|---|---|---|---|---|---|
| PyTorch | Tính linh hoạt khá tốt; có thể phải đánh đổi hiệu năng thuần | Tương thích xuất sắc với thư viện Python | Tài nguyên và cộng đồng phong phú | Nghiên cứu và prototype | Phát triển thường xuyên, tích cực | Phụ thuộc vào môi trường triển khai | Hỗ trợ CUDA để tăng tốc GPU |
| TorchScript | Phù hợp với production hơn PyTorch | Chuyển đổi mượt mà từ PyTorch sang C++ | Chuyên biệt nhưng phạm vi hẹp hơn PyTorch | Các ngành mà Python là điểm nghẽn | Cập nhật đồng bộ với PyTorch | Bảo mật được cải thiện mà không cần Python đầy đủ | Kế thừa hỗ trợ CUDA từ PyTorch |
| ONNX | Thay đổi tùy theo runtime | Khả năng tương thích cao giữa các framework | Hệ sinh thái rộng, được nhiều tổ chức hỗ trợ | Tính linh hoạt giữa các framework ML | Cập nhật thường xuyên để hỗ trợ các phép toán mới | Đảm bảo thực hành chuyển đổi và triển khai an toàn | Nhiều phương thức tối ưu hóa phần cứng |
| OpenVINO | Được tối ưu cho phần cứng Intel | Tốt nhất trong hệ sinh thái Intel | Vững mạnh trong lĩnh vực thị giác máy tính | IoT và edge với phần cứng Intel | Cập nhật thường xuyên cho phần cứng Intel | Các tính năng mạnh mẽ cho ứng dụng nhạy cảm | Tùy chỉnh cho phần cứng Intel |
| TensorRT | Hiệu năng hàng đầu trên GPU NVIDIA | Tốt nhất cho phần cứng NVIDIA | Mạng lưới hỗ trợ mạnh mẽ từ NVIDIA | Suy luận video và hình ảnh theo thời gian thực | Cập nhật thường xuyên cho GPU mới | Chú trọng bảo mật | Được thiết kế cho GPU NVIDIA |
| CoreML | Tối ưu hóa cho phần cứng Apple trên thiết bị | Chỉ dành riêng cho hệ sinh thái Apple | Hỗ trợ mạnh mẽ từ Apple và nhà phát triển | ML trên thiết bị Apple | Cập nhật thường xuyên từ Apple | Chú trọng quyền riêng tư và bảo mật | Neural Engine và GPU của Apple |
| Core AI | Tối ưu hóa cho Apple silicon | iOS 27 và macOS 27; xuất trên macOS chạy Apple silicon từ phiên bản 26 trở lên hoặc Linux x86_64 (glibc 2.34 trở lên), Python 3.11-3.14 | Framework của Apple; tùy chọn bật trong SDK iOS/Flutter | ML trên thiết bị trên các nền tảng Apple thế hệ tiếp theo | Gắn liền với các bản phát hành hệ điều hành Apple; hiện đang ở giai đoạn beta | Suy luận trên thiết bị giúp dữ liệu luôn ở cục bộ | Apple Neural Engine, GPU và CPU |
| TF SavedModel | Có khả năng mở rộng trong môi trường máy chủ | Khả năng tương thích rộng trong hệ sinh thái TensorFlow | Được hỗ trợ rộng rãi nhờ TensorFlow phổ biến | Phục vụ model ở quy mô lớn | Cập nhật thường xuyên từ Google và cộng đồng | Các tính năng mạnh mẽ dành cho doanh nghiệp | Nhiều phương thức tăng tốc phần cứng |
| TF GraphDef | Ổn định với đồ thị tính toán tĩnh | Tích hợp tốt với hạ tầng TensorFlow | Tài nguyên để tối ưu hóa đồ thị tĩnh | Các trường hợp cần đồ thị tĩnh | Cập nhật song song với TensorFlow core | Các biện pháp bảo mật TensorFlow đã được kiểm chứng | Các tùy chọn tăng tốc TensorFlow |
| TF Edge TPU | Tối ưu hóa cho phần cứng Edge TPU của Google | Chỉ dành riêng cho thiết bị Edge TPU | Phát triển nhờ tài nguyên từ Google và bên thứ ba | Thiết bị IoT cần xử lý theo thời gian thực | Cải tiến cho phần cứng Edge TPU mới | Bảo mật IoT mạnh mẽ của Google | Được thiết kế riêng cho Google Coral |
| LiteRT | Tốc độ và hiệu quả trên nền tảng di động/nhúng/web | Hỗ trợ thiết bị di động, hệ thống nhúng, edge và trình duyệt | Cộng đồng vững mạnh, được Google hậu thuẫn | Ứng dụng trên thiết bị cho Android, iOS và web | Các tính năng runtime trên thiết bị mới nhất | Suy luận an toàn trên thiết bị và trong trình duyệt | Tăng tốc GPU, DSP và WebGPU |
| PaddlePaddle | Có tính cạnh tranh, dễ sử dụng và mở rộng linh hoạt | Hệ sinh thái Baidu, hỗ trợ ứng dụng rộng rãi | Phát triển nhanh, đặc biệt tại Trung Quốc | Thị trường Trung Quốc và xử lý ngôn ngữ | Tập trung vào ứng dụng AI tiếng Trung | Chú trọng quyền riêng tư và bảo mật dữ liệu | Bao gồm chip Kunlun của Baidu |
| MNN | Hiệu năng cao trên thiết bị di động | Hệ thống ARM di động và nhúng cùng CPU X86-64 | Cộng đồng ML di động/nhúng | Hiệu quả trên hệ thống di động | Duy trì hiệu năng cao trên thiết bị di động | Lợi thế bảo mật trên thiết bị | Tối ưu hóa cho CPU và GPU ARM |
| NCNN | Tối ưu hóa cho thiết bị di động dùng ARM | Hệ thống ARM di động và nhúng | Cộng đồng ML di động/nhúng chuyên biệt nhưng năng động | Hiệu quả trên hệ thống Android và ARM | Duy trì hiệu năng cao trên ARM | Lợi thế bảo mật trên thiết bị | Tối ưu hóa cho CPU và GPU ARM |
| Sony IMX500 | Suy luận trên cảm biến với mức tiêu thụ điện năng rất thấp | Cảm biến Sony IMX500, Raspberry Pi AI Camera | Hệ sinh thái Sony AITRIOS | AI edge trên camera | Cập nhật SDK Sony và bộ công cụ MCT | Dữ liệu được lưu trên cảm biến | Bộ tăng tốc tích hợp chip Sony IMX500 |
| Rockchip RKNN | Tối ưu hóa cho NPU Rockchip | Bo mạch SoC Rockchip (ví dụ: RK3588) | Cộng đồng nhà phát triển Rockchip | SBC nhúng và thiết bị edge | Cập nhật Rockchip RKNN-Toolkit | Suy luận cục bộ trên thiết bị | NPU Rockchip |
| ExecuTorch | Runtime PyTorch hiệu quả trên thiết bị | iOS, Android, hệ thống nhúng thông qua XNNPACK | Được dự án PyTorch hậu thuẫn | Ứng dụng di động và nhúng | Được duy trì song song với PyTorch | Suy luận trên thiết bị giúp dữ liệu luôn ở cục bộ | XNNPACK và backend CPU/GPU di động |
| Axelera AI | Thông lượng rất cao (lên đến 856 TOPS) | Metis AIPU qua PCIe hoặc M.2 | SDK Axelera Voyager | Suy luận edge thông lượng cao | Cập nhật Axelera SDK | Suy luận edge tại chỗ | Axelera Metis AIPU |
| DEEPX | Suy luận NPU tối ưu hóa INT8 | Phần cứng NPU DEEPX | Công cụ dành cho nhà phát triển DEEPX (dx_com, dx_engine) | Suy luận edge nhúng | Cập nhật DEEPX SDK và runtime | Suy luận cục bộ trên thiết bị | DEEPX NPU |
| Qualcomm QNN | Suy luận Snapdragon nhanh ngay trên thiết bị | Snapdragon Hexagon NPU, Adreno GPU, CPU | Hệ sinh thái Qualcomm AI Hub | Thiết bị Snapdragon di động và edge | Cập nhật Qualcomm AI stack (QAIRT) | Suy luận trên thiết bị giúp dữ liệu luôn ở cục bộ | Snapdragon Hexagon NPU |
| Hailo | Suy luận INT8 HEF trên Hailo NPU | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler và HailoRT | Camera, robot, hệ thống edge công nghiệp | Các bản phát hành Hailo DFC và HailoRT | Suy luận cục bộ trên thiết bị | Hailo NPU |
| Huawei Ascend | Thông lượng cao hơn trên Ascend AI Core | Bo mạch Atlas và OrangePi AIPro | Hệ sinh thái Huawei CANN | Suy luận edge trên Ascend NPU | Các bản phát hành CANN và ATC | Suy luận cục bộ trên thiết bị | Ascend AI Core |
| AMD Xilinx | Inference INT8 trên NPU Versal AI Edge Gen 2 | Versal AI Edge Series Gen 2 (VEK385) | AMD Vitis AI và Quark | Thị giác nhúng trên SoC thích ứng | Các bản phát hành Vitis AI và Quark | Suy luận cục bộ trên thiết bị | NPU Versal AI Engine |
Phần so sánh này cung cấp cho bạn cái nhìn tổng quan. Khi triển khai, hãy cân nhắc các yêu cầu và giới hạn cụ thể của dự án so với từng lựa chọn, đồng thời tham khảo hướng dẫn tích hợp được liên kết cho định dạng bạn chọn.
Kết luận#
Nhiều định dạng xuất của YOLO26 cho phép bạn tùy chỉnh model cho hầu hết mọi môi trường, từ máy chủ GPU trên cloud đến camera edge gắn trên cảm biến. Sau khi chọn định dạng, hãy làm theo các phương pháp tốt nhất khi triển khai model để tối ưu hóa, khắc phục sự cố và bảo mật, đồng thời tìm đến cộng đồng Ultralytics khi gặp khó khăn.
Câu hỏi thường gặp#
Ultralytics YOLO26 hỗ trợ nhiều định dạng triển khai, mỗi định dạng được thiết kế cho những môi trường và nền tảng phần cứng cụ thể. Các định dạng chính gồm:
- PyTorch phù hợp cho nghiên cứu và tạo nguyên mẫu, với khả năng tích hợp Python tuyệt vời.
- TorchScript dành cho môi trường production không có Python.
- ONNX hỗ trợ khả năng tương thích đa nền tảng và tăng tốc phần cứng.
- OpenVINO giúp tối ưu hiệu năng trên phần cứng Intel.
- TensorRT cho khả năng suy luận tốc độ cao trên GPU NVIDIA.
Mỗi định dạng có những ưu điểm riêng. Để xem hướng dẫn chi tiết từng bước, hãy tham khảo tài liệu về quy trình xuất model.
Để tăng tốc độ suy luận trên CPU Intel, bạn có thể triển khai model YOLO26 bằng bộ công cụ OpenVINO của Intel. OpenVINO giúp tăng đáng kể hiệu năng bằng cách tối ưu hóa model để tận dụng hiệu quả phần cứng Intel.
- Chuyển đổi model YOLO26 sang định dạng OpenVINO bằng hàm
model.export(). - Làm theo hướng dẫn thiết lập chi tiết trong tài liệu xuất model sang Intel OpenVINO.
Để tìm hiểu thêm, hãy xem bài viết trên blog của chúng tôi.
- Chuyển đổi model YOLO26 sang định dạng OpenVINO bằng hàm
Có, bạn có thể triển khai model YOLO26 trên thiết bị di động bằng LiteRT (trước đây là TensorFlow Lite) và NCNN trên Android, cũng như CoreML hoặc LiteRT trên iOS. LiteRT là runtime trên thiết bị của Google dành cho thiết bị di động và thiết bị nhúng; runtime này chạy cùng một model trên Android, iOS và trình duyệt, giúp suy luận trực tiếp trên thiết bị hiệu quả.
Ví dụfrom ultralytics import YOLO model = YOLO("yolo26n.pt") # Lệnh xuất sang định dạng NCNN model.export(format="ncnn")Để biết thêm chi tiết về cách triển khai model trên thiết bị di động, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.
Khi chọn định dạng triển khai cho YOLO26, hãy cân nhắc các yếu tố sau:
- Hiệu năng: Một số định dạng như TensorRT mang lại tốc độ vượt trội trên GPU NVIDIA, trong khi OpenVINO được tối ưu cho phần cứng Intel.
- Khả năng tương thích: ONNX tương thích rộng rãi với nhiều nền tảng khác nhau.
- Mức độ dễ tích hợp: Các định dạng như CoreML hoặc LiteRT được thiết kế riêng cho những hệ sinh thái cụ thể, lần lượt là iOS và Android.
- Hỗ trợ từ cộng đồng: Các định dạng như PyTorch và TensorFlow có nguồn tài liệu và hỗ trợ cộng đồng phong phú.
Để xem phân tích so sánh, hãy tham khảo tài liệu về các định dạng xuất của chúng tôi.
Để triển khai model YOLO26 trong ứng dụng web, bạn có thể dùng LiteRT.js, runtime web của LiteRT, cho phép chạy model machine learning trực tiếp trong trình duyệt và Node.js. Phương pháp này loại bỏ nhu cầu về hạ tầng backend và mang lại hiệu năng theo thời gian thực.
- Xuất model YOLO26 sang định dạng LiteRT.
- Tích hợp model đã xuất vào ứng dụng web bằng LiteRT.js.
Để xem hướng dẫn từng bước, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.