Ultralytics YOLO27:

Phân tích so sánh các tùy chọn triển khai YOLO26#

YOLO26 hỗ trợ hơn 20 tùy chọn triển khai, mỗi tùy chọn được tối ưu cho một runtime, phần cứng đích hoặc nền tảng khác nhau — từ PyTorch và ONNX đến TensorRT, OpenVINO, CoreML và các format dành riêng cho edge-NPU. Việc chọn tùy chọn phù hợp đòi hỏi cân bằng giữa tốc độ inference, giới hạn phần cứng và mức độ dễ dàng tích hợp. Hướng dẫn này so sánh mọi tùy chọn để bạn có thể chọn phương án phù hợp nhất cho ứng dụng của mình, sau đó tham khảo các phương pháp hay nhất để triển khai model nhằm triển khai đáng tin cậy.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Deployment là giai đoạn trong quy trình dự án computer vision khi model đã train bắt đầu thực hiện công việc thực tế, vì vậy format mà bạn export có ảnh hưởng trực tiếp đến tốc độ, chi phí và khả năng chuyển đổi nền tảng.

Cách chọn tùy chọn triển khai phù hợp cho model YOLO26#

Khi đến lúc triển khai model YOLO26, việc chọn format export phù hợp là rất quan trọng. Như đã nêu trong tài liệu export Ultralytics YOLO26, hàm model.export() chuyển đổi model đã train của bạn sang nhiều format khác nhau, được điều chỉnh cho các môi trường và yêu cầu hiệu năng đa dạng.

Format lý tưởng phụ thuộc vào bối cảnh vận hành dự kiến của model và phần cứng.

Bỏ qua bước export thủ công

Để deployment được quản lý mà không cần export thủ công, Ultralytics Platform cung cấp các inference endpoint sẵn sàng sử dụng với khả năng tự động scale trên 42 khu vực toàn cầu.

Các tùy chọn triển khai YOLO26#

Dưới đây là mô tả ngắn về từng format và thời điểm nên sử dụng format đó. Để xem toàn bộ quy trình export, hãy tham khảo tài liệu export; để xem các tiêu chí cạnh nhau, chuyển đến bảng so sánh.

  • PyTorch (.pt): Format native cho training và inference, mang lại tính linh hoạt tối đa cùng khả năng tăng tốc GPU thông qua NVIDIA CUDA hoặc AMD ROCm — lý tưởng cho nghiên cứu và prototyping mà không cần bước export.
  • TorchScript (torchscript): Serialize model để chạy trên runtime C++ không cần Python, phù hợp với các hệ thống production nơi không có Python.
  • ONNX (onnx): Format trao đổi độc lập với framework, hỗ trợ rộng rãi trên nhiều nền tảng và phần cứng thông qua ONNX Runtime.
  • OpenVINO (openvino): Bộ công cụ của Intel cho inference tối ưu trên CPU, GPU tích hợp và NPU Intel, thường được sử dụng trong IoT và edge computing.
  • TensorRT (engine): Runtime hiệu năng cao của NVIDIA, cung cấp inference GPU hàng đầu với tối ưu hóa FP16 và INT8.
  • CoreML (coreml): Format on-device của Apple cho iOS, macOS, watchOS và tvOS, sử dụng Apple Neural Engine.
  • TF SavedModel (saved_model): Format tiêu chuẩn của TensorFlow để serving phía server có khả năng scale với TensorFlow Serving.
  • TF GraphDef (pb): Format TensorFlow static graph đã freeze cho các môi trường yêu cầu computation graph cố định.
  • TF Edge TPU (edgetpu): Compile các model .tflite cho bộ tăng tốc Google Coral Edge TPU.
  • LiteRT (litert): Runtime on-device của Google (trước đây là TensorFlow Lite) cho inference trên mobile, thiết bị nhúng và trình duyệt từ một model .tflite duy nhất, hỗ trợ FP32 và INT8 cùng khả năng thực thi trong trình duyệt thông qua LiteRT.js.
  • PaddlePaddle (paddle): Framework deep learning của Baidu, phổ biến tại Trung Quốc, với khả năng hỗ trợ phần cứng rộng rãi.
  • MNN (mnn): Inference engine nhẹ, hiệu năng cao, được tối ưu cho các hệ thống ARM và x86-64 mobile và nhúng.
  • NCNN (ncnn): Framework inference nhẹ, hiệu năng cao, được tối ưu cho các thiết bị ARM mobile.
  • Sony IMX500 (imx): Export cho cảm biến vision thông minh Sony IMX500 với khả năng xử lý on-chip, chẳng hạn như Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Nhắm đến các NPU Rockchip trên bo mạch nhúng với lượng tử hóa FP16 và INT8.
  • ExecuTorch (executorch): Runtime on-device native của PyTorch cho mobile (iOS và Android) và các hệ thống nhúng thông qua XNNPACK.
  • Axelera AI (axelera): Compile cho AIPU Metis của Axelera (lên đến 856 TOPS) qua PCIe hoặc M.2 để inference edge throughput cao.
  • DEEPX (deepx): Nhắm đến phần cứng NPU DEEPX với lượng tử hóa INT8 cho inference edge nhúng.
  • Qualcomm QNN (qnn): Inference on-device trên Snapdragon Hexagon NPU, Adreno GPU và CPU thông qua stack Qualcomm AI.
  • Core AI (coreai): Định dạng .aimodel mới của Apple dành cho iOS 27 và macOS 27, được lên lịch chạy trên CPU, GPU và Apple Neural Engine; việc xuất file yêu cầu macOS 26 trở lên trên Apple silicon.

Tích hợp Hailo export trực tiếp các model YOLO detection, segmentation, semantic segmentation, depth estimation, classification, pose và OBB sang Hailo HEF; xem bảng tương thích để biết các model và target đã được xác thực. Tích hợp Ambarella tuân theo workflow ONNX-first và compile các bản export ONNX sang format AmbaPB bằng toolchain CVflow của Ambarella cho các SoC CVflow® như CV72, tùy chọn sử dụng training nhận biết nén SpongeTorch. Tích hợp Huawei Ascend compile các bản export ONNX sang format offline .om bằng compiler CANN ATC để inference FP16 trên Ascend AI Processors.

So sánh các tùy chọn triển khai#

Bảng dưới đây tóm tắt các tùy chọn triển khai cho model YOLO26 theo những tiêu chí thường quyết định lựa chọn. Để xem chi tiết từng format, hãy tham khảo tài liệu về các format export.

Tùy chọn triển khaiBenchmark hiệu năngKhả năng tương thích và tích hợpHỗ trợ cộng đồng và hệ sinh tháiCác nghiên cứu tình huốngBảo trì và cập nhậtCác cân nhắc về bảo mậtTăng tốc phần cứng
PyTorchTính linh hoạt tốt; có thể đánh đổi hiệu năng thuần túyTương thích xuất sắc với các thư viện PythonTài nguyên và cộng đồng phong phúNghiên cứu và prototypePhát triển thường xuyên, tích cựcPhụ thuộc vào môi trường deploymentHỗ trợ CUDA để tăng tốc GPU
TorchScriptPhù hợp với production hơn PyTorchChuyển đổi mượt mà từ PyTorch sang C++Chuyên biệt nhưng hẹp hơn PyTorchCác ngành mà Python là điểm nghẽnCập nhật nhất quán cùng PyTorchBảo mật được cải thiện mà không cần Python đầy đủKế thừa hỗ trợ CUDA từ PyTorch
ONNXThay đổi tùy theo runtimeCao trên các framework khác nhauHệ sinh thái rộng, được nhiều tổ chức hỗ trợLinh hoạt giữa các framework MLCập nhật thường xuyên cho các operation mớiĐảm bảo thực hành chuyển đổi và deployment an toànNhiều tối ưu hóa phần cứng
OpenVINOĐược tối ưu cho phần cứng IntelTốt nhất trong hệ sinh thái IntelVững chắc trong lĩnh vực computer visionIoT và edge với phần cứng IntelCập nhật thường xuyên cho phần cứng IntelTính năng mạnh mẽ cho các ứng dụng nhạy cảmĐược điều chỉnh cho phần cứng Intel
TensorRTHàng đầu trên GPU NVIDIATốt nhất cho phần cứng NVIDIAMạng lưới hỗ trợ mạnh từ NVIDIAInference video và hình ảnh theo thời gian thựcCập nhật thường xuyên cho GPU mớiChú trọng bảo mậtĐược thiết kế cho GPU NVIDIA
CoreMLĐược tối ưu cho phần cứng Apple on-deviceĐộc quyền cho hệ sinh thái AppleHỗ trợ mạnh từ Apple và developerML on-device trên các sản phẩm AppleCập nhật thường xuyên từ AppleTập trung vào quyền riêng tư và bảo mậtApple Neural Engine và GPU
TF SavedModelCó khả năng scale trong môi trường serverTương thích rộng trong hệ sinh thái TensorFlowHỗ trợ lớn nhờ mức độ phổ biến của TensorFlowServing model ở quy mô lớnCập nhật thường xuyên từ Google và cộng đồngTính năng mạnh mẽ cho doanh nghiệpNhiều hình thức tăng tốc phần cứng
TF GraphDefỔn định cho static computation graphTích hợp tốt với hạ tầng TensorFlowTài nguyên để tối ưu static graphCác kịch bản yêu cầu static graphCập nhật cùng TensorFlow coreCác thực hành bảo mật TensorFlow đã được thiết lậpCác tùy chọn tăng tốc TensorFlow
TF Edge TPUĐược tối ưu hóa cho phần cứng Edge TPU của GoogleChỉ dành riêng cho các thiết bị Edge TPUPhát triển cùng các tài nguyên của Google và bên thứ baCác thiết bị IoT yêu cầu xử lý theo thời gian thựcCải tiến cho phần cứng Edge TPU mớiBảo mật IoT mạnh mẽ của GoogleĐược thiết kế riêng cho Google Coral
LiteRTTốc độ và hiệu suất trên thiết bị di động/nhúng/webHỗ trợ thiết bị di động, thiết bị nhúng, edge và trình duyệtCộng đồng mạnh mẽ, được Google hỗ trợỨng dụng trên thiết bị cho Android, iOS và webCác tính năng runtime trên thiết bị mới nhấtSuy luận an toàn trên thiết bị và trong trình duyệtTăng tốc GPU, DSP và WebGPU
PaddlePaddleCó tính cạnh tranh, dễ sử dụng và có khả năng mở rộngHệ sinh thái Baidu, hỗ trợ nhiều ứng dụngPhát triển nhanh chóng, đặc biệt tại Trung QuốcThị trường Trung Quốc và xử lý ngôn ngữTập trung vào các ứng dụng AI của Trung QuốcĐề cao quyền riêng tư và bảo mật dữ liệuBao gồm các chip Kunlun của Baidu
MNNHiệu suất cao cho thiết bị di độngCác hệ thống ARM di động và nhúng cùng CPU X86-64Cộng đồng ML di động/nhúngHiệu quả trên các hệ thống di độngDuy trì hiệu suất cao trên thiết bị di độngLợi thế bảo mật trên thiết bịTối ưu hóa cho CPU và GPU ARM
NCNNĐược tối ưu hóa cho các thiết bị di động dựa trên ARMCác hệ thống ARM di động và nhúngCộng đồng ML di động/nhúng chuyên biệt nhưng năng độngHiệu quả trên Android và các hệ thống ARMDuy trì hiệu suất cao trên ARMLợi thế bảo mật trên thiết bịTối ưu hóa cho CPU và GPU ARM
Sony IMX500Suy luận trên cảm biến với mức tiêu thụ điện năng rất thấpCảm biến Sony IMX500, Raspberry Pi AI CameraHệ sinh thái Sony AITRIOSAI edge trên cameraCác bản cập nhật SDK và toolchain MCT của SonyDữ liệu được giữ lại trên cảm biếnBộ tăng tốc tích hợp trên chip Sony IMX500
Rockchip RKNNĐược tối ưu hóa cho NPU RockchipBo mạch SoC Rockchip (ví dụ: RK3588)Cộng đồng nhà phát triển RockchipSBC nhúng và các thiết bị edgeCác bản cập nhật Rockchip RKNN-ToolkitSuy luận cục bộ trên thiết bịNPU Rockchip
ExecuTorchRuntime PyTorch trên thiết bị hiệu quảiOS, Android và thiết bị nhúng thông qua XNNPACKĐược hỗ trợ bởi dự án PyTorchỨng dụng di động và nhúngĐược duy trì song song với PyTorchSuy luận trên thiết bị giúp dữ liệu luôn cục bộCác backend CPU/GPU di động và XNNPACK
Axelera AIThông lượng rất cao (lên đến 856 TOPS)Metis AIPU qua PCIe hoặc M.2Axelera Voyager SDKSuy luận edge có thông lượng caoCác bản cập nhật Axelera SDKSuy luận edge tại chỗAxelera Metis AIPU
DEEPXSuy luận NPU được tối ưu hóa cho INT8Phần cứng NPU DEEPXCông cụ dành cho nhà phát triển DEEPX (dx_com, dx_engine)Suy luận edge nhúngCác bản cập nhật SDK và runtime DEEPXSuy luận cục bộ trên thiết bịNPU DEEPX
Qualcomm QNNSuy luận Snapdragon nhanh trên thiết bịNPU Snapdragon Hexagon, GPU Adreno, CPUHệ sinh thái Qualcomm AI HubCác thiết bị Snapdragon di động và edgeCác bản cập nhật stack AI của Qualcomm (QAIRT)Suy luận trên thiết bị giúp dữ liệu luôn cục bộNPU Snapdragon Hexagon
HailoSuy luận INT8 HEF trên NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler và HailoRTCamera, robot, hệ thống biên công nghiệpCác bản phát hành Hailo DFC và HailoRTSuy luận cục bộ trên thiết bịNPU Hailo
Huawei AscendThông lượng cao hơn trên Ascend AI CoreBo mạch Atlas và OrangePi AIProHệ sinh thái Huawei CANNSuy luận biên trên NPU AscendCác bản phát hành CANN và ATCSuy luận cục bộ trên thiết bịAscend AI Core
Core AIĐược tối ưu hóa cho Apple siliconiOS 27 và macOS 27; việc xuất file yêu cầu macOS 26+Framework của Apple; chưa có trong iOS/Flutter SDKML trên thiết bị cho các nền tảng Apple thế hệ tiếp theoGắn liền với các bản phát hành HĐH Apple; hiện đang ở giai đoạn betaSuy luận trên thiết bị giúp dữ liệu luôn cục bộApple Neural Engine, GPU và CPU

Bảng so sánh này cung cấp cho bạn tổng quan cấp cao. Khi triển khai, hãy cân nhắc các yêu cầu và ràng buộc cụ thể của dự án so với từng tùy chọn, đồng thời tham khảo hướng dẫn tích hợp được liên kết cho format bạn chọn.

Kết luận#

Phạm vi format export rộng của YOLO26 cho phép bạn điều chỉnh model cho gần như mọi môi trường, từ server GPU trên cloud đến camera edge trên cảm biến. Sau khi chọn format, hãy làm theo các phương pháp hay nhất khi triển khai model để tối ưu hóa, khắc phục sự cố và bảo mật, đồng thời tìm đến cộng đồng Ultralytics khi gặp vấn đề.

FAQ#

  • Ultralytics YOLO26 hỗ trợ nhiều format triển khai, mỗi format được thiết kế cho các môi trường và nền tảng phần cứng cụ thể. Các format chính bao gồm:

    • PyTorch dành cho nghiên cứu và tạo prototype, với khả năng tích hợp Python tuyệt vời.
    • TorchScript dành cho môi trường production nơi không có Python.
    • ONNX dành cho khả năng tương thích đa nền tảng và tăng tốc phần cứng.
    • OpenVINO dành cho hiệu suất được tối ưu hóa trên phần cứng Intel.
    • TensorRT dành cho suy luận tốc độ cao trên GPU NVIDIA.

    Mỗi format có những lợi thế riêng. Để xem hướng dẫn chi tiết, hãy tham khảo tài liệu về quy trình export của chúng tôi.

  • Để tăng tốc độ suy luận trên CPU Intel, bạn có thể triển khai model YOLO26 bằng toolkit OpenVINO của Intel. OpenVINO mang lại cải thiện hiệu suất đáng kể bằng cách tối ưu hóa model để khai thác phần cứng Intel một cách hiệu quả.

    1. Chuyển đổi model YOLO26 sang format OpenVINO bằng hàm model.export().
    2. Làm theo hướng dẫn thiết lập chi tiết trong tài liệu Intel OpenVINO Export.

    Để biết thêm thông tin, hãy xem bài viết trên blog của chúng tôi.

  • Có, các model YOLO26 có thể được triển khai trên thiết bị di động bằng LiteRT (trước đây là TensorFlow Lite) và NCNN cho Android, cũng như CoreML hoặc LiteRT cho iOS. LiteRT là runtime trên thiết bị của Google dành cho các thiết bị di động và nhúng, đồng thời chạy cùng một model trên Android, iOS và trình duyệt, mang lại khả năng inference hiệu quả trên thiết bị.

    Ví dụ
    # Export command for NCNN format
    model.export(format="ncnn")

    Để biết thêm chi tiết về việc triển khai model trên thiết bị di động, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.

  • Khi chọn format triển khai cho YOLO26, hãy cân nhắc các yếu tố sau:

    • Hiệu năng: Một số format như TensorRT cung cấp tốc độ vượt trội trên GPU NVIDIA, trong khi OpenVINO được tối ưu hóa cho phần cứng Intel.
    • Tính tương thích: ONNX có khả năng tương thích rộng trên nhiều nền tảng khác nhau.
    • Mức độ dễ tích hợp: Các format như CoreML hoặc LiteRT được thiết kế riêng cho những hệ sinh thái cụ thể như iOS và Android.
    • Hỗ trợ từ cộng đồng: Các format như PyTorch và TensorFlow có nguồn tài nguyên và hỗ trợ phong phú từ cộng đồng.

    Để xem phân tích so sánh, hãy tham khảo tài liệu về các format export của chúng tôi.

  • Để triển khai các model YOLO26 trong một ứng dụng web, bạn có thể sử dụng LiteRT.js, web runtime của LiteRT, cho phép chạy các model machine learning trực tiếp trong trình duyệt và Node.js. Cách tiếp cận này loại bỏ nhu cầu về hạ tầng backend và mang lại hiệu năng theo thời gian thực.

    1. Export model YOLO26 sang format LiteRT.
    2. Tích hợp model đã export vào ứng dụng web của bạn bằng LiteRT.js.

    Để xem hướng dẫn từng bước, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.

Bình luận