Ultralytics YOLO27:
Get Started

Phân tích so sánh các tùy chọn triển khai YOLO26#

YOLO26 hỗ trợ hơn 20 tùy chọn triển khai, mỗi tùy chọn được tối ưu cho một runtime, phần cứng đích hoặc nền tảng khác nhau — từ PyTorch và ONNX đến TensorRT, OpenVINO, CoreML và các định dạng NPU biên chuyên dụng. Việc chọn tùy chọn phù hợp cần cân bằng tốc độ suy luận, giới hạn phần cứng và mức độ dễ tích hợp. Hướng dẫn này so sánh mọi tùy chọn để bạn có thể chọn phương án phù hợp nhất cho ứng dụng của mình, sau đó tham khảo các phương pháp tốt nhất khi triển khai model để triển khai đáng tin cậy.



Xem: Cách chọn định dạng triển khai Ultralytics YOLO26 phù hợp nhất cho dự án của bạn | TensorRT | OpenVINO 🚀

Triển khai là giai đoạn trong quy trình dự án thị giác máy tính mà model đã huấn luyện bắt đầu thực hiện công việc thực tế, vì vậy định dạng xuất có ảnh hưởng trực tiếp đến tốc độ, chi phí và tính di động.

Cách chọn tùy chọn triển khai phù hợp cho model YOLO26 của bạn#

Khi đến lúc triển khai model YOLO26, việc chọn định dạng export phù hợp là rất quan trọng. Như được trình bày trong tài liệu export Ultralytics YOLO26, hàm model.export() chuyển đổi model đã huấn luyện sang nhiều định dạng phù hợp với các môi trường và yêu cầu hiệu năng khác nhau.

Định dạng lý tưởng phụ thuộc vào bối cảnh vận hành dự kiến của model và phần cứng.

Bỏ qua bước export thủ công

Để triển khai được quản lý mà không cần export thủ công, Ultralytics Platform cung cấp các endpoint suy luận sẵn sàng sử dụng với khả năng tự động mở rộng quy mô trên 42 khu vực toàn cầu.

Các tùy chọn triển khai của YOLO26#

Sau đây là mô tả ngắn về từng định dạng và thời điểm nên sử dụng. Để xem hướng dẫn export đầy đủ, hãy tham khảo tài liệu export; để xem các tiêu chí được đặt cạnh nhau, hãy chuyển đến bảng so sánh.

  • PyTorch (.pt): Định dạng huấn luyện và suy luận gốc, mang lại độ linh hoạt tối đa và khả năng tăng tốc GPU thông qua NVIDIA CUDA hoặc AMD ROCm — lý tưởng cho nghiên cứu và tạo prototype mà không cần bước export.
  • TorchScript (torchscript): Tuần tự hóa model để chạy trên runtime C++ không cần Python, phù hợp với các hệ thống production không có Python.
  • ONNX (onnx): Định dạng trao đổi không phụ thuộc framework, hỗ trợ rộng rãi nhiều nền tảng và phần cứng thông qua ONNX Runtime, bao gồm GPU NVIDIA qua CUDA và GPU AMD qua MIGraphX.
  • OpenVINO (openvino): Bộ công cụ của Intel để tối ưu suy luận trên CPU, GPU tích hợp và NPU Intel, thường được dùng trong IoT và điện toán biên.
  • TensorRT (engine): Runtime hiệu năng cao của NVIDIA, mang lại khả năng suy luận GPU hàng đầu với tối ưu hóa FP16 và INT8.
  • CoreML (coreml): Định dạng chạy trực tiếp trên thiết bị của Apple dành cho iOS, macOS, watchOS và tvOS, sử dụng Apple Neural Engine.
  • Core AI (coreai): Định dạng .aimodel mới của Apple dành cho iOS 27 và macOS 27, được lên lịch chạy trên CPU, GPU và Apple Neural Engine; để export, cần macOS 26 trở lên trên Apple silicon hoặc x86_64 Linux với glibc 2.34 trở lên, cùng Python 3.11 đến 3.14.
  • TF SavedModel (saved_model): Định dạng tiêu chuẩn của TensorFlow để phục vụ model phía máy chủ có khả năng mở rộng với TensorFlow Serving.
  • TF GraphDef (pb): Định dạng TensorFlow đồ thị tĩnh đã đóng băng dành cho các môi trường cần đồ thị tính toán cố định.
  • TF Edge TPU (edgetpu): Biên dịch model .tflite cho bộ tăng tốc Google Coral Edge TPU.
  • LiteRT (litert): Runtime chạy trực tiếp trên thiết bị của Google (trước đây là TensorFlow Lite) dành cho suy luận trên thiết bị di động, hệ thống nhúng và trình duyệt từ một model .tflite duy nhất, hỗ trợ FP32 và INT8, đồng thời thực thi trong trình duyệt thông qua LiteRT.js.
  • PaddlePaddle (paddle): Framework deep learning của Baidu, phổ biến tại Trung Quốc và hỗ trợ rộng rãi nhiều phần cứng.
  • MNN (mnn): Engine suy luận gọn nhẹ, hiệu năng cao, được tối ưu cho các hệ thống di động và nhúng ARM, x86-64.
  • NCNN (ncnn): Framework suy luận gọn nhẹ, hiệu năng cao, được tối ưu cho thiết bị di động ARM.
  • Sony IMX500 (imx): Export model cho cảm biến thị giác thông minh IMX500 của Sony với khả năng xử lý trên chip, chẳng hạn như Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Nhắm đến NPU Rockchip trên các bo mạch nhúng với lượng tử hóa FP16 và INT8.
  • ExecuTorch (executorch): Runtime chạy trực tiếp trên thiết bị gốc của PyTorch dành cho thiết bị di động (iOS và Android) và hệ thống nhúng thông qua XNNPACK.
  • Axelera AI (axelera): Biên dịch cho AIPU Metis của Axelera (tối đa 856 TOPS) qua PCIe hoặc M.2 để suy luận biên thông lượng cao.
  • DEEPX (deepx): Nhắm đến phần cứng NPU DEEPX với lượng tử hóa INT8 để suy luận biên trên hệ thống nhúng.
  • Qualcomm QNN (qnn): Suy luận trực tiếp trên thiết bị với NPU Snapdragon Hexagon, GPU Adreno và CPU thông qua bộ công cụ AI của Qualcomm.

Tích hợp Hailo export trực tiếp các model YOLO detection, segmentation, semantic segmentation, depth estimation, classification, pose và OBB sang Hailo HEF; xem bảng tương thích để biết các model và mục tiêu đã được xác thực. Tích hợp Ambarella sử dụng quy trình ưu tiên ONNX và biên dịch các bản export ONNX sang format AmbaPB bằng toolchain CVflow của Ambarella dành cho các SoC CVflow® như CV72, có thể sử dụng thêm quá trình huấn luyện nhận biết nén SpongeTorch. Tích hợp Huawei Ascend biên dịch các bản export ONNX sang format offline .om bằng compiler CANN ATC để inference FP16 trên Ascend AI Processors. Tích hợp AMD Xilinx lượng tử hóa các bản export ONNX bằng AMD Quark cho NPU dòng Versal AI Edge Series Gen 2; Vitis AI Execution Provider biên dịch các bản export này thành model .rai.

So sánh các tùy chọn triển khai#

Bảng sau đây tóm tắt các tùy chọn triển khai cho model YOLO26 theo những tiêu chí thường quyết định lựa chọn. Để tìm hiểu sâu về từng định dạng, hãy xem tài liệu về định dạng export.

Tùy chọn triển khaiĐánh giá hiệu năngKhả năng tương thích và tích hợpHỗ trợ cộng đồng và hệ sinh tháiNghiên cứu tình huốngBảo trì và cập nhậtCác cân nhắc về bảo mậtTăng tốc phần cứng
PyTorchTính linh hoạt khá tốt; có thể phải đánh đổi hiệu năng thuầnTương thích xuất sắc với thư viện PythonTài nguyên và cộng đồng phong phúNghiên cứu và prototypePhát triển thường xuyên, tích cựcPhụ thuộc vào môi trường triển khaiHỗ trợ CUDA để tăng tốc GPU
TorchScriptPhù hợp với production hơn PyTorchChuyển đổi mượt mà từ PyTorch sang C++Chuyên biệt nhưng phạm vi hẹp hơn PyTorchCác ngành mà Python là điểm nghẽnCập nhật đồng bộ với PyTorchBảo mật được cải thiện mà không cần Python đầy đủKế thừa hỗ trợ CUDA từ PyTorch
ONNXThay đổi tùy theo runtimeKhả năng tương thích cao giữa các frameworkHệ sinh thái rộng, được nhiều tổ chức hỗ trợTính linh hoạt giữa các framework MLCập nhật thường xuyên để hỗ trợ các phép toán mớiĐảm bảo thực hành chuyển đổi và triển khai an toànNhiều phương thức tối ưu hóa phần cứng
OpenVINOĐược tối ưu cho phần cứng IntelTốt nhất trong hệ sinh thái IntelVững mạnh trong lĩnh vực thị giác máy tínhIoT và edge với phần cứng IntelCập nhật thường xuyên cho phần cứng IntelCác tính năng mạnh mẽ cho ứng dụng nhạy cảmTùy chỉnh cho phần cứng Intel
TensorRTHiệu năng hàng đầu trên GPU NVIDIATốt nhất cho phần cứng NVIDIAMạng lưới hỗ trợ mạnh mẽ từ NVIDIASuy luận video và hình ảnh theo thời gian thựcCập nhật thường xuyên cho GPU mớiChú trọng bảo mậtĐược thiết kế cho GPU NVIDIA
CoreMLTối ưu hóa cho phần cứng Apple trên thiết bịChỉ dành riêng cho hệ sinh thái AppleHỗ trợ mạnh mẽ từ Apple và nhà phát triểnML trên thiết bị AppleCập nhật thường xuyên từ AppleChú trọng quyền riêng tư và bảo mậtNeural Engine và GPU của Apple
Core AITối ưu hóa cho Apple siliconiOS 27 và macOS 27; xuất trên macOS chạy Apple silicon từ phiên bản 26 trở lên hoặc Linux x86_64 (glibc 2.34 trở lên), Python 3.11-3.14Framework của Apple; tùy chọn bật trong SDK iOS/FlutterML trên thiết bị trên các nền tảng Apple thế hệ tiếp theoGắn liền với các bản phát hành hệ điều hành Apple; hiện đang ở giai đoạn betaSuy luận trên thiết bị giúp dữ liệu luôn ở cục bộApple Neural Engine, GPU và CPU
TF SavedModelCó khả năng mở rộng trong môi trường máy chủKhả năng tương thích rộng trong hệ sinh thái TensorFlowĐược hỗ trợ rộng rãi nhờ TensorFlow phổ biếnPhục vụ model ở quy mô lớnCập nhật thường xuyên từ Google và cộng đồngCác tính năng mạnh mẽ dành cho doanh nghiệpNhiều phương thức tăng tốc phần cứng
TF GraphDefỔn định với đồ thị tính toán tĩnhTích hợp tốt với hạ tầng TensorFlowTài nguyên để tối ưu hóa đồ thị tĩnhCác trường hợp cần đồ thị tĩnhCập nhật song song với TensorFlow coreCác biện pháp bảo mật TensorFlow đã được kiểm chứngCác tùy chọn tăng tốc TensorFlow
TF Edge TPUTối ưu hóa cho phần cứng Edge TPU của GoogleChỉ dành riêng cho thiết bị Edge TPUPhát triển nhờ tài nguyên từ Google và bên thứ baThiết bị IoT cần xử lý theo thời gian thựcCải tiến cho phần cứng Edge TPU mớiBảo mật IoT mạnh mẽ của GoogleĐược thiết kế riêng cho Google Coral
LiteRTTốc độ và hiệu quả trên nền tảng di động/nhúng/webHỗ trợ thiết bị di động, hệ thống nhúng, edge và trình duyệtCộng đồng vững mạnh, được Google hậu thuẫnỨng dụng trên thiết bị cho Android, iOS và webCác tính năng runtime trên thiết bị mới nhấtSuy luận an toàn trên thiết bị và trong trình duyệtTăng tốc GPU, DSP và WebGPU
PaddlePaddleCó tính cạnh tranh, dễ sử dụng và mở rộng linh hoạtHệ sinh thái Baidu, hỗ trợ ứng dụng rộng rãiPhát triển nhanh, đặc biệt tại Trung QuốcThị trường Trung Quốc và xử lý ngôn ngữTập trung vào ứng dụng AI tiếng TrungChú trọng quyền riêng tư và bảo mật dữ liệuBao gồm chip Kunlun của Baidu
MNNHiệu năng cao trên thiết bị di độngHệ thống ARM di động và nhúng cùng CPU X86-64Cộng đồng ML di động/nhúngHiệu quả trên hệ thống di độngDuy trì hiệu năng cao trên thiết bị di độngLợi thế bảo mật trên thiết bịTối ưu hóa cho CPU và GPU ARM
NCNNTối ưu hóa cho thiết bị di động dùng ARMHệ thống ARM di động và nhúngCộng đồng ML di động/nhúng chuyên biệt nhưng năng độngHiệu quả trên hệ thống Android và ARMDuy trì hiệu năng cao trên ARMLợi thế bảo mật trên thiết bịTối ưu hóa cho CPU và GPU ARM
Sony IMX500Suy luận trên cảm biến với mức tiêu thụ điện năng rất thấpCảm biến Sony IMX500, Raspberry Pi AI CameraHệ sinh thái Sony AITRIOSAI edge trên cameraCập nhật SDK Sony và bộ công cụ MCTDữ liệu được lưu trên cảm biếnBộ tăng tốc tích hợp chip Sony IMX500
Rockchip RKNNTối ưu hóa cho NPU RockchipBo mạch SoC Rockchip (ví dụ: RK3588)Cộng đồng nhà phát triển RockchipSBC nhúng và thiết bị edgeCập nhật Rockchip RKNN-ToolkitSuy luận cục bộ trên thiết bịNPU Rockchip
ExecuTorchRuntime PyTorch hiệu quả trên thiết bịiOS, Android, hệ thống nhúng thông qua XNNPACKĐược dự án PyTorch hậu thuẫnỨng dụng di động và nhúngĐược duy trì song song với PyTorchSuy luận trên thiết bị giúp dữ liệu luôn ở cục bộXNNPACK và backend CPU/GPU di động
Axelera AIThông lượng rất cao (lên đến 856 TOPS)Metis AIPU qua PCIe hoặc M.2SDK Axelera VoyagerSuy luận edge thông lượng caoCập nhật Axelera SDKSuy luận edge tại chỗAxelera Metis AIPU
DEEPXSuy luận NPU tối ưu hóa INT8Phần cứng NPU DEEPXCông cụ dành cho nhà phát triển DEEPX (dx_com, dx_engine)Suy luận edge nhúngCập nhật DEEPX SDK và runtimeSuy luận cục bộ trên thiết bịDEEPX NPU
Qualcomm QNNSuy luận Snapdragon nhanh ngay trên thiết bịSnapdragon Hexagon NPU, Adreno GPU, CPUHệ sinh thái Qualcomm AI HubThiết bị Snapdragon di động và edgeCập nhật Qualcomm AI stack (QAIRT)Suy luận trên thiết bị giúp dữ liệu luôn ở cục bộSnapdragon Hexagon NPU
HailoSuy luận INT8 HEF trên Hailo NPUHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler và HailoRTCamera, robot, hệ thống edge công nghiệpCác bản phát hành Hailo DFC và HailoRTSuy luận cục bộ trên thiết bịHailo NPU
Huawei AscendThông lượng cao hơn trên Ascend AI CoreBo mạch Atlas và OrangePi AIProHệ sinh thái Huawei CANNSuy luận edge trên Ascend NPUCác bản phát hành CANN và ATCSuy luận cục bộ trên thiết bịAscend AI Core
AMD XilinxInference INT8 trên NPU Versal AI Edge Gen 2Versal AI Edge Series Gen 2 (VEK385)AMD Vitis AI và QuarkThị giác nhúng trên SoC thích ứngCác bản phát hành Vitis AI và QuarkSuy luận cục bộ trên thiết bịNPU Versal AI Engine

Phần so sánh này cung cấp cho bạn cái nhìn tổng quan. Khi triển khai, hãy cân nhắc các yêu cầu và giới hạn cụ thể của dự án so với từng lựa chọn, đồng thời tham khảo hướng dẫn tích hợp được liên kết cho định dạng bạn chọn.

Kết luận#

Nhiều định dạng xuất của YOLO26 cho phép bạn tùy chỉnh model cho hầu hết mọi môi trường, từ máy chủ GPU trên cloud đến camera edge gắn trên cảm biến. Sau khi chọn định dạng, hãy làm theo các phương pháp tốt nhất khi triển khai model để tối ưu hóa, khắc phục sự cố và bảo mật, đồng thời tìm đến cộng đồng Ultralytics khi gặp khó khăn.

Câu hỏi thường gặp#

  • Ultralytics YOLO26 hỗ trợ nhiều định dạng triển khai, mỗi định dạng được thiết kế cho những môi trường và nền tảng phần cứng cụ thể. Các định dạng chính gồm:

    • PyTorch phù hợp cho nghiên cứu và tạo nguyên mẫu, với khả năng tích hợp Python tuyệt vời.
    • TorchScript dành cho môi trường production không có Python.
    • ONNX hỗ trợ khả năng tương thích đa nền tảng và tăng tốc phần cứng.
    • OpenVINO giúp tối ưu hiệu năng trên phần cứng Intel.
    • TensorRT cho khả năng suy luận tốc độ cao trên GPU NVIDIA.

    Mỗi định dạng có những ưu điểm riêng. Để xem hướng dẫn chi tiết từng bước, hãy tham khảo tài liệu về quy trình xuất model.

  • Để tăng tốc độ suy luận trên CPU Intel, bạn có thể triển khai model YOLO26 bằng bộ công cụ OpenVINO của Intel. OpenVINO giúp tăng đáng kể hiệu năng bằng cách tối ưu hóa model để tận dụng hiệu quả phần cứng Intel.

    1. Chuyển đổi model YOLO26 sang định dạng OpenVINO bằng hàm model.export().
    2. Làm theo hướng dẫn thiết lập chi tiết trong tài liệu xuất model sang Intel OpenVINO.

    Để tìm hiểu thêm, hãy xem bài viết trên blog của chúng tôi.

  • Có, bạn có thể triển khai model YOLO26 trên thiết bị di động bằng LiteRT (trước đây là TensorFlow Lite) và NCNN trên Android, cũng như CoreML hoặc LiteRT trên iOS. LiteRT là runtime trên thiết bị của Google dành cho thiết bị di động và thiết bị nhúng; runtime này chạy cùng một model trên Android, iOS và trình duyệt, giúp suy luận trực tiếp trên thiết bị hiệu quả.

    Ví dụ
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # Lệnh xuất sang định dạng NCNN
    model.export(format="ncnn")

    Để biết thêm chi tiết về cách triển khai model trên thiết bị di động, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.

  • Khi chọn định dạng triển khai cho YOLO26, hãy cân nhắc các yếu tố sau:

    • Hiệu năng: Một số định dạng như TensorRT mang lại tốc độ vượt trội trên GPU NVIDIA, trong khi OpenVINO được tối ưu cho phần cứng Intel.
    • Khả năng tương thích: ONNX tương thích rộng rãi với nhiều nền tảng khác nhau.
    • Mức độ dễ tích hợp: Các định dạng như CoreML hoặc LiteRT được thiết kế riêng cho những hệ sinh thái cụ thể, lần lượt là iOS và Android.
    • Hỗ trợ từ cộng đồng: Các định dạng như PyTorch và TensorFlow có nguồn tài liệu và hỗ trợ cộng đồng phong phú.

    Để xem phân tích so sánh, hãy tham khảo tài liệu về các định dạng xuất của chúng tôi.

  • Để triển khai model YOLO26 trong ứng dụng web, bạn có thể dùng LiteRT.js, runtime web của LiteRT, cho phép chạy model machine learning trực tiếp trong trình duyệt và Node.js. Phương pháp này loại bỏ nhu cầu về hạ tầng backend và mang lại hiệu năng theo thời gian thực.

    1. Xuất model YOLO26 sang định dạng LiteRT.
    2. Tích hợp model đã xuất vào ứng dụng web bằng LiteRT.js.

    Để xem hướng dẫn từng bước, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.

Bình luận