YOLO Vision 2026:

Phân tích so sánh các tùy chọn triển khai YOLO26#

YOLO26 hỗ trợ hơn 20 tùy chọn triển khai, mỗi tùy chọn được tối ưu cho một runtime, phần cứng mục tiêu hoặc nền tảng khác nhau — từ PyTorch và ONNX đến TensorRT, OpenVINO, CoreML, và các định dạng chuyên dụng cho NPU biên. Việc lựa chọn phương án phù hợp sẽ cân bằng giữa tốc độ inference, giới hạn phần cứng và độ dễ tích hợp. Hướng dẫn này so sánh từng tùy chọn để bạn có thể chọn giải pháp phù hợp nhất cho ứng dụng của mình, sau đó chuyển sang best practices triển khai mô hình để triển khai một cách đáng tin cậy.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Triển khai là giai đoạn trong quy trình dự án computer vision nơi mô hình đã được train bắt đầu thực hiện các tác vụ thực tế, vì vậy định dạng bạn xuất ra có tác động trực tiếp đến tốc độ, chi phí và tính di động.

Cách chọn tùy chọn triển khai phù hợp cho mô hình YOLO26 của bạn#

Khi đến lúc triển khai mô hình YOLO26 của bạn, việc lựa chọn định dạng xuất phù hợp là rất quan trọng. Như được nêu trong tài liệu xuất YOLO26 của Ultralytics, hàm model.export() chuyển đổi mô hình đã train của bạn thành nhiều định dạng khác nhau được tùy chỉnh cho các môi trường và yêu cầu hiệu suất đa dạng.

Định dạng lý tưởng phụ thuộc vào môi trường vận hành dự kiến và phần cứng của model.

Bỏ qua việc xuất thủ công

Đối với việc triển khai có quản lý mà không cần xuất thủ công, Ultralytics Platform cung cấp các inference endpoint sẵn sàng sử dụng với khả năng tự động mở rộng trên 42 khu vực toàn cầu.

Các tùy chọn triển khai của YOLO26#

Dưới đây là mô tả ngắn gọn về từng định dạng và thời điểm nên sử dụng. Để xem hướng dẫn xuất đầy đủ, hãy xem tài liệu xuất; để xem các tiêu chí so sánh song song, hãy chuyển đến bảng so sánh.

  • PyTorch (.pt): Định dạng train và inference gốc, mang lại tính linh hoạt tối đa và khả năng tăng tốc GPU thông qua NVIDIA CUDA hoặc AMD ROCm — lý tưởng cho nghiên cứu và tạo mẫu mà không cần bước xuất mô hình.
  • TorchScript (torchscript): Tuần tự hóa mô hình cho runtime C++ không cần Python, phù hợp với các hệ thống production nơi Python không khả dụng.
  • ONNX (onnx): Định dạng trung gian bất kể framework với khả năng hỗ trợ đa nền tảng và phần cứng rộng rãi thông qua ONNX Runtime.
  • OpenVINO (openvino): Bộ công cụ của Intel để inference được tối ưu hóa trên CPU Intel, GPU tích hợp và NPU, phổ biến trong IoT và edge computing.
  • TensorRT (engine): Runtime hiệu suất cao của NVIDIA mang lại khả năng inference GPU hàng đầu với tối ưu hóa FP16 và INT8.
  • CoreML (coreml): Định dạng trên thiết bị của Apple dành cho iOS, macOS, watchOS và tvOS, sử dụng Apple Neural Engine.
  • TF SavedModel (saved_model): Định dạng chuẩn của TensorFlow để phục vụ phía server có khả năng mở rộng với TensorFlow Serving.
  • TF GraphDef (pb): Định dạng TensorFlow đồ thị tĩnh đã được đóng băng cho các môi trường cần đồ thị tính toán cố định.
  • TF Edge TPU (edgetpu): Biên dịch các mô hình .tflite cho bộ tăng tốc Google Coral Edge TPU.
  • LiteRT (litert): Runtime trên thiết bị của Google (trước đây là TensorFlow Lite) cho thiết bị di động, nhúng và trình duyệt inference từ một mô hình .tflite duy nhất, hỗ trợ FP32 và INT8 cùng khả năng thực thi trong trình duyệt qua LiteRT.js.
  • PaddlePaddle (paddle): Framework deep learning của Baidu, phổ biến tại Trung Quốc, với sự hỗ trợ phần cứng rộng rãi.
  • MNN (mnn): Engine inference trọng lượng nhẹ, hiệu suất cao được tối ưu hóa cho các hệ thống ARM và x86-64 di động và nhúng.
  • NCNN (ncnn): Framework inference trọng lượng nhẹ, hiệu suất cao được tinh chỉnh cho các thiết bị ARM di động.
  • Sony IMX500 (imx): Xuất dữ liệu cho cảm biến thị giác thông minh IMX500 của Sony với khả năng xử lý trên chip, chẳng hạn như Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Nhắm mục tiêu vào các NPU Rockchip trên bo mạch nhúng với lượng tử hóa FP16 và INT8.
  • ExecuTorch (executorch): Runtime trên thiết bị gốc của PyTorch cho thiết bị di động (iOS và Android) và hệ thống nhúng thông qua XNNPACK.
  • Axelera AI (axelera): Biên dịch cho Metis AIPU của Axelera (lên tới 856 TOPS) qua PCIe hoặc M.2 cho inference biên thông lượng cao.
  • DEEPX (deepx): Nhắm mục tiêu phần cứng NPU DEEPX với lượng tử hóa INT8 cho inference biên nhúng.
  • Qualcomm QNN (qnn): Inference trên thiết bị trên Snapdragon Hexagon NPU, Adreno GPU và CPU thông qua bộ công cụ Qualcomm AI.

Tích hợp Hailo integration xuất các mô hình phát hiện, phân đoạn, phân đoạn ngữ nghĩa, ước tính chiều sâu, phân loại, pose và OBB của YOLO trực tiếp sang Hailo HEF; xem bảng tương thích của nó để biết các mô hình và mục tiêu đã được xác thực. Tích hợp Ambarella integration tuân theo quy trình ưu tiên ONNX và biên dịch các bản xuất ONNX sang định dạng AmbaPB với chuỗi công cụ CVflow của Ambarella dành cho các SoC CVflow® như CV72, tùy ý sử dụng quá trình train nhận biết nén SpongeTorch. Tích hợp Huawei Ascend integration biên dịch các bản xuất ONNX sang định dạng ngoại tuyến .om bằng trình biên dịch CANN ATC để inference FP16 trên các Bộ xử lý AI Ascend.

So sánh các tùy chọn triển khai#

Bảng sau đây tóm tắt các tùy chọn triển khai cho các mô hình YOLO26 trên các tiêu chí thường quyết định sự lựa chọn. Để có cái nhìn sâu hơn về từng định dạng, hãy xem tài liệu định dạng xuất.

Tùy chọn Triển khaiĐiểm chuẩn hiệu năngKhả năng tương thích và Tích hợpHỗ trợ cộng đồng và Hệ sinh tháiNghiên cứu điển hìnhBảo trì và Cập nhậtCân nhắc về Bảo mậtTăng tốc phần cứng
PyTorchTính linh hoạt tốt; có thể đánh đổi hiệu năng thôTuyệt vời với các thư viện PythonNguồn tài nguyên và cộng đồng rộng lớnNghiên cứu và tạo mẫuPhát triển đều đặn, tích cựcPhụ thuộc vào môi trường triển khaiHỗ trợ CUDA cho tăng tốc GPU
TorchScriptTốt hơn cho môi trường production so với PyTorchChuyển đổi mượt mà từ PyTorch sang C++Chuyên biệt nhưng hẹp hơn so với PyTorchNgành công nghiệp nơi Python là điểm nghẽnCập nhật nhất quán với PyTorchCải thiện bảo mật mà không cần toàn bộ PythonKế thừa hỗ trợ CUDA từ PyTorch
ONNXThay đổi tùy thuộc vào runtimeCao trên các framework khác nhauHệ sinh thái rộng, được hỗ trợ bởi nhiều tổ chứcTính linh hoạt trên các framework MLCập nhật thường xuyên cho các thao tác mớiĐảm bảo các thực hành chuyển đổi và triển khai an toànNhiều tối ưu hóa phần cứng khác nhau
OpenVINOĐược tối ưu hóa cho phần cứng IntelTốt nhất trong hệ sinh thái IntelVững chắc trong lĩnh vực thị giác máy tínhIoT và biên với phần cứng IntelCập nhật thường xuyên cho phần cứng IntelCác tính năng mạnh mẽ cho các ứng dụng nhạy cảmĐược thiết kế riêng cho phần cứng Intel
TensorRTHàng đầu trên GPU NVIDIATốt nhất cho phần cứng NVIDIAMạng lưới mạnh mẽ thông qua NVIDIASuy luận video và hình ảnh thời gian thựcCập nhật thường xuyên cho các GPU mớiChú trọng vào bảo mậtĐược thiết kế cho các GPU NVIDIA
CoreMLĐược tối ưu hóa cho phần cứng Apple trên thiết bịĐộc quyền cho hệ sinh thái AppleHỗ trợ mạnh mẽ từ Apple và các nhà phát triểnML trên thiết bị của các sản phẩm AppleCác bản cập nhật thường xuyên từ AppleTập trung vào quyền riêng tư và bảo mậtApple neural engine và GPU
TF SavedModelCó khả năng mở rộng trong môi trường serverKhả năng tương thích rộng trong hệ sinh thái TensorFlowHỗ trợ lớn nhờ vào sự phổ biến của TensorFlowPhục vụ các model ở quy mô lớnCập nhật thường xuyên bởi Google và cộng đồngCác tính năng mạnh mẽ cho doanh nghiệpNhiều loại tăng tốc phần cứng khác nhau
TF GraphDefỔn định cho các biểu đồ tính toán tĩnhTích hợp tốt với cơ sở hạ tầng TensorFlowNguồn tài nguyên để tối ưu hóa các biểu đồ tĩnhCác kịch bản yêu cầu đồ thị tĩnhCập nhật song song với TensorFlow coreCác thực tiễn bảo mật TensorFlow đã được thiết lậpCác tùy chọn tăng tốc TensorFlow
TF Edge TPUĐược tối ưu hóa cho phần cứng Edge TPU của GoogleDành riêng cho các thiết bị Edge TPUPhát triển cùng các tài nguyên của Google và bên thứ baThiết bị IoT yêu cầu xử lý thời gian thựcCác cải tiến cho phần cứng Edge TPU mớiBảo mật IoT mạnh mẽ của GoogleĐược thiết kế tùy chỉnh cho Google Coral
LiteRTTốc độ và hiệu suất trên thiết bị di động/nhúng/webHỗ trợ di động, nhúng, edge và trình duyệtCộng đồng mạnh mẽ, được Google hỗ trợCác ứng dụng trên thiết bị trên Android, iOS và webCác tính năng runtime trên thiết bị mới nhấtSuy luận bảo mật trên thiết bị và trong trình duyệtTăng tốc GPU, DSP và WebGPU
PaddlePaddleCạnh tranh, dễ sử dụng và có khả năng mở rộngHệ sinh thái Baidu, hỗ trợ ứng dụng rộng rãiPhát triển nhanh chóng, đặc biệt là tại Trung QuốcThị trường Trung Quốc và xử lý ngôn ngữTập trung vào các ứng dụng AI tại Trung QuốcChú trọng vào quyền riêng tư và bảo mật dữ liệuBao gồm các chip Kunlun của Baidu
MNNHiệu năng cao cho thiết bị di độngHệ thống ARM di động, nhúng và CPU X86-64Cộng đồng ML di động/nhúngHiệu quả của hệ thống di độngDuy trì hiệu năng cao trên thiết bị di độngƯu điểm bảo mật trên thiết bịTối ưu hóa cho CPU và GPU ARM
NCNNĐược tối ưu hóa cho các thiết bị dựa trên ARM di độngCác hệ thống ARM di động và nhúngCộng đồng ML di động/nhúng tuy ngách nhưng rất tích cựcHiệu quả của hệ thống Android và ARMDuy trì hiệu suất cao trên ARMƯu điểm bảo mật trên thiết bịTối ưu hóa cho CPU và GPU ARM
Sony IMX500Suy luận trên cảm biến với mức tiêu thụ điện năng rất thấpCảm biến Sony IMX500, Raspberry Pi AI CameraHệ sinh thái Sony AITRIOSEdge AI trên cameraCập nhật SDK của Sony và chuỗi công cụ MCTDữ liệu nằm trên cảm biếnBộ tăng tốc trên chip Sony IMX500
Rockchip RKNNTối ưu hóa cho Rockchip NPUCác bo mạch Rockchip SoC (ví dụ: RK3588)Cộng đồng nhà phát triển RockchipSBC nhúng và các thiết bị edgeCập nhật Rockchip RKNN-ToolkitSuy luận cục bộ trên thiết bịRockchip NPU
ExecuTorchRuntime PyTorch hiệu quả trên thiết bịiOS, Android, nhúng qua XNNPACKĐược hỗ trợ bởi dự án PyTorchCác ứng dụng di động và nhúngĐược duy trì cùng với PyTorchSuy luận trên thiết bị giúp giữ dữ liệu cục bộXNNPACK và các backend CPU/GPU di động
Axelera AIThông lượng rất cao (lên đến 856 TOPS)Metis AIPU qua PCIe hoặc M.2Axelera Voyager SDKSuy luận edge thông lượng caoCập nhật Axelera SDKSuy luận edge tại chỗAxelera Metis AIPU
DEEPXSuy luận NPU tối ưu hóa INT8Phần cứng DEEPX NPUCông cụ nhà phát triển DEEPX (dx_com, dx_engine)Suy luận edge nhúngCập nhật SDK và runtime DEEPXSuy luận cục bộ trên thiết bịDEEPX NPU
Qualcomm QNNSuy luận Snapdragon nhanh trên thiết bịSnapdragon Hexagon NPU, Adreno GPU, CPUHệ sinh thái Qualcomm AI HubCác thiết bị di động và edge SnapdragonCập nhật stack Qualcomm AI (QAIRT)Suy luận trên thiết bị giúp giữ dữ liệu cục bộSnapdragon Hexagon NPU

So sánh này cung cấp cho bạn cái nhìn tổng quan. Để triển khai, hãy cân nhắc các yêu cầu và giới hạn cụ thể của dự án của bạn đối với từng tùy chọn và tham khảo hướng dẫn tích hợp được liên kết cho định dạng mà bạn chọn.

Kết luận#

Nhiều định dạng xuất của YOLO26 cho phép bạn điều chỉnh mô hình cho hầu hết mọi môi trường, từ server GPU đám mây đến camera biên gắn trên cảm biến. Khi bạn đã chọn được định dạng, hãy tuân theo best practices triển khai mô hình để tối ưu hóa, khắc phục sự cố và bảo mật, đồng thời dựa vào Ultralytics community khi bạn gặp trở ngại.

Câu hỏi thường gặp#

  • Ultralytics YOLO26 hỗ trợ nhiều định dạng triển khai, mỗi định dạng được thiết kế cho các môi trường và nền tảng phần cứng cụ thể. Các định dạng chính bao gồm:

    • PyTorch để nghiên cứu và tạo nguyên mẫu, với khả năng tích hợp Python tuyệt vời.
    • TorchScript cho môi trường sản xuất nơi Python không khả dụng.
    • ONNX để tương thích đa nền tảng và tăng tốc phần cứng.
    • OpenVINO để có hiệu suất tối ưu trên phần cứng Intel.
    • TensorRT để suy luận tốc độ cao trên GPU NVIDIA.

    Mỗi định dạng đều có những ưu điểm riêng. Để có hướng dẫn chi tiết từng bước, hãy xem tài liệu quy trình xuất của chúng tôi.

  • Để tăng tốc độ suy luận trên CPU Intel, bạn có thể triển khai model YOLO26 của mình bằng bộ công cụ OpenVINO của Intel. OpenVINO mang lại khả năng tăng hiệu suất đáng kể bằng cách tối ưu hóa các model để tận dụng hiệu quả phần cứng Intel.

    1. Chuyển đổi mô hình YOLO26 của bạn sang định dạng OpenVINO bằng cách sử dụng hàm model.export().
    2. Làm theo hướng dẫn thiết lập chi tiết trong tài liệu Xuất Intel OpenVINO.

    Để biết thêm thông tin chi tiết, hãy xem bài đăng blog của chúng tôi.

  • Có, các mô hình YOLO26 có thể được triển khai trên thiết bị di động bằng LiteRT (trước đây là TensorFlow Lite) và NCNN cho Android, và CoreML hoặc LiteRT cho iOS. LiteRT là runtime trên thiết bị của Google dành cho thiết bị di động và nhúng, chạy cùng một mô hình trên Android, iOS và trình duyệt, cung cấp khả năng inference trên thiết bị hiệu quả.

    Ví dụ
    # Export command for NCNN format
    model.export(format="ncnn")

    Để biết thêm chi tiết về việc triển khai mô hình lên thiết bị di động, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.

  • Khi chọn định dạng triển khai cho YOLO26, hãy xem xét các yếu tố sau:

    • Hiệu suất: Một số định dạng như TensorRT cung cấp tốc độ vượt trội trên GPU NVIDIA, trong khi OpenVINO được tối ưu hóa cho phần cứng Intel.
    • Tính tương thích: ONNX cung cấp khả năng tương thích rộng rãi trên các nền tảng khác nhau.
    • Dễ dàng tích hợp: Các định dạng như CoreML hoặc LiteRT được tùy chỉnh cho các hệ sinh thái cụ thể như iOS và Android tương ứng.
    • Hỗ trợ từ cộng đồng: Các định dạng như PyTorch và TensorFlow có nguồn lực và sự hỗ trợ phong phú từ cộng đồng.

    Để phân tích so sánh, hãy tham khảo tài liệu định dạng xuất của chúng tôi.

  • Để triển khai các mô hình YOLO26 trong một ứng dụng web, bạn có thể sử dụng LiteRT.js, runtime web của LiteRT, cho phép chạy các mô hình machine learning trực tiếp trong trình duyệt và Node.js. Phương pháp này loại bỏ sự cần thiết của hạ tầng backend và mang lại hiệu suất thời gian thực.

    1. Xuất model YOLO26 sang định dạng LiteRT.
    2. Tích hợp model đã xuất vào ứng dụng web của bạn bằng LiteRT.js.

    Để có hướng dẫn từng bước, hãy tham khảo hướng dẫn tích hợp LiteRT của chúng tôi.

Bình luận