YOLO Vision 2026:

Сравнительный анализ вариантов развертывания YOLO26#

YOLO26 поддерживает более 20 вариантов развертывания, каждый из которых настроен под определенную среду выполнения, целевое аппаратное обеспечение или платформу — от PyTorch и ONNX до TensorRT, OpenVINO, CoreML и специализированных форматов для периферийных NPU. Выбор подходящего варианта позволяет сбалансировать скорость инференса, аппаратные ограничения и простоту интеграции. В этом руководстве сравниваются все варианты, чтобы ты мог выбрать лучший для своего приложения, а затем перейти к рекомендациям по развертыванию моделей для надежного запуска.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Развертывание — это этап рабочего процесса проекта компьютерного зрения, на котором обученная модель начинает выполнять реальные задачи, поэтому формат экспорта напрямую влияет на скорость, стоимость и портируемость.

Как выбрать правильный вариант развертывания для твоей модели YOLO26#

Когда придет время развертывать модель YOLO26, выбор подходящего формата экспорта имеет очень важное значение. Как описано в документации по экспорту Ultralytics YOLO26, функция model.export() преобразует твою обученную модель в различные форматы, адаптированные под разные среды и требования к производительности.

Идеальный формат зависит от предполагаемого рабочего контекста твоей модели и оборудования.

Пропусти ручной экспорт

Для управляемого развертывания без ручного экспорта Ultralytics Platform предоставляет готовые к использованию эндпоинты инференса с автоматическим масштабированием в 42 глобальных регионах.

Варианты развертывания YOLO26#

Здесь приведено краткое описание каждого формата и рекомендации по его выбору. Полное руководство по экспорту см. в документации по экспорту; критерии для сравнения сведены в таблицу сравнения.

  • PyTorch (.pt): Родной формат для обучения и инференса, обеспечивающий максимальную гибкость и ускорение на GPU с помощью NVIDIA CUDA или AMD ROCm — идеально подходит для исследований и прототипирования без необходимости выполнения шага экспорта.
  • TorchScript (torchscript): Сериализует модель для среды выполнения C++ без использования Python, что подходит для производственных систем, где Python недоступен.
  • ONNX (onnx): Независимый от фреймворка промежуточный формат с широкой кроссплатформенной аппаратной поддержкой через ONNX Runtime.
  • OpenVINO (openvino): Инструментарий Intel для оптимизированного инференса на CPU, интегрированных GPU и NPU от Intel, часто используемый в IoT и периферийных вычислениях.
  • TensorRT (engine): Высокопроизводительная среда выполнения от NVIDIA, обеспечивающая первоклассный инференс на GPU с оптимизацией FP16 и INT8.
  • CoreML (coreml): Формат Apple для работы на устройствах под управлением iOS, macOS, watchOS и tvOS с использованием Apple Neural Engine.
  • TF SavedModel (saved_model): Стандартный формат TensorFlow для масштабируемого обслуживания на стороне сервера с помощью TensorFlow Serving.
  • TF GraphDef (pb): Замороженный формат TensorFlow со статическим графом для сред, которым требуется фиксированный вычислительный граф.
  • TF Edge TPU (edgetpu): Компилирует модели .tflite для ускорителей Google Coral Edge TPU.
  • LiteRT (litert): Среда выполнения Google для мобильных, встраиваемых устройств и браузеров (ранее TensorFlow Lite), позволяющая запускать одну модель .tflite на мобильных устройствах, встраиваемых системах и в браузере, с поддержкой FP32 и INT8, а также выполнением в браузере через LiteRT.js.
  • PaddlePaddle (paddle): Фреймворк глубокого обучения от Baidu, популярный в Китае, с широкой аппаратной поддержкой.
  • MNN (mnn): Легковесный высокопроизводительный движок инференса, оптимизированный для мобильных и встраиваемых систем на базе архитектур ARM и x86-64.
  • NCNN (ncnn): Высокопроизводительный легковесный фреймворк инференса, настроенный для мобильных устройств ARM.
  • Sony IMX500 (imx): Экспорт для интеллектуального датчика зрения Sony IMX500 с обработкой на кристалле, такого как камера Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Предназначен для NPU Rockchip на встраиваемых платах с квантованием FP16 и INT8.
  • ExecuTorch (executorch): Родная среда выполнения PyTorch для мобильных устройств (iOS и Android) и встраиваемых систем через XNNPACK.
  • Axelera AI (axelera): Компилирует для AIPU Metis от Axelera (до 856 TOPS) через PCIe или M.2 для высокопроизводительного инференса на периферии.
  • DEEPX (deepx): Ориентирован на аппаратное обеспечение DEEPX NPU с квантованием INT8 для периферийного встраиваемого инференса.
  • Qualcomm QNN (qnn): Инференс на устройстве с использованием Snapdragon Hexagon NPU, Adreno GPU и CPU через стек Qualcomm AI.

Интеграция Hailo позволяет экспортировать модели детекции, сегментации, семантической сегментации, оценки глубины, классификации, позы и OBB напрямую в Hailo HEF; см. таблицу совместимости для проверки поддерживаемых моделей и целевых устройств. Интеграция Ambarella использует рабочий процесс с приоритетом ONNX и компилирует экспортированные файлы ONNX в формат AmbaPB с помощью цепочки инструментов Ambarella CVflow для SoC CVflow® (например, CV72), опционально используя обучение с учетом сжатия SpongeTorch. Интеграция Huawei Ascend компилирует экспорт ONNX в автономный формат .om с помощью компилятора CANN ATC для инференса в FP16 на процессорах Ascend AI Processors.

Сравнение вариантов развертывания#

В следующей таблице кратко описаны варианты развертывания моделей YOLO26 по критериям, которые обычно определяют выбор. Подробный обзор каждого формата см. в документации по форматам экспорта.

Вариант развертыванияТесты производительностиСовместимость и интеграцияПоддержка сообщества и экосистемаПримеры использованияОбслуживание и обновленияВопросы безопасностиАппаратное ускорение
PyTorchХорошая гибкость; может идти в ущерб чистой производительностиОтлично работает с библиотеками PythonОбширные ресурсы и сообществоИсследования и прототипыРегулярная, активная разработкаЗависит от среды развертыванияПоддержка CUDA для ускорения на GPU
TorchScriptЛучше подходит для продакшена, чем PyTorchПлавный переход от PyTorch к C++Специализированная, но уже, чем у PyTorchИндустрия, где Python является «узким местом»Последовательные обновления вместе с PyTorchПовышенная безопасность без полноценного PythonНаследует поддержку CUDA от PyTorch
ONNXПеременная в зависимости от среды выполненияВысокая для различных фреймворковШирокая экосистема, поддерживаемая многими организациямиГибкость между ML-фреймворкамиРегулярные обновления для новых операцийОбеспечение безопасных методов конвертации и развертыванияРазличные аппаратные оптимизации
OpenVINOОптимизировано для оборудования IntelЛучше всего в рамках экосистемы IntelНадежно в области компьютерного зренияIoT и периферийные вычисления на оборудовании IntelРегулярные обновления для оборудования IntelНадежные функции для конфиденциальных приложенийАдаптировано для оборудования Intel
TensorRTВысший уровень для GPU NVIDIAЛучшее для оборудования NVIDIAСильная сеть через NVIDIAВывод видео и изображений в реальном времениЧастые обновления для новых GPUАкцент на безопасностиРазработано для GPU NVIDIA
CoreMLОптимизировано для оборудования Apple на устройствеЭксклюзивно для экосистемы AppleСильная поддержка Apple и разработчиковML на устройстве в продуктах AppleРегулярные обновления AppleФокус на конфиденциальности и безопасностиApple Neural Engine и GPU
TF SavedModelМасштабируемость в серверных средахШирокая совместимость в экосистеме TensorFlowШирокая поддержка благодаря популярности TensorFlowМасштабируемое обслуживание моделейРегулярные обновления от Google и сообществаНадежные функции для предприятияРазличные виды аппаратного ускорения
TF GraphDefСтабильно для статических вычислительных графовХорошо интегрируется с инфраструктурой TensorFlowРесурсы для оптимизации статических графовСценарии, требующие статических графовОбновления параллельно с ядром TensorFlowУстоявшиеся практики безопасности TensorFlowВарианты ускорения TensorFlow
TF Edge TPUОптимизировано для оборудования Google Edge TPUЭксклюзивно для устройств Edge TPUРазвивается благодаря Google и сторонним ресурсамIoT-устройства, требующие обработки в реальном времениУлучшения для нового оборудования Edge TPUНадежная IoT-безопасность от GoogleСпециально разработано для Google Coral
LiteRTСкорость и эффективность на мобильных/встроенных/веб-системахПоддержка мобильных, встроенных, периферийных систем и браузеровНадежное сообщество, поддержка GoogleПриложения на устройствах под управлением Android, iOS и в вебеНовейшие функции среды выполнения на устройствахБезопасный вывод на устройстве и в браузереУскорение через GPU, DSP и WebGPU
PaddlePaddleКонкурентоспособно, просто в использовании и масштабируемоЭкосистема Baidu, широкая поддержка приложенийБыстрорастущая, особенно в КитаеКитайский рынок и обработка языкаФокус на китайских AI-приложенияхАкцент на конфиденциальности и безопасности данныхВключая чипы Kunlun от Baidu
MNNВысокая производительность для мобильных устройствМобильные и встроенные ARM-системы и X86-64 CPUСообщество мобильного/встроенного MLЭффективность мобильных системПоддержка высокой производительности на мобильных устройствахПреимущества безопасности на устройствеОптимизация для ARM CPU и GPU
NCNNОптимизировано для мобильных устройств на базе ARMМобильные и встроенные ARM-системыНишевое, но активное сообщество мобильного/встроенного MLЭффективность Android и ARM-системПоддержание высокой производительности на ARMПреимущества безопасности на устройствеОптимизация для ARM CPU и GPU
Sony IMX500Вывод на сенсоре при очень низком энергопотребленииДатчик Sony IMX500, Raspberry Pi AI CameraЭкосистема Sony AITRIOSEdge AI на камереОбновления Sony SDK и цепочки инструментов MCTДанные остаются на сенсореУскоритель на чипе Sony IMX500
Rockchip RKNNОптимизировано для NPU RockchipПлаты Rockchip SoC (например, RK3588)Сообщество разработчиков RockchipВстраиваемые SBC и устройства edgeОбновления Rockchip RKNN-ToolkitЛокальный вывод на устройствеRockchip NPU
ExecuTorchЭффективная среда выполнения PyTorch на устройствеiOS, Android, встраиваемые системы через XNNPACKПоддерживается проектом PyTorchМобильные и встраиваемые приложенияРазвивается вместе с PyTorchИнференс на устройстве позволяет сохранять данные локальноБэкенды XNNPACK и мобильные CPU/GPU
Axelera AIОчень высокая пропускная способность (до 856 TOPS)Metis AIPU через PCIe или M.2Axelera Voyager SDKВысокопроизводительный вывод на границе сетиОбновления Axelera SDKЛокальный вывод на границе сетиAxelera Metis AIPU
DEEPXВывод на NPU, оптимизированный под INT8Оборудование DEEPX NPUИнструменты разработчика DEEPX (dx_com, dx_engine)Встраиваемый вывод на границе сетиОбновления DEEPX SDK и среды выполненияЛокальный вывод на устройствеDEEPX NPU
Qualcomm QNNБыстрый вывод на устройствах SnapdragonNPU Snapdragon Hexagon, Adreno GPU, CPUЭкосистема Qualcomm AI HubМобильные и edge-устройства на базе SnapdragonОбновления стека Qualcomm AI (QAIRT)Инференс на устройстве позволяет сохранять данные локальноNPU Snapdragon Hexagon

Это сравнение дает тебе общее представление. Для развертывания сопоставь специфические требования и ограничения своего проекта с каждым вариантом и обратись к руководству по интеграции для выбранного формата.

Заключение#

Широкий спектр форматов экспорта YOLO26 позволяет адаптировать модель практически под любую среду: от облачного сервера с GPU до периферийной камеры с датчиком. Выбрав формат, следуй рекомендациям по развертыванию моделей в отношении оптимизации, устранения неполадок и безопасности, а при возникновении трудностей обращайся за помощью к сообществу Ultralytics.

FAQ#

  • Ultralytics YOLO26 поддерживает различные форматы развертывания, каждый из которых предназначен для определенных сред и аппаратных платформ. Ключевые форматы включают:

    • PyTorch для исследований и прототипирования с отличной интеграцией с Python.
    • TorchScript для производственных сред, где Python недоступен.
    • ONNX для кроссплатформенной совместимости и аппаратного ускорения.
    • OpenVINO для оптимизированной производительности на оборудовании Intel.
    • TensorRT для высокоскоростного инференса на NVIDIA GPUs.

    Каждый формат имеет уникальные преимущества. Подробное пошаговое руководство см. в нашей документации по процессу экспорта.

  • Чтобы повысить скорость инференса на процессорах Intel, ты можешь развернуть свою модель YOLO26 с использованием инструментария Intel OpenVINO. OpenVINO обеспечивает значительный прирост производительности за счет оптимизации моделей для эффективного использования оборудования Intel.

    1. Конвертируй модель YOLO26 в формат OpenVINO с помощью функции model.export().
    2. Следуй подробному руководству по настройке в документации по экспорту Intel OpenVINO.

    Больше полезной информации ты найдешь в нашем блоге.

  • Да, модели YOLO26 могут быть развернуты на мобильных устройствах с использованием LiteRT (ранее TensorFlow Lite) и NCNN для Android, а также CoreML или LiteRT для iOS. LiteRT — это среда выполнения Google для мобильных и встраиваемых устройств, которая позволяет запускать одну и ту же модель на Android, iOS и в браузере, обеспечивая эффективный инференс прямо на устройстве.

    Пример
    # Export command for NCNN format
    model.export(format="ncnn")

    Дополнительные сведения о развертывании моделей на мобильных устройствах см. в нашем руководстве по интеграции LiteRT.

  • При выборе формата развертывания для YOLO26 учитывай следующие факторы:

    • Производительность: Некоторые форматы, такие как TensorRT, обеспечивают исключительную скорость на NVIDIA GPUs, в то время как OpenVINO оптимизирован для оборудования Intel.
    • Совместимость: ONNX предлагает широкую совместимость на разных платформах.
    • Простота интеграции: Форматы вроде CoreML или LiteRT специально адаптированы для соответствующих экосистем: iOS и Android.
    • Поддержка сообщества: Такие форматы, как PyTorch и TensorFlow, имеют обширные ресурсы сообщества и поддержку.

    Для сравнительного анализа обратись к нашей документации по форматам экспорта.

  • Чтобы развернуть модели YOLO26 в веб-приложении, ты можешь использовать LiteRT.js, веб-среду выполнения LiteRT, которая позволяет запускать модели шинного обучения (машинного обучения) напрямую в браузере и Node.js. Такой подход избавляет от необходимости использовать бэкенд-инфраструктуру и обеспечивает производительность в реальном времени.

    1. Экспортируй модель YOLO26 в формат LiteRT.
    2. Интегрируй экспортированную модель в свое веб-приложение с помощью LiteRT.js.

    Пошаговые инструкции см. в нашем руководстве по интеграции LiteRT.

Комментарии