Ultralytics YOLO27:

Сравнительный анализ вариантов развертывания YOLO26#

YOLO26 поддерживает более 20 вариантов развертывания, каждый из которых оптимизирован для определенной среды выполнения, аппаратной платформы или среды — от PyTorch и ONNX до TensorRT, OpenVINO, CoreML и специализированных форматов для периферийных NPU. Выбор подходящего варианта требует найти баланс между скоростью инференса, аппаратными ограничениями и простотой интеграции. В этом руководстве сравниваются все варианты, чтобы ты мог выбрать наиболее подходящий для своего приложения, а затем перейти к рекомендациям по развертыванию моделей и надежно развернуть модель.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

Развертывание — это этап в рабочем процессе проекта компьютерного зрения, на котором обученная модель начинает выполнять реальные задачи, поэтому формат экспорта напрямую влияет на скорость, стоимость и переносимость.

Как выбрать подходящий вариант развертывания для модели YOLO26#

Когда приходит время развернуть модель YOLO26, очень важно выбрать подходящий формат экспорта. Как указано в документации по экспорту Ultralytics YOLO26, функция model.export() преобразует обученную модель в различные форматы, предназначенные для разных сред и требований к производительности.

Идеальный формат зависит от предполагаемого рабочего контекста модели и используемого оборудования.

Избегай ручного экспорта

Для управляемого развертывания без ручного экспорта Ultralytics Platform предоставляет готовые к использованию конечные точки инференса с автоматическим масштабированием в 42 регионах по всему миру.

Варианты развертывания YOLO26#

Ниже приведено краткое описание каждого формата и случаев, когда его стоит выбрать. Полное пошаговое руководство по экспорту см. в документации по экспорту, а критерии бокового сравнения — в сравнительной таблице.

  • PyTorch (.pt): нативный формат обучения и инференса, обеспечивающий максимальную гибкость и ускорение на GPU через NVIDIA CUDA или AMD ROCm — идеален для исследований и прототипирования, поскольку экспорт не требуется.
  • TorchScript (torchscript): сериализует модель для среды выполнения на C++ без Python, что подходит для производственных систем, где Python недоступен.
  • ONNX (onnx): независимый от фреймворка формат обмена с широкой поддержкой разных платформ и оборудования через ONNX Runtime.
  • OpenVINO (openvino): инструментарий Intel для оптимизированного инференса на CPU, интегрированных GPU и NPU Intel, широко используемый в IoT и периферийных вычислениях.
  • TensorRT (engine): высокопроизводительная среда выполнения NVIDIA, обеспечивающая первоклассный инференс на GPU с оптимизацией FP16 и INT8.
  • CoreML (coreml): формат Apple для выполнения на устройствах под управлением iOS, macOS, watchOS и tvOS с использованием Apple Neural Engine.
  • TF SavedModel (saved_model): стандартный формат TensorFlow для масштабируемого серверного обслуживания моделей с помощью TensorFlow Serving.
  • TF GraphDef (pb): формат TensorFlow с зафиксированным статическим графом для сред, которым требуется неизменяемый вычислительный граф.
  • TF Edge TPU (edgetpu): компилирует модели .tflite для ускорителей Google Coral Edge TPU.
  • LiteRT (litert): среда выполнения Google на устройстве (ранее TensorFlow Lite) для инференса на мобильных и встраиваемых устройствах, а также в браузере на основе одной модели .tflite, с поддержкой FP32 и INT8 и выполнением в браузере через LiteRT.js.
  • PaddlePaddle (paddle): фреймворк глубокого обучения Baidu, популярный в Китае и поддерживающий широкий спектр оборудования.
  • MNN (mnn): легковесный высокопроизводительный движок инференса, оптимизированный для мобильных и встраиваемых систем ARM и x86-64.
  • NCNN (ncnn): высокопроизводительный легковесный фреймворк инференса, оптимизированный для мобильных устройств ARM.
  • Sony IMX500 (imx): экспорт для интеллектуального сенсора зрения Sony IMX500 со встроенной обработкой, например для Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): предназначен для NPU Rockchip на встраиваемых платах и поддерживает квантование FP16 и INT8.
  • ExecuTorch (executorch): нативная среда выполнения PyTorch на устройстве для мобильных (iOS и Android) и встраиваемых систем через XNNPACK.
  • Axelera AI (axelera): компилирует модели для AIPU Metis компании Axelera (до 856 TOPS) через PCIe или M.2 для высокопроизводительного периферийного инференса.
  • DEEPX (deepx): предназначен для оборудования NPU DEEPX и поддерживает квантование INT8 для периферийного инференса во встраиваемых системах.
  • Qualcomm QNN (qnn): инференс на устройстве с использованием NPU Snapdragon Hexagon, GPU Adreno и CPU через стек Qualcomm AI.
  • Core AI (coreai): новый формат .aimodel от Apple для iOS 27 и macOS 27, запланированный для процессора, графического процессора и Apple Neural Engine; для экспорта требуется macOS 26 или новее на процессорах Apple silicon.

Интеграция Hailo экспортирует модели YOLO для обнаружения, сегментации, семантической сегментации, оценки глубины, классификации, определения позы и OBB напрямую в Hailo HEF; проверенные модели и целевые платформы см. в таблице совместимости. Интеграция Ambarella использует рабочий процесс с приоритетом ONNX и компилирует экспортированные модели ONNX в формат AmbaPB с помощью инструментальной цепочки CVflow компании Ambarella для SoC CVflow®, таких как CV72, при необходимости используя обучение с учетом сжатия SpongeTorch. Интеграция Huawei Ascend компилирует экспортированные модели ONNX в офлайн-формат .om с помощью компилятора CANN ATC для инференса FP16 на AI-процессорах Ascend.

Сравнение вариантов развертывания#

В следующей таблице представлены варианты развертывания моделей YOLO26 по критериям, которые обычно определяют выбор. Подробный обзор каждого формата см. в документации по форматам экспорта.

Вариант развертыванияСравнительные тесты производительностиСовместимость и интеграцияПоддержка сообщества и экосистемаПрактические примерыОбслуживание и обновленияВопросы безопасностиАппаратное ускорение
PyTorchХорошая гибкость; возможен компромисс с максимальной производительностьюОтличная совместимость с библиотеками PythonОбширные ресурсы и сообществоИсследования и прототипыРегулярная активная разработкаЗависит от среды развертыванияПоддержка CUDA для ускорения на GPU
TorchScriptДля production подходит лучше, чем PyTorchПлавный переход от PyTorch к C++Специализированная экосистема, но более узкая, чем у PyTorchОтрасли, где Python становится узким местомСогласованные обновления вместе с PyTorchПовышенная безопасность без полноценного PythonНаследует поддержку CUDA от PyTorch
ONNXЗависит от среды выполненияВысокая совместимость с разными фреймворкамиШирокая экосистема с поддержкой многих организацийГибкость при работе с разными ML-фреймворкамиРегулярные обновления для новых операцийОбеспечь безопасные процессы преобразования и развертыванияРазличные варианты оптимизации оборудования
OpenVINOОптимизирован для оборудования IntelЛучше всего работает в экосистеме IntelНадежные возможности в области компьютерного зренияIoT и периферийные системы на оборудовании IntelРегулярные обновления для оборудования IntelНадежные функции для приложений с конфиденциальными даннымиАдаптирован для оборудования Intel
TensorRTПервоклассная производительность на GPU NVIDIAЛучше всего подходит для оборудования NVIDIAСильная экосистема и поддержка со стороны NVIDIAИнференс видео и изображений в реальном времениЧастые обновления для новых GPUАкцент на безопасностиРазработан для GPU NVIDIA
CoreMLОптимизирован для оборудования Apple на устройствахЭксклюзивно для экосистемы AppleСильная поддержка со стороны Apple и разработчиковML на устройствах AppleРегулярные обновления AppleАкцент на конфиденциальности и безопасностиNeural Engine и GPU Apple
TF SavedModelМасштабируется в серверных средахШирокая совместимость в экосистеме TensorFlowШирокая поддержка благодаря популярности TensorFlowОбслуживание моделей в крупном масштабеРегулярные обновления от Google и сообществаНадежные возможности для корпоративного использованияРазличные варианты аппаратного ускорения
TF GraphDefСтабильность для статических вычислительных графовХорошо интегрируется с инфраструктурой TensorFlowРесурсы для оптимизации статических графовСценарии, требующие статических графовОбновления вместе с ядром TensorFlowПроверенные методы обеспечения безопасности TensorFlowВарианты ускорения TensorFlow
TF Edge TPUОптимизировано для оборудования Google Edge TPUТолько для устройств Edge TPUРазвивается благодаря ресурсам Google и сторонних разработчиковУстройства IoT, которым требуется обработка в реальном времениУлучшения для нового оборудования Edge TPUНадёжная защита IoT от GoogleСпециально разработано для Google Coral
LiteRTСкорость и эффективность на мобильных, встраиваемых устройствах и в веб-средеПоддержка мобильных, встраиваемых, периферийных устройств и браузеровНадёжное сообщество при поддержке GoogleПриложения на устройстве для Android, iOS и веб-средыНовейшие возможности выполнения на устройствеБезопасный вывод на устройстве и в браузереУскорение с помощью GPU, DSP и WebGPU
PaddlePaddleКонкурентоспособность, простота использования и масштабируемостьЭкосистема Baidu и широкая поддержка приложенийБыстро развивается, особенно в КитаеКитайский рынок и обработка языкаФокус на китайских приложениях ИИАкцент на конфиденциальности и безопасности данныхВключая чипы Kunlun от Baidu
MNNВысокая производительность на мобильных устройствахМобильные и встраиваемые системы ARM, а также CPU X86-64Сообщество ML для мобильных и встраиваемых системЭффективность мобильных системВысокая производительность на мобильных устройствах при сопровожденииПреимущества безопасности на устройствеОптимизация для CPU и GPU ARM
NCNNОптимизировано для мобильных устройств на базе ARMМобильные и встраиваемые системы ARMНебольшое, но активное сообщество ML для мобильных и встраиваемых системЭффективность систем Android и ARMВысокая производительность и сопровождение на ARMПреимущества безопасности на устройствеОптимизация для CPU и GPU ARM
Sony IMX500Вывод на сенсоре при очень низком энергопотребленииСенсор Sony IMX500, камера Raspberry Pi AIЭкосистема Sony AITRIOSПериферийный ИИ на камереОбновления SDK и инструментальной цепочки SonyДанные остаются на сенсореВстроенный ускоритель Sony IMX500
Rockchip RKNNОптимизировано для NPU RockchipПлаты с SoC Rockchip (например, RK3588)Сообщество разработчиков RockchipВстраиваемые SBC и периферийные устройстваОбновления Rockchip RKNN-ToolkitЛокальный вывод на устройствеNPU Rockchip
ExecuTorchЭффективная среда выполнения PyTorch на устройствеiOS, Android и встраиваемые системы через XNNPACKПри поддержке проекта PyTorchМобильные и встраиваемые приложенияСопровождается вместе с PyTorchВывод на устройстве сохраняет данные локальноБэкенды XNNPACK и CPU/GPU для мобильных устройств
Axelera AIОчень высокая пропускная способность (до 856 TOPS)Metis AIPU через PCIe или M.2Axelera Voyager SDKВысокопроизводительный периферийный выводОбновления Axelera SDKПериферийный вывод в локальной инфраструктуреAxelera Metis AIPU
DEEPXВывод на NPU, оптимизированный для INT8Оборудование DEEPX NPUИнструменты разработчика DEEPX (dx_com, dx_engine)Встраиваемый периферийный выводОбновления SDK и среды выполнения DEEPXЛокальный вывод на устройствеDEEPX NPU
Qualcomm QNNБыстрый вывод на устройствах SnapdragonNPU Snapdragon Hexagon, GPU Adreno, CPUЭкосистема Qualcomm AI HubМобильные и периферийные устройства SnapdragonОбновления стека Qualcomm AI (QAIRT)Вывод на устройстве сохраняет данные локальноNPU Snapdragon Hexagon
HailoИнференс INT8 HEF на NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler и HailoRTКамеры, роботы, промышленные краевые системыРелизы Hailo DFC и HailoRTЛокальный вывод на устройствеHailo NPU
Huawei AscendБолее высокая пропускная способность на Ascend AI CoreПлаты Atlas и OrangePi AIProЭкосистема Huawei CANNИнференс на краевых устройствах на NPU AscendРелизы CANN и ATCЛокальный вывод на устройствеAscend AI Core
Core AIОптимизировано для Apple siliconiOS 27 и macOS 27; для экспорта требуется macOS 26+Фреймворк Apple; пока еще не поддерживается в SDK iOS/FlutterМашинное обучение на устройстве на платформах Apple нового поколенияПривязано к релизам ОС Apple; в настоящее время находится в бета-версииВывод на устройстве сохраняет данные локальноApple Neural Engine, GPU и CPU

Это сравнение даёт тебе общий обзор. Для развёртывания сопоставь конкретные требования и ограничения своего проекта с каждой опцией и ознакомься с руководством по интеграции для выбранного формата.

Заключение#

Широкий выбор форматов экспорта YOLO26 позволяет адаптировать модель практически к любой среде — от облачного GPU-сервера до периферийной камеры с обработкой на сенсоре. Выбрав формат, следуй рекомендациям по развёртыванию моделей для оптимизации, устранения неполадок и обеспечения безопасности, а при возникновении проблем обращайся к сообществу Ultralytics.

Часто задаваемые вопросы#

  • Ultralytics YOLO26 поддерживает различные форматы развёртывания, каждый из которых предназначен для определённых сред и аппаратных платформ. К основным форматам относятся:

    • PyTorch для исследований и создания прототипов с отличной интеграцией с Python.
    • TorchScript для производственных сред, где Python недоступен.
    • ONNX для кроссплатформенной совместимости и аппаратного ускорения.
    • OpenVINO для оптимизированной производительности на оборудовании Intel.
    • TensorRT для высокоскоростного вывода на GPU NVIDIA.

    Каждый формат имеет свои преимущества. Подробное пошаговое руководство см. в нашей документации по процессу экспорта.

  • Чтобы повысить скорость вывода на CPU Intel, можно развернуть модель YOLO26 с помощью инструментария OpenVINO от Intel. OpenVINO значительно повышает производительность, оптимизируя модели для эффективного использования оборудования Intel.

    1. Преобразуй модель YOLO26 в формат OpenVINO с помощью функции model.export().
    2. Следуй подробному руководству по настройке в документации по экспорту Intel OpenVINO.

    Дополнительные сведения см. в нашей публикации в блоге.

  • Да, модели YOLO26 можно развертывать на мобильных устройствах с помощью LiteRT (ранее TensorFlow Lite) и NCNN для Android, а также CoreML или LiteRT для iOS. LiteRT — это среда выполнения Google для устройств, предназначенная для мобильных и встраиваемых устройств. Она запускает одну и ту же модель на Android, iOS и в браузере, обеспечивая эффективный вывод на устройстве.

    Пример
    # Export command for NCNN format
    model.export(format="ncnn")

    Подробнее о развертывании моделей на мобильных устройствах см. в нашем руководстве по интеграции LiteRT.

  • При выборе формата развертывания для YOLO26 учитывай следующие факторы:

    • Производительность: некоторые форматы, например TensorRT, обеспечивают исключительно высокую скорость на GPU NVIDIA, а OpenVINO оптимизирован для оборудования Intel.
    • Совместимость: ONNX обеспечивает широкую совместимость с различными платформами.
    • Простота интеграции: такие форматы, как CoreML и LiteRT, адаптированы для определенных экосистем, например iOS и Android соответственно.
    • Поддержка сообщества: у таких форматов, как PyTorch и TensorFlow, есть обширные ресурсы сообщества и широкая поддержка.

    Сравнительный анализ см. в нашей документации по форматам экспорта.

  • Чтобы развернуть модели YOLO26 в веб-приложении, можно использовать LiteRT.js — веб-среду выполнения LiteRT, которая позволяет запускать модели машинного обучения непосредственно в браузере и Node.js. Такой подход устраняет необходимость в серверной инфраструктуре и обеспечивает работу в реальном времени.

    1. Экспортируй модель YOLO26 в формат LiteRT.
    2. Интегрируй экспортированную модель в веб-приложение с помощью LiteRT.js.

    Пошаговые инструкции см. в нашем руководстве по интеграции LiteRT.

Комментарии