Ultralytics YOLO27:
Get Started

Сравнительный анализ вариантов развёртывания YOLO26#

YOLO26 поддерживает более 20 вариантов развёртывания, каждый из которых оптимизирован для определённой среды выполнения, аппаратной платформы или платформы — от PyTorch и ONNX до TensorRT, OpenVINO, CoreML и специализированных форматов для периферийных NPU. Правильный выбор позволяет сбалансировать скорость инференса, аппаратные ограничения и простоту интеграции. В этом руководстве сравниваются все варианты, чтобы ты мог выбрать оптимальный для своего приложения, а затем перейти к лучшим практикам развёртывания моделей и надёжно развернуть модель.



Смотри: Как выбрать лучший формат развертывания Ultralytics YOLO26 для своего проекта | TensorRT | OpenVINO 🚀

Развёртывание — это этап рабочего процесса проекта компьютерного зрения, на котором обученная модель начинает выполнять реальные задачи, поэтому формат экспорта напрямую влияет на скорость, стоимость и переносимость.

Как выбрать подходящий вариант развёртывания для модели YOLO26#

Когда придёт время развернуть модель YOLO26, очень важно выбрать подходящий формат экспорта. Как указано в документации по экспорту Ultralytics YOLO26, функция model.export() преобразует обученную модель в различные форматы для разных сред и требований к производительности.

Оптимальный формат зависит от условий эксплуатации модели и аппаратного обеспечения.

Экспорт без ручной настройки

Для управляемого развёртывания без ручного экспорта платформа Ultralytics предоставляет готовые к использованию конечные точки инференса с автомасштабированием в 42 регионах по всему миру.

Варианты развёртывания YOLO26#

Вот краткое описание каждого формата и рекомендации по его выбору. Полное пошаговое руководство по экспорту см. в документации по экспорту, а критерии для сравнения — в сравнительной таблице.

  • PyTorch (.pt): Нативный формат для обучения и инференса, обеспечивающий максимальную гибкость и ускорение на GPU с помощью NVIDIA CUDA или AMD ROCm. Идеально подходит для исследований и создания прототипов; экспорт не требуется.
  • TorchScript (torchscript): Сериализует модель для среды выполнения C++ без Python; подходит для производственных систем, в которых Python недоступен.
  • ONNX (onnx): Независимый от фреймворка формат обмена с широкой поддержкой разных платформ и оборудования через ONNX Runtime, включая GPU NVIDIA с помощью CUDA и GPU AMD через MIGraphX.
  • OpenVINO (openvino): Набор инструментов Intel для оптимизированного инференса на CPU, интегрированных GPU и NPU Intel; широко используется в IoT и периферийных вычислениях.
  • TensorRT (engine): Высокопроизводительная среда выполнения NVIDIA, обеспечивающая первоклассный инференс на GPU с оптимизацией FP16 и INT8.
  • CoreML (coreml): Формат Apple для выполнения на устройствах iOS, macOS, watchOS и tvOS, использующий Apple Neural Engine.
  • Core AI (coreai): Новый формат Apple .aimodel для iOS 27 и macOS 27, который распределяет вычисления между CPU, GPU и Apple Neural Engine. Для экспорта требуется macOS 26 или новее на Apple silicon либо x86_64 Linux с glibc 2.34 или новее и Python 3.11–3.14.
  • TF SavedModel (saved_model): Стандартный формат TensorFlow для масштабируемого обслуживания моделей на стороне сервера с помощью TensorFlow Serving.
  • TF GraphDef (pb): Формат TensorFlow с зафиксированным статическим графом для сред, которым требуется неизменный граф вычислений.
  • TF Edge TPU (edgetpu): Компилирует модели .tflite для ускорителей Google Coral Edge TPU.
  • LiteRT (litert): Среда выполнения Google на устройстве (ранее TensorFlow Lite) для инференса на мобильных и встраиваемых устройствах, а также в браузере с использованием единой модели .tflite. Поддерживает FP32 и INT8, а также выполнение в браузере через LiteRT.js.
  • PaddlePaddle (paddle): Популярный в Китае фреймворк глубокого обучения компании Baidu с широкой поддержкой оборудования.
  • MNN (mnn): Лёгкий высокопроизводительный движок инференса, оптимизированный для мобильных и встраиваемых систем ARM и x86-64.
  • NCNN (ncnn): Высокопроизводительный лёгкий фреймворк инференса, оптимизированный для мобильных устройств ARM.
  • Sony IMX500 (imx): Экспорт моделей для интеллектуального датчика зрения Sony IMX500 со встроенной обработкой, например для камеры Raspberry Pi AI Camera.
  • Rockchip RKNN (rknn): Предназначен для NPU Rockchip на встраиваемых платах; поддерживает квантование FP16 и INT8.
  • ExecuTorch (executorch): Нативная среда выполнения PyTorch на устройстве для мобильных (iOS и Android) и встраиваемых систем через XNNPACK.
  • Axelera AI (axelera): Компилирует модели для AIPU Metis компании Axelera (до 856 TOPS), подключаемого через PCIe или M.2 для высокопроизводительного периферийного инференса.
  • DEEPX (deepx): Предназначен для оборудования NPU DEEPX и поддерживает квантование INT8 для периферийного инференса на встраиваемых устройствах.
  • Qualcomm QNN (qnn): Инференс на устройстве с использованием NPU Snapdragon Hexagon, GPU Adreno и CPU через стек Qualcomm AI.

Интеграция Hailo напрямую экспортирует модели YOLO для обнаружения объектов, сегментации, семантической сегментации, оценки глубины, классификации, оценки позы и OBB в формат Hailo HEF; проверенные модели и целевые устройства смотри в таблице совместимости. Интеграция Ambarella использует рабочий процесс с приоритетом ONNX и компилирует экспортированные в ONNX модели в формат AmbaPB с помощью набора инструментов CVflow от Ambarella для SoC CVflow®, таких как CV72; при необходимости можно использовать обучение с учетом сжатия SpongeTorch. Интеграция Huawei Ascend компилирует экспортированные в ONNX модели в офлайн-формат .om с помощью компилятора CANN ATC для инференса FP16 на процессорах Ascend AI. Интеграция AMD Xilinx квантирует экспортированные в ONNX модели с помощью AMD Quark для NPU устройств Versal AI Edge Series Gen 2; затем Vitis AI Execution Provider компилирует их в модель .rai.

Сравнение вариантов развёртывания#

В таблице ниже приведены варианты развёртывания моделей YOLO26 и критерии, которые обычно влияют на выбор. Подробное описание каждого формата см. в документации по форматам экспорта.

Вариант развёртыванияТесты производительностиСовместимость и интеграцияПоддержка сообщества и экосистемаПримеры из практикиОбслуживание и обновленияВопросы безопасностиАппаратное ускорение
PyTorchХорошая гибкость; возможен компромисс с пиковой производительностьюОтличная интеграция с библиотеками PythonОбширные ресурсы и активное сообществоИсследования и прототипыРегулярная активная разработкаЗависит от среды развёртыванияПоддержка CUDA для ускорения на GPU
TorchScriptДля производства подходит лучше, чем PyTorchПлавный переход с PyTorch на C++Специализированный вариант, но с более узкой сферой применения, чем PyTorchПромышленная среда, где Python становится узким местомРегулярные обновления вместе с PyTorchПовышенная безопасность без полноценной среды PythonИспользует поддержку CUDA из PyTorch
ONNXЗависит от среды выполненияВысокая совместимость с разными фреймворкамиШирокая экосистема при поддержке множества организацийГибкость при работе с разными фреймворками машинного обученияРегулярные обновления с поддержкой новых операцийОбеспечь безопасные практики преобразования и развёртыванияРазличные варианты аппаратной оптимизации
OpenVINOОптимизирован для оборудования IntelЛучше всего работает в экосистеме IntelНадёжное решение для компьютерного зренияИнтернет вещей и периферийные устройства на оборудовании IntelРегулярные обновления для оборудования IntelРасширенные возможности для приложений с повышенными требованиями к безопасностиАдаптировано для оборудования Intel
TensorRTТоповая производительность на GPU NVIDIAОптимальный выбор для оборудования NVIDIAРазвитая экосистема NVIDIAОбработка видео и изображений в реальном времениЧастые обновления для новых GPUОсобое внимание безопасностиРазработано для GPU NVIDIA
CoreMLОптимизировано для работы непосредственно на устройствах AppleТолько для экосистемы AppleСильная поддержка со стороны Apple и разработчиковМашинное обучение непосредственно на устройствах AppleРегулярные обновления AppleВ центре внимания — конфиденциальность и безопасностьНейронный движок и GPU Apple
Core AIОптимизировано для Apple siliconiOS 27 и macOS 27; экспорт на Apple silicon с macOS 26+ или на x86_64 Linux (glibc 2.34+), Python 3.11–3.14Фреймворк Apple; подключается по желанию в SDK для iOS/FlutterМашинное обучение непосредственно на устройствах платформ Apple нового поколенияОбновления привязаны к выпускам ОС Apple; сейчас — бета-версияЛокальный инференс на устройстве сохраняет данные на нёмApple Neural Engine, GPU и CPU
TF SavedModelМасштабируется в серверных средахШирокая совместимость с экосистемой TensorFlowШирокая поддержка благодаря популярности TensorFlowОбслуживание моделей в масштабеРегулярные обновления от Google и сообществаШирокие возможности для корпоративного использованияУскорение на различных типах оборудования
TF GraphDefСтабильная работа со статическими графами вычисленийХорошо интегрируется с инфраструктурой TensorFlowРесурсы для оптимизации статических графовСценарии, требующие статических графовОбновления выходят вместе с ядром TensorFlowПроверенные практики безопасности TensorFlowВарианты ускорения TensorFlow
TF Edge TPUОптимизировано для оборудования Google Edge TPUТолько для устройств Edge TPUРазвивается благодаря ресурсам Google и сторонних разработчиковУстройства интернета вещей, которым нужна обработка в реальном времениУлучшения для нового оборудования Edge TPUНадёжная защита интернета вещей от GoogleСпециально разработано для Google Coral
LiteRTСкорость и эффективность на мобильных, встроенных и веб-платформахПоддержка мобильных и встроенных систем, периферийных устройств и браузеровАктивное сообщество при поддержке GoogleПриложения непосредственно на устройствах Android, iOS и в вебеНовейшие возможности среды выполнения на устройствеБезопасный инференс непосредственно на устройстве и в браузереУскорение на GPU, DSP и WebGPU
PaddlePaddleКонкурентоспособное, простое в использовании и масштабируемое решениеЭкосистема Baidu и широкая поддержка приложенийБыстро развивается, особенно в КитаеКитайский рынок и обработка китайского языкаОриентировано на приложения ИИ для китайского рынкаОсобое внимание конфиденциальности и безопасности данныхВключая чипы Kunlun от Baidu
MNNВысокая производительность на мобильных устройствахМобильные и встроенные системы на ARM, а также CPU с архитектурой X86-64Сообщество разработчиков машинного обучения для мобильных и встроенных системЭффективность на мобильных системахПоддержание высокой производительности на мобильных устройствахПреимущества безопасности при обработке на устройствеОптимизация для CPU и GPU на ARM
NCNNОптимизировано для мобильных устройств на базе ARMМобильные и встроенные системы на ARMНебольшое, но активное сообщество разработчиков машинного обучения для мобильных и встроенных системЭффективность на Android и системах ARMПоддержание высокой производительности на ARMПреимущества безопасности при обработке на устройствеОптимизация для CPU и GPU на ARM
Sony IMX500Инференс на сенсоре при очень низком энергопотребленииСенсор Sony IMX500, камера Raspberry Pi AI CameraЭкосистема Sony AITRIOSПериферийный ИИ непосредственно на камереОбновления SDK Sony и набора инструментов MCTДанные остаются на сенсореВстроенный ускоритель Sony IMX500
Rockchip RKNNОптимизировано для NPU RockchipПлаты с SoC Rockchip (например, RK3588)Сообщество разработчиков RockchipВстроенные одноплатные компьютеры и периферийные устройстваОбновления Rockchip RKNN-ToolkitЛокальный инференс непосредственно на устройствеNPU Rockchip
ExecuTorchЭффективная среда выполнения PyTorch непосредственно на устройствеiOS, Android и встроенные системы через XNNPACKПоддерживается проектом PyTorchМобильные и встроенные приложенияРазвивается вместе с PyTorchЛокальный инференс на устройстве сохраняет данные на нёмXNNPACK и бэкенды для мобильных CPU/GPU
Axelera AIОчень высокая пропускная способность (до 856 TOPS)Metis AIPU через PCIe или M.2SDK Axelera VoyagerВысокая пропускная способность периферийного инференсаОбновления SDK AxeleraПериферийный инференс на локальном оборудованииAxelera Metis AIPU
DEEPXИнференс на NPU с оптимизацией INT8Оборудование NPU DEEPXИнструменты разработчика DEEPX (dx_com, dx_engine)Встроенный периферийный инференсОбновления SDK и среды выполнения DEEPXЛокальный инференс непосредственно на устройствеNPU DEEPX
Qualcomm QNNБыстрый инференс Snapdragon непосредственно на устройствеNPU Snapdragon Hexagon, GPU Adreno, CPUЭкосистема Qualcomm AI HubМобильные и периферийные устройства SnapdragonОбновления стека Qualcomm AI (QAIRT)Локальный инференс на устройстве сохраняет данные на нёмNPU Snapdragon Hexagon
HailoИнференс HEF с INT8 на NPU HailoHailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler и HailoRTКамеры, роботы, промышленные периферийные системыРелизы Hailo DFC и HailoRTЛокальный инференс непосредственно на устройствеNPU Hailo
Huawei AscendБолее высокая пропускная способность на Ascend AI CoreПлаты Atlas и OrangePi AIProЭкосистема Huawei CANNПериферийный инференс на NPU AscendРелизы CANN и ATCЛокальный инференс непосредственно на устройствеAscend AI Core
AMD XilinxИнференс INT8 на NPU Versal AI Edge Gen 2Versal AI Edge Series Gen 2 (VEK385)AMD Vitis AI и QuarkКомпьютерное зрение на адаптивных SoCРелизы Vitis AI и QuarkЛокальный инференс непосредственно на устройствеNPU Versal AI Engine

Это сравнение дает общее представление. При развертывании сопоставь конкретные требования и ограничения своего проекта с каждым вариантом и изучи руководство по интеграции для выбранного формата.

Заключение#

Широкий выбор форматов экспорта YOLO26 позволяет адаптировать модель практически к любой среде — от облачного GPU-сервера до периферийной камеры с датчиком. Выбрав формат, следуй рекомендациям по развертыванию моделей для оптимизации, устранения неполадок и обеспечения безопасности. Если возникнут трудности, обратись к сообществу Ultralytics.

Часто задаваемые вопросы#

  • Ultralytics YOLO26 поддерживает различные форматы развертывания, каждый из которых предназначен для определенных сред и аппаратных платформ. К основным форматам относятся:

    • PyTorch для исследований и создания прототипов с отличной интеграцией с Python.
    • TorchScript для производственных сред, где Python недоступен.
    • ONNX для совместимости между платформами и аппаратного ускорения.
    • OpenVINO для повышения производительности на оборудовании Intel.
    • TensorRT для высокоскоростного инференса на GPU NVIDIA.

    Каждый формат обладает своими преимуществами. Подробное пошаговое руководство см. в нашей документации по процессу экспорта.

  • Чтобы повысить скорость инференса на CPU Intel, можно развернуть модель YOLO26 с помощью инструментария Intel OpenVINO. OpenVINO значительно повышает производительность, оптимизируя модели для эффективного использования оборудования Intel.

    1. Преобразуй модель YOLO26 в формат OpenVINO с помощью функции model.export().
    2. Подробные инструкции по настройке см. в документации по экспорту Intel OpenVINO.

    Подробнее читай в нашей публикации в блоге.

  • Да, модели YOLO26 можно развертывать на мобильных устройствах с помощью LiteRT (ранее TensorFlow Lite) и NCNN на Android, а на iOS — с помощью CoreML или LiteRT. LiteRT — это среда выполнения Google для мобильных и встроенных устройств, которая запускает одну и ту же модель на Android, iOS и в браузере, обеспечивая эффективный инференс непосредственно на устройстве.

    Пример
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # Команда экспорта в формат NCNN
    model.export(format="ncnn")

    Подробнее о развертывании моделей на мобильных устройствах см. в нашем руководстве по интеграции LiteRT.

  • При выборе формата развертывания для YOLO26 учитывай следующие факторы:

    • Производительность: некоторые форматы, например TensorRT, обеспечивают исключительно высокую скорость на GPU NVIDIA, а OpenVINO оптимизирован для оборудования Intel.
    • Совместимость: ONNX обеспечивает широкую совместимость с различными платформами.
    • Простота интеграции: такие форматы, как CoreML и LiteRT, предназначены для определенных экосистем — iOS и Android соответственно.
    • Поддержка сообщества: у таких форматов, как PyTorch и TensorFlow, есть обширные ресурсы и поддержка сообщества.

    Сравнительный анализ см. в нашей документации по форматам экспорта.

  • Для развертывания моделей YOLO26 в веб-приложении можно использовать LiteRT.js — веб-среду выполнения LiteRT, которая позволяет запускать модели машинного обучения непосредственно в браузере и Node.js. Такой подход избавляет от необходимости в серверной инфраструктуре и обеспечивает работу в реальном времени.

    1. Экспортируй модель YOLO26 в формат LiteRT.
    2. Интегрируй экспортированную модель в веб-приложение с помощью LiteRT.js.

    Пошаговые инструкции см. в нашем руководстве по интеграции LiteRT.

Комментарии