Сравнительный анализ вариантов развёртывания YOLO26#
YOLO26 поддерживает более 20 вариантов развёртывания, каждый из которых оптимизирован для определённой среды выполнения, аппаратной платформы или платформы — от PyTorch и ONNX до TensorRT, OpenVINO, CoreML и специализированных форматов для периферийных NPU. Правильный выбор позволяет сбалансировать скорость инференса, аппаратные ограничения и простоту интеграции. В этом руководстве сравниваются все варианты, чтобы ты мог выбрать оптимальный для своего приложения, а затем перейти к лучшим практикам развёртывания моделей и надёжно развернуть модель.
Смотри: Как выбрать лучший формат развертывания Ultralytics YOLO26 для своего проекта | TensorRT | OpenVINO 🚀
Развёртывание — это этап рабочего процесса проекта компьютерного зрения, на котором обученная модель начинает выполнять реальные задачи, поэтому формат экспорта напрямую влияет на скорость, стоимость и переносимость.
Как выбрать подходящий вариант развёртывания для модели YOLO26#
Когда придёт время развернуть модель YOLO26, очень важно выбрать подходящий формат экспорта. Как указано в документации по экспорту Ultralytics YOLO26, функция model.export() преобразует обученную модель в различные форматы для разных сред и требований к производительности.
Оптимальный формат зависит от условий эксплуатации модели и аппаратного обеспечения.
Для управляемого развёртывания без ручного экспорта платформа Ultralytics предоставляет готовые к использованию конечные точки инференса с автомасштабированием в 42 регионах по всему миру.
Варианты развёртывания YOLO26#
Вот краткое описание каждого формата и рекомендации по его выбору. Полное пошаговое руководство по экспорту см. в документации по экспорту, а критерии для сравнения — в сравнительной таблице.
- PyTorch (
.pt): Нативный формат для обучения и инференса, обеспечивающий максимальную гибкость и ускорение на GPU с помощью NVIDIA CUDA или AMD ROCm. Идеально подходит для исследований и создания прототипов; экспорт не требуется. - TorchScript (
torchscript): Сериализует модель для среды выполнения C++ без Python; подходит для производственных систем, в которых Python недоступен. - ONNX (
onnx): Независимый от фреймворка формат обмена с широкой поддержкой разных платформ и оборудования через ONNX Runtime, включая GPU NVIDIA с помощью CUDA и GPU AMD через MIGraphX. - OpenVINO (
openvino): Набор инструментов Intel для оптимизированного инференса на CPU, интегрированных GPU и NPU Intel; широко используется в IoT и периферийных вычислениях. - TensorRT (
engine): Высокопроизводительная среда выполнения NVIDIA, обеспечивающая первоклассный инференс на GPU с оптимизацией FP16 и INT8. - CoreML (
coreml): Формат Apple для выполнения на устройствах iOS, macOS, watchOS и tvOS, использующий Apple Neural Engine. - Core AI (
coreai): Новый формат Apple.aimodelдля iOS 27 и macOS 27, который распределяет вычисления между CPU, GPU и Apple Neural Engine. Для экспорта требуется macOS 26 или новее на Apple silicon либо x86_64 Linux с glibc 2.34 или новее и Python 3.11–3.14. - TF SavedModel (
saved_model): Стандартный формат TensorFlow для масштабируемого обслуживания моделей на стороне сервера с помощью TensorFlow Serving. - TF GraphDef (
pb): Формат TensorFlow с зафиксированным статическим графом для сред, которым требуется неизменный граф вычислений. - TF Edge TPU (
edgetpu): Компилирует модели.tfliteдля ускорителей Google Coral Edge TPU. - LiteRT (
litert): Среда выполнения Google на устройстве (ранее TensorFlow Lite) для инференса на мобильных и встраиваемых устройствах, а также в браузере с использованием единой модели.tflite. Поддерживает FP32 и INT8, а также выполнение в браузере через LiteRT.js. - PaddlePaddle (
paddle): Популярный в Китае фреймворк глубокого обучения компании Baidu с широкой поддержкой оборудования. - MNN (
mnn): Лёгкий высокопроизводительный движок инференса, оптимизированный для мобильных и встраиваемых систем ARM и x86-64. - NCNN (
ncnn): Высокопроизводительный лёгкий фреймворк инференса, оптимизированный для мобильных устройств ARM. - Sony IMX500 (
imx): Экспорт моделей для интеллектуального датчика зрения Sony IMX500 со встроенной обработкой, например для камеры Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Предназначен для NPU Rockchip на встраиваемых платах; поддерживает квантование FP16 и INT8. - ExecuTorch (
executorch): Нативная среда выполнения PyTorch на устройстве для мобильных (iOS и Android) и встраиваемых систем через XNNPACK. - Axelera AI (
axelera): Компилирует модели для AIPU Metis компании Axelera (до 856 TOPS), подключаемого через PCIe или M.2 для высокопроизводительного периферийного инференса. - DEEPX (
deepx): Предназначен для оборудования NPU DEEPX и поддерживает квантование INT8 для периферийного инференса на встраиваемых устройствах. - Qualcomm QNN (
qnn): Инференс на устройстве с использованием NPU Snapdragon Hexagon, GPU Adreno и CPU через стек Qualcomm AI.
Интеграция Hailo напрямую экспортирует модели YOLO для обнаружения объектов, сегментации, семантической сегментации, оценки глубины, классификации, оценки позы и OBB в формат Hailo HEF; проверенные модели и целевые устройства смотри в таблице совместимости. Интеграция Ambarella использует рабочий процесс с приоритетом ONNX и компилирует экспортированные в ONNX модели в формат AmbaPB с помощью набора инструментов CVflow от Ambarella для SoC CVflow®, таких как CV72; при необходимости можно использовать обучение с учетом сжатия SpongeTorch. Интеграция Huawei Ascend компилирует экспортированные в ONNX модели в офлайн-формат .om с помощью компилятора CANN ATC для инференса FP16 на процессорах Ascend AI. Интеграция AMD Xilinx квантирует экспортированные в ONNX модели с помощью AMD Quark для NPU устройств Versal AI Edge Series Gen 2; затем Vitis AI Execution Provider компилирует их в модель .rai.
Сравнение вариантов развёртывания#
В таблице ниже приведены варианты развёртывания моделей YOLO26 и критерии, которые обычно влияют на выбор. Подробное описание каждого формата см. в документации по форматам экспорта.
| Вариант развёртывания | Тесты производительности | Совместимость и интеграция | Поддержка сообщества и экосистема | Примеры из практики | Обслуживание и обновления | Вопросы безопасности | Аппаратное ускорение |
|---|---|---|---|---|---|---|---|
| PyTorch | Хорошая гибкость; возможен компромисс с пиковой производительностью | Отличная интеграция с библиотеками Python | Обширные ресурсы и активное сообщество | Исследования и прототипы | Регулярная активная разработка | Зависит от среды развёртывания | Поддержка CUDA для ускорения на GPU |
| TorchScript | Для производства подходит лучше, чем PyTorch | Плавный переход с PyTorch на C++ | Специализированный вариант, но с более узкой сферой применения, чем PyTorch | Промышленная среда, где Python становится узким местом | Регулярные обновления вместе с PyTorch | Повышенная безопасность без полноценной среды Python | Использует поддержку CUDA из PyTorch |
| ONNX | Зависит от среды выполнения | Высокая совместимость с разными фреймворками | Широкая экосистема при поддержке множества организаций | Гибкость при работе с разными фреймворками машинного обучения | Регулярные обновления с поддержкой новых операций | Обеспечь безопасные практики преобразования и развёртывания | Различные варианты аппаратной оптимизации |
| OpenVINO | Оптимизирован для оборудования Intel | Лучше всего работает в экосистеме Intel | Надёжное решение для компьютерного зрения | Интернет вещей и периферийные устройства на оборудовании Intel | Регулярные обновления для оборудования Intel | Расширенные возможности для приложений с повышенными требованиями к безопасности | Адаптировано для оборудования Intel |
| TensorRT | Топовая производительность на GPU NVIDIA | Оптимальный выбор для оборудования NVIDIA | Развитая экосистема NVIDIA | Обработка видео и изображений в реальном времени | Частые обновления для новых GPU | Особое внимание безопасности | Разработано для GPU NVIDIA |
| CoreML | Оптимизировано для работы непосредственно на устройствах Apple | Только для экосистемы Apple | Сильная поддержка со стороны Apple и разработчиков | Машинное обучение непосредственно на устройствах Apple | Регулярные обновления Apple | В центре внимания — конфиденциальность и безопасность | Нейронный движок и GPU Apple |
| Core AI | Оптимизировано для Apple silicon | iOS 27 и macOS 27; экспорт на Apple silicon с macOS 26+ или на x86_64 Linux (glibc 2.34+), Python 3.11–3.14 | Фреймворк Apple; подключается по желанию в SDK для iOS/Flutter | Машинное обучение непосредственно на устройствах платформ Apple нового поколения | Обновления привязаны к выпускам ОС Apple; сейчас — бета-версия | Локальный инференс на устройстве сохраняет данные на нём | Apple Neural Engine, GPU и CPU |
| TF SavedModel | Масштабируется в серверных средах | Широкая совместимость с экосистемой TensorFlow | Широкая поддержка благодаря популярности TensorFlow | Обслуживание моделей в масштабе | Регулярные обновления от Google и сообщества | Широкие возможности для корпоративного использования | Ускорение на различных типах оборудования |
| TF GraphDef | Стабильная работа со статическими графами вычислений | Хорошо интегрируется с инфраструктурой TensorFlow | Ресурсы для оптимизации статических графов | Сценарии, требующие статических графов | Обновления выходят вместе с ядром TensorFlow | Проверенные практики безопасности TensorFlow | Варианты ускорения TensorFlow |
| TF Edge TPU | Оптимизировано для оборудования Google Edge TPU | Только для устройств Edge TPU | Развивается благодаря ресурсам Google и сторонних разработчиков | Устройства интернета вещей, которым нужна обработка в реальном времени | Улучшения для нового оборудования Edge TPU | Надёжная защита интернета вещей от Google | Специально разработано для Google Coral |
| LiteRT | Скорость и эффективность на мобильных, встроенных и веб-платформах | Поддержка мобильных и встроенных систем, периферийных устройств и браузеров | Активное сообщество при поддержке Google | Приложения непосредственно на устройствах Android, iOS и в вебе | Новейшие возможности среды выполнения на устройстве | Безопасный инференс непосредственно на устройстве и в браузере | Ускорение на GPU, DSP и WebGPU |
| PaddlePaddle | Конкурентоспособное, простое в использовании и масштабируемое решение | Экосистема Baidu и широкая поддержка приложений | Быстро развивается, особенно в Китае | Китайский рынок и обработка китайского языка | Ориентировано на приложения ИИ для китайского рынка | Особое внимание конфиденциальности и безопасности данных | Включая чипы Kunlun от Baidu |
| MNN | Высокая производительность на мобильных устройствах | Мобильные и встроенные системы на ARM, а также CPU с архитектурой X86-64 | Сообщество разработчиков машинного обучения для мобильных и встроенных систем | Эффективность на мобильных системах | Поддержание высокой производительности на мобильных устройствах | Преимущества безопасности при обработке на устройстве | Оптимизация для CPU и GPU на ARM |
| NCNN | Оптимизировано для мобильных устройств на базе ARM | Мобильные и встроенные системы на ARM | Небольшое, но активное сообщество разработчиков машинного обучения для мобильных и встроенных систем | Эффективность на Android и системах ARM | Поддержание высокой производительности на ARM | Преимущества безопасности при обработке на устройстве | Оптимизация для CPU и GPU на ARM |
| Sony IMX500 | Инференс на сенсоре при очень низком энергопотреблении | Сенсор Sony IMX500, камера Raspberry Pi AI Camera | Экосистема Sony AITRIOS | Периферийный ИИ непосредственно на камере | Обновления SDK Sony и набора инструментов MCT | Данные остаются на сенсоре | Встроенный ускоритель Sony IMX500 |
| Rockchip RKNN | Оптимизировано для NPU Rockchip | Платы с SoC Rockchip (например, RK3588) | Сообщество разработчиков Rockchip | Встроенные одноплатные компьютеры и периферийные устройства | Обновления Rockchip RKNN-Toolkit | Локальный инференс непосредственно на устройстве | NPU Rockchip |
| ExecuTorch | Эффективная среда выполнения PyTorch непосредственно на устройстве | iOS, Android и встроенные системы через XNNPACK | Поддерживается проектом PyTorch | Мобильные и встроенные приложения | Развивается вместе с PyTorch | Локальный инференс на устройстве сохраняет данные на нём | XNNPACK и бэкенды для мобильных CPU/GPU |
| Axelera AI | Очень высокая пропускная способность (до 856 TOPS) | Metis AIPU через PCIe или M.2 | SDK Axelera Voyager | Высокая пропускная способность периферийного инференса | Обновления SDK Axelera | Периферийный инференс на локальном оборудовании | Axelera Metis AIPU |
| DEEPX | Инференс на NPU с оптимизацией INT8 | Оборудование NPU DEEPX | Инструменты разработчика DEEPX (dx_com, dx_engine) | Встроенный периферийный инференс | Обновления SDK и среды выполнения DEEPX | Локальный инференс непосредственно на устройстве | NPU DEEPX |
| Qualcomm QNN | Быстрый инференс Snapdragon непосредственно на устройстве | NPU Snapdragon Hexagon, GPU Adreno, CPU | Экосистема Qualcomm AI Hub | Мобильные и периферийные устройства Snapdragon | Обновления стека Qualcomm AI (QAIRT) | Локальный инференс на устройстве сохраняет данные на нём | NPU Snapdragon Hexagon |
| Hailo | Инференс HEF с INT8 на NPU Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler и HailoRT | Камеры, роботы, промышленные периферийные системы | Релизы Hailo DFC и HailoRT | Локальный инференс непосредственно на устройстве | NPU Hailo |
| Huawei Ascend | Более высокая пропускная способность на Ascend AI Core | Платы Atlas и OrangePi AIPro | Экосистема Huawei CANN | Периферийный инференс на NPU Ascend | Релизы CANN и ATC | Локальный инференс непосредственно на устройстве | Ascend AI Core |
| AMD Xilinx | Инференс INT8 на NPU Versal AI Edge Gen 2 | Versal AI Edge Series Gen 2 (VEK385) | AMD Vitis AI и Quark | Компьютерное зрение на адаптивных SoC | Релизы Vitis AI и Quark | Локальный инференс непосредственно на устройстве | NPU Versal AI Engine |
Это сравнение дает общее представление. При развертывании сопоставь конкретные требования и ограничения своего проекта с каждым вариантом и изучи руководство по интеграции для выбранного формата.
Заключение#
Широкий выбор форматов экспорта YOLO26 позволяет адаптировать модель практически к любой среде — от облачного GPU-сервера до периферийной камеры с датчиком. Выбрав формат, следуй рекомендациям по развертыванию моделей для оптимизации, устранения неполадок и обеспечения безопасности. Если возникнут трудности, обратись к сообществу Ultralytics.
Часто задаваемые вопросы#
Ultralytics YOLO26 поддерживает различные форматы развертывания, каждый из которых предназначен для определенных сред и аппаратных платформ. К основным форматам относятся:
- PyTorch для исследований и создания прототипов с отличной интеграцией с Python.
- TorchScript для производственных сред, где Python недоступен.
- ONNX для совместимости между платформами и аппаратного ускорения.
- OpenVINO для повышения производительности на оборудовании Intel.
- TensorRT для высокоскоростного инференса на GPU NVIDIA.
Каждый формат обладает своими преимуществами. Подробное пошаговое руководство см. в нашей документации по процессу экспорта.
Чтобы повысить скорость инференса на CPU Intel, можно развернуть модель YOLO26 с помощью инструментария Intel OpenVINO. OpenVINO значительно повышает производительность, оптимизируя модели для эффективного использования оборудования Intel.
- Преобразуй модель YOLO26 в формат OpenVINO с помощью функции
model.export(). - Подробные инструкции по настройке см. в документации по экспорту Intel OpenVINO.
Подробнее читай в нашей публикации в блоге.
- Преобразуй модель YOLO26 в формат OpenVINO с помощью функции
Да, модели YOLO26 можно развертывать на мобильных устройствах с помощью LiteRT (ранее TensorFlow Lite) и NCNN на Android, а на iOS — с помощью CoreML или LiteRT. LiteRT — это среда выполнения Google для мобильных и встроенных устройств, которая запускает одну и ту же модель на Android, iOS и в браузере, обеспечивая эффективный инференс непосредственно на устройстве.
Примерfrom ultralytics import YOLO model = YOLO("yolo26n.pt") # Команда экспорта в формат NCNN model.export(format="ncnn")Подробнее о развертывании моделей на мобильных устройствах см. в нашем руководстве по интеграции LiteRT.
При выборе формата развертывания для YOLO26 учитывай следующие факторы:
- Производительность: некоторые форматы, например TensorRT, обеспечивают исключительно высокую скорость на GPU NVIDIA, а OpenVINO оптимизирован для оборудования Intel.
- Совместимость: ONNX обеспечивает широкую совместимость с различными платформами.
- Простота интеграции: такие форматы, как CoreML и LiteRT, предназначены для определенных экосистем — iOS и Android соответственно.
- Поддержка сообщества: у таких форматов, как PyTorch и TensorFlow, есть обширные ресурсы и поддержка сообщества.
Сравнительный анализ см. в нашей документации по форматам экспорта.
Для развертывания моделей YOLO26 в веб-приложении можно использовать LiteRT.js — веб-среду выполнения LiteRT, которая позволяет запускать модели машинного обучения непосредственно в браузере и Node.js. Такой подход избавляет от необходимости в серверной инфраструктуре и обеспечивает работу в реальном времени.
- Экспортируй модель YOLO26 в формат LiteRT.
- Интегрируй экспортированную модель в веб-приложение с помощью LiteRT.js.
Пошаговые инструкции см. в нашем руководстве по интеграции LiteRT.