Сравнительный анализ вариантов развертывания YOLO26#
YOLO26 поддерживает более 20 вариантов развертывания, каждый из которых оптимизирован для определенной среды выполнения, аппаратной платформы или среды — от PyTorch и ONNX до TensorRT, OpenVINO, CoreML и специализированных форматов для периферийных NPU. Выбор подходящего варианта требует найти баланс между скоростью инференса, аппаратными ограничениями и простотой интеграции. В этом руководстве сравниваются все варианты, чтобы ты мог выбрать наиболее подходящий для своего приложения, а затем перейти к рекомендациям по развертыванию моделей и надежно развернуть модель.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
Развертывание — это этап в рабочем процессе проекта компьютерного зрения, на котором обученная модель начинает выполнять реальные задачи, поэтому формат экспорта напрямую влияет на скорость, стоимость и переносимость.
Как выбрать подходящий вариант развертывания для модели YOLO26#
Когда приходит время развернуть модель YOLO26, очень важно выбрать подходящий формат экспорта. Как указано в документации по экспорту Ultralytics YOLO26, функция model.export() преобразует обученную модель в различные форматы, предназначенные для разных сред и требований к производительности.
Идеальный формат зависит от предполагаемого рабочего контекста модели и используемого оборудования.
Для управляемого развертывания без ручного экспорта Ultralytics Platform предоставляет готовые к использованию конечные точки инференса с автоматическим масштабированием в 42 регионах по всему миру.
Варианты развертывания YOLO26#
Ниже приведено краткое описание каждого формата и случаев, когда его стоит выбрать. Полное пошаговое руководство по экспорту см. в документации по экспорту, а критерии бокового сравнения — в сравнительной таблице.
- PyTorch (
.pt): нативный формат обучения и инференса, обеспечивающий максимальную гибкость и ускорение на GPU через NVIDIA CUDA или AMD ROCm — идеален для исследований и прототипирования, поскольку экспорт не требуется. - TorchScript (
torchscript): сериализует модель для среды выполнения на C++ без Python, что подходит для производственных систем, где Python недоступен. - ONNX (
onnx): независимый от фреймворка формат обмена с широкой поддержкой разных платформ и оборудования через ONNX Runtime. - OpenVINO (
openvino): инструментарий Intel для оптимизированного инференса на CPU, интегрированных GPU и NPU Intel, широко используемый в IoT и периферийных вычислениях. - TensorRT (
engine): высокопроизводительная среда выполнения NVIDIA, обеспечивающая первоклассный инференс на GPU с оптимизацией FP16 и INT8. - CoreML (
coreml): формат Apple для выполнения на устройствах под управлением iOS, macOS, watchOS и tvOS с использованием Apple Neural Engine. - TF SavedModel (
saved_model): стандартный формат TensorFlow для масштабируемого серверного обслуживания моделей с помощью TensorFlow Serving. - TF GraphDef (
pb): формат TensorFlow с зафиксированным статическим графом для сред, которым требуется неизменяемый вычислительный граф. - TF Edge TPU (
edgetpu): компилирует модели.tfliteдля ускорителей Google Coral Edge TPU. - LiteRT (
litert): среда выполнения Google на устройстве (ранее TensorFlow Lite) для инференса на мобильных и встраиваемых устройствах, а также в браузере на основе одной модели.tflite, с поддержкой FP32 и INT8 и выполнением в браузере через LiteRT.js. - PaddlePaddle (
paddle): фреймворк глубокого обучения Baidu, популярный в Китае и поддерживающий широкий спектр оборудования. - MNN (
mnn): легковесный высокопроизводительный движок инференса, оптимизированный для мобильных и встраиваемых систем ARM и x86-64. - NCNN (
ncnn): высокопроизводительный легковесный фреймворк инференса, оптимизированный для мобильных устройств ARM. - Sony IMX500 (
imx): экспорт для интеллектуального сенсора зрения Sony IMX500 со встроенной обработкой, например для Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): предназначен для NPU Rockchip на встраиваемых платах и поддерживает квантование FP16 и INT8. - ExecuTorch (
executorch): нативная среда выполнения PyTorch на устройстве для мобильных (iOS и Android) и встраиваемых систем через XNNPACK. - Axelera AI (
axelera): компилирует модели для AIPU Metis компании Axelera (до 856 TOPS) через PCIe или M.2 для высокопроизводительного периферийного инференса. - DEEPX (
deepx): предназначен для оборудования NPU DEEPX и поддерживает квантование INT8 для периферийного инференса во встраиваемых системах. - Qualcomm QNN (
qnn): инференс на устройстве с использованием NPU Snapdragon Hexagon, GPU Adreno и CPU через стек Qualcomm AI. - Core AI (
coreai): новый формат.aimodelот Apple для iOS 27 и macOS 27, запланированный для процессора, графического процессора и Apple Neural Engine; для экспорта требуется macOS 26 или новее на процессорах Apple silicon.
Интеграция Hailo экспортирует модели YOLO для обнаружения, сегментации, семантической сегментации, оценки глубины, классификации, определения позы и OBB напрямую в Hailo HEF; проверенные модели и целевые платформы см. в таблице совместимости. Интеграция Ambarella использует рабочий процесс с приоритетом ONNX и компилирует экспортированные модели ONNX в формат AmbaPB с помощью инструментальной цепочки CVflow компании Ambarella для SoC CVflow®, таких как CV72, при необходимости используя обучение с учетом сжатия SpongeTorch. Интеграция Huawei Ascend компилирует экспортированные модели ONNX в офлайн-формат .om с помощью компилятора CANN ATC для инференса FP16 на AI-процессорах Ascend.
Сравнение вариантов развертывания#
В следующей таблице представлены варианты развертывания моделей YOLO26 по критериям, которые обычно определяют выбор. Подробный обзор каждого формата см. в документации по форматам экспорта.
| Вариант развертывания | Сравнительные тесты производительности | Совместимость и интеграция | Поддержка сообщества и экосистема | Практические примеры | Обслуживание и обновления | Вопросы безопасности | Аппаратное ускорение |
|---|---|---|---|---|---|---|---|
| PyTorch | Хорошая гибкость; возможен компромисс с максимальной производительностью | Отличная совместимость с библиотеками Python | Обширные ресурсы и сообщество | Исследования и прототипы | Регулярная активная разработка | Зависит от среды развертывания | Поддержка CUDA для ускорения на GPU |
| TorchScript | Для production подходит лучше, чем PyTorch | Плавный переход от PyTorch к C++ | Специализированная экосистема, но более узкая, чем у PyTorch | Отрасли, где Python становится узким местом | Согласованные обновления вместе с PyTorch | Повышенная безопасность без полноценного Python | Наследует поддержку CUDA от PyTorch |
| ONNX | Зависит от среды выполнения | Высокая совместимость с разными фреймворками | Широкая экосистема с поддержкой многих организаций | Гибкость при работе с разными ML-фреймворками | Регулярные обновления для новых операций | Обеспечь безопасные процессы преобразования и развертывания | Различные варианты оптимизации оборудования |
| OpenVINO | Оптимизирован для оборудования Intel | Лучше всего работает в экосистеме Intel | Надежные возможности в области компьютерного зрения | IoT и периферийные системы на оборудовании Intel | Регулярные обновления для оборудования Intel | Надежные функции для приложений с конфиденциальными данными | Адаптирован для оборудования Intel |
| TensorRT | Первоклассная производительность на GPU NVIDIA | Лучше всего подходит для оборудования NVIDIA | Сильная экосистема и поддержка со стороны NVIDIA | Инференс видео и изображений в реальном времени | Частые обновления для новых GPU | Акцент на безопасности | Разработан для GPU NVIDIA |
| CoreML | Оптимизирован для оборудования Apple на устройствах | Эксклюзивно для экосистемы Apple | Сильная поддержка со стороны Apple и разработчиков | ML на устройствах Apple | Регулярные обновления Apple | Акцент на конфиденциальности и безопасности | Neural Engine и GPU Apple |
| TF SavedModel | Масштабируется в серверных средах | Широкая совместимость в экосистеме TensorFlow | Широкая поддержка благодаря популярности TensorFlow | Обслуживание моделей в крупном масштабе | Регулярные обновления от Google и сообщества | Надежные возможности для корпоративного использования | Различные варианты аппаратного ускорения |
| TF GraphDef | Стабильность для статических вычислительных графов | Хорошо интегрируется с инфраструктурой TensorFlow | Ресурсы для оптимизации статических графов | Сценарии, требующие статических графов | Обновления вместе с ядром TensorFlow | Проверенные методы обеспечения безопасности TensorFlow | Варианты ускорения TensorFlow |
| TF Edge TPU | Оптимизировано для оборудования Google Edge TPU | Только для устройств Edge TPU | Развивается благодаря ресурсам Google и сторонних разработчиков | Устройства IoT, которым требуется обработка в реальном времени | Улучшения для нового оборудования Edge TPU | Надёжная защита IoT от Google | Специально разработано для Google Coral |
| LiteRT | Скорость и эффективность на мобильных, встраиваемых устройствах и в веб-среде | Поддержка мобильных, встраиваемых, периферийных устройств и браузеров | Надёжное сообщество при поддержке Google | Приложения на устройстве для Android, iOS и веб-среды | Новейшие возможности выполнения на устройстве | Безопасный вывод на устройстве и в браузере | Ускорение с помощью GPU, DSP и WebGPU |
| PaddlePaddle | Конкурентоспособность, простота использования и масштабируемость | Экосистема Baidu и широкая поддержка приложений | Быстро развивается, особенно в Китае | Китайский рынок и обработка языка | Фокус на китайских приложениях ИИ | Акцент на конфиденциальности и безопасности данных | Включая чипы Kunlun от Baidu |
| MNN | Высокая производительность на мобильных устройствах | Мобильные и встраиваемые системы ARM, а также CPU X86-64 | Сообщество ML для мобильных и встраиваемых систем | Эффективность мобильных систем | Высокая производительность на мобильных устройствах при сопровождении | Преимущества безопасности на устройстве | Оптимизация для CPU и GPU ARM |
| NCNN | Оптимизировано для мобильных устройств на базе ARM | Мобильные и встраиваемые системы ARM | Небольшое, но активное сообщество ML для мобильных и встраиваемых систем | Эффективность систем Android и ARM | Высокая производительность и сопровождение на ARM | Преимущества безопасности на устройстве | Оптимизация для CPU и GPU ARM |
| Sony IMX500 | Вывод на сенсоре при очень низком энергопотреблении | Сенсор Sony IMX500, камера Raspberry Pi AI | Экосистема Sony AITRIOS | Периферийный ИИ на камере | Обновления SDK и инструментальной цепочки Sony | Данные остаются на сенсоре | Встроенный ускоритель Sony IMX500 |
| Rockchip RKNN | Оптимизировано для NPU Rockchip | Платы с SoC Rockchip (например, RK3588) | Сообщество разработчиков Rockchip | Встраиваемые SBC и периферийные устройства | Обновления Rockchip RKNN-Toolkit | Локальный вывод на устройстве | NPU Rockchip |
| ExecuTorch | Эффективная среда выполнения PyTorch на устройстве | iOS, Android и встраиваемые системы через XNNPACK | При поддержке проекта PyTorch | Мобильные и встраиваемые приложения | Сопровождается вместе с PyTorch | Вывод на устройстве сохраняет данные локально | Бэкенды XNNPACK и CPU/GPU для мобильных устройств |
| Axelera AI | Очень высокая пропускная способность (до 856 TOPS) | Metis AIPU через PCIe или M.2 | Axelera Voyager SDK | Высокопроизводительный периферийный вывод | Обновления Axelera SDK | Периферийный вывод в локальной инфраструктуре | Axelera Metis AIPU |
| DEEPX | Вывод на NPU, оптимизированный для INT8 | Оборудование DEEPX NPU | Инструменты разработчика DEEPX (dx_com, dx_engine) | Встраиваемый периферийный вывод | Обновления SDK и среды выполнения DEEPX | Локальный вывод на устройстве | DEEPX NPU |
| Qualcomm QNN | Быстрый вывод на устройствах Snapdragon | NPU Snapdragon Hexagon, GPU Adreno, CPU | Экосистема Qualcomm AI Hub | Мобильные и периферийные устройства Snapdragon | Обновления стека Qualcomm AI (QAIRT) | Вывод на устройстве сохраняет данные локально | NPU Snapdragon Hexagon |
| Hailo | Инференс INT8 HEF на NPU Hailo | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler и HailoRT | Камеры, роботы, промышленные краевые системы | Релизы Hailo DFC и HailoRT | Локальный вывод на устройстве | Hailo NPU |
| Huawei Ascend | Более высокая пропускная способность на Ascend AI Core | Платы Atlas и OrangePi AIPro | Экосистема Huawei CANN | Инференс на краевых устройствах на NPU Ascend | Релизы CANN и ATC | Локальный вывод на устройстве | Ascend AI Core |
| Core AI | Оптимизировано для Apple silicon | iOS 27 и macOS 27; для экспорта требуется macOS 26+ | Фреймворк Apple; пока еще не поддерживается в SDK iOS/Flutter | Машинное обучение на устройстве на платформах Apple нового поколения | Привязано к релизам ОС Apple; в настоящее время находится в бета-версии | Вывод на устройстве сохраняет данные локально | Apple Neural Engine, GPU и CPU |
Это сравнение даёт тебе общий обзор. Для развёртывания сопоставь конкретные требования и ограничения своего проекта с каждой опцией и ознакомься с руководством по интеграции для выбранного формата.
Заключение#
Широкий выбор форматов экспорта YOLO26 позволяет адаптировать модель практически к любой среде — от облачного GPU-сервера до периферийной камеры с обработкой на сенсоре. Выбрав формат, следуй рекомендациям по развёртыванию моделей для оптимизации, устранения неполадок и обеспечения безопасности, а при возникновении проблем обращайся к сообществу Ultralytics.
Часто задаваемые вопросы#
Ultralytics YOLO26 поддерживает различные форматы развёртывания, каждый из которых предназначен для определённых сред и аппаратных платформ. К основным форматам относятся:
- PyTorch для исследований и создания прототипов с отличной интеграцией с Python.
- TorchScript для производственных сред, где Python недоступен.
- ONNX для кроссплатформенной совместимости и аппаратного ускорения.
- OpenVINO для оптимизированной производительности на оборудовании Intel.
- TensorRT для высокоскоростного вывода на GPU NVIDIA.
Каждый формат имеет свои преимущества. Подробное пошаговое руководство см. в нашей документации по процессу экспорта.
Чтобы повысить скорость вывода на CPU Intel, можно развернуть модель YOLO26 с помощью инструментария OpenVINO от Intel. OpenVINO значительно повышает производительность, оптимизируя модели для эффективного использования оборудования Intel.
- Преобразуй модель YOLO26 в формат OpenVINO с помощью функции
model.export(). - Следуй подробному руководству по настройке в документации по экспорту Intel OpenVINO.
Дополнительные сведения см. в нашей публикации в блоге.
- Преобразуй модель YOLO26 в формат OpenVINO с помощью функции
Да, модели YOLO26 можно развертывать на мобильных устройствах с помощью LiteRT (ранее TensorFlow Lite) и NCNN для Android, а также CoreML или LiteRT для iOS. LiteRT — это среда выполнения Google для устройств, предназначенная для мобильных и встраиваемых устройств. Она запускает одну и ту же модель на Android, iOS и в браузере, обеспечивая эффективный вывод на устройстве.
Пример# Export command for NCNN format model.export(format="ncnn")Подробнее о развертывании моделей на мобильных устройствах см. в нашем руководстве по интеграции LiteRT.
При выборе формата развертывания для YOLO26 учитывай следующие факторы:
- Производительность: некоторые форматы, например TensorRT, обеспечивают исключительно высокую скорость на GPU NVIDIA, а OpenVINO оптимизирован для оборудования Intel.
- Совместимость: ONNX обеспечивает широкую совместимость с различными платформами.
- Простота интеграции: такие форматы, как CoreML и LiteRT, адаптированы для определенных экосистем, например iOS и Android соответственно.
- Поддержка сообщества: у таких форматов, как PyTorch и TensorFlow, есть обширные ресурсы сообщества и широкая поддержка.
Сравнительный анализ см. в нашей документации по форматам экспорта.
Чтобы развернуть модели YOLO26 в веб-приложении, можно использовать LiteRT.js — веб-среду выполнения LiteRT, которая позволяет запускать модели машинного обучения непосредственно в браузере и Node.js. Такой подход устраняет необходимость в серверной инфраструктуре и обеспечивает работу в реальном времени.
- Экспортируй модель YOLO26 в формат LiteRT.
- Интегрируй экспортированную модель в веб-приложение с помощью LiteRT.js.
Пошаговые инструкции см. в нашем руководстве по интеграции LiteRT.