Сравнительный анализ вариантов развертывания YOLO26#
YOLO26 поддерживает более 20 вариантов развертывания, каждый из которых настроен под определенную среду выполнения, целевое аппаратное обеспечение или платформу — от PyTorch и ONNX до TensorRT, OpenVINO, CoreML и специализированных форматов для периферийных NPU. Выбор подходящего варианта позволяет сбалансировать скорость инференса, аппаратные ограничения и простоту интеграции. В этом руководстве сравниваются все варианты, чтобы ты мог выбрать лучший для своего приложения, а затем перейти к рекомендациям по развертыванию моделей для надежного запуска.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
Развертывание — это этап рабочего процесса проекта компьютерного зрения, на котором обученная модель начинает выполнять реальные задачи, поэтому формат экспорта напрямую влияет на скорость, стоимость и портируемость.
Как выбрать правильный вариант развертывания для твоей модели YOLO26#
Когда придет время развертывать модель YOLO26, выбор подходящего формата экспорта имеет очень важное значение. Как описано в документации по экспорту Ultralytics YOLO26, функция model.export() преобразует твою обученную модель в различные форматы, адаптированные под разные среды и требования к производительности.
Идеальный формат зависит от предполагаемого рабочего контекста твоей модели и оборудования.
Для управляемого развертывания без ручного экспорта Ultralytics Platform предоставляет готовые к использованию эндпоинты инференса с автоматическим масштабированием в 42 глобальных регионах.
Варианты развертывания YOLO26#
Здесь приведено краткое описание каждого формата и рекомендации по его выбору. Полное руководство по экспорту см. в документации по экспорту; критерии для сравнения сведены в таблицу сравнения.
- PyTorch (
.pt): Родной формат для обучения и инференса, обеспечивающий максимальную гибкость и ускорение на GPU с помощью NVIDIA CUDA или AMD ROCm — идеально подходит для исследований и прототипирования без необходимости выполнения шага экспорта. - TorchScript (
torchscript): Сериализует модель для среды выполнения C++ без использования Python, что подходит для производственных систем, где Python недоступен. - ONNX (
onnx): Независимый от фреймворка промежуточный формат с широкой кроссплатформенной аппаратной поддержкой через ONNX Runtime. - OpenVINO (
openvino): Инструментарий Intel для оптимизированного инференса на CPU, интегрированных GPU и NPU от Intel, часто используемый в IoT и периферийных вычислениях. - TensorRT (
engine): Высокопроизводительная среда выполнения от NVIDIA, обеспечивающая первоклассный инференс на GPU с оптимизацией FP16 и INT8. - CoreML (
coreml): Формат Apple для работы на устройствах под управлением iOS, macOS, watchOS и tvOS с использованием Apple Neural Engine. - TF SavedModel (
saved_model): Стандартный формат TensorFlow для масштабируемого обслуживания на стороне сервера с помощью TensorFlow Serving. - TF GraphDef (
pb): Замороженный формат TensorFlow со статическим графом для сред, которым требуется фиксированный вычислительный граф. - TF Edge TPU (
edgetpu): Компилирует модели.tfliteдля ускорителей Google Coral Edge TPU. - LiteRT (
litert): Среда выполнения Google для мобильных, встраиваемых устройств и браузеров (ранее TensorFlow Lite), позволяющая запускать одну модель.tfliteна мобильных устройствах, встраиваемых системах и в браузере, с поддержкой FP32 и INT8, а также выполнением в браузере через LiteRT.js. - PaddlePaddle (
paddle): Фреймворк глубокого обучения от Baidu, популярный в Китае, с широкой аппаратной поддержкой. - MNN (
mnn): Легковесный высокопроизводительный движок инференса, оптимизированный для мобильных и встраиваемых систем на базе архитектур ARM и x86-64. - NCNN (
ncnn): Высокопроизводительный легковесный фреймворк инференса, настроенный для мобильных устройств ARM. - Sony IMX500 (
imx): Экспорт для интеллектуального датчика зрения Sony IMX500 с обработкой на кристалле, такого как камера Raspberry Pi AI Camera. - Rockchip RKNN (
rknn): Предназначен для NPU Rockchip на встраиваемых платах с квантованием FP16 и INT8. - ExecuTorch (
executorch): Родная среда выполнения PyTorch для мобильных устройств (iOS и Android) и встраиваемых систем через XNNPACK. - Axelera AI (
axelera): Компилирует для AIPU Metis от Axelera (до 856 TOPS) через PCIe или M.2 для высокопроизводительного инференса на периферии. - DEEPX (
deepx): Ориентирован на аппаратное обеспечение DEEPX NPU с квантованием INT8 для периферийного встраиваемого инференса. - Qualcomm QNN (
qnn): Инференс на устройстве с использованием Snapdragon Hexagon NPU, Adreno GPU и CPU через стек Qualcomm AI.
Интеграция Hailo позволяет экспортировать модели детекции, сегментации, семантической сегментации, оценки глубины, классификации, позы и OBB напрямую в Hailo HEF; см. таблицу совместимости для проверки поддерживаемых моделей и целевых устройств. Интеграция Ambarella использует рабочий процесс с приоритетом ONNX и компилирует экспортированные файлы ONNX в формат AmbaPB с помощью цепочки инструментов Ambarella CVflow для SoC CVflow® (например, CV72), опционально используя обучение с учетом сжатия SpongeTorch. Интеграция Huawei Ascend компилирует экспорт ONNX в автономный формат .om с помощью компилятора CANN ATC для инференса в FP16 на процессорах Ascend AI Processors.
Сравнение вариантов развертывания#
В следующей таблице кратко описаны варианты развертывания моделей YOLO26 по критериям, которые обычно определяют выбор. Подробный обзор каждого формата см. в документации по форматам экспорта.
| Вариант развертывания | Тесты производительности | Совместимость и интеграция | Поддержка сообщества и экосистема | Примеры использования | Обслуживание и обновления | Вопросы безопасности | Аппаратное ускорение |
|---|---|---|---|---|---|---|---|
| PyTorch | Хорошая гибкость; может идти в ущерб чистой производительности | Отлично работает с библиотеками Python | Обширные ресурсы и сообщество | Исследования и прототипы | Регулярная, активная разработка | Зависит от среды развертывания | Поддержка CUDA для ускорения на GPU |
| TorchScript | Лучше подходит для продакшена, чем PyTorch | Плавный переход от PyTorch к C++ | Специализированная, но уже, чем у PyTorch | Индустрия, где Python является «узким местом» | Последовательные обновления вместе с PyTorch | Повышенная безопасность без полноценного Python | Наследует поддержку CUDA от PyTorch |
| ONNX | Переменная в зависимости от среды выполнения | Высокая для различных фреймворков | Широкая экосистема, поддерживаемая многими организациями | Гибкость между ML-фреймворками | Регулярные обновления для новых операций | Обеспечение безопасных методов конвертации и развертывания | Различные аппаратные оптимизации |
| OpenVINO | Оптимизировано для оборудования Intel | Лучше всего в рамках экосистемы Intel | Надежно в области компьютерного зрения | IoT и периферийные вычисления на оборудовании Intel | Регулярные обновления для оборудования Intel | Надежные функции для конфиденциальных приложений | Адаптировано для оборудования Intel |
| TensorRT | Высший уровень для GPU NVIDIA | Лучшее для оборудования NVIDIA | Сильная сеть через NVIDIA | Вывод видео и изображений в реальном времени | Частые обновления для новых GPU | Акцент на безопасности | Разработано для GPU NVIDIA |
| CoreML | Оптимизировано для оборудования Apple на устройстве | Эксклюзивно для экосистемы Apple | Сильная поддержка Apple и разработчиков | ML на устройстве в продуктах Apple | Регулярные обновления Apple | Фокус на конфиденциальности и безопасности | Apple Neural Engine и GPU |
| TF SavedModel | Масштабируемость в серверных средах | Широкая совместимость в экосистеме TensorFlow | Широкая поддержка благодаря популярности TensorFlow | Масштабируемое обслуживание моделей | Регулярные обновления от Google и сообщества | Надежные функции для предприятия | Различные виды аппаратного ускорения |
| TF GraphDef | Стабильно для статических вычислительных графов | Хорошо интегрируется с инфраструктурой TensorFlow | Ресурсы для оптимизации статических графов | Сценарии, требующие статических графов | Обновления параллельно с ядром TensorFlow | Устоявшиеся практики безопасности TensorFlow | Варианты ускорения TensorFlow |
| TF Edge TPU | Оптимизировано для оборудования Google Edge TPU | Эксклюзивно для устройств Edge TPU | Развивается благодаря Google и сторонним ресурсам | IoT-устройства, требующие обработки в реальном времени | Улучшения для нового оборудования Edge TPU | Надежная IoT-безопасность от Google | Специально разработано для Google Coral |
| LiteRT | Скорость и эффективность на мобильных/встроенных/веб-системах | Поддержка мобильных, встроенных, периферийных систем и браузеров | Надежное сообщество, поддержка Google | Приложения на устройствах под управлением Android, iOS и в вебе | Новейшие функции среды выполнения на устройствах | Безопасный вывод на устройстве и в браузере | Ускорение через GPU, DSP и WebGPU |
| PaddlePaddle | Конкурентоспособно, просто в использовании и масштабируемо | Экосистема Baidu, широкая поддержка приложений | Быстрорастущая, особенно в Китае | Китайский рынок и обработка языка | Фокус на китайских AI-приложениях | Акцент на конфиденциальности и безопасности данных | Включая чипы Kunlun от Baidu |
| MNN | Высокая производительность для мобильных устройств | Мобильные и встроенные ARM-системы и X86-64 CPU | Сообщество мобильного/встроенного ML | Эффективность мобильных систем | Поддержка высокой производительности на мобильных устройствах | Преимущества безопасности на устройстве | Оптимизация для ARM CPU и GPU |
| NCNN | Оптимизировано для мобильных устройств на базе ARM | Мобильные и встроенные ARM-системы | Нишевое, но активное сообщество мобильного/встроенного ML | Эффективность Android и ARM-систем | Поддержание высокой производительности на ARM | Преимущества безопасности на устройстве | Оптимизация для ARM CPU и GPU |
| Sony IMX500 | Вывод на сенсоре при очень низком энергопотреблении | Датчик Sony IMX500, Raspberry Pi AI Camera | Экосистема Sony AITRIOS | Edge AI на камере | Обновления Sony SDK и цепочки инструментов MCT | Данные остаются на сенсоре | Ускоритель на чипе Sony IMX500 |
| Rockchip RKNN | Оптимизировано для NPU Rockchip | Платы Rockchip SoC (например, RK3588) | Сообщество разработчиков Rockchip | Встраиваемые SBC и устройства edge | Обновления Rockchip RKNN-Toolkit | Локальный вывод на устройстве | Rockchip NPU |
| ExecuTorch | Эффективная среда выполнения PyTorch на устройстве | iOS, Android, встраиваемые системы через XNNPACK | Поддерживается проектом PyTorch | Мобильные и встраиваемые приложения | Развивается вместе с PyTorch | Инференс на устройстве позволяет сохранять данные локально | Бэкенды XNNPACK и мобильные CPU/GPU |
| Axelera AI | Очень высокая пропускная способность (до 856 TOPS) | Metis AIPU через PCIe или M.2 | Axelera Voyager SDK | Высокопроизводительный вывод на границе сети | Обновления Axelera SDK | Локальный вывод на границе сети | Axelera Metis AIPU |
| DEEPX | Вывод на NPU, оптимизированный под INT8 | Оборудование DEEPX NPU | Инструменты разработчика DEEPX (dx_com, dx_engine) | Встраиваемый вывод на границе сети | Обновления DEEPX SDK и среды выполнения | Локальный вывод на устройстве | DEEPX NPU |
| Qualcomm QNN | Быстрый вывод на устройствах Snapdragon | NPU Snapdragon Hexagon, Adreno GPU, CPU | Экосистема Qualcomm AI Hub | Мобильные и edge-устройства на базе Snapdragon | Обновления стека Qualcomm AI (QAIRT) | Инференс на устройстве позволяет сохранять данные локально | NPU Snapdragon Hexagon |
Это сравнение дает тебе общее представление. Для развертывания сопоставь специфические требования и ограничения своего проекта с каждым вариантом и обратись к руководству по интеграции для выбранного формата.
Заключение#
Широкий спектр форматов экспорта YOLO26 позволяет адаптировать модель практически под любую среду: от облачного сервера с GPU до периферийной камеры с датчиком. Выбрав формат, следуй рекомендациям по развертыванию моделей в отношении оптимизации, устранения неполадок и безопасности, а при возникновении трудностей обращайся за помощью к сообществу Ultralytics.
FAQ#
Ultralytics YOLO26 поддерживает различные форматы развертывания, каждый из которых предназначен для определенных сред и аппаратных платформ. Ключевые форматы включают:
- PyTorch для исследований и прототипирования с отличной интеграцией с Python.
- TorchScript для производственных сред, где Python недоступен.
- ONNX для кроссплатформенной совместимости и аппаратного ускорения.
- OpenVINO для оптимизированной производительности на оборудовании Intel.
- TensorRT для высокоскоростного инференса на NVIDIA GPUs.
Каждый формат имеет уникальные преимущества. Подробное пошаговое руководство см. в нашей документации по процессу экспорта.
Чтобы повысить скорость инференса на процессорах Intel, ты можешь развернуть свою модель YOLO26 с использованием инструментария Intel OpenVINO. OpenVINO обеспечивает значительный прирост производительности за счет оптимизации моделей для эффективного использования оборудования Intel.
- Конвертируй модель YOLO26 в формат OpenVINO с помощью функции
model.export(). - Следуй подробному руководству по настройке в документации по экспорту Intel OpenVINO.
Больше полезной информации ты найдешь в нашем блоге.
- Конвертируй модель YOLO26 в формат OpenVINO с помощью функции
Да, модели YOLO26 могут быть развернуты на мобильных устройствах с использованием LiteRT (ранее TensorFlow Lite) и NCNN для Android, а также CoreML или LiteRT для iOS. LiteRT — это среда выполнения Google для мобильных и встраиваемых устройств, которая позволяет запускать одну и ту же модель на Android, iOS и в браузере, обеспечивая эффективный инференс прямо на устройстве.
Пример# Export command for NCNN format model.export(format="ncnn")Дополнительные сведения о развертывании моделей на мобильных устройствах см. в нашем руководстве по интеграции LiteRT.
При выборе формата развертывания для YOLO26 учитывай следующие факторы:
- Производительность: Некоторые форматы, такие как TensorRT, обеспечивают исключительную скорость на NVIDIA GPUs, в то время как OpenVINO оптимизирован для оборудования Intel.
- Совместимость: ONNX предлагает широкую совместимость на разных платформах.
- Простота интеграции: Форматы вроде CoreML или LiteRT специально адаптированы для соответствующих экосистем: iOS и Android.
- Поддержка сообщества: Такие форматы, как PyTorch и TensorFlow, имеют обширные ресурсы сообщества и поддержку.
Для сравнительного анализа обратись к нашей документации по форматам экспорта.
Чтобы развернуть модели YOLO26 в веб-приложении, ты можешь использовать LiteRT.js, веб-среду выполнения LiteRT, которая позволяет запускать модели шинного обучения (машинного обучения) напрямую в браузере и Node.js. Такой подход избавляет от необходимости использовать бэкенд-инфраструктуру и обеспечивает производительность в реальном времени.
- Экспортируй модель YOLO26 в формат LiteRT.
- Интегрируй экспортированную модель в свое веб-приложение с помощью LiteRT.js.
Пошаговые инструкции см. в нашем руководстве по интеграции LiteRT.