YOLO26のデプロイオプションの比較分析#
YOLO26は、ONNXやTensorRT、OpenVINO、CoreML、専用のエッジNPU形式など、ランタイム、ハードウェア、プラットフォームに応じて調整された20種類以上のデプロイオプションに対応しています。適切な形式を選ぶには、推論速度、ハードウェアの制約、統合の容易さのバランスを考慮します。このガイドでは各オプションを比較し、用途に最適な形式を選べるように解説します。選択後は、モデルデプロイのベストプラクティスを参照して、確実にデプロイしてください。
視聴: プロジェクトに最適なUltralytics YOLO26のデプロイ形式を選ぶ方法 | TensorRT | OpenVINO 🚀
デプロイは、コンピュータービジョンプロジェクトのワークフローにおいて、トレーニング済みモデルが実際の処理を開始する段階です。そのため、エクスポート形式は速度、コスト、移植性に直接影響します。
YOLO26モデルに適したデプロイオプションの選び方#
YOLO26モデルをデプロイする際には、適切なエクスポート形式を選ぶことが非常に重要です。Ultralytics YOLO26のエクスポートドキュメントで説明されているように、model.export()関数を使うと、トレーニング済みモデルをさまざまな環境や性能要件に適した複数の形式に変換できます。
最適な形式は、モデルを運用する環境とハードウェアによって異なります。
手動エクスポートなしでマネージドデプロイを行う場合、Ultralytics Platformは、世界42リージョンでオートスケーリングする、すぐに使える推論エンドポイントを提供します。
YOLO26のデプロイオプション#
各形式の概要と、選択に適した状況を簡単に説明します。エクスポート手順の全容についてはエクスポートのドキュメントを、各形式の比較基準については比較表をご覧ください。
- PyTorch (
.pt): ネイティブのトレーニング・推論形式です。柔軟性が高く、NVIDIA CUDAまたはAMD ROCmによるGPUアクセラレーションにも対応しているため、エクスポートせずに研究やプロトタイピングを行うのに適しています。 - TorchScript (
torchscript): モデルをシリアライズして、Pythonを必要としないC++ランタイムで実行できるようにします。Pythonを利用できない本番システムに適しています。 - ONNX (
onnx): フレームワークに依存しない交換形式で、ONNX Runtimeを通じて幅広いプラットフォームとハードウェアに対応します。CUDA経由でNVIDIA GPUを利用できるほか、MIGraphX経由でAMD GPUも利用できます。 - OpenVINO (
openvino): Intel CPU、内蔵GPU、NPUでの推論を最適化するIntelのツールキットです。IoTやエッジコンピューティングで広く利用されています。 - TensorRT (
engine): FP16とINT8の最適化により、最高水準のGPU推論性能を実現するNVIDIAの高性能ランタイムです。 - CoreML (
coreml): Apple Neural Engineを使用する、iOS、macOS、watchOS、tvOS向けのApple製オンデバイス形式です。 - Core AI (
coreai): iOS 27およびmacOS 27向けにAppleが提供する新しい.aimodel形式です。CPU、GPU、Apple Neural Engineでの実行に対応します。エクスポートには、Appleシリコン搭載のmacOS 26以降、またはglibc 2.34以降のx86_64 Linuxが必要で、Python 3.11~3.14に対応しています。 - TF SavedModel (
saved_model): TensorFlow Servingを使用した、スケーラブルなサーバーサイド配信向けのTensorFlow標準形式です。 - TF GraphDef (
pb): 固定された計算グラフが必要な環境向けの、凍結された静的グラフ形式のTensorFlow形式です。 - TF Edge TPU (
edgetpu): Google Coral Edge TPUアクセラレーター向けに.tfliteモデルをコンパイルします。 - LiteRT (
litert): モバイル、組み込み機器、ブラウザーでの推論に対応するGoogleのオンデバイスランタイム(旧TensorFlow Lite)です。1つの.tfliteモデルでFP32とINT8に対応し、LiteRT.jsを使ったブラウザー内実行も可能です。 - PaddlePaddle (
paddle): 中国で広く利用され、幅広いハードウェアに対応するBaiduのディープラーニングフレームワークです。 - MNN (
mnn): モバイルおよび組み込み機器向けのARM・x86-64システムに最適化された、軽量で高性能な推論エンジンです。 - NCNN (
ncnn): モバイルARMデバイス向けに最適化された、高性能で軽量な推論フレームワークです。 - Sony IMX500 (
imx): Raspberry Pi AI Cameraなど、オンチップ処理に対応するSonyのIMX500インテリジェントビジョンセンサー向けにエクスポートします。 - Rockchip RKNN (
rknn): FP16およびINT8量子化に対応し、組み込みボード上のRockchip NPUを対象とします。 - ExecuTorch (
executorch): XNNPACKを通じてモバイル(iOSおよびAndroid)と組み込みシステムに対応する、PyTorchネイティブのオンデバイスランタイムです。 - Axelera AI (
axelera): PCIeまたはM.2経由でAxeleraのMetis AIPU(最大856 TOPS)向けにコンパイルし、高スループットのエッジ推論を実現します。 - DEEPX (
deepx): INT8量子化を用いた組み込みエッジ推論向けに、DEEPX NPUハードウェアを対象とします。 - Qualcomm QNN (
qnn): Qualcomm AIスタックを通じて、Snapdragon Hexagon NPU、Adreno GPU、CPU上でオンデバイス推論を実行します。
Hailo統合では、YOLOの検出、セグメンテーション、セマンティックセグメンテーション、深度推定、分類、姿勢、OBBモデルをHailo HEFに直接エクスポートします。検証済みモデルとターゲットについては、互換性表を参照してください。Ambarella統合ではONNXを中心とするワークフローを採用し、AmbarellaのCVflowツールチェーンを使用してONNXエクスポートをAmbaPB形式にコンパイルします。対象はCV72などのCVflow® SoCで、SpongeTorchの圧縮を考慮したトレーニングも任意で利用できます。Huawei Ascend統合では、CANN ATCコンパイラーを使用してONNXエクスポートを.omオフライン形式にコンパイルし、Ascend AI ProcessorsでFP16推論を実行します。AMD Xilinx統合では、AMD Quarkを使用してONNXエクスポートをVersal AI Edge Series Gen 2 NPU向けに量子化し、Vitis AI Execution Providerで.raiモデルにコンパイルします。
デプロイオプションの比較#
次の表では、通常、選択の決め手となる基準に沿って、YOLO26モデルのデプロイオプションをまとめています。各形式の詳細については、エクスポート形式のドキュメントをご覧ください。
| デプロイオプション | 性能ベンチマーク | 互換性と統合 | コミュニティサポートとエコシステム | ケーススタディ | メンテナンスと更新 | セキュリティ上の考慮事項 | ハードウェアアクセラレーション |
|---|---|---|---|---|---|---|---|
| PyTorch | 柔軟性は高いものの、最大性能とのトレードオフが生じる場合があります | Pythonライブラリとの優れた互換性 | 豊富なリソースとコミュニティ | 研究とプロトタイプ | 定期的かつ活発な開発 | デプロイ環境に依存します | GPUアクセラレーション向けのCUDAサポート |
| TorchScript | PyTorchより本番環境向けです | PyTorchからC++へのスムーズな移行 | 専門性は高いものの、PyTorchより用途は限定的です | Pythonがボトルネックとなる業界 | PyTorchと連動した継続的な更新 | Python全体に依存せず、セキュリティを強化できます | PyTorchのCUDAサポートを継承します |
| ONNX | ランタイムによって異なります | さまざまなフレームワークで高い互換性があります | 幅広いエコシステムと、多数の組織によるサポート | MLフレームワーク間で柔軟に利用できます | 新しい演算に対応する定期的な更新 | 安全な変換とデプロイの手順を徹底します | さまざまなハードウェア最適化 |
| OpenVINO | Intelハードウェア向けに最適化されています | Intelエコシステムで最高の性能を発揮します | コンピュータービジョン分野で優れた実績があります | Intelハードウェアを活用したIoTとエッジ | Intelハードウェア向けの定期的なアップデート | 機密性の高いアプリケーション向けの堅牢な機能 | Intelハードウェア向けに最適化 |
| TensorRT | NVIDIA GPUで最高クラスの性能 | NVIDIAハードウェアに最適 | NVIDIAを通じた強力なネットワーク | リアルタイムの動画・画像推論 | 新しいGPU向けの頻繁なアップデート | セキュリティを重視 | NVIDIA GPU向けに設計 |
| CoreML | Appleデバイス上での実行に最適化 | Appleエコシステム専用 | Appleおよび開発者による強力なサポート | Apple製品上でのオンデバイスML | Appleによる定期的なアップデート | プライバシーとセキュリティを重視 | Apple Neural EngineとGPU |
| Core AI | Apple silicon向けに最適化 | iOS 27およびmacOS 27。Apple silicon搭載のmacOS 26以降またはx86_64 Linux(glibc 2.34以降)でエクスポート可能、Python 3.11~3.14 | Appleフレームワーク。iOS/Flutter SDKではオプトイン方式 | 次世代Appleプラットフォーム上でのオンデバイスML | Apple OSのリリースに連動。現在はベータ版 | オンデバイス推論によりデータをローカルに保持 | Apple Neural Engine、GPU、CPU |
| TF SavedModel | サーバー環境でのスケーラビリティ | TensorFlowエコシステムとの幅広い互換性 | TensorFlowの人気による充実したサポート | 大規模なモデルサービング | Googleおよびコミュニティによる定期的なアップデート | エンタープライズ向けの堅牢な機能 | 多様なハードウェアアクセラレーション |
| TF GraphDef | 静的計算グラフでの安定性 | TensorFlowインフラストラクチャとの優れた統合性 | 静的グラフを最適化するためのリソース | 静的グラフが必要なシナリオ | TensorFlowコアと連動したアップデート | TensorFlowで確立されたセキュリティ対策 | TensorFlowのアクセラレーションオプション |
| TF Edge TPU | Google Edge TPUハードウェア向けに最適化 | Edge TPUデバイス専用 | Googleおよびサードパーティのリソースとともに拡大 | リアルタイム処理が必要なIoTデバイス | 新しいEdge TPUハードウェア向けの改善 | Googleの堅牢なIoTセキュリティ | Google Coral向けにカスタム設計 |
| LiteRT | モバイル、組み込み、エッジ、ウェブでの高速性と効率性 | モバイル、組み込み、エッジ、ブラウザーをサポート | 活発なコミュニティとGoogleの支援 | Android、iOS、ウェブ向けのオンデバイスアプリ | 最新のオンデバイスランタイム機能 | オンデバイスおよびブラウザー内での安全な推論 | GPU、DSP、WebGPUによるアクセラレーション |
| PaddlePaddle | 競争力があり、使いやすく、スケーラブル | Baiduエコシステムと幅広いアプリケーションサポート | 急速に成長しており、特に中国で拡大 | 中国市場と言語処理 | 中国のAIアプリケーションを重視 | データのプライバシーとセキュリティを重視 | BaiduのKunlunチップを含む |
| MNN | モバイルデバイス向けの高性能 | モバイルおよび組み込み向けARMシステムとX86-64 CPU | モバイル・組み込みMLコミュニティ | モバイルシステムでの効率性 | モバイルデバイスでの高性能な保守性 | オンデバイスセキュリティの利点 | ARM CPUおよびGPU向けの最適化 |
| NCNN | ARMベースのモバイルデバイス向けに最適化 | モバイルおよび組み込み向けARMシステム | ニッチながら活発なモバイル・組み込みMLコミュニティ | AndroidおよびARMシステムでの効率性 | ARMでの高性能な保守性 | オンデバイスセキュリティの利点 | ARM CPUおよびGPU向けの最適化 |
| Sony IMX500 | 非常に低消費電力のセンサー上推論 | Sony IMX500センサー、Raspberry Pi AI Camera | Sony AITRIOSエコシステム | カメラ上で実行するエッジAI | Sony SDKおよびMCTツールチェーンのアップデート | データをセンサー上に保持 | Sony IMX500オンチップアクセラレーター |
| Rockchip RKNN | Rockchip NPU向けに最適化 | Rockchip SoCボード(例:RK3588) | Rockchip開発者コミュニティ | 組み込みSBCおよびエッジデバイス | Rockchip RKNN-Toolkitのアップデート | オンデバイスのローカル推論 | Rockchip NPU |
| ExecuTorch | 効率的なオンデバイスPyTorchランタイム | XNNPACK経由でiOS、Android、組み込み環境に対応 | PyTorchプロジェクトによる支援 | モバイルおよび組み込みアプリ | PyTorchと連動してメンテナンス | オンデバイス推論によりデータをローカルに保持 | XNNPACKおよびモバイルCPU/GPUバックエンド |
| Axelera AI | 非常に高いスループット(最大856 TOPS) | PCIeまたはM.2接続のMetis AIPU | Axelera Voyager SDK | 高スループットのエッジ推論 | Axelera SDKの更新 | オンプレミスのエッジ推論 | Axelera Metis AIPU |
| DEEPX | INT8最適化NPU推論 | DEEPX NPUハードウェア | DEEPX開発者ツール(dx_com、dx_engine) | 組み込みエッジ推論 | DEEPX SDKとランタイムの更新 | オンデバイスのローカル推論 | DEEPX NPU |
| Qualcomm QNN | Snapdragonでの高速なデバイス上推論 | Snapdragon Hexagon NPU、Adreno GPU、CPU | Qualcomm AI Hubエコシステム | モバイルおよびエッジ向けSnapdragonデバイス | Qualcomm AIスタック(QAIRT)の更新 | オンデバイス推論によりデータをローカルに保持 | Snapdragon Hexagon NPU |
| Hailo | Hailo NPUでのINT8 HEF推論 | Hailo-8/8L/10H/15H/15L、Raspberry Pi AI HAT+ | Hailo Dataflow CompilerとHailoRT | カメラ、ロボット、産業用エッジシステム | Hailo DFCとHailoRTのリリース | オンデバイスのローカル推論 | Hailo NPU |
| Huawei Ascend | Ascend AI Coreでのスループット向上 | AtlasボードとOrangePi AIPro | Huawei CANNエコシステム | Ascend NPUでのエッジ推論 | CANNとATCのリリース | オンデバイスのローカル推論 | Ascend AI Core |
| AMD Xilinx | Versal AI Edge Gen 2 NPUでのINT8推論 | Versal AI Edge Series Gen 2(VEK385) | AMD Vitis AIとQuark | アダプティブSoCでの組み込みビジョン | Vitis AIとQuarkのリリース | オンデバイスのローカル推論 | Versal AI Engine NPU |
この比較では、概要を把握できます。デプロイする際は、プロジェクト固有の要件や制約を各オプションと照らし合わせ、選択した形式に対応するリンク先の統合ガイドを参照してください。
結論#
YOLO26は幅広いエクスポート形式に対応しているため、クラウドGPUサーバーからセンサー搭載型のエッジカメラまで、ほぼあらゆる環境に合わせてモデルを調整できます。形式を選んだら、最適化、トラブルシューティング、セキュリティについてはモデルデプロイのベストプラクティスに従い、問題が発生した場合はUltralyticsコミュニティを活用してください。
よくある質問#
Ultralytics YOLO26は、それぞれ特定の環境やハードウェアプラットフォーム向けに設計された、さまざまなデプロイ形式に対応しています。主な形式は次のとおりです。
- 研究やプロトタイピング向けのPyTorch。Pythonとの優れた統合性を備えています。
- Pythonを利用できない本番環境向けのTorchScript。
- クロスプラットフォーム互換性とハードウェアアクセラレーションに対応するONNX。
- Intelハードウェアで性能を最適化するOpenVINO。
- NVIDIA GPUで高速な推論を実現するTensorRT。
各形式にはそれぞれ独自の利点があります。詳しい手順については、エクスポートプロセスのドキュメントをご覧ください。
Intel CPUでの推論速度を高めるには、IntelのOpenVINOツールキットを使用してYOLO26モデルをデプロイできます。OpenVINOは、Intelハードウェアを効率的に活用できるようモデルを最適化し、大幅な性能向上を実現します。
model.export()関数を使用して、YOLO26モデルをOpenVINO形式に変換します。- 詳しいセットアップ手順については、Intel OpenVINOエクスポートのドキュメントをご覧ください。
詳しくは、ブログ記事をご覧ください。
はい、AndroidではLiteRT(旧TensorFlow Lite)とNCNN、iOSではCoreMLまたはLiteRTを使用して、YOLO26モデルをモバイルデバイスにデプロイできます。LiteRTは、モバイルおよび組み込みデバイス向けのGoogleのオンデバイスランタイムです。Android、iOS、ブラウザーで同じモデルを実行でき、効率的なオンデバイス推論を実現します。
例from ultralytics import YOLO model = YOLO("yolo26n.pt") # NCNN形式へのエクスポートコマンド model.export(format="ncnn")モバイルへのモデルのデプロイについて詳しくは、LiteRT統合ガイドをご覧ください。
YOLO26のデプロイ形式を選ぶ際は、次の要素を考慮してください。
- パフォーマンス: TensorRTなどの形式はNVIDIA GPUで優れた速度を発揮し、OpenVINOはIntelハードウェア向けに最適化されています。
- 互換性: ONNXは、さまざまなプラットフォームとの幅広い互換性を備えています。
- 統合の容易さ: CoreMLやLiteRTなどの形式は、それぞれiOSやAndroidなど、特定のエコシステム向けに設計されています。
- コミュニティサポート: PyTorchやTensorFlowなどの形式には、充実したコミュニティリソースとサポートがあります。
比較分析については、エクスポート形式のドキュメントをご覧ください。
YOLO26モデルをWebアプリケーションにデプロイするには、LiteRTのWebランタイムであるLiteRT.jsを使用できます。これにより、機械学習モデルをブラウザーやNode.jsで直接実行できます。この方法ではバックエンドのインフラストラクチャが不要になり、リアルタイムのパフォーマンスを実現できます。
- YOLO26モデルをLiteRT形式にエクスポートします。
- LiteRT.jsを使用して、エクスポートしたモデルをWebアプリケーションに統合します。
手順については、LiteRT統合ガイドをご覧ください。