Ultralytics YOLO27:
Get Started

YOLO26のデプロイオプションの比較分析#

YOLO26は、ONNXやTensorRT、OpenVINO、CoreML、専用のエッジNPU形式など、ランタイム、ハードウェア、プラットフォームに応じて調整された20種類以上のデプロイオプションに対応しています。適切な形式を選ぶには、推論速度、ハードウェアの制約、統合の容易さのバランスを考慮します。このガイドでは各オプションを比較し、用途に最適な形式を選べるように解説します。選択後は、モデルデプロイのベストプラクティスを参照して、確実にデプロイしてください。



視聴: プロジェクトに最適なUltralytics YOLO26のデプロイ形式を選ぶ方法 | TensorRT | OpenVINO 🚀

デプロイは、コンピュータービジョンプロジェクトのワークフローにおいて、トレーニング済みモデルが実際の処理を開始する段階です。そのため、エクスポート形式は速度、コスト、移植性に直接影響します。

YOLO26モデルに適したデプロイオプションの選び方#

YOLO26モデルをデプロイする際には、適切なエクスポート形式を選ぶことが非常に重要です。Ultralytics YOLO26のエクスポートドキュメントで説明されているように、model.export()関数を使うと、トレーニング済みモデルをさまざまな環境や性能要件に適した複数の形式に変換できます。

最適な形式は、モデルを運用する環境とハードウェアによって異なります。

手動でのエクスポートを省略

手動エクスポートなしでマネージドデプロイを行う場合、Ultralytics Platformは、世界42リージョンでオートスケーリングする、すぐに使える推論エンドポイントを提供します。

YOLO26のデプロイオプション#

各形式の概要と、選択に適した状況を簡単に説明します。エクスポート手順の全容についてはエクスポートのドキュメントを、各形式の比較基準については比較表をご覧ください。

  • PyTorch (.pt): ネイティブのトレーニング・推論形式です。柔軟性が高く、NVIDIA CUDAまたはAMD ROCmによるGPUアクセラレーションにも対応しているため、エクスポートせずに研究やプロトタイピングを行うのに適しています。
  • TorchScript (torchscript): モデルをシリアライズして、Pythonを必要としないC++ランタイムで実行できるようにします。Pythonを利用できない本番システムに適しています。
  • ONNX (onnx): フレームワークに依存しない交換形式で、ONNX Runtimeを通じて幅広いプラットフォームとハードウェアに対応します。CUDA経由でNVIDIA GPUを利用できるほか、MIGraphX経由でAMD GPUも利用できます。
  • OpenVINO (openvino): Intel CPU、内蔵GPU、NPUでの推論を最適化するIntelのツールキットです。IoTやエッジコンピューティングで広く利用されています。
  • TensorRT (engine): FP16とINT8の最適化により、最高水準のGPU推論性能を実現するNVIDIAの高性能ランタイムです。
  • CoreML (coreml): Apple Neural Engineを使用する、iOS、macOS、watchOS、tvOS向けのApple製オンデバイス形式です。
  • Core AI (coreai): iOS 27およびmacOS 27向けにAppleが提供する新しい.aimodel形式です。CPU、GPU、Apple Neural Engineでの実行に対応します。エクスポートには、Appleシリコン搭載のmacOS 26以降、またはglibc 2.34以降のx86_64 Linuxが必要で、Python 3.11~3.14に対応しています。
  • TF SavedModel (saved_model): TensorFlow Servingを使用した、スケーラブルなサーバーサイド配信向けのTensorFlow標準形式です。
  • TF GraphDef (pb): 固定された計算グラフが必要な環境向けの、凍結された静的グラフ形式のTensorFlow形式です。
  • TF Edge TPU (edgetpu): Google Coral Edge TPUアクセラレーター向けに.tfliteモデルをコンパイルします。
  • LiteRT (litert): モバイル、組み込み機器、ブラウザーでの推論に対応するGoogleのオンデバイスランタイム(旧TensorFlow Lite)です。1つの.tfliteモデルでFP32とINT8に対応し、LiteRT.jsを使ったブラウザー内実行も可能です。
  • PaddlePaddle (paddle): 中国で広く利用され、幅広いハードウェアに対応するBaiduのディープラーニングフレームワークです。
  • MNN (mnn): モバイルおよび組み込み機器向けのARM・x86-64システムに最適化された、軽量で高性能な推論エンジンです。
  • NCNN (ncnn): モバイルARMデバイス向けに最適化された、高性能で軽量な推論フレームワークです。
  • Sony IMX500 (imx): Raspberry Pi AI Cameraなど、オンチップ処理に対応するSonyのIMX500インテリジェントビジョンセンサー向けにエクスポートします。
  • Rockchip RKNN (rknn): FP16およびINT8量子化に対応し、組み込みボード上のRockchip NPUを対象とします。
  • ExecuTorch (executorch): XNNPACKを通じてモバイル(iOSおよびAndroid)と組み込みシステムに対応する、PyTorchネイティブのオンデバイスランタイムです。
  • Axelera AI (axelera): PCIeまたはM.2経由でAxeleraのMetis AIPU(最大856 TOPS)向けにコンパイルし、高スループットのエッジ推論を実現します。
  • DEEPX (deepx): INT8量子化を用いた組み込みエッジ推論向けに、DEEPX NPUハードウェアを対象とします。
  • Qualcomm QNN (qnn): Qualcomm AIスタックを通じて、Snapdragon Hexagon NPU、Adreno GPU、CPU上でオンデバイス推論を実行します。

Hailo統合では、YOLOの検出、セグメンテーション、セマンティックセグメンテーション、深度推定、分類、姿勢、OBBモデルをHailo HEFに直接エクスポートします。検証済みモデルとターゲットについては、互換性表を参照してください。Ambarella統合ではONNXを中心とするワークフローを採用し、AmbarellaのCVflowツールチェーンを使用してONNXエクスポートをAmbaPB形式にコンパイルします。対象はCV72などのCVflow® SoCで、SpongeTorchの圧縮を考慮したトレーニングも任意で利用できます。Huawei Ascend統合では、CANN ATCコンパイラーを使用してONNXエクスポートを.omオフライン形式にコンパイルし、Ascend AI ProcessorsでFP16推論を実行します。AMD Xilinx統合では、AMD Quarkを使用してONNXエクスポートをVersal AI Edge Series Gen 2 NPU向けに量子化し、Vitis AI Execution Providerで.raiモデルにコンパイルします。

デプロイオプションの比較#

次の表では、通常、選択の決め手となる基準に沿って、YOLO26モデルのデプロイオプションをまとめています。各形式の詳細については、エクスポート形式のドキュメントをご覧ください。

デプロイオプション性能ベンチマーク互換性と統合コミュニティサポートとエコシステムケーススタディメンテナンスと更新セキュリティ上の考慮事項ハードウェアアクセラレーション
PyTorch柔軟性は高いものの、最大性能とのトレードオフが生じる場合がありますPythonライブラリとの優れた互換性豊富なリソースとコミュニティ研究とプロトタイプ定期的かつ活発な開発デプロイ環境に依存しますGPUアクセラレーション向けのCUDAサポート
TorchScriptPyTorchより本番環境向けですPyTorchからC++へのスムーズな移行専門性は高いものの、PyTorchより用途は限定的ですPythonがボトルネックとなる業界PyTorchと連動した継続的な更新Python全体に依存せず、セキュリティを強化できますPyTorchのCUDAサポートを継承します
ONNXランタイムによって異なりますさまざまなフレームワークで高い互換性があります幅広いエコシステムと、多数の組織によるサポートMLフレームワーク間で柔軟に利用できます新しい演算に対応する定期的な更新安全な変換とデプロイの手順を徹底しますさまざまなハードウェア最適化
OpenVINOIntelハードウェア向けに最適化されていますIntelエコシステムで最高の性能を発揮しますコンピュータービジョン分野で優れた実績がありますIntelハードウェアを活用したIoTとエッジIntelハードウェア向けの定期的なアップデート機密性の高いアプリケーション向けの堅牢な機能Intelハードウェア向けに最適化
TensorRTNVIDIA GPUで最高クラスの性能NVIDIAハードウェアに最適NVIDIAを通じた強力なネットワークリアルタイムの動画・画像推論新しいGPU向けの頻繁なアップデートセキュリティを重視NVIDIA GPU向けに設計
CoreMLAppleデバイス上での実行に最適化Appleエコシステム専用Appleおよび開発者による強力なサポートApple製品上でのオンデバイスMLAppleによる定期的なアップデートプライバシーとセキュリティを重視Apple Neural EngineとGPU
Core AIApple silicon向けに最適化iOS 27およびmacOS 27。Apple silicon搭載のmacOS 26以降またはx86_64 Linux(glibc 2.34以降)でエクスポート可能、Python 3.11~3.14Appleフレームワーク。iOS/Flutter SDKではオプトイン方式次世代Appleプラットフォーム上でのオンデバイスMLApple OSのリリースに連動。現在はベータ版オンデバイス推論によりデータをローカルに保持Apple Neural Engine、GPU、CPU
TF SavedModelサーバー環境でのスケーラビリティTensorFlowエコシステムとの幅広い互換性TensorFlowの人気による充実したサポート大規模なモデルサービングGoogleおよびコミュニティによる定期的なアップデートエンタープライズ向けの堅牢な機能多様なハードウェアアクセラレーション
TF GraphDef静的計算グラフでの安定性TensorFlowインフラストラクチャとの優れた統合性静的グラフを最適化するためのリソース静的グラフが必要なシナリオTensorFlowコアと連動したアップデートTensorFlowで確立されたセキュリティ対策TensorFlowのアクセラレーションオプション
TF Edge TPUGoogle Edge TPUハードウェア向けに最適化Edge TPUデバイス専用Googleおよびサードパーティのリソースとともに拡大リアルタイム処理が必要なIoTデバイス新しいEdge TPUハードウェア向けの改善Googleの堅牢なIoTセキュリティGoogle Coral向けにカスタム設計
LiteRTモバイル、組み込み、エッジ、ウェブでの高速性と効率性モバイル、組み込み、エッジ、ブラウザーをサポート活発なコミュニティとGoogleの支援Android、iOS、ウェブ向けのオンデバイスアプリ最新のオンデバイスランタイム機能オンデバイスおよびブラウザー内での安全な推論GPU、DSP、WebGPUによるアクセラレーション
PaddlePaddle競争力があり、使いやすく、スケーラブルBaiduエコシステムと幅広いアプリケーションサポート急速に成長しており、特に中国で拡大中国市場と言語処理中国のAIアプリケーションを重視データのプライバシーとセキュリティを重視BaiduのKunlunチップを含む
MNNモバイルデバイス向けの高性能モバイルおよび組み込み向けARMシステムとX86-64 CPUモバイル・組み込みMLコミュニティモバイルシステムでの効率性モバイルデバイスでの高性能な保守性オンデバイスセキュリティの利点ARM CPUおよびGPU向けの最適化
NCNNARMベースのモバイルデバイス向けに最適化モバイルおよび組み込み向けARMシステムニッチながら活発なモバイル・組み込みMLコミュニティAndroidおよびARMシステムでの効率性ARMでの高性能な保守性オンデバイスセキュリティの利点ARM CPUおよびGPU向けの最適化
Sony IMX500非常に低消費電力のセンサー上推論Sony IMX500センサー、Raspberry Pi AI CameraSony AITRIOSエコシステムカメラ上で実行するエッジAISony SDKおよびMCTツールチェーンのアップデートデータをセンサー上に保持Sony IMX500オンチップアクセラレーター
Rockchip RKNNRockchip NPU向けに最適化Rockchip SoCボード(例:RK3588)Rockchip開発者コミュニティ組み込みSBCおよびエッジデバイスRockchip RKNN-Toolkitのアップデートオンデバイスのローカル推論Rockchip NPU
ExecuTorch効率的なオンデバイスPyTorchランタイムXNNPACK経由でiOS、Android、組み込み環境に対応PyTorchプロジェクトによる支援モバイルおよび組み込みアプリPyTorchと連動してメンテナンスオンデバイス推論によりデータをローカルに保持XNNPACKおよびモバイルCPU/GPUバックエンド
Axelera AI非常に高いスループット(最大856 TOPS)PCIeまたはM.2接続のMetis AIPUAxelera Voyager SDK高スループットのエッジ推論Axelera SDKの更新オンプレミスのエッジ推論Axelera Metis AIPU
DEEPXINT8最適化NPU推論DEEPX NPUハードウェアDEEPX開発者ツール(dx_com、dx_engine)組み込みエッジ推論DEEPX SDKとランタイムの更新オンデバイスのローカル推論DEEPX NPU
Qualcomm QNNSnapdragonでの高速なデバイス上推論Snapdragon Hexagon NPU、Adreno GPU、CPUQualcomm AI Hubエコシステムモバイルおよびエッジ向けSnapdragonデバイスQualcomm AIスタック(QAIRT)の更新オンデバイス推論によりデータをローカルに保持Snapdragon Hexagon NPU
HailoHailo NPUでのINT8 HEF推論Hailo-8/8L/10H/15H/15L、Raspberry Pi AI HAT+Hailo Dataflow CompilerとHailoRTカメラ、ロボット、産業用エッジシステムHailo DFCとHailoRTのリリースオンデバイスのローカル推論Hailo NPU
Huawei AscendAscend AI Coreでのスループット向上AtlasボードとOrangePi AIProHuawei CANNエコシステムAscend NPUでのエッジ推論CANNとATCのリリースオンデバイスのローカル推論Ascend AI Core
AMD XilinxVersal AI Edge Gen 2 NPUでのINT8推論Versal AI Edge Series Gen 2(VEK385)AMD Vitis AIとQuarkアダプティブSoCでの組み込みビジョンVitis AIとQuarkのリリースオンデバイスのローカル推論Versal AI Engine NPU

この比較では、概要を把握できます。デプロイする際は、プロジェクト固有の要件や制約を各オプションと照らし合わせ、選択した形式に対応するリンク先の統合ガイドを参照してください。

結論#

YOLO26は幅広いエクスポート形式に対応しているため、クラウドGPUサーバーからセンサー搭載型のエッジカメラまで、ほぼあらゆる環境に合わせてモデルを調整できます。形式を選んだら、最適化、トラブルシューティング、セキュリティについてはモデルデプロイのベストプラクティスに従い、問題が発生した場合はUltralyticsコミュニティを活用してください。

よくある質問#

  • Ultralytics YOLO26は、それぞれ特定の環境やハードウェアプラットフォーム向けに設計された、さまざまなデプロイ形式に対応しています。主な形式は次のとおりです。

    • 研究やプロトタイピング向けのPyTorch。Pythonとの優れた統合性を備えています。
    • Pythonを利用できない本番環境向けのTorchScript。
    • クロスプラットフォーム互換性とハードウェアアクセラレーションに対応するONNX。
    • Intelハードウェアで性能を最適化するOpenVINO。
    • NVIDIA GPUで高速な推論を実現するTensorRT。

    各形式にはそれぞれ独自の利点があります。詳しい手順については、エクスポートプロセスのドキュメントをご覧ください。

  • Intel CPUでの推論速度を高めるには、IntelのOpenVINOツールキットを使用してYOLO26モデルをデプロイできます。OpenVINOは、Intelハードウェアを効率的に活用できるようモデルを最適化し、大幅な性能向上を実現します。

    1. model.export()関数を使用して、YOLO26モデルをOpenVINO形式に変換します。
    2. 詳しいセットアップ手順については、Intel OpenVINOエクスポートのドキュメントをご覧ください。

    詳しくは、ブログ記事をご覧ください。

  • はい、AndroidではLiteRT(旧TensorFlow Lite)とNCNN、iOSではCoreMLまたはLiteRTを使用して、YOLO26モデルをモバイルデバイスにデプロイできます。LiteRTは、モバイルおよび組み込みデバイス向けのGoogleのオンデバイスランタイムです。Android、iOS、ブラウザーで同じモデルを実行でき、効率的なオンデバイス推論を実現します。

    例
    from ultralytics import YOLO
    
    model = YOLO("yolo26n.pt")
    
    # NCNN形式へのエクスポートコマンド
    model.export(format="ncnn")

    モバイルへのモデルのデプロイについて詳しくは、LiteRT統合ガイドをご覧ください。

  • YOLO26のデプロイ形式を選ぶ際は、次の要素を考慮してください。

    • パフォーマンス: TensorRTなどの形式はNVIDIA GPUで優れた速度を発揮し、OpenVINOはIntelハードウェア向けに最適化されています。
    • 互換性: ONNXは、さまざまなプラットフォームとの幅広い互換性を備えています。
    • 統合の容易さ: CoreMLやLiteRTなどの形式は、それぞれiOSやAndroidなど、特定のエコシステム向けに設計されています。
    • コミュニティサポート: PyTorchやTensorFlowなどの形式には、充実したコミュニティリソースとサポートがあります。

    比較分析については、エクスポート形式のドキュメントをご覧ください。

  • YOLO26モデルをWebアプリケーションにデプロイするには、LiteRTのWebランタイムであるLiteRT.jsを使用できます。これにより、機械学習モデルをブラウザーやNode.jsで直接実行できます。この方法ではバックエンドのインフラストラクチャが不要になり、リアルタイムのパフォーマンスを実現できます。

    1. YOLO26モデルをLiteRT形式にエクスポートします。
    2. LiteRT.jsを使用して、エクスポートしたモデルをWebアプリケーションに統合します。

    手順については、LiteRT統合ガイドをご覧ください。

コメント