YOLO26デプロイオプションの比較分析#
YOLO26 は 20 種類以上のデプロイオプションをサポートしており、それぞれが PyTorch や ONNX から TensorRT、OpenVINO、CoreML、専用のエッジ NPU 形式に至るまで、異なるランタイム、ハードウェアターゲット、プラットフォームに合わせて調整されています。適切な形式を選択することで、推論速度、ハードウェアの制約、統合の容易さのバランスを取ることができます。このガイドでは、すべてのオプションを比較して、アプリケーションに最適なものを選択できるようにし、その後モデルデプロイのベストプラクティスに進んで確実にデプロイする方法を説明します。
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
デプロイは、コンピュータビジョンプロジェクトのワークフローにおいてトレーニング済みモデルが実際の処理を開始するステージであるため、エクスポート先の形式は速度、コスト、移植性に直接的な影響を与えます。
YOLO26モデルに最適なデプロイオプションを選択する方法#
YOLO26 モデルをデプロイする際、適切なエクスポート形式の選択は非常に重要です。Ultralytics YOLO26 エクスポートドキュメントで説明されているように、model.export() 関数は、トレーニング済みモデルを多様な環境やパフォーマンス要件に合わせてさまざまな形式に変換します。
理想的なフォーマットは、モデルの意図する運用コンテキストとハードウェアに依存します。
手動でのエクスポートを必要としないマネージドデプロイのために、Ultralytics Platform は、42 のグローバルリージョンにわたる自動スケーリングを備えたすぐに使用できる推論エンドポイントを提供します。
YOLO26のデプロイオプション#
以下は各形式の簡単な説明と、それぞれの使用に適した状況です。完全なエクスポートの手順についてはエクスポートドキュメントを、並べて比較した基準については比較表をご覧ください。
- PyTorch (
.pt): ネイティブのトレーニングおよび推論形式であり、エクスポートステップを必要とせずに、NVIDIA CUDA または AMD ROCm を通じた最大の柔軟性と GPU アクセラレーションを提供します。これは研究やプロトタイピングに最適です。 - TorchScript (
torchscript): Python が利用できない本番システムに適した、Python フリーの C++ ランタイム用にモデルをシリアル化します。 - ONNX (
onnx): ONNX Runtime を通じて幅広いクロスプラットフォームおよびハードウェアサポートを提供する、フレームワークに依存しない互換形式です。 - OpenVINO (
openvino): Intel の CPU、統合 GPU、NPU で最適化された推論を行うための Intel のツールキットであり、IoT やエッジコンピューティングで広く使用されています。 - TensorRT (
engine): FP16 および INT8 の最適化により、最高レベルの GPU 推論を実現する NVIDIA の高性能ランタイムです。 - CoreML (
coreml): Apple Neural Engine を使用し、iOS、macOS、watchOS、tvOS 向けの Apple のオンデバイス形式です。 - TF SavedModel (
saved_model): TensorFlow Serving によるスケーラブルなサーバーサイドサービングのための TensorFlow の標準形式です。 - TF GraphDef (
pb): 固定の計算グラフを必要とする環境向けの、凍結された静的グラフの TensorFlow 形式です。 - TF Edge TPU (
edgetpu): Google Coral Edge TPU アクセラレータ用に.tfliteモデルをコンパイルします。 - LiteRT (
litert): モバイル、組み込み、およびブラウザでの推論を単一の.tfliteモデルから実行するための Google のオンデバイスランタイム(旧 TensorFlow Lite)です。FP32 および INT8 をサポートし、LiteRT.js を介したブラウザ内実行が可能です。 - PaddlePaddle (
paddle): 中国で人気があり、幅広いハードウェアサポートを備えた Baidu のディープラーニングフレームワークです。 - MNN (
mnn): モバイルおよび組み込みの ARM および x86-64 システム向けに最適化された、軽量かつ高性能な推論エンジンです。 - NCNN (
ncnn): モバイル ARM デバイス向けに調整された、高性能で軽量な推論フレームワークです。 - Sony IMX500 (
imx): Raspberry Pi AI Camera などの、チップ上での処理機能を備えたソニーのインテリジェントビジョンセンサー IMX500 向けのエクスポートです。 - Rockchip RKNN (
rknn): FP16 および INT8 の量子化を使用して、組み込みボード上の Rockchip NPU をターゲットにします。 - ExecuTorch (
executorch): XNNPACK を介したモバイル(iOS および Android)および組み込みシステム向けの PyTorch ネイティブのオンデバイスランタイムです。 - Axelera AI (
axelera): 高スループットのエッジ推論のために、PCIe または M.2 を介して Axelera の Metis AIPU(最大 856 TOPS)向けにコンパイルします。 - DEEPX (
deepx): 組み込みエッジ推論のために、INT8 の量子化を使用して DEEPX NPU ハードウェアをターゲットにします。 - Qualcomm QNN (
qnn): Qualcomm AI スタックを介して、Snapdragon の Hexagon NPU、Adreno GPU、および CPU でオンデバイス推論を実行します。
Hailo インテグレーションは、YOLO の検出、セグメンテーション、セマンティックセグメンテーション、深度推定、分類、姿勢推定、OBB モデルを Hailo HEF に直接エクスポートします。検証済みモデルとターゲットについては、その互換性テーブルを参照してください。Ambarella インテグレーションは ONNX ファーストのワークフローに従い、CV72 などの CVflow® SoC 向けに Ambarella の CVflow ツールチェーンを使用して ONNX エクスポートを AmbaPB 形式にコンパイルし、必要に応じて SpongeTorch 圧縮認識トレーニングを使用します。Huawei Ascend インテグレーションは、Ascend AI プロセッサーでの FP16 推論のために、CANN ATC コンパイラを使用して ONNX エクスポートを .om オフライン形式にコンパイルします。
デプロイオプションの比較#
次の表は、選択の決め手となる一般的な基準に基づいた、YOLO26 モデルのデプロイオプションをまとめたものです。各形式の詳細については、エクスポート形式のドキュメントをご覧ください。
| デプロイメントオプション | パフォーマンスベンチマーク | 互換性と統合 | コミュニティサポートとエコシステム | ユースケース | メンテナンスとアップデート | セキュリティの考慮事項 | ハードウェアアクセラレーション |
|---|---|---|---|---|---|---|---|
| PyTorch | 優れた柔軟性; 生のパフォーマンスとトレードオフになる可能性があります | Python ライブラリとの優れた互換性 | 豊富なリソースとコミュニティ | 研究およびプロトタイプ | 定期的な活発な開発 | デプロイメント環境に依存 | GPU アクセラレーションのための CUDA サポート |
| TorchScript | PyTorch よりも本番環境に適している | PyTorch から C++ へのスムーズな移行 | 専門的ですが PyTorch よりも限定的 | Python がボトルネックとなる業界 | PyTorch との一貫したアップデート | Python 全体を含まないことによるセキュリティの向上 | PyTorch から CUDA サポートを継承 |
| ONNX | ランタイムによって異なる | 異なるフレームワーク間で高い互換性 | 多くの組織にサポートされた幅広いエコシステム | ML フレームワーク間での柔軟性 | 新しい演算に対する定期的なアップデート | 安全な変換とデプロイメントの実践を確保 | さまざまなハードウェア最適化 |
| OpenVINO | Intel ハードウェア向けに最適化 | Intel エコシステム内で最適 | コンピュータビジョン分野で堅実 | Intel ハードウェアを使用した IoT およびエッジ | Intel ハードウェア向けの定期的なアップデート | 機密性の高いアプリケーション向けの堅牢な機能 | Intel ハードウェア向けに調整 |
| TensorRT | NVIDIA GPU で最高レベル | NVIDIA ハードウェアに最適 | NVIDIA を通じた強力なネットワーク | リアルタイムのビデオおよび画像推論 | 新しい GPU に対する頻繁なアップデート | セキュリティを重視 | NVIDIA GPU 向けに設計 |
| CoreML | オンデバイスの Apple ハードウェアに最適化 | Apple エコシステム専用 | 強力な Apple と開発者のサポート | Apple 製品でのオンデバイス ML | Apple の定期的なアップデート | プライバシーとセキュリティに重点を置く | Apple Neural Engine および GPU |
| TF SavedModel | サーバー環境でスケーラブル | TensorFlow エコシステム内での幅広い互換性 | TensorFlow の人気による大規模なサポート | 大規模なモデルの提供 | Google とコミュニティによる定期的なアップデート | エンタープライズ向けの堅牢な機能 | さまざまなハードウェアアクセラレーション |
| TF GraphDef | 静的計算グラフに対して安定 | TensorFlow インフラストラクチャとうまく統合 | 静的グラフを最適化するためのリソース | 静的グラフを必要とするシナリオ | TensorFlowコアに合わせたアップデート | 確立されたTensorFlowセキュリティプラクティス | TensorFlowアクセラレーションオプション |
| TF Edge TPU | GoogleのEdge TPUハードウェア向けに最適化 | Edge TPUデバイス専用 | Googleおよびサードパーティのリソースと共に成長 | リアルタイム処理を必要とするIoTデバイス | 新しいEdge TPUハードウェア向けの改善 | Googleの堅牢なIoTセキュリティ | Google Coral向けにカスタム設計 |
| LiteRT | モバイル/組み込み/Web環境における速度と効率 | モバイル、組み込み、エッジ、およびブラウザのサポート | 堅牢なコミュニティ、Googleのサポート | Android、iOS、Webを横断したオンデバイスアプリ | 最新のオンデバイスランタイム機能 | 安全なオンデバイスおよびブラウザ内推論 | GPU、DSP、およびWebGPUアクセラレーション |
| PaddlePaddle | 競争力があり、使いやすくスケーラブル | Baiduエコシステム、幅広いアプリケーションサポート | 特に中国で急成長中 | 中国市場と言語処理 | 中国のAIアプリケーションに注力 | データプライバシーとセキュリティを重視 | BaiduのKunlunチップを含む |
| MNN | モバイルデバイス向けの高性能 | モバイルおよび組み込みARMシステムとX86-64 CPU | モバイル/組み込みMLコミュニティ | モバイルシステムの効率性 | モバイルデバイス上での高性能なメンテナンス | オンデバイスセキュリティの利点 | ARM CPUおよびGPUの最適化 |
| NCNN | モバイルARMベースデバイス向けに最適化 | モバイルおよび組み込みARMシステム | ニッチだが活発なモバイル/組み込みMLコミュニティ | AndroidおよびARMシステムの効率性 | ARMにおける高性能な保守 | オンデバイスセキュリティの利点 | ARM CPUおよびGPUの最適化 |
| Sony IMX500 | 超低消費電力でのセンサー内推論 | Sony IMX500センサー、Raspberry Pi AI Camera | Sony AITRIOSエコシステム | カメラ内エッジAI | Sony SDKおよびMCTツールチェーンのアップデート | データはセンサー内に留まる | Sony IMX500チップ内アクセラレータ |
| Rockchip RKNN | Rockchip NPU向けに最適化 | Rockchip SoCボード(例:RK3588) | Rockchip開発者コミュニティ | 組み込みSBCおよびエッジデバイス | Rockchip RKNN-Toolkitのアップデート | オンデバイスでのローカル推論 | Rockchip NPU |
| ExecuTorch | 効率的なオンデバイスPyTorchランタイム | iOS、Android、XNNPACK経由の組み込み | PyTorchプロジェクトによる支援 | モバイルおよび組み込みアプリ | PyTorchと並行してメンテナンス | デバイス内での推論によりデータをローカルに保持 | XNNPACKおよびモバイルCPU/GPUバックエンド |
| Axelera AI | 非常に高いスループット(最大856 TOPS) | PCIeまたはM.2経由のMetis AIPU | Axelera Voyager SDK | 高スループットのエッジ推論 | Axelera SDKのアップデート | オンプレミスでのエッジ推論 | Axelera Metis AIPU |
| DEEPX | INT8最適化されたNPU推論 | DEEPX NPUハードウェア | DEEPX開発者ツール (dx_com, dx_engine) | 組み込みエッジ推論 | DEEPX SDKおよびランタイムのアップデート | オンデバイスでのローカル推論 | DEEPX NPU |
| Qualcomm QNN | 高速なオンデバイスSnapdragon推論 | Snapdragon Hexagon NPU、Adreno GPU、CPU | Qualcomm AI Hubエコシステム | モバイルおよびエッジSnapdragonデバイス | Qualcomm AIスタック (QAIRT) のアップデート | デバイス内での推論によりデータをローカルに保持 | Snapdragon Hexagon NPU |
この比較は、全体的な概要を提供するものです。デプロイにあたっては、プロジェクトの具体的な要件や制約を各オプションと照らし合わせ、選択したフォーマットのリンク先統合ガイドを参照してください。
結論#
YOLO26 の幅広いエクスポート形式により、クラウド GPU サーバーからオンセンサーのエッジカメラに至るまで、ほぼあらゆる環境に合わせてモデルを調整できます。形式を選択したら、最適化、トラブルシューティング、セキュリティについてモデルデプロイのベストプラクティスに従い、問題が発生した場合はUltralytics コミュニティを活用してください。
よくある質問 (FAQ)#
Ultralytics YOLO26は、特定の環境やハードウェアプラットフォーム向けに設計されたさまざまなデプロイメントフォーマットをサポートしています。主要なフォーマットは以下の通りです:
- PyTorch: 研究やプロトタイピング向け。優れたPython統合を提供します。
- TorchScript: Pythonが使用できない本番環境向け。
- ONNX: クロスプラットフォームの互換性とハードウェアアクセラレーション向け。
- OpenVINO: Intelハードウェアでのパフォーマンス最適化向け。
- TensorRT: NVIDIA GPUでの高速推論向け。
各形式には独自の利点があります。詳細な手順については、エクスポートプロセスのドキュメントをご覧ください。
Intel CPUでの推論速度を向上させるには、IntelのOpenVINOツールキットを使用してYOLO26モデルをデプロイできます。OpenVINOは、Intelハードウェアを効率的に活用するようにモデルを最適化し、大幅なパフォーマンス向上を実現します。
model.export()関数を使用して、YOLO26 モデルを OpenVINO 形式に変換します。- Intel OpenVINO エクスポートドキュメントの詳細なセットアップガイドに従ってください。
詳細については、当社のブログ記事をご覧ください。
はい、YOLO26 モデルは、Android では LiteRT(旧 TensorFlow Lite)や NCNN、iOS では CoreML または LiteRT を使用してモバイルデバイスにデプロイできます。LiteRT は、モバイルおよび組み込みデバイス向けの Google のオンデバイスランタイムであり、Android、iOS、ブラウザ間で同じモデルを実行し、効率的なオンデバイス推論を提供します。
例# Export command for NCNN format model.export(format="ncnn")モデルのモバイルへのデプロイに関する詳細については、LiteRT インテグレーションガイドをご参照ください。
YOLO26のデプロイメントフォーマットを選択する際は、以下の要素を考慮してください:
- パフォーマンス: TensorRTのようなフォーマットはNVIDIA GPUで非常に高速ですが、OpenVINOはIntelハードウェアに最適化されています。
- 互換性: ONNXは、異なるプラットフォーム間で幅広い互換性を提供します。
- 統合の容易さ: CoreMLやLiteRTのようなフォーマットは、それぞれiOSやAndroidといった特定のエコシステムに合わせて調整されています。
- コミュニティサポート: PyTorch や TensorFlow などの形式には、豊富なコミュニティリソースとサポートがあります。
比較分析については、エクスポート形式のドキュメントをご参照ください。
YOLO26 モデルを Web アプリケーションにデプロイするには、LiteRT の Web ランタイムである LiteRT.js を使用できます。これにより、機械学習モデルをブラウザや Node.js 内で直接実行できるようになります。このアプローチにより、バックエンドインフラストラクチャが不要になり、リアルタイムのパフォーマンスが提供されます。
- YOLO26モデルをLiteRTフォーマットにエクスポートします。
- LiteRT.jsを使用して、エクスポートされたモデルをWebアプリケーションに統合します。
手順については、LiteRT インテグレーションガイドをご参照ください。