YOLO26 배포 옵션 비교 분석#
YOLO26은 다양한 runtime, 하드웨어 대상 또는 플랫폼에 맞게 조정된 20개 이상의 배포 옵션을 지원합니다. PyTorch와 ONNX부터 TensorRT, OpenVINO, CoreML, 전용 edge-NPU 형식까지 제공됩니다. 적합한 옵션을 선택하려면 추론 속도, 하드웨어 제약, 통합 용이성 사이의 균형을 고려해야 합니다. 이 가이드에서는 모든 옵션을 비교하여 애플리케이션에 가장 적합한 옵션을 선택할 수 있도록 안내한 다음, 안정적으로 배포하기 위한 모델 배포 모범 사례를 소개합니다.
Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀
배포는 학습된 모델이 실제 작업을 시작하는 컴퓨터 비전 프로젝트 workflow의 단계이므로, 어떤 형식으로 export하는지가 속도, 비용, 이식성에 직접적인 영향을 줍니다.
YOLO26 모델에 적합한 배포 옵션을 선택하는 방법#
YOLO26 모델을 배포할 시점이 되면 적합한 export 형식을 선택하는 것이 매우 중요합니다. Ultralytics YOLO26 export 문서에 설명된 것처럼 model.export() 함수는 학습된 모델을 다양한 환경과 성능 요구 사항에 맞는 여러 형식으로 변환합니다.
이상적인 형식은 모델의 사용 목적과 하드웨어에 따라 달라집니다.
수동 export 없이 관리형 배포를 수행하려면 Ultralytics Platform이 42개 글로벌 리전에서 자동 스케일링을 지원하는 즉시 사용 가능한 추론 endpoint를 제공합니다.
YOLO26의 배포 옵션#
다음은 각 형식에 대한 간략한 설명과 해당 형식을 사용해야 하는 경우입니다. 전체 export 과정은 export 문서를 참조하고, 기준별 비교는 비교 표에서 확인하십시오.
- PyTorch (
.pt): 기본 학습 및 추론 형식으로, NVIDIA CUDA 또는 AMD ROCm을 통한 GPU 가속과 최대의 유연성을 제공합니다. 별도의 export 단계가 필요하지 않아 연구와 프로토타이핑에 적합합니다. - TorchScript (
torchscript): Python이 없는 C++ runtime을 위해 모델을 직렬화하며, Python을 사용할 수 없는 production 시스템에 적합합니다. - ONNX (
onnx): ONNX Runtime을 통해 다양한 플랫폼과 하드웨어를 폭넓게 지원하는 framework에 종속되지 않는 상호 운용 형식입니다. - OpenVINO (
openvino): Intel CPU, 통합 GPU 및 NPU에서 최적화된 추론을 제공하는 Intel의 toolkit으로, IoT 및 edge computing 환경에서 널리 사용됩니다. - TensorRT (
engine): FP16 및 INT8 최적화를 통해 최고 수준의 GPU 추론 성능을 제공하는 NVIDIA의 고성능 runtime입니다. - CoreML (
coreml): Apple Neural Engine을 사용하는 iOS, macOS, watchOS 및 tvOS용 Apple의 on-device 형식입니다. - TF SavedModel (
saved_model): TensorFlow Serving을 통한 확장 가능한 서버 측 serving을 위한 TensorFlow의 표준 형식입니다. - TF GraphDef (
pb): 고정된 computation graph가 필요한 환경을 위한 동결된 정적 graph TensorFlow 형식입니다. - TF Edge TPU (
edgetpu):.tflite모델을 Google Coral Edge TPU accelerator용으로 컴파일합니다. - LiteRT (
litert): 단일.tflite모델을 사용하여 mobile, embedded 및 browser 추론을 수행하는 Google의 on-device runtime입니다. TensorFlow Lite를 기반으로 하며 FP32 및 INT8을 지원하고 LiteRT.js를 통한 browser 내 실행도 지원합니다. - PaddlePaddle (
paddle): 중국에서 널리 사용되는 Baidu의 deep learning framework로, 다양한 하드웨어를 폭넓게 지원합니다. - MNN (
mnn): mobile 및 embedded ARM과 x86-64 시스템에 최적화된 경량 고성능 추론 engine입니다. - NCNN (
ncnn): mobile ARM 장치에 맞게 조정된 고성능 경량 추론 framework입니다. - Sony IMX500 (
imx): Raspberry Pi AI Camera와 같은 on-chip 처리를 지원하는 Sony의 IMX500 intelligent vision sensor용으로 export합니다. - Rockchip RKNN (
rknn): FP16 및 INT8 양자화를 지원하며 embedded board의 Rockchip NPU를 대상으로 합니다. - ExecuTorch (
executorch): XNNPACK을 통해 mobile(iOS 및 Android) 및 embedded 시스템을 지원하는 PyTorch의 기본 on-device runtime입니다. - Axelera AI (
axelera): PCIe 또는 M.2를 통해 Axelera의 Metis AIPU(최대 856 TOPS)용으로 컴파일하여 고처리량 edge 추론을 지원합니다. - DEEPX (
deepx): embedded edge 추론을 위해 INT8 양자화를 지원하는 DEEPX NPU 하드웨어를 대상으로 합니다. - Qualcomm QNN (
qnn): Qualcomm AI stack을 통해 Snapdragon Hexagon NPU, Adreno GPU 및 CPU에서 on-device 추론을 수행합니다. - 핵심 AI (
coreai): iOS 27 및 macOS 27을 위한 Apple의 새로운.aimodel포맷으로, CPU, GPU, Apple Neural Engine에 걸쳐 예약되어 있으며; 내보내기에는 Apple 실리콘 기반의 macOS 26 이상이 필요합니다.
Hailo 통합은 YOLO detection, segmentation, semantic segmentation, depth estimation, classification, pose 및 OBB 모델을 Hailo HEF로 직접 export합니다. 검증된 모델과 대상은 호환성 표를 참조하십시오. Ambarella 통합은 ONNX 우선 workflow를 따르며, Ambarella의 CVflow toolchain을 사용해 ONNX export를 CV72와 같은 CVflow® SoC용 AmbaPB 형식으로 컴파일합니다. 필요에 따라 SpongeTorch compression-aware training을 사용할 수 있습니다. Huawei Ascend 통합은 CANN ATC compiler를 사용해 ONNX export를 .om offline 형식으로 컴파일하여 Ascend AI Processor에서 FP16 추론을 수행합니다.
배포 옵션 비교#
다음 표는 일반적으로 선택을 좌우하는 기준에 따라 YOLO26 모델의 배포 옵션을 요약합니다. 각 형식에 대한 자세한 내용은 export 형식 문서를 참조하십시오.
| 배포 옵션 | 성능 벤치마크 | 호환성 및 통합 | 커뮤니티 지원 및 생태계 | 사례 연구 | 유지 관리 및 업데이트 | 보안 고려 사항 | 하드웨어 가속 |
|---|---|---|---|---|---|---|---|
| PyTorch | 유연성이 우수하지만 원시 성능이 저하될 수 있습니다 | Python 라이브러리와의 호환성이 뛰어납니다 | 풍부한 리소스와 커뮤니티를 제공합니다 | 연구 및 프로토타입에 적합합니다 | 정기적이고 활발하게 개발됩니다 | 배포 환경에 따라 달라집니다 | GPU 가속을 위한 CUDA 지원 |
| TorchScript | PyTorch보다 production에 적합합니다 | PyTorch에서 C++로 원활하게 전환할 수 있습니다 | 전문화되어 있지만 PyTorch보다 범위가 좁습니다 | Python이 병목이 되는 산업 환경에 적합합니다 | PyTorch와 일관된 업데이트를 제공합니다 | 전체 Python 없이 향상된 보안을 제공합니다 | PyTorch에서 CUDA 지원을 상속합니다 |
| ONNX | runtime에 따라 달라집니다 | 서로 다른 framework 전반에서 지원 수준이 높습니다 | 광범위한 생태계를 보유하며 많은 조직이 지원합니다 | ML framework 전반에서 유연하게 사용할 수 있습니다 | 새로운 operation을 위한 정기 업데이트를 제공합니다 | 안전한 변환 및 배포 관행을 보장해야 합니다 | 다양한 하드웨어 최적화를 제공합니다 |
| OpenVINO | Intel 하드웨어에 최적화되어 있습니다 | Intel 생태계 내에서 가장 적합합니다 | computer vision 분야에서 견고합니다 | Intel 하드웨어를 사용하는 IoT 및 edge 환경에 적합합니다 | Intel 하드웨어를 위한 정기 업데이트를 제공합니다 | 민감한 애플리케이션을 위한 강력한 기능을 제공합니다 | Intel 하드웨어에 맞게 조정되어 있습니다 |
| TensorRT | NVIDIA GPU에서 최고 수준의 성능을 제공합니다 | NVIDIA 하드웨어에 가장 적합합니다 | NVIDIA를 통한 강력한 네트워크를 제공합니다 | 실시간 video 및 image 추론에 적합합니다 | 새로운 GPU를 위한 업데이트가 빈번합니다 | 보안을 중시합니다 | NVIDIA GPU용으로 설계되었습니다 |
| CoreML | on-device Apple 하드웨어에 최적화되어 있습니다 | Apple 생태계 전용입니다 | Apple 및 개발자 지원이 강력합니다 | Apple 제품에서 on-device ML을 지원합니다 | Apple의 정기 업데이트를 제공합니다 | privacy와 보안에 중점을 둡니다 | Apple Neural Engine 및 GPU를 사용합니다 |
| TF SavedModel | server 환경에서 확장 가능합니다 | TensorFlow 생태계에서 폭넓은 호환성을 제공합니다 | TensorFlow의 높은 인기로 인해 광범위한 지원을 받습니다 | 대규모로 모델을 serving할 수 있습니다 | Google과 커뮤니티가 정기적으로 업데이트합니다 | enterprise를 위한 강력한 기능을 제공합니다 | 다양한 하드웨어 가속을 지원합니다 |
| TF GraphDef | 정적 computation graph에 안정적입니다 | TensorFlow infrastructure와 원활하게 통합됩니다 | 정적 graph 최적화를 위한 리소스를 제공합니다 | 정적 graph가 필요한 시나리오에 적합합니다 | TensorFlow core와 함께 업데이트됩니다 | 확립된 TensorFlow 보안 관행을 따릅니다 | TensorFlow 가속 옵션 |
| TF Edge TPU | Google의 Edge TPU 하드웨어에 최적화 | Edge TPU 디바이스 전용 | Google 및 서드파티 리소스와 함께 성장 | 실시간 처리가 필요한 IoT 디바이스 | 새로운 Edge TPU 하드웨어를 위한 개선 사항 | Google의 강력한 IoT 보안 | Google Coral에 맞게 커스텀 설계 |
| LiteRT | 모바일/임베디드/웹 환경에서의 속도와 효율성 | 모바일, 임베디드, 엣지 및 브라우저 지원 | 강력한 커뮤니티와 Google의 지원 | Android, iOS 및 웹 전반의 온디바이스 앱 | 최신 온디바이스 런타임 기능 | 안전한 온디바이스 및 브라우저 내 추론 | GPU, DSP 및 WebGPU 가속 |
| PaddlePaddle | 경쟁력 있고 사용하기 쉬우며 확장 가능 | Baidu 생태계와 폭넓은 애플리케이션 지원 | 특히 중국에서 빠르게 성장 | 중국 시장 및 언어 처리 | 중국 AI 애플리케이션에 중점 | 데이터 개인정보 보호 및 보안 강조 | Baidu의 Kunlun 칩 포함 |
| MNN | 모바일 디바이스에서 높은 성능 | 모바일 및 임베디드 ARM 시스템과 X86-64 CPU | 모바일/임베디드 ML 커뮤니티 | 모바일 시스템 효율성 | 모바일 디바이스에서 높은 성능 유지 | 온디바이스 보안의 이점 | ARM CPU 및 GPU 최적화 |
| NCNN | 모바일 ARM 기반 디바이스에 최적화 | 모바일 및 임베디드 ARM 시스템 | 규모는 작지만 활발한 모바일/임베디드 ML 커뮤니티 | Android 및 ARM 시스템 효율성 | ARM에서 높은 성능 유지 | 온디바이스 보안의 이점 | ARM CPU 및 GPU 최적화 |
| Sony IMX500 | 매우 낮은 전력으로 센서 내 추론 | Sony IMX500 센서, Raspberry Pi AI Camera | Sony AITRIOS 생태계 | 카메라 내 엣지 AI | Sony SDK 및 MCT 툴체인 업데이트 | 데이터가 센서에 유지됨 | Sony IMX500 온칩 가속기 |
| Rockchip RKNN | Rockchip NPU에 최적화 | Rockchip SoC 보드(예: RK3588) | Rockchip 개발자 커뮤니티 | 임베디드 SBC 및 엣지 디바이스 | Rockchip RKNN-Toolkit 업데이트 | 온디바이스 로컬 추론 | Rockchip NPU |
| ExecuTorch | 효율적인 온디바이스 PyTorch 런타임 | XNNPACK을 통한 iOS, Android 및 임베디드 지원 | PyTorch 프로젝트의 지원 | 모바일 및 임베디드 앱 | PyTorch와 함께 유지 관리 | 온디바이스 추론으로 데이터를 로컬에 유지 | XNNPACK 및 모바일 CPU/GPU 백엔드 |
| Axelera AI | 매우 높은 처리량(최대 856 TOPS) | PCIe 또는 M.2를 통한 Metis AIPU | Axelera Voyager SDK | 높은 처리량의 엣지 추론 | Axelera SDK 업데이트 | 온프레미스 엣지 추론 | Axelera Metis AIPU |
| DEEPX | INT8에 최적화된 NPU 추론 | DEEPX NPU 하드웨어 | DEEPX 개발자 도구(dx_com, dx_engine) | 임베디드 엣지 추론 | DEEPX SDK 및 런타임 업데이트 | 온디바이스 로컬 추론 | DEEPX NPU |
| Qualcomm QNN | 빠른 온디바이스 Snapdragon 추론 | Snapdragon Hexagon NPU, Adreno GPU, CPU | Qualcomm AI Hub 생태계 | 모바일 및 엣지 Snapdragon 디바이스 | Qualcomm AI 스택(QAIRT) 업데이트 | 온디바이스 추론으로 데이터를 로컬에 유지 | Snapdragon Hexagon NPU |
| Hailo | Hailo NPU에서의 INT8 HEF 추론 | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler 및 HailoRT | 카메라, 로봇, 산업용 엣지 시스템 | Hailo DFC 및 HailoRT 릴리스 | 온디바이스 로컬 추론 | Hailo NPU |
| Huawei Ascend | Ascend AI Core에서의 더 높은 처리량 | Atlas 보드 및 OrangePi AIPro | Huawei CANN 생태계 | Ascend NPU에서의 엣지 추론 | CANN 및 ATC 릴리스 | 온디바이스 로컬 추론 | Ascend AI Core |
| Core AI | Apple 실리콘에 최적화됨 | iOS 27 및 macOS 27; 내보내기에는 macOS 26 이상 필요 | Apple 프레임워크; 아직 iOS/Flutter SDK에 포함되지 않음 | 차세대 Apple 플랫폼에서의 온디바이스 머신러닝 | Apple OS 릴리스와 연동됨; 현재 베타 버전 | 온디바이스 추론으로 데이터를 로컬에 유지 | Apple Neural Engine, GPU, CPU |
이 비교는 개괄적인 정보를 제공합니다. 배포 시 각 옵션에 대해 프로젝트의 구체적인 요구 사항과 제약 조건을 비교하고, 선택한 형식에 해당하는 링크된 통합 가이드를 참고하시기 바랍니다.
결론#
YOLO26의 다양한 export 형식을 사용하면 클라우드 GPU 서버부터 센서 내 엣지 카메라까지 거의 모든 환경에 맞게 모델을 조정할 수 있습니다. 형식을 선택한 후에는 최적화, 문제 해결 및 보안을 위해 model deployment best practices를 따르고, 문제가 발생하면 Ultralytics community를 활용하시기 바랍니다.
FAQ#
Ultralytics YOLO26은 특정 환경과 하드웨어 플랫폼에 맞게 설계된 다양한 배포 형식을 지원합니다. 주요 형식은 다음과 같습니다:
- 연구 및 프로토타이핑을 위한 PyTorch로, 뛰어난 Python 통합을 제공합니다.
- Python을 사용할 수 없는 프로덕션 환경을 위한 TorchScript입니다.
- 플랫폼 간 호환성 및 하드웨어 가속을 위한 ONNX입니다.
- Intel 하드웨어에서 최적화된 성능을 위한 OpenVINO입니다.
- NVIDIA GPU에서 고속 추론을 위한 TensorRT입니다.
각 형식에는 고유한 장점이 있습니다. 자세한 단계별 안내는 export process documentation을 참조하시기 바랍니다.
Intel CPU에서 추론 속도를 향상하려면 Intel의 OpenVINO 툴킷을 사용하여 YOLO26 모델을 배포할 수 있습니다. OpenVINO는 Intel 하드웨어를 효율적으로 활용하도록 모델을 최적화하여 성능을 크게 향상합니다.
model.export()함수를 사용하여 YOLO26 모델을 OpenVINO 형식으로 변환합니다.- Intel OpenVINO Export documentation의 자세한 설정 가이드를 따르시기 바랍니다.
더 자세한 내용은 blog post를 확인하시기 바랍니다.
예, YOLO26 모델은 Android에서 LiteRT(이전 TensorFlow Lite) 및 NCNN을 사용하고, iOS에서 CoreML 또는 LiteRT를 사용하여 모바일 디바이스에 배포할 수 있습니다. LiteRT는 모바일 및 임베디드 디바이스를 위한 Google의 온디바이스 런타임으로, Android, iOS 및 브라우저에서 동일한 모델을 실행하여 효율적인 온디바이스 추론을 제공합니다.
예시# Export command for NCNN format model.export(format="ncnn")모바일에 모델을 배포하는 방법에 대한 자세한 내용은 LiteRT 통합 가이드를 참조하십시오.
YOLO26의 배포 형식을 선택할 때 다음 요소를 고려하십시오.
- 성능: TensorRT와 같은 일부 형식은 NVIDIA GPU에서 탁월한 속도를 제공하며, OpenVINO는 Intel 하드웨어에 최적화되어 있습니다.
- 호환성: ONNX는 다양한 플랫폼에서 폭넓은 호환성을 제공합니다.
- 통합 용이성: CoreML 또는 LiteRT와 같은 형식은 각각 iOS 및 Android와 같은 특정 생태계에 맞게 설계되었습니다.
- 커뮤니티 지원: PyTorch 및 TensorFlow와 같은 형식은 광범위한 커뮤니티 리소스와 지원을 제공합니다.
비교 분석은 내보내기 형식 문서를 참조하십시오.
웹 애플리케이션에 YOLO26 모델을 배포하려면 LiteRT의 웹 런타임인 LiteRT.js를 사용할 수 있습니다. 이를 통해 머신 러닝 모델을 브라우저와 Node.js에서 직접 실행할 수 있습니다. 이 방식은 백엔드 인프라가 필요하지 않으며 실시간 성능을 제공합니다.
- YOLO26 모델을 LiteRT 형식으로 내보냅니다.
- LiteRT.js를 사용하여 내보낸 모델을 웹 애플리케이션에 통합합니다.
단계별 지침은 LiteRT 통합 가이드를 참조하십시오.