YOLO26 배포 옵션 비교 분석#
YOLO26은 PyTorch와 ONNX부터 TensorRT, OpenVINO, CoreML, 전용 엣지 NPU 형식에 이르기까지, 런타임, 하드웨어 대상 또는 플랫폼에 따라 최적화된 20가지 이상의 배포 옵션을 지원합니다. 적합한 옵션을 선택하려면 추론 속도, 하드웨어 제약, 통합 편의성 간의 균형을 고려해야 합니다. 이 가이드에서는 모든 옵션을 비교하여 애플리케이션에 가장 적합한 옵션을 선택할 수 있도록 돕고, 이후 모델 배포 모범 사례를 참고해 안정적으로 배포할 수 있도록 안내합니다.
시청: 프로젝트에 가장 적합한 Ultralytics YOLO26 배포 형식 선택 방법 | TensorRT | OpenVINO 🚀
배포는 학습된 모델이 실제 작업을 시작하는 컴퓨터 비전 프로젝트 워크플로의 단계이므로, 내보내기 형식은 속도, 비용 및 이식성에 직접적인 영향을 미칩니다.
YOLO26 모델에 적합한 배포 옵션 선택 방법#
YOLO26 모델을 배포할 때는 적합한 내보내기 형식을 선택하는 것이 매우 중요합니다. Ultralytics YOLO26 내보내기 문서에 설명된 것처럼, model.export() 함수는 학습된 모델을 다양한 환경과 성능 요구 사항에 맞게 설계된 여러 형식으로 변환합니다.
최적의 형식은 모델이 사용될 운영 환경과 하드웨어에 따라 달라집니다.
수동 내보내기 없이 관리형 배포를 수행하려면 Ultralytics Platform에서 전 세계 42개 리전의 자동 확장을 지원하는 즉시 사용 가능한 추론 엔드포인트를 제공합니다.
YOLO26의 배포 옵션#
각 형식에 대한 간단한 설명과 사용 시점을 안내합니다. 전체 내보내기 절차는 내보내기 문서를, 항목별 비교 기준은 비교표를 참조하세요.
- PyTorch (
.pt): 기본 학습 및 추론 형식으로, 최대한의 유연성을 제공하며 NVIDIA CUDA 또는 AMD ROCm을 통해 GPU 가속을 지원합니다. 내보내기 단계가 필요하지 않아 연구와 프로토타이핑에 적합합니다. - TorchScript (
torchscript): Python이 필요 없는 C++ 런타임용으로 모델을 직렬화하므로, Python을 사용할 수 없는 프로덕션 시스템에 적합합니다. - ONNX (
onnx): 프레임워크에 종속되지 않는 교환 형식으로, ONNX Runtime을 통해 폭넓은 플랫폼 및 하드웨어를 지원하며 CUDA를 사용하는 NVIDIA GPU와 MIGraphX를 사용하는 AMD GPU도 포함됩니다. - OpenVINO (
openvino): Intel CPU, 통합 GPU 및 NPU에서 추론을 최적화하는 Intel의 툴킷으로, IoT 및 엣지 컴퓨팅에서 널리 사용됩니다. - TensorRT (
engine): FP16 및 INT8 최적화를 통해 최고 수준의 GPU 추론 성능을 제공하는 NVIDIA의 고성능 런타임입니다. - CoreML (
coreml): Apple Neural Engine을 사용하는 iOS, macOS, watchOS 및 tvOS용 Apple의 온디바이스 형식입니다. - Core AI (
coreai): iOS 27 및 macOS 27용으로 새롭게 선보이는 Apple의.aimodel형식이며, CPU, GPU 및 Apple Neural Engine 전반에서 실행되도록 설계되었습니다. 내보내기에는 Apple silicon 기반 macOS 26 이상 또는 glibc 2.34 이상을 사용하는 x86_64 Linux가 필요하며, Python 3.11~3.14를 지원합니다. - TF SavedModel (
saved_model): TensorFlow Serving을 통한 확장 가능한 서버 측 서빙을 위한 TensorFlow 표준 형식입니다. - TF GraphDef (
pb): 고정된 계산 그래프가 필요한 환경을 위한 정적 그래프 고정형 TensorFlow 형식입니다. - TF Edge TPU (
edgetpu): Google Coral Edge TPU 가속기용으로.tflite모델을 컴파일합니다. - LiteRT (
litert): 단일.tflite모델에서 모바일, 임베디드 및 브라우저 추론을 지원하는 Google의 온디바이스 런타임(구 TensorFlow Lite)입니다. FP32 및 INT8을 지원하고 LiteRT.js를 통해 브라우저에서 실행할 수 있습니다. - PaddlePaddle (
paddle): 중국에서 널리 사용되는 Baidu의 딥러닝 프레임워크로, 폭넓은 하드웨어를 지원합니다. - MNN (
mnn): 모바일 및 임베디드 ARM과 x86-64 시스템에 최적화된 경량 고성능 추론 엔진입니다. - NCNN (
ncnn): 모바일 ARM 기기에 맞게 최적화된 고성능 경량 추론 프레임워크입니다. - Sony IMX500 (
imx): Raspberry Pi AI Camera와 같이 칩 내 처리가 가능한 Sony IMX500 지능형 비전 센서용으로 내보냅니다. - Rockchip RKNN (
rknn): 임베디드 보드의 Rockchip NPU를 대상으로 FP16 및 INT8 양자화를 지원합니다. - ExecuTorch (
executorch): XNNPACK을 통해 모바일(iOS 및 Android)과 임베디드 시스템을 지원하는 PyTorch 기본 온디바이스 런타임입니다. - Axelera AI (
axelera): 고처리량 엣지 추론을 위해 PCIe 또는 M.2를 통해 Axelera의 Metis AIPU(최대 856 TOPS)용으로 컴파일합니다. - DEEPX (
deepx): 임베디드 엣지 추론용 DEEPX NPU 하드웨어를 대상으로 INT8 양자화를 지원합니다. - Qualcomm QNN (
qnn): Qualcomm AI 스택을 통해 Snapdragon Hexagon NPU, Adreno GPU 및 CPU에서 온디바이스 추론을 지원합니다.
Hailo 통합은 YOLO 탐지, 분할, 시맨틱 분할, 깊이 추정, 분류, 포즈 및 OBB 모델을 Hailo HEF로 직접 내보냅니다. 검증된 모델과 타깃은 호환성 표를 참조하세요. Ambarella 통합은 ONNX 우선 워크플로를 따르며, CV72와 같은 CVflow® SoC용으로 Ambarella의 CVflow 툴체인을 사용해 ONNX 내보내기 결과를 AmbaPB 형식으로 컴파일하고, 필요에 따라 SpongeTorch 압축 인식 학습을 활용합니다. Huawei Ascend 통합은 CANN ATC 컴파일러를 사용해 ONNX 내보내기 결과를 .om 오프라인 형식으로 컴파일하여 Ascend AI 프로세서에서 FP16 추론을 수행합니다. AMD Xilinx 통합은 AMD Quark를 사용해 Versal AI Edge Series Gen 2 NPU용 ONNX 내보내기 결과를 양자화하며, Vitis AI Execution Provider가 이를 .rai 모델로 컴파일합니다.
배포 옵션 비교#
다음 표에서는 일반적으로 선택에 영향을 미치는 기준에 따라 YOLO26 모델의 배포 옵션을 요약합니다. 각 형식에 대한 자세한 내용은 내보내기 형식 문서를 참조하세요.
| 배포 옵션 | 성능 벤치마크 | 호환성 및 통합 | 커뮤니티 지원 및 생태계 | 사례 연구 | 유지보수 및 업데이트 | 보안 고려 사항 | 하드웨어 가속 |
|---|---|---|---|---|---|---|---|
| PyTorch | 유연성이 뛰어나지만 순수 성능과 절충이 필요할 수 있습니다 | Python 라이브러리와의 호환성이 뛰어납니다 | 풍부한 리소스와 커뮤니티를 제공합니다 | 연구 및 프로토타입 | 정기적이고 활발한 개발이 이루어집니다 | 배포 환경에 따라 달라집니다 | GPU 가속을 위한 CUDA 지원 |
| TorchScript | PyTorch보다 프로덕션에 적합합니다 | PyTorch에서 C++로 원활하게 전환할 수 있습니다 | 전문 분야에 적합하지만 PyTorch보다 범위가 좁습니다 | Python이 병목이 되는 산업 | PyTorch와 일관된 업데이트를 제공합니다 | Python 전체 환경 없이도 보안을 강화할 수 있습니다 | PyTorch의 CUDA 지원을 상속합니다 |
| ONNX | 런타임에 따라 달라집니다 | 다양한 프레임워크에서 높은 호환성을 제공합니다 | 폭넓은 생태계를 갖추고 여러 기관의 지원을 받습니다 | ML 프레임워크 전반에서 유연하게 사용할 수 있습니다 | 새로운 연산을 위한 정기 업데이트를 제공합니다 | 안전한 변환 및 배포 방식을 보장합니다 | 다양한 하드웨어 최적화를 지원합니다 |
| OpenVINO | Intel 하드웨어에 최적화되어 있습니다 | Intel 생태계에서 가장 뛰어난 성능을 발휘합니다 | 컴퓨터 비전 분야에서 탄탄한 입지를 갖추고 있습니다 | Intel 하드웨어 기반 IoT 및 엣지 | Intel 하드웨어 정기 업데이트 | 민감한 애플리케이션을 위한 강력한 기능 | Intel 하드웨어에 맞춤 설계 |
| TensorRT | NVIDIA GPU에서 최상급 성능 | NVIDIA 하드웨어에 최적 | NVIDIA를 통한 탄탄한 네트워크 | 실시간 비디오 및 이미지 추론 | 신규 GPU를 위한 잦은 업데이트 | 보안 중시 | NVIDIA GPU용으로 설계 |
| CoreML | 온디바이스 Apple 하드웨어에 최적화 | Apple 생태계 전용 | Apple 및 개발자 지원이 탄탄함 | Apple 제품에서의 온디바이스 ML | Apple의 정기 업데이트 | 개인정보 보호 및 보안 중점 | Apple Neural Engine 및 GPU |
| Core AI | Apple silicon에 최적화 | iOS 27 및 macOS 27; Apple silicon 탑재 macOS 26 이상 또는 x86_64 Linux(glibc 2.34 이상)에서 내보내기, Python 3.11-3.14 | Apple 프레임워크; iOS/Flutter SDK에서 선택적으로 활성화 | 차세대 Apple 플랫폼에서의 온디바이스 ML | Apple OS 릴리스에 연동되며 현재 베타 버전 | 온디바이스 추론으로 데이터를 로컬에 보관 | Apple Neural Engine, GPU 및 CPU |
| TF SavedModel | 서버 환경에서 확장 가능 | TensorFlow 생태계와 폭넓은 호환성 | TensorFlow의 인기에 힘입은 폭넓은 지원 | 대규모 모델 서빙 | Google 및 커뮤니티의 정기 업데이트 | 엔터프라이즈를 위한 강력한 기능 | 다양한 하드웨어 가속 |
| TF GraphDef | 정적 계산 그래프에서 안정적 | TensorFlow 인프라와 원활하게 통합 | 정적 그래프 최적화를 위한 리소스 | 정적 그래프가 필요한 시나리오 | TensorFlow 코어와 함께 업데이트 | 확립된 TensorFlow 보안 관행 | TensorFlow 가속 옵션 |
| TF Edge TPU | Google Edge TPU 하드웨어에 최적화 | Edge TPU 기기 전용 | Google 및 타사 리소스와 함께 성장 | 실시간 처리가 필요한 IoT 기기 | 새로운 Edge TPU 하드웨어를 위한 개선 | Google의 강력한 IoT 보안 | Google Coral 전용으로 설계 |
| LiteRT | 모바일/임베디드/웹 환경에서의 속도와 효율성 | 모바일, 임베디드, 엣지 및 브라우저 지원 | 탄탄한 커뮤니티와 Google의 지원 | Android, iOS 및 웹 전반의 온디바이스 앱 | 최신 온디바이스 런타임 기능 | 온디바이스 및 브라우저 내 추론의 보안 | GPU, DSP 및 WebGPU 가속 |
| PaddlePaddle | 경쟁력 있고 사용하기 쉬우며 확장 가능 | Baidu 생태계와 폭넓은 애플리케이션 지원 | 빠르게 성장하며 특히 중국에서 두드러짐 | 중국 시장 및 언어 처리 | 중국 AI 애플리케이션에 중점 | 데이터 개인정보 보호 및 보안 중시 | Baidu의 Kunlun 칩 포함 |
| MNN | 모바일 기기에서 높은 성능 | 모바일 및 임베디드 ARM 시스템과 X86-64 CPU | 모바일/임베디드 ML 커뮤니티 | 모바일 시스템 효율성 | 모바일 기기에서 높은 성능 유지 | 온디바이스 보안상의 이점 | ARM CPU 및 GPU 최적화 |
| NCNN | ARM 기반 모바일 기기에 최적화 | 모바일 및 임베디드 ARM 시스템 | 규모는 작지만 활발한 모바일/임베디드 ML 커뮤니티 | Android 및 ARM 시스템 효율성 | ARM에서 높은 성능 유지 | 온디바이스 보안상의 이점 | ARM CPU 및 GPU 최적화 |
| Sony IMX500 | 매우 낮은 전력으로 센서 내 추론 | Sony IMX500 센서, Raspberry Pi AI Camera | Sony AITRIOS 생태계 | 카메라 내 엣지 AI | Sony SDK 및 MCT 툴체인 업데이트 | 데이터를 센서에 보관 | Sony IMX500 온칩 가속기 |
| Rockchip RKNN | Rockchip NPU에 최적화 | Rockchip SoC 보드(예: RK3588) | Rockchip 개발자 커뮤니티 | 임베디드 SBC 및 엣지 기기 | Rockchip RKNN-Toolkit 업데이트 | 온디바이스 로컬 추론 | Rockchip NPU |
| ExecuTorch | 효율적인 온디바이스 PyTorch 런타임 | XNNPACK을 통한 iOS, Android 및 임베디드 지원 | PyTorch 프로젝트의 지원 | 모바일 및 임베디드 앱 | PyTorch와 함께 유지 관리 | 온디바이스 추론으로 데이터를 로컬에 보관 | XNNPACK 및 모바일 CPU/GPU 백엔드 |
| Axelera AI | 매우 높은 처리량(최대 856 TOPS) | PCIe 또는 M.2를 통한 Metis AIPU | Axelera Voyager SDK | 높은 처리량의 엣지 추론 | Axelera SDK 업데이트 | 온프레미스 엣지 추론 | Axelera Metis AIPU |
| DEEPX | INT8 최적화 NPU 추론 | DEEPX NPU 하드웨어 | DEEPX 개발자 도구(dx_com, dx_engine) | 임베디드 엣지 추론 | DEEPX SDK 및 런타임 업데이트 | 온디바이스 로컬 추론 | DEEPX NPU |
| Qualcomm QNN | 빠른 온디바이스 Snapdragon 추론 | Snapdragon Hexagon NPU, Adreno GPU, CPU | Qualcomm AI Hub 에코시스템 | 모바일 및 엣지 Snapdragon 디바이스 | Qualcomm AI 스택(QAIRT) 업데이트 | 온디바이스 추론으로 데이터를 로컬에 보관 | Snapdragon Hexagon NPU |
| Hailo | Hailo NPU에서의 INT8 HEF 추론 | Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+ | Hailo Dataflow Compiler 및 HailoRT | 카메라, 로봇, 산업용 엣지 시스템 | Hailo DFC 및 HailoRT 릴리스 | 온디바이스 로컬 추론 | Hailo NPU |
| Huawei Ascend | Ascend AI Core에서 더 높은 처리량 | Atlas 보드 및 OrangePi AIPro | Huawei CANN 에코시스템 | Ascend NPU의 엣지 추론 | CANN 및 ATC 릴리스 | 온디바이스 로컬 추론 | Ascend AI Core |
| AMD Xilinx | Versal AI Edge Gen 2 NPU에서의 INT8 추론 | Versal AI Edge Series Gen 2(VEK385) | AMD Vitis AI 및 Quark | 적응형 SoC의 임베디드 비전 | Vitis AI 및 Quark 릴리스 | 온디바이스 로컬 추론 | Versal AI Engine NPU |
이 비교는 전체적인 개요를 제공합니다. 배포 시에는 프로젝트의 구체적인 요구 사항과 제약 조건을 각 옵션과 비교해 검토하고, 선택한 형식에 해당하는 통합 가이드를 참조하세요.
결론#
YOLO26은 다양한 내보내기 형식을 지원하므로 클라우드 GPU 서버부터 센서에 직접 연결하는 엣지 카메라까지 거의 모든 환경에 맞게 모델을 조정할 수 있습니다. 형식을 선택한 다음 최적화, 문제 해결 및 보안을 위한 모델 배포 모범 사례를 따르고, 문제가 발생하면 Ultralytics 커뮤니티의 도움을 받으세요.
자주 묻는 질문#
Ultralytics YOLO26은 다양한 배포 형식을 지원하며, 각 형식은 특정 환경과 하드웨어 플랫폼에 맞게 설계되었습니다. 주요 형식은 다음과 같습니다.
- 연구 및 프로토타이핑에 적합하고 Python 통합이 뛰어난 PyTorch.
- Python을 사용할 수 없는 프로덕션 환경을 위한 TorchScript.
- 크로스 플랫폼 호환성 및 하드웨어 가속을 위한 ONNX.
- Intel 하드웨어에서 최적화된 성능을 제공하는 OpenVINO.
- NVIDIA GPU에서 고속 추론을 제공하는 TensorRT.
각 형식에는 고유한 장점이 있습니다. 자세한 단계별 안내는 내보내기 프로세스 문서를 참조하세요.
Intel CPU에서 추론 속도를 높이려면 Intel의 OpenVINO 툴킷을 사용해 YOLO26 모델을 배포할 수 있습니다. OpenVINO는 Intel 하드웨어를 효율적으로 활용하도록 모델을 최적화해 성능을 크게 향상합니다.
model.export()함수를 사용해 YOLO26 모델을 OpenVINO 형식으로 변환하세요.- 자세한 설정 안내는 Intel OpenVINO 내보내기 문서를 참조하세요.
더 자세한 내용은 블로그 게시물을 확인하세요.
예. Android에서는 LiteRT(이전 명칭 TensorFlow Lite)와 NCNN을 사용하고, iOS에서는 CoreML 또는 LiteRT를 사용해 YOLO26 모델을 모바일 디바이스에 배포할 수 있습니다. LiteRT는 모바일 및 임베디드 디바이스용 Google 온디바이스 런타임으로, Android, iOS, 브라우저에서 동일한 모델을 실행해 효율적인 온디바이스 추론을 제공합니다.
예제from ultralytics import YOLO model = YOLO("yolo26n.pt") # NCNN 형식 내보내기 명령 model.export(format="ncnn")모바일 디바이스에 모델을 배포하는 자세한 내용은 LiteRT 통합 가이드를 참조하세요.
YOLO26의 배포 형식을 선택할 때 다음 요소를 고려하세요.
- 성능: TensorRT와 같은 일부 형식은 NVIDIA GPU에서 탁월한 속도를 제공하며, OpenVINO는 Intel 하드웨어에 최적화되어 있습니다.
- 호환성: ONNX는 다양한 플랫폼에서 폭넓은 호환성을 제공합니다.
- 통합 용이성: CoreML이나 LiteRT와 같은 형식은 각각 iOS 및 Android와 같은 특정 에코시스템에 맞게 설계되었습니다.
- 커뮤니티 지원: PyTorch 및 TensorFlow와 같은 형식은 방대한 커뮤니티 자료와 지원을 제공합니다.
비교 분석은 내보내기 형식 문서를 참조하세요.
웹 애플리케이션에 YOLO26 모델을 배포하려면 LiteRT의 웹 런타임인 LiteRT.js를 사용할 수 있습니다. LiteRT.js를 사용하면 브라우저와 Node.js에서 머신 러닝 모델을 직접 실행할 수 있습니다. 이 방식은 백엔드 인프라가 필요하지 않으며 실시간 성능을 제공합니다.
- YOLO26 모델을 LiteRT 형식으로 내보내세요.
- LiteRT.js를 사용해 내보낸 모델을 웹 애플리케이션에 통합하세요.
단계별 지침은 LiteRT 통합 가이드를 참조하세요.