Ultralytics YOLO27:

YOLO26 배포 옵션 비교 분석#

YOLO26은 다양한 runtime, 하드웨어 대상 또는 플랫폼에 맞게 조정된 20개 이상의 배포 옵션을 지원합니다. PyTorch와 ONNX부터 TensorRT, OpenVINO, CoreML, 전용 edge-NPU 형식까지 제공됩니다. 적합한 옵션을 선택하려면 추론 속도, 하드웨어 제약, 통합 용이성 사이의 균형을 고려해야 합니다. 이 가이드에서는 모든 옵션을 비교하여 애플리케이션에 가장 적합한 옵션을 선택할 수 있도록 안내한 다음, 안정적으로 배포하기 위한 모델 배포 모범 사례를 소개합니다.



Watch: How to Choose the Best Ultralytics YOLO26 Deployment Format for Your Project | TensorRT | OpenVINO 🚀

배포는 학습된 모델이 실제 작업을 시작하는 컴퓨터 비전 프로젝트 workflow의 단계이므로, 어떤 형식으로 export하는지가 속도, 비용, 이식성에 직접적인 영향을 줍니다.

YOLO26 모델에 적합한 배포 옵션을 선택하는 방법#

YOLO26 모델을 배포할 시점이 되면 적합한 export 형식을 선택하는 것이 매우 중요합니다. Ultralytics YOLO26 export 문서에 설명된 것처럼 model.export() 함수는 학습된 모델을 다양한 환경과 성능 요구 사항에 맞는 여러 형식으로 변환합니다.

이상적인 형식은 모델의 사용 목적과 하드웨어에 따라 달라집니다.

수동 export 건너뛰기

수동 export 없이 관리형 배포를 수행하려면 Ultralytics Platform이 42개 글로벌 리전에서 자동 스케일링을 지원하는 즉시 사용 가능한 추론 endpoint를 제공합니다.

YOLO26의 배포 옵션#

다음은 각 형식에 대한 간략한 설명과 해당 형식을 사용해야 하는 경우입니다. 전체 export 과정은 export 문서를 참조하고, 기준별 비교는 비교 표에서 확인하십시오.

  • PyTorch (.pt): 기본 학습 및 추론 형식으로, NVIDIA CUDA 또는 AMD ROCm을 통한 GPU 가속과 최대의 유연성을 제공합니다. 별도의 export 단계가 필요하지 않아 연구와 프로토타이핑에 적합합니다.
  • TorchScript (torchscript): Python이 없는 C++ runtime을 위해 모델을 직렬화하며, Python을 사용할 수 없는 production 시스템에 적합합니다.
  • ONNX (onnx): ONNX Runtime을 통해 다양한 플랫폼과 하드웨어를 폭넓게 지원하는 framework에 종속되지 않는 상호 운용 형식입니다.
  • OpenVINO (openvino): Intel CPU, 통합 GPU 및 NPU에서 최적화된 추론을 제공하는 Intel의 toolkit으로, IoT 및 edge computing 환경에서 널리 사용됩니다.
  • TensorRT (engine): FP16 및 INT8 최적화를 통해 최고 수준의 GPU 추론 성능을 제공하는 NVIDIA의 고성능 runtime입니다.
  • CoreML (coreml): Apple Neural Engine을 사용하는 iOS, macOS, watchOS 및 tvOS용 Apple의 on-device 형식입니다.
  • TF SavedModel (saved_model): TensorFlow Serving을 통한 확장 가능한 서버 측 serving을 위한 TensorFlow의 표준 형식입니다.
  • TF GraphDef (pb): 고정된 computation graph가 필요한 환경을 위한 동결된 정적 graph TensorFlow 형식입니다.
  • TF Edge TPU (edgetpu): .tflite 모델을 Google Coral Edge TPU accelerator용으로 컴파일합니다.
  • LiteRT (litert): 단일 .tflite 모델을 사용하여 mobile, embedded 및 browser 추론을 수행하는 Google의 on-device runtime입니다. TensorFlow Lite를 기반으로 하며 FP32 및 INT8을 지원하고 LiteRT.js를 통한 browser 내 실행도 지원합니다.
  • PaddlePaddle (paddle): 중국에서 널리 사용되는 Baidu의 deep learning framework로, 다양한 하드웨어를 폭넓게 지원합니다.
  • MNN (mnn): mobile 및 embedded ARM과 x86-64 시스템에 최적화된 경량 고성능 추론 engine입니다.
  • NCNN (ncnn): mobile ARM 장치에 맞게 조정된 고성능 경량 추론 framework입니다.
  • Sony IMX500 (imx): Raspberry Pi AI Camera와 같은 on-chip 처리를 지원하는 Sony의 IMX500 intelligent vision sensor용으로 export합니다.
  • Rockchip RKNN (rknn): FP16 및 INT8 양자화를 지원하며 embedded board의 Rockchip NPU를 대상으로 합니다.
  • ExecuTorch (executorch): XNNPACK을 통해 mobile(iOS 및 Android) 및 embedded 시스템을 지원하는 PyTorch의 기본 on-device runtime입니다.
  • Axelera AI (axelera): PCIe 또는 M.2를 통해 Axelera의 Metis AIPU(최대 856 TOPS)용으로 컴파일하여 고처리량 edge 추론을 지원합니다.
  • DEEPX (deepx): embedded edge 추론을 위해 INT8 양자화를 지원하는 DEEPX NPU 하드웨어를 대상으로 합니다.
  • Qualcomm QNN (qnn): Qualcomm AI stack을 통해 Snapdragon Hexagon NPU, Adreno GPU 및 CPU에서 on-device 추론을 수행합니다.
  • 핵심 AI (coreai): iOS 27 및 macOS 27을 위한 Apple의 새로운 .aimodel 포맷으로, CPU, GPU, Apple Neural Engine에 걸쳐 예약되어 있으며; 내보내기에는 Apple 실리콘 기반의 macOS 26 이상이 필요합니다.

Hailo 통합은 YOLO detection, segmentation, semantic segmentation, depth estimation, classification, pose 및 OBB 모델을 Hailo HEF로 직접 export합니다. 검증된 모델과 대상은 호환성 표를 참조하십시오. Ambarella 통합은 ONNX 우선 workflow를 따르며, Ambarella의 CVflow toolchain을 사용해 ONNX export를 CV72와 같은 CVflow® SoC용 AmbaPB 형식으로 컴파일합니다. 필요에 따라 SpongeTorch compression-aware training을 사용할 수 있습니다. Huawei Ascend 통합은 CANN ATC compiler를 사용해 ONNX export를 .om offline 형식으로 컴파일하여 Ascend AI Processor에서 FP16 추론을 수행합니다.

배포 옵션 비교#

다음 표는 일반적으로 선택을 좌우하는 기준에 따라 YOLO26 모델의 배포 옵션을 요약합니다. 각 형식에 대한 자세한 내용은 export 형식 문서를 참조하십시오.

배포 옵션성능 벤치마크호환성 및 통합커뮤니티 지원 및 생태계사례 연구유지 관리 및 업데이트보안 고려 사항하드웨어 가속
PyTorch유연성이 우수하지만 원시 성능이 저하될 수 있습니다Python 라이브러리와의 호환성이 뛰어납니다풍부한 리소스와 커뮤니티를 제공합니다연구 및 프로토타입에 적합합니다정기적이고 활발하게 개발됩니다배포 환경에 따라 달라집니다GPU 가속을 위한 CUDA 지원
TorchScriptPyTorch보다 production에 적합합니다PyTorch에서 C++로 원활하게 전환할 수 있습니다전문화되어 있지만 PyTorch보다 범위가 좁습니다Python이 병목이 되는 산업 환경에 적합합니다PyTorch와 일관된 업데이트를 제공합니다전체 Python 없이 향상된 보안을 제공합니다PyTorch에서 CUDA 지원을 상속합니다
ONNXruntime에 따라 달라집니다서로 다른 framework 전반에서 지원 수준이 높습니다광범위한 생태계를 보유하며 많은 조직이 지원합니다ML framework 전반에서 유연하게 사용할 수 있습니다새로운 operation을 위한 정기 업데이트를 제공합니다안전한 변환 및 배포 관행을 보장해야 합니다다양한 하드웨어 최적화를 제공합니다
OpenVINOIntel 하드웨어에 최적화되어 있습니다Intel 생태계 내에서 가장 적합합니다computer vision 분야에서 견고합니다Intel 하드웨어를 사용하는 IoT 및 edge 환경에 적합합니다Intel 하드웨어를 위한 정기 업데이트를 제공합니다민감한 애플리케이션을 위한 강력한 기능을 제공합니다Intel 하드웨어에 맞게 조정되어 있습니다
TensorRTNVIDIA GPU에서 최고 수준의 성능을 제공합니다NVIDIA 하드웨어에 가장 적합합니다NVIDIA를 통한 강력한 네트워크를 제공합니다실시간 video 및 image 추론에 적합합니다새로운 GPU를 위한 업데이트가 빈번합니다보안을 중시합니다NVIDIA GPU용으로 설계되었습니다
CoreMLon-device Apple 하드웨어에 최적화되어 있습니다Apple 생태계 전용입니다Apple 및 개발자 지원이 강력합니다Apple 제품에서 on-device ML을 지원합니다Apple의 정기 업데이트를 제공합니다privacy와 보안에 중점을 둡니다Apple Neural Engine 및 GPU를 사용합니다
TF SavedModelserver 환경에서 확장 가능합니다TensorFlow 생태계에서 폭넓은 호환성을 제공합니다TensorFlow의 높은 인기로 인해 광범위한 지원을 받습니다대규모로 모델을 serving할 수 있습니다Google과 커뮤니티가 정기적으로 업데이트합니다enterprise를 위한 강력한 기능을 제공합니다다양한 하드웨어 가속을 지원합니다
TF GraphDef정적 computation graph에 안정적입니다TensorFlow infrastructure와 원활하게 통합됩니다정적 graph 최적화를 위한 리소스를 제공합니다정적 graph가 필요한 시나리오에 적합합니다TensorFlow core와 함께 업데이트됩니다확립된 TensorFlow 보안 관행을 따릅니다TensorFlow 가속 옵션
TF Edge TPUGoogle의 Edge TPU 하드웨어에 최적화Edge TPU 디바이스 전용Google 및 서드파티 리소스와 함께 성장실시간 처리가 필요한 IoT 디바이스새로운 Edge TPU 하드웨어를 위한 개선 사항Google의 강력한 IoT 보안Google Coral에 맞게 커스텀 설계
LiteRT모바일/임베디드/웹 환경에서의 속도와 효율성모바일, 임베디드, 엣지 및 브라우저 지원강력한 커뮤니티와 Google의 지원Android, iOS 및 웹 전반의 온디바이스 앱최신 온디바이스 런타임 기능안전한 온디바이스 및 브라우저 내 추론GPU, DSP 및 WebGPU 가속
PaddlePaddle경쟁력 있고 사용하기 쉬우며 확장 가능Baidu 생태계와 폭넓은 애플리케이션 지원특히 중국에서 빠르게 성장중국 시장 및 언어 처리중국 AI 애플리케이션에 중점데이터 개인정보 보호 및 보안 강조Baidu의 Kunlun 칩 포함
MNN모바일 디바이스에서 높은 성능모바일 및 임베디드 ARM 시스템과 X86-64 CPU모바일/임베디드 ML 커뮤니티모바일 시스템 효율성모바일 디바이스에서 높은 성능 유지온디바이스 보안의 이점ARM CPU 및 GPU 최적화
NCNN모바일 ARM 기반 디바이스에 최적화모바일 및 임베디드 ARM 시스템규모는 작지만 활발한 모바일/임베디드 ML 커뮤니티Android 및 ARM 시스템 효율성ARM에서 높은 성능 유지온디바이스 보안의 이점ARM CPU 및 GPU 최적화
Sony IMX500매우 낮은 전력으로 센서 내 추론Sony IMX500 센서, Raspberry Pi AI CameraSony AITRIOS 생태계카메라 내 엣지 AISony SDK 및 MCT 툴체인 업데이트데이터가 센서에 유지됨Sony IMX500 온칩 가속기
Rockchip RKNNRockchip NPU에 최적화Rockchip SoC 보드(예: RK3588)Rockchip 개발자 커뮤니티임베디드 SBC 및 엣지 디바이스Rockchip RKNN-Toolkit 업데이트온디바이스 로컬 추론Rockchip NPU
ExecuTorch효율적인 온디바이스 PyTorch 런타임XNNPACK을 통한 iOS, Android 및 임베디드 지원PyTorch 프로젝트의 지원모바일 및 임베디드 앱PyTorch와 함께 유지 관리온디바이스 추론으로 데이터를 로컬에 유지XNNPACK 및 모바일 CPU/GPU 백엔드
Axelera AI매우 높은 처리량(최대 856 TOPS)PCIe 또는 M.2를 통한 Metis AIPUAxelera Voyager SDK높은 처리량의 엣지 추론Axelera SDK 업데이트온프레미스 엣지 추론Axelera Metis AIPU
DEEPXINT8에 최적화된 NPU 추론DEEPX NPU 하드웨어DEEPX 개발자 도구(dx_com, dx_engine)임베디드 엣지 추론DEEPX SDK 및 런타임 업데이트온디바이스 로컬 추론DEEPX NPU
Qualcomm QNN빠른 온디바이스 Snapdragon 추론Snapdragon Hexagon NPU, Adreno GPU, CPUQualcomm AI Hub 생태계모바일 및 엣지 Snapdragon 디바이스Qualcomm AI 스택(QAIRT) 업데이트온디바이스 추론으로 데이터를 로컬에 유지Snapdragon Hexagon NPU
HailoHailo NPU에서의 INT8 HEF 추론Hailo-8/8L/10H/15H/15L, Raspberry Pi AI HAT+Hailo Dataflow Compiler 및 HailoRT카메라, 로봇, 산업용 엣지 시스템Hailo DFC 및 HailoRT 릴리스온디바이스 로컬 추론Hailo NPU
Huawei AscendAscend AI Core에서의 더 높은 처리량Atlas 보드 및 OrangePi AIProHuawei CANN 생태계Ascend NPU에서의 엣지 추론CANN 및 ATC 릴리스온디바이스 로컬 추론Ascend AI Core
Core AIApple 실리콘에 최적화됨iOS 27 및 macOS 27; 내보내기에는 macOS 26 이상 필요Apple 프레임워크; 아직 iOS/Flutter SDK에 포함되지 않음차세대 Apple 플랫폼에서의 온디바이스 머신러닝Apple OS 릴리스와 연동됨; 현재 베타 버전온디바이스 추론으로 데이터를 로컬에 유지Apple Neural Engine, GPU, CPU

이 비교는 개괄적인 정보를 제공합니다. 배포 시 각 옵션에 대해 프로젝트의 구체적인 요구 사항과 제약 조건을 비교하고, 선택한 형식에 해당하는 링크된 통합 가이드를 참고하시기 바랍니다.

결론#

YOLO26의 다양한 export 형식을 사용하면 클라우드 GPU 서버부터 센서 내 엣지 카메라까지 거의 모든 환경에 맞게 모델을 조정할 수 있습니다. 형식을 선택한 후에는 최적화, 문제 해결 및 보안을 위해 model deployment best practices를 따르고, 문제가 발생하면 Ultralytics community를 활용하시기 바랍니다.

FAQ#

  • Ultralytics YOLO26은 특정 환경과 하드웨어 플랫폼에 맞게 설계된 다양한 배포 형식을 지원합니다. 주요 형식은 다음과 같습니다:

    • 연구 및 프로토타이핑을 위한 PyTorch로, 뛰어난 Python 통합을 제공합니다.
    • Python을 사용할 수 없는 프로덕션 환경을 위한 TorchScript입니다.
    • 플랫폼 간 호환성 및 하드웨어 가속을 위한 ONNX입니다.
    • Intel 하드웨어에서 최적화된 성능을 위한 OpenVINO입니다.
    • NVIDIA GPU에서 고속 추론을 위한 TensorRT입니다.

    각 형식에는 고유한 장점이 있습니다. 자세한 단계별 안내는 export process documentation을 참조하시기 바랍니다.

  • Intel CPU에서 추론 속도를 향상하려면 Intel의 OpenVINO 툴킷을 사용하여 YOLO26 모델을 배포할 수 있습니다. OpenVINO는 Intel 하드웨어를 효율적으로 활용하도록 모델을 최적화하여 성능을 크게 향상합니다.

    1. model.export() 함수를 사용하여 YOLO26 모델을 OpenVINO 형식으로 변환합니다.
    2. Intel OpenVINO Export documentation의 자세한 설정 가이드를 따르시기 바랍니다.

    더 자세한 내용은 blog post를 확인하시기 바랍니다.

  • 예, YOLO26 모델은 Android에서 LiteRT(이전 TensorFlow Lite) 및 NCNN을 사용하고, iOS에서 CoreML 또는 LiteRT를 사용하여 모바일 디바이스에 배포할 수 있습니다. LiteRT는 모바일 및 임베디드 디바이스를 위한 Google의 온디바이스 런타임으로, Android, iOS 및 브라우저에서 동일한 모델을 실행하여 효율적인 온디바이스 추론을 제공합니다.

    예시
    # Export command for NCNN format
    model.export(format="ncnn")

    모바일에 모델을 배포하는 방법에 대한 자세한 내용은 LiteRT 통합 가이드를 참조하십시오.

  • YOLO26의 배포 형식을 선택할 때 다음 요소를 고려하십시오.

    • 성능: TensorRT와 같은 일부 형식은 NVIDIA GPU에서 탁월한 속도를 제공하며, OpenVINO는 Intel 하드웨어에 최적화되어 있습니다.
    • 호환성: ONNX는 다양한 플랫폼에서 폭넓은 호환성을 제공합니다.
    • 통합 용이성: CoreML 또는 LiteRT와 같은 형식은 각각 iOS 및 Android와 같은 특정 생태계에 맞게 설계되었습니다.
    • 커뮤니티 지원: PyTorch 및 TensorFlow와 같은 형식은 광범위한 커뮤니티 리소스와 지원을 제공합니다.

    비교 분석은 내보내기 형식 문서를 참조하십시오.

  • 웹 애플리케이션에 YOLO26 모델을 배포하려면 LiteRT의 웹 런타임인 LiteRT.js를 사용할 수 있습니다. 이를 통해 머신 러닝 모델을 브라우저와 Node.js에서 직접 실행할 수 있습니다. 이 방식은 백엔드 인프라가 필요하지 않으며 실시간 성능을 제공합니다.

    1. YOLO26 모델을 LiteRT 형식으로 내보냅니다.
    2. LiteRT.js를 사용하여 내보낸 모델을 웹 애플리케이션에 통합합니다.

    단계별 지침은 LiteRT 통합 가이드를 참조하십시오.

댓글