배포#
Ultralytics Platform은 YOLO 모델을 프로덕션 환경에 배포하기 위한 포괄적인 model deployment options을 제공합니다. 브라우저 기반 추론으로 모델을 테스트하고, 전 세계 42개 지역의 전용 엔드포인트에 배포하며, 실시간으로 성능을 모니터링할 수 있습니다.
Watch: Get Started with Ultralytics Platform - Deploy
개요#
배포 섹션은 다음을 지원합니다:
Predict탭에서 브라우저로 직접 모델을 테스트하세요.- 전 세계 42개 리전의 전용 엔드포인트에 배포
- 요청 메트릭, 로그 및 상태 점검 모니터링
- 유휴 상태 시 0으로 스케일링(현재 배포는 단일 활성 인스턴스를 실행합니다)

배포 옵션#
Ultralytics Platform은 다수의 배포 경로를 제공합니다:
| 옵션 | 설명 | 최적 대상 |
|---|---|---|
| Predict Tab | 이미지, 웹캠 및 예제를 사용한 브라우저 기반 추론 | 개발, 검증 |
| 공유 추론(Shared Inference) | 3개 리전에 걸친 멀티 테넌트 서비스 | 가벼운 사용, 테스트 |
| Dedicated Endpoints | 42개 리전에 걸친 단일 테넌트 서비스 | 프로덕션, 저지연 |
워크플로우#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 단계 | 설명 |
|---|---|
| Test | Predict tab에서 모델을 검증하세요. |
| 구성 | 지역을 선택하고 편집 가능한 자동 생성 배포 이름을 확인합니다. |
| 배포 (Deploy) | Deploy tab에서 전용 엔드포인트를 생성하세요. |
| 모니터링 | Monitoring에서 요청, 지연 시간, 오류 및 로그를 추적하세요. |
아키텍처#
공유 추론#
공유 추론 서비스는 3개의 주요 리전에서 실행되며 데이터 리전에 따라 자동으로 요청을 라우팅합니다:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| 리전 | 레이블 | 위치 | 최적 대상 |
|---|---|---|---|
| US | 미주 | 미국 아이오와주 | 미주 지역 사용자, 미주 지역에서 가장 빠름 |
| EU | 유럽, 중동 및 아프리카 | 유럽 벨기에 | 유럽 사용자, GDPR 규정 준수 |
| AP | 아시아 태평양 | 아시아 태평양, 대만 | 아시아 태평양 사용자, 가장 낮은 APAC 지연 시간 |
전용 엔드포인트#
Ultralytics Cloud를 통해 전 세계 42개 리전에 배포:
- 아메리카: 14개 리전
- 유럽: 13개 리전
- 아시아 태평양: 12개 리전
- 중동 및 아프리카: 3개 리전
각 엔드포인트는 다음과 같은 기능을 갖춘 단일 테넌트 서비스입니다:
1 CPU,2 GiB메모리,minInstances=0,maxInstances=1의 기본 리소스- 유휴 상태 시 0으로 스케일링
- 고유 엔드포인트 URL
- 독립적인 모니터링, 로그 및 상태 점검
배포 페이지#
사이드바의 Deploy 아래에서 글로벌 배포 페이지에 액세스할 수 있습니다. 이 페이지는 다음을 보여줍니다.
- 배포된 리전 핀이 표시된 세계 지도(대화형 지도)
- 개요 카드: 총 요청 수(24시간), 활성 배포, 오류율(24시간), P95 지연 시간(24시간)
- 카드, 간소화, 테이블의 세 가지 보기 모드를 지원하는 배포 목록
- 완료된 모든 모델에서 엔드포인트를 생성할 수 있는 새 배포 버튼

이 페이지는 평상시에는 15초마다 폴링합니다. 배포가 전환 상태(creating, deploying 또는 stopping)에 있을 때는 더 빠른 피드백을 위해 폴링 주기가 3초마다로 빨라집니다.
주요 특징#
글로벌 커버리지#
42개 리전을 통해 사용자와 가까운 곳에 배포:
- 북미, 남미
- 유럽, 중동, 아프리카
- 아시아 태평양, 오세아니아
스케일링 동작#
엔드포인트는 현재 다음과 같이 동작합니다:
- 0으로 스케일링:
minInstances은 기본적으로0로 설정됩니다. - 단일 활성 인스턴스: 현재 모든 플랜에서
maxInstances은1(으)로 제한됩니다.
지역별 배포#
측정된 지역 지연 시간을 사용하여 호출자 근처에 엔드포인트를 배치합니다. 실제 추론 지연 시간은 모델, 입력 크기, 엔드포인트 상태 및 네트워크 경로에 따라 다릅니다.
상태 점검#
실행 중인 각 배포에는 다음을 포함하는 자동 상태 점검이 포함됩니다:
- 실시간 상태 표시기(정상/비정상)
- 응답 지연 시간 표시
- 비정상 상태 시 자동 재시도(20초마다 폴링)
- 수동 새로 고침 버튼
빠른 시작#
배포 생성:
- 프로젝트에 모델을 학습하거나 업로드하십시오
- 모델의 Deploy 탭으로 이동하십시오
- 지연 시간 테이블에서 리전을 선택하십시오
- Deploy를 클릭하고 배포 상태가 Ready가 될 때까지 기다립니다.
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready배포가 완료되면 API 키와 함께 엔드포인트 URL을 사용하여 모든 애플리케이션에서 추론 요청을 보낼 수 있습니다.
빠른 링크#
- Inference: 브라우저에서 모델 테스트
- Endpoints: 전용 엔드포인트 배포
- Monitoring: 배포 성능 추적
FAQ#
기능 공유 전용 서비스 Platform 사용자 간 공유 단일 배포 전용 스케일 Platform에서 관리 0으로 스케일링, 1개 인스턴스 리전 3개의 데이터 지역 42개의 배포 지역 중에서 선택 URL Platform 모델 API 생성된 배포 엔드포인트 URL 테스팅 모델 Predict탭배포 카드 Predict탭 또는 API서비스가 시작되는 동안 배포는 생성 중 또는 배포 중 상태로 유지됩니다. 상태가 Ready로 변경되면 사용할 수 있게 되며 소요 시간은 모델과 지역에 따라 다릅니다.
네, 각 모델은 서로 다른 지역에 여러 엔드포인트를 가질 수 있습니다. 배포 수는 플랜에 따라 제한됩니다: Free
3, Pro10, Enterpriseunlimited.스케일 투 제로(scale-to-zero)가 활성화된 경우:
- 비활성 상태 후 엔드포인트가 축소됩니다
- 첫 번째 요청이 콜드 스타트를 트리거합니다
- 이후 요청은 빠르게 처리됩니다
유휴 기간 이후의 첫 번째 요청은 콜드 스타트를 트리거합니다.