배포#
Ultralytics Platform은 YOLO 모델을 프로덕션 환경에 배포하기 위한 포괄적인 model deployment options을 제공합니다. 브라우저 기반 추론으로 모델을 테스트하고, 전 세계 42개 지역의 전용 엔드포인트에 배포하며, 실시간으로 성능을 모니터링할 수 있습니다.
Watch: Get Started with Ultralytics Platform - Deploy
개요#
배포 섹션은 다음을 지원합니다:
Predict탭에서 브라우저로 직접 모델을 테스트하세요.- 전 세계 42개 리전의 전용 엔드포인트에 배포
- 요청 메트릭, 로그 및 상태 점검 모니터링
- 유휴 상태 시 0으로 스케일링(현재 배포는 단일 활성 인스턴스를 실행합니다)

배포 옵션#
Ultralytics Platform은 다수의 배포 경로를 제공합니다:
| 옵션 | 설명 | 최적 대상 |
|---|---|---|
| Predict Tab | 이미지, 웹캠 및 예제를 사용한 브라우저 기반 추론 | 개발, 검증 |
| 공유 추론(Shared Inference) | 3개 데이터 지역에 걸친 멀티태넌트 서비스 | 가벼운 사용, 테스트 |
| Dedicated Endpoints | 42개 리전에 걸친 단일 테넌트 서비스 | 프로덕션, 저지연 |
| Export | 로컬 또는 엣지 런타임을 위해 20가지 포맷으로 가중치 다운로드 | 오프라인, 온디바이스 |
워크플로우#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 단계 | 설명 |
|---|---|
| Test | Predict tab에서 모델을 검증하세요. |
| 구성 | 지역을 선택하세요. 배포 이름은 모델과 도시에 기반하여 생성됩니다. |
| 배포 (Deploy) | Deploy tab에서 전용 엔드포인트를 생성하세요. |
| 모니터링 | Monitoring에서 요청, 지연 시간, 오류 및 로그를 추적하세요. |
아키텍처#
공유 추론#
공유 추론 서비스는 3개의 주요 지역에서 실행됩니다. 모델에 대한 요청은 해당 모델의 data region에 있는 서비스로 라우팅되므로, 결과는 모델이 저장된 지역 내에 유지됩니다:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| 리전 | 레이블 | 위치 | 최적 대상 |
|---|---|---|---|
| US | 미주 | 미국 아이오와주 | 미주 지역 사용자, 미주 지역에서 가장 빠름 |
| EU | 유럽, 중동 및 아프리카 | 유럽 벨기에 | 유럽 사용자, GDPR 규정 준수 |
| AP | 아시아 태평양 | 아시아 태평양, 대만 | 아시아 태평양 사용자, 가장 낮은 APAC 지연 시간 |
전용 엔드포인트#
Ultralytics Cloud를 통해 전 세계 42개 리전에 배포:
- 아메리카: 14개 리전
- 유럽: 13개 리전
- 아시아 태평양: 12개 리전
- 중동 및 아프리카: 3개 리전
각 엔드포인트는 다음과 같은 기능을 갖춘 단일 테넌트 서비스입니다:
- 플랫폼 관리형 크기 조정(현재 설정 불가)
- 유휴 상태 시 0으로 스케일링
/docs에 자체 대화형 API 참조가 포함된 고유 엔드포인트 URL- 자체 API 키 바인딩으로 해당 키만 엔드포인트 호출 가능
- 독립적인 모니터링, 로그 및 상태 점검
배포 페이지#
사이드바의 Deploy 아래에서 글로벌 배포 페이지에 액세스할 수 있습니다. 이 페이지는 다음을 보여줍니다.
- 배포된 지역 핀이 표시되는 세계 지도; 지역을 클릭하면
New Deployment대화상자가 열립니다. - 개요 카드: 총 요청 수(24시간), 활성 배포, 오류율(24시간), P95 지연 시간(24시간)
- 카드, 간소화, 테이블의 세 가지 보기 모드를 지원하는 배포 목록
- 완료된 모든 모델에서 엔드포인트를 생성할 수 있는 새 배포 버튼
- 페이지 헤더의 Refresh 버튼 및
Updated타임스탬프

페이지가 자동으로 새로고침되며, 배포가 전환 상태(creating, deploying 또는 stopping)에 있는 동안 더 빠르게 폴링합니다. 자세한 내용은 Monitoring을 참조하세요.
주요 특징#
글로벌 커버리지#
42개 리전을 통해 사용자와 가까운 곳에 배포:
- 북미, 남미
- 유럽, 중동, 아프리카
- 아시아 태평양, 오세아니아
스케일링 동작#
엔드포인트는 현재 다음과 같이 동작합니다:
- 0으로 스케일링: 유휴 상태의 엔드포인트는 0으로 축소되며 다음 요청 시 콜드 스타트됩니다.
- 단일 활성 인스턴스: 각 엔드포인트는 현재 모든 플랜에서 하나의 인스턴스에서 서비스됩니다.
- 부하 분산(Load shedding): 엔드포인트 용량이 일시적으로 가득 찼을 때 요청은
429응답을 받습니다. Direct Endpoint Requests 참조 - 요청 시간 초과: 각 요청은 최대 1시간 동안 실행될 수 있으며, 이는 비디오 추론에 충분한 시간입니다.
지역별 배포#
측정된 지역 지연 시간을 사용하여 호출자 근처에 엔드포인트를 배치합니다. 실제 추론 지연 시간은 모델, 입력 크기, 엔드포인트 상태 및 네트워크 경로에 따라 다릅니다.
상태 점검#
실행 중인 각 배포에는 다음을 포함하는 자동 상태 점검이 포함됩니다:
- 실시간 상태 표시기(정상/비정상)
- 응답 지연 시간 표시
- 비정상 상태일 때 자동 재시도하며, 정상 상태가 되면 중지
- 수동 새로 고침 버튼
빠른 시작#
배포 생성:
- 프로젝트에 모델을 학습하거나 업로드하십시오
- 모델의 Deploy 탭으로 이동하십시오
- 지연 시간 테이블에서 리전을 선택하십시오
- Deploy를 클릭하고 배포 상태가 Ready가 될 때까지 기다립니다.
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready배포 이름은 모델 이름과 지역 도시를 기반으로 생성되므로 별도의 명명 단계가 필요하지 않습니다. 배포 후 API 키가 포함된 엔드포인트 URL을 사용하여 모든 애플리케이션에서 추론 요청을 보낼 수 있습니다.
빠른 링크#
- Inference: 브라우저에서 모델 테스트
- Endpoints: 전용 엔드포인트 배포
- Monitoring: 배포 성능 추적
FAQ#
기능 공유 전용 서비스 Platform 사용자 간 공유 단일 배포 전용 스케일 Platform에서 관리 0으로 스케일링, 1개 인스턴스 리전 3개의 데이터 지역 42개의 배포 지역 중에서 선택 URL Platform 모델 API 생성된 배포 엔드포인트 URL 테스팅 모델 Predict탭배포 카드 Predict탭 또는 API요청 제한 (Rate limits) 분당 20개 요청 직접 호출에 대한 플랫폼 요청 제한 없음 인증 (Auth) 모든 워크스페이스 API 키 배포에 바인딩된 API 키만 해당 배포는 서비스가 시작되는 동안 생성 중 또는 배포 중 상태를 유지합니다. 상태가 Ready로 바뀌면 사용할 수 있게 되며, 소요 시간은 모델과 지역에 따라 다르고 일반적으로 몇 분이 걸립니다.
네, 각 모델은 서로 다른 지역에 여러 엔드포인트를 가질 수 있습니다. 배포 개수는 플랜에 따라 제한됩니다: 무료
3, 프로10, 엔터프라이즈unlimited. 할당량은 모델을 소유한 워크스페이스에 부과되며, 엔드포인트는 한 번에 정확히 하나의 모델만 서비스합니다. URL을 변경하지 않고 교체하려면 model replacement를 사용하세요.스케일 투 제로(scale-to-zero)가 활성화된 경우:
- 비활성 상태 후 엔드포인트가 축소됩니다
- 첫 번째 요청이 콜드 스타트를 트리거합니다
- 이후 요청은 빠르게 처리됩니다
유휴 기간 이후의 첫 번째 요청은 콜드 스타트를 유발합니다. 배포 카드를 열면 엔드포인트를 예열하는 헬스 체크가 실행되므로, 그 직후의 테스트 예측은 빠르게 응답합니다.