배포#
Ultralytics Platform은 YOLO 모델을 프로덕션 환경에 배포하기 위한 포괄적인 모델 배포 옵션을 제공합니다. 브라우저 기반 추론으로 모델을 테스트하고, 전 세계 42개 지역의 전용 엔드포인트에 배포하며, 실시간으로 성능을 모니터링할 수 있습니다.
Watch: Get Started with Ultralytics Platform - Deploy
개요#
배포 섹션은 다음을 지원합니다:
Predict탭을 사용하여 브라우저에서 직접 모델 테스트- 전 세계 42개 리전의 전용 엔드포인트에 배포
- 요청 메트릭, 로그 및 상태 점검 모니터링
- 유휴 상태 시 0으로 스케일링(현재 배포는 단일 활성 인스턴스를 실행합니다)

배포 옵션#
Ultralytics Platform은 다수의 배포 경로를 제공합니다:
| 옵션 | 설명 | 최적 대상 |
|---|---|---|
| Predict 탭 | 이미지, 웹캠 및 예제를 사용한 브라우저 기반 추론 | 개발, 검증 |
| 공유 추론(Shared Inference) | 3개 리전에 걸친 멀티 테넌트 서비스 | 가벼운 사용, 테스트 |
| 전용 엔드포인트 | 42개 리전에 걸친 단일 테넌트 서비스 | 프로덕션, 저지연 |
워크플로우#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 단계 | 설명 |
|---|---|
| Test | Predict 탭에서 모델 검증 |
| 구성 | 지역을 선택하고 편집 가능한 자동 생성 배포 이름을 확인합니다. |
| 배포 (Deploy) | Deploy 탭에서 전용 엔드포인트 생성 |
| 모니터링 | 모니터링에서 요청, 지연 시간, 오류 및 로그 추적 |
아키텍처#
공유 추론#
공유 추론 서비스는 3개의 주요 리전에서 실행되며 데이터 리전에 따라 자동으로 요청을 라우팅합니다:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| 리전 | 레이블 | 위치 | 최적 대상 |
|---|---|---|---|
| US | 미주 | 미국 아이오와주 | 미주 지역 사용자, 미주 지역에서 가장 빠름 |
| EU | 유럽, 중동 및 아프리카 | 유럽 벨기에 | 유럽 사용자, GDPR 규정 준수 |
| AP | 아시아 태평양 | 아시아 태평양, 대만 | 아시아 태평양 사용자, 가장 낮은 APAC 지연 시간 |
전용 엔드포인트#
Ultralytics Cloud를 통해 전 세계 42개 리전에 배포:
- 아메리카: 14개 리전
- 유럽: 13개 리전
- 아시아 태평양: 12개 리전
- 중동 및 아프리카: 3개 리전
각 엔드포인트는 다음과 같은 기능을 갖춘 단일 테넌트 서비스입니다:
1 CPU,2 GiB메모리,minInstances=0,maxInstances=1의 기본 리소스- 유휴 상태 시 0으로 스케일링
- 고유 엔드포인트 URL
- 독립적인 모니터링, 로그 및 상태 점검
배포 페이지#
사이드바의 Deploy 아래에서 글로벌 배포 페이지에 액세스하십시오. 이 페이지는 다음을 보여줍니다:
- 배포된 리전 핀이 표시된 세계 지도(대화형 지도)
- 개요 카드: 총 요청 수(24시간), 활성 배포, 오류율(24시간), P95 지연 시간(24시간)
- 카드, 간소화, 테이블의 세 가지 보기 모드를 지원하는 배포 목록
- 완료된 모든 모델에서 엔드포인트를 생성할 수 있는 새 배포 버튼

이 페이지는 정상 상태에서 15초마다 폴링을 수행합니다. 배포가 전환 상태(creating, deploying 또는 stopping)일 때, 더 빠른 피드백을 위해 폴링 간격이 3초로 단축됩니다.
주요 특징#
글로벌 커버리지#
42개 리전을 통해 사용자와 가까운 곳에 배포:
- 북미, 남미
- 유럽, 중동, 아프리카
- 아시아 태평양, 오세아니아
스케일링 동작#
엔드포인트는 현재 다음과 같이 동작합니다:
- 0으로 스케일링(Scale to zero):
minInstances의 기본값은0입니다. - 단일 활성 인스턴스: 모든 플랜에서
maxInstances는 현재1로 제한됩니다
지역별 배포#
측정된 지역 지연 시간을 사용하여 호출자 근처에 엔드포인트를 배치합니다. 실제 추론 지연 시간은 모델, 입력 크기, 엔드포인트 상태 및 네트워크 경로에 따라 다릅니다.
상태 점검#
실행 중인 각 배포에는 다음을 포함하는 자동 상태 점검이 포함됩니다:
- 실시간 상태 표시기(정상/비정상)
- 응답 지연 시간 표시
- 비정상 상태 시 자동 재시도(20초마다 폴링)
- 수동 새로 고침 버튼
빠른 시작#
배포 생성:
- 프로젝트에 모델을 학습하거나 업로드하십시오
- 모델의 Deploy 탭으로 이동하십시오
- 지연 시간 테이블에서 리전을 선택하십시오
- Deploy를 클릭하고 배포 상태가 Ready가 될 때까지 기다립니다.
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready배포가 완료되면 API 키와 함께 엔드포인트 URL을 사용하여 모든 애플리케이션에서 추론 요청을 보낼 수 있습니다.
빠른 링크#
FAQ#
공유 추론과 전용 추론의 차이점은 무엇입니까?#
| 기능 | 공유 | 전용 |
|---|---|---|
| 서비스 | Platform 사용자 간 공유 | 단일 배포 전용 |
| 스케일 | Platform에서 관리 | 0으로 스케일링, 1개 인스턴스 |
| 리전 | 3개의 데이터 지역 | 42개의 배포 지역 중에서 선택 |
| URL | Platform 모델 API | 생성된 배포 엔드포인트 URL |
| 테스팅 | 모델 Predict 탭 | 배포 카드 Predict 탭 또는 API |
배포에는 얼마나 걸립니까?#
서비스가 시작되는 동안 배포는 생성 중 또는 배포 중 상태로 유지됩니다. 상태가 Ready로 변경되면 사용할 수 있게 되며 소요 시간은 모델과 지역에 따라 다릅니다.
여러 모델을 배포할 수 있습니까?#
네, 각 모델은 서로 다른 지역에 여러 개의 엔드포인트를 가질 수 있습니다. 배포 횟수는 플랜에 따라 제한됩니다: Free 3, Pro 10, Enterprise unlimited.
엔드포인트가 유휴 상태일 때는 어떻게 됩니까?#
스케일 투 제로(scale-to-zero)가 활성화된 경우:
- 비활성 상태 후 엔드포인트가 축소됩니다
- 첫 번째 요청이 콜드 스타트를 트리거합니다
- 이후 요청은 빠르게 처리됩니다
유휴 기간 이후의 첫 번째 요청은 콜드 스타트를 트리거합니다.