Ultralytics YOLO27:

배포#

Ultralytics Platform은 YOLO 모델을 프로덕션 환경에 배포할 수 있도록 포괄적인 모델 배포 옵션을 제공합니다. 브라우저 기반 추론으로 모델을 테스트하고, 전 세계 42개 리전에 전용 엔드포인트를 배포하며, 성능을 실시간으로 모니터링할 수 있습니다.



Watch: Get Started with Ultralytics Platform - Deploy

개요#

Deployment 섹션에서는 다음 작업을 수행할 수 있습니다:

  • Predict 탭을 사용하여 브라우저에서 직접 모델을 테스트합니다.
  • 전 세계 42개 리전의 전용 엔드포인트에 배포합니다.
  • 모니터 유료 엔드포인트의 요청 메트릭, 로그, 상태 확인 및 임시 예측
  • 리소스 선택: 기본 엔드포인트는 0으로 스케일링되며, 사용자 정의 크기는 가동 시간 청구와 함께 웜 인스턴스를 유지합니다.

개요 카드가 표시된 Ultralytics Platform 배포 페이지 세계 지도

배포 옵션#

Ultralytics Platform은 여러 배포 경로를 제공합니다:

옵션설명적합한 용도
Predict 탭이미지, 웹캠 및 예제를 사용하는 브라우저 기반 추론개발, 검증
공유 추론3개 데이터 리전에 걸친 멀티 테넌트 서비스가벼운 사용, 테스트
전용 엔드포인트42개 리전에 걸친 싱글 테넌트 서비스프로덕션, 짧은 지연 시간
Export로컬 또는 엣지 런타임용 가중치를 20개 형식으로 다운로드합니다.오프라인, 온디바이스

Workflow#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
단계설명
TestPredict에서 모델을 검증합니다.
구성모델, 리전, CPU 및 메모리를 선택하고 가격과 배포 이름을 검토합니다.
배포Deploy에서 전용 엔드포인트를 생성합니다.
모니터링모니터링에서 엔드포인트 메트릭과 임시 예측을 확인합니다.

아키텍처#

공유 추론#

공유 추론 서비스는 3개의 주요 리전에서 실행됩니다. 모델에 대한 요청은 해당 모델의 데이터 리전에 있는 서비스로 라우팅되므로 결과는 모델이 저장된 리전 내부에 유지됩니다:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
리전레이블위치적합한 용도
US미주미국 아이오와미주 사용자, 미주 지역에 가장 빠른 속도
EU유럽, 중동 및 아프리카유럽 벨기에유럽 사용자, GDPR 준수
AP아시아 태평양아시아 태평양 대만아시아 태평양 사용자, APAC에서 가장 낮은 지연 시간

전용 엔드포인트#

Ultralytics Cloud에서 전 세계 42개 리전에 배포합니다:

  • 미주: 14개 리전
  • 유럽: 13개 리전
  • 아시아 태평양: 12개 리전
  • 중동 및 아프리카: 3개 리전

각 엔드포인트는 다음과 같은 싱글 테넌트 서비스입니다:

  • 배포 전에 가격이 표시되는 구성 가능한 CPU 및 메모리
  • 기본 리소스의 경우 스케일투제로(Scale-to-Zero), 사용자 정의 리소스의 경우 가동 시간이 청구되는 웜 인스턴스
  • /docs에 자체 대화형 API 레퍼런스가 있는 고유 엔드포인트 URL
  • 해당 키만 엔드포인트를 호출할 수 있도록 별도로 연결된 API 키
  • 독립적인 모니터링, 로그 및 상태 점검

Deployments 페이지#

사이드바의 Deploy에서 전역 배포 페이지에 액세스합니다. 이 페이지에는 다음이 표시됩니다:

  • 배포된 리전 핀이 표시된 세계 지도; 리전을 클릭하면 New Deployment 대화 상자가 열립니다.
  • 개요 카드: HTTP 요청(24시간), 활성 배포, HTTP 오류율(24시간), HTTP P95 지연 시간(24시간)
  • 카드, 컴팩트 및 테이블의 세 가지 보기 모드를 제공하는 배포 목록
  • 완료된 모든 모델에서 엔드포인트를 생성할 수 있는 New Deployment 버튼
  • 페이지 헤더의 Refresh 버튼 및 Updated 타임스탬프

개요 카드와 배포 목록이 표시된 Ultralytics Platform 배포 페이지

자동 폴링

페이지는 자동으로 새로 고쳐지며, 배포가 전환 상태(creating, deploying 또는 stopping)에 있을 때 더 빠르게 폴링합니다. 자세한 내용은 Monitoring을 참조하세요.

경량 임시 모니터링

유료 엔드포인트는 서빙 인스턴스의 메모리에만 유지되는 차트와 예시 이미지를 제공합니다. 모델을 중지, 재시작, 재배포, 크기 조정 또는 교체하면 이 데이터가 지워질 수 있습니다. 예시를 유지하려면 데이터셋에 저장하고 수정이 완료될 때까지 기다리세요. 모니터링을 참조하세요.

주요 기능#

전 세계 지원 범위#

다음 지역을 포함하는 42개 리전에 사용자가 있는 곳과 가까운 위치로 배포합니다:

  • 북아메리카, 남아메리카
  • 유럽, 중동, 아프리카
  • 아시아 태평양, 오세아니아

스케일링 동작#

엔드포인트는 현재 다음과 같이 동작합니다:

  • 기본 리소스: 유휴 엔드포인트는 0으로 스케일 다운되며 다음 요청 시 콜드 스타트됩니다.
  • 사용자 정의 리소스: 하나의 인스턴스가 웜 상태를 유지하며 중지될 때까지 가동 시간 요금이 부과됩니다.
  • 단일 활성 인스턴스: 각 엔드포인트는 현재 모든 플랜에서 하나의 인스턴스로 서비스를 제공합니다.
  • 로드 셰딩: 엔드포인트가 일시적으로 용량에 도달하면 요청에 429 응답이 반환됩니다 — Direct Endpoint Requests를 참조하세요.
  • 요청 시간 초과: 직접 엔드포인트 요청의 최대 지속 시간은 1시간입니다. 지원되는 입력은 추론을 참조하세요.

리전별 배포#

측정된 리전 지연 시간을 사용하여 호출자와 가까운 위치에 엔드포인트를 배치합니다. 실제 추론 지연 시간은 모델, 입력 크기, 엔드포인트 상태 및 네트워크 경로에 따라 달라집니다.

상태 점검#

실행 중인 각 배포에는 다음과 같은 자동 상태 점검이 포함됩니다:

  • 실시간 상태 표시기(정상/비정상)
  • 응답 지연 시간 표시
  • 비정상 상태일 때 자동 재시도, 정상 상태가 되면 중지
  • 수동 새로 고침 버튼

빠른 시작#

배포를 생성하는 방법:

  1. 프로젝트에서 모델을 학습하거나 업로드합니다.
  2. 모델의 Deploy 탭으로 이동합니다.
  3. 지연 시간 테이블의 리전에 대해 배포를 클릭합니다.
  4. 배포 대화상자에서 CPU, 메모리, 가격 및 이름을 검토합니다.
  5. 배포 생성을 클릭하고 배포 상태가 준비됨이 될 때까지 기다립니다.
빠른 배포
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

배포 이름은 모델 이름과 리전 도시를 기반으로 생성되며 배포 전에 편집할 수 있습니다. 배포가 완료되면 API 키가 포함된 엔드포인트 URL을 사용하여 모든 애플리케이션에서 추론 요청을 보낼 수 있습니다.

빠른 링크#

FAQ#

  • 기능공유전용
    서비스Platform 사용자 전체가 공유하나의 배포 전용
    스케일Platform에서 관리기본: 0으로 스케일링; 사용자 정의: 웜 상태 유지
    리전3개 데이터 리전42개 배포 리전 중에서 선택
    URLPlatform 모델 API생성된 배포 엔드포인트 URL
    테스트모델 Predict배포 카드의 Predict 탭 또는 API
    속도 제한분당 20개 요청직접 호출에는 Platform 속도 제한 없음
    인증모든 워크스페이스 API 키배포에 연결된 API 키만
  • 서비스가 시작되는 동안 배포는 생성 중 또는 배포 중 상태로 유지됩니다. 상태가 Ready로 변경되면 사용할 수 있으며, 소요 시간은 모델과 리전에 따라 다르고 일반적으로 몇 분 정도 걸립니다.

  • 예. 각 모델에는 서로 다른 리전에 여러 엔드포인트를 설정할 수 있습니다. 배포 수는 요금제에 따라 제한됩니다. 무료 3, Pro 10, Enterprise unlimited입니다. 할당량은 모델을 소유한 workspace에 청구되며, 하나의 엔드포인트는 한 번에 정확히 하나의 모델만 서비스합니다. URL을 변경하지 않고 교체하려면 모델 교체를 사용하십시오.

  • 기본 리소스 엔드포인트는 유휴 상태일 때 0으로 스케일링됩니다:

    • 비활성 상태가 지속되면 엔드포인트가 축소됩니다
    • 첫 번째 요청이 콜드 스타트를 트리거합니다
    • 이후 요청은 빠르게 처리됩니다

    유휴 기간 후의 첫 번째 요청은 콜드 스타트를 트리거합니다. 배포 카드를 열면 엔드포인트를 예열하는 상태 점검이 실행되므로, 그 직후 테스트 예측을 실행해도 빠르게 응답합니다.

    사용자 정의 리소스 엔드포인트는 웜 상태를 유지하며 유휴 시간을 포함하여 가동 시간에 대한 요금이 청구됩니다. 가동 시간 청구를 중지하려면 엔드포인트를 중지하세요.

댓글