YOLO Vision 2026:

배포#

Ultralytics Platform은 YOLO 모델을 프로덕션 환경에 배포하기 위한 포괄적인 model deployment options을 제공합니다. 브라우저 기반 추론으로 모델을 테스트하고, 전 세계 42개 지역의 전용 엔드포인트에 배포하며, 실시간으로 성능을 모니터링할 수 있습니다.



Watch: Get Started with Ultralytics Platform - Deploy

개요#

배포 섹션은 다음을 지원합니다:

  • Predict 탭에서 브라우저로 직접 모델을 테스트하세요.
  • 전 세계 42개 리전의 전용 엔드포인트에 배포
  • 요청 메트릭, 로그 및 상태 점검 모니터링
  • 유휴 상태 시 0으로 스케일링(현재 배포는 단일 활성 인스턴스를 실행합니다)

Ultralytics Platform Deploy Page World Map With Overview Cards

배포 옵션#

Ultralytics Platform은 다수의 배포 경로를 제공합니다:

옵션설명최적 대상
Predict Tab이미지, 웹캠 및 예제를 사용한 브라우저 기반 추론개발, 검증
공유 추론(Shared Inference)3개 데이터 지역에 걸친 멀티태넌트 서비스가벼운 사용, 테스트
Dedicated Endpoints42개 리전에 걸친 단일 테넌트 서비스프로덕션, 저지연
Export로컬 또는 엣지 런타임을 위해 20가지 포맷으로 가중치 다운로드오프라인, 온디바이스

워크플로우#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
단계설명
TestPredict tab에서 모델을 검증하세요.
구성지역을 선택하세요. 배포 이름은 모델과 도시에 기반하여 생성됩니다.
배포 (Deploy)Deploy tab에서 전용 엔드포인트를 생성하세요.
모니터링Monitoring에서 요청, 지연 시간, 오류 및 로그를 추적하세요.

아키텍처#

공유 추론#

공유 추론 서비스는 3개의 주요 지역에서 실행됩니다. 모델에 대한 요청은 해당 모델의 data region에 있는 서비스로 라우팅되므로, 결과는 모델이 저장된 지역 내에 유지됩니다:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
리전레이블위치최적 대상
US미주미국 아이오와주미주 지역 사용자, 미주 지역에서 가장 빠름
EU유럽, 중동 및 아프리카유럽 벨기에유럽 사용자, GDPR 규정 준수
AP아시아 태평양아시아 태평양, 대만아시아 태평양 사용자, 가장 낮은 APAC 지연 시간

전용 엔드포인트#

Ultralytics Cloud를 통해 전 세계 42개 리전에 배포:

  • 아메리카: 14개 리전
  • 유럽: 13개 리전
  • 아시아 태평양: 12개 리전
  • 중동 및 아프리카: 3개 리전

각 엔드포인트는 다음과 같은 기능을 갖춘 단일 테넌트 서비스입니다:

  • 플랫폼 관리형 크기 조정(현재 설정 불가)
  • 유휴 상태 시 0으로 스케일링
  • /docs에 자체 대화형 API 참조가 포함된 고유 엔드포인트 URL
  • 자체 API 키 바인딩으로 해당 키만 엔드포인트 호출 가능
  • 독립적인 모니터링, 로그 및 상태 점검

배포 페이지#

사이드바의 Deploy 아래에서 글로벌 배포 페이지에 액세스할 수 있습니다. 이 페이지는 다음을 보여줍니다.

  • 배포된 지역 핀이 표시되는 세계 지도; 지역을 클릭하면 New Deployment 대화상자가 열립니다.
  • 개요 카드: 총 요청 수(24시간), 활성 배포, 오류율(24시간), P95 지연 시간(24시간)
  • 카드, 간소화, 테이블의 세 가지 보기 모드를 지원하는 배포 목록
  • 완료된 모든 모델에서 엔드포인트를 생성할 수 있는 새 배포 버튼
  • 페이지 헤더의 Refresh 버튼 및 Updated 타임스탬프

Ultralytics Platform Deploy Page Overview Cards And Deployments List

자동 폴링

페이지가 자동으로 새로고침되며, 배포가 전환 상태(creating, deploying 또는 stopping)에 있는 동안 더 빠르게 폴링합니다. 자세한 내용은 Monitoring을 참조하세요.

주요 특징#

글로벌 커버리지#

42개 리전을 통해 사용자와 가까운 곳에 배포:

  • 북미, 남미
  • 유럽, 중동, 아프리카
  • 아시아 태평양, 오세아니아

스케일링 동작#

엔드포인트는 현재 다음과 같이 동작합니다:

  • 0으로 스케일링: 유휴 상태의 엔드포인트는 0으로 축소되며 다음 요청 시 콜드 스타트됩니다.
  • 단일 활성 인스턴스: 각 엔드포인트는 현재 모든 플랜에서 하나의 인스턴스에서 서비스됩니다.
  • 부하 분산(Load shedding): 엔드포인트 용량이 일시적으로 가득 찼을 때 요청은 429 응답을 받습니다. Direct Endpoint Requests 참조
  • 요청 시간 초과: 각 요청은 최대 1시간 동안 실행될 수 있으며, 이는 비디오 추론에 충분한 시간입니다.

지역별 배포#

측정된 지역 지연 시간을 사용하여 호출자 근처에 엔드포인트를 배치합니다. 실제 추론 지연 시간은 모델, 입력 크기, 엔드포인트 상태 및 네트워크 경로에 따라 다릅니다.

상태 점검#

실행 중인 각 배포에는 다음을 포함하는 자동 상태 점검이 포함됩니다:

  • 실시간 상태 표시기(정상/비정상)
  • 응답 지연 시간 표시
  • 비정상 상태일 때 자동 재시도하며, 정상 상태가 되면 중지
  • 수동 새로 고침 버튼

빠른 시작#

배포 생성:

  1. 프로젝트에 모델을 학습하거나 업로드하십시오
  2. 모델의 Deploy 탭으로 이동하십시오
  3. 지연 시간 테이블에서 리전을 선택하십시오
  4. Deploy를 클릭하고 배포 상태가 Ready가 될 때까지 기다립니다.
빠른 배포
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

배포 이름은 모델 이름과 지역 도시를 기반으로 생성되므로 별도의 명명 단계가 필요하지 않습니다. 배포 후 API 키가 포함된 엔드포인트 URL을 사용하여 모든 애플리케이션에서 추론 요청을 보낼 수 있습니다.

빠른 링크#

FAQ#

  • 기능공유전용
    서비스Platform 사용자 간 공유단일 배포 전용
    스케일Platform에서 관리0으로 스케일링, 1개 인스턴스
    리전3개의 데이터 지역42개의 배포 지역 중에서 선택
    URLPlatform 모델 API생성된 배포 엔드포인트 URL
    테스팅모델 Predict배포 카드 Predict 탭 또는 API
    요청 제한 (Rate limits)분당 20개 요청직접 호출에 대한 플랫폼 요청 제한 없음
    인증 (Auth)모든 워크스페이스 API 키배포에 바인딩된 API 키만 해당
  • 배포는 서비스가 시작되는 동안 생성 중 또는 배포 중 상태를 유지합니다. 상태가 Ready로 바뀌면 사용할 수 있게 되며, 소요 시간은 모델과 지역에 따라 다르고 일반적으로 몇 분이 걸립니다.

  • 네, 각 모델은 서로 다른 지역에 여러 엔드포인트를 가질 수 있습니다. 배포 개수는 플랜에 따라 제한됩니다: 무료 3, 프로 10, 엔터프라이즈 unlimited. 할당량은 모델을 소유한 워크스페이스에 부과되며, 엔드포인트는 한 번에 정확히 하나의 모델만 서비스합니다. URL을 변경하지 않고 교체하려면 model replacement를 사용하세요.

  • 스케일 투 제로(scale-to-zero)가 활성화된 경우:

    • 비활성 상태 후 엔드포인트가 축소됩니다
    • 첫 번째 요청이 콜드 스타트를 트리거합니다
    • 이후 요청은 빠르게 처리됩니다

    유휴 기간 이후의 첫 번째 요청은 콜드 스타트를 유발합니다. 배포 카드를 열면 엔드포인트를 예열하는 헬스 체크가 실행되므로, 그 직후의 테스트 예측은 빠르게 응답합니다.

댓글