Ultralytics YOLO27:

Deployment#

Ultralytics Platform cung cấp các tùy chọn triển khai model toàn diện để đưa các model YOLO của bạn vào môi trường production. Kiểm thử model bằng inference trên trình duyệt, triển khai lên các endpoint chuyên dụng tại 42 khu vực trên toàn cầu và theo dõi hiệu suất theo thời gian thực.



Watch: Get Started with Ultralytics Platform - Deploy

Tổng quan#

Phần Triển khai giúp bạn:

  • Kiểm thử model trực tiếp trên trình duyệt bằng tab Predict
  • Triển khai lên các endpoint chuyên dụng tại 42 khu vực trên toàn cầu
  • Giám sát các chỉ số yêu cầu, nhật ký, kiểm tra tình trạng hoạt động và dự đoán tạm thời trên các endpoint có trả phí
  • Chọn tài nguyên: các endpoint mặc định tự động scale về 0; các kích thước tùy chỉnh giữ một instance luôn ấm với chi phí tính theo thời gian hoạt động

Bản đồ thế giới cùng các thẻ tổng quan trên trang Deploy của Ultralytics Platform

Tùy chọn triển khai#

Ultralytics Platform cung cấp nhiều phương thức triển khai:

Tùy chọnMô tảPhù hợp nhất cho
Tab PredictInference trên trình duyệt với image, webcam và các ví dụPhát triển, validation
Shared InferenceService multi-tenant trên 3 khu vực dữ liệuSử dụng nhẹ, kiểm thử
Dedicated EndpointsCác service single-tenant trên 42 khu vựcProduction, độ trễ thấp
ExportTải weights ở 20 định dạng để chạy trên runtime local hoặc edgeOffline, trên thiết bị

Workflow#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
Giai đoạnMô tả
TestValidation model bằng tab Predict
Cấu hìnhChọn một model, khu vực, CPU và bộ nhớ; xem lại bảng giá và tên deployment
DeployTạo một endpoint chuyên dụng từ tab Deploy
Theo dõiKiểm tra các chỉ số của endpoint và dự đoán tạm thời trong phần Monitoring

Kiến trúc#

Shared Inference#

Service shared inference chạy tại 3 khu vực chính. Request đến một model được định tuyến đến service tại khu vực dữ liệu của model đó, vì vậy kết quả vẫn nằm trong khu vực lưu trữ model:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
RegionNhãnVị tríPhù hợp nhất cho
USChâu MỹIowa, Hoa KỳNgười dùng tại châu Mỹ, nhanh nhất cho châu Mỹ
EUChâu Âu, Trung Đông & châu PhiBỉ, châu ÂuNgười dùng tại châu Âu, tuân thủ GDPR
APChâu Á - Thái Bình DươngĐài Loan, châu Á - Thái Bình DươngNgười dùng tại châu Á - Thái Bình Dương, độ trễ thấp nhất tại APAC

Dedicated Endpoints#

Triển khai lên 42 khu vực trên toàn thế giới trên Ultralytics Cloud:

  • Châu Mỹ: 14 khu vực
  • Châu Âu: 13 khu vực
  • Châu Á - Thái Bình Dương: 12 khu vực
  • Trung Đông & Châu Phi: 3 khu vực

Mỗi endpoint là một service single-tenant với:

  • CPU và bộ nhớ có thể cấu hình với mức giá hiển thị trước khi deployment
  • Scale về 0 đối với tài nguyên mặc định; một instance ấm, tính phí theo thời gian hoạt động đối với tài nguyên tùy chỉnh
  • URL endpoint riêng cùng tài liệu tham chiếu API tương tác riêng tại /docs
  • Liên kết API key riêng, để chỉ key đó có thể gọi endpoint
  • Monitoring, log và kiểm tra tình trạng hoạt động độc lập

Trang Deployments#

Truy cập trang deployments toàn cầu từ thanh bên trong Deploy. Trang này hiển thị:

  • Bản đồ thế giới với các ghim khu vực đã triển khai; nhấp vào một khu vực để mở hộp thoại New Deployment
  • Thẻ tổng quan: HTTP Requests (24h), Active Deployments, HTTP Error Rate (24h), HTTP P95 Latency (24h)
  • Danh sách deployments với ba chế độ xem: thẻ, thu gọn và bảng
  • Nút New Deployment để tạo endpoint từ bất kỳ model nào đã hoàn tất
  • Nút Refresh và timestamp Updated trong header của trang

Các thẻ tổng quan và danh sách deployments trên trang Deploy của Ultralytics Platform

Polling tự động

Trang tự động refresh, polling nhanh hơn khi deployment đang ở trạng thái chuyển tiếp (creating, deploying hoặc stopping). Xem Monitoring để biết thêm chi tiết.

Giám sát tạm thời, nhẹ nhàng

Các endpoint trả phí cung cấp biểu đồ và hình ảnh ví dụ chỉ được lưu trong bộ nhớ của instance phục vụ. Việc dừng, khởi động lại, redeploy, thay đổi kích thước hoặc thay thế model có thể làm sạch dữ liệu này. Lưu các ví dụ vào một dataset và chờ quá trình nhập hoàn tất để giữ lại chúng. Xem thêm tại Monitoring.

Tính năng chính#

Phạm vi toàn cầu#

Triển khai gần người dùng của bạn tại 42 khu vực bao phủ:

  • Bắc Mỹ, Nam Mỹ
  • Châu Âu, Trung Đông, Châu Phi
  • Châu Á - Thái Bình Dương, Châu Đại Dương

Cơ chế scaling#

Các endpoint hiện hoạt động như sau:

  • Tài nguyên mặc định: các endpoint không hoạt động sẽ scale xuống 0 và khởi động lạnh ở yêu cầu tiếp theo
  • Tài nguyên tùy chỉnh: một instance duy trì trạng thái ấm và tính phí thời gian hoạt động cho đến khi bị dừng
  • Một instance đang hoạt động: mỗi endpoint hiện phục vụ từ một instance trên tất cả các plan
  • Load shedding: các request nhận phản hồi 429 khi endpoint tạm thời đạt giới hạn capacity — xem Direct Endpoint Requests
  • Thời gian chờ yêu cầu: các yêu cầu endpoint trực tiếp có thời lượng tối đa là 1 giờ; xem phần Inference để biết các đầu vào được hỗ trợ

Triển khai theo khu vực#

Sử dụng độ trễ theo khu vực đã đo để đặt endpoint gần các client gọi đến. Độ trễ inference thực tế phụ thuộc vào model, kích thước input, trạng thái endpoint và đường truyền mạng.

Kiểm tra tình trạng hoạt động#

Mỗi deployment đang chạy đều có kiểm tra tình trạng hoạt động tự động với:

  • Chỉ báo trạng thái trực tiếp (healthy/unhealthy)
  • Hiển thị độ trễ phản hồi
  • Tự động retry khi unhealthy và dừng khi đã healthy
  • Nút refresh thủ công

Bắt đầu nhanh#

Tạo một deployment:

  1. Train hoặc upload một model vào project
  2. Đi đến tab Deploy của model
  3. Nhấp vào Deploy cho một khu vực trong bảng độ trễ
  4. Xem lại CPU, bộ nhớ, bảng giá và tên trong hộp thoại deployment
  5. Nhấp vào Create Deployment và đợi trạng thái deployment chuyển thành Ready
Triển khai nhanh
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

Tên deployment được tạo từ tên model và thành phố khu vực, có thể được chỉnh sửa trước khi deployment. Sau khi deploy, hãy sử dụng URL của endpoint với khóa API của bạn để gửi yêu cầu suy luận từ bất kỳ ứng dụng nào.

Liên kết nhanh#

  • Inference: Kiểm thử model trên trình duyệt
  • Endpoints: Triển khai các endpoint chuyên dụng
  • Monitoring: Theo dõi hiệu năng deployment

FAQ#

  • Tính năngSharedDedicated
    ServiceDùng chung giữa những người dùng PlatformDành riêng cho một deployment
    ScaleDo Platform quản lýMặc định: scale về 0; tùy chỉnh: duy trì trạng thái ấm
    Khu vực3 khu vực dữ liệuChọn từ 42 khu vực triển khai
    URLAPI model của PlatformURL endpoint triển khai được tạo tự động
    Kiểm thửTab model PredictTab Predict trên thẻ deployment hoặc API
    Giới hạn rate20 request/phútKhông có giới hạn rate của Platform đối với các lệnh gọi trực tiếp
    Xác thựcBất kỳ API key nào của workspaceChỉ API key được liên kết với deployment
  • Quá trình triển khai vẫn ở trạng thái đang tạo hoặc đang triển khai trong khi service khởi động. Service có thể sử dụng được khi trạng thái chuyển sang Ready; thời gian thay đổi tùy theo model và khu vực, thường mất vài phút.

  • Có, mỗi model có thể có nhiều endpoint ở các khu vực khác nhau. Số lượng deployment bị giới hạn theo gói: Miễn phí 3, Pro 10, Enterprise unlimited. Hạn mức được tính cho workspace sở hữu model, và mỗi endpoint chỉ phục vụ chính xác một model tại một thời điểm — sử dụng thay thế model để thay đổi model mà không cần thay đổi URL.

  • Các endpoint sử dụng tài nguyên mặc định sẽ scale về 0 khi không hoạt động:

    • Endpoint giảm quy mô sau một khoảng thời gian không hoạt động
    • Request đầu tiên kích hoạt cold start
    • Các request tiếp theo có tốc độ nhanh

    Các request đầu tiên sau một khoảng thời gian không hoạt động sẽ kích hoạt cold start. Việc mở deployment card sẽ chạy kiểm tra tình trạng, giúp làm nóng endpoint, vì vậy một lần dự đoán thử ngay sau đó sẽ phản hồi nhanh.

    Các endpoint sử dụng tài nguyên tùy chỉnh duy trì trạng thái ấm và bị tính phí theo thời gian hoạt động, bao gồm cả thời gian nhàn rỗi. Hãy dừng một endpoint để ngừng tính phí thời gian hoạt động.

Bình luận