Ultralytics YOLO27:
Get Started

Triển khai#

Ultralytics Platform cung cấp các tùy chọn triển khai model toàn diện để đưa model YOLO vào môi trường production. Kiểm thử model bằng inference trên trình duyệt, triển khai lên các endpoint chuyên dụng tại 42 khu vực trên toàn cầu và giám sát hiệu năng theo thời gian thực.



Xem: Bắt đầu với Ultralytics Platform - Triển khai

Tổng quan#

Mục Deployment giúp bạn:

  • Kiểm thử model trực tiếp trên trình duyệt bằng tab Predict
  • Triển khai lên các endpoint chuyên dụng tại 42 khu vực trên toàn cầu
  • Giám sát chỉ số request, log, health check và dự đoán tạm thời trên mỗi endpoint chuyên dụng
  • Chọn tài nguyên: endpoint mặc định tự scale về 0; cấu hình kích thước tùy chỉnh giữ một instance luôn hoạt động và tính phí theo thời gian hoạt động

Bản đồ thế giới và các thẻ tổng quan trong tab Deployments của Ultralytics Platform

Tùy chọn triển khai#

Ultralytics Platform cung cấp nhiều phương thức triển khai:

Tùy chọnMô tảPhù hợp nhất cho
Tab PredictHình ảnh, webcam, ví dụ; camera IP trên endpoint riêngPhát triển, validation
Inference dùng chungDịch vụ đa tenant tại 3 khu vực dữ liệuSử dụng ít, kiểm thử
Endpoint chuyên dụngDịch vụ đơn tenant tại 42 khu vựcProduction, độ trễ thấp
ExportTải xuống weights ở 22 format để chạy trên runtime cục bộ hoặc edgeNgoại tuyến, trên thiết bị

Workflow#

Giai đoạnMô tả
TestValidation model bằng tab Predict
Cấu hìnhChọn model, khu vực, CPU và bộ nhớ; xem giá và tên triển khai
Triển khaiTạo endpoint chuyên dụng từ tab Deploy
Theo dõiKiểm tra chỉ số endpoint và các dự đoán tạm thời trong Monitoring

Kiến trúc#

Inference dùng chung#

Dịch vụ inference dùng chung hoạt động tại 3 khu vực chính. Các request gửi đến một model được chuyển đến dịch vụ tại khu vực dữ liệu của model đó, nhờ vậy kết quả luôn nằm trong khu vực lưu trữ model:

Khu vựcNhãnVị tríPhù hợp nhất cho
USChâu MỹIowa, Hoa KỳNgười dùng ở châu Mỹ, tốc độ nhanh nhất tại châu Mỹ
EUChâu Âu, Trung Đông và Châu PhiBỉ, Châu ÂuNgười dùng ở châu Âu, tuân thủ GDPR
APChâu Á - Thái Bình DươngĐài Loan, Châu Á - Thái Bình DươngNgười dùng ở Châu Á - Thái Bình Dương, độ trễ thấp nhất tại APAC

Endpoint chuyên dụng#

Triển khai tại 42 khu vực trên toàn thế giới bằng Ultralytics Cloud:

  • Châu Mỹ: 14 khu vực
  • Châu Âu: 13 khu vực
  • Châu Á - Thái Bình Dương: 12 khu vực
  • Trung Đông & Châu Phi: 3 khu vực

Mỗi endpoint là một dịch vụ đơn tenant với các đặc điểm sau:

  • Có thể cấu hình CPU và bộ nhớ; giá được hiển thị trước khi triển khai
  • Tài nguyên mặc định tự scale về 0; tài nguyên tùy chỉnh duy trì một instance luôn hoạt động và tính phí theo thời gian hoạt động
  • URL endpoint riêng cùng tài liệu tham chiếu API tương tác tại /docs
  • Liên kết API key riêng, nên chỉ khóa đó mới có thể gọi endpoint
  • Giám sát, log và health check độc lập

Tab Deployments#

Tất cả deployment của bạn được liệt kê trong tab Deployments trên trang hồ sơ (/{username}?tab=deployments), bên cạnh Datasets và Projects. Mục Deployments trên thanh bên liệt kê các deployment của bạn; mỗi mục liên kết đến trang deployment tương ứng, với nút + để tạo deployment và một liên kết đến tab đầy đủ. Tab này hiển thị:

  • Bản đồ thế giới với các dấu vị trí khu vực đã triển khai; nhấp vào một khu vực để mở hộp thoại New Deployment
  • Thẻ tổng quan: Active Deployments, HTTP Requests (24h), HTTP Error Rate (24h), HTTP P95 Latency (24h)
  • Danh sách Deployments có chức năng tìm kiếm, sắp xếp và ba chế độ xem: dạng thẻ, thu gọn và bảng; mỗi deployment liên kết đến trang riêng với các tab Overview, Monitoring, Predict và Logs
  • Nút New Deployment để tạo endpoint từ bất kỳ model nào đã hoàn tất

Các thẻ tổng quan và danh sách Deployments trong tab Deployments của Ultralytics Platform

Tự động làm mới

Tab tự động làm mới và làm mới nhanh hơn khi trạng thái deployment đang thay đổi (creating, deploying hoặc stopping). Xem Monitoring để biết chi tiết.

Giám sát tạm thời, gọn nhẹ

Mỗi endpoint chuyên dụng ở trạng thái sẵn sàng cung cấp biểu đồ và ảnh ví dụ chỉ được lưu trong bộ nhớ của instance serving. Dừng, khởi động lại, triển khai lại, thay đổi kích thước hoặc thay model có thể xóa dữ liệu này. Lưu các ví dụ vào dataset và chờ hoàn tất quá trình tiếp nhận dữ liệu để giữ lại chúng. Xem Monitoring.

Tính năng chính#

Phạm vi toàn cầu#

Triển khai gần người dùng với 42 khu vực bao phủ:

  • Bắc Mỹ, Nam Mỹ
  • Châu Âu, Trung Đông, Châu Phi
  • Châu Á - Thái Bình Dương, Châu Đại Dương

Cách thức scale#

Hiện tại, endpoint hoạt động như sau:

  • Tài nguyên mặc định: endpoint không hoạt động sẽ scale về 0 và khởi động nguội khi nhận request tiếp theo
  • Tài nguyên tùy chỉnh: một instance luôn hoạt động và phát sinh phí theo thời gian hoạt động cho đến khi được dừng
  • Một instance đang hoạt động: hiện tại, mỗi endpoint phục vụ từ một instance trên tất cả các gói
  • Giảm tải: request nhận phản hồi 429 khi endpoint tạm thời hết công suất — xem Request trực tiếp đến Endpoint
  • Timeout request: request trực tiếp đến endpoint có thời lượng tối đa là 1 giờ; xem Inference để biết các input được hỗ trợ

Triển khai theo khu vực#

Dùng độ trễ đo được tại từng khu vực để đặt endpoint gần nơi gửi request. Độ trễ inference thực tế phụ thuộc vào model, kích thước input, trạng thái endpoint và đường truyền mạng.

Health check#

Mỗi deployment đang chạy đều có health check tự động với các thông tin sau:

  • Chỉ báo trạng thái trực tiếp (healthy/unhealthy)
  • Hiển thị độ trễ phản hồi
  • Tự động thử lại khi không healthy và dừng khi trạng thái healthy
  • Nút ping lại thủ công

Bắt đầu nhanh#

Tạo deployment:

  1. Huấn luyện hoặc tải model lên project
  2. Chuyển đến tab Deploy của model
  3. Nhấp Deploy cho một khu vực trong bảng độ trễ
  4. Kiểm tra CPU, bộ nhớ, giá và tên trong hộp thoại triển khai
  5. Nhấp Create Deployment và chờ trạng thái triển khai chuyển thành Ready
Triển khai nhanh
Model → Deploy tab → Deploy in a region → Review configuration → Create Deployment

Tên triển khai được tạo từ tên model và thành phố thuộc khu vực, đồng thời có thể chỉnh sửa trước khi triển khai. Sau khi triển khai, hãy dùng URL endpoint cùng API key để gửi yêu cầu inference từ bất kỳ ứng dụng nào.

  • Inference: Kiểm thử model trên trình duyệt
  • Endpoints: Triển khai endpoint chuyên dụng
  • Giám sát: Theo dõi hiệu suất triển khai

Câu hỏi thường gặp#

  • Tính năngDùng chungChuyên dụng
    Dịch vụDùng chung cho người dùng PlatformDành riêng cho một triển khai
    Khả năng mở rộngDo Platform quản lýMặc định: thu nhỏ về 0; tùy chỉnh: luôn sẵn sàng
    Khu vực3 khu vực dữ liệuChọn trong số 42 khu vực triển khai
    URLAPI model của PlatformURL endpoint triển khai được tạo tự động
    Kiểm thửTab model PredictTab hoặc API trên trang triển khai Predict
    Giới hạn tốc độ20 yêu cầu/phútKhông có giới hạn tốc độ của Platform đối với các lệnh gọi trực tiếp
    Xác thựcBất kỳ API key nào của workspaceChỉ API key được liên kết với triển khai
  • Triển khai ở trạng thái đang tạo hoặc đang triển khai trong khi dịch vụ khởi động. Triển khai có thể sử dụng được khi trạng thái chuyển thành Ready; thời gian thay đổi tùy theo model và khu vực, thường mất vài phút.

  • Có, mỗi model có thể có nhiều endpoint ở các khu vực khác nhau. Số lượng triển khai bị giới hạn theo gói: Free 3, Pro 10, Enterprise unlimited. Hạn mức được tính cho workspace sở hữu model, và mỗi endpoint chỉ phục vụ chính xác một model tại một thời điểm — dùng thay thế model để đổi model mà không thay đổi URL.

  • Endpoint dùng tài nguyên mặc định sẽ thu nhỏ về 0 khi không hoạt động:

    • Endpoint thu nhỏ sau một khoảng thời gian không hoạt động
    • Yêu cầu đầu tiên kích hoạt khởi động nguội
    • Các yêu cầu tiếp theo sẽ nhanh

    Yêu cầu đầu tiên sau một khoảng thời gian không hoạt động sẽ kích hoạt khởi động nguội. Mở trang triển khai sẽ chạy bước kiểm tra tình trạng, giúp làm nóng endpoint, vì vậy dự đoán thử ngay sau đó sẽ phản hồi nhanh.

    Endpoint dùng tài nguyên tùy chỉnh luôn sẵn sàng và bị tính phí theo thời gian hoạt động, bao gồm cả thời gian không hoạt động. Dừng endpoint để ngừng tính phí thời gian hoạt động.

Bình luận