Triển khai#
Ultralytics Platform cung cấp các tùy chọn triển khai model toàn diện để đưa model YOLO vào môi trường production. Kiểm thử model bằng inference trên trình duyệt, triển khai lên các endpoint chuyên dụng tại 42 khu vực trên toàn cầu và giám sát hiệu năng theo thời gian thực.
Xem: Bắt đầu với Ultralytics Platform - Triển khai
Tổng quan#
Mục Deployment giúp bạn:
- Kiểm thử model trực tiếp trên trình duyệt bằng tab
Predict - Triển khai lên các endpoint chuyên dụng tại 42 khu vực trên toàn cầu
- Giám sát chỉ số request, log, health check và dự đoán tạm thời trên mỗi endpoint chuyên dụng
- Chọn tài nguyên: endpoint mặc định tự scale về 0; cấu hình kích thước tùy chỉnh giữ một instance luôn hoạt động và tính phí theo thời gian hoạt động

Tùy chọn triển khai#
Ultralytics Platform cung cấp nhiều phương thức triển khai:
| Tùy chọn | Mô tả | Phù hợp nhất cho |
|---|---|---|
| Tab Predict | Hình ảnh, webcam, ví dụ; camera IP trên endpoint riêng | Phát triển, validation |
| Inference dùng chung | Dịch vụ đa tenant tại 3 khu vực dữ liệu | Sử dụng ít, kiểm thử |
| Endpoint chuyên dụng | Dịch vụ đơn tenant tại 42 khu vực | Production, độ trễ thấp |
| Export | Tải xuống weights ở 22 format để chạy trên runtime cục bộ hoặc edge | Ngoại tuyến, trên thiết bị |
Workflow#
| Giai đoạn | Mô tả |
|---|---|
| Test | Validation model bằng tab Predict |
| Cấu hình | Chọn model, khu vực, CPU và bộ nhớ; xem giá và tên triển khai |
| Triển khai | Tạo endpoint chuyên dụng từ tab Deploy |
| Theo dõi | Kiểm tra chỉ số endpoint và các dự đoán tạm thời trong Monitoring |
Kiến trúc#
Inference dùng chung#
Dịch vụ inference dùng chung hoạt động tại 3 khu vực chính. Các request gửi đến một model được chuyển đến dịch vụ tại khu vực dữ liệu của model đó, nhờ vậy kết quả luôn nằm trong khu vực lưu trữ model:
| Khu vực | Nhãn | Vị trí | Phù hợp nhất cho |
|---|---|---|---|
| US | Châu Mỹ | Iowa, Hoa Kỳ | Người dùng ở châu Mỹ, tốc độ nhanh nhất tại châu Mỹ |
| EU | Châu Âu, Trung Đông và Châu Phi | Bỉ, Châu Âu | Người dùng ở châu Âu, tuân thủ GDPR |
| AP | Châu Á - Thái Bình Dương | Đài Loan, Châu Á - Thái Bình Dương | Người dùng ở Châu Á - Thái Bình Dương, độ trễ thấp nhất tại APAC |
Endpoint chuyên dụng#
Triển khai tại 42 khu vực trên toàn thế giới bằng Ultralytics Cloud:
- Châu Mỹ: 14 khu vực
- Châu Âu: 13 khu vực
- Châu Á - Thái Bình Dương: 12 khu vực
- Trung Đông & Châu Phi: 3 khu vực
Mỗi endpoint là một dịch vụ đơn tenant với các đặc điểm sau:
- Có thể cấu hình CPU và bộ nhớ; giá được hiển thị trước khi triển khai
- Tài nguyên mặc định tự scale về 0; tài nguyên tùy chỉnh duy trì một instance luôn hoạt động và tính phí theo thời gian hoạt động
- URL endpoint riêng cùng tài liệu tham chiếu API tương tác tại
/docs - Liên kết API key riêng, nên chỉ khóa đó mới có thể gọi endpoint
- Giám sát, log và health check độc lập
Tab Deployments#
Tất cả deployment của bạn được liệt kê trong tab Deployments trên trang hồ sơ (/{username}?tab=deployments), bên cạnh Datasets và Projects. Mục Deployments trên thanh bên liệt kê các deployment của bạn; mỗi mục liên kết đến trang deployment tương ứng, với nút + để tạo deployment và một liên kết đến tab đầy đủ. Tab này hiển thị:
- Bản đồ thế giới với các dấu vị trí khu vực đã triển khai; nhấp vào một khu vực để mở hộp thoại
New Deployment - Thẻ tổng quan: Active Deployments, HTTP Requests (24h), HTTP Error Rate (24h), HTTP P95 Latency (24h)
- Danh sách Deployments có chức năng tìm kiếm, sắp xếp và ba chế độ xem: dạng thẻ, thu gọn và bảng; mỗi deployment liên kết đến trang riêng với các tab
Overview,Monitoring,PredictvàLogs - Nút New Deployment để tạo endpoint từ bất kỳ model nào đã hoàn tất

Tab tự động làm mới và làm mới nhanh hơn khi trạng thái deployment đang thay đổi (creating, deploying hoặc stopping). Xem Monitoring để biết chi tiết.
Mỗi endpoint chuyên dụng ở trạng thái sẵn sàng cung cấp biểu đồ và ảnh ví dụ chỉ được lưu trong bộ nhớ của instance serving. Dừng, khởi động lại, triển khai lại, thay đổi kích thước hoặc thay model có thể xóa dữ liệu này. Lưu các ví dụ vào dataset và chờ hoàn tất quá trình tiếp nhận dữ liệu để giữ lại chúng. Xem Monitoring.
Tính năng chính#
Phạm vi toàn cầu#
Triển khai gần người dùng với 42 khu vực bao phủ:
- Bắc Mỹ, Nam Mỹ
- Châu Âu, Trung Đông, Châu Phi
- Châu Á - Thái Bình Dương, Châu Đại Dương
Cách thức scale#
Hiện tại, endpoint hoạt động như sau:
- Tài nguyên mặc định: endpoint không hoạt động sẽ scale về 0 và khởi động nguội khi nhận request tiếp theo
- Tài nguyên tùy chỉnh: một instance luôn hoạt động và phát sinh phí theo thời gian hoạt động cho đến khi được dừng
- Một instance đang hoạt động: hiện tại, mỗi endpoint phục vụ từ một instance trên tất cả các gói
- Giảm tải: request nhận phản hồi
429khi endpoint tạm thời hết công suất — xem Request trực tiếp đến Endpoint - Timeout request: request trực tiếp đến endpoint có thời lượng tối đa là 1 giờ; xem Inference để biết các input được hỗ trợ
Triển khai theo khu vực#
Dùng độ trễ đo được tại từng khu vực để đặt endpoint gần nơi gửi request. Độ trễ inference thực tế phụ thuộc vào model, kích thước input, trạng thái endpoint và đường truyền mạng.
Health check#
Mỗi deployment đang chạy đều có health check tự động với các thông tin sau:
- Chỉ báo trạng thái trực tiếp (healthy/unhealthy)
- Hiển thị độ trễ phản hồi
- Tự động thử lại khi không healthy và dừng khi trạng thái healthy
- Nút ping lại thủ công
Bắt đầu nhanh#
Tạo deployment:
- Huấn luyện hoặc tải model lên project
- Chuyển đến tab Deploy của model
- Nhấp Deploy cho một khu vực trong bảng độ trễ
- Kiểm tra CPU, bộ nhớ, giá và tên trong hộp thoại triển khai
- Nhấp Create Deployment và chờ trạng thái triển khai chuyển thành Ready
Model → Deploy tab → Deploy in a region → Review configuration → Create DeploymentTên triển khai được tạo từ tên model và thành phố thuộc khu vực, đồng thời có thể chỉnh sửa trước khi triển khai. Sau khi triển khai, hãy dùng URL endpoint cùng API key để gửi yêu cầu inference từ bất kỳ ứng dụng nào.
Liên kết nhanh#
- Inference: Kiểm thử model trên trình duyệt
- Endpoints: Triển khai endpoint chuyên dụng
- Giám sát: Theo dõi hiệu suất triển khai
Câu hỏi thường gặp#
Triển khai ở trạng thái đang tạo hoặc đang triển khai trong khi dịch vụ khởi động. Triển khai có thể sử dụng được khi trạng thái chuyển thành Ready; thời gian thay đổi tùy theo model và khu vực, thường mất vài phút.
Có, mỗi model có thể có nhiều endpoint ở các khu vực khác nhau. Số lượng triển khai bị giới hạn theo gói: Free
3, Pro10, Enterpriseunlimited. Hạn mức được tính cho workspace sở hữu model, và mỗi endpoint chỉ phục vụ chính xác một model tại một thời điểm — dùng thay thế model để đổi model mà không thay đổi URL.Endpoint dùng tài nguyên mặc định sẽ thu nhỏ về 0 khi không hoạt động:
- Endpoint thu nhỏ sau một khoảng thời gian không hoạt động
- Yêu cầu đầu tiên kích hoạt khởi động nguội
- Các yêu cầu tiếp theo sẽ nhanh
Yêu cầu đầu tiên sau một khoảng thời gian không hoạt động sẽ kích hoạt khởi động nguội. Mở trang triển khai sẽ chạy bước kiểm tra tình trạng, giúp làm nóng endpoint, vì vậy dự đoán thử ngay sau đó sẽ phản hồi nhanh.
Endpoint dùng tài nguyên tùy chỉnh luôn sẵn sàng và bị tính phí theo thời gian hoạt động, bao gồm cả thời gian không hoạt động. Dừng endpoint để ngừng tính phí thời gian hoạt động.