Triển khai#
Ultralytics Platform cung cấp các model deployment options toàn diện để đưa các model YOLO của bạn vào môi trường production. Kiểm thử model bằng suy luận trên trình duyệt, deploy lên các endpoint chuyên dụng trên 42 khu vực toàn cầu và giám sát hiệu suất theo thời gian thực.
Watch: Get Started with Ultralytics Platform - Deploy
Tổng quan#
Phần Triển khai giúp bạn:
- Test model trực tiếp trên trình duyệt với tab
Predict - Triển khai tới các endpoint chuyên dụng tại 42 khu vực toàn cầu
- Theo dõi các chỉ số yêu cầu, nhật ký (logs) và các kiểm tra tình trạng (health checks)
- Scale to zero khi nhàn rỗi (các deployment hiện tại chạy một instance hoạt động duy nhất)

Các tùy chọn triển khai#
Ultralytics Platform cung cấp nhiều đường lối triển khai:
| Tùy chọn | Mô tả | Phù hợp nhất cho |
|---|---|---|
| Predict Tab | Inference trên trình duyệt với hình ảnh, webcam và các ví dụ | Phát triển, xác thực |
| Shared Inference | Dịch vụ đa người thuê trên 3 vùng dữ liệu | Sử dụng nhẹ, kiểm thử |
| Dedicated Endpoints | Các dịch vụ single-tenant trên 42 khu vực | Production, độ trễ thấp |
| Export | Tải xuống weights ở 20 định dạng cho runtime cục bộ hoặc edge | Ngoại tuyến, trên thiết bị |
Quy trình làm việc#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Giai đoạn | Mô tả |
|---|---|
| Test | Xác thực model bằng tab Predict |
| Cấu hình | Chọn một vùng; tên deployment được tạo tự động từ model và thành phố |
| Triển khai | Tạo một endpoint chuyên dụng từ tab Deploy |
| Theo dõi | Theo dõi các request, độ trễ, lỗi và log trong phần Monitoring |
Kiến trúc#
Shared Inference#
Dịch vụ inference chia sẻ chạy trong 3 vùng chính. Các request đến một model được định tuyến tới dịch vụ trong vùng dữ liệu của model đó, do đó kết quả vẫn nằm bên trong vùng lưu trữ model:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Model Data Region}:::decide
Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Khu vực | Nhãn | Vị trí | Phù hợp nhất cho |
|---|---|---|---|
| US | Châu Mỹ | Iowa, Mỹ | Người dùng tại châu Mỹ, nhanh nhất cho khu vực châu Mỹ |
| EU | Châu Âu, Trung Đông & Châu Phi | Bỉ, Châu Âu | Người dùng tại châu Âu, tuân thủ GDPR |
| AP | Châu Á - Thái Bình Dương | Đài Loan, Châu Á - Thái Bình Dương | Người dùng tại Châu Á - Thái Bình Dương, độ trễ APAC thấp nhất |
Dedicated Endpoints#
Triển khai tới 42 khu vực trên toàn thế giới thông qua Ultralytics Cloud:
- Châu Mỹ: 14 khu vực
- Châu Âu: 13 khu vực
- Châu Á-Thái Bình Dương: 12 khu vực
- Trung Đông & Châu Phi: 3 khu vực
Mỗi endpoint là một dịch vụ đơn người dùng với:
- Kích thước do Platform quản lý (hiện chưa thể cấu hình)
- Scale-to-zero khi nhàn rỗi
- URL endpoint duy nhất với tài liệu tham khảo API tương tác tại
/docs - Liên kết khóa API riêng, do đó chỉ khóa đó mới có thể gọi endpoint
- Theo dõi, nhật ký và kiểm tra tình trạng độc lập
Trang Deployments#
Truy cập trang deploy toàn cầu từ thanh bên dưới Deploy. Trang này hiển thị:
- Bản đồ thế giới với các ghim vùng đã deploy; nhấp vào một vùng để mở hộp thoại
New Deployment - Thẻ tổng quan: Tổng yêu cầu (24h), Deployment đang hoạt động, Tỷ lệ lỗi (24h), Độ trễ P95 (24h)
- Danh sách deployment với ba chế độ xem: thẻ, thu gọn và bảng
- Nút New Deployment để tạo các endpoint từ bất kỳ model nào đã hoàn tất
- Nút Refresh và dấu thời gian
Updatedtrong tiêu đề trang

Trang tự động làm mới, thăm dò nhanh hơn khi các deployment đang trong trạng thái chuyển tiếp (creating, deploying, hoặc stopping). Xem phần Monitoring để biết thêm chi tiết.
Tính năng chính#
Phạm vi toàn cầu#
Triển khai gần với người dùng của bạn với 42 khu vực bao phủ:
- Bắc Mỹ, Nam Mỹ
- Châu Âu, Trung Đông, Châu Phi
- Châu Á Thái Bình Dương, Châu Đại Dương
Hành vi mở rộng (Scaling)#
Các endpoint hiện tại hoạt động như sau:
- Scale về không: các endpoint nhàn rỗi sẽ scale xuống bằng không và khởi động lạnh ở request tiếp theo
- Single active instance: mỗi endpoint hiện phục vụ từ một instance trên mọi gói
- Load shedding: các request nhận được phản hồi
429khi endpoint tạm thời đầy tải — xem Direct Endpoint Requests - Request timeout: mỗi request có thể chạy tối đa 1 giờ, đủ thời gian cho video inference
Triển khai theo khu vực#
Sử dụng độ trễ khu vực đã đo được để đặt endpoint gần với các bên gọi. Độ trễ suy luận thực tế phụ thuộc vào model, kích thước đầu vào, trạng thái endpoint và đường truyền mạng.
Kiểm tra tình trạng (Health Checks)#
Mỗi deployment đang chạy bao gồm kiểm tra tình trạng tự động với:
- Chỉ báo trạng thái trực tiếp (khỏe mạnh/không khỏe mạnh)
- Hiển thị độ trễ phản hồi
- Tự động thử lại khi không khỏe mạnh, dừng lại khi đã khỏe mạnh
- Nút làm mới thủ công
Bắt đầu nhanh#
Tạo một triển khai:
- Huấn luyện hoặc tải lên một model vào dự án
- Đi đến tab Deploy của model
- Chọn một khu vực từ bảng độ trễ
- Nhấp vào Deploy và đợi trạng thái triển khai chuyển thành Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readyTên deployment được tạo từ tên model và thành phố vùng, do đó không cần bước đặt tên. Sau khi deploy, hãy sử dụng URL endpoint với khóa API của bạn để gửi request inference từ bất kỳ ứng dụng nào.
Liên kết nhanh#
- Inference: Kiểm thử model trên trình duyệt
- Endpoints: Deploy các endpoint chuyên dụng
- Monitoring: Theo dõi hiệu suất triển khai
Câu hỏi thường gặp#
Deployment giữ nguyên trạng thái tạo hoặc đang deploy trong khi dịch vụ khởi động. Nó sẵn sàng sử dụng khi trạng thái chuyển thành Ready; thời gian thay đổi tùy theo model và vùng, thường mất vài phút.
Có, mỗi model có thể có nhiều endpoint ở các vùng khác nhau. Số lượng deployment bị giới hạn theo gói: Free
3, Pro10, Enterpriseunlimited. Hạn mức được tính phí vào workspace sở hữu model và một endpoint chỉ phục vụ đúng một model tại một thời điểm — hãy sử dụng model replacement để hoán đổi mà không làm thay đổi URL.Khi bật tính năng scale-to-zero:
- Endpoint tự động giảm quy mô sau khi không hoạt động
- Yêu cầu đầu tiên sẽ kích hoạt khởi động lạnh (cold start)
- Các yêu cầu tiếp theo sẽ diễn ra nhanh chóng
Các request đầu tiên sau thời gian nhàn rỗi sẽ kích hoạt khởi động lạnh. Việc mở thẻ deployment sẽ chạy kiểm tra sức khỏe làm ấm endpoint, giúp dự đoán thử nghiệm ngay sau đó phản hồi nhanh chóng.