Triển khai#
Ultralytics Platform cung cấp các tùy chọn triển khai model toàn diện để đưa các model YOLO của bạn vào môi trường production. Kiểm thử model với tính năng suy luận trên trình duyệt, triển khai đến các endpoint chuyên dụng tại 42 khu vực toàn cầu và giám sát hiệu suất theo thời gian thực.
Watch: Get Started with Ultralytics Platform - Deploy
Tổng quan#
Phần Triển khai giúp bạn:
- Kiểm tra model trực tiếp trên trình duyệt bằng tab
Predict - Triển khai tới các endpoint chuyên dụng tại 42 khu vực toàn cầu
- Theo dõi các chỉ số yêu cầu, nhật ký (logs) và các kiểm tra tình trạng (health checks)
- Scale to zero khi nhàn rỗi (các deployment hiện tại chạy một instance hoạt động duy nhất)

Các tùy chọn triển khai#
Ultralytics Platform cung cấp nhiều đường lối triển khai:
| Tùy chọn | Mô tả | Phù hợp nhất cho |
|---|---|---|
| Tab Predict | Inference trên trình duyệt với hình ảnh, webcam và các ví dụ | Phát triển, xác thực |
| Shared Inference | Dịch vụ đa người dùng trên 3 khu vực | Sử dụng nhẹ, kiểm thử |
| Dedicated Endpoints | Các dịch vụ single-tenant trên 42 khu vực | Production, độ trễ thấp |
Quy trình làm việc#
graph LR
A[✅ Test]:::start --> B[⚙️ Configure]:::proc
B --> C[🌐 Deploy]:::proc
C --> D[📊 Monitor]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Giai đoạn | Mô tả |
|---|---|
| Test | Xác thực model với tab Predict |
| Cấu hình | Chọn một khu vực và xem lại tên triển khai có thể chỉnh sửa, được tạo tự động |
| Triển khai | Tạo một endpoint chuyên dụng từ tab Deploy |
| Theo dõi | Theo dõi các yêu cầu, độ trễ, lỗi và nhật ký trong phần Monitoring |
Kiến trúc#
Shared Inference#
Dịch vụ shared inference chạy tại 3 khu vực chính, tự động định tuyến các yêu cầu dựa trên khu vực dữ liệu của bạn:
graph TB
User[User Request]:::start --> API[Platform API]:::proc
API --> Router{Region Router}:::decide
Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef decide fill:#FF9800,color:#fff
classDef out fill:#9C27B0,color:#fff| Khu vực | Nhãn | Vị trí | Phù hợp nhất cho |
|---|---|---|---|
| US | Châu Mỹ | Iowa, Mỹ | Người dùng tại châu Mỹ, nhanh nhất cho khu vực châu Mỹ |
| EU | Châu Âu, Trung Đông & Châu Phi | Bỉ, Châu Âu | Người dùng tại châu Âu, tuân thủ GDPR |
| AP | Châu Á - Thái Bình Dương | Đài Loan, Châu Á - Thái Bình Dương | Người dùng tại Châu Á - Thái Bình Dương, độ trễ APAC thấp nhất |
Dedicated Endpoints#
Triển khai tới 42 khu vực trên toàn thế giới thông qua Ultralytics Cloud:
- Châu Mỹ: 14 khu vực
- Châu Âu: 13 khu vực
- Châu Á-Thái Bình Dương: 12 khu vực
- Trung Đông & Châu Phi: 3 khu vực
Mỗi endpoint là một dịch vụ đơn người dùng với:
- Tài nguyên mặc định gồm
1 CPU,2 GiBbộ nhớ,minInstances=0,maxInstances=1 - Scale-to-zero khi nhàn rỗi
- URL endpoint duy nhất
- Theo dõi, nhật ký và kiểm tra tình trạng độc lập
Trang Deployments#
Truy cập trang triển khai toàn cầu từ thanh bên dưới mục Deploy. Trang này hiển thị:
- Bản đồ thế giới với các ghim khu vực đã triển khai (bản đồ tương tác)
- Thẻ tổng quan: Tổng yêu cầu (24h), Deployment đang hoạt động, Tỷ lệ lỗi (24h), Độ trễ P95 (24h)
- Danh sách deployment với ba chế độ xem: thẻ, thu gọn và bảng
- Nút New Deployment để tạo các endpoint từ bất kỳ model nào đã hoàn tất

Trang này truy vấn mỗi 15 giây trong điều kiện bình thường. Khi các deployment ở trạng thái chuyển tiếp (creating, deploying hoặc stopping), tần suất truy vấn tăng lên mỗi 3 giây để có phản hồi nhanh hơn.
Tính năng chính#
Phạm vi toàn cầu#
Triển khai gần với người dùng của bạn với 42 khu vực bao phủ:
- Bắc Mỹ, Nam Mỹ
- Châu Âu, Trung Đông, Châu Phi
- Châu Á Thái Bình Dương, Châu Đại Dương
Hành vi mở rộng (Scaling)#
Các endpoint hiện tại hoạt động như sau:
- Mở rộng quy mô về 0:
minInstancesmặc định là0 - Một instance hoạt động duy nhất:
maxInstanceshiện bị giới hạn ở1trên tất cả các gói
Triển khai theo khu vực#
Sử dụng độ trễ khu vực đã đo được để đặt endpoint gần với các bên gọi. Độ trễ suy luận thực tế phụ thuộc vào model, kích thước đầu vào, trạng thái endpoint và đường truyền mạng.
Kiểm tra tình trạng (Health Checks)#
Mỗi deployment đang chạy bao gồm kiểm tra tình trạng tự động với:
- Chỉ báo trạng thái trực tiếp (khỏe mạnh/không khỏe mạnh)
- Hiển thị độ trễ phản hồi
- Tự động thử lại khi không khỏe mạnh (truy vấn mỗi 20 giây)
- Nút làm mới thủ công
Bắt đầu nhanh#
Tạo một triển khai:
- Huấn luyện hoặc tải lên một model vào dự án
- Đi đến tab Deploy của model
- Chọn một khu vực từ bảng độ trễ
- Nhấp vào Deploy và đợi trạng thái triển khai chuyển thành Ready
Model → Deploy tab → Select region → Click Deploy → Endpoint URL readySau khi triển khai, hãy sử dụng URL endpoint cùng với API key của bạn để gửi các yêu cầu inference từ bất kỳ ứng dụng nào.
Liên kết nhanh#
- Inference: Kiểm tra các model trên trình duyệt
- Endpoints: Triển khai các endpoint chuyên dụng
- Monitoring: Theo dõi hiệu năng triển khai
Câu hỏi thường gặp#
Sự khác biệt giữa shared và dedicated inference là gì?#
| Tính năng | Shared | Dedicated |
|---|---|---|
| Service | Chia sẻ giữa các người dùng Platform | Dành riêng cho một triển khai |
| Quy mô | Được quản lý bởi Platform | Mở rộng quy mô về 0, một instance |
| Khu vực | 3 khu vực dữ liệu | Chọn từ 42 khu vực triển khai |
| URL | Platform model API | URL endpoint triển khai được tạo |
| Testing | Tab Predict của model | Tab Predict của thẻ triển khai hoặc API |
Việc triển khai mất bao lâu?#
Triển khai vẫn ở trạng thái đang tạo hoặc đang triển khai trong khi service của nó khởi động. Nó sẽ sẵn sàng sử dụng khi trạng thái chuyển thành Ready; thời gian thay đổi tùy theo model và khu vực.
Tôi có thể triển khai nhiều model không?#
Có, mỗi model có thể có nhiều endpoint tại các vùng khác nhau. Số lượng triển khai được giới hạn theo gói: Free 3, Pro 10, Enterprise unlimited.
Điều gì xảy ra khi một endpoint ở trạng thái nhàn rỗi (idle)?#
Khi bật tính năng scale-to-zero:
- Endpoint tự động giảm quy mô sau khi không hoạt động
- Yêu cầu đầu tiên sẽ kích hoạt khởi động lạnh (cold start)
- Các yêu cầu tiếp theo sẽ diễn ra nhanh chóng
Các yêu cầu đầu tiên sau một khoảng thời gian nhàn rỗi sẽ kích hoạt khởi động lạnh.