YOLO Vision 2026:

Triển khai#

Ultralytics Platform cung cấp các tùy chọn triển khai model toàn diện để đưa các model YOLO của bạn vào môi trường production. Kiểm thử model với tính năng suy luận trên trình duyệt, triển khai đến các endpoint chuyên dụng tại 42 khu vực toàn cầu và giám sát hiệu suất theo thời gian thực.



Watch: Get Started with Ultralytics Platform - Deploy

Tổng quan#

Phần Triển khai giúp bạn:

  • Kiểm tra model trực tiếp trên trình duyệt bằng tab Predict
  • Triển khai tới các endpoint chuyên dụng tại 42 khu vực toàn cầu
  • Theo dõi các chỉ số yêu cầu, nhật ký (logs) và các kiểm tra tình trạng (health checks)
  • Scale to zero khi nhàn rỗi (các deployment hiện tại chạy một instance hoạt động duy nhất)

Ultralytics Platform Deploy Page World Map With Overview Cards

Các tùy chọn triển khai#

Ultralytics Platform cung cấp nhiều đường lối triển khai:

Tùy chọnMô tảPhù hợp nhất cho
Tab PredictInference trên trình duyệt với hình ảnh, webcam và các ví dụPhát triển, xác thực
Shared InferenceDịch vụ đa người dùng trên 3 khu vựcSử dụng nhẹ, kiểm thử
Dedicated EndpointsCác dịch vụ single-tenant trên 42 khu vựcProduction, độ trễ thấp

Quy trình làm việc#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
Giai đoạnMô tả
TestXác thực model với tab Predict
Cấu hìnhChọn một khu vực và xem lại tên triển khai có thể chỉnh sửa, được tạo tự động
Triển khaiTạo một endpoint chuyên dụng từ tab Deploy
Theo dõiTheo dõi các yêu cầu, độ trễ, lỗi và nhật ký trong phần Monitoring

Kiến trúc#

Shared Inference#

Dịch vụ shared inference chạy tại 3 khu vực chính, tự động định tuyến các yêu cầu dựa trên khu vực dữ liệu của bạn:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Region Router}:::decide
    Router -->|US users| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU users| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP users| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
Khu vựcNhãnVị tríPhù hợp nhất cho
USChâu MỹIowa, MỹNgười dùng tại châu Mỹ, nhanh nhất cho khu vực châu Mỹ
EUChâu Âu, Trung Đông & Châu PhiBỉ, Châu ÂuNgười dùng tại châu Âu, tuân thủ GDPR
APChâu Á - Thái Bình DươngĐài Loan, Châu Á - Thái Bình DươngNgười dùng tại Châu Á - Thái Bình Dương, độ trễ APAC thấp nhất

Dedicated Endpoints#

Triển khai tới 42 khu vực trên toàn thế giới thông qua Ultralytics Cloud:

  • Châu Mỹ: 14 khu vực
  • Châu Âu: 13 khu vực
  • Châu Á-Thái Bình Dương: 12 khu vực
  • Trung Đông & Châu Phi: 3 khu vực

Mỗi endpoint là một dịch vụ đơn người dùng với:

  • Tài nguyên mặc định gồm 1 CPU, 2 GiB bộ nhớ, minInstances=0, maxInstances=1
  • Scale-to-zero khi nhàn rỗi
  • URL endpoint duy nhất
  • Theo dõi, nhật ký và kiểm tra tình trạng độc lập

Trang Deployments#

Truy cập trang triển khai toàn cầu từ thanh bên dưới mục Deploy. Trang này hiển thị:

  • Bản đồ thế giới với các ghim khu vực đã triển khai (bản đồ tương tác)
  • Thẻ tổng quan: Tổng yêu cầu (24h), Deployment đang hoạt động, Tỷ lệ lỗi (24h), Độ trễ P95 (24h)
  • Danh sách deployment với ba chế độ xem: thẻ, thu gọn và bảng
  • Nút New Deployment để tạo các endpoint từ bất kỳ model nào đã hoàn tất

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Tự động truy vấn (Polling)

Trang này truy vấn mỗi 15 giây trong điều kiện bình thường. Khi các deployment ở trạng thái chuyển tiếp (creating, deploying hoặc stopping), tần suất truy vấn tăng lên mỗi 3 giây để có phản hồi nhanh hơn.

Tính năng chính#

Phạm vi toàn cầu#

Triển khai gần với người dùng của bạn với 42 khu vực bao phủ:

  • Bắc Mỹ, Nam Mỹ
  • Châu Âu, Trung Đông, Châu Phi
  • Châu Á Thái Bình Dương, Châu Đại Dương

Hành vi mở rộng (Scaling)#

Các endpoint hiện tại hoạt động như sau:

  • Mở rộng quy mô về 0: minInstances mặc định là 0
  • Một instance hoạt động duy nhất: maxInstances hiện bị giới hạn ở 1 trên tất cả các gói

Triển khai theo khu vực#

Sử dụng độ trễ khu vực đã đo được để đặt endpoint gần với các bên gọi. Độ trễ suy luận thực tế phụ thuộc vào model, kích thước đầu vào, trạng thái endpoint và đường truyền mạng.

Kiểm tra tình trạng (Health Checks)#

Mỗi deployment đang chạy bao gồm kiểm tra tình trạng tự động với:

  • Chỉ báo trạng thái trực tiếp (khỏe mạnh/không khỏe mạnh)
  • Hiển thị độ trễ phản hồi
  • Tự động thử lại khi không khỏe mạnh (truy vấn mỗi 20 giây)
  • Nút làm mới thủ công

Bắt đầu nhanh#

Tạo một triển khai:

  1. Huấn luyện hoặc tải lên một model vào dự án
  2. Đi đến tab Deploy của model
  3. Chọn một khu vực từ bảng độ trễ
  4. Nhấp vào Deploy và đợi trạng thái triển khai chuyển thành Ready
Triển khai nhanh
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Sau khi triển khai, hãy sử dụng URL endpoint cùng với API key của bạn để gửi các yêu cầu inference từ bất kỳ ứng dụng nào.

Liên kết nhanh#

  • Inference: Kiểm tra các model trên trình duyệt
  • Endpoints: Triển khai các endpoint chuyên dụng
  • Monitoring: Theo dõi hiệu năng triển khai

Câu hỏi thường gặp#

Sự khác biệt giữa shared và dedicated inference là gì?#

Tính năngSharedDedicated
ServiceChia sẻ giữa các người dùng PlatformDành riêng cho một triển khai
Quy môĐược quản lý bởi PlatformMở rộng quy mô về 0, một instance
Khu vực3 khu vực dữ liệuChọn từ 42 khu vực triển khai
URLPlatform model APIURL endpoint triển khai được tạo
TestingTab Predict của modelTab Predict của thẻ triển khai hoặc API

Việc triển khai mất bao lâu?#

Triển khai vẫn ở trạng thái đang tạo hoặc đang triển khai trong khi service của nó khởi động. Nó sẽ sẵn sàng sử dụng khi trạng thái chuyển thành Ready; thời gian thay đổi tùy theo model và khu vực.

Tôi có thể triển khai nhiều model không?#

Có, mỗi model có thể có nhiều endpoint tại các vùng khác nhau. Số lượng triển khai được giới hạn theo gói: Free 3, Pro 10, Enterprise unlimited.

Điều gì xảy ra khi một endpoint ở trạng thái nhàn rỗi (idle)?#

Khi bật tính năng scale-to-zero:

  • Endpoint tự động giảm quy mô sau khi không hoạt động
  • Yêu cầu đầu tiên sẽ kích hoạt khởi động lạnh (cold start)
  • Các yêu cầu tiếp theo sẽ diễn ra nhanh chóng

Các yêu cầu đầu tiên sau một khoảng thời gian nhàn rỗi sẽ kích hoạt khởi động lạnh.

Bình luận