YOLO Vision 2026:

Triển khai#

Ultralytics Platform cung cấp các model deployment options toàn diện để đưa các model YOLO của bạn vào môi trường production. Kiểm thử model bằng suy luận trên trình duyệt, deploy lên các endpoint chuyên dụng trên 42 khu vực toàn cầu và giám sát hiệu suất theo thời gian thực.



Watch: Get Started with Ultralytics Platform - Deploy

Tổng quan#

Phần Triển khai giúp bạn:

  • Test model trực tiếp trên trình duyệt với tab Predict
  • Triển khai tới các endpoint chuyên dụng tại 42 khu vực toàn cầu
  • Theo dõi các chỉ số yêu cầu, nhật ký (logs) và các kiểm tra tình trạng (health checks)
  • Scale to zero khi nhàn rỗi (các deployment hiện tại chạy một instance hoạt động duy nhất)

Ultralytics Platform Deploy Page World Map With Overview Cards

Các tùy chọn triển khai#

Ultralytics Platform cung cấp nhiều đường lối triển khai:

Tùy chọnMô tảPhù hợp nhất cho
Predict TabInference trên trình duyệt với hình ảnh, webcam và các ví dụPhát triển, xác thực
Shared InferenceDịch vụ đa người thuê trên 3 vùng dữ liệuSử dụng nhẹ, kiểm thử
Dedicated EndpointsCác dịch vụ single-tenant trên 42 khu vựcProduction, độ trễ thấp
ExportTải xuống weights ở 20 định dạng cho runtime cục bộ hoặc edgeNgoại tuyến, trên thiết bị

Quy trình làm việc#

graph LR
    A[✅ Test]:::start --> B[⚙️ Configure]:::proc
    B --> C[🌐 Deploy]:::proc
    C --> D[📊 Monitor]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
Giai đoạnMô tả
TestXác thực model bằng tab Predict
Cấu hìnhChọn một vùng; tên deployment được tạo tự động từ model và thành phố
Triển khaiTạo một endpoint chuyên dụng từ tab Deploy
Theo dõiTheo dõi các request, độ trễ, lỗi và log trong phần Monitoring

Kiến trúc#

Shared Inference#

Dịch vụ inference chia sẻ chạy trong 3 vùng chính. Các request đến một model được định tuyến tới dịch vụ trong vùng dữ liệu của model đó, do đó kết quả vẫn nằm bên trong vùng lưu trữ model:

graph TB
    User[User Request]:::start --> API[Platform API]:::proc
    API --> Router{Model Data Region}:::decide
    Router -->|US models| US["US Predict Service<br/>Iowa"]:::out
    Router -->|EU models| EU["EU Predict Service<br/>Belgium"]:::out
    Router -->|AP models| AP["AP Predict Service<br/>Taiwan"]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef decide fill:#FF9800,color:#fff
    classDef out fill:#9C27B0,color:#fff
Khu vựcNhãnVị tríPhù hợp nhất cho
USChâu MỹIowa, MỹNgười dùng tại châu Mỹ, nhanh nhất cho khu vực châu Mỹ
EUChâu Âu, Trung Đông & Châu PhiBỉ, Châu ÂuNgười dùng tại châu Âu, tuân thủ GDPR
APChâu Á - Thái Bình DươngĐài Loan, Châu Á - Thái Bình DươngNgười dùng tại Châu Á - Thái Bình Dương, độ trễ APAC thấp nhất

Dedicated Endpoints#

Triển khai tới 42 khu vực trên toàn thế giới thông qua Ultralytics Cloud:

  • Châu Mỹ: 14 khu vực
  • Châu Âu: 13 khu vực
  • Châu Á-Thái Bình Dương: 12 khu vực
  • Trung Đông & Châu Phi: 3 khu vực

Mỗi endpoint là một dịch vụ đơn người dùng với:

  • Kích thước do Platform quản lý (hiện chưa thể cấu hình)
  • Scale-to-zero khi nhàn rỗi
  • URL endpoint duy nhất với tài liệu tham khảo API tương tác tại /docs
  • Liên kết khóa API riêng, do đó chỉ khóa đó mới có thể gọi endpoint
  • Theo dõi, nhật ký và kiểm tra tình trạng độc lập

Trang Deployments#

Truy cập trang deploy toàn cầu từ thanh bên dưới Deploy. Trang này hiển thị:

  • Bản đồ thế giới với các ghim vùng đã deploy; nhấp vào một vùng để mở hộp thoại New Deployment
  • Thẻ tổng quan: Tổng yêu cầu (24h), Deployment đang hoạt động, Tỷ lệ lỗi (24h), Độ trễ P95 (24h)
  • Danh sách deployment với ba chế độ xem: thẻ, thu gọn và bảng
  • Nút New Deployment để tạo các endpoint từ bất kỳ model nào đã hoàn tất
  • Nút Refresh và dấu thời gian Updated trong tiêu đề trang

Ultralytics Platform Deploy Page Overview Cards And Deployments List

Tự động truy vấn (Polling)

Trang tự động làm mới, thăm dò nhanh hơn khi các deployment đang trong trạng thái chuyển tiếp (creating, deploying, hoặc stopping). Xem phần Monitoring để biết thêm chi tiết.

Tính năng chính#

Phạm vi toàn cầu#

Triển khai gần với người dùng của bạn với 42 khu vực bao phủ:

  • Bắc Mỹ, Nam Mỹ
  • Châu Âu, Trung Đông, Châu Phi
  • Châu Á Thái Bình Dương, Châu Đại Dương

Hành vi mở rộng (Scaling)#

Các endpoint hiện tại hoạt động như sau:

  • Scale về không: các endpoint nhàn rỗi sẽ scale xuống bằng không và khởi động lạnh ở request tiếp theo
  • Single active instance: mỗi endpoint hiện phục vụ từ một instance trên mọi gói
  • Load shedding: các request nhận được phản hồi 429 khi endpoint tạm thời đầy tải — xem Direct Endpoint Requests
  • Request timeout: mỗi request có thể chạy tối đa 1 giờ, đủ thời gian cho video inference

Triển khai theo khu vực#

Sử dụng độ trễ khu vực đã đo được để đặt endpoint gần với các bên gọi. Độ trễ suy luận thực tế phụ thuộc vào model, kích thước đầu vào, trạng thái endpoint và đường truyền mạng.

Kiểm tra tình trạng (Health Checks)#

Mỗi deployment đang chạy bao gồm kiểm tra tình trạng tự động với:

  • Chỉ báo trạng thái trực tiếp (khỏe mạnh/không khỏe mạnh)
  • Hiển thị độ trễ phản hồi
  • Tự động thử lại khi không khỏe mạnh, dừng lại khi đã khỏe mạnh
  • Nút làm mới thủ công

Bắt đầu nhanh#

Tạo một triển khai:

  1. Huấn luyện hoặc tải lên một model vào dự án
  2. Đi đến tab Deploy của model
  3. Chọn một khu vực từ bảng độ trễ
  4. Nhấp vào Deploy và đợi trạng thái triển khai chuyển thành Ready
Triển khai nhanh
Model → Deploy tab → Select region → Click Deploy → Endpoint URL ready

Tên deployment được tạo từ tên model và thành phố vùng, do đó không cần bước đặt tên. Sau khi deploy, hãy sử dụng URL endpoint với khóa API của bạn để gửi request inference từ bất kỳ ứng dụng nào.

Liên kết nhanh#

  • Inference: Kiểm thử model trên trình duyệt
  • Endpoints: Deploy các endpoint chuyên dụng
  • Monitoring: Theo dõi hiệu suất triển khai

Câu hỏi thường gặp#

  • Tính năngSharedDedicated
    ServiceChia sẻ giữa các người dùng PlatformDành riêng cho một triển khai
    Quy môĐược quản lý bởi PlatformMở rộng quy mô về 0, một instance
    Khu vực3 khu vực dữ liệuChọn từ 42 khu vực triển khai
    URLPlatform model APIURL endpoint triển khai được tạo
    TestingTab model PredictTab Predict của deployment-card hoặc API
    Rate limits20 request/phútKhông giới hạn tỷ lệ trên Platform đối với các lệnh gọi trực tiếp
    AuthBất kỳ khóa API workspace nàoChỉ khóa API được liên kết với deployment
  • Deployment giữ nguyên trạng thái tạo hoặc đang deploy trong khi dịch vụ khởi động. Nó sẵn sàng sử dụng khi trạng thái chuyển thành Ready; thời gian thay đổi tùy theo model và vùng, thường mất vài phút.

  • Có, mỗi model có thể có nhiều endpoint ở các vùng khác nhau. Số lượng deployment bị giới hạn theo gói: Free 3, Pro 10, Enterprise unlimited. Hạn mức được tính phí vào workspace sở hữu model và một endpoint chỉ phục vụ đúng một model tại một thời điểm — hãy sử dụng model replacement để hoán đổi mà không làm thay đổi URL.

  • Khi bật tính năng scale-to-zero:

    • Endpoint tự động giảm quy mô sau khi không hoạt động
    • Yêu cầu đầu tiên sẽ kích hoạt khởi động lạnh (cold start)
    • Các yêu cầu tiếp theo sẽ diễn ra nhanh chóng

    Các request đầu tiên sau thời gian nhàn rỗi sẽ kích hoạt khởi động lạnh. Việc mở thẻ deployment sẽ chạy kiểm tra sức khỏe làm ấm endpoint, giúp dự đoán thử nghiệm ngay sau đó phản hồi nhanh chóng.

Bình luận