YOLO Vision 2026:

Tích hợp Google Cloud Storage#

Tích hợp Google Cloud Storage kết nối các bucket GCS của bạn với Ultralytics Platform. Hình ảnh của bạn vẫn nằm trong các bucket — Platform sẽ lập chỉ mục trực tiếp tại chỗ, cho phép bạn duyệt, gán nhãn và train các model YOLO mà không cần tải lên bản sao.

Tính năng Pro

Các dataset Google Cloud Storage yêu cầu Pro or Enterprise plan. Các workspace miễn phí sẽ nhìn thấy tính năng tích hợp và được nhắc nâng cấp khi kết nối. Các dataset Google Cloud Storage hiện có vẫn hoàn toàn truy cập được nếu gói đăng ký kết thúc — chỉ các kết nối và lệnh import mới yêu cầu gói Pro.

Tạo một Service Account chỉ đọc#

Platform chỉ đọc từ bộ nhớ của bạn — tuyệt đối không ghi, sửa đổi hoặc xóa các object của bạn. Hãy tạo một service account chuyên dụng chỉ với quyền đọc:

  1. Trong bảng điều khiển Google Cloud, hãy truy cập IAM & Admin > Service Accounts và tạo một service account.
  2. Cấp cho nó vai trò Storage Object Viewer (roles/storage.objectViewer) trên các bucket bạn muốn kết nối.
  3. Mở service account, chọn Keys > Add key > Create new key, chọn JSON và tải xuống tệp khóa.
Tính năng phát hiện bucket cần thêm một quyền

roles/storage.objectViewer bao gồm mọi thao tác mà Platform thực hiện với dữ liệu của bạn, nhưng nó không cho phép liệt kê các bucket trong một dự án. Thêm một vai trò chứa storage.buckets.list nếu bạn muốn Platform tự động tìm các bucket cho mình; nếu không, hãy nhập thủ công tên từng bucket khi kết nối.

Kết nối với Platform#

  1. Đi tới Settings > Integrations và chọn Google Cloud Storage từ danh sách tích hợp.
  2. Dán nội dung của khóa JSON tài khoản dịch vụ.
  3. Nhấp vào Find available buckets, sau đó chọn các bucket cần kết nối. Nếu tài khoản dịch vụ không thể liệt kê các bucket, hãy nhập thủ công tên bucket đã biết.
  4. Nhấp vào Connect. Platform sẽ xác minh khả năng liệt kê và đọc từng bucket đã chọn trước khi lưu bất kỳ thông tin nào.

Ultralytics Platform Google Cloud Storage Integration Settings

Bạn cần vai trò quản trị viên hoặc chủ sở hữu workspace để kết nối bộ nhớ đám mây. Một kết nối hỗ trợ tối đa 50 bucket, và tính năng phát hiện liệt kê tối đa 300 bucket mà service account có thể nhìn thấy.

Trình duyệt của bạn đọc tệp khóa đã dán và chỉ gửi ba trường mà Platform cần — client_email, private_key, và project_id. Phần còn lại của tệp JSON không bao giờ rời khỏi trang.

Việc kết nối lại cùng một service account sau đó sẽ thêm các bucket mới vào tích hợp hiện có. Thông tin đăng nhập đã lưu chỉ được thay thế khi thông tin thay thế có thể đọc được mọi bucket mà bạn đã kết nối.

Bảo mật thông tin xác thực

Thông tin đăng nhập được mã hóa khi lưu trữ bằng AES-256-GCM, không bao giờ được trả về trình duyệt và không bao giờ bị lộ cho các tác vụ huấn luyện. Để thu hồi quyền truy cập, hãy xóa khóa service account trong Google Cloud.

Tạo một tập dữ liệu từ bucket GCS#

  1. Nhấp vào New Dataset và mở tab Cloud.
  2. Chọn một bucket đã kết nối và duyệt đến thư mục chứa dữ liệu của bạn.
  3. Xác nhận thư mục, điều chỉnh tên dataset và tạo dataset.

Platform liệt kê thư mục một lần và lập chỉ mục những gì nó tìm thấy:

  • Images — các object .jpg, .jpeg, .png, .webp, và .avif được lập chỉ mục với kích thước được đọc thông qua các request giới hạn. Platform không lưu trữ bản sao thứ hai của hình ảnh nguồn.
  • Labels — các sidecar YOLO .txt được phân tích cú pháp thành các annotation trên Platform, được khớp theo bố cục chuẩn images/labels/ hoặc dưới dạng các file cùng thư mục.
  • Metadata — tệp YAML cung cấp tên lớp và hình dạng keypoint của pose, hoàn toàn giống như một tải lên lưu trữ. data.yamldata.yml được ưu tiên khi thư mục chứa nhiều tệp.
  • Task — một mẫu các tệp nhãn sẽ quyết định tác vụ, do đó các thư mục segment, pose và OBB được nhận diện dựa trên hình dạng nhãn của chúng thay vì tác vụ bạn đã chọn trong hộp thoại.
  • Splits — tên thư mục train, val, và test trong đường dẫn object sẽ gán các tập dữ liệu tự động.

Dataset sau đó hoạt động giống như bất kỳ dataset nào khác: duyệt và annotate dataset đó, đặt ở chế độ công khai hoặc riêng tư, chia sẻ với team của bạn và train trên đó thông qua tính năng quản lý training. Các tệp gốc được stream theo yêu cầu và hình ảnh được lập chỉ mục không tiêu tốn storage quota trên Platform của bạn.

Giới hạn

Một lần nhập duy nhất có thể lập chỉ mục lên đến 50.000 đối tượng, và các tệp nhãn hoặc YAML có dung lượng lên đến 1 MB mỗi tệp. Các bucket lớn hơn nên được chia thành nhiều tập dữ liệu.

Giữ các đối tượng được lập chỉ mục ở trạng thái bất biến

Mỗi hình ảnh được lập chỉ mục đều được ghim vào thế hệ đối tượng GCS của nó, và Platform sẽ dừng hoạt động nếu một đối tượng bị thay đổi bên dưới nó. Hãy thêm các đối tượng mới thay vì ghi đè lên các đối tượng hiện có.

Nhập thất bại#

Nếu quá trình nhập không thành công — do thư mục trống, lỗi đánh máy trong đường dẫn hoặc quyền hạn bị thu hồi — tập dữ liệu sẽ hiển thị lỗi trên trang của nó. Người chỉnh sửa có thể nhấp vào Retry import để khởi động lại với bucket và thư mục đã lưu, hoặc tạo một tập dữ liệu mới trỏ đến đường dẫn đã sửa.

Thao tác thử lại sẽ liệt kê lại thư mục thay vì tiếp tục: các đối tượng được thêm vào kể từ lần thử đầu tiên sẽ được lấy, và các đối tượng không còn ở đó sẽ bị loại khỏi dataset.

Huấn luyện#

Huấn luyện được quản lý hoạt động thông qua quy trình huấn luyện thông thường. Quá trình huấn luyện sử dụng các bản sao riêng của Platform gồm các hình ảnh được ghim trong suốt thời gian chạy, và thông tin đăng nhập Google Cloud của bạn không bao giờ bị lộ cho các tác vụ huấn luyện.

Ngắt kết nối một kết nối#

Việc ngắt kết nối sẽ xóa thông tin đăng nhập đã lưu trữ mà không ảnh hưởng đến bất kỳ thứ gì trong Google Cloud. Các dataset được xây dựng từ các bucket đó vẫn nằm trong workspace của bạn với các lớp, nhãn và chú thích của chúng, nhưng hình ảnh của chúng không thể được tải, xem trước hoặc huấn luyện cho đến khi service account đó được kết nối lại.

Sử dụng REST API với ID tích hợp được trả về bởi GET /api/integrations/buckets:

curl -X DELETE \
  -H "Authorization: Bearer YOUR_API_KEY" \
  https://platform.ultralytics.com/api/integrations/buckets/INTEGRATION_ID
from ultralytics_platform import Platform

client = Platform()  # reads ULTRALYTICS_API_KEY
integrations = client.storage_integrations.list()
client.storage_integrations.delete("INTEGRATION_ID")

Để thu hồi quyền truy cập ngay tại nguồn, hãy xóa khóa service account trong Google Cloud.

Các hạn chế hiện tại#

Các dataset hỗ trợ bởi GCS hiện không bao gồm các tính năng yêu cầu bản sao thuộc sở hữu của Platform đối với hình ảnh của bạn: auto-annotation, clustering analysis, sao chép dataset và version snapshots cố định.

Việc xóa một tập dữ liệu dựa trên GCS, hoặc xóa từng hình ảnh khỏi tập dữ liệu đó, chỉ xóa các tham chiếu của Platform — các đối tượng của bạn không bao giờ bị tác động.

Hãy xem thêm các phần tích hợp Amazon S3Azure Blob Storage.

Những người đóng góp

Bình luận