Ultralytics YOLO27:

Tích hợp Google Cloud Storage#

Tích hợp Google Cloud Storage kết nối các bucket GCS của bạn với Ultralytics Platform. Hình ảnh vẫn nằm trong các bucket của bạn — Platform lập chỉ mục trực tiếp tại đó, để bạn có thể duyệt, gắn nhãn và huấn luyện model YOLO mà không cần tải lên bản sao.

Tính năng Pro

Dataset Google Cloud Storage yêu cầu gói Pro hoặc Enterprise. Workspace miễn phí vẫn thấy mục tích hợp và sẽ được nhắc nâng cấp khi kết nối. Dataset Google Cloud Storage hiện có vẫn truy cập đầy đủ nếu gói đăng ký hết hạn — chỉ các kết nối và lần nhập mới mới yêu cầu Pro.

Tạo Service Account chỉ có quyền đọc#

Platform chỉ đọc dữ liệu từ bộ nhớ của bạn — không bao giờ ghi, sửa đổi hoặc xóa đối tượng. Tạo một service account chuyên dụng chỉ có quyền đọc:

  1. Trong Google Cloud console, truy cập IAM & Admin > Service Accounts và tạo một service account.
  2. Cấp cho tài khoản vai trò Storage Object Viewer (roles/storage.objectViewer) trên các bucket bạn muốn kết nối.
  3. Mở service account, chọn Keys > Add key > Create new key, chọn JSON rồi tải tệp khóa xuống.
Cần thêm một quyền để khám phá bucket

roles/storage.objectViewer bao gồm mọi thao tác Platform thực hiện với dữ liệu của bạn, nhưng không cho phép liệt kê các bucket trong một dự án. Thêm một vai trò có storage.buckets.list nếu bạn muốn Platform tự tìm các bucket; hoặc nhập thủ công tên từng bucket khi kết nối.

Kết nối với Platform#

  1. Truy cập Settings > Integrations và chọn Google Cloud Storage từ danh sách tích hợp.
  2. Dán nội dung của khóa JSON service account.
  3. Nhấp Find available buckets, sau đó chọn các bucket cần kết nối. Nếu service account không thể liệt kê bucket, hãy nhập thủ công tên một bucket đã biết.
  4. Nhấp Connect. Platform xác minh khả năng liệt kê và đọc từng bucket đã chọn trước khi lưu bất cứ thứ gì.

Cài đặt tích hợp Google Cloud Storage của Ultralytics Platform

Bạn cần có vai trò quản trị viên hoặc chủ sở hữu workspace để kết nối bộ nhớ đám mây. Một kết nối hỗ trợ tối đa 50 bucket và tính năng khám phá liệt kê tối đa 300 bucket mà service account có thể truy cập.

Trình duyệt đọc tệp khóa bạn dán và chỉ gửi ba trường mà Platform cần — client_email, private_key, và project_id. Phần còn lại của JSON không rời khỏi trang.

Kết nối lại cùng service account sau này sẽ thêm các bucket mới vào phần tích hợp hiện có. Thông tin xác thực đã lưu chỉ được thay thế khi thông tin thay thế vẫn có thể đọc mọi bucket bạn đã kết nối.

Bảo mật thông tin xác thực

Thông tin xác thực được mã hóa khi lưu trữ bằng AES-256-GCM, không bao giờ được gửi lại trình duyệt và không bao giờ bị lộ cho các workload huấn luyện. Để thu hồi quyền truy cập, hãy xóa khóa service account trong Google Cloud.

Tạo Dataset từ bucket GCS#

  1. Nhấp New Dataset rồi mở tab Cloud.
  2. Chọn một bucket đã kết nối và duyệt đến thư mục chứa dữ liệu.
  3. Xác nhận thư mục, điều chỉnh tên dataset rồi tạo dataset.

Platform liệt kê thư mục một lần và lập chỉ mục các nội dung tìm thấy:

  • Hình ảnh — Các đối tượng .jpg, .jpeg, .png, .webp và .avif được lập chỉ mục, đồng thời đọc kích thước bằng các yêu cầu có giới hạn. Platform không lưu một bản sao thứ hai của ảnh nguồn.
  • Nhãn — Các tệp phụ .txt YOLO được phân tích cú pháp thành annotation trong Platform, ghép theo cấu trúc chuẩn images/ → labels/ hoặc theo các tệp cùng thư mục.
  • Metadata — Tệp YAML cung cấp tên lớp và hình dạng keypoint pose, giống hệt như khi tải lên archive. Ưu tiên data.yaml và data.yml nếu thư mục chứa nhiều tệp.
  • Tác vụ — Một mẫu tệp nhãn sẽ xác định tác vụ, vì vậy các thư mục segment, pose và OBB được nhận diện dựa trên cấu trúc nhãn thay vì tác vụ bạn chọn trong hộp thoại.
  • Các tập chia — Tên thư mục train, val và test trong đường dẫn đối tượng sẽ tự động gán các tập chia.

Sau đó, dataset hoạt động như mọi dataset khác: duyệt và gắn nhãn, đặt chế độ công khai hoặc riêng tư, chia sẻ với nhóm của bạn và huấn luyện bằng dịch vụ huấn luyện được quản lý. Các tệp gốc được truyền trực tuyến theo yêu cầu và hình ảnh đã lập chỉ mục không sử dụng hạn mức bộ nhớ trên Platform của bạn.

Giới hạn

Một lần nhập lập chỉ mục tối đa 500.000 đối tượng, cùng các tệp nhãn hoặc YAML có dung lượng tối đa 1 MB mỗi tệp. Nên chia các bucket lớn thành nhiều dataset.

Giữ các đối tượng đã lập chỉ mục ở trạng thái bất biến

Mỗi hình ảnh được lập chỉ mục gắn với generation của đối tượng GCS tương ứng, và Platform sẽ từ chối an toàn nếu đối tượng bị thay đổi. Hãy thêm đối tượng mới thay vì ghi đè đối tượng hiện có.

Lần nhập thất bại#

Nếu lần nhập thất bại — do thư mục trống, đường dẫn sai chính tả hoặc quyền bị thu hồi — dataset sẽ hiển thị lỗi trên trang của mình. Người chỉnh sửa có thể nhấp Retry import để chạy lại bằng bucket và thư mục đã lưu, hoặc tạo dataset mới trỏ đến đường dẫn đã sửa.

Khi thử lại, hệ thống sẽ liệt kê lại thư mục thay vì tiếp tục từ điểm đã dừng: các đối tượng được thêm sau lần thử đầu tiên sẽ được lấy vào, còn các đối tượng không còn ở đó sẽ bị loại khỏi dataset.

Huấn luyện#

Huấn luyện được quản lý hoạt động theo quy trình huấn luyện thông thường. Trong thời gian chạy, quá trình huấn luyện sử dụng các bản sao riêng của Platform từ những hình ảnh đã ghim, và thông tin xác thực Google Cloud của bạn không bao giờ bị lộ cho các workload huấn luyện.

Ngắt kết nối#

Ngắt kết nối sẽ xóa thông tin xác thực đã lưu mà không tác động đến bất cứ thứ gì trong Google Cloud. Dataset được tạo từ các bucket đó vẫn nằm trong workspace cùng với lớp, nhãn và annotation, nhưng không thể tải, xem trước hoặc huấn luyện trên hình ảnh cho đến khi kết nối lại cùng service account.

Sử dụng REST API với ID tích hợp được trả về bởi GET /api/integrations/buckets:

curl -X DELETE \
  -H "Authorization: Bearer YOUR_API_KEY" \
  https://platform.ultralytics.com/api/integrations/buckets/INTEGRATION_ID
from ultralytics_platform import Platform

client = Platform()  # reads ULTRALYTICS_API_KEY
integrations = client.storage_integrations.list()
client.storage_integrations.delete("INTEGRATION_ID")

Thay vào đó, để thu hồi quyền truy cập ngay tại nguồn, hãy xóa khóa service account trong Google Cloud.

Các giới hạn hiện tại#

Dataset dùng GCS hiện không hỗ trợ các tính năng cần bản sao hình ảnh do Platform quản lý: tự động gắn nhãn, phân tích phân cụm, sao chép dataset và ảnh chụp phiên bản bất biến.

Xóa dataset dùng GCS hoặc từng hình ảnh trong dataset chỉ xóa các tham chiếu của Platform — các đối tượng của bạn không bao giờ bị tác động.

Xem thêm các tích hợp Amazon S3 và Azure Blob Storage.

Câu hỏi thường gặp#

  • Không. Platform liệt kê bucket một lần và lập chỉ mục kích thước hình ảnh cùng các nhãn tìm thấy. Các tệp gốc được truyền trực tuyến theo yêu cầu để duyệt và gắn nhãn; quá trình huấn luyện được quản lý chỉ sử dụng các bản sao riêng của Platform từ những hình ảnh đã ghim trong thời gian chạy. Hình ảnh đã lập chỉ mục không được tính vào hạn mức bộ nhớ của bạn.

  • Dataset được lập chỉ mục một lần khi tạo. Các đối tượng mới sẽ không được lấy vào cho đến khi bạn tạo dataset mới hoặc thử lại lần nhập thất bại. Mỗi hình ảnh đã lập chỉ mục được ghim vào phiên bản của nó, vì vậy việc ghi đè một đối tượng khiến Platform từ chối an toàn hình ảnh đó. Hãy thêm đối tượng mới thay vì thay thế đối tượng hiện có.

  • Các tính năng cần bản sao hình ảnh do Platform quản lý không khả dụng trên dataset đã kết nối: tự động gắn nhãn, phân tích phân cụm, sao chép dataset và ảnh chụp phiên bản bất biến. Gắn nhãn thủ công, chia sẻ và huấn luyện đều hoạt động như bình thường.

  • Ngắt kết nối tích hợp trong Settings > Integrations để xóa thông tin xác thực đã lưu, hoặc xóa khóa service account trong Google Cloud. Cả hai thao tác đều không ảnh hưởng đến dữ liệu trong các bucket của bạn.

Bình luận