Tích hợp Amazon S3#
Tích hợp Amazon S3 kết nối các bucket S3 của bạn với Ultralytics Platform. Hình ảnh vẫn nằm trong các bucket của bạn — Platform lập chỉ mục trực tiếp tại đó, nhờ vậy bạn có thể duyệt, gán nhãn và huấn luyện model YOLO mà không cần tải lên bản sao.
Để sử dụng dataset Amazon S3, bạn cần có gói Pro hoặc Enterprise. Các workspace miễn phí vẫn thấy tích hợp này và được nhắc nâng cấp khi kết nối. Dataset Amazon S3 hiện có vẫn có thể truy cập đầy đủ nếu gói đăng ký hết hạn — chỉ các kết nối và lần nhập mới cần gói Pro.
Tạo người dùng IAM chỉ có quyền đọc#
Platform chỉ đọc dữ liệu từ bộ nhớ của bạn — không bao giờ ghi, sửa đổi hoặc xóa đối tượng. Hãy dùng một người dùng IAM chuyên dụng chỉ có quyền liệt kê và đọc — tuyệt đối không dùng thông tin xác thực root:
-
Trong bảng điều khiển AWS, vào IAM > Users và tạo người dùng không có quyền truy cập bảng điều khiển.
-
Gắn chính sách chỉ cấp quyền liệt kê và đọc cho các bucket bạn muốn kết nối:
{ "Version": "2012-10-17", "Statement": [ { "Effect": "Allow", "Action": "s3:ListAllMyBuckets", "Resource": "*" }, { "Effect": "Allow", "Action": ["s3:ListBucket", "s3:GetObject"], "Resource": ["arn:aws:s3:::my-bucket", "arn:aws:s3:::my-bucket/*"] } ] }s3:ListAllMyBucketslà tùy chọn — tính năng này cho phép Platform tìm các bucket của bạn để bạn không cần nhập tên bucket. -
Mở tab Security credentials của người dùng, tạo access key, rồi sao chép access key ID và secret access key.
Platform từ chối thông tin xác thực AWS tạm thời. Các key do AWS STS cấp — bao gồm mọi key bắt đầu bằng ASIA, thông tin xác thực phiên của role
và key IAM Identity Center — sẽ hết hạn khi dataset vẫn đang được kết nối, vì vậy cần dùng access key có thời hạn dài của một người dùng IAM chuyên dụng.
Kết nối với Platform#
- Vào Settings > Integrations và chọn Amazon S3 trong danh sách tích hợp.
- Nhập access key ID, secret access key và vùng của bucket (ví dụ
us-east-1). - Nhấp vào Find available buckets, sau đó chọn các bucket cần kết nối. Nếu chính sách không cho phép tìm kiếm, hãy nhập thủ công tên của một bucket đã biết.
- Nhấp Connect. Platform xác minh khả năng liệt kê và đọc từng bucket đã chọn trước khi lưu bất cứ thứ gì.

Bạn cần có vai trò quản trị viên hoặc chủ sở hữu workspace để kết nối bộ nhớ đám mây. Mỗi kết nối hỗ trợ tối đa 50 bucket và tính năng tìm kiếm liệt kê tối đa 300 bucket mà key có thể truy cập.
Kết nối lại cùng người dùng IAM sau đó sẽ thêm các bucket mới vào tích hợp hiện có. Thông tin xác thực đã lưu chỉ được thay thế khi thông tin xác thực mới vẫn có thể đọc tất cả bucket bạn đã kết nối.
Một kết nối đọc các bucket trong vùng bạn nhập. Nếu các bucket của bạn nằm ở nhiều vùng, hãy tạo một kết nối cho mỗi vùng.
Thông tin xác thực được mã hóa khi lưu trữ bằng AES-256-GCM, không bao giờ được gửi lại cho trình duyệt và không bao giờ bị lộ cho các workload huấn luyện. Để thu hồi quyền truy cập, hãy vô hiệu hóa access key trong AWS IAM.
Tạo dataset từ bucket S3#
- Nhấp New Dataset rồi mở tab Cloud.
- Chọn một bucket đã kết nối và duyệt đến thư mục chứa dữ liệu.
- Xác nhận thư mục, điều chỉnh tên dataset rồi tạo dataset.
Platform liệt kê thư mục một lần và lập chỉ mục các nội dung tìm thấy:
- Hình ảnh — Các đối tượng
.jpg,.jpeg,.png,.webpvà.avifđược lập chỉ mục, đồng thời đọc kích thước bằng các yêu cầu có giới hạn. Platform không lưu một bản sao thứ hai của ảnh nguồn. - Nhãn — Các tệp phụ
.txtYOLO được phân tích cú pháp thành annotation trong Platform, ghép theo cấu trúc chuẩnimages/→labels/hoặc theo các tệp cùng thư mục. - Metadata — Tệp YAML cung cấp tên lớp và hình dạng keypoint pose, giống hệt như khi tải lên archive. Ưu tiên
data.yamlvàdata.ymlnếu thư mục chứa nhiều tệp. - Tác vụ — Một mẫu tệp nhãn sẽ xác định tác vụ, vì vậy các thư mục segment, pose và OBB được nhận diện dựa trên cấu trúc nhãn thay vì tác vụ bạn chọn trong hộp thoại.
- Các tập dữ liệu — Tên thư mục
train,valvàtesttrong object key sẽ tự động xác định tập dữ liệu.
Sau đó, dataset hoạt động như mọi dataset khác: duyệt và gắn nhãn, đặt chế độ công khai hoặc riêng tư, chia sẻ với nhóm của bạn và huấn luyện bằng dịch vụ huấn luyện được quản lý. Các tệp gốc được truyền trực tuyến theo yêu cầu và hình ảnh đã lập chỉ mục không sử dụng hạn mức bộ nhớ trên Platform của bạn.
Một lần nhập lập chỉ mục tối đa 500.000 đối tượng, cùng các tệp nhãn hoặc YAML có dung lượng tối đa 1 MB mỗi tệp. Nên chia các bucket lớn thành nhiều dataset.
Mỗi hình ảnh được lập chỉ mục đều được ghim với ETag của đối tượng S3 tương ứng, và Platform sẽ từ chối hoạt động nếu đối tượng bị thay đổi. Hãy thêm đối tượng mới thay vì ghi đè đối tượng hiện có.
Lần nhập thất bại#
Nếu lần nhập thất bại — do thư mục trống, đường dẫn sai chính tả hoặc quyền bị thu hồi — dataset sẽ hiển thị lỗi trên trang của mình. Người chỉnh sửa có thể nhấp Retry import để chạy lại bằng bucket và thư mục đã lưu, hoặc tạo dataset mới trỏ đến đường dẫn đã sửa.
Khi thử lại, hệ thống sẽ liệt kê lại thư mục thay vì tiếp tục từ điểm đã dừng: các đối tượng được thêm sau lần thử đầu tiên sẽ được lấy vào, còn các đối tượng không còn ở đó sẽ bị loại khỏi dataset.
Huấn luyện#
Tính năng huấn luyện được quản lý hoạt động theo quy trình huấn luyện thông thường. Trong suốt thời gian chạy, quá trình huấn luyện sử dụng các bản sao hình ảnh đã ghim do Platform quản lý, và thông tin xác thực AWS của bạn không bao giờ bị lộ cho các workload huấn luyện.
Ngắt kết nối#
Ngắt kết nối sẽ xóa thông tin xác thực đã lưu mà không tác động đến bất kỳ dữ liệu nào trên AWS. Dataset được tạo từ các bucket đó vẫn nằm trong workspace cùng với các class, nhãn và chú thích, nhưng không thể tải, xem trước hoặc dùng để huấn luyện hình ảnh cho đến khi kết nối lại cùng người dùng IAM.
Sử dụng REST API với ID tích hợp được trả về bởi GET /api/integrations/buckets:
curl -X DELETE \
-H "Authorization: Bearer YOUR_API_KEY" \
https://platform.ultralytics.com/api/integrations/buckets/INTEGRATION_IDfrom ultralytics_platform import Platform
client = Platform() # reads ULTRALYTICS_API_KEY
integrations = client.storage_integrations.list()
client.storage_integrations.delete("INTEGRATION_ID")Để thu hồi quyền truy cập trực tiếp tại nguồn, hãy vô hiệu hóa hoặc xóa access key trong AWS IAM.
Các giới hạn hiện tại#
Dataset dựa trên S3 hiện không hỗ trợ các tính năng cần có bản sao hình ảnh do Platform quản lý: tự động gán nhãn, phân tích phân cụm, sao chép dataset và ảnh chụp phiên bản bất biến.
Xóa dataset dựa trên S3 hoặc từng hình ảnh trong dataset chỉ xóa các tham chiếu của Platform — các đối tượng của bạn không bị tác động.
Xem thêm các tích hợp Google Cloud Storage và Azure Blob Storage.
Câu hỏi thường gặp#
Không. Platform liệt kê bucket một lần và lập chỉ mục kích thước hình ảnh cùng các nhãn tìm thấy. Các tệp gốc được truyền trực tuyến theo yêu cầu để duyệt và gắn nhãn; quá trình huấn luyện được quản lý chỉ sử dụng các bản sao riêng của Platform từ những hình ảnh đã ghim trong thời gian chạy. Hình ảnh đã lập chỉ mục không được tính vào hạn mức bộ nhớ của bạn.
Dataset được lập chỉ mục một lần khi tạo. Các đối tượng mới sẽ không được lấy vào cho đến khi bạn tạo dataset mới hoặc thử lại lần nhập thất bại. Mỗi hình ảnh đã lập chỉ mục được ghim vào phiên bản của nó, vì vậy việc ghi đè một đối tượng khiến Platform từ chối an toàn hình ảnh đó. Hãy thêm đối tượng mới thay vì thay thế đối tượng hiện có.
Các tính năng cần bản sao hình ảnh do Platform quản lý không khả dụng trên dataset đã kết nối: tự động gắn nhãn, phân tích phân cụm, sao chép dataset và ảnh chụp phiên bản bất biến. Gắn nhãn thủ công, chia sẻ và huấn luyện đều hoạt động như bình thường.
Ngắt kết nối tích hợp trong Settings > Integrations để xóa thông tin xác thực đã lưu, hoặc vô hiệu hóa hay xóa access key trong AWS IAM. Cả hai thao tác đều không tác động đến dữ liệu trong các bucket của bạn.