Tích hợp Azure Blob Storage#
Tích hợp Azure Blob Storage kết nối các container trong tài khoản lưu trữ của bạn với Ultralytics Platform. Hình ảnh vẫn nằm trong các container của bạn — Platform lập chỉ mục tại chỗ, nhờ đó bạn có thể duyệt, gắn nhãn và huấn luyện model YOLO mà không cần tải lên bản sao.
Dataset Azure Blob Storage yêu cầu gói Pro hoặc Enterprise. Các workspace miễn phí vẫn thấy tích hợp này và được nhắc nâng cấp khi kết nối. Dataset Azure Blob Storage hiện có vẫn có thể truy cập đầy đủ nếu gói đăng ký kết thúc — chỉ các kết nối và lần nhập mới yêu cầu Pro.
Lấy chuỗi kết nối#
Platform chỉ đọc dữ liệu từ storage của bạn — không bao giờ ghi, sửa đổi hoặc xóa blob. Tích hợp hiện tại yêu cầu chuỗi kết nối dùng access key của tài khoản, cấp quyền trên toàn tài khoản dù Platform chỉ thực hiện thao tác liệt kê và đọc:
- Trong Azure portal, mở tài khoản lưu trữ của bạn.
- Đi đến Security + networking > Access keys.
- Sao chép chuỗi kết nối.
Chuỗi phải có AccountName, AccountKey và HTTPS làm giao thức — theo định dạng Azure cung cấp trong Access
keys. Chuỗi kết nối dùng SAS token, chứa SharedAccessSignature thay vì AccountKey, sẽ bị từ chối.
Các kết nối sử dụng endpoint blob.core.windows.net tiêu chuẩn. Không hỗ trợ sovereign cloud (Azure China, Azure Government) và endpoint blob tùy chỉnh.
Kết nối với Platform#
- Đi đến Settings > Integrations và chọn Azure Blob Storage trong danh sách tích hợp.
- Dán chuỗi kết nối.
- Nhấp Find available containers, sau đó chọn các container cần kết nối. Bạn cũng có thể nhập tên container thủ công.
- Nhấp Connect. Platform xác minh rằng có thể liệt kê và đọc từng container đã chọn trước khi lưu bất cứ thông tin nào.

Bạn cần có [vai trò](https://ultralytics-translation-0.invalid quản trị viên hoặc chủ sở hữu workspace để kết nối cloud storage. Một kết nối hỗ trợ tối đa 50 container và quá trình tìm kiếm liệt kê tối đa 300 container trong tài khoản lưu trữ.
Kết nối lại cùng tài khoản lưu trữ sau này sẽ thêm các container mới vào tích hợp hiện có. Thông tin xác thực đã lưu chỉ được thay thế khi thông tin thay thế vẫn có thể đọc mọi container bạn đã kết nối.
Nếu bị lộ bên ngoài Platform, khóa tài khoản có thể cấp quyền cho thao tác ghi và xóa hoặc tạo SAS token. Thông tin xác thực được mã hóa khi lưu trữ bằng AES-256-GCM, không bao giờ được gửi lại trình duyệt và không bao giờ bị lộ cho workload huấn luyện. Khi phù hợp, hãy sử dụng một tài khoản lưu trữ chuyên dụng. Để thu hồi quyền truy cập, hãy xoay vòng access key của tài khoản lưu trữ trong Azure.
Tạo dataset từ blob container#
- Nhấp New Dataset rồi mở tab Cloud.
- Chọn một container đã kết nối và duyệt đến thư mục chứa dữ liệu của bạn.
- Xác nhận thư mục, điều chỉnh tên dataset rồi tạo dataset.
Platform liệt kê thư mục một lần và lập chỉ mục các nội dung tìm thấy:
- Hình ảnh — blob có phần mở rộng
.jpg,.jpeg,.png,.webpvà.avifđược lập chỉ mục; kích thước được đọc thông qua các request có giới hạn. Platform không lưu một bản sao thứ hai của ảnh nguồn. - Nhãn — Các tệp phụ
.txtYOLO được phân tích cú pháp thành annotation trong Platform, ghép theo cấu trúc chuẩnimages/→labels/hoặc theo các tệp cùng thư mục. - Metadata — Tệp YAML cung cấp tên lớp và hình dạng keypoint pose, giống hệt như khi tải lên archive. Ưu tiên
data.yamlvàdata.ymlnếu thư mục chứa nhiều tệp. - Tác vụ — Một mẫu tệp nhãn sẽ xác định tác vụ, vì vậy các thư mục segment, pose và OBB được nhận diện dựa trên cấu trúc nhãn thay vì tác vụ bạn chọn trong hộp thoại.
- Các tập dữ liệu — tên thư mục
train,valvàtesttrong đường dẫn blob tự động xác định các tập dữ liệu.
Sau đó, dataset hoạt động như mọi dataset khác: duyệt và gắn nhãn, đặt chế độ công khai hoặc riêng tư, chia sẻ với nhóm của bạn và huấn luyện bằng dịch vụ huấn luyện được quản lý. Các tệp gốc được truyền trực tuyến theo yêu cầu và hình ảnh đã lập chỉ mục không sử dụng hạn mức bộ nhớ trên Platform của bạn.
Mỗi lần nhập lập chỉ mục tối đa 500.000 blob và các file nhãn hoặc YAML có kích thước tối đa 1 MB mỗi file. Nên chia các container lớn thành nhiều dataset.
Mỗi ảnh được lập chỉ mục được gắn với ETag của blob; Platform sẽ từ chối hoạt động nếu blob bị thay đổi. Hãy thêm blob mới thay vì ghi đè lên blob hiện có.
Lần nhập thất bại#
Nếu lần nhập thất bại — do thư mục trống, đường dẫn bị nhập sai hoặc quyền bị thu hồi — dataset sẽ hiển thị lỗi trên trang của dataset. Biên tập viên có thể nhấp Retry import để khởi động lại bằng container và thư mục đã lưu, hoặc tạo dataset mới trỏ đến đường dẫn chính xác.
Thử lại sẽ liệt kê lại thư mục thay vì tiếp tục từ lần trước: các blob được thêm kể từ lần thử đầu tiên sẽ được đưa vào, còn các blob không còn ở đó sẽ bị loại khỏi dataset.
Huấn luyện#
Huấn luyện được quản lý hoạt động theo quy trình huấn luyện thông thường. Trong suốt thời gian chạy, quá trình huấn luyện sử dụng các bản sao riêng của những ảnh đã ghim do Platform lưu giữ; thông tin xác thực Azure của bạn không bao giờ bị lộ cho workload huấn luyện.
Ngắt kết nối#
Ngắt kết nối sẽ xóa chuỗi kết nối đã lưu mà không tác động đến bất cứ thứ gì trong Azure. Dataset được tạo từ các container đó vẫn nằm trong workspace cùng với class, nhãn và chú thích, nhưng không thể tải, xem trước hoặc huấn luyện trên hình ảnh cho đến khi kết nối lại cùng tài khoản lưu trữ.
Sử dụng REST API với ID tích hợp được trả về bởi GET /api/integrations/buckets:
curl -X DELETE \
-H "Authorization: Bearer YOUR_API_KEY" \
https://platform.ultralytics.com/api/integrations/buckets/INTEGRATION_IDfrom ultralytics_platform import Platform
client = Platform() # reads ULTRALYTICS_API_KEY
integrations = client.storage_integrations.list()
client.storage_integrations.delete("INTEGRATION_ID")Để thu hồi quyền truy cập trực tiếp tại nguồn, hãy xoay vòng access key của tài khoản lưu trữ trong Azure.
Các giới hạn hiện tại#
Dataset sử dụng Azure hiện không hỗ trợ các tính năng yêu cầu Platform lưu bản sao hình ảnh: tự động gắn nhãn, phân tích phân cụm, sao chép dataset và snapshot phiên bản bất biến.
Xóa dataset sử dụng Azure hoặc từng ảnh trong dataset chỉ xóa các tham chiếu của Platform — blob của bạn không bị tác động.
Xem thêm các tích hợp Google Cloud Storage và Amazon S3.
Câu hỏi thường gặp#
Không. Platform liệt kê container một lần và lập chỉ mục kích thước hình ảnh cùng các nhãn tìm thấy. Ảnh gốc được truyền theo yêu cầu để duyệt và gắn nhãn; quá trình huấn luyện được quản lý chỉ sử dụng các bản sao riêng của những ảnh đã ghim do Platform lưu giữ trong suốt thời gian chạy. Hình ảnh đã lập chỉ mục không tính vào hạn mức lưu trữ của bạn.
Dataset được lập chỉ mục một lần khi tạo. Các đối tượng mới sẽ không được lấy vào cho đến khi bạn tạo dataset mới hoặc thử lại lần nhập thất bại. Mỗi hình ảnh đã lập chỉ mục được ghim vào phiên bản của nó, vì vậy việc ghi đè một đối tượng khiến Platform từ chối an toàn hình ảnh đó. Hãy thêm đối tượng mới thay vì thay thế đối tượng hiện có.
Các tính năng cần bản sao hình ảnh do Platform quản lý không khả dụng trên dataset đã kết nối: tự động gắn nhãn, phân tích phân cụm, sao chép dataset và ảnh chụp phiên bản bất biến. Gắn nhãn thủ công, chia sẻ và huấn luyện đều hoạt động như bình thường.
Ngắt kết nối tích hợp trong Settings > Integrations để xóa thông tin xác thực đã lưu, hoặc xoay vòng access key của tài khoản lưu trữ trong Azure. Cả hai thao tác đều không ảnh hưởng đến dữ liệu trong các container của bạn.