Chuẩn bị dữ liệu#
Chuẩn bị dữ liệu là nền tảng cho các model computer vision thành công. Ultralytics Platform cung cấp bộ công cụ toàn diện để quản lý dữ liệu training, từ tải lên, annotation đến phân tích.
Xem: Bắt đầu với Ultralytics Platform - Dữ liệu
Tổng quan#
Phần Data của Ultralytics Platform giúp bạn:
- Tải lên ảnh, video và file dataset (ZIP, TAR bao gồm
.tar.gz/.tgz, NDJSON) - Nhập từ URL bằng cách dán liên kết trực tiếp đến archive hoặc bản export NDJSON, hoặc nhập từ Roboflow
- Kết nối Google Cloud Storage, Amazon S3 hoặc Azure Blob Storage, rồi sử dụng dữ liệu tại chỗ mà không cần tải lên một bản sao
- Giữ dữ liệu pixel tại chỗ với worker CPU/GPU Enterprise On Premise
- Gán nhãn bằng công cụ vẽ thủ công và Smart annotation với SAM (SAM 2.1, SAM 3 hoặc SAM 3.1 mặc định), model YOLO hoặc model có prompt lớp — model mã nguồn mở được host hoặc model trả phí của nhà cung cấp — trên dataset phát hiện có 1–200 lớp
- Quản lý lớp bằng cách đổi tên, đổi màu, hợp nhất và xóa lớp trên toàn bộ dataset
- Mở rộng dataset bằng Tìm ảnh tương tự hoặc Tạo ảnh tương tự, sau đó gán nhãn cho những ảnh bạn giữ lại
- Làm mờ khuôn mặt trong ảnh hiện có hoặc ảnh tải lên sau này
- Phân tích dữ liệu bằng thống kê, trực quan hóa và phân cụm dựa trên embedding
- Export ở định dạng NDJSON để training cục bộ

Workflow#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Giai đoạn | Mô tả |
|---|---|
| Tải lên | Nhập ảnh, video hoặc archive với quy trình xử lý tự động |
| Gán nhãn | Gán nhãn dữ liệu bằng công cụ thủ công hoặc dùng Smart annotation với SAM (phát hiện, phân đoạn, ngữ nghĩa và OBB), YOLO hoặc model có prompt lớp — model mã nguồn mở được host hoặc model trả phí của nhà cung cấp — trên dataset phát hiện có 1–200 lớp |
| Phân tích | Xem phân bố lớp, heatmap không gian, thống kê kích thước và cụm embedding |
| Export | Tải xuống ở định dạng NDJSON để sử dụng ngoại tuyến |
Các tác vụ được hỗ trợ#
Dataset của Ultralytics Platform hỗ trợ cả 7 loại tác vụ YOLO:
| Tác vụ | Mô tả | Công cụ annotation |
|---|---|---|
| Phát hiện | Phát hiện đối tượng bằng bounding box | Công cụ hình chữ nhật |
| Phân đoạn | Phân đoạn instance bằng mask pixel | Công cụ đa giác |
| Ngữ nghĩa | Phân đoạn ngữ nghĩa với các vùng pixel theo từng lớp | Công cụ đa giác |
| Độ sâu | Bản đồ độ sâu theo metric ở từng pixel | Các đối tượng đích đã nhập |
| Phân loại | Phân loại ở cấp ảnh | Bộ chọn lớp |
| Tư thế | Ước tính keypoint với template skeleton tích hợp sẵn và tùy chỉnh | Công cụ keypoint |
| OBB | Bounding box xoay cho các đối tượng bị xoay | Công cụ hộp xoay |
Loại tác vụ được thiết lập khi tạo dataset và quyết định những công cụ annotation nào khả dụng. Bạn có thể thay đổi loại tác vụ sau đó từ bộ chọn tác vụ ở phần header của dataset, nhưng các annotation không tương thích sẽ không hiển thị sau khi chuyển đổi. Chỉ có thể chuyển sang hoặc chuyển từ tác vụ độ sâu khi dataset còn trống — xem Chỉnh sửa Dataset.
Tính năng chính#
Lưu trữ thông minh#
Ultralytics Platform quản lý lưu trữ hiệu quả:
- Khử trùng lặp: Các ảnh giống hệt nhau trong cùng vùng dữ liệu chỉ được lưu một lần
- Tính toàn vẹn: Dữ liệu tải lên được xác minh tính toàn vẹn
- Hiệu quả: Lưu trữ được tối ưu và xử lý nhanh
URI của dataset#
Tham chiếu dataset bằng định dạng URI ul:// (xem Sử dụng Dataset trên Platform):
yolo train model=yolo26n.pt data=ul://username/datasets/my-datasetNhờ đó, bạn có thể training trên dataset của platform từ bất kỳ máy nào đã cấu hình API key của mình.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)Phiên bản hóa dataset#
Tạo snapshot NDJSON bất biến của dataset để training có thể tái lập. Mỗi phiên bản ghi lại số lượng ảnh, số lượng lớp và số lượng annotation tại thời điểm tạo. Xem Tab Versions để biết chi tiết.
Các tab của dataset#
Trang dataset có thể hiển thị tối đa sáu tab, tùy thuộc vào trạng thái dataset và quyền của bạn:
| Tab | Mô tả |
|---|---|
| Ảnh | Duyệt ảnh ở chế độ lưới, thu gọn hoặc bảng kèm lớp phủ annotation |
| Lớp | Xem, đổi tên, đổi màu, hợp nhất và xóa lớp, kèm số lượng nhãn theo từng lớp |
| Charts | Thống kê tự động: phân bố split, số lượng lớp, heatmap |
| Model | Models được training trên dataset này, kèm metric và trạng thái |
| Phiên bản | Tạo, so sánh, tải xuống và khôi phục snapshot NDJSON bất biến |
| Lỗi | Ảnh xử lý thất bại, kèm chi tiết lỗi và hướng dẫn khắc phục |
Classes xuất hiện khi dataset có ảnh và tác vụ của dataset có lớp, còn Charts xuất hiện bất cứ khi nào dataset có ảnh. Errors chỉ xuất hiện khi có lỗi xử lý. Versions xuất hiện khi bạn có quyền chỉnh sửa hoặc ở chế độ chỉ đọc khi đã có phiên bản.
Phân cụm#
Khám phá dataset dưới dạng biểu đồ phân tán 2D tương tác, trong đó các ảnh có hình ảnh tương tự nằm gần nhau — hữu ích để tìm các cụm, bản sao và điểm ngoại lai, cũng như kiểm tra cách các split hoặc lớp phân bố trong dữ liệu. Khoanh một vùng bằng lasso hoặc nhấp vào một điểm để lọc thư viện ảnh chỉ còn những ảnh đó. Phân tích yêu cầu từ 20 đến 200.000 ảnh không bị lỗi. Cùng các embedding đó cho phép bạn tìm ảnh tương tự trong dataset công khai, dataset của riêng bạn và dataset nhóm, rồi thêm ảnh vào dataset của mình. Xem Phân cụm để biết chi tiết.
Thống kê và trực quan hóa#
Tab Charts cung cấp phân tích tự động, bao gồm:
- Phân bố split: Biểu đồ donut thể hiện số lượng ảnh train/val/test
- Các lớp hàng đầu: Biểu đồ donut về 10 lớp annotation xuất hiện thường xuyên nhất
- Kích thước ảnh: Biểu đồ histogram phân bố chiều rộng và chiều cao ảnh (tính bằng pixel)
- Kích thước ảnh 2D: Bản đồ nhiệt 2D về chiều rộng so với chiều cao, kèm các đường hướng dẫn tỷ lệ khung hình
- Vị trí chú thích: Bản đồ nhiệt 2D về vị trí tâm bounding box
- Số điểm trên mỗi đối tượng: Phân bố số đỉnh polygon hoặc keypoint (đối với các dataset segmentation/pose)
Xem tab Charts để biết danh sách đầy đủ.
Liên kết nhanh#
- Datasets: Tải lên, quản lý và xuất dữ liệu huấn luyện
- Chú thích: Gán nhãn dữ liệu bằng công cụ thủ công và công cụ có AI hỗ trợ
- Huấn luyện trên cloud: Huấn luyện model trên các dataset đã được chú thích
- URI dataset: Sử dụng URI
ul://để huấn luyện từ mọi nơi
Câu hỏi thường gặp#
Ultralytics Platform hỗ trợ:
Ảnh: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (tối đa 50MB mỗi tệp)
Video: MP4, WebM, MOV, MKV, M4V (tối đa 1GB, trích xuất khung hình ở 1 FPS, tối đa 100 khung hình)
Tệp dataset: Tệp lưu trữ ZIP hoặc TAR, bao gồm
.tar.gzvà.tgz(tối đa 10GB với gói Free, 20GB với Pro, 50GB với Enterprise), chứa ảnh cùng nhãn tùy chọn ở định dạng YOLO, JSON COCO hoặc JSON LabelMe, mask PNG ngữ nghĩa hoặc bản đồ độ sâu, cùng với tệp xuất Ultralytics NDJSON hoặc Labelbox NDJSONBạn cũng có thể nhập bất kỳ định dạng lưu trữ hoặc NDJSON nào trong số này bằng cách dán liên kết HTTP(S) trực tiếp vào tab
URLtrong hộp thoạiNew Dataset. Nhãn Pascal VOC XML được phát hiện nhưng không được nhập.Giới hạn dung lượng lưu trữ tùy thuộc vào gói của bạn:
Gói Giới hạn dung lượng lưu trữ Free 100 GB Pro 500 GB Enterprise Không giới hạn Giới hạn kích thước từng tệp: Ảnh 50MB, Video 1GB, dataset 10GB với gói Free / 20GB với Pro / 50GB với Enterprise
Có! Sử dụng định dạng URI dataset để huấn luyện cục bộ:
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100Hoặc xuất dataset ở định dạng NDJSON để chuyển metadata, các tập chia, chú thích và URL ảnh có chữ ký.