Chuẩn bị dữ liệu#
Chuẩn bị dữ liệu là nền tảng cho các model thị giác máy tính thành công. Ultralytics Platform cung cấp các công cụ toàn diện để quản lý dữ liệu training của bạn, từ tải lên, annotation đến phân tích.
Watch: Get Started with Ultralytics Platform - Data
Tổng quan#
Mục Data của Ultralytics Platform giúp bạn:
- Tải lên hình ảnh, video và tệp dataset (ZIP, TAR bao gồm
.tar.gz/.tgz, NDJSON) - Import từ URL bằng cách dán liên kết trực tiếp đến archive hoặc bản export NDJSON, hoặc từ Roboflow
- Kết nối Google Cloud Storage, Amazon S3 hoặc Azure Blob Storage và sử dụng dữ liệu tại chỗ mà không cần tải lên một bản sao
- Giữ pixel on-premise với các worker CPU/GPU Enterprise On Premise
- Chú thích bằng các công cụ vẽ thủ công và tính năng gán nhãn thông minh hỗ trợ bởi SAM — chọn từ SAM 2.1, SAM 3 hoặc SAM 3.1 mặc định
- Quản lý class bằng cách đổi tên, đổi màu, hợp nhất và xóa trên toàn bộ dataset
- Phân tích dữ liệu bằng statistics, visualization và clustering dựa trên embedding
- Export ở định dạng NDJSON để training cục bộ

Workflow#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Giai đoạn | Mô tả |
|---|---|
| Upload | Import hình ảnh, video hoặc archive với quy trình xử lý tự động |
| Annotate | Gán nhãn dữ liệu bằng các công cụ thủ công hoặc sử dụng annotation SAM cho detect, segment, semantic và OBB |
| Phân tích | Xem phân phối class, spatial heatmap, statistics về kích thước và các cluster embedding |
| Export | Tải xuống ở định dạng NDJSON để sử dụng offline |
Các Task được hỗ trợ#
Dataset trên Ultralytics Platform hỗ trợ cả 7 loại task YOLO:
| Task | Mô tả | Công cụ Annotation |
|---|---|---|
| Detect | Object detection bằng bounding box | Công cụ hình chữ nhật |
| Segment | Instance segmentation bằng pixel mask | Công cụ polygon |
| Semantic | Semantic segmentation với các vùng pixel theo từng class | Công cụ polygon |
| Depth | Bản đồ depth metric theo từng pixel | Target đã import |
| Classify | Phân loại ở cấp độ hình ảnh | Bộ chọn class |
| Pose | Ước tính keypoint với các template skeleton tích hợp sẵn và tùy chỉnh | Công cụ keypoint |
| OBB | Bounding box định hướng cho các object bị xoay | Công cụ box định hướng |
Loại task được thiết lập khi tạo dataset và xác định các công cụ annotation khả dụng. Bạn có thể thay đổi sau đó từ bộ chọn task trong header của dataset, nhưng các annotation không tương thích sẽ không được hiển thị sau khi chuyển đổi. Chỉ được chuyển sang hoặc chuyển khỏi depth khi dataset đang trống — xem Edit Dataset.
Tính năng chính#
Smart Storage#
Ultralytics Platform quản lý việc lưu trữ một cách hiệu quả:
- Deduplication: Các hình ảnh giống hệt nhau trong cùng một khu vực dữ liệu chỉ được lưu trữ một lần
- Integrity: Các lượt upload được xác minh về tính toàn vẹn dữ liệu
- Efficiency: Storage được tối ưu và xử lý nhanh
URI của dataset#
Tham chiếu đến dataset bằng định dạng URI ul:// (xem Using Platform Datasets):
yolo train data=ul://username/datasets/my-datasetĐiều này cho phép training trên dataset của platform từ bất kỳ máy nào đã cấu hình API key của bạn.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)Versioning dataset#
Tạo snapshot NDJSON bất biến của dataset để training có khả năng tái lập. Mỗi version ghi lại số lượng hình ảnh, class và annotation tại thời điểm tạo. Xem Versions Tab để biết chi tiết.
Các tab tập dữ liệu#
Các trang dataset có thể hiển thị tối đa sáu tab, tùy thuộc vào trạng thái dataset và quyền của bạn:
| Tab | Mô tả |
|---|---|
| Images | Duyệt hình ảnh ở chế độ xem dạng lưới, thu gọn hoặc bảng với các lớp phủ annotation |
| Class | Xem, đổi tên, đổi màu, hợp nhất và xóa class cùng số lượng label theo từng class |
| Charts | Statistics tự động: phân phối split, số lượng class, heatmap |
| Models | Model được train trên dataset này cùng metrics và trạng thái |
| Versions | Tạo, tải xuống và khôi phục snapshot NDJSON bất biến để đảm bảo khả năng tái lập |
| Errors | Các hình ảnh không xử lý được, kèm chi tiết lỗi và hướng dẫn khắc phục |
Classes xuất hiện khi dataset có hình ảnh và task của dataset có class, trong khi Charts xuất hiện bất cứ khi nào dataset có hình ảnh. Errors chỉ xuất hiện khi có lỗi xử lý. Versions xuất hiện khi bạn có quyền chỉnh sửa hoặc ở chế độ chỉ đọc khi đã tồn tại version.
Phân cụm#
Khám phá tập dữ liệu của bạn dưới dạng biểu đồ tán xạ 2D tương tác, nơi các hình ảnh có độ tương đồng trực quan nằm gần nhau — hữu ích để phát hiện các cụm, dữ liệu trùng lặp và ngoại lai, cũng như để kiểm tra cách các tập phân chia hoặc lớp được phân phối trên dữ liệu của bạn. Khoanh vùng một khu vực của biểu đồ để lọc thư viện chỉ hiển thị các hình ảnh đó. Phân tích cần từ 20 đến 200.000 hình ảnh không bị lỗi. Các embedding tương tự cho phép bạn find similar images trong các tập dữ liệu công khai và thêm chúng vào tập dữ liệu của bạn. Xem Clustering để biết chi tiết.
Statistics và Visualization#
Tab Charts cung cấp các phân tích tự động, bao gồm:
- Phân phối Split: Biểu đồ donut về số lượng hình ảnh train/val/test
- Top Classes: Biểu đồ donut về 10 class annotation xuất hiện thường xuyên nhất
- Kích thước hình ảnh: Histogram về phân phối chiều rộng và chiều cao hình ảnh (tính bằng pixel)
- Kích thước hình ảnh 2D: Heatmap 2D về chiều rộng so với chiều cao, kèm các đường hướng dẫn tỷ lệ khung hình
- Vị trí Annotation: Heatmap 2D về vị trí tâm của bounding box
- Số điểm mỗi Instance: Phân phối số lượng vertex polygon hoặc keypoint (dataset segment/pose)
Xem tab Charts để biết danh sách đầy đủ.
Liên kết nhanh#
- Datasets: Tải lên, quản lý và export dữ liệu training của bạn
- Annotation: Gán nhãn dữ liệu bằng các công cụ thủ công và có AI hỗ trợ
- Cloud Training: Train model trên các dataset đã annotation của bạn
- Dataset URI: Sử dụng URI
ul://để training từ bất kỳ đâu
FAQ#
Ultralytics Platform hỗ trợ:
Hình ảnh: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (tối đa 50MB mỗi tệp)
Video: MP4, WebM, MOV, MKV, M4V (tối đa 1GB, trích xuất frame ở 1 FPS, tối đa 100 frame)
Tệp tập dữ liệu: Kho lưu trữ ZIP hoặc TAR bao gồm
.tar.gzvà.tgz(tối đa 10GB trên Free, 20GB trên Pro, 50GB trên Enterprise) chứa hình ảnh với nhãn YOLO-format hoặc nhãn JSON COCO tùy chọn hoặc semantic PNG masks, cộng với các tệp xuất NDJSONBất kỳ định dạng archive hoặc NDJSON nào trong số này cũng có thể được import bằng cách dán liên kết HTTP(S) trực tiếp vào tab
URLcủa dialogNew Dataset. Label Pascal VOC XML được phát hiện nhưng không được import.Giới hạn storage phụ thuộc vào plan của bạn:
Plan Giới hạn Storage Free 100 GB Pro 500 GB Enterprise Không giới hạn Giới hạn từng tệp: Hình ảnh 50MB, Video 1GB, dataset 10GB trên Free / 20GB trên Pro / 50GB trên Enterprise
Có! Sử dụng định dạng URI của dataset để training cục bộ:
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100Hoặc xuất dataset của bạn ở định dạng NDJSON để chuyển metadata, các tập phân chia, annotation và URL hình ảnh được ký.