데이터 준비#
데이터 준비는 성공적인 컴퓨터 비전 모델의 기반입니다. Ultralytics Platform은 업로드부터 annotation, 분석까지 training data를 관리할 수 있는 종합적인 도구를 제공합니다.
Watch: Get Started with Ultralytics Platform - Data
개요#
Ultralytics Platform의 Data 섹션에서는 다음 작업을 수행할 수 있습니다:
- 업로드 이미지, 비디오 및 데이터셋 파일(ZIP,
.tar.gz/.tgz을 포함한 TAR, NDJSON) - URL에서 가져오기 아카이브 또는 NDJSON export의 직접 링크를 붙여 넣거나 Roboflow에서 가져오기
- 연결 Google Cloud Storage, Amazon S3 또는 Azure Blob Storage를 연결하고 사본을 업로드하지 않고 데이터를 현재 위치에서 사용하기
- Enterprise 온프레미스 CPU/GPU worker를 사용하여 픽셀을 온프레미스에 유지
- 어노테이션 수동 그리기 도구 및 SAM 기반 스마트 라벨링 — SAM 2.1, SAM 3 또는 기본 SAM 3.1 중 선택하세요
- 전체 데이터셋에서 class 관리 — class 이름 변경, 색상 변경, 병합 및 삭제
- 통계, visualization 및 embedding 기반 clustering으로 데이터 분석
- 로컬 training을 위해 NDJSON 형식으로 export

Workflow#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 단계 | 설명 |
|---|---|
| 업로드 | 자동 처리 기능을 사용하여 이미지, 비디오 또는 아카이브 가져오기 |
| 어노테이션 | 수동 도구로 데이터에 label을 지정하거나, detect, segment, semantic 및 OBB에 SAM annotation 사용 |
| 분석 | class distribution, spatial heatmap, dimension 통계 및 embedding cluster 보기 |
| 내보내기 | 오프라인 사용을 위해 NDJSON 형식으로 다운로드 |
지원되는 작업#
Ultralytics Platform 데이터셋은 7가지 YOLO task type을 모두 지원합니다:
| 태스크 | 설명 | Annotation Tool |
|---|---|---|
| Detect | bounding box를 사용한 object detection | Rectangle tool |
| Segment | pixel mask를 사용한 instance segmentation | Polygon tool |
| Semantic | class별 pixel region을 사용한 semantic segmentation | Polygon tool |
| Depth | pixel별 metric depth map | Imported targets |
| Classify | image-level classification | Class selector |
| Pose | 기본 제공 및 custom skeleton template을 사용한 keypoint estimation | Keypoint tool |
| OBB | 회전된 object를 위한 oriented bounding box | Oriented box tool |
데이터셋을 생성할 때 task type이 설정되며, 사용 가능한 annotation tool을 결정합니다. 이후에도 데이터셋 header의 task selector에서 변경할 수 있지만, 전환 후 호환되지 않는 annotation은 표시되지 않습니다. depth로 전환하거나 depth에서 전환하는 작업은 데이터셋이 비어 있을 때만 허용됩니다 — 자세한 내용은 Edit Dataset을 참조하십시오.
주요 기능#
Smart Storage#
Ultralytics Platform은 스토리지를 효율적으로 관리합니다.
- 중복 제거: 동일한 데이터 리전의 동일한 이미지는 한 번만 저장됩니다.
- 무결성: 업로드된 데이터의 무결성을 검증합니다.
- 효율성: storage를 최적화하고 빠르게 처리합니다
Dataset URIs#
ul:// URI 형식을 사용하여 데이터셋을 참조하십시오(Using Platform Datasets 참조):
yolo train data=ul://username/datasets/my-dataset이를 통해 API key가 구성된 모든 machine에서 Platform 데이터셋으로 training할 수 있습니다.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)Dataset Versioning#
재현 가능한 training을 위해 데이터셋의 변경 불가능한 NDJSON snapshot을 생성합니다. 각 version에는 생성 시점의 이미지 수, class 수 및 annotation 수가 기록됩니다. 자세한 내용은 Versions Tab을 참조하십시오.
데이터셋 탭#
데이터셋 페이지에는 데이터셋 상태와 권한에 따라 최대 6개의 tab이 표시될 수 있습니다:
| Tab | 설명 |
|---|---|
| Images | annotation overlay와 함께 grid, compact 또는 table view로 이미지 탐색 |
| 클래스 | class별 label 수와 함께 class를 확인, 이름 변경, 색상 변경, 병합 및 삭제 |
| Charts | 자동 통계: split distribution, class 수, heatmap |
| Models | 이 데이터셋으로 training한 Models과 metric 및 상태 |
| Versions | 재현성을 위해 변경 불가능한 NDJSON snapshot을 생성, 다운로드 및 복원 |
| Errors | 처리에 실패한 이미지와 오류 세부 정보 및 해결 안내 |
데이터셋에 이미지가 있고 해당 task에 class가 있으면 Classes이 표시되며, 이미지가 있으면 언제나 Charts이 표시됩니다. 처리 실패가 있을 때만 Errors가 표시됩니다. 편집 권한이 있거나 version이 이미 존재하는 read-only mode에서는 Versions이 표시됩니다.
Clustering#
시각적으로 유사한 이미지가 서로 가깝게 배치되는 대화형 2D 산점도로 데이터셋을 탐색해 보세요. 이는 클러스터, 중복 항목, 이상치를 찾아내고 데이터 전반에 걸쳐 분할이나 클래스가 어떻게 분포되어 있는지 검사하는 데 유용합니다. 플롯의 영역을 올가미(Lasso) 도구로 선택하여 해당 이미지로 갤러리를 필터링할 수 있습니다. 분석에는 오류가 없는 20개에서 200,000개 사이의 이미지가 필요합니다. 동일한 임베딩을 사용하여 공개 데이터셋에서 유사한 이미지를 찾고 내 데이터셋에 추가할 수 있습니다. 자세한 내용은 클러스터링을 참조하세요.
Statistics and Visualization#
Charts tab에서는 다음을 포함한 자동 분석을 제공합니다:
- Split Distribution: train/val/test 이미지 수를 나타내는 donut chart
- Top Classes: annotation 빈도가 가장 높은 10개 class를 나타내는 donut chart
- Image Dimensions: 이미지 width 및 height distribution의 histogram(pixel 단위)
- Image Dimensions 2D: aspect ratio guide line이 표시된 width 대 height의 2D heatmap
- Annotation Locations: bounding box 중심 위치의 2D heatmap
- Points per Instance: polygon vertex 또는 keypoint 수 distribution(segment/pose 데이터셋)
전체 목록은 Charts tab을 참조하십시오.
빠른 링크#
- Datasets: training data 업로드, 관리 및 export
- Annotation: 수동 및 AI 지원 도구로 데이터에 label 지정
- Cloud Training: annotation이 완료된 데이터셋으로 cloud에서 모델 training
- Dataset URI: 어디서나 training할 수 있도록
ul://URI 사용
FAQ#
Ultralytics Platform은 다음을 지원합니다:
이미지: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO(각 최대 50MB)
비디오: MP4, WebM, MOV, MKV, M4V(최대 1GB, 1 FPS로 frame 추출, 최대 100개 frame)
데이터셋 파일:
.tar.gz및.tgz을 포함하는 ZIP 또는 TAR 아카이브(Free의 경우 최대 10GB, Pro의 경우 20GB, Enterprise의 경우 50GB)로, 선택적인 YOLO 형식 또는 COCO JSON 라벨이나 의미론적 PNG 마스크가 포함된 이미지와 NDJSON 내보내기를 포함합니다.이러한 archive 또는 NDJSON format은
New Datasetdialog의URLtab에 직접 HTTP(S) link를 붙여 넣어 가져올 수도 있습니다. Pascal VOC XML label은 감지되지만 가져오지는 않습니다.Storage limit은 plan에 따라 다릅니다:
Plan Storage Limit Free 100 GB Pro 500 GB Enterprise Unlimited 개별 file limit: 이미지 50MB, 비디오 1GB, 데이터셋은 Free에서 10GB / Pro에서 20GB / Enterprise에서 50GB
예! Dataset URI 형식을 사용하여 local에서 training하십시오:
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100또는 메타데이터, 분할, 어노테이션 및 서명된 이미지 URL을 전송하려면 데이터셋을 NDJSON 형식으로 내보냅니다.