데이터 준비#
데이터 준비는 성공적인 컴퓨터 비전 모델의 기반입니다. Ultralytics Platform은 업로드부터 어노테이션, 분석에 이르기까지 학습 데이터 관리를 위한 종합적인 도구를 제공합니다.
시청: Ultralytics Platform 시작하기 - 데이터
개요#
Ultralytics Platform의 Data 섹션에서는 다음 작업을 수행할 수 있습니다:
- 이미지, 동영상 및 데이터셋 파일(ZIP,
.tar.gz/.tgz을 포함하는 TAR, NDJSON) 업로드 - 아카이브 또는 NDJSON 내보내기의 직접 링크를 붙여넣거나 Roboflow에서 URL로 가져오기
- Google Cloud Storage, Amazon S3 또는 Azure Blob Storage를 연결하고 사본을 업로드하지 않고 데이터를 바로 사용
- Enterprise On Premise CPU/GPU 워커로 픽셀을 온프레미스에 유지
- 수동 그리기 도구와 SAM을 사용한 스마트 어노테이션(SAM 2.1, SAM 3 또는 기본값인 SAM 3.1), YOLO 모델 또는 클래스 프롬프트 기반 모델(호스팅된 오픈 소스 모델 또는 유료 공급자 모델)로 1~200개 클래스를 지원하는 탐지 데이터셋에 어노테이션
- 전체 데이터셋에서 클래스 이름 변경, 색상 변경, 병합 및 삭제를 통해 클래스 관리
- 유사 이미지 찾기 또는 유사 이미지 생성으로 데이터셋을 확장한 다음, 유지할 이미지에 어노테이션 지정
- 기존 이미지 또는 향후 업로드 이미지의 얼굴 흐리게 처리
- 통계, 시각화 및 임베딩 기반 클러스터링으로 데이터를 분석
- 로컬 학습을 위해 NDJSON 형식으로 내보내기

워크플로#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| 단계 | 설명 |
|---|---|
| 업로드 | 자동 처리 기능으로 이미지, 동영상 또는 아카이브 가져오기 |
| 어노테이션 | 수동 도구로 데이터에 라벨을 지정하거나, SAM(탐지, 세그먼트, 시맨틱 및 OBB), YOLO 또는 클래스 프롬프트 기반 모델(호스팅된 오픈 소스 모델 또는 유료 공급자 모델)을 사용하는 스마트 어노테이션을 통해 1~200개 클래스를 지원하는 탐지 데이터셋에 라벨 지정 |
| 분석 | 클래스 분포, 공간 히트맵, 차원 통계 및 임베딩 클러스터 확인 |
| 내보내기 | 오프라인에서 사용하려면 NDJSON 형식으로 다운로드 |
지원 작업#
Ultralytics Platform 데이터셋은 YOLO 작업 유형 7가지를 모두 지원합니다:
| 작업 | 설명 | 어노테이션 도구 |
|---|---|---|
| 탐지 | 바운딩 박스를 사용한 객체 탐지 | 사각형 도구 |
| 세그먼트 | 픽셀 마스크를 사용한 인스턴스 세그멘테이션 | 다각형 도구 |
| 시맨틱 | 클래스별 픽셀 영역을 사용한 시맨틱 세그멘테이션 | 다각형 도구 |
| Depth | 픽셀 단위 미터법 깊이 맵 | 가져온 타깃 |
| 분류 | 이미지 단위 분류 | 클래스 선택기 |
| 포즈 | 기본 제공 및 사용자 지정 스켈레톤 템플릿을 사용한 키포인트 추정 | 키포인트 도구 |
| OBB | 회전된 객체를 위한 방향성 바운딩 박스 | 방향성 박스 도구 |
작업 유형은 데이터셋을 만들 때 설정하며, 사용 가능한 어노테이션 도구를 결정합니다. 나중에 데이터셋 헤더의 작업 선택기에서 변경할 수 있지만, 전환 후에는 호환되지 않는 어노테이션이 표시되지 않습니다. depth로 전환하거나 depth에서 다른 작업 유형으로 전환하는 것은 데이터셋이 비어 있을 때만 가능합니다. 자세한 내용은 데이터셋 편집을 참조하세요.
주요 기능#
스마트 스토리지#
Ultralytics Platform은 스토리지를 효율적으로 관리합니다:
- 중복 제거: 동일한 데이터 리전의 중복 이미지는 한 번만 저장됩니다.
- 무결성: 업로드 데이터의 무결성을 검증합니다.
- 효율성: 최적화된 스토리지와 빠른 처리 기능을 제공합니다.
데이터셋 URI#
ul:// URI 형식을 사용해 데이터셋을 참조합니다(Platform 데이터셋 사용 참조):
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset이 기능을 사용하면 API 키가 구성된 모든 머신에서 플랫폼 데이터셋으로 학습할 수 있습니다.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)데이터셋 버전 관리#
재현 가능한 학습을 위해 데이터셋의 변경 불가능한 NDJSON 스냅샷을 만듭니다. 각 버전에는 생성 당시의 이미지 수, 클래스 수 및 어노테이션 수가 기록됩니다. 자세한 내용은 Versions 탭을 참조하세요.
데이터셋 탭#
데이터셋 상태와 권한에 따라 데이터셋 페이지에 최대 6개의 탭이 표시됩니다:
| 탭 | 설명 |
|---|---|
| 이미지 | 어노테이션 오버레이와 함께 그리드, 컴팩트 또는 테이블 보기로 이미지 탐색 |
| 클래스 | 클래스별 라벨 수를 확인하고, 클래스를 조회하거나 이름 및 색상을 변경하고 병합하거나 삭제 |
| 차트 | 자동 통계: 분할 분포, 클래스 수, 히트맵 |
| 모델 | 이 데이터셋으로 학습한 모델의 메트릭 및 상태 |
| 버전 | 변경 불가능한 NDJSON 스냅샷을 생성, 비교, 다운로드 및 복원 |
| 오류 | 처리에 실패한 이미지와 오류 세부 정보 및 해결 안내 |
데이터셋에 이미지가 있고 작업에 클래스가 있으면 Classes이 표시되며, 이미지가 있으면 Charts이 표시됩니다. 처리 실패가 있는 경우에만 Errors가 표시됩니다. 편집 권한이 있거나 기존 버전이 있는 읽기 전용 모드에서는 Versions이 표시됩니다.
클러스터링#
데이터셋을 인터랙티브한 2D 산점도로 탐색할 수 있습니다. 시각적으로 유사한 이미지가 서로 가까이 표시되므로 클러스터, 중복 이미지 및 이상치를 찾고 데이터 전반에 분할 또는 클래스가 어떻게 분포하는지 살펴보는 데 유용합니다. 영역을 올가미로 선택하거나 점을 클릭해 갤러리를 해당 이미지로 필터링합니다. 분석에는 오류가 없는 이미지가 20~200,000개 필요합니다. 동일한 임베딩을 사용해 공개 데이터셋, 본인 데이터셋 및 팀 데이터셋에서 유사 이미지 찾기를 수행하고 해당 이미지를 본인 데이터셋에 추가할 수 있습니다. 자세한 내용은 클러스터링을 참조하세요.
통계 및 시각화#
Charts 탭에서는 다음을 비롯한 자동 분석 결과를 제공합니다:
- 분할 분포: train/val/test 이미지 수를 나타내는 도넛형 차트
- 상위 클래스: 어노테이션 빈도가 가장 높은 10개 클래스의 도넛형 차트
- 이미지 크기: 이미지 너비와 높이 분포를 픽셀 단위로 보여주는 히스토그램
- 이미지 크기 2D: 종횡비 안내선이 표시된 너비 대 높이 2D 히트맵
- 어노테이션 위치: 바운딩 박스 중심 위치를 나타내는 2D 히트맵
- 인스턴스당 포인트 수: 폴리곤 꼭짓점 또는 키포인트 개수 분포(세그먼테이션/포즈 데이터셋)
전체 목록은 차트 탭을 참조하세요.
빠른 링크#
- 데이터셋: 학습 데이터를 업로드하고 관리 및 내보내기
- 어노테이션: 수동 및 AI 지원 도구로 데이터에 라벨 지정
- 클라우드 학습: 어노테이션이 완료된 데이터셋으로 모델 학습
- 데이터셋 URI:
ul://URI를 사용해 어디서나 학습
자주 묻는 질문#
Ultralytics Platform에서 지원하는 형식은 다음과 같습니다.
이미지: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO(각 최대 50MB)
동영상: MP4, WebM, MOV, MKV, M4V(최대 1GB, 1 FPS로 프레임 추출, 최대 100프레임)
데이터셋 파일:
.tar.gz및.tgz이 포함된 ZIP 또는 TAR 아카이브(Free는 최대 10GB, Pro는 20GB, Enterprise는 50GB). 이미지와 함께 선택적으로 YOLO 형식, COCO JSON 또는 LabelMe JSON 라벨, 시맨틱 PNG 마스크 또는 깊이 맵, 그리고 Ultralytics NDJSON 또는 Labelbox NDJSON 내보내기를 포함할 수 있습니다.이러한 아카이브 또는 NDJSON 형식은
New Dataset대화상자의URL탭에 직접 HTTP(S) 링크를 붙여 넣어 가져올 수도 있습니다. Pascal VOC XML 라벨은 감지되지만 가져오지는 않습니다.저장 용량 제한은 요금제에 따라 다릅니다.
요금제 저장 용량 제한 Free 100 GB Pro 500 GB Enterprise 무제한 개별 파일 제한: 이미지 50MB, 동영상 1GB, 데이터셋 Free 10GB / Pro 20GB / Enterprise 50GB
예. 데이터셋 URI 형식을 사용해 로컬에서 학습할 수 있습니다.
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100또는 데이터셋을 NDJSON 형식으로 내보내 메타데이터, 분할 정보, 어노테이션 및 서명된 이미지 URL을 전송할 수 있습니다.