YOLO Vision 2026:

데이터셋#

Ultralytics Platform 데이터셋은 학습 데이터를 관리하기 위한 간소화된 솔루션을 제공합니다. 업로드 후 플랫폼은 이미지, 라벨, 통계를 자동으로 처리합니다. 데이터셋은 처리가 완료되고 train 분할에 이미지 최소 1개, val 또는 test 분할에 이미지 최소 1개, 라벨이 지정된 이미지 최소 1개, 그리고 총 이미지 수가 최소 2개 이상일 때 학습 준비가 완료됩니다.

데이터셋 업로드#

Ultralytics Platform은 유연성을 위해 다양한 업로드 형식을 허용합니다.

이미 다른 곳에 데이터가 있으신가요?

Roboflow에 이미 데이터셋이 있는 경우 Integrations를 사용하여 수동 내보내기나 재업로드 없이 직접 가져올 수 있습니다. Google Cloud Storage, Amazon S3 또는 Azure Blob Storage의 데이터는 Cloud storage를 통해 대체하여 사용할 수 있습니다. 엔터프라이즈 워크스페이스는 픽셀을 Platform으로 전송하지 않고 On Premise를 사용하여 로컬 데이터를 인덱싱하고 학습할 수 있습니다.

지원되는 형식#

형식확장자참고최대 크기
JPEG.jpg, .jpeg가장 일반적이며 권장됨50 MB
PNG.png투명도 지원50 MB
WebP.webp최신, 우수한 압축률50 MB
BMP.bmp비압축50 MB
TIFF.tiff, .tif고품질50 MB
HEIC.heiciPhone 사진50 MB
AVIF.avif차세대 형식50 MB
JP2.jp2JPEG 200050 MB
DNG.dngRaw 카메라50 MB
MPO.mpoMulti-picture object50 MB

동영상 코덱 지원#

파일 확장자만으로는 충분하지 않습니다. 플랫폼 수집 워커에서 코덱을 디코딩할 수 없는 경우 동영상 처리가 실패할 수 있습니다.

H.264 MP4 사용

MP4 컨테이너의 H.264 동영상은 주요 브라우저에서 가장 광범위하게 지원되며 가장 안전한 선택입니다. 동영상이 업로드되지 않는 경우 FFmpeg를 사용하여 다시 인코딩하세요:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

데이터셋 준비하기#

Platform은 Ultralytics YOLO, COCO, Ultralytics NDJSON 및 원시(주석 없음) 업로드를 지원합니다:

data.yaml 파일과 함께 표준 YOLO 디렉토리 구조를 사용합니다:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

YAML 파일은 데이터셋 구성을 정의합니다:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Raw 업로드

Raw: 주석이 없는 이미지(라벨 없음)를 업로드합니다. annotation editor를 사용하여 플랫폼에서 직접 주석을 달 계획일 때 유용합니다.

플랫 디렉토리 구조

명시적인 분할 폴더 없이 이미지를 업로드할 수도 있습니다. 플랫폼은 업로드 중 활성 분할 대상을 준수하며, 분류 데이터셋이 아닌 경우 분할 정보가 제공되지 않으면 학습 세트의 일부에서 검증 분할을 자동으로 생성할 수 있습니다. 나중에 대량 분할 이동 또는 분할 재배치를 통해 언제든지 이미지를 다시 할당할 수 있습니다.

형식 자동 감지

포맷이 자동으로 감지됩니다: names, train, 또는 val 키를 포함하는 data.yaml이 있는 데이터셋은 YOLO로 처리됩니다. images, annotations, 및 categories 배열을 포함하는 COCO JSON 파일이 있는 데이터셋은 COCO로 처리됩니다. .ndjson 내보내기는 Ultralytics NDJSON으로 가져와집니다. 이미지만 있고 주석이 없는 데이터셋은 원본(raw)으로 처리됩니다.

작업별 형식에 대한 자세한 내용은 supported tasksDatasets Overview를 참조하세요.

업로드 프로세스#

데이터셋을 생성하려면:

  1. 사이드바에서 Annotate(으)로 이동합니다.
  2. New Dataset 클릭
  3. 작업 유형을 선택합니다(supported tasks 참조).
  4. 이름과 선택적인 설명을 추가합니다.
  5. 가시성(공개 또는 비공개)과 선택적 라이선스를 설정합니다(available licenses 참조).
  6. 파일을 추가하고 Create & Upload을 클릭하거나, 빈 데이터셋으로 시작하려면 Create Dataset을 클릭합니다.

Ultralytics Platform Datasets Upload Dialog Task Selector 기존 데이터셋에 파일을 추가하려면 해당 데이터셋 페이지를 열고 파일을 갤러리에 드래그하거나 페이지 헤더의 업로드 아이콘을 클릭하세요. 데이터셋 작업이 이미 정의되어 있으므로 업로드 아이콘을 클릭하면 브라우저의 기본 파일 선택기가 바로 열립니다.

업로드 후, 플랫폼은 다단계 파이프라인을 통해 데이터를 처리합니다:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Validation: 형식 및 크기 확인
  2. Normalization: 큰 이미지 크기 조정(최대 4096px, 최소 치수 28px)
  3. Thumbnails: 256px WebP 미리보기 생성
  4. Label Parsing: YOLO 및 COCO 형식 라벨이 추출되었습니다.
  5. Statistics: 클래스 분포 및 이미지 치수 계산

Ultralytics Platform Datasets Upload Progress Bar

업로드 전 유효성 검사

업로드하기 전에 로컬에서 데이터셋을 검증할 수 있습니다:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
이미지 크기 요구 사항

이미지의 가장 짧은 쪽은 최소 28px 이상이어야 합니다. 이보다 작은 이미지는 처리 중에 거부됩니다. 가장 긴 쪽이 4096px보다 큰 이미지는 가로세로 비율이 유지되면서 자동으로 크기가 조정됩니다.

이미지 탐색#

다양한 레이아웃으로 데이터셋 이미지를 봅니다.

갤러리 툴바에서 Clustering 패널을 열어 대화형 2D 산점도(scatter plot)로 데이터셋을 탐색하세요.

보기설명
Grid주석 오버레이가 있는 썸네일 그리드(기본값)
컴팩트빠른 스캔을 위한 더 작은 썸네일
테이블썸네일, 파일 이름, 치수, 크기, 분할, 클래스 및 라벨 개수가 포함된 목록

Ultralytics Platform Datasets Gallery Grid View With Annotations

정렬 및 필터링#

이미지를 정렬하고 필터링하여 효율적으로 탐색할 수 있습니다:

정렬설명
최신순 / 오래된순업로드 / 생성 순서
이름 A-Z / Z-A파일 이름 알파벳순
높이 ↑/↓이미지 높이 (픽셀 단위)
너비 ↑/↓이미지 너비 (픽셀 단위)
크기 ↑/↓디스크상 파일 크기
주석 ↑/↓이미지당 주석 수
대규모 데이터셋

100,000개가 넘는 이미지로 구성된 데이터셋의 경우, 갤러리의 반응성을 유지하기 위해 이름 / 크기 / 너비 / 높이 정렬 기능이 비활성화됩니다. 최신순, 오래된순, 주석 개수순 정렬은 계속 사용할 수 있습니다.

주석이 없는 이미지 찾기

Annotations 필터 세트를 Unannotated(으)로 설정하여 아직 주석이 필요한 이미지를 빠르게 찾으세요. 이는 라벨링 진행 상황을 추적하려는 대규모 데이터셋에 특히 유용합니다.

사용자 정의 메타데이터 검색

검색창은 갤러리 툴바 오른쪽에 위치하며 카드, 컴팩트, 테이블의 모든 뷰 모드를 필터링합니다. 파일 이름(파일 확장자는 선택 사항)뿐만 아니라 사용자 정의 메타데이터 키, 스칼라 값, 배열 항목과도 일치하므로 {"ship_type": "yacht"}(을)를 포함하는 img_0042 이(가) 이름인 이미지는 img_0042(으)로 검색하든 yacht(으)로 검색하든 모두 찾아집니다.

하위 객체 내부에 중첩된 값은 일치하지 않습니다. 32자의 1진수 문자열을 붙여넣으면 해당 정확한 이미지 콘텐츠 해시를 조회합니다.

전체 화면 뷰어#

이미지를 클릭하면 다음 기능을 포함한 전체 화면 뷰어가 열립니다:

  • 탐색: 화살표 키 또는 썸네일 미리보기를 사용하여 탐색
  • 이미지 정보: Platform에서 생성된 속성, 커스텀 메타데이터, 그리고 EXIF와 같은 임베디드 파일 메타데이터를 검토합니다.
  • 사용자 정의 메타데이터: 소유자와 편집자는 중첩된 값(직렬화된 문자열 최대 500,000자) 및 최상위 키(최대 128자)를 포함하여 JSON 객체를 추가하거나 교체할 수 있습니다.
  • 주석: 주석 오버레이 표시 여부 전환
  • 클래스 분석: 색상 표시기가 포함된 클래스별 라벨 개수
  • Annotate: 편집 권한이 있는 경우 데스크톱에서 전체 화면 뷰어가 열리면 주석 제어 기능이 즉시 활성화됩니다.
  • 다운로드: 원본 이미지 파일 다운로드
  • 삭제: 데이터셋에서 이미지 삭제
  • Zoom: 확대하려면 Cmd/Ctrl+Scroll, Cmd/Ctrl++ 또는 Cmd/Ctrl+=, 축소하려면 Cmd/Ctrl+-을 사용합니다.
  • Reset view: 이미지를 뷰어에 맞추려면 Cmd/Ctrl + 0 또는 재설정 버튼을 사용합니다.
  • Pan: 확대된 상태에서 캔버스를 이동하려면 Space을 누른 채 드래그합니다.
  • 픽셀 뷰: 상세 확인을 위해 픽셀화된 렌더링을 전환합니다.

Ultralytics Platform Datasets Fullscreen Viewer With Metadata Panel

Split별 필터링#

데이터셋 Split별로 이미지 필터링:

Split목적
학습모델 학습용
Val학습 중 검증용
Test최종 평가용

클러스터링#

Clustering 패널은 시각적으로 유사한 이미지가 서로 가깝게 배치되는 대화형 2D 산점도로 데이터셋을 투영합니다. 갤러리를 떠나지 않고도 클러스터를 드러내고, 중복 항목과 이상값을 찾아내며, 분할이나 클래스가 데이터에 어떻게 분포되어 있는지 검사할 수 있습니다. 데이터셋 페이지의 갤러리 툴바에 있는 산점도 아이콘에서 이 패널을 엽니다.

Ultralytics Platform Datasets Clustering Empty State

분석 실행#

분석 시작:

  1. 데이터셋을 열고 갤러리 툴바의 산점도 아이콘 클릭
  2. Analyze Dataset 클릭
  3. 진행률 표시줄이 완료될 때까지 대기 — 결과가 같은 패널에 표시됩니다.

분석은 백그라운드에서 실행되며 데이터셋 크기에 따라 몇 분 정도 소요될 수 있습니다. 패널을 닫거나 페이지를 떠났다가 나중에 다시 돌아와도 됩니다.

시각화#

분석이 완료되면 패널에 모든 분석된 이미지의 2D 산점도가 표시됩니다. 갤러리 필터(Split, 클래스, 라벨링 여부)는 필터 범위 밖의 포인트를 흐리게 처리하여 관심 있는 하위 집합에 집중할 수 있도록 합니다.

Ultralytics Platform Datasets Clustering Scatter Plot

색상 기준#

패널 툴바의 Color by 드롭다운을 사용하여 데이터 포인트의 음영 처리 방식을 변경합니다. 언제든지 보기 모드를 전환할 수 있습니다. 플롯이 즉시 다시 색칠되므로 분할, 클래스 또는 이미지 속성이 클러스터에 어떻게 분포되어 있는지 확인할 수 있습니다.

옵션음영
SplitsTrain / Val / Test
Classes각 이미지의 첫 번째 주석 클래스
Width이미지 너비
Height이미지 높이
Size파일 크기
주석(Annotations)이미지당 주석 개수

Ultralytics Platform Datasets Clustering Color Modes

라소 선택#

영역 주변에 자유형 선택 영역을 그려 플롯의 포인트를 강조 표시합니다. 갤러리가 일치하는 이미지로 필터링되므로 일반적인 image operations을 사용하여 검사, 재라벨링, 이동 또는 삭제할 수 있습니다.

선택 취소

차트 위의 칩은 선택된 포인트 수를 보여줍니다. ×을 클릭하여 올소(lasso)를 지우고 전체 갤러리 보기로 돌아갑니다.

이동 및 확대/축소#

마우스와 키보드를 사용하여 대규모 산점도를 탐색하십시오:

입력작업
스크롤산점도를 2D로 이동
Cmd/Ctrl+스크롤커서 위치를 기준으로 확대 또는 축소
Space 키 누르기드래그하여 이동하는 모드로 전환

재분석#

분석 후 데이터셋이 변경되면 소유자와 편집자를 위해 패널 상단에 Re-analyze 버튼이 나타납니다.

Re-analyze을 클릭하여 처음부터 임베딩과 2D 투영을 다시 계산합니다.

데이터셋 탭#

각 데이터셋 페이지는 데이터셋 상태 및 권한에 따라 최대 6개의 탭을 표시할 수 있습니다:

이미지 탭#

주석 오버레이가 포함된 이미지 갤러리를 보여주는 기본 보기입니다. 그리드, 컴팩트, 테이블 보기 모드를 지원합니다. 파일을 여기에 드래그 앤 드롭하여 이미지를 추가할 수 있습니다.

클래스 탭#

이 탭은 데이터셋에 이미지가 있을 때 표시됩니다.

데이터셋의 주석 클래스 관리:

  • 클래스 히스토그램: 선형/로그 스케일 전환이 가능한 클래스별 주석 개수 막대 차트
  • 클래스 테이블: 클래스 이름, 라벨 수, 이미지 수로 정렬 및 검색이 가능한 테이블
  • 클래스 이름 편집: 클래스 이름을 클릭하여 인라인으로 이름을 변경합니다
  • 클래스 색상 편집: 색상 견본을 클릭하여 클래스 색상을 변경합니다
  • 새 클래스 추가: 하단의 입력을 사용하여 클래스를 추가합니다

Ultralytics Platform Datasets Classes Tab Histogram And Table

불균형 데이터셋을 위한 로그 스케일

데이터셋에 클래스 불균형이 있는 경우(예: "person" 주석은 10,000개인데 "bicycle" 주석은 50개뿐인 경우), 클래스 히스토그램의 Log Scale 토글을 사용하여 모든 클래스를 명확하게 시각화하세요.

차트 탭#

이 탭은 데이터셋에 이미지가 있을 때 표시됩니다.

데이터셋에서 계산된 자동 통계:

차트설명
분할 분포학습/검증/테스트 이미지 수 및 라벨링된 백분율의 도넛 차트
상위 클래스가장 빈번한 10개 어노테이션 클래스의 도넛 차트
이미지 크기평균값이 포함된 이미지 너비 및 높이 분포 히스토그램(오버레이)
인스턴스당 포인트어노테이션당 폴리곤 정점 또는 키포인트 수(세그먼트/포즈)
어노테이션 위치BBox 중심 위치의 2D 히트맵
이미지 파일 크기이미지 파일 크기 분포 히스토그램
이미지 형식원본 이미지 형식(JPG, PNG 등)의 분포
BBox 크기BBox 너비 및 높이 히스토그램(오버레이)
이미지당 객체 수이미지당 어노테이션 개수 히스토그램
이미지 크기 2D가로세로 비율 가이드 라인이 포함된 2D 너비 대 높이 히트맵

Ultralytics Platform Datasets Charts Tab Statistics Grid

통계 캐싱

플랫폼은 계산된 통계를 캐시하며 이미지, 주석, 클래스 또는 분할(split)이 변경되면 캐시를 무효화합니다.

전체 화면 히트맵

히트맵의 확장 버튼을 클릭하여 전체 화면 모드로 봅니다. 이는 더 크고 상세한 보기를 제공하며, 대규모 데이터셋의 공간 패턴을 이해하는 데 유용합니다.

모델 탭#

이 데이터셋에서 학습된 모든 모델을 검색 가능한 테이블에서 확인합니다:

설명
이름링크가 포함된 모델 이름
프로젝트아이콘이 포함된 상위 프로젝트
버전학습에 사용된 불변(Immutable) 데이터셋 버전 (있는 경우)
상태학습 상태 배지
작업YOLO 작업 유형
에포크최적 에포크 / 총 에포크
mAP50-95평균 정밀도(Mean average precision)
mAP50IoU 0.50에서의 mAP
생성됨생성 날짜

Ultralytics Platform Datasets Models Tab Trained Models Table

오류 탭#

이 탭은 하나 이상의 파일 처리 실패 시에만 나타납니다.

처리에 실패한 이미지는 다음 정보와 함께 나열됩니다:

  • 오류 배너: 실패한 이미지의 총 개수 및 안내
  • 오류 테이블: 파일명, 사용자 친화적인 오류 설명, 수정 힌트 및 미리보기 썸네일
  • 일반적인 오류로는 파일 손상, 지원되지 않는 형식, 너무 작은 이미지(최소 28px), 지원되지 않는 색상 모드 등이 있습니다

Ultralytics Platform Datasets Errors Tab Processing Failures

일반적인 처리 오류
오류원인수정 방법
이미지 파일을 읽을 수 없음손상되었거나 지원되지 않는 형식이미지 편집기에서 다시 내보내기
불완전하거나 손상됨전송 중 파일이 잘림원본 파일을 다시 다운로드
이미지가 너무 작음최소 크기가 28px 미만더 높은 해상도의 원본 이미지 사용
지원되지 않는 색상 모드CMYK 또는 인덱스 색상 모드RGB 모드로 변환

버전 탭#

재현 가능한 학습을 위해 데이터셋의 불변 NDJSON 스냅샷을 생성합니다. 각 버전은 생성 시점의 이미지 수, 클래스 수, 어노테이션 수 및 파일 크기를 캡처합니다.

설명
버전버전 번호(v1, v2, ...)
설명사용자가 제공한 설명(편집 가능)
이미지스냅샷 생성 시점의 이미지 수
클래스스냅샷 생성 시점의 클래스 수
어노테이션스냅샷 생성 시점의 어노테이션 수
크기NDJSON 내보내기 파일 크기
생성됨버전 생성 시점
작업다운로드, 복원 또는 삭제

버전을 생성하려면:

  1. 버전 탭 열기
  2. 선택적으로 설명 입력(예: "500개의 학습 이미지 추가" 또는 "잘못 라벨링된 클래스 수정")
  3. + 새 버전 클릭
  4. 새 버전이 테이블에 나타납니다
  5. 행 작업을 사용하여 버전을 다운로드, 복원 또는 삭제합니다.

각 버전은 순차적으로 번호가 지정됩니다(v1, v2, v3...). 저장된 버전이 버전 테이블에 남아 있는 동안에는 언제든지 다운로드할 수 있습니다.

버전 복원

복원을 수행하면 데이터셋의 현재 이미지, 분할, 클래스 및 주석이 선택한 스냅샷으로 영구적으로 교체됩니다. 재구축에는 몇 분 정도 소요될 수 있으며, 현재 상태를 다른 버전으로 먼저 저장하지 않은 경우 취소할 수 없습니다.

학습 중 버전 저장

Cloud Training dialog에서 Save Dataset Version을 활성화하여 모델을 학습에 사용된 정확한 데이터셋에 연결합니다. 플랫폼은 데이터셋 내용이 변경되지 않은 경우 일치하는 버전을 재사용하고, 변경된 경우에만 새 버전을 생성합니다.

준비된 데이터셋만 가능

버전 생성은 데이터셋이 ready 상태에 도달한 후에 가능합니다.

버전 생성 시기

데이터셋에 큰 변화(이미지 추가, 어노테이션 수정, 분할 재조정 등)를 주기 전후에 버전을 생성하십시오. 이를 통해 서로 다른 데이터셋 상태에 따른 모델 성능을 비교할 수 있습니다.

NDJSON 파일 크기

표시된 크기는 이미지 자체가 아닌 이미지 URL과 어노테이션을 포함하는 NDJSON 내보내기 파일 크기입니다. 실제 이미지 데이터는 별도로 저장되며 서명된 URL을 통해 액세스됩니다.

데이터셋 내보내기#

데이터셋 헤더나 버전 탭에서 NDJSON을 다운로드하여 오프라인용으로 데이터셋을 내보내십시오.

내보내려면:

  1. 데이터셋 헤더의 다운로드 버튼(다운로드 아이콘)을 클릭하십시오
  2. 현재 NDJSON 스냅샷을 직접 다운로드합니다.
  3. 나중에 다시 다운로드할 수 있는 변경 불가능한 번호가 지정된 스냅샷이 필요한 경우 Versions 탭을 사용하십시오.

Ultralytics Platform Datasets Export Ndjson Download NDJSON 형식은 줄당 하나의 JSON 객체를 저장합니다. 첫 번째 줄에는 데이터셋 메타데이터가 포함되고, 그 뒤에 이미지당 한 줄씩 이어집니다.

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

선택 사항인 이미지 수준의 metadata 객체는 NDJSON 파일이 Platform으로 가져와질 때 보존됩니다. 이미지의 전체 화면 정보 패널에서 이를 검사하거나 편집할 수 있습니다. 프로그래밍 방식의 아카이브 업로드를 위해 Dataset Ingest API는 이에 상응하는 imageMetadata 경로 맵을 지원합니다.

서명된 URL

내보낸 NDJSON의 이미지 URL은 서명되어 있으며 7일 동안 유효합니다. 최신 URL이 필요한 경우 데이터셋을 다시 내보내거나 새 버전을 만드십시오.

전체 사양은 Ultralytics NDJSON format documentation을 참조하세요.

이미지 작업#

빠른 작업#

Grid 또는 Compact 뷰에서 이미지를 마우스 오른쪽 버튼으로 클릭하여 빠른 작업에 액세스하십시오:

작업설명
Move to Split이미지를 Train, Val 또는 Test 분할로 재할당합니다.
다운로드원본 이미지 파일 다운로드
Delete데이터셋에서 이미지 삭제

Ultralytics Platform Datasets Image Card Context Menu

단일 대 일괄

이미지 컨텍스트 메뉴는 단일 이미지에서 작동합니다. 여러 이미지에 대한 일괄 작업을 수행하려면 체크박스 선택 기능이 있는 Table 뷰를 사용하십시오.

일괄 분할 이동#

선택한 이미지를 동일한 데이터셋 내의 다른 분할로 재할당합니다:

  1. Table 뷰로 전환
  2. 체크박스를 사용하여 이미지 선택
  3. 마우스 오른쪽 버튼을 클릭하여 컨텍스트 메뉴 열기
  4. Move to split > Train, Validation 또는 Test를 선택합니다.

그리드 뷰에서 분할 필터 탭으로 이미지를 드래그 앤 드롭할 수도 있습니다.

Train/Val 분할 구성

모든 이미지를 하나의 데이터셋에 업로드한 다음, 일괄 분할 이동을 사용하여 하위 집합을 train, validation 및 test 분할로 구성하십시오.

분할 재배포#

사용자 지정 비율을 사용하여 train, validation 및 test 분할에 걸쳐 모든 이미지를 재배포합니다:

  1. 데이터셋 툴바의 split bar를 클릭하여 Redistribute Splits 대화 상자를 엽니다.
  2. 아래 방법 중 하나를 사용하여 분할 백분율을 조정합니다.
  3. 실시간 이미지 수 미리보기를 검토하여 배포를 확인합니다.
  4. Apply를 클릭하여 백분율에 따라 모든 이미지를 무작위로 재할당합니다.

Ultralytics Platform Datasets Split Redistribution Dialog 이 대화 상자는 목표 분할 비율을 설정하는 세 가지 방법을 제공합니다:

메서드설명
Drag색상 세그먼트 사이의 핸들을 드래그하여 분할 경계를 시각적으로 조정합니다.
Type모든 분할의 백분율 입력을 편집합니다(다른 두 분할은 비례적으로 자동 재조정됩니다).
Auto한 번의 클릭으로 80/20 train/validation 분할을 즉시 설정하고 test 분할을 0%로 설정합니다.

실시간 미리보기를 통해 적용하기 전에 각 분할에 몇 개의 이미지가 포함될지 정확하게 확인할 수 있습니다.

빠른 80/20 분할

Auto 버튼을 클릭하여 권장되는 80/20 train/validation 분할을 즉시 설정하십시오. 이는 학습에 가장 일반적인 비율입니다.

일괄 삭제#

여러 이미지를 한 번에 삭제합니다:

  1. 테이블 뷰에서 이미지 선택
  2. 마우스 우클릭 후 Delete을 선택합니다.
  3. 삭제 확인

데이터셋 URI#

ul:// URI 형식을 사용하여 Platform 데이터셋을 참조합니다(Using Platform Datasets 참조):

ul://username/datasets/dataset-slug

데이터셋 또는 모델 웹 URL을 직접 붙여넣을 수도 있습니다(예: https://platform.ultralytics.com/username/datasets/dataset-slug); 자동으로 ul:// URI로 다시 작성됩니다. 데이터셋 목록을 전달하면 각 데이터셋을 차례대로 하나의 베이스 모델에 대해 미세 조정합니다(예: model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"])).

이 URI를 사용하여 어디서나 모델을 학습시키십시오:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Platform 데이터로 어디서나 학습

ul:// URI는 모든 환경에서 작동합니다:

  • 로컬 머신: 하드웨어에서 학습, 데이터 자동 다운로드
  • Google Colab: 노트북에서 Platform 데이터셋에 액세스
  • 원격 서버: 전체 데이터셋 액세스 권한을 가지고 클라우드 VM에서 학습

사용 가능한 라이선스#

Platform은 다음 데이터셋 라이선스를 지원합니다:

라이선스유형
없음라이선스 선택 안 됨
CC0-1.0퍼블릭 도메인
CC-BY-2.5허용적
CC-BY-4.0허용적
CC-BY-SA-4.0카피레프트
CC-BY-NC-4.0비상업적
CC-BY-NC-SA-4.0카피레프트
CC-BY-ND-4.0파생물 없음
CC-BY-NC-ND-4.0비상업적
Apache-2.0허용적
MIT허용적
AGPL-3.0카피레프트
GPL-3.0카피레프트
연구 전용제한됨
기타사용자 지정
카피레프트 라이선스

카피레프트 라이선스(AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-4.0)가 있는 데이터셋을 복제할 때, 복제본은 라이선스를 상속하며 라이선스 선택기가 잠깁니다.

가시성 설정#

데이터셋을 볼 수 있는 사람을 제어하십시오:

설정설명
Private귀하 및 권한이 부여된 워크스페이스 멤버가 액세스할 수 있습니다.
Public탐색(Explore) 페이지를 포함하여 누구나 볼 수 있습니다.

가시성은 토글 스위치를 사용하여 New Dataset 대화 상자에서 데이터셋을 생성할 때 설정됩니다. 공개 데이터셋은 Explore 페이지에 표시됩니다.

데이터셋 편집#

데이터셋 메타데이터는 데이터셋 페이지에서 직접 인라인으로 편집할 수 있으며 대화 상자가 필요하지 않습니다:

  • Name: 데이터셋 이름을 클릭하여 편집합니다. 변경 사항은 포커스가 벗어날 때(blur) 또는 Enter(으)로 자동 저장됩니다.
  • 설명: 설명을 클릭하거나 "Add a description..." 자리 표시자를 클릭하여 편집합니다. 변경 사항은 자동 저장됩니다.
  • 작업 유형: 작업 배지를 클릭하여 다른 작업 유형을 선택합니다.
  • 라이선스: 라이선스 선택기를 클릭하여 데이터셋 라이선스를 변경합니다.
작업 유형 변경

각 이미지는 모든 작업 유형에 대한 주석을 함께 저장합니다. 데이터셋 작업 유형을 변경하면 편집기에 표시되는 주석과 내보내기 및 학습에 포함되는 주석이 제어됩니다. 다른 작업 유형에 대한 주석은 데이터베이스에 보존되며 다시 전환하면 다시 나타납니다.

사용자 정의 메타데이터#

추가 작업을 열고 정보를 선택하여 다음 두 가지 섹션을 검토합니다:

  • Ultralytics 메타데이터: 데이터셋 ID, 소유자, 태스크, 이미지 및 어노테이션 개수, 스토리지 지역, 타임스탬프와 같은 읽기 전용 Platform 세부 정보
  • 사용자 정의 메타데이터: 출처, 캡처 조건, 고객 ID, 거버넌스 또는 기타 문맥 데이터를 위한 사용자의 JSON 객체

워크스페이스 뷰어는 메타데이터를 검사할 수 있으며, 편집 권한이 있는 멤버는 사용자 정의 메타데이터 객체를 교체할 수 있습니다. 직렬화된 메타데이터 객체는 500,000자로 제한되며, 각 최상위 키는 128자로 제한됩니다. 사용자 정의 메타데이터를 지우려면 빈 객체({})를 저장하십시오.

데이터셋 복제#

소유자가 아닌 공개 데이터셋을 볼 때 Clone Dataset을 클릭하여 복제 대화 상자를 엽니다. 대상 워크스페이스, 이름, 가시성, 라이선스를 검토한 후 복제를 확인합니다. 복사본에는 모든 이미지, 주석, 클래스 정의가 포함됩니다. 원본 공개 데이터셋은 기본 가시성이 공개인 워크스페이스에서 기본적으로 공개 상태로 유지되며, 엔터프라이즈 워크스페이스 복제본은 기본적으로 비공개로 설정됩니다. 원본 데이터셋에 카피레프트 라이선스가 있는 경우 복제본도 이를 상속하며 라이선스 선택기는 잠깁니다.

Star 및 공유#

  • Star: 별표 버튼을 클릭하여 데이터셋을 북마크합니다. 별표 수는 모든 사용자에게 표시됩니다.
  • 공유: 공개 데이터셋의 경우 공유 버튼을 클릭하여 링크를 복사하거나 소셜 플랫폼에 공유할 수 있습니다.

데이터셋 삭제#

더 이상 필요하지 않은 데이터셋 삭제:

  1. 데이터셋 헤더에서 Delete dataset 휴지통 아이콘을 클릭합니다.
  2. 대화 상자에서 확인: "이 작업은 [name]을(를) 휴지통으로 이동합니다. 30일 이내에 복원할 수 있습니다."
휴지통 및 복원

삭제된 데이터셋은 영구 삭제되지 않고 휴지통으로 이동됩니다. Settings > Trash에서 30일 이내에 복원할 수 있습니다.

데이터셋으로 학습#

데이터셋에서 직접 학습 시작:

  1. 데이터셋 페이지에서 New Model을 클릭합니다.
  2. 프로젝트 선택 또는 새로 만들기
  3. 학습 파라미터 구성
  4. 학습 시작
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

자세한 내용은 Cloud Training을 참조하세요.

FAQ#

업로드 후 데이터는 어떻게 처리됩니까?#

데이터는 선택한 리전(US, EU 또는 AP)에서 처리 및 저장됩니다. 이미지는 다음과 같이 처리됩니다:

  1. 형식 및 크기 검증
  2. 최소 치수가 28px 미만인 경우 거부됨
  3. 4096px보다 큰 경우 정규화(가로세로 비율 유지; 최적화된 저장소를 위해 인코딩)
  4. XXH3-128 해싱을 사용하는 콘텐츠 주소 지정 가능 저장소(CAS)에 저장
  5. 빠른 탐색을 위해 256px WebP 형식의 썸네일 생성

저장소는 어떻게 작동합니까?#

Ultralytics Platform은 효율적인 저장을 위해 **콘텐츠 주소 지정 가능 저장소(CAS)**를 사용합니다:

  • 중복 제거(Deduplication): 동일한 데이터 영역 내의 동일한 이미지 바이트는 동일한 기본 객체를 재사용합니다.
  • 무결성: XXH3-128 해싱을 통해 데이터 무결성 보장
  • 효율성: 복제본은 이미지 바이트를 복사하는 대신 CAS 객체를 재사용하며, 대상 워크스페이스의 스토리지 할당량에는 계속 합산됩니다.
  • 리전: 데이터는 선택한 리전(US, EU 또는 AP) 내에 보관됨

기존 데이터셋에 이미지를 추가할 수 있습니까?#

네. 파일을 데이터셋 갤러리에 드래그하거나 페이지 헤더의 업로드 아이콘을 클릭하면 브라우저의 기본 파일 선택기가 바로 열립니다. 처리가 완료되면 새로운 통계가 자동으로 계산됩니다.

이미지를 분할(split) 간에 어떻게 이동합니까?#

일괄 분할 이동 기능을 사용하십시오:

  1. 테이블 뷰에서 이미지 선택
  2. 마우스 우클릭 후 Move to split을 선택합니다.
  3. 대상 분할(Train, Validation 또는 Test) 선택

어떤 라벨 형식이 지원됩니까?#

Ultralytics Platform은 YOLO 라벨, COCO JSON, Ultralytics NDJSON 및 원시 이미지 업로드를 지원합니다:

정규화된 좌표(0-1 범위)가 포함된 이미지당 하나의 .txt 파일:

작업형식예시
탐지(Detect)class cx cy w h0 0.5 0.5 0.2 0.3
세그멘테이션(Segment)class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
포즈(Pose)class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
OBB(방향성 경계 상자)class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
분류(Classify)디렉터리 구조train/cats/, train/dogs/

포즈 가시성 플래그: 0=라벨 없음, 1=라벨링되었으나 가려짐, 2=라벨링되었고 보임.

동일한 데이터셋에 여러 작업 유형을 주석 달 수 있습니까?#

네. 각 이미지는 6가지 태스크 유형(detect, segment, semantic, classify, pose, OBB)에 대한 모든 어노테이션을 함께 저장합니다. 기존 어노테이션을 잃지 않고 언제든지 데이터셋의 활성 태스크 유형을 전환할 수 있습니다. 활성 태스크 유형과 일치하는 어노테이션만 편집기에 표시되며 내보내기 및 학습에 포함됩니다. 다른 태스크의 어노테이션은 보존되며 다시 전환할 때 다시 나타납니다.

댓글