데이터셋 개요#
Ultralytics는 객체 탐지, 인스턴스 세그멘테이션, 시맨틱 세그멘테이션, 깊이 추정, 분류, 포즈 추정 및 방향성 바운딩 박스(OBB)와 같은 컴퓨터 비전 작업을 지원하기 위해 다양한 데이터셋을 제공합니다. 아래에는 주요 Ultralytics 데이터셋 목록과 각 컴퓨터 비전 작업 및 해당 데이터셋에 대한 요약이 나와 있습니다. 트랙 모드는 트래커별 학습 없이 탐지, 세그멘테이션, 포즈 및 OBB 모델 위에서 실행됩니다. 자세한 내용은 트래킹 데이터셋을 참조하십시오.
Watch: Ultralytics Datasets Overview
Object Detection#
바운딩 박스 객체 탐지는 이미지의 각 객체 주위에 바운딩 박스를 그려 객체를 탐지하고 위치를 식별하는 컴퓨터 비전 기법입니다.
- African-wildlife: 물소, 코끼리, 코뿔소, 얼룩말을 비롯한 아프리카 야생동물 이미지가 포함된 데이터셋입니다.
- Argoverse: 풍부한 어노테이션이 포함된 도시 환경의 3D 트래킹 및 모션 예측 데이터셋입니다.
- Brain-tumor: 종양의 존재 여부, 위치 및 특성에 대한 세부 정보와 MRI 또는 CT 스캔 이미지가 포함된 뇌종양 탐지용 데이터셋입니다.
- COCO: 문맥 속 일반 객체(COCO)는 80개 객체 카테고리를 포함하는 대규모 객체 탐지, 세그멘테이션 및 캡셔닝 데이터셋입니다.
- COCO8: COCO train2017의 처음 8개 이미지 중 더 작은 서브셋으로, 4개는 학습용, 4개는 검증용이며 빠른 테스트에 적합합니다.
- COCO8-Grayscale: RGB를 그레이스케일로 변환하여 생성한 COCO8의 그레이스케일 버전으로, 단일 채널 모델 평가에 유용합니다.
- COCO8-Multispectral: RGB 파장을 보간하여 생성한 COCO8의 10채널 멀티스펙트럴 버전으로, 스펙트럼을 고려한 모델 평가에 유용합니다.
- COCO12-Formats: 이미지 로딩 파이프라인을 검증하기 위한 12가지 지원 이미지 포맷(AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WebP)을 포함하는 12개 이미지 테스트 데이터셋입니다.
- COCO128: COCO train2017의 첫 128개 이미지로 구성된 소규모 서브셋으로, 테스트에 적합합니다.
- Construction-PPE: 헬멧, 조끼, 장갑, 부츠, 보안경과 같은 주요 안전 장비와 장비 누락 라벨이 어노테이션된 건설 현장 이미지 데이터셋으로, 규정 준수 및 작업자 보호를 위한 AI 모델 개발을 지원합니다.
- Global Wheat 2020: Global Wheat Challenge 2020을 위한 밀 이삭 이미지 데이터셋입니다.
- HomeObjects-3K: 12가지 일반 가정용 물품이 포함된 어노테이션된 실내 장면 데이터셋으로, 스마트 홈 시스템, 로보틱스 및 증강 현실용 컴퓨터 비전 모델 개발과 테스트에 적합합니다.
- KITTI: 스테레오, LiDAR 및 GPS/IMU 입력을 특징으로 하며 다양한 도로 장면에서의 2D 객체 검출에 사용되는 잘 알려진 자율주행 데이터셋입니다.
- LVIS: 1,203개 객체 카테고리를 포함하는 대규모 객체 탐지, 세그멘테이션 및 캡셔닝 데이터셋입니다.
- Medical-pills: 의약품 품질 관리, 분류 및 산업 표준 준수 확인과 같은 작업을 지원하도록 설계된, 라벨이 지정된 의약품 알약 이미지 데이터셋입니다.
- Objects365: 365개 객체 카테고리와 600K개 이상의 어노테이션된 이미지를 포함하는 고품질 대규모 객체 탐지 데이터셋입니다.
- OpenImagesV7: Google이 제공하는 종합 데이터셋으로, 1.7M개의 학습 이미지와 42k개의 검증 이미지가 포함되어 있습니다.
- RF100: 종합적인 모델 평가를 위해 7개 이미지 도메인에 걸친 100개 데이터셋으로 구성된 다양한 객체 탐지 벤치마크입니다.
- Signature: 어노테이션된 서명이 포함된 다양한 문서 이미지 데이터셋으로, 문서 검증 및 사기 탐지 연구를 지원합니다.
- SKU-110K: 11K개 이상의 이미지와 170만 개의 바운딩 박스가 포함된 소매 환경의 밀집 객체 탐지 데이터셋입니다.
- TT100K: 221개 표지판 카테고리에 걸쳐 16,817개의 거리 뷰 이미지를 포함하는 칭화-텐센트 100K 교통 표지판 데이터셋입니다.
- VisDrone: 드론으로 촬영한 이미지에서 얻은 객체 탐지 및 다중 객체 트래킹 데이터셋으로, 10K개 이상의 이미지와 비디오 시퀀스가 포함되어 있습니다.
- VOC: 20개 객체 클래스와 11K개 이상의 이미지가 포함된 객체 탐지 및 세그멘테이션용 Pascal 시각 객체 클래스(VOC) 데이터셋입니다.
- xView: 60개 객체 카테고리와 100만 개 이상의 어노테이션된 객체가 포함된 항공·위성 이미지 객체 탐지용 데이터셋입니다.
인스턴스 세그멘테이션#
인스턴스 세그멘테이션은 이미지에서 객체를 픽셀 수준으로 식별하고 위치를 파악하는 컴퓨터 비전 기법입니다. 각 픽셀을 분류하기만 하는 시맨틱 세그멘테이션과 달리, 인스턴스 세그멘테이션은 동일한 클래스에 속하는 서로 다른 인스턴스를 구분합니다.
- Carparts-seg: 차량 부품 식별을 위해 특수 제작된 데이터셋으로, 설계, 제조 및 연구 요구 사항을 지원합니다. 객체 탐지와 세그멘테이션 작업 모두에 사용할 수 있습니다.
- COCO: 객체 탐지, 세그멘테이션 및 캡셔닝 작업을 위해 설계된 대규모 데이터셋으로, 200K개 이상의 라벨링된 이미지가 포함되어 있습니다.
- COCO8-seg: 세그멘테이션 어노테이션이 포함된 COCO 이미지 8개 서브셋으로 구성된 인스턴스 세그멘테이션 작업용 소규모 데이터셋입니다.
- COCO128-seg: 세그멘테이션 어노테이션이 포함된 COCO 이미지 128개 서브셋으로 구성된 인스턴스 세그멘테이션 작업용 소규모 데이터셋입니다.
- Crack-seg: 도로와 벽의 균열 탐지를 위해 특별히 제작된 데이터셋으로, 객체 탐지와 세그멘테이션 작업 모두에 적용할 수 있습니다.
- Package-seg: 창고 또는 산업 환경의 패키지 식별에 맞춰 설계된 데이터셋으로, 객체 탐지와 세그멘테이션 애플리케이션 모두에 적합합니다.
시맨틱 세그멘테이션#
시맨틱 세그멘테이션은 이미지의 모든 픽셀에 클래스 라벨을 할당하여 자율주행, 장면 파싱 및 토지 피복 매핑과 같은 애플리케이션을 위한 조밀한 장면 맵을 생성합니다.
- Cityscapes: 19개 학습 클래스가 포함된 도시 거리 장면 시맨틱 세그멘테이션 데이터셋입니다.
- Cityscapes8: 빠른 시맨틱 세그멘테이션 파이프라인 점검을 위한 Cityscapes 이미지 8개 규모의 소형 서브셋입니다.
- ADE20K: 150개 시맨틱 클래스가 포함된 장면 파싱 데이터셋입니다.
깊이 추정#
단안 깊이 추정은 단일 RGB 이미지에서 픽셀별 깊이 맵을 미터 단위로 예측하며, 3D 장면 재구성, 로봇 내비게이션 및 AR/VR 애플리케이션을 지원합니다.
- Depth8: 빠른 파이프라인 점검을 위한 SUN RGB-D 이미지 8개 규모의 소형 서브셋입니다.
- ARKitScenes: Apple ARKit LiDAR로 캡처한 실제 실내 RGB-D로, 가장 큰 실제 학습 소스입니다.
- SUN RGB-D: 네 가지 서로 다른 RGB-D 센서로 캡처한 실제 실내 장면입니다.
- DIODE: 측량 등급 레이저 스캐너에서 얻은 조밀한 실내 및 실외 깊이입니다.
- Hypersim: 완벽한 픽셀당 깊이를 가진 포토리얼리스틱 합성 실내 장면입니다.
- TartanAir: 최대 ~80m의 조밀한 깊이를 가진 합성 AirSim 환경입니다.
- Virtual KITTI 2: 조밀한 깊이를 가진 KITTI 주행 장면의 합성 재현입니다.
- KITTI: Velodyne LiDAR 깊이가 포함된 실제 야외 자율주행 장면이며, KITTI Eigen 벤치마크이기도 합니다.
- ImageNet (pseudo-labeled): 증류를 위한 Depth Anything 3사사 레이블이 포함된 ImageNet-1K 이미지입니다.
- NYU Depth V2: Microsoft Kinect v1으로 캡처한 표준 실내 깊이 벤치마크입니다.
- ETH3D: 고정밀 실내 및 실외 레이저 스캐너 벤치마크입니다.
- Make3D: 분포 외 실외 캠퍼스 벤치마크입니다.
- iBims-1: 깊이 모서리 및 평면 표면을 위한 고품질 실내 벤치마크입니다.
분류#
이미지 분류는 시각적 콘텐츠를 기반으로 이미지를 하나 이상의 사전 정의된 클래스 또는 카테고리로 분류하는 컴퓨터 비전 작업입니다.
- Caltech 101: 이미지 분류 작업을 위한 101개 객체 카테고리의 이미지가 포함된 데이터셋입니다.
- Caltech 256: 256개 객체 카테고리와 더 까다로운 이미지가 포함된 Caltech 101의 확장 버전입니다.
- CIFAR-10: 10개 클래스의 32x32 컬러 이미지 60K개로 구성되며, 클래스당 6K개의 이미지가 포함된 데이터셋입니다.
- CIFAR-100: 100개 객체 카테고리와 클래스당 600개 이미지가 포함된 CIFAR-10의 확장 버전입니다.
- Fashion-MNIST: 이미지 분류 작업을 위한 10개 패션 카테고리의 그레이스케일 이미지 70,000개로 구성된 데이터셋입니다.
- ImageNet: 1,400만 개 이상의 이미지와 20,000개 카테고리가 포함된 대규모 객체 탐지 및 이미지 분류 데이터셋입니다.
- ImageNet-10: 더 빠른 실험과 테스트를 위한 ImageNet의 10개 카테고리 소규모 서브셋입니다.
- Imagenette: 빠른 학습과 테스트를 위해 쉽게 구별할 수 있는 10개 클래스로 구성된 ImageNet의 소규모 서브셋입니다.
- Imagewoof: 이미지 분류 작업을 위해 10개 견종 카테고리로 구성된 ImageNet의 더 까다로운 서브셋입니다.
- MNIST: 이미지 분류 작업을 위한 손글씨 숫자 그레이스케일 이미지 70,000개 데이터셋입니다.
- MNIST160: MNIST train 및 test 분할에서 각 숫자(0-9)의 처음 8개 이미지로 구성됩니다. 데이터셋에는 총 160개의 이미지가 포함되어 있습니다.
포즈 추정#
포즈 추정은 카메라 또는 월드 좌표계에 대한 객체의 포즈를 파악하는 데 사용되는 기법입니다. 여기에는 특히 사람이나 동물과 같은 객체의 주요 지점 또는 관절을 식별하는 작업이 포함됩니다.
- COCO: 포즈 추정 작업을 위해 설계된 사람 포즈 어노테이션이 포함된 대규모 데이터셋입니다.
- COCO8-pose: 사람 포즈 어노테이션이 포함된 COCO 이미지 8개 서브셋으로 구성된 포즈 추정 작업용 소규모 데이터셋입니다.
- Dog-pose: 개에 초점을 맞춘 약 8,500개의 이미지로 구성되며, 개 한 마리당 24개의 키포인트가 어노테이션된 포즈 추정 작업용 종합 데이터셋입니다.
- Hand-Keypoints: 사람 손에 초점을 맞춘 26,000개 이상의 이미지로 구성되며, 손 하나당 21개의 키포인트가 어노테이션된 포즈 추정 작업용 간결한 데이터셋입니다.
- Tiger-pose: 호랑이에 초점을 맞춘 263개의 이미지로 구성되며, 호랑이 한 마리당 12개의 키포인트가 어노테이션된 포즈 추정 작업용 소형 데이터셋입니다.
방향성 바운딩 박스(OBB)#
방향성 바운딩 박스(OBB)는 회전된 바운딩 박스를 사용하여 이미지에서 각도가 있는 객체를 탐지하는 컴퓨터 비전 방법으로, 항공 및 위성 이미지에 자주 적용됩니다. 기존 바운딩 박스와 달리 OBB는 다양한 방향의 객체에 더 잘 맞출 수 있습니다.
- DOTA-v2: 170만 개의 인스턴스와 11,268개의 이미지가 포함된 인기 있는 OBB 항공 이미지 데이터셋입니다.
- DOTA8: DOTAv1 분할 세트의 처음 8개 이미지로 구성된 소규모 서브셋으로, 학습용 4개와 검증용 4개로 나뉘며 빠른 테스트에 적합합니다.
- DOTA128: 학습 및 검증용 이미지 128개로 구성된 DOTA 데이터셋의 128개 이미지 서브셋으로, OBB 모델 테스트에 적합한 규모와 다양성의 균형을 제공합니다.
새 데이터셋 기여#
새 데이터셋을 기여하려면 기존 인프라와 잘 맞도록 하기 위한 몇 가지 단계가 필요합니다. 필요한 단계는 다음과 같습니다.
Watch: How to Contribute to Ultralytics Datasets
새 데이터셋 기여 단계#
-
이미지 수집: 데이터셋에 포함할 이미지를 수집합니다. 공개 데이터베이스나 직접 수집한 자료 등 다양한 출처에서 가져올 수 있습니다.
-
이미지 어노테이션: 작업에 따라 이러한 이미지에 바운딩 박스, 세그먼트 또는 키포인트를 어노테이션합니다.
-
어노테이션 내보내기: 이러한 어노테이션을 Ultralytics가 지원하는 YOLO
*.txt파일 형식으로 변환합니다. -
데이터셋 구성: 데이터셋을 올바른 폴더 구조로 정리합니다. 최상위 디렉터리로
images/및labels/이 있어야 하며, 각 디렉터리 안에train/및val/하위 디렉터리가 있어야 합니다.dataset/ ├── images/ │ ├── train/ │ └── val/ └── labels/ ├── train/ └── val/ -
data.yaml파일 생성: 데이터셋의 루트 디렉터리에 데이터셋, 클래스 및 기타 필요한 정보를 설명하는data.yaml파일을 생성합니다. -
이미지 최적화(선택 사항): 보다 효율적인 처리를 위해 데이터셋 크기를 줄이려면 아래 코드를 사용하여 이미지를 최적화할 수 있습니다. 필수 사항은 아니지만 데이터셋 크기를 줄이고 다운로드 속도를 높이는 데 권장됩니다.
-
데이터셋 압축: 전체 데이터셋 폴더를 zip 파일로 압축합니다.
-
문서화 및 PR: 데이터셋과 기존 프레임워크에 통합되는 방식을 설명하는 문서 페이지를 생성합니다. 그런 다음 Pull Request(PR)를 제출합니다. PR 제출 방법에 대한 자세한 내용은 Ultralytics 기여 가이드라인을 참조하십시오.
데이터셋을 최적화하고 압축하는 예제 코드#
from pathlib import Path
from ultralytics.data.utils import compress_one_image
from ultralytics.utils.downloads import zip_directory
# Define dataset directory
path = Path("path/to/dataset")
# Optimize images in dataset (optional)
for f in path.rglob("*.jpg"):
compress_one_image(f)
# Zip dataset into 'path/to/dataset.zip'
zip_directory(path)이 단계를 따르면 기존 Ultralytics 구조와 원활하게 통합되는 새 데이터셋을 기여할 수 있습니다.
FAQ#
Ultralytics는 객체 탐지를 비롯한 다양한 데이터셋을 지원하며, 다음이 포함됩니다.
- COCO: 80개 객체 카테고리를 포함하는 대규모 객체 탐지, 세그멘테이션 및 캡셔닝 데이터셋입니다.
- LVIS: 보다 세분화된 객체 탐지 및 세그멘테이션을 위해 설계된 1,203개 객체 카테고리의 종합 데이터셋입니다.
- Argoverse: 풍부한 어노테이션이 포함된 도시 환경의 3D 트래킹 및 모션 예측 데이터셋입니다.
- VisDrone: 드론으로 촬영한 이미지에서 얻은 객체 탐지 및 다중 객체 트래킹 데이터셋입니다.
- SKU-110K: 11K개 이상의 이미지가 포함된 소매 환경의 밀집 객체 탐지 데이터셋입니다.
이러한 데이터셋은 다양한 객체 탐지 애플리케이션을 위한 강력한 Ultralytics YOLO 모델 학습을 지원합니다.
새 데이터셋을 기여하려면 몇 가지 단계가 필요합니다.
- 이미지 수집: 공개 데이터베이스 또는 개인 컬렉션에서 이미지를 수집합니다.
- 이미지 어노테이션: 작업에 따라 바운딩 박스, 세그먼트 또는 키포인트를 적용합니다.
- 어노테이션 내보내기: 어노테이션을 YOLO
*.txt형식으로 변환합니다. - 데이터셋 구성:
train/및val/디렉터리가 있고 각 디렉터리에images/및labels/하위 디렉터리가 포함된 폴더 구조를 사용합니다. data.yaml파일 생성: 데이터셋 설명, 클래스 및 기타 관련 정보를 포함합니다.- 이미지 최적화(선택 사항): 효율성을 위해 데이터셋 크기를 줄입니다.
- 데이터셋 압축: 데이터셋을 zip 파일로 압축합니다.
- 문서화 및 PR: 데이터셋을 설명하고 Ultralytics 기여 가이드라인에 따라 Pull Request를 제출합니다.
종합적인 가이드는 새 데이터셋 기여를 참조하십시오.
Ultralytics Platform은 다음을 비롯한 강력한 데이터셋 관리 및 분석 기능을 제공합니다.
- 원활한 데이터셋 관리: 한곳에서 데이터셋을 업로드, 구성 및 관리합니다.
- 즉각적인 학습 통합: 추가 설정 없이 업로드한 데이터셋을 모델 학습에 직접 사용합니다.
- 시각화 도구: 데이터셋 이미지와 주석을 탐색하고 시각화합니다.
- 데이터셋 분석: 데이터셋의 분포와 특성에 대한 인사이트를 얻습니다.
이 플랫폼은 데이터셋 관리부터 모델 학습까지의 전환 과정을 간소화하여 전체 프로세스를 더욱 효율적으로 만듭니다. Ultralytics Platform 데이터셋에 대해 자세히 알아보세요.
Ultralytics YOLO 모델은 컴퓨터 비전 작업을 위한 다음과 같은 여러 고유 기능을 제공합니다:
- 실시간 성능: 시간에 민감한 애플리케이션을 위한 고속 추론 및 학습 기능을 제공합니다.
- 다용도성: 통합 프레임워크에서 객체 검출, 인스턴스 세그멘테이션, 시맨틱 세그멘테이션, 깊이 추정, 분류 및 자세 추정 작업을 지원합니다.
- 사전 학습 모델: 다양한 애플리케이션을 위한 고성능 사전 학습 모델을 제공하여 학습 시간을 단축합니다.
- 폭넓은 커뮤니티 지원: 문제 해결 및 개발을 위한 활발한 커뮤니티와 종합적인 문서를 제공합니다.
- 간편한 통합: 기존 프로젝트 및 워크플로와 통합할 수 있는 간단한 API를 제공합니다.
Ultralytics 모델 페이지에서 YOLO 모델에 대해 자세히 알아보세요.
Ultralytics 도구를 사용하여 데이터셋을 최적화하고 압축하려면 다음 예제 코드를 따르세요:
데이터셋 최적화 및 압축from pathlib import Path from ultralytics.data.utils import compress_one_image from ultralytics.utils.downloads import zip_directory # Define dataset directory path = Path("path/to/dataset") # Optimize images in dataset (optional) for f in path.rglob("*.jpg"): compress_one_image(f) # Zip dataset into 'path/to/dataset.zip' zip_directory(path)이 프로세스는 데이터셋 크기를 줄여 더욱 효율적인 저장과 빠른 다운로드 속도를 지원합니다. 데이터셋 최적화 및 압축에 대해 자세히 알아보세요.