Ultralytics YOLO27:
Get Started

데이터셋 개요#

Ultralytics는 탐지, 인스턴스 분할, 시맨틱 분할, 깊이 추정, 분류, 자세 추정, 방향 바운딩 박스(OBB)와 같은 컴퓨터 비전 작업을 지원하기 위해 다양한 데이터셋을 제공합니다. 아래에는 주요 Ultralytics 데이터셋 목록과 각 컴퓨터 비전 작업 및 해당 데이터셋의 요약이 나와 있습니다. 추적 모드는 추적기 전용 학습 없이 탐지, 분할, 자세 및 OBB 모델을 기반으로 실행됩니다. 자세한 내용은 추적 데이터셋을 참조하세요.



시청: Ultralytics 데이터셋 개요

객체 탐지#

바운딩 박스 객체 탐지는 이미지 속 각 객체 주위에 바운딩 박스를 그려 객체를 탐지하고 위치를 지정하는 컴퓨터 비전 기법입니다.

  • African-wildlife: 버팔로, 코끼리, 코뿔소, 얼룩말을 포함한 아프리카 야생동물 이미지로 구성된 데이터셋입니다.
  • Argoverse: 풍부한 어노테이션이 포함된 도시 환경의 3D 추적 및 모션 예측 데이터셋입니다.
  • Brain-tumor: 종양의 존재 여부, 위치, 특성에 관한 세부 정보가 포함된 MRI 또는 CT 스캔 이미지로 구성된 뇌종양 탐지 데이터셋입니다.
  • COCO: 컨텍스트 내 일반 객체(COCO)는 80개 객체 범주를 포함하는 대규모 객체 탐지, 분할 및 캡셔닝 데이터셋입니다.
  • COCO8: COCO train2017의 처음 8개 이미지(학습용 4개, 검증용 4개)로 구성된 소규모 하위 집합으로, 빠른 테스트에 적합합니다.
  • COCO8-Grayscale: RGB를 그레이스케일로 변환해 만든 COCO8의 그레이스케일 버전으로, 단일 채널 모델 평가에 유용합니다.
  • COCO8-Multispectral: RGB 파장을 보간해 만든 COCO8의 10채널 다중 스펙트럼 버전으로, 스펙트럼 인식 모델 평가에 유용합니다.
  • COCO12-Formats: 이미지 로딩 파이프라인 검증을 위해 지원되는 12가지 이미지 형식(AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WebP)을 모두 포함한 12개 이미지 테스트 데이터셋입니다.
  • COCO128: COCO train2017의 처음 128개 이미지로 구성된 소규모 하위 집합으로, 테스트에 적합합니다.
  • Construction-PPE: 헬멧, 조끼, 장갑, 안전화, 고글과 같은 주요 안전 장비와 장비 미착용 여부를 라벨링한 건설 현장 이미지 데이터셋입니다. 규정 준수 및 작업자 보호를 위한 AI 모델 개발을 지원합니다.
  • Global Wheat 2020: Global Wheat Challenge 2020을 위해 밀 이삭 이미지를 포함한 데이터셋입니다.
  • HomeObjects-3K: 일반적인 가정용품 12종이 포함된 실내 장면 어노테이션 데이터셋으로, 스마트 홈 시스템, 로보틱스, 증강 현실용 컴퓨터 비전 모델을 개발하고 테스트하는 데 적합합니다.
  • KITTI: 스테레오, LiDAR, GPS/IMU 입력이 포함된 잘 알려진 자율 주행 데이터셋으로, 다양한 도로 장면에서 2D 객체 탐지에 사용됩니다.
  • LVIS: 1,203개 객체 범주를 포함하는 대규모 객체 탐지 및 인스턴스 분할 데이터셋입니다.
  • Medical-pills: 의약품 품질 관리, 분류, 업계 표준 준수 확인 등의 작업을 지원하도록 설계된 의약품 알약 라벨링 이미지 데이터셋입니다.
  • Objects365: 365개 객체 범주와 170만 개 이상의 어노테이션 이미지로 구성된 고품질 대규모 객체 탐지 데이터셋입니다.
  • OpenImagesV7: Google이 제공하는 포괄적인 데이터셋으로, 학습 이미지 170만 개와 검증 이미지 4만 2천 개를 포함합니다.
  • RF100: 포괄적인 모델 평가를 위해 7개 이미지 도메인에 걸친 100개 데이터셋으로 구성된 다양한 객체 탐지 벤치마크입니다.
  • Signature: 서명이 어노테이션된 다양한 문서 이미지 데이터셋으로, 문서 검증 및 사기 탐지 연구를 지원합니다.
  • SKU-110K: 1만 1천 개가 넘는 이미지와 170만 개의 바운딩 박스를 포함하는 소매 환경의 고밀도 객체 탐지 데이터셋입니다.
  • TT100K: Tsinghua-Tencent 100K 교통 표지판 데이터셋으로, 221개 표지판 범주에 걸친 스트리트 뷰 이미지 16,817개를 포함합니다.
  • VisDrone: 드론 촬영 이미지로 구성된 객체 탐지 및 다중 객체 추적 데이터셋으로, 1만 개가 넘는 이미지와 비디오 시퀀스를 포함합니다.
  • VOC: 객체 클래스 20개와 이미지 2만 1천 개 이상을 포함하는 객체 탐지 및 분할용 Pascal 시각 객체 클래스(VOC) 데이터셋입니다.
  • xView: 60개 객체 범주와 100만 개가 넘는 어노테이션 객체를 포함하는 항공 이미지 객체 탐지 데이터셋입니다.

인스턴스 분할#

인스턴스 분할은 이미지 속 객체를 픽셀 수준에서 식별하고 위치를 지정하는 컴퓨터 비전 기법입니다. 각 픽셀의 클래스만 분류하는 시맨틱 분할과 달리, 인스턴스 분할은 같은 클래스에 속한 개별 인스턴스를 구분합니다.

  • Carparts-seg: 차량 부품 식별을 위해 특별히 구축한 데이터셋으로, 설계, 제조, 연구 요구 사항을 지원합니다. 객체 탐지와 분할 작업에 모두 사용할 수 있습니다.
  • COCO: 20만 개가 넘는 라벨링 이미지로 구성된 대규모 데이터셋으로, 객체 탐지, 분할, 캡셔닝 작업을 위해 설계되었습니다.
  • COCO8-seg: 분할 어노테이션이 포함된 COCO 이미지 8개 하위 집합으로 구성된 소규모 인스턴스 분할 작업용 데이터셋입니다.
  • COCO128-seg: 분할 어노테이션이 포함된 COCO 이미지 128개 하위 집합으로 구성된 소규모 인스턴스 분할 작업용 데이터셋입니다.
  • Crack-seg: 도로와 벽의 균열 탐지를 위해 특별히 제작된 데이터셋으로, 객체 탐지 및 분할 작업에 모두 적용할 수 있습니다.
  • Package-seg: 창고나 산업 현장의 패키지 식별에 맞춰 구성된 데이터셋으로, 객체 탐지 및 분할 애플리케이션에 모두 적합합니다.

시맨틱 분할#

시맨틱 분할은 이미지의 모든 픽셀에 클래스 라벨을 할당하여 자율 주행, 장면 파싱, 토지 피복 매핑 등의 애플리케이션에 사용할 수 있는 조밀한 장면 맵을 생성합니다.

  • Cityscapes: 학습 클래스 19개로 구성된 도시 거리 장면 시맨틱 분할 데이터셋입니다.
  • Cityscapes8: 시맨틱 분할 파이프라인을 빠르게 확인할 수 있는 Cityscapes 이미지 8개로 구성된 소규모 하위 집합입니다.
  • ADE20K: 시맨틱 클래스 150개를 포함하는 장면 파싱 데이터셋입니다.

깊이 추정#

단안 깊이 추정은 단일 RGB 이미지에서 픽셀별 깊이 맵을 미터 단위로 예측하며, 3D 장면 재구성, 로봇 내비게이션, AR/VR 애플리케이션을 지원합니다.

  • Depth8: 파이프라인을 빠르게 확인할 수 있는 SUN RGB-D 이미지 8개로 구성된 소규모 하위 집합입니다.
  • ARKitScenes: Apple ARKit LiDAR로 캡처한 실제 실내 RGB-D 데이터로, 가장 큰 실제 학습 데이터 소스입니다.
  • SUN RGB-D: 서로 다른 네 가지 RGB-D 센서로 캡처한 실제 실내 장면입니다.
  • DIODE: 측량용 레이저 스캐너로 수집한 실내외 고밀도 깊이 데이터입니다.
  • Hypersim: 픽셀별 깊이가 완벽하게 제공되는 사실적인 합성 실내 장면입니다.
  • TartanAir: 약 80m까지의 고밀도 깊이 데이터가 포함된 합성 AirSim 환경입니다.
  • Virtual KITTI 2: 고밀도 깊이 데이터가 포함된 KITTI 주행 장면의 합성 재현 데이터입니다.
  • KITTI: Velodyne LiDAR 깊이 데이터가 포함된 실제 야외 자율 주행 장면으로, KITTI Eigen 벤치마크이기도 합니다.
  • ImageNet(의사 라벨링): 증류를 위한 Depth Anything 3 의사 라벨이 포함된 ImageNet-1K 이미지입니다.
  • NYU Depth V2: Microsoft Kinect v1으로 캡처한 표준 실내 깊이 벤치마크입니다.
  • ETH3D: 정밀도가 높은 실내외 레이저 스캐너 벤치마크입니다.
  • Make3D: 분포 외 야외 캠퍼스 벤치마크입니다.
  • iBims-1: 깊이 경계와 평면 표면을 위한 고품질 실내 벤치마크입니다.

분류#

이미지 분류는 시각적 콘텐츠를 바탕으로 이미지를 하나 이상의 사전 정의된 클래스나 범주에 분류하는 컴퓨터 비전 작업입니다.

  • Caltech 101: 이미지 분류 작업을 위해 객체 범주 101개의 이미지를 포함하는 데이터셋입니다.
  • Caltech 256: 객체 범주 256개와 더 까다로운 이미지를 포함하는 Caltech 101의 확장 버전입니다.
  • CIFAR-10: 10개 클래스의 32x32 컬러 이미지 6만 개로 구성되며, 클래스마다 이미지 6천 개를 포함하는 데이터셋입니다.
  • CIFAR-100: 객체 범주 100개와 클래스당 이미지 600개를 포함하는 CIFAR-10의 확장 버전입니다.
  • Fashion-MNIST: 이미지 분류 작업을 위해 패션 범주 10개의 그레이스케일 이미지 7만 장으로 구성된 데이터셋입니다.
  • ImageNet: 이미지 1,400만 개 이상과 범주 2만 개를 포함하는 대규모 객체 탐지 및 이미지 분류 데이터셋입니다.
  • ImageNet-10: 더 빠른 실험과 테스트를 위해 범주 10개로 구성한 ImageNet의 소규모 하위 집합입니다.
  • Imagenette: 빠른 학습과 테스트를 위해 쉽게 구분할 수 있는 클래스 10개를 포함한 ImageNet의 소규모 하위 집합입니다.
  • Imagewoof: 이미지 분류 작업을 위해 개 품종 범주 10개를 포함하는 더 까다로운 ImageNet 하위 집합입니다.
  • MNIST: 이미지 분류 작업을 위한 손글씨 숫자 그레이스케일 이미지 7만 장으로 구성된 데이터셋입니다.
  • MNIST160: MNIST 학습 및 테스트 분할에서 숫자(0~9)마다 처음 8개 이미지를 가져온 데이터셋으로, 총 160개 이미지로 구성됩니다.

자세 추정#

자세 추정은 카메라 또는 월드 좌표계를 기준으로 객체의 자세를 파악하는 기법입니다. 여기에는 객체, 특히 사람이나 동물의 키포인트 또는 관절을 식별하는 과정이 포함됩니다.

  • COCO: 자세 추정 작업을 위해 설계된 사람 자세 어노테이션이 포함된 대규모 데이터셋입니다.
  • COCO8-pose: 사람 자세 어노테이션이 포함된 COCO 이미지 8개 하위 집합으로 구성된 소규모 자세 추정 작업용 데이터셋입니다.
  • Dog-pose: 개에 초점을 맞춘 약 8,500개 이미지로 구성되고 개마다 24개 키포인트가 어노테이션된 포괄적인 자세 추정 작업용 데이터셋입니다.
  • Hand-Keypoints: 사람 손에 초점을 맞춘 2만 6천 개 이상의 이미지로 구성되고 손마다 21개 키포인트가 어노테이션된 간결한 자세 추정 작업용 데이터셋입니다.
  • Tiger-pose: 호랑이에 초점을 맞춘 이미지 263개로 구성되고 호랑이마다 12개 키포인트가 어노테이션된 소규모 자세 추정 작업용 데이터셋입니다.

방향성 경계 상자(OBB)#

방향 바운딩 박스(OBB)는 회전된 바운딩 박스를 사용해 이미지 속 기울어진 객체를 탐지하는 컴퓨터 비전 기법으로, 항공 및 위성 이미지에 자주 적용됩니다. 기존 바운딩 박스와 달리 OBB는 다양한 방향의 객체를 더 잘 감쌀 수 있습니다.

  • DOTA-v2: 170만 개 인스턴스와 11,268개 이미지로 구성된 널리 사용되는 OBB 항공 이미지 데이터셋입니다.
  • DOTA8: DOTAv1 분할 세트의 처음 8개 이미지(학습용 4개, 검증용 4개)로 구성된 소규모 하위 집합으로, 빠른 테스트에 적합합니다.
  • DOTA128: 학습 및 검증용 이미지 128개를 포함하는 DOTA 데이터셋의 128개 이미지 하위 집합으로, OBB 모델 테스트에 적합한 규모와 다양성의 균형을 제공합니다.

새 데이터셋 기여#

새 데이터셋을 기여하려면 기존 인프라와 잘 부합하는지 확인하기 위해 몇 가지 단계를 거쳐야 합니다. 필요한 단계는 다음과 같습니다:



시청: Ultralytics 데이터셋에 기여하는 방법

새 데이터셋 기여 단계#

  1. 이미지 수집: 데이터셋에 포함할 이미지를 수집합니다. 공개 데이터베이스나 자체 컬렉션 등 다양한 출처에서 이미지를 모을 수 있습니다.

  2. 이미지 어노테이션: 작업에 따라 이 이미지에 바운딩 박스, 세그먼트 또는 키포인트를 어노테이션합니다.

  3. 어노테이션 내보내기: Ultralytics가 지원하는 YOLO *.txt 파일 형식으로 어노테이션을 변환합니다.

  4. 데이터셋 구성: 데이터셋을 올바른 폴더 구조로 정리합니다. 최상위 디렉터리로 images/과 labels/이 있어야 하며, 각 디렉터리 안에는 train/와 val/ 하위 디렉터리가 있어야 합니다.

    dataset/
    ├── images/
    │   ├── train/
    │   └── val/
    └── labels/
        ├── train/
        └── val/
  5. data.yaml 파일 만들기: 데이터셋의 루트 디렉터리에 데이터셋, 클래스 및 기타 필요한 정보를 설명하는 data.yaml 파일을 만듭니다.

  6. 이미지 최적화(선택 사항): 더 효율적으로 처리할 수 있도록 데이터셋 크기를 줄이려면 아래 코드를 사용해 이미지를 최적화할 수 있습니다. 필수 작업은 아니지만 데이터셋 크기를 줄이고 다운로드 속도를 높이는 데 권장됩니다.

  7. 데이터셋 압축: 전체 데이터셋 폴더를 zip 파일로 압축합니다.

  8. 문서 작성 및 PR 제출: 데이터셋과 기존 프레임워크에 통합되는 방식을 설명하는 문서 페이지를 작성합니다. 그런 다음 Pull Request (PR)를 제출합니다. PR 제출 방법에 대한 자세한 내용은 Ultralytics 기여 가이드라인을 참조하세요.

데이터셋 최적화 및 압축 예제 코드#

데이터셋 최적화 및 압축
from pathlib import Path

from ultralytics.data.utils import compress_one_image
from ultralytics.utils.downloads import zip_directory

# 데이터셋 디렉터리 정의
path = Path("path/to/dataset")

# 데이터셋 이미지 최적화(선택 사항)
for f in path.rglob("*.jpg"):
    compress_one_image(f)

# 'path/to/dataset.zip'으로 데이터셋 압축
zip_directory(path)

이 단계를 따르면 Ultralytics의 기존 구조와 잘 통합되는 새 데이터셋을 기여할 수 있습니다.

자주 묻는 질문#

  • Ultralytics는 객체 탐지를 위한 다양한 데이터셋을 지원합니다. 예를 들면 다음과 같습니다.

    • COCO: 80개 객체 카테고리를 포함하는 대규모 객체 탐지, 분할 및 캡션 데이터셋입니다.
    • LVIS: 1,203개 객체 카테고리를 포함하며, 보다 세분화된 객체 탐지 및 분할을 위해 설계된 방대한 데이터셋입니다.
    • Argoverse: 풍부한 어노테이션이 포함된 도시 환경의 3D 추적 및 모션 예측 데이터셋입니다.
    • VisDrone: 드론 촬영 이미지의 객체 탐지 및 다중 객체 추적 데이터가 포함된 데이터셋입니다.
    • SKU-110K: 11K개 이상의 이미지로 소매 환경의 밀집 객체 탐지를 다루는 데이터셋입니다.

    이러한 데이터셋은 다양한 객체 탐지 애플리케이션을 위한 견고한 Ultralytics YOLO 모델의 학습을 지원합니다.

  • 새 데이터셋을 기여하려면 다음과 같은 여러 단계를 거쳐야 합니다.

    1. 이미지 수집: 공개 데이터베이스나 개인 컬렉션에서 이미지를 수집합니다.
    2. 이미지 어노테이션: 작업에 따라 바운딩 박스, 세그먼트 또는 키포인트를 지정합니다.
    3. 어노테이션 내보내기: 어노테이션을 YOLO *.txt 형식으로 변환합니다.
    4. 데이터셋 구성: images/ 및 labels/ 디렉터리를 사용하고, 각 디렉터리 안에 train/ 및 val/ 하위 디렉터리를 배치하는 폴더 구조를 사용합니다.
    5. data.yaml 파일 생성: 데이터셋 설명, 클래스 및 기타 관련 정보를 포함합니다.
    6. 이미지 최적화(선택 사항): 효율성을 높이기 위해 데이터셋 크기를 줄입니다.
    7. 데이터셋 압축: 데이터셋을 zip 파일로 압축합니다.
    8. 문서 작성 및 PR 제출: 데이터셋을 설명하고 Ultralytics 기여 가이드라인에 따라 Pull Request를 제출합니다.

    자세한 가이드는 새 데이터셋 기여하기를 참조하세요.

  • Ultralytics Platform은 다음과 같은 데이터셋 관리 및 분석 기능을 제공합니다.

    • 간편한 데이터셋 관리: 한곳에서 데이터셋을 업로드하고, 구성하고, 관리합니다.
    • 즉시 학습 통합: 추가 설정 없이 업로드한 데이터셋을 모델 학습에 바로 사용합니다.
    • 시각화 도구: 데이터셋 이미지와 어노테이션을 탐색하고 시각화합니다.
    • 데이터셋 분석: 데이터셋의 분포와 특성에 대한 인사이트를 얻습니다.

    이 플랫폼은 데이터셋 관리에서 모델 학습으로 이어지는 과정을 간소화하여 전체 프로세스의 효율성을 높입니다. Ultralytics Platform 데이터셋에 대해 자세히 알아보세요.

  • Ultralytics YOLO 모델은 컴퓨터 비전 작업을 위한 다음과 같은 여러 고유 기능을 제공합니다.

    • 실시간 성능: 시간에 민감한 애플리케이션을 위한 고속 추론 및 학습 기능입니다.
    • 다목적성: 탐지, 인스턴스 분할, 시맨틱 분할, 깊이 추정, 분류, 포즈 추정 및 방향성 바운딩 박스(OBB) 작업을 통합된 프레임워크에서 지원합니다.
    • 사전 학습된 모델: 다양한 애플리케이션에서 사용할 수 있는 고성능 사전 학습 모델을 제공하여 학습 시간을 단축합니다.
    • 폭넓은 커뮤니티 지원: 문제 해결과 개발을 위한 활발한 커뮤니티와 포괄적인 문서를 제공합니다.
    • 간편한 통합: 기존 프로젝트 및 워크플로에 통합할 수 있는 간단한 API를 제공합니다.

    Ultralytics 모델 페이지에서 YOLO 모델에 대해 자세히 알아보세요.

  • Ultralytics 도구를 사용해 데이터셋을 최적화하고 압축하려면 다음 예제 코드를 따르세요.

    데이터셋 최적화 및 압축
    from pathlib import Path
    
    from ultralytics.data.utils import compress_one_image
    from ultralytics.utils.downloads import zip_directory
    
    # 데이터셋 디렉터리 정의
    path = Path("path/to/dataset")
    
    # 데이터셋 이미지 최적화(선택 사항)
    for f in path.rglob("*.jpg"):
        compress_one_image(f)
    
    # 'path/to/dataset.zip'으로 데이터셋 압축
    zip_directory(path)

    이 프로세스는 데이터셋 크기를 줄여 저장 효율성을 높이고 다운로드 속도를 향상하는 데 도움이 됩니다. 데이터셋 최적화 및 압축 방법에 대해 자세히 알아보세요.

댓글