Ultralytics를 활용한 K-Fold 교차 검증#
소개#
본 종합 가이드는 Ultralytics 생태계 내에서 object detection 데이터셋을 위한 K-Fold 교차 검증 구현 방법을 설명합니다. YOLO detection 형식과 sklearn, pandas, PyYAML 같은 주요 Python 라이브러리를 활용하여 필요한 설정, 피처 벡터 생성 과정, K-Fold 데이터셋 분할 실행 방법을 안내해 드립니다.
프로젝트에서 Fruit Detection 데이터셋을 사용하든 커스텀 데이터 소스를 사용하든, 본 튜토리얼은 machine learning 모델의 신뢰성과 강건성을 높이기 위해 K-Fold Cross Validation을 이해하고 적용하는 데 도움을 드리는 것을 목표로 합니다. 이번 튜토리얼에서는 k=5개의 폴드를 사용하지만, 최적의 폴드 수는 데이터셋과 프로젝트의 세부 사항에 따라 달라질 수 있음을 유념하시기 바랍니다. K-Fold Cross Validation은 데이터셋이 작고 노이즈가 많거나 변동성이 높을 때 가장 큰 가치를 제공하며, 크고 다양한 데이터셋의 경우 잘 구성된 train/val/test 분할만으로도 대개 충분합니다.
시작해 보겠습니다.
설정#
-
주석은 YOLO detection format 형식이어야 합니다.
-
이 가이드는 어노테이션 파일이 로컬에 준비되어 있다고 가정합니다.
-
본 예제에서는 Fruit Detection 데이터셋을 사용합니다.
- 이 데이터셋에는 총 8479개의 이미지가 포함되어 있습니다.
- 6개의 클래스 라벨이 포함되어 있으며, 각 라벨의 총 인스턴스 수는 아래와 같습니다.
| 클래스 라벨 | 인스턴스 수 |
|---|---|
| Apple | 7049 |
| Grapes | 7202 |
| Pineapple | 1613 |
| Orange | 15549 |
| Banana | 3536 |
| Watermelon | 1976 |
-
필요한 Python 패키지는 다음과 같습니다:
ultralyticssklearnpandaspyyaml
-
본 튜토리얼은
k=5개의 폴드로 진행됩니다. 하지만 특정 데이터셋에 가장 적절한 폴드 수를 직접 결정해야 합니다.
-
프로젝트를 위한 새로운 Python 가상 환경(
venv)을 시작하고 활성화합니다.pip(또는 선호하는 패키지 관리자)을 사용하여 다음을 설치합니다:- Ultralytics 라이브러리:
pip install -U ultralytics. 또는 공식 repo를 클론할 수도 있습니다. - Scikit-learn, pandas 및 PyYAML:
pip install -U scikit-learn pandas pyyaml.
- Ultralytics 라이브러리:
-
주석이 YOLO detection format 형식으로 되어 있는지 확인합니다.
- 이 튜토리얼에서는 모든 주석 파일이
Fruit-Detection/labels디렉토리에 있습니다.
- 이 튜토리얼에서는 모든 주석 파일이
객체 탐지 데이터셋을 위한 특징 벡터 생성#
-
아래 단계를 수행하기 위해 새로운
example.pyPython 파일을 생성하는 것으로 시작합니다. -
패키지 데이터셋 소유자를 통해 설정된 학습 및 검증 이미지를 로드하고, 테스트 분할은 그대로 둡니다.
from pathlib import Path from ultralytics.data.dataset import YOLODataset from ultralytics.data.utils import check_det_dataset yaml_file = "path/to/data.yaml" data = check_det_dataset(yaml_file) dataset_path = Path(data["path"]) sources = [] for split in ("train", "val"): source = data.get(split) if source: sources.extend(source if isinstance(source, list) else [source]) dataset = YOLODataset(sources, data=data, augment=False) images = [Path(p) for p in dataset.im_files] -
이제 데이터셋 YAML 파일의 내용을 읽고 클래스 라벨의 인덱스를 추출하십시오.
classes = data["names"] cls_idx = sorted(classes.keys()) -
빈
pandasDataFrame을 초기화합니다.import pandas as pd labels_df = pd.DataFrame(0.0, columns=cls_idx, index=images) -
어노테이션 파일에 존재하는 각 클래스 라벨의 인스턴스 수를 계산합니다.
from collections import Counter for image, label in zip(images, dataset.labels): lbl_counter = Counter(label["cls"].flatten().astype(int)) labels_df.loc[image, list(lbl_counter)] = list(lbl_counter.values()) -
다음은 생성된 DataFrame의 샘플 뷰입니다:
0 1 2 3 4 5 '0000a16e4b057580_jpg.rf.00ab48988370f64f5ca8ea4...' 0.0 0.0 0.0 0.0 0.0 7.0 '0000a16e4b057580_jpg.rf.7e6dce029fb67f01eb19aa7...' 0.0 0.0 0.0 0.0 0.0 7.0 '0000a16e4b057580_jpg.rf.bc4d31cdcbe229dd022957a...' 0.0 0.0 0.0 0.0 0.0 7.0 '00020ebf74c4881c_jpg.rf.508192a0a97aa6c4a3b6882...' 0.0 0.0 0.0 1.0 0.0 0.0 '00020ebf74c4881c_jpg.rf.5af192a2254c8ecc4188a25...' 0.0 0.0 0.0 1.0 0.0 0.0 ... ... ... ... ... ... ... 'ff4cd45896de38be_jpg.rf.c4b5e967ca10c7ced3b9e97...' 0.0 0.0 0.0 0.0 0.0 2.0 'ff4cd45896de38be_jpg.rf.ea4c1d37d2884b3e3cbce08...' 0.0 0.0 0.0 0.0 0.0 2.0 'ff5fd9c3c624b7dc_jpg.rf.bb519feaa36fc4bf630a033...' 1.0 0.0 0.0 0.0 0.0 0.0 'ff5fd9c3c624b7dc_jpg.rf.f0751c9c3aa4519ea3c9d6a...' 1.0 0.0 0.0 0.0 0.0 0.0 'fffe28b31f2a70d4_jpg.rf.7ea16bd637ba0711c53b540...' 0.0 6.0 0.0 0.0 0.0 0.0
행은 절대 이미지 경로를 사용하고 열은 클래스 레이블 인덱스에 해당합니다. 누락된 레이블은 모두 0인 배경 행으로 유지됩니다. 이 데이터 구조를 통해 객체 검출 데이터셋에 K-Fold Cross Validation을 적용할 수 있습니다.
K-Fold 데이터셋 분할#
-
이제
sklearn.model_selection의KFold클래스를 사용하여 데이터셋의k분할을 생성합니다.- 중요:
shuffle=True을 설정하면 분할 과정에서 클래스의 무작위 분포가 보장됩니다.M이 선택한 정수인random_state=M을 설정함으로써 재현 가능한 결과를 얻을 수 있습니다.
from sklearn.model_selection import KFold ksplit = 5 kf = KFold(n_splits=ksplit, shuffle=True, random_state=20) # setting random_state for repeatable results kfolds = list(kf.split(labels_df)) - 중요:
-
데이터셋이 이제
k개의 폴드로 분할되었으며, 각 폴드는train및val인덱스 목록을 가지고 있습니다. 결과를 더 명확하게 표시하기 위해 DataFrame을 구성하겠습니다.folds = [f"split_{n}" for n in range(1, ksplit + 1)] folds_df = pd.DataFrame(index=labels_df.index, columns=folds) for i, (train, val) in enumerate(kfolds, start=1): folds_df.loc[labels_df.index[train], f"split_{i}"] = "train" folds_df.loc[labels_df.index[val], f"split_{i}"] = "val" -
이제
val에 존재하는 클래스와train에 존재하는 클래스의 비율로 각 폴드의 클래스 라벨 분포를 계산합니다.fold_lbl_distrb = pd.DataFrame(index=folds, columns=cls_idx) for n, (train_indices, val_indices) in enumerate(kfolds, start=1): train_totals = labels_df.iloc[train_indices].sum() val_totals = labels_df.iloc[val_indices].sum() # To avoid division by zero, we add a small value (1E-7) to the denominator ratio = val_totals / (train_totals + 1e-7) fold_lbl_distrb.loc[f"split_{n}"] = ratio이상적인 시나리오는 모든 클래스 비율이 각 분할 및 클래스 전반에 걸쳐 상당히 유사한 것입니다. 그러나 이는 데이터셋의 세부 사항에 따라 달라집니다.
-
각 분할에 대한 이미지 목록과 데이터셋 YAML을 작성합니다. 텍스트 목록을 사용하면 데이터셋을
k번 복사하는 것을 방지할 수 있습니다.import yaml save_path = dataset_path.parent / f"{ksplit}-Fold_Cross-val" save_path.mkdir(parents=True, exist_ok=True) ds_yamls = [] for split in folds_df.columns: for partition in ("train", "val"): split_images = folds_df.index[folds_df[split] == partition] paths = "\n".join(map(str, split_images)) (save_path / f"{split}_{partition}.txt").write_text(f"{paths}\n") dataset_yaml = save_path / f"{split}.yaml" ds_yamls.append(dataset_yaml) with open(dataset_yaml, "w") as ds_y: yaml.safe_dump( { "path": save_path.as_posix(), "train": f"{split}_train.txt", "val": f"{split}_val.txt", "names": classes, }, ds_y, )
기록 저장(선택 사항)#
선택적으로, 향후 참조를 위해 K-Fold 분할 기록과 라벨 분포 DataFrame을 CSV 파일로 저장할 수 있습니다.
folds_df.to_csv(save_path / "kfold_datasplit.csv")
fold_lbl_distrb.to_csv(save_path / "kfold_label_distribution.csv")K-Fold 데이터 분할을 사용하여 YOLO 학습#
-
먼저 YOLO 모델을 로드합니다.
from ultralytics import YOLO weights_path = "path/to/weights.pt" # use yolo26n.pt for a small model model = YOLO(weights_path, task="detect") -
다음으로, 데이터셋 YAML 파일들을 순회하며 학습을 실행합니다. 결과는
project및name인수로 지정된 디렉토리에 저장됩니다. 기본적으로 이 디렉토리는 'runs/detect/train#'이며, 여기서 #은 정수 인덱스입니다.results = {} # Define your additional arguments here batch = 16 project = "kfold_demo" epochs = 100 for k, dataset_yaml in enumerate(ds_yamls): model = YOLO(weights_path, task="detect") results[k] = model.train( data=dataset_yaml, epochs=epochs, batch=batch, project=project, name=f"fold_{k + 1}" ) # include any additional train arguments -
자동 데이터셋 분할을 위해 Ultralytics data.split.autosplit 함수를 사용할 수도 있습니다:
from ultralytics.data.split import autosplit # Automatically split dataset into train/val/test autosplit(path="path/to/images", weights=(0.8, 0.2, 0.0), annotated_only=True)
결론#
본 가이드에서는 K-Fold 교차 검증을 사용하여 YOLO 객체 검출 모델을 학습하는 과정을 살펴보았습니다. 학습 및 검증 풀을 K개의 파티션으로 분할하고 생성된 비율 표를 사용하여 무작위 분할 후 클래스 균형을 검사하는 방법을 배웠습니다.
또한 데이터 분할 및 라벨 분포를 시각화하기 위해 리포트 DataFrame을 생성하는 절차를 살펴보고, 학습 및 검증 세트의 구조에 대한 명확한 통찰력을 얻었습니다.
선택적으로 향후 참조를 위해 기록을 저장했으며, 이는 대규모 프로젝트나 모델 성능 문제 해결 시 특히 유용할 수 있습니다.
마지막으로 루프 내에서 각 분할을 사용하여 실제 모델 학습을 구현하고 추가 분석 및 비교를 위해 학습 결과를 저장했습니다.
이 K-Fold 교차 검증 기법은 가용한 데이터를 최대한 활용하는 강력한 방법이며, 다양한 데이터 서브셋에서 모델 성능이 신뢰할 수 있고 일관성 있게 유지되도록 보장하는 데 도움이 됩니다. 이를 통해 특정 데이터 패턴에 overfit될 가능성이 낮고 일반화 성능이 뛰어나며 신뢰할 수 있는 모델을 얻을 수 있습니다.
이 가이드에서는 YOLO를 사용했지만, 이러한 단계는 대부분 다른 머신 러닝 모델에도 적용 가능하다는 점을 기억하십시오. 이러한 단계를 이해하면 자신의 머신 러닝 프로젝트에서 효과적으로 교차 검증을 적용할 수 있습니다.
FAQ#
K-Fold 교차 검증은 모델 성능을 더 신뢰성 있게 평가하기 위해 데이터셋을 'k'개의 서브셋(폴드)으로 나누는 기법입니다. 각 폴드는 학습 데이터와 validation data 역할을 모두 수행합니다. object detection의 맥락에서 K-Fold 교차 검증을 사용하면 다양한 데이터 분할에 걸쳐 Ultralytics YOLO 모델의 성능이 강건하고 일반화 가능하도록 보장하여 신뢰성을 높일 수 있습니다. Ultralytics YOLO로 K-Fold 교차 검증을 설정하는 방법에 대한 자세한 내용은 K-Fold Cross Validation with Ultralytics를 참조하세요.
Ultralytics YOLO로 K-Fold 교차 검증을 구현하려면 다음 단계를 따라야 합니다:
- 주석이 YOLO detection format 형식인지 확인합니다.
sklearn,pandas,pyyaml같은 Python 라이브러리를 사용하세요.- 데이터셋에서 특징 벡터를 생성하십시오.
sklearn.model_selection의KFold을 사용하여 데이터셋을 분할합니다.- 각 분할에서 YOLO 모델을 학습시키십시오.
종합적인 가이드를 보려면 문서의 K-Fold Dataset Split 섹션을 참조하세요.
이 가이드의 워크플로는 YOLO detection 형식을 대상으로 하지만, 동일한 접근 방식이 모든 YOLO 작업에 적용됩니다. 교차 검증이 도움이 되는지 여부가 아니라 작업에 따라 폴드를 구성하는 방식이 달라집니다:
작업 폴드 설계 detect이미지 수준에서 분할하며, 폴드 간 객체 및 클래스 분포의 균형을 맞춥니다. 관련된 이미지(동일한 환자, 비디오 시퀀스, 카메라 또는 사이트)는 단일 폴드 내에 유지합니다. segmentdetection과 동일한 이미지 수준 전략을 사용하되, 모든 폴드에서 마스크와 클래스 커버리지를 추가로 보존합니다. classify훈련과 검증 간의 클래스 빈도가 균형을 유지하도록 층화 폴드를 선호합니다. pose동일한 사람이나 동물이 폴드의 양쪽에 모두 나타나지 않도록 피처(주체) 또는 시퀀스별로 분할합니다. obb이미지 수준에서 분할하여 동일한 장인의 타일이나 크롭을 함께 유지합니다. 이는 항공 이미지의 경우 특히 중요합니다. 어떤 작업이든, 거의 중복되거나 관련된 샘플은 서로 반대되는 폴드에 들어가지 않도록 하십시오. 이러한 데이터 유출은 모델이 프로덕션 환경에서 달성할 성능보다 검증 지표를 훨씬 더 부풀리게 됩니다.
Ultralytics YOLO는 높은 accuracy와 효율성을 갖춘 최첨단 실시간 객체 검출을 제공합니다. detection, instance segmentation, semantic segmentation, classification과 같은 다양한 computer vision 작업을 지원하는 다재다능한 모델입니다. 또한, 코딩이 필요 없는 모델 학습 및 배포를 위해 Ultralytics Platform과 같은 도구와 원활하게 통합됩니다. 자세한 내용은 Ultralytics YOLO page에서 기능과 장점을 확인해 보세요.
주석은 YOLO detection format을 따라야 합니다. 각 주석 파일은 이미지 내 bounding box 좌표와 함께 객체 클래스를 나열해야 합니다. YOLO 형식은 object detection 모델 학습을 위한 간소화되고 표준화된 데이터 처리를 보장합니다. 올바른 주석 포맷팅에 대한 자세한 정보는 YOLO detection format guide를 방문하세요.
네, 주석이 YOLO detection format인 한 K-Fold 교차 검증을 모든 커스텀 데이터셋과 함께 사용할 수 있습니다. 데이터셋 경로와 클래스 라벨을 사용하려는 커스텀 데이터셋에 맞는 것으로 교체하세요. 이러한 유연성을 통해 모든 object detection 프로젝트가 K-Fold 교차 검증을 통한 강건한 모델 평가의 이점을 누릴 수 있습니다. 실용적인 예제는 Generating Feature Vectors 섹션을 검토하세요.