구성#
YOLO 설정과 하이퍼파라미터는 모델의 성능, 속도 및 정확도에 중요한 역할을 합니다. 이러한 설정은 학습, 검증, 예측을 비롯한 여러 단계에서 모델의 동작에 영향을 줄 수 있습니다.
Watch: Mastering Ultralytics YOLO: Configuration
Ultralytics 명령어는 다음 구문을 사용합니다.
yolo TASK MODE ARGS다음과 같습니다:
TASK(선택 사항)는 (detect, segment, semantic, depth, classify, pose, obb) 중 하나입니다.MODE(필수)은 (train, val, predict, export, track, benchmark) 중 하나입니다.ARGS(선택 사항)는 기본값을 재정의하는arg=value쌍(예:imgsz=640)입니다.
기본 ARG 값은 이 페이지에 정의되어 있으며 cfg/default.yaml 파일에서 가져옵니다.
작업#
Ultralytics YOLO 모델은 다음을 비롯한 다양한 컴퓨터 비전 작업을 수행할 수 있습니다.
- Detect: 객체 감지는 이미지 또는 동영상 내 객체를 식별하고 위치를 지정합니다.
- Segment: 인스턴스 세그멘테이션은 이미지 또는 동영상을 서로 다른 객체나 클래스에 해당하는 영역으로 나눕니다.
- Semantic segmentation (
semantic): 시맨틱 세그멘테이션은 밀집 장면 이해를 위해 이미지의 모든 픽셀에 클래스 레이블을 할당합니다. - Depth (
depth): 단안 깊이 추정은 단일 RGB 이미지에서 픽셀별 깊이 맵을 미터 단위로 예측합니다. - Classify: 이미지 분류는 입력 이미지의 클래스 레이블을 예측합니다.
- Pose: 포즈 추정은 이미지 또는 동영상에서 객체를 식별하고 키포인트를 추정합니다.
- OBB: 방향성 BBox는 회전된 BBox를 사용하며 위성 또는 의료 이미지에 적합합니다.
| 인수 | 기본값 | 설명 |
|---|---|---|
task | 'detect' | YOLO 작업을 지정합니다. detect은 객체 감지, segment는 인스턴스 세그멘테이션, semantic은 시맨틱 세그멘테이션, depth는 단안 깊이 추정, classify는 분류, pose은 포즈 추정, obb은 방향성 BBox에 사용됩니다. 각 작업은 이미지 및 동영상 분석의 특정 출력과 문제에 맞게 설계되었습니다. |
모드#
Ultralytics YOLO 모델은 서로 다른 모드로 작동하며, 각 모드는 모델 수명 주기의 특정 단계에 맞게 설계되었습니다.
- Train: 사용자 지정 데이터셋으로 YOLO 모델을 학습합니다.
- Val: 학습된 YOLO 모델을 검증합니다.
- Predict: 학습된 YOLO 모델을 사용하여 새로운 이미지 또는 동영상에 대한 예측을 수행합니다.
- Export: 배포를 위해 YOLO 모델을 내보냅니다.
- Track: YOLO 모델을 사용하여 실시간으로 객체를 추적합니다.
- Benchmark: YOLO 내보내기 형식(ONNX, TensorRT 등)의 속도와 정확도를 벤치마크합니다.
| 인수 | 기본값 | 설명 |
|---|---|---|
mode | 'train' | YOLO 모델의 작동 모드를 지정합니다. train은 모델 학습, val은 검증, predict는 추론, export은 배포 형식으로 변환, track는 객체 추적, benchmark는 성능 평가에 사용됩니다. 각 모드는 개발부터 배포까지 서로 다른 단계를 지원합니다. |
학습 설정#
YOLO 모델의 학습 설정에는 모델의 성능, 속도 및 정확도에 영향을 주는 하이퍼파라미터와 구성이 포함됩니다. 주요 설정에는 배치 크기, 학습률, 모멘텀 및 가중치 감쇠가 있습니다. 옵티마이저, 손실 함수 및 데이터셋 구성도 학습에 영향을 줍니다. 최적의 성능을 위해서는 튜닝과 실험이 중요합니다. 자세한 내용은 Ultralytics 엔트리포인트 함수를 참조하십시오.
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
model | str | None | 학습에 사용할 모델 파일을 지정합니다. .pt 사전 학습 모델 또는 .yaml 구성 파일의 경로를 허용합니다. 모델 구조를 정의하거나 가중치를 초기화하는 데 필수적입니다. |
data | str | None | 데이터셋 YAML의 경로(예: coco8.yaml)입니다. 여기에는 학습 및 검증 데이터의 경로, 클래스 이름 및 클래스 수가 포함됩니다. 분류의 경우 데이터셋 디렉터리 또는 기본 제공 데이터셋 이름(예: imagenet10)을 사용합니다. |
epochs | int | 100 | 총 학습 에포크 수입니다. 각 에포크는 전체 데이터셋을 한 번 모두 처리하는 것을 의미합니다. 이 값을 조정하면 학습 기간과 모델 성능에 영향을 줄 수 있습니다. |
time | float | None | 최대 학습 시간(시간 단위)입니다. 설정하면 epochs 인수를 재정의하여 지정된 시간이 지나면 학습을 자동으로 중지합니다. 시간이 제한된 학습 시나리오에 유용합니다. |
patience | int | 100 | 검증 지표가 개선되지 않을 때 학습을 조기 중지하기 전에 기다릴 에포크 수입니다. 성능이 정체될 때 학습을 중지하여 과적합을 방지하는 데 도움이 됩니다. |
batch | int 또는 float | 16 | 세 가지 모드를 지원하는 배치 크기입니다. 정수로 설정하는 방식(예: batch=16), GPU 메모리 사용률 60%를 위한 자동 모드(batch=-1), 지정된 사용률 분율을 사용하는 자동 모드(batch=0.70)가 있습니다. |
imgsz | int | 640 | 학습 대상 이미지 크기입니다. rect=False인 경우 이미지가 지정된 값과 변의 길이가 같은 정사각형으로 조정되며, YOLO 모델에서는 종횡비를 유지하지만 RT-DETR에서는 유지하지 않습니다. 모델 정확도와 계산 복잡도에 영향을 줍니다. |
save | bool | True | 학습 체크포인트와 최종 모델 가중치를 저장할 수 있도록 합니다. 학습 재개 또는 모델 배포에 유용합니다. |
save_period | int | -1 | 모델 체크포인트를 저장하는 주기를 에포크 단위로 지정합니다. -1 값은 이 기능을 비활성화합니다. 장시간 학습 중 중간 모델을 저장하는 데 유용합니다. |
cache | bool | False | 데이터셋 이미지를 메모리(True/ram) 또는 디스크(disk)에 캐싱하거나 캐싱을 비활성화(False)합니다. 메모리 사용량이 증가하는 대신 디스크 I/O를 줄여 학습 속도를 향상합니다. |
device | int 또는 str 또는 list | None | 학습에 사용할 컴퓨팅 장치를 지정합니다. 단일 GPU(device=0), 여러 GPU(device=[0,1]), CPU(device=cpu), Apple silicon용 MPS(device=mps), Huawei Ascend NPU(device=npu:0 또는 device=npu:0,1), 유휴 GPU 자동 선택(device=-1) 또는 여러 유휴 GPU 자동 선택(device=[-1,-1])을 사용할 수 있습니다. |
workers | int | 8 | 데이터 로딩을 위한 작업자 스레드 수입니다(Multi-GPU 학습 시 RANK당). 데이터 전처리 및 모델 입력 공급 속도에 영향을 주며, 특히 다중 GPU 설정에서 유용합니다. |
project | str | None | 학습 출력이 저장되는 프로젝트 디렉터리의 이름입니다. 서로 다른 실험을 체계적으로 저장할 수 있습니다. |
name | str | None | 학습 실행의 이름입니다. 프로젝트 폴더 내에 하위 디렉터리를 생성하는 데 사용되며, 해당 디렉터리에 학습 로그와 출력이 저장됩니다. |
exist_ok | bool | False | True인 경우 기존 프로젝트/이름 디렉터리를 덮어쓸 수 있습니다. 이전 출력을 수동으로 삭제하지 않고 반복적으로 실험하는 데 유용합니다. |
save_dir | str | None | 실행 출력이 저장되는 정확한 디렉터리를 지정하여 project/name 조합을 재정의합니다. 경로는 자동으로 번호를 증가시키지 않고 그대로 사용되므로 연속 실행에서 동일한 디렉터리를 재사용합니다. |
pretrained | bool 또는 str | True | 사전 학습된 가중치로 학습을 시작할지 결정합니다. 부울 값 또는 로드할 가중치의 문자열 경로로 설정할 수 있습니다. pretrained=False은 모델 아키텍처를 유지하면서 무작위로 초기화된 가중치에서 학습합니다. |
cls_remap | bool | True | 데이터셋 간에 파인튜닝할 때 클래스 이름이 일치하는 경우 사전 학습된 분류 헤드의 행을 새 모델에 복사합니다. 따라서 겹치는 클래스는 학습된 바이어스를 유지하며, 헤드 너비가 변경되지 않은 경우 해당 가중치도 유지합니다. 클래스 수가 다르거나 클래스 순서가 달라도 적용됩니다. |
optimizer | str | 'auto' | 학습에 사용할 옵티마이저를 선택합니다. SGD, MuSGD, Adam, Adamax, AdamW, NAdam, RAdam, RMSProp 또는 auto을 사용하여 학습 반복 횟수에 따라 AdamW 또는 MuSGD을 선택할 수 있습니다. 수렴 속도와 안정성에 영향을 줍니다. |
seed | int | 0 | 학습을 위한 랜덤 시드를 설정하여 동일한 구성으로 실행할 때 결과를 재현할 수 있도록 합니다. |
deterministic | bool | True | 결정론적 알고리즘 사용을 강제합니다. 재현성을 보장하지만 비결정론적 알고리즘의 제한으로 인해 성능과 속도에 영향을 줄 수 있습니다. |
verbose | bool | True | 학습 중 상세 출력을 활성화하여 콘솔에 진행률 표시줄, 에포크별 지표 및 추가 학습 정보를 표시합니다. |
single_cls | bool | False | 다중 클래스 데이터셋의 모든 클래스를 학습 중 하나의 클래스로 처리합니다. 이진 분류 작업이나 분류보다 객체 존재 여부에 집중할 때 유용합니다. |
classes | list[int] | None | 학습할 클래스 ID 목록을 지정합니다. 학습 중 특정 클래스만 필터링하고 집중하는 데 유용합니다. |
rect | bool | False | 최소 패딩 전략을 활성화합니다. 배치 내 이미지에 공통 크기에 도달하는 데 필요한 최소한의 패딩을 적용하며, 가장 긴 변은 imgsz과 같습니다. 효율성과 속도를 향상할 수 있지만 모델 정확도에 영향을 줄 수 있습니다. |
multi_scale | float | 0.0 | 각 배치에서 imgsz을 +/- multi_scale만큼 무작위로 변경합니다(예: 0.25 -> 0.75x에서 1.25x까지). 모델 stride의 배수로 반올림하며, 0.0는 멀티 스케일 학습을 비활성화합니다. |
cos_lr | bool | False | 코사인 학습률 스케줄러를 사용하여 에포크에 따라 코사인 곡선을 따르도록 학습률을 조정합니다. 더 나은 수렴을 위해 학습률을 관리하는 데 도움이 됩니다. |
close_mosaic | int | 10 | 완료 전 학습을 안정화하기 위해 마지막 N개 에포크에서 모자이크 데이터 증강을 비활성화합니다. 0으로 설정하면 이 기능이 비활성화됩니다. |
resume | bool | False | 마지막으로 저장된 체크포인트에서 학습을 재개합니다. 모델 가중치, 옵티마이저 상태 및 에포크 수를 자동으로 로드하여 학습을 원활하게 계속합니다. |
amp | bool 또는 str | True | 학습 정밀도를 설정합니다. True 또는 "fp16"은 FP16을 사용하고, "bf16"는 지원되는 CUDA 장치에서 BF16을 사용하며, False 또는 "fp32"는 FP32를 사용합니다. |
quantize | int 또는 str | None | INT8 양자화 인식 학습(QAT)을 위해 8(또는 "int8")으로 설정합니다. 이 학습은 루프 내에서 가상 양자화를 사용하여 미세 조정하므로 가중치가 INT8 내보내기에 적합해집니다. 양자화 인식 학습(Quantization-Aware Training)을 참조하세요. |
fraction | float, int 또는 list | 1.0 | 데이터셋 하위 집합을 비율/개수 또는 [train, val, test] 목록으로 지정합니다. 1은 전체 분할을 의미하고, 1보다 큰 정수는 이미지 개수이며, 선택 사항인 test 항목에서만 0/0.0를 사용하여 없음을 의미할 수 있습니다. 두 항목 목록에서는 test를 전체로 유지합니다. |
profile | bool | False | 학습 중 ONNX 및 TensorRT 속도 프로파일링을 활성화하여 모델 배포 최적화에 유용하게 합니다. |
freeze | int 또는 list | None | 모델의 첫 N개 레이어 또는 인덱스나 모듈 이름으로 지정한 특정 레이어(23.cv2, 앞의 model. 제외)를 고정하여 학습 가능한 파라미터 수를 줄입니다. 파인튜닝 또는 전이 학습에 유용합니다. |
lr0 | float | 0.01 | 초기 학습률(즉, SGD=1E-2, Adam=1E-3)입니다. 이 값은 최적화 과정에 매우 중요하며 모델 가중치가 업데이트되는 속도에 영향을 줍니다. |
lrf | float | 0.01 | 초기 학습률의 비율로 나타낸 최종 학습률 = (lr0 * lrf)이며, 스케줄러와 함께 사용하여 시간에 따라 학습률을 조정합니다. |
momentum | float | 0.937 | SGD의 모멘텀 계수 또는 Adam 옵티마이저의 beta1로, 현재 업데이트에 과거 그래디언트를 반영하는 정도에 영향을 줍니다. |
weight_decay | float | 0.0005 | L2 정규화 항으로, 과적합을 방지하기 위해 큰 가중치에 페널티를 부여합니다. |
warmup_epochs | float | 3.0 | 학습률 워밍업 에포크 수입니다. 초기 학습률을 안정화하기 위해 낮은 값에서 초기 학습률까지 학습률을 점진적으로 증가시킵니다. |
warmup_momentum | float | 0.8 | 워밍업 단계의 초기 모멘텀으로, 워밍업 기간 동안 설정된 모멘텀에 점진적으로 맞춰집니다. |
warmup_bias_lr | float | 0.1 | 워밍업 단계에서 바이어스 파라미터에 사용할 학습률로, 초기 에포크의 모델 학습을 안정화하는 데 도움이 됩니다. 기본 optimizer='auto'에서는 자동으로 0.0으로 설정되므로 이를 사용하려면 옵티마이저 이름을 명시적으로 지정해야 합니다. |
distill_model | str | None | 지식 증류에 사용할 교사 모델 체크포인트의 경로(예: yolo26x.pt)입니다. 설정하면 고정된 교사의 안내를 받는 추가 증류 손실을 사용하여 학생 모델을 학습합니다. |
dis | float | 6.0 | 표준 감지 손실에 추가되는 증류 손실의 가중치입니다. 값이 클수록 교사의 특징 안내가 미치는 영향이 커집니다. |
box | float | 7.5 | 손실 함수의 박스 손실 구성 요소 가중치로, BBox 좌표를 정확하게 예측하는 데 두는 비중에 영향을 줍니다. |
cls | float | 0.5 | 전체 손실 함수에서 분류 손실의 가중치로, 다른 구성 요소에 비해 올바른 클래스 예측의 중요도에 영향을 줍니다. |
cls_pw | float | 0.0 | 역클래스 빈도를 사용하여 클래스 불균형을 처리하기 위한 클래스 가중치의 지수입니다. 0.0은 클래스 가중치를 비활성화하고, 1.0은 전체 역빈도 가중치를 적용합니다. 0과 1 사이의 값은 부분적인 가중치를 제공합니다. |
dfl | float | 1.5 | 박스 거리 회귀 항의 가중치입니다. 감지 헤드가 reg_max > 1을 사용하는 경우에는 분포 초점 손실(DFL)이고, DFL이 없는 YOLO26(reg_max: 1)에서는 정규화된 박스 거리에 대한 L1 손실입니다. |
pose | float | 12.0 | 포즈 추정용으로 학습된 모델에서 포즈 손실의 가중치로, 포즈 키포인트를 정확하게 예측하는 데 두는 비중에 영향을 줍니다. |
kobj | float | 1.0 | 포즈 추정 모델에서 키포인트 객체성 손실의 가중치로, 감지 신뢰도와 포즈 정확도 사이의 균형을 조정합니다. |
rle | float | 1.0 | 포즈 추정 모델에서 잔차 로그 가능도 추정 손실의 가중치로, 키포인트 위치 지정의 정밀도에 영향을 줍니다. |
angle | float | 1.0 | obb 모델에서 각도 손실의 가중치로, 방향성 BBox 각도 예측의 정밀도에 영향을 줍니다. |
dlog | float | 1.0 | 깊이 추정 모델에서 스케일 불변 로그(SILog) 손실의 가중치로, 깊이 정확도를 결정하는 주요 항입니다. |
dgrad | float | 0.5 | 깊이 추정 모델에서 그래디언트 손실의 가중치로, 깊이 경계의 오류에 페널티를 부여하고 더 선명한 표면 경계를 유도합니다. |
dlam | float | 1.0 | 깊이 추정 모델에서 SILog 손실의 분산 집중 계수입니다. 1.0은 손실을 완전히 스케일 불변으로 만들고, 0.0은 이를 일반 로그-RMSE로 줄입니다. |
nbs | int | 64 | 손실 정규화를 위한 기준 배치 크기입니다. |
overlap_mask | bool | True | 객체 마스크를 학습을 위해 하나의 마스크로 병합할지, 객체별로 분리하여 유지할지 결정합니다. 겹치는 경우 병합 중 더 작은 마스크를 더 큰 마스크 위에 겹쳐 놓습니다. |
mask_ratio | int | 4 | 세그멘테이션 마스크의 다운샘플링 비율로, 학습 중 사용되는 마스크의 해상도에 영향을 줍니다. |
dropout | float | 0.0 | 분류 작업의 정규화를 위한 드롭아웃 비율로, 학습 중 유닛을 무작위로 생략하여 과적합을 방지합니다. |
val | bool | True | 학습 중 검증을 활성화하여 별도의 데이터셋에서 모델 성능을 주기적으로 평가할 수 있도록 합니다. |
nms | bool, 선택 사항 | None | 에폭 검증, 체크포인트 선택 및 조기 종료에 사용되는 추론 헤드를 선택합니다. None 또는 True은 NMS가 포함된 일대다 방식을 사용하고, False는 사용 가능한 경우 NMS가 없는 헤드를 사용합니다. 두 헤드 모두 학습 손실을 유지합니다. |
plots | bool | True | 학습 및 검증 지표와 예측 예시의 플롯을 생성하고 저장하여 모델 성능과 학습 진행 상황을 시각적으로 파악할 수 있도록 합니다. |
compile | bool 또는 str | False | PyTorch 2.x torch.compile 그래프 컴파일을 backend='inductor'과 함께 활성화합니다. True → "default", False → 비활성화 또는 "default", "reduce-overhead", "max-autotune-no-cudagraphs"과 같은 문자열 모드를 사용할 수 있습니다. 지원되지 않는 경우 경고와 함께 eager 모드로 대체됩니다. |
channels_last | bool | None | 학습 중 합성곱에 channels_last (NHWC) 메모리 포맷을 사용합니다. None 설정은 PyTorch 1.11 버전 이상을 사용하는 CUDA 환경에서 자동으로 이를 활성화하지만, 성능이 더 느리게 측정된 Windows 환경은 예외로 합니다. False 설정은 이를 비활성화하며, True 설정은 명시적으로 이를 요청합니다. PyTorch 1.10 버전 이하, CPU, 그리고 MPS 환경에서는 기본적으로 NCHW를 유지합니다. |
max_det | int | 300 | 학습 검증 중 이미지당 최대 감지 횟수입니다. detect, segment, pose, OBB의 경우 기본값 300은 해당 개수가 300을 초과할 때만 가장 큰 학습/검증 레이블 지정 객체 수로 증가합니다. 다른 값은 고정된 상태로 유지되며, 한도를 초과하면 경고가 발생합니다. |
batch 인수는 세 가지 구성 옵션을 제공합니다.
- 고정 배치 크기: 정수로 배치당 이미지 수를 지정합니다(예:
batch=16). - 자동 모드(GPU 메모리 60%):
batch=-1을 사용하여 CUDA 메모리 사용률을 약 60%로 자동 조정합니다. - 사용률 분율을 지정한 자동 모드: 분율(예:
batch=0.70)을 설정하여 지정된 GPU 메모리 사용량을 기준으로 조정합니다. - 적합한 설정을 찾지 못한 경우: 사용 가능한 프로파일을 생성하는 후보 배치 크기가 없으면 AutoBatch는 관련 없는 기본값으로 조용히 대체하지 않고 명확한
RuntimeError을 발생시킵니다.
예측 설정#
YOLO 모델의 예측 설정에는 추론 중 성능, 속도 및 정확도에 영향을 주는 하이퍼파라미터와 구성이 포함됩니다. 주요 설정에는 신뢰도 임계값, 비최대 억제(NMS) 임계값 및 클래스 수가 있습니다. 입력 데이터의 크기와 형식, 마스크와 같은 보조 기능도 예측에 영향을 줍니다. 최적의 성능을 위해서는 이러한 설정을 튜닝하는 것이 중요합니다.
추론 인수:
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
source | str 또는 int 또는 None | None | 추론을 위한 데이터 소스를 지정합니다. 이미지 경로, 비디오 파일, 디렉터리, URL 또는 실시간 피드용 장치 ID일 수 있습니다. 생략하면 경고가 로그에 기록되고 모델은 기본 제공 데모 에셋(ultralytics/assets, OBB의 경우 데모 URL)으로 대체됩니다. 다양한 형식과 소스를 지원하므로 다양한 유형의 입력에 유연하게 적용할 수 있습니다. |
conf | float | 0.25 | 검출을 위한 최소 confidence threshold를 설정합니다. 이 threshold보다 낮은 confidence로 검출된 객체는 무시됩니다. 이 값을 조정하면 false positive를 줄이는 데 도움이 될 수 있습니다. |
iou | float | 0.7 | 비최대 억제(NMS)를 위한 Intersection over Union (IoU) threshold입니다. 값이 낮을수록 겹치는 box를 제거하여 검출 수가 줄어들며, 중복을 줄이는 데 유용합니다. |
imgsz | int 또는 tuple | 640 | Letterbox target입니다. 정수는 정사각형 N×N을 지정하고, tuple은 (height, width)을 지정합니다. rect=True를 사용하면 minimum-rectangle padding으로 인해 실제 tensor가 이 target보다 작을 수 있습니다. 고정 크기에는 rect=False을 사용합니다. 자세한 내용은 고정 shape와 minimum rectangle 비교를 참조하십시오. |
rect | bool | True | True인 경우 가능한 때에 minimum-rectangle padding을 사용합니다(동일 shape batch 및 지원되는 backend). False인 경우 항상 전체 imgsz에 맞춰 padding합니다. 자세한 내용은 고정 shape와 minimum rectangle 비교를 참조하십시오. |
quantize | int 또는 str | None | 추론 정밀도: 16/"fp16" 및 32/"fp32"/설정 안 함은 PyTorch 및 TorchScript 모델에 대한 FP16 또는 FP32 연산을 선택하며, 다른 형식은 아티팩트와 런타임이 선택하는 정밀도로 연산합니다. 16에서 OpenVINO는 여전히 클라이언트에서 입력을 FP16으로 반올림한 후 다시 FP32로 확장하지만, 런타임이 연산하는 정밀도 자체는 변경하지 않습니다. INT8/PTQ 양자화는 export 중에 구성된 후 내보낸 모델을 로드하여 사용됩니다. 지원 중단된 half 플래그를 대체합니다. |
device | str | None | 추론에 사용할 device를 지정합니다(예: cpu, cuda:0, 0, npu 또는 npu:0). CPU, 특정 GPU, Huawei Ascend NPU 또는 기타 연산 device 중에서 모델 실행에 사용할 장치를 선택할 수 있습니다. |
dnn | bool | False | True인 경우 ONNX 모델 추론에 ONNX Runtime 대신 OpenCV DNN 모듈을 사용합니다. |
data | str | None | dataset YAML의 경로입니다(예: coco8.yaml). 이 파일은 names만 읽으며, 로드된 모델에 자체 class name이 없는 경우에만 사용됩니다. 이러한 경우는 third-party export이거나, 함께 제공되는 metadata와 분리된 Ultralytics export입니다. 이러한 모델은 그렇지 않으면 class0, class1 등을 보고합니다. |
batch | int | 1 | 추론을 위한 batch size를 지정합니다(source가 디렉터리, 비디오 파일 또는 .txt 파일인 경우에만 작동합니다). batch size가 클수록 throughput이 높아져 추론에 필요한 총 시간이 단축될 수 있습니다. |
max_det | int | 300 | 이미지당 허용되는 최대 검출 수입니다. 한 번의 추론에서 모델이 검출할 수 있는 객체의 총 수를 제한하여 밀집된 장면에서 과도한 출력을 방지합니다. |
vid_stride | int | 1 | 비디오 입력을 위한 frame stride입니다. temporal resolution을 낮추는 대신 비디오의 frame을 건너뛰어 처리 속도를 높일 수 있습니다. 값이 1이면 모든 frame을 처리하고, 더 높은 값이면 frame을 건너뜁니다. |
stream_buffer | bool | False | 비디오 stream으로 들어오는 frame을 queue에 넣을지 결정합니다. False인 경우 새 frame을 수용하기 위해 이전 frame을 삭제합니다(실시간 애플리케이션에 최적화됨). True인 경우 새 frame을 buffer에 queue하여 frame이 건너뛰지 않도록 하지만, inference FPS가 stream FPS보다 낮으면 latency가 발생합니다. |
visualize | bool | False | 각 prediction 옆에 class activation heatmap을 저장하여 어떤 pixel이 예측된 class score를 높였는지 보여 줍니다. conf 및 classes을 따르므로 classes=[0]는 해당 class에만 매핑됩니다. Ultralytics PyTorch 모델에서만 사용할 수 있습니다. |
augment | bool | False | prediction에 test-time augmentation (TTA)을 사용하도록 설정합니다. 추론 속도가 느려지는 대신 detection robustness가 향상될 수 있습니다. Ultralytics PyTorch 모델에서만 사용할 수 있습니다. |
agnostic_nms | bool | False | 클래스 비구분 NMS를 활성화하여 동일 클래스 내에서뿐만 아니라 서로 다른 클래스 간에도 점수가 낮은 겹치는 상자를 억제합니다. 클래스 겹침이 흔한 다중 클래스 감지 시나리오에서 유용합니다. NMS가 없는 추론(YOLO26 또는 YOLOv10의 nms=False)의 경우, 이는 동일한 감지가 여러 클래스 레이블(IoU=1.0 중복)로 표시되는 것만 방지하며 서로 다른 상자 간의 IoU 임계값 기반 억제는 수행하지 않습니다. |
classes | list[int] | None | prediction을 class ID 집합으로 필터링합니다. 지정된 class에 속하는 detection만 반환됩니다. multi-class detection task에서 관련 객체에 집중할 때 유용합니다. |
retina_masks | bool | False | 고해상도 segmentation mask를 반환합니다. 활성화하면 반환되는 mask(masks.data)가 원본 이미지 크기와 일치합니다. 비활성화하면 추론에 사용된 이미지 크기를 갖습니다. |
embed | list[int] | None | feature vector 또는 embedding을 추출할 layer를 지정합니다. 두 번째 마지막 layer의 embedding에는 model.embed(source)을 사용하고, 특정 layer를 선택하려면 model.predict(source, embed=[layer])를 사용합니다. clustering이나 similarity search와 같은 downstream task에 유용합니다. Ultralytics PyTorch 모델에서만 사용할 수 있습니다. |
project | str | None | save이 활성화된 경우 prediction output이 저장되는 project directory의 이름입니다. |
name | str | None | prediction run의 이름입니다. project folder 내에 subdirectory를 생성할 때 사용되며, save이 활성화된 경우 prediction output이 이곳에 저장됩니다. |
stream | bool | False | 모든 frame을 한 번에 memory에 로드하는 대신 Results object의 generator를 반환하여 긴 비디오나 많은 이미지에 대해 memory-efficient processing을 활성화합니다. |
verbose | bool | True | terminal에 상세한 inference log를 표시할지 제어하여 prediction process에 대한 실시간 피드백을 제공합니다. |
compile | bool 또는 str | False | PyTorch 2.x torch.compile 그래프 컴파일을 backend='inductor'과 함께 활성화합니다. True → "default", False → 비활성화 또는 "default", "reduce-overhead", "max-autotune-no-cudagraphs"과 같은 문자열 모드를 사용할 수 있습니다. 지원되지 않는 경우 경고와 함께 eager 모드로 대체됩니다. |
channels_last | bool | None | native PyTorch inference에 channels_last (NHWC) memory format을 사용합니다. None은 PyTorch 1.13 이상을 사용하는 oneDNN-enabled Linux 및 Windows x86 CPU에서 이를 자동으로 활성화하고, False은 비활성화하며, True는 지원되는 x86 CPU 또는 CUDA device에서 이를 요청합니다. ARM64, MPS, 이전 PyTorch version, oneDNN이 없는 CPU, TensorRT 및 ONNX와 같은 export format은 변경되지 않습니다. |
nms | bool, 선택 사항 | None | 기본적으로 NMS가 포함된 일대다 추론을 실행합니다(None 또는 True). 사용 가능한 경우 NMS가 없는 일대일 헤드를 사용하려면 False로 설정하세요. 자세한 내용은 End-to-End Detection guide를 참조하세요. |
시각화 인자:
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
show | bool | False | True인 경우 annotation이 추가된 이미지 또는 비디오를 window에 표시합니다. 개발 또는 테스트 중 즉각적인 시각적 피드백을 제공하는 데 유용합니다. |
save | bool | False or True | annotation이 추가된 이미지 또는 비디오를 파일로 저장하도록 설정합니다. 문서화, 추가 분석 또는 결과 공유에 유용합니다. CLI 사용 시 기본값은 True이고 Python에서 사용할 때는 False입니다. |
save_frames | bool | False | 비디오를 처리할 때 개별 frame을 이미지로 저장합니다. 특정 frame을 추출하거나 frame 단위의 상세한 분석을 수행할 때 유용합니다. |
save_txt | bool | False | detection 결과를 [class] [x_center] [y_center] [width] [height] [confidence] 형식에 따라 text file에 저장합니다. 다른 analysis tool과 통합할 때 유용합니다. |
save_conf | bool | False | 저장된 text file에 confidence score를 포함합니다. post-processing 및 analysis에 사용할 수 있는 세부 정보를 향상합니다. |
save_crop | bool | False | detection을 crop한 이미지를 저장합니다. dataset augmentation, analysis 또는 특정 객체에 초점을 맞춘 dataset 생성에 유용합니다. |
show_labels | bool | True | visual output에 각 detection의 label을 표시합니다. 검출된 객체를 즉시 파악할 수 있습니다. |
show_conf | bool | True | 각 detection의 confidence score를 label과 함께 표시합니다. 각 detection에 대한 모델의 확신 정도를 파악할 수 있습니다. |
show_boxes | bool | True | 검출된 객체 주위에 bounding box를 그립니다. 이미지 또는 비디오 frame에서 객체를 시각적으로 식별하고 위치를 파악하는 데 필수적입니다. |
line_width | int or None | None | bounding box의 line width를 지정합니다. None인 경우 이미지 크기에 따라 line width가 자동으로 조정됩니다. 명확한 시각적 표현을 위해 사용자 지정이 가능합니다. |
검증 설정#
YOLO 모델의 검증 설정에는 검증 데이터셋에서 성능을 평가하기 위한 하이퍼파라미터와 구성이 포함됩니다. 이러한 설정은 성능, 속도 및 정확도에 영향을 줍니다. 일반적인 설정에는 배치 크기, 검증 빈도 및 성능 지표가 포함됩니다. 검증 데이터셋의 크기와 구성, 그리고 특정 작업도 프로세스에 영향을 줍니다.
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
data | str | None | 데이터셋 YAML의 경로(예: coco8.yaml)를 지정하며, YAML에는 검증 데이터의 경로가 포함되어야 합니다. Classification 작업에서는 대신 데이터셋 디렉터리 또는 기본 제공 데이터셋 이름(예: imagenet10)을 사용합니다. |
imgsz | int | 640 | 입력 이미지의 크기를 정의합니다. 처리 전에 모든 이미지의 크기가 이 규격으로 조정됩니다. 크기를 키우면 작은 객체의 정확도가 향상될 수 있지만 계산 시간이 증가합니다. |
batch | int | 16 | 배치당 이미지 수를 설정합니다. 값이 높을수록 GPU 메모리를 더 효율적으로 활용하지만 더 많은 VRAM이 필요합니다. 사용 가능한 하드웨어 리소스에 따라 조정하십시오. |
save_json | bool | False | True인 경우, 추가 분석, 다른 도구와의 통합 또는 COCO 같은 평가 서버 제출을 위해 결과를 JSON 파일로 저장합니다. 탐지 데이터셋에서는 faster-coco-eval을 사용해 예측을 평가하며, 훈련 중 metrics/mAP_small(B), metrics/mAP_medium(B), metrics/mAP_large(B)로 results.csv에 기록되는 소형, 중형, 대형 객체 mAP를 보고합니다. |
conf | float | 0.001 | 검출의 최소 confidence 임계값을 설정합니다. 값이 낮으면 recall이 증가하지만 false positive가 더 많이 발생할 수 있습니다. Precision-recall 곡선의 기본값은 0.001이며, 검출 confusion matrix는 명시적인 conf 값을 사용하거나 값이 생략되면 0.25를 사용합니다. 요약 precision과 recall은 max-F1 confidence를 사용하므로 confusion_matrix.png에서 파생된 값과 다를 수 있습니다. 메모리 사용량을 줄이기 위해 OBB 검증에서는 0.01가 기본값입니다. |
iou | float | 0.7 | Intersection Over Union의 Non-Maximum Suppression 임계값을 설정합니다. 중복 검출 제거를 제어합니다. |
max_det | int | 300 | 이미지당 최대 감지 횟수를 제한합니다. detect, segment, pose, OBB의 경우 300으로 두면 이미지가 검증 분할의 가장 큰 레이블 지정 객체 수를 초과할 때 경고와 함께 해당 개수로 상향 조정되며, 그 외의 다른 값은 유지되면서 이미지가 이를 초과할 경우 재현율이 제한될 수 있다는 경고가 표시됩니다. |
quantize | int 또는 str | None | 검증 정밀도: 16/"fp16" 및 32/"fp32"/설정 안 함은 PyTorch 및 TorchScript 모델에 대한 FP16 또는 FP32 연산을 선택하며, 다른 형식은 아티팩트와 런타임이 선택하는 정밀도로 연산합니다. 16에서 OpenVINO는 여전히 클라이언트에서 입력을 FP16으로 반올림한 후 다시 FP32로 확장하지만, 런타임이 연산하는 정밀도 자체는 변경하지 않습니다. INT8/PTQ 양자화는 export 중에 구성된 후 내보낸 모델을 검증하여 사용됩니다. 지원 중단된 half 플래그를 대체합니다. |
device | str | None | 검증에 사용할 디바이스(cpu, cuda:0, npu, npu:0 등)를 지정합니다. None인 경우 사용 가능한 최적의 디바이스를 자동으로 선택합니다. 여러 CUDA 디바이스는 쉼표로 구분하여 지정할 수 있습니다. |
dnn | bool | False | True인 경우 ONNX 모델 추론에 OpenCV DNN 모듈을 사용하여 PyTorch 추론 방식의 대안을 제공합니다. |
plots | bool | True | True으로 설정하면 모델 성능을 시각적으로 평가할 수 있도록 예측과 ground truth 비교 결과, confusion matrix, PR 곡선을 생성하고 저장합니다. |
classes | list[int] | None | 평가할 클래스 ID 목록을 지정합니다. 평가 중 특정 클래스만 필터링하고 집중하는 데 유용합니다. |
rect | bool | True | True인 경우 배치 처리를 위해 직사각형 추론을 사용하여 padding을 줄이고, 이미지의 원래 종횡비로 처리함으로써 속도와 효율성을 높일 수 있습니다. depth 검증에서는 무시됩니다. 해당 검증은 padding 대신 모든 이미지를 고정된 imgsz 정사각형으로 늘립니다. |
split | str | 'val' | 검증에 사용할 데이터셋 분할(val, test 또는 train)을 결정합니다. 성능 평가에 사용할 데이터 구간을 유연하게 선택할 수 있습니다. |
fraction | float, int 또는 list | 1.0 | 검증된 분할의 하위 집합입니다. [train, val, test] 목록이 있는 경우 split에 해당하는 항목이 적용됩니다(1 = 전체 분할, 1 초과의 정수 = 이미지 수; 생략된 항목은 전체임). 스칼라는 split=train에서만 적용되며, 이후 val와 test은 전체 분할을 사용합니다. |
project | str | None | 검증 출력이 저장되는 프로젝트 디렉터리의 이름입니다. 여러 실험 또는 모델의 결과를 정리하는 데 도움이 됩니다. |
name | str | None | 검증 실행의 이름입니다. 프로젝트 폴더 내에 검증 로그와 출력이 저장되는 하위 디렉터리를 만드는 데 사용됩니다. |
verbose | bool | True | True인 경우 클래스별 지표, 배치 진행 상황, 추가 디버깅 정보를 포함하여 검증 프로세스 중 자세한 정보를 표시합니다. |
save_txt | bool | False | True인 경우 검출 결과를 텍스트 파일에 저장하며, 이미지마다 하나의 파일을 생성합니다. 추가 분석, 사용자 지정 후처리 또는 다른 시스템과의 통합에 유용합니다. |
save_conf | bool | False | True인 경우 save_txt이 활성화되면 저장된 텍스트 파일에 confidence 값을 포함하여 분석 및 필터링을 위한 더 자세한 출력을 제공합니다. |
workers | int | 8 | 데이터 로딩에 사용할 worker 스레드 수입니다. 값이 높으면 데이터 전처리 속도가 빨라질 수 있지만 CPU 사용량이 증가할 수 있습니다. 0으로 설정하면 메인 스레드를 사용하며, 일부 환경에서 더 안정적일 수 있습니다. |
augment | bool | False | 검증 중 test-time augmentation (TTA)을 활성화합니다. 입력의 변환된 버전에 대해 추론을 실행하므로 추론 속도가 느려지는 대신 검출 정확도가 향상될 수 있습니다. Ultralytics PyTorch 모델에서만 사용할 수 있습니다. |
agnostic_nms | bool | False | 클래스 비구분 Non-Maximum Suppression을 활성화하여 예측된 클래스와 관계없이 점수가 낮은 겹치는 상자를 억제합니다. 인스턴스 중심 애플리케이션에 유용합니다. NMS가 없는 추론(YOLO26 또는 YOLOv10의 nms=False)의 경우, 이는 동일한 감지가 여러 클래스 레이블(IoU=1.0 중복)로 표시되는 것만 방지하며 서로 다른 상자 간의 IoU 임계값 기반 억제는 수행하지 않습니다. |
single_cls | bool | False | 검증 중 모든 클래스를 하나의 클래스로 처리합니다. 이진 검출 작업에서 모델 성능을 평가하거나 클래스 구분이 중요하지 않은 경우에 유용합니다. |
visualize | bool | False | 각 이미지의 ground truth, true positive, false positive, false negative를 시각화합니다. 디버깅과 모델 해석에 유용합니다. |
show_labels | bool | True | visualize=True인 경우 검증 시각화에 클래스 레이블을 표시합니다. 일치 항목과 오류를 더 깔끔하게 보려면 False로 설정하십시오. |
show_conf | bool | True | visualize=True인 경우 검증 시각화에 confidence score를 표시합니다. 일치 항목과 오류를 더 깔끔하게 보려면 False로 설정하십시오. |
compile | bool 또는 str | False | PyTorch 2.x torch.compile 그래프 컴파일을 backend='inductor'과 함께 활성화합니다. True → "default", False → 비활성화 또는 "default", "reduce-overhead", "max-autotune-no-cudagraphs"과 같은 문자열 모드를 사용할 수 있습니다. 지원되지 않는 경우 경고와 함께 eager 모드로 대체됩니다. |
channels_last | bool | None | 네이티브 PyTorch 검증에 channels_last (NHWC) 메모리 형식을 사용합니다. None은 PyTorch 1.13 이상을 사용하는 oneDNN 지원 Linux 및 Windows x86 CPU에서 자동으로 활성화하고, False은 비활성화하며, True는 지원되는 x86 CPU 또는 CUDA 디바이스에서 사용을 요청합니다. ARM64, MPS, 이전 PyTorch 버전, oneDNN이 없는 CPU 및 내보낸 형식은 변경되지 않습니다. 학습 중 검증에서는 학습 모델 레이아웃을 유지합니다. |
nms | bool, 선택 사항 | None | 기본적으로 NMS가 포함된 일대다 추론을 실행합니다(None 또는 True). 사용 가능한 경우 NMS가 없는 일대일 헤드를 사용하려면 False로 설정하세요. 자세한 내용은 End-to-End Detection guide를 참조하세요. |
신중한 튜닝과 실험은 최적의 성능을 보장하고 과적합을 감지하고 방지하는 데 매우 중요합니다.
Export 설정#
YOLO 모델의 export 설정에는 다양한 환경에서 사용할 수 있도록 모델을 저장하거나 export하기 위한 구성이 포함됩니다. 이러한 설정은 성능, 크기 및 호환성에 영향을 줍니다. 주요 설정에는 export된 파일 형식(예: ONNX, TensorFlow SavedModel), 대상 디바이스(예: CPU, GPU) 및 마스크와 같은 기능이 포함됩니다. 모델의 작업과 대상 환경의 제약 조건도 export 프로세스에 영향을 줍니다.
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
format | str | 'torchscript' | 'onnx', 'torchscript', 'engine'(TensorRT) 또는 기타 형식과 같은 export된 모델의 대상 형식입니다. 각 형식은 서로 다른 배포 환경과의 호환성을 제공합니다. |
name | str | None | 하드웨어 대상이 필요한 형식의 하드웨어 대상 이름입니다. Hailo 아키텍처('hailo8', 'hailo8l', 'hailo10h', 'hailo15h', 'hailo15l'; 기본값은 'hailo8l'), Rockchip RKNN 칩(기본값은 'rk3588'), Huawei Ascend SoC(CANN --soc_version; 기본값은 'Ascend310B4') 또는 Qualcomm QNN HTP 대상(기본값은 '73')입니다. 다른 모드에서 사용하는 project/name 실행 이름 지정 쌍과는 다릅니다. |
imgsz | int 또는 tuple | 640 | 모델 입력에 사용할 원하는 이미지 크기입니다. 정사각형 이미지의 경우 정수(예: 640×640의 경우 640)로 지정하거나, 특정 크기의 경우 튜플 (height, width)로 지정할 수 있습니다. 전달하지 않으면 export는 로드된 체크포인트에 기록된 학습 크기를 재사용합니다. 공식 YOLO26 체크포인트는 depth에 768, classify에 224, OBB에 1024, 기타 작업에 640를 기록하며, fine-tune 모델은 학습된 imgsz을 기록합니다. YAML에서 생성된 모델에는 기록된 학습 크기가 없으므로 640을 사용합니다. |
keras | bool | False | TensorFlow SavedModel용 Keras 형식으로의 export를 활성화하여 TensorFlow serving 및 API와의 호환성을 제공합니다. |
optimize | bool | False | DEEPX에 대해 더 높은 컴파일러 최적화를 활성화하여 컴파일 시간은 늘리지만 inference 지연 시간을 줄입니다. |
quantize | int 또는 str | None | 양자화 정밀도: 16 (FP16, 모델 크기를 줄이고 지원되는 하드웨어에서 추론 속도를 높일 수 있음) 또는 8 (INT8/PTQ, 최소한의 정확도 손실로 모델을 추가 압축하며, 주로 엣지 디바이스용으로 사용됨; data/fraction 캘리브레이션 필요); 32/미설정 시 FP32. quantize=8로 학습된 체크포인트는 항상 INT8을 내보냄: onnx 및 engine는 캘리브레이션 없이 체크포인트가 포함한 범위를 기반으로 내보내며, 다른 포맷이나 정밀도는 거부됨. 혼합 가중치/활성화 정밀도를 지원하는 내보내기 포맷은 'w8a8'/'w16a16'/'w8a16'/'w8a32' 표기법도 허용함. 지원 중단된 half/int8 플래그(half=True → 16, int8=True → 8, 지원 중단 경고와 함께 여전히 허용됨)를 대체함. 타겟 포맷에서 지원하는 정밀도만 허용됨 (아래 참조). |
dynamic | bool | False | TorchScript, ONNX, OpenVINO, TensorRT 및 CoreML export에서 동적 입력 크기를 허용하여 다양한 이미지 크기를 더욱 유연하게 처리할 수 있습니다. |
simplify | bool | True | 중간 ONNX 그래프를 생성하는 export의 경우 onnxslim을 사용해 그래프를 단순화합니다(Export 형식 참조). 이를 통해 inference 엔진의 성능과 호환성이 향상될 수 있습니다. |
opset | int | None | ONNX 그래프를 생성하는 export의 ONNX opset 버전을 지정합니다(Export 형식 참조). 이를 통해 다양한 ONNX parser 및 runtime과 호환할 수 있습니다. 설정하지 않으면 지원되는 최신 버전을 사용합니다. |
workspace | float 또는 None | None | TensorRT 최적화를 위한 최대 workspace 크기를 GiB 단위로 설정하여 메모리 사용량과 성능의 균형을 맞춥니다. TensorRT가 디바이스의 최대값까지 자동으로 할당하도록 하려면 None을 사용합니다. |
nms | bool, 선택 사항 | None | None은 외부 NMS를 위해 원시 일대다 예측을 내보내고, True은 지원되는 경우 NMS를 내장하며, False는 사용 가능한 경우 NMS가 없는 헤드를 선택합니다. CoreML 내장 NMS는 고정 형태의 detect, segment 및 pose를 지원합니다. End-to-End Detection guide를 참조하세요. |
conf | float | None | export 시 NMS가 생성되는 모든 곳에서 사용하는 confidence threshold입니다: nms=True export, Hailo의 non-end-to-end detect export, 그리고 내부적으로 nms=True을 강제하는 IMX의 detect, pose 및 segment export에 적용됩니다. 설정하지 않으면 기본값은 0.25입니다. |
iou | float | 0.7 | export 시 NMS가 생성되는 모든 곳에서 사용하는 IoU threshold입니다: nms=True export, Hailo의 non-end-to-end detect export, 그리고 내부적으로 nms=True를 강제하는 IMX의 detect, pose 및 segment export에 적용됩니다. |
max_det | int | 300 | 내보낸 모델의 출력에 유지되는 최대 감지 수입니다. 네이티브 NMS 파이프라인에 감지 제한이 없는 CoreML 감지를 제외한 모든 형식의 nms=True 내보내기와 NMS 없는 엔드투엔드 감지 내보내기(사용 가능한 앵커 수로 제한되는 YOLO26 및 YOLOv10), 그리고 IMX의 detect, pose, segment 내보내기에 적용됩니다. |
agnostic_nms | bool | False | 표준 nms=True 파이프라인을 통해 export 시 NMS가 생성되는 모든 곳에서 class-agnostic NMS를 활성화하며, CoreML 자체의 NMS 단계도 포함됩니다. 이를 통해 동일한 클래스 내에서만이 아니라 서로 다른 클래스 간에도 점수가 낮은 겹치는 박스를 억제합니다. Hailo 또는 IMX 자체에서 생성하는 NMS 구성에는 class-agnostic 옵션이 없으므로 이 플래그를 사용해도 적용되지 않으며, 항상 class-aware로 유지됩니다. 또한 NMS가 없는 end-to-end export(YOLO26, YOLOv10)에도 내장됩니다. 이 경우 동일한 detection이 여러 클래스 레이블로 나타나는 것(IoU=1.0 중복)만 방지하며, 서로 다른 박스 간의 IoU threshold 억제에는 영향을 주지 않습니다. |
batch | int | 1 | export된 모델의 batch inference 크기 또는 predict 모드에서 export된 모델이 동시에 처리할 최대 이미지 수를 지정합니다. Edge TPU export의 경우 자동으로 1로 설정됩니다. |
device | str | None | export에 사용할 디바이스를 지정합니다: GPU(device=0), CPU(device=cpu), Apple silicon용 MPS(device=mps), Huawei Ascend NPU(device=npu 또는 device=npu:0) 또는 NVIDIA Jetson용 DLA(device=dla:0 또는 device=dla:1)입니다. TensorRT export는 자동으로 GPU를 사용하지만 TensorRT 11.0은 DLA를 지원하지 않습니다. |
verbose | bool | False | format='engine' export 중 TensorRT builder 로그의 심각도 수준을 VERBOSE로 높입니다. 다른 export 형식에서는 무시됩니다. |
data | str | None | 데이터셋 YAML 파일 경로로, INT8 양자화 캘리브레이션에 필수적임; 분류의 경우 데이터셋 디렉토리나 기본 제공 데이터셋 이름을 대신 사용함. INT8이 활성화된 상태에서 지정되지 않은 경우, Ultralytics는 필요한 경우 태스크별 캘리브레이션 데이터셋을 선택하거나 모델 태스크의 기본 데이터셋으로 대체함. quantize=8로 학습된 체크포인트는 자체 INT8 범위를 포함하고 있으며 캘리브레이션 데이터가 필요하지 않음. |
split | str | 'val' | data에서 INT8 양자화 calibration dataloader를 생성하는 데 사용할 데이터셋 분할('train', 'val' 또는 'test')입니다. |
fraction | float, int 또는 list | 1.0 | INT8 calibration에 사용할 데이터셋 하위 집합입니다. 비율, 이미지 수 또는 [train, val, test] 값으로 지정합니다. 1은 전체 분할을 의미하고, 1보다 큰 정수는 이미지 수를 의미하며, 선택적 test 항목만 0/0.0를 사용해 없음을 나타낼 수 있습니다. 두 항목으로 구성된 목록은 test를 전체로 유지합니다. |
신중한 구성을 통해 export된 모델이 사용 사례에 맞게 최적화되고 대상 환경에서 효과적으로 작동하도록 할 수 있습니다.
Solutions 설정#
Ultralytics Solutions 구성 설정은 객체 수 세기, heatmap 생성, 운동 추적, 데이터 분석, 영역 추적, 대기열 관리 및 영역 기반 수 세기와 같은 작업에 맞게 모델을 유연하게 커스터마이즈할 수 있도록 합니다. 이러한 옵션을 사용하면 특정 요구사항에 맞춰 정확하고 유용한 결과를 쉽게 조정할 수 있습니다.
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
model | str | None | Ultralytics YOLO 모델 파일의 경로입니다. |
region | list 또는 dict | None | 관심 영역을 정의하는 점으로, (x, y) 튜플 목록 또는 여러 영역에 대해 영역 이름을 점 목록에 매핑하는 딕셔너리(RegionCounter만 해당)입니다. None인 경우 영역이 필요한 솔루션은 사전 정의된 기본값으로 대체됩니다. |
show_in | bool | True | 동영상 스트림에 진입 수를 표시할지 제어하는 플래그입니다. |
show_out | bool | True | 동영상 스트림에 이탈 수를 표시할지 제어하는 플래그입니다. |
analytics_type | str | 'line' | 그래프 유형입니다. 즉, line, bar, area 또는 pie입니다. |
colormap | int | cv2.COLORMAP_DEEPGREEN | 히트맵에 사용할 컬러맵입니다. |
line_width | int | 2 | 솔루션이 그리는 박스, 키포인트 및 카운트의 선 두께입니다. |
verbose | bool | True | 입력 형태, 클래스별 개수 및 처리 속도의 프레임별 로그를 활성화합니다. 추적 호출 자체는 항상 로그를 출력하지 않습니다. |
json_file | str | None | 모든 주차 좌표 데이터가 포함된 JSON 파일의 경로입니다. |
up_angle | float | 145.0 | 'up' 포즈의 각도 임계값입니다. |
kpts | list[int] | '[6, 8, 10]' | 운동 모니터링에 사용되는 세 키포인트 인덱스의 목록입니다. 이러한 키포인트는 어깨, 팔꿈치, 손목과 같은 신체 관절 또는 부위에 해당하며, 팔굽혀펴기, 턱걸이, 스쿼트 및 복근 운동과 같은 운동에 사용됩니다. |
down_angle | int | 90 | 'down' 포즈의 각도 임계값입니다. |
blur_ratio | float | 0.5 | 블러 강도의 백분율을 조정하며, 값의 범위는 0.1 - 1.0입니다. |
crop_dir | str | 'cropped-detections' | 크롭된 검출 결과를 저장할 디렉터리 이름입니다. |
records | int | 5 | 보안 알람 시스템으로 이메일을 트리거할 총 검출 개수입니다. |
vision_point | tuple[int, int] | (20, 20) | VisionEye Solution을 사용하여 비전이 객체를 추적하고 경로를 그릴 지점입니다. |
source | str | None | 입력 소스(동영상, RTSP 등)의 경로입니다. Solutions 명령줄 인터페이스(CLI)에서만 사용할 수 있습니다. |
figsize | tuple[float, float] | (12.8, 7.2) | 히트맵이나 그래프와 같은 분석 차트의 그림 크기입니다. |
fps | float | 30.0 | 속도 계산에 사용되는 초당 프레임 수입니다. |
max_hist | int | 5 | 속도 및 방향 계산을 위해 객체당 추적할 최대 과거 지점 수입니다. |
meter_per_pixel | float | 0.05 | 픽셀 거리를 실제 단위로 변환하는 데 사용되는 배율입니다. |
max_speed | int | 120 | 시각적 오버레이의 최대 속도 제한입니다(알림에 사용됨). |
data | str | 'images' | 유사도 검색에 사용되는 이미지 디렉터리의 경로입니다. |
imgsz | int | 640 | 모델 추론을 위한 입력 이미지 크기입니다. |
증강 설정#
데이터 증강 기법은 학습 데이터에 변화를 도입하여 모델이 보지 못한 데이터에 더 잘 일반화하도록 함으로써 YOLO 모델의 견고성과 성능을 향상하는 데 필수적입니다. 다음 표에서는 각 증강 인자의 목적과 효과를 설명합니다:
| 인수 | 유형 | 기본값 | 지원되는 작업 | 범위 | 설명 |
|---|---|---|---|---|---|
hsv_h | float | 0.015 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 이미지의 색조를 색상환의 일정 비율만큼 조정하여 색상 변화를 도입합니다. 다양한 조명 조건에서 모델이 일반화하는 데 도움이 됩니다. classify의 경우 auto_augment=None일 때만 적용됩니다. |
hsv_s | float | 0.7 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 이미지의 채도를 일정 비율만큼 변경하여 색상의 강도에 영향을 줍니다. 다양한 환경 조건을 시뮬레이션하는 데 유용합니다. classify의 경우 auto_augment=None일 때만 적용됩니다. |
hsv_v | float | 0.4 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 이미지의 값(밝기)을 일정 비율만큼 변경하여 다양한 조명 조건에서 모델이 잘 작동하도록 합니다. classify의 경우 auto_augment=None일 때만 적용됩니다. |
degrees | float | 0 | detect, segment, semantic, depth, pose, obb | 0.0 - 180 | 지정된 각도 범위 내에서 이미지를 무작위로 회전하여 다양한 방향의 객체를 인식하는 모델의 능력을 향상합니다. |
translate | float | 0.1 | detect, segment, semantic, depth, pose, obb | 0.0 - 1.0 | 이미지 크기의 일정 비율만큼 이미지를 수평 및 수직으로 이동하여 부분적으로 보이는 객체를 detection하는 방법을 학습하도록 돕습니다. |
scale | float | tuple | 0.5 | detect, segment, semantic, depth, classify, pose, obb | 0 - 1 또는 명시적인 (min, max) 튜플(classify에는 해당하지 않음) | gain factor로 이미지 크기를 조정하여 카메라에서 서로 다른 거리에 있는 객체를 시뮬레이션합니다. |
shear | float | 0 | detect, segment, semantic, depth, pose, obb | -180 - +180 | 지정된 각도만큼 이미지를 전단하여 서로 다른 각도에서 객체를 보는 효과를 모방합니다. |
perspective | float | 0 | detect, segment, semantic, depth, pose, obb | 0.0 - 0.001 | 이미지에 무작위 perspective 변환을 적용하여 3D 공간의 객체를 이해하는 모델의 능력을 향상합니다. |
flipud | float | 0 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 지정된 확률로 이미지를 상하 반전하여 객체의 특성에는 영향을 주지 않으면서 데이터 변화를 늘립니다. |
fliplr | float | 0.5 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 지정된 확률로 이미지를 좌우 반전하여 대칭적인 객체를 학습하고 데이터셋의 다양성을 높이는 데 유용합니다. |
bgr | float | 0 | detect, segment, semantic, depth, pose, obb | 0.0 - 1.0 | 지정된 확률로 이미지 채널을 RGB에서 BGR로 반전하여 잘못된 채널 순서에 대한 견고성을 높이는 데 유용합니다. |
mosaic | float | 1 | detect, segment, semantic, pose, obb | 0.0 - 1.0 | 4개의 학습 이미지를 하나로 결합하여 다양한 장면 구성과 객체 상호작용을 시뮬레이션합니다. 복잡한 장면 이해에 매우 효과적입니다. |
mixup | float | 0 | detect, segment, semantic, pose, obb | 0.0 - 1.0 | 두 이미지와 해당 레이블을 혼합하여 합성 이미지를 생성합니다. 레이블 노이즈와 시각적 변화를 도입하여 모델의 일반화 능력을 향상합니다. |
cutmix | float | 0 | detect, segment, pose, obb | 0.0 - 1.0 | 두 이미지의 일부를 결합하여 각 영역을 구분하면서 부분적으로 혼합된 이미지를 생성합니다. 가림 상황을 만들어 모델의 견고성을 향상합니다. |
copy_paste | float | 0 | segment, obb | 0.0 - 1.0 | 붙여 넣을 수 있는 객체의 비율입니다. flip은 이미지 내부에서 객체을 미러링하고, mixup은 이 값을 이미지 간 적용 확률로도 사용합니다. |
copy_paste_mode | str | flip | segment, obb | - | 사용할 copy-paste 전략을 지정합니다. 옵션에는 'flip' 및 'mixup'가 포함됩니다. |
auto_augment | str | randaugment | classify | - | 사전 정의된 증강 정책('randaugment', 'autoaugment' 또는 'augmix')을 적용하여 시각적 다양성을 통해 모델 성능을 향상합니다. |
erasing | float | 0.4 | classify | 0.0 - 1.0 | 학습 중 이미지 영역을 무작위로 지워 모델이 덜 명확한 특징에 집중하도록 합니다. |
augmentations | list | None | detect, segment, semantic, depth, pose, obb | - | 고급 데이터 증강을 위한 사용자 지정 Albumentations 변환(Python API 전용)입니다. 특수한 증강 요구사항을 위해 변환 객체 목록을 허용합니다. |
데이터셋과 작업 요구사항에 맞게 이러한 설정을 조정하십시오. 다양한 값을 실험하면 최상의 모델 성능을 위한 최적의 증강 전략을 찾는 데 도움이 됩니다.
로깅, 체크포인트 및 플로팅 설정#
YOLO 모델을 학습할 때 로깅, 체크포인트, 플로팅 및 파일 관리가 중요합니다:
- 로깅: TensorBoard와 같은 라이브러리를 사용하거나 파일에 기록하여 모델의 진행 상황을 추적하고 문제를 진단합니다.
- 체크포인트: 정기적으로 모델을 저장하여 학습을 재개하거나 다양한 구성을 실험합니다.
- 플로팅: Matplotlib 또는 TensorBoard와 같은 라이브러리를 사용하여 성능과 학습 진행 상황을 시각화합니다.
- 파일 관리: 체크포인트, 로그 파일 및 플롯과 같이 학습 중 생성된 파일을 쉽게 액세스하고 분석할 수 있도록 정리합니다.
이러한 측면을 효과적으로 관리하면 진행 상황을 추적하고 디버깅과 최적화를 쉽게 수행할 수 있습니다.
| 인수 | 기본값 | 설명 |
|---|---|---|
project | None | 학습 실행을 저장할 루트 디렉터리를 지정합니다. 지정하지 않으면 실행 결과가 runs/<task> 아래에 저장됩니다. 각 실행 결과는 별도의 하위 디렉터리에 저장됩니다. |
name | None | 실험 이름을 정의합니다. 지정하지 않으면 YOLO는 모드 이름을 사용하고 각 실행마다 이름을 증가시켜(예: train, train-2) 덮어쓰기를 방지합니다. |
exist_ok | False | 기존 실험 디렉터리를 덮어쓸지 여부를 제어합니다. True은 덮어쓰기를 허용하고 False은 방지합니다. |
plots | True | 학습 및 검증 플롯의 생성과 저장을 제어합니다. True으로 설정하면 손실 곡선, 정밀도-재현율 곡선 및 샘플 예측과 같은 플롯을 생성하여 성능을 시각적으로 추적할 수 있습니다. |
save | True | 학습 체크포인트와 최종 모델 가중치의 저장을 활성화합니다. True으로 설정하면 모델 상태를 주기적으로 저장하여 학습 재개 또는 모델 배포를 가능하게 합니다. |
사용자 지정 구성 파일#
저장된 YAML을 로드하여 인라인으로 전달하지 않고 전체 인자 세트를 재사용합니다. cfg 인자는 default.yaml의 값을 재정의하며, 함께 전달된 추가 인자는 계속 우선 적용됩니다.
| 인수 | 기본값 | 설명 |
|---|---|---|
cfg | None | 값이 default.yaml 항목을 대체하는 YAML 파일의 경로입니다. 실제 CLI 예시는 기본 구성 파일 재정의를 참조하십시오. |
FAQ#
정확도에 영향을 미치는 주요 하이퍼파라미터는 다음과 같습니다:
- 배치 크기 (
batch): 크기가 클수록 학습을 안정화할 수 있지만 더 많은 메모리가 필요합니다. - 학습률 (
lr0): 학습률이 낮으면 세밀하게 조정할 수 있지만 수렴이 느려집니다. - Momentum (
momentum): gradient vector를 가속하고 진동을 완화합니다. - 이미지 크기 (
imgsz): 크기가 클수록 정확도가 향상되지만 계산 부하가 증가합니다.
데이터셋과 하드웨어에 따라 이러한 값을 조정하십시오. 자세한 내용은 Train 설정에서 확인할 수 있습니다.
- 배치 크기 (
학습률(
lr0)은 매우 중요합니다. SGD에는0.01, Adam optimizer에는0.001부터 시작하십시오. 지표를 모니터링하고 필요에 따라 조정하십시오. cosine learning rate scheduler(cos_lr) 또는 warmup(warmup_epochs,warmup_momentum)을 사용하십시오. 자세한 내용은 Train 가이드에 있습니다.기본 설정에는 다음이 포함됩니다:
- Confidence Threshold (
conf=0.25): detection에 필요한 최소 confidence입니다. - IoU Threshold (
iou=0.7): Non-Maximum Suppression (NMS)에 사용됩니다. - 이미지 크기 (
imgsz=640): 입력 이미지를 리사이즈합니다. - Device (
device=None): CPU, GPU, Apple MPS 또는 Huawei Ascend NPU(npu)를 선택합니다.
전체 개요는 Predict 설정과 Predict 가이드를 참조하십시오.
- Confidence Threshold (