Ultralytics YOLO 모델 학습#
소개#
딥러닝 모델 학습은 데이터를 주입하고 매개변수를 조정하여 정확한 예측을 수행할 수 있도록 하는 과정을 포함합니다. Ultralytics YOLO26의 학습 모드는 현대적인 하드웨어 성능을 온전히 활용하여 객체 검출 모델을 효과적이고 효율적으로 학습할 수 있도록 설계되었습니다. 이 가이드는 YOLO26의 강력한 기능 세트를 사용하여 자신만의 모델 학습을 시작하는 데 필요한 모든 세부 정보를 다루는 것을 목표로 합니다. 아직 Ultralytics를 설치하지 않았다면 빠른 시작 가이드부터 시작하십시오.
예정된 학습 예제는 미출시 YOLO27 미리보기를 참조하십시오.
Watch: How to Train a YOLO model on Your Custom Dataset in Google Colab.
학습을 위해 Ultralytics YOLO를 선택해야 하는 이유는 무엇입니까?#
YOLO26의 학습 모드를 선택해야 하는 몇 가지 강력한 이유는 다음과 같습니다.
- 효율성: 단일 GPU 설정이든 여러 GPU로 확장하는 경우든 하드웨어를 최대한 활용할 수 있습니다.
- 범용성: COCO, VOC, ImageNet과 같이 손쉽게 사용할 수 있는 데이터셋뿐만 아니라 사용자 정의 데이터셋에서도 학습할 수 있습니다.
- 사용자 친화성: 간단하면서도 강력한 CLI 및 Python 인터페이스를 통해 직관적인 학습 경험을 제공합니다.
- 하이퍼파라미터 유연성: 모델 성능을 미세 조정할 수 있는 광범위한 사용자 정의 가능 하이퍼파라미터를 제공합니다. 더 깊은 제어를 위해 트레이너를 직접 사용자 정의할 수 있습니다.
- 클라우드 학습: 실시간 메트릭과 자동 체크포인트를 제공하는 Ultralytics Platform을 통해 클라우드 GPU에서 학습할 수 있습니다.
학습 모드의 주요 기능#
다음은 YOLO26 학습 모드의 몇 가지 주요 기능입니다.
- 자동 데이터셋 다운로드: 다운로드 소스가 포함된 데이터셋 구성은 첫 사용 시
yolo train data=coco8.yaml과 같이 자동으로 다운로드됩니다. 지원되는 형식 및 데이터셋에 대한 자세한 내용은 데이터셋 개요를 참조하십시오. - 멀티 GPU 지원: 여러 GPU에서 학습 작업을 원활하게 확장하여 프로세스를 가속화할 수 있습니다.
- 하이퍼파라미터 구성: YAML 구성 파일이나 CLI 인수를 통해 하이퍼파라미터를 수정할 수 있는 옵션을 제공합니다.
- 시각화 및 모니터링: 더 나은 인사이트를 얻기 위해 학습 메트릭을 실시간으로 추적하고 학습 과정을 시각화합니다.
사용 예시#
이미지 크기 640으로 COCO8 데이터셋에서 YOLO26n을 100 에포크 동안 학습합니다. 학습 장치는 device 인수를 사용하여 지정할 수 있습니다. 인수가 전달되지 않으면 사용 가능한 경우 GPU device=0가 사용되고, 그렇지 않으면 device='cpu'이 사용됩니다. 전체 학습 인수 목록은 아래의 인수 섹션을 참조하십시오.
Windows에서는 스크립트로 학습을 시작할 때 RuntimeError이 발생할 수 있습니다. 이를 해결하려면 학습 코드 앞에 if __name__ == "__main__": 블록을 추가하십시오.
장치는 자동으로 결정됩니다. GPU를 사용할 수 있는 경우 GPU가 사용되며(기본 CUDA 장치 0), 그렇지 않으면 CPU에서 학습이 시작됩니다.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n.yaml") # build a new model from YAML
model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training)
model = YOLO("yolo26n.yaml").load("yolo26n.pt") # build from YAML and transfer weights
# Train the model
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)멀티 GPU 학습#
멀티 GPU 학습은 여러 GPU에 학습 부하를 분산하여 사용 가능한 하드웨어 리소스를 보다 효율적으로 활용할 수 있도록 해줍니다. 이 기능은 Python API와 커맨드 라인 인터페이스 모두에서 사용할 수 있습니다. 멀티 GPU 학습을 활성화하려면 사용하려는 GPU 장치 ID를 지정하십시오.
2개의 GPU(CUDA 장치 0 및 1)로 학습하려면 다음 명령을 사용하십시오. 필요에 따라 추가 GPU로 확장하십시오.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training)
# Train the model with 2 GPUs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=[0, 1])
# Train the model with the two most idle GPUs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=[-1, -1])torch>=2.4용 공식 PyTorch 휠을 사용하는 경우 Windows에서 멀티 GPU 학습이 작동하지 않습니다. Ultralytics는 torch.distributed.run을 통해 DDP를 실행하며, 그 렌데즈부(rendezvous) 단계는 PyTorch 2.4 이후 기본값으로 libuv 백엔드를 사용하는 TCPStore를 빌드하지만, 공식 Windows 휠은 libuv 없이 빌드됩니다. 학습이 즉시 종료되며 다음이 발생합니다:
RuntimeError: use_libuv was requested but PyTorch was built without libuv support
USE_LIBUV=0을(를) 설정해도 렌데즈부가 TCPStore을 직접 구성하고 해당 코드 경로가 변수를 읽지 않기 때문에 이 문제가 해결되지 않습니다. 여러 GPU를 사용하려면 Linux 또는 WSL2에서 학습하거나, Windows에서 device=0(으)로 단일 GPU 학습을 수행하십시오.
여러 장치를 지정하면(예: device=[0, 1]), Ultralytics는 내부적으로 새로운 트레이너 인스턴스를 생성하고 내부적으로 torch.distributed.run을 실행합니다. 이는 표준 CLI 사용 및 수정되지 않은 Python 스크립트에 대해 원활하게 작동합니다.
그러나 스크립트에 커스텀 트레이너, 검증기, 데이터셋, 데이터 증강 파이프라인 등의 사용자 정의 컴포넌트가 포함되어 있는 경우, 이러한 객체는 자동으로 직렬화되어 DDP 하위 프로세스로 전송될 수 없습니다. 이 경우 torch.distributed.run을(를) 사용하여 스크립트를 직접 실행해야 합니다:
python -m torch.distributed.run --nproc_per_node 2 your_training_script.pyAMD GPU 학습은 표준 device=0 또는 device=cuda:0 구문과 함께 PyTorch ROCm 빌드를 사용합니다. 설치 방법 및 현재 MIGraphX, DirectML, Ryzen AI NPU 지원 상태에 대해서는 AMD 통합 가이드를 참조하십시오.
Intel GPU 학습은 device=xpu:0 또는 XCCL을 제공하는 PyTorch 빌드의 여러 XPU ID를 사용합니다.
화웨이 어센드 NPU 학습#
Ultralytics는 torch_npu을 통해 화웨이 Ascend NPU에서의 학습 및 검증을 지원합니다. Ascend Extension for PyTorch 설치 가이드에 따라 상호 호환되는 CANN, PyTorch 및 torch_npu 버전을 설치한 다음, Ultralytics를 시작하기 전에 CANN 환경을 소스(source)하십시오.
source /usr/local/Ascend/ascend-toolkit/set_env.shfrom ultralytics import YOLO
model = YOLO("yolo26n.pt")
# Train on one Ascend NPU
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="npu:0")
# Train across two Ascend NPUs with HCCL
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="npu:0,1")AMP, 검증, 체크포인팅, 재개를 포함한 표준 학습 기능은 활성 NPU를 사용합니다. AutoBatch는 단일 NPU 학습에 사용할 수 있으며, 다중 NPU ID는 HCCL을 통해 분산 학습을 시작합니다. 학습 후 모델 내보내기 및 배포에 대해서는 화웨이 Ascend 통합 가이드를 참조하십시오.
유휴 GPU 학습#
유휴 GPU 학습은 멀티 GPU 시스템에서 사용량이 가장 적은 GPU를 자동으로 선택하여 수동 GPU 선택 없이 리소스 사용을 최적화합니다. 이 기능은 사용률 지표와 VRAM 가용성을 기반으로 사용 가능한 GPU를 식별합니다.
학습을 위해 가장 유휴 상태인 GPU를 자동으로 선택하고 사용하려면 -1 장치 파라미터를 사용하십시오. 이는 공유 컴퓨팅 환경이나 여러 사용자가 있는 서버에서 특히 유용합니다.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training)
# Train using the single most idle GPU
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=-1)
# Train using the two most idle GPUs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device=[-1, -1])자동 선택 알고리즘은 다음 항목을 우선시합니다:
- 더 낮은 현재 사용률 백분율
- 더 높은 사용 가능한 메모리(여유 VRAM)
- 더 낮은 온도 및 전력 소비
이 기능은 공유 컴퓨팅 환경에서나 서로 다른 모델에 걸쳐 여러 학습 작업을 실행할 때 특히 유용합니다. 변경되는 시스템 조건에 자동으로 적응하여 수동 개입 없이 최적의 리소스 할당을 보장합니다.
Apple Silicon MPS 학습#
Ultralytics YOLO 모델에 통합된 Apple 실리콘 칩 지원을 통해 이제 강력한 금속 성능 셰이버(MPS) 프레임워크를 활용하는 장치에서 모델을 학습할 수 있습니다. MPS는 Apple의 커스텀 실리콘에서 연산 및 이미지 처리 작업을 실행하는 고성능 방식을 제공합니다.
Apple 실리콘 칩에서 학습을 활성화하려면 학습 프로세스를 시작할 때 장치로 'mps'를 지정해야 합니다. 아래는 Python 및 커맨드 라인을 통해 이를 수행할 수 있는 방법을 보여주는 예제입니다:
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training)
# Train the model with MPS
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="mps")Apple 실리콘 칩의 연산 능력을 활용하면서 학습 작업을 더욱 효율적으로 처리할 수 있습니다. 보다 자세한 지침과 고급 구성 옵션에 대해서는 PyTorch MPS 문서를 참조하십시오.
중단된 학습 재개#
이전에 저장된 상태에서 학습을 재개하는 것은 딥러닝 모델 작업 시 중요한 기능입니다. 이는 학습 프로세스가 예기치 않게 중단되었거나 새 데이터로 또는 더 많은 에포크 동안 모델 학습을 계속하고자 할 때 유용할 수 있습니다.
학습이 재개되면 Ultralytics YOLO는 마지막으로 저장된 모델의 가중치를 로드하고 옵티마이저 상태, 학습률 스케줄러, 에포크 번호 및 데이터셋도 복원합니다. 이를 통해 중단된 지점부터 학습 과정을 원활하게 계속 진행할 수 있습니다. 체크포인트의 데이터셋 대신 다른 데이터셋에서 계속 진행하려면 resume와 함께 명시적인 data=을 전달하세요.
train 메서드를 호출할 때 resume 인수를 True(으)로 설정하고 부분적으로 학습된 모델 가중치가 포함된 .pt 파일의 경로를 지정하여 Ultralytics YOLO에서 학습을 쉽게 재개할 수 있습니다.
아래는 Python 및 커맨드 라인을 통해 중단된 학습을 재개하는 방법의 예제입니다:
from ultralytics import YOLO
# Load a model
model = YOLO("path/to/last.pt") # load a partially trained model
# Resume training
results = model.train(resume=True)resume=True을(를) 설정하면 train 함수가 'path/to/last.pt' 파일에 저장된 상태를 사용하여 중단된 지점부터 학습을 계속합니다. resume 인수가 생략되거나 False(으)로 설정된 경우, train 함수는 새로운 학습 세션을 시작합니다.
체크포인트는 기본적으로 모든 에포크가 끝날 때 또는 save_period 인수를 사용하여 고정된 간격으로 저장되므로, 학습 실행을 재개하려면 최소 1 에포크를 완료해야 합니다.
학습 설정#
YOLO 모델의 학습 설정은 학습 과정에서 사용되는 다양한 하이퍼파라미터와 구성을 포괄합니다. 이러한 설정은 모델의 성능, 속도 및 정확도에 영향을 미칩니다. 주요 학습 설정에는 배치 크기, 학습률, 모멘텀 및 가중치 감쇠가 포함됩니다. 또한 옵티마이저, 손실 함수, 학습 데이터셋 구성의 선택이 학습 과정에 영향을 미칠 수 있습니다. 이러한 설정을 신중하게 조정하고 실험하는 것은 성능을 최적화하는 데 매우 중요합니다.
MuSGD 옵티마이저#
YOLO26에서 MuSGD는 표준 SGD 업데이트와 Muon 스타일 직교화 업데이트를 결합한 하이브리드 옵티마이저입니다.
직교화된 Muon 업데이트가 최적화를 안정화하는 데 도움이 될 수 있는 더 긴 YOLO26 학습 실행 및 더 큰 데이터셋에 권장됩니다.
2D 선형 가중치와 4D 컨볼루션 필터(2D로 재형상화됨)만 SGD와 함께 Muon 스타일 업데이트를 받으며, 배치 정규화 가중치 및 편향 항과 같은 다른 모든 파라미터는 표준 SGD로 유지됩니다.
optimizer=auto이 사용되면 Ultralytics는 더 긴 학습 실행(일반적으로 반복 횟수 > 10000)에 대해 MuSGD를 자동으로 선택합니다. 더 짧은 실행의 경우 트레이너는 AdamW로 폴백합니다.
사용 예제:
yolo train model=yolo26n.pt data=coco8.yaml optimizer=MuSGDultralytics/optim/muon.py의 구현과 BaseTrainer.build_optimizer의 옵티마이저 자동 선택 로직을 참조하십시오.
| 인수 | 유형 | 기본값 | 설명 |
|---|---|---|---|
model | str | None | 학습에 사용할 모델 파일을 지정합니다. .pt 사전 학습 모델 또는 .yaml 구성 파일의 경로를 허용합니다. 모델 구조를 정의하거나 가중치를 초기화하는 데 필수적입니다. |
data | str | None | 데이터셋 YAML의 경로(예: coco8.yaml)입니다. 여기에는 학습 및 검증 데이터의 경로, 클래스 이름 및 클래스 수가 포함됩니다. 분류의 경우 데이터셋 디렉터리 또는 기본 제공 데이터셋 이름(예: imagenet10)을 사용합니다. |
epochs | int | 100 | 총 학습 에포크 수입니다. 각 에포크는 전체 데이터셋을 한 번 모두 처리하는 것을 의미합니다. 이 값을 조정하면 학습 기간과 모델 성능에 영향을 줄 수 있습니다. |
time | float | None | 최대 학습 시간(시간 단위)입니다. 설정하면 epochs 인수를 재정의하여 지정된 시간이 지나면 학습을 자동으로 중지합니다. 시간이 제한된 학습 시나리오에 유용합니다. |
patience | int | 100 | 검증 지표가 개선되지 않을 때 학습을 조기 중지하기 전에 기다릴 에포크 수입니다. 성능이 정체될 때 학습을 중지하여 과적합을 방지하는 데 도움이 됩니다. |
batch | int 또는 float | 16 | 세 가지 모드를 지원하는 배치 크기입니다. 정수로 설정하는 방식(예: batch=16), GPU 메모리 사용률 60%를 위한 자동 모드(batch=-1), 지정된 사용률 분율을 사용하는 자동 모드(batch=0.70)가 있습니다. |
imgsz | int | 640 | 학습 대상 이미지 크기입니다. rect=False인 경우 이미지가 지정된 값과 변의 길이가 같은 정사각형으로 조정되며, YOLO 모델에서는 종횡비를 유지하지만 RT-DETR에서는 유지하지 않습니다. 모델 정확도와 계산 복잡도에 영향을 줍니다. |
save | bool | True | 학습 체크포인트와 최종 모델 가중치를 저장할 수 있도록 합니다. 학습 재개 또는 모델 배포에 유용합니다. |
save_period | int | -1 | 모델 체크포인트를 저장하는 주기를 에포크 단위로 지정합니다. -1 값은 이 기능을 비활성화합니다. 장시간 학습 중 중간 모델을 저장하는 데 유용합니다. |
cache | bool | False | 데이터셋 이미지를 메모리(True/ram) 또는 디스크(disk)에 캐싱하거나 캐싱을 비활성화(False)합니다. 메모리 사용량이 증가하는 대신 디스크 I/O를 줄여 학습 속도를 향상합니다. |
device | int 또는 str 또는 list | None | 학습에 사용할 컴퓨팅 장치를 지정합니다. 단일 GPU(device=0), 여러 GPU(device=[0,1]), CPU(device=cpu), Apple silicon용 MPS(device=mps), Huawei Ascend NPU(device=npu:0 또는 device=npu:0,1), 유휴 GPU 자동 선택(device=-1) 또는 여러 유휴 GPU 자동 선택(device=[-1,-1])을 사용할 수 있습니다. |
workers | int | 8 | 데이터 로딩을 위한 작업자 스레드 수입니다(Multi-GPU 학습 시 RANK당). 데이터 전처리 및 모델 입력 공급 속도에 영향을 주며, 특히 다중 GPU 설정에서 유용합니다. |
project | str | None | 학습 출력이 저장되는 프로젝트 디렉터리의 이름입니다. 서로 다른 실험을 체계적으로 저장할 수 있습니다. |
name | str | None | 학습 실행의 이름입니다. 프로젝트 폴더 내에 하위 디렉터리를 생성하는 데 사용되며, 해당 디렉터리에 학습 로그와 출력이 저장됩니다. |
exist_ok | bool | False | True인 경우 기존 프로젝트/이름 디렉터리를 덮어쓸 수 있습니다. 이전 출력을 수동으로 삭제하지 않고 반복적으로 실험하는 데 유용합니다. |
save_dir | str | None | 실행 출력이 저장되는 정확한 디렉터리를 지정하여 project/name 조합을 재정의합니다. 경로는 자동으로 번호를 증가시키지 않고 그대로 사용되므로 연속 실행에서 동일한 디렉터리를 재사용합니다. |
pretrained | bool 또는 str | True | 사전 학습된 가중치로 학습을 시작할지 결정합니다. 부울 값 또는 로드할 가중치의 문자열 경로로 설정할 수 있습니다. pretrained=False은 모델 아키텍처를 유지하면서 무작위로 초기화된 가중치에서 학습합니다. |
cls_remap | bool | True | 데이터셋 간에 파인튜닝할 때 클래스 이름이 일치하는 경우 사전 학습된 분류 헤드의 행을 새 모델에 복사합니다. 따라서 겹치는 클래스는 학습된 바이어스를 유지하며, 헤드 너비가 변경되지 않은 경우 해당 가중치도 유지합니다. 클래스 수가 다르거나 클래스 순서가 달라도 적용됩니다. |
optimizer | str | 'auto' | 학습에 사용할 옵티마이저를 선택합니다. SGD, MuSGD, Adam, Adamax, AdamW, NAdam, RAdam, RMSProp 또는 auto을 사용하여 학습 반복 횟수에 따라 AdamW 또는 MuSGD을 선택할 수 있습니다. 수렴 속도와 안정성에 영향을 줍니다. |
seed | int | 0 | 학습을 위한 랜덤 시드를 설정하여 동일한 구성으로 실행할 때 결과를 재현할 수 있도록 합니다. |
deterministic | bool | True | 결정론적 알고리즘 사용을 강제합니다. 재현성을 보장하지만 비결정론적 알고리즘의 제한으로 인해 성능과 속도에 영향을 줄 수 있습니다. |
verbose | bool | True | 학습 중 상세 출력을 활성화하여 콘솔에 진행률 표시줄, 에포크별 지표 및 추가 학습 정보를 표시합니다. |
single_cls | bool | False | 다중 클래스 데이터셋의 모든 클래스를 학습 중 하나의 클래스로 처리합니다. 이진 분류 작업이나 분류보다 객체 존재 여부에 집중할 때 유용합니다. |
classes | list[int] | None | 학습할 클래스 ID 목록을 지정합니다. 학습 중 특정 클래스만 필터링하고 집중하는 데 유용합니다. |
rect | bool | False | 최소 패딩 전략을 활성화합니다. 배치 내 이미지에 공통 크기에 도달하는 데 필요한 최소한의 패딩을 적용하며, 가장 긴 변은 imgsz과 같습니다. 효율성과 속도를 향상할 수 있지만 모델 정확도에 영향을 줄 수 있습니다. |
multi_scale | float | 0.0 | 각 배치에서 imgsz을 +/- multi_scale만큼 무작위로 변경합니다(예: 0.25 -> 0.75x에서 1.25x까지). 모델 stride의 배수로 반올림하며, 0.0는 멀티 스케일 학습을 비활성화합니다. |
cos_lr | bool | False | 코사인 학습률 스케줄러를 사용하여 에포크에 따라 코사인 곡선을 따르도록 학습률을 조정합니다. 더 나은 수렴을 위해 학습률을 관리하는 데 도움이 됩니다. |
close_mosaic | int | 10 | 완료 전 학습을 안정화하기 위해 마지막 N개 에포크에서 모자이크 데이터 증강을 비활성화합니다. 0으로 설정하면 이 기능이 비활성화됩니다. |
resume | bool | False | 마지막으로 저장된 체크포인트에서 학습을 재개합니다. 모델 가중치, 옵티마이저 상태 및 에포크 수를 자동으로 로드하여 학습을 원활하게 계속합니다. |
amp | bool 또는 str | True | 학습 정밀도를 설정합니다. True 또는 "fp16"은 FP16을 사용하고, "bf16"는 지원되는 CUDA 장치에서 BF16을 사용하며, False 또는 "fp32"는 FP32를 사용합니다. |
quantize | int 또는 str | None | INT8 양자화 인식 학습(QAT)을 위해 8(또는 "int8")으로 설정합니다. 이 학습은 루프 내에서 가상 양자화를 사용하여 미세 조정하므로 가중치가 INT8 내보내기에 적합해집니다. 양자화 인식 학습(Quantization-Aware Training)을 참조하세요. |
fraction | float, int 또는 list | 1.0 | 데이터셋 하위 집합을 비율/개수 또는 [train, val, test] 목록으로 지정합니다. 1은 전체 분할을 의미하고, 1보다 큰 정수는 이미지 개수이며, 선택 사항인 test 항목에서만 0/0.0를 사용하여 없음을 의미할 수 있습니다. 두 항목 목록에서는 test를 전체로 유지합니다. |
profile | bool | False | 학습 중 ONNX 및 TensorRT 속도 프로파일링을 활성화하여 모델 배포 최적화에 유용하게 합니다. |
freeze | int 또는 list | None | 모델의 첫 N개 레이어 또는 인덱스나 모듈 이름으로 지정한 특정 레이어(23.cv2, 앞의 model. 제외)를 고정하여 학습 가능한 파라미터 수를 줄입니다. 파인튜닝 또는 전이 학습에 유용합니다. |
lr0 | float | 0.01 | 초기 학습률(즉, SGD=1E-2, Adam=1E-3)입니다. 이 값은 최적화 과정에 매우 중요하며 모델 가중치가 업데이트되는 속도에 영향을 줍니다. |
lrf | float | 0.01 | 초기 학습률의 비율로 나타낸 최종 학습률 = (lr0 * lrf)이며, 스케줄러와 함께 사용하여 시간에 따라 학습률을 조정합니다. |
momentum | float | 0.937 | SGD의 모멘텀 계수 또는 Adam 옵티마이저의 beta1로, 현재 업데이트에 과거 그래디언트를 반영하는 정도에 영향을 줍니다. |
weight_decay | float | 0.0005 | L2 정규화 항으로, 과적합을 방지하기 위해 큰 가중치에 페널티를 부여합니다. |
warmup_epochs | float | 3.0 | 학습률 워밍업 에포크 수입니다. 초기 학습률을 안정화하기 위해 낮은 값에서 초기 학습률까지 학습률을 점진적으로 증가시킵니다. |
warmup_momentum | float | 0.8 | 워밍업 단계의 초기 모멘텀으로, 워밍업 기간 동안 설정된 모멘텀에 점진적으로 맞춰집니다. |
warmup_bias_lr | float | 0.1 | 워밍업 단계에서 바이어스 파라미터에 사용할 학습률로, 초기 에포크의 모델 학습을 안정화하는 데 도움이 됩니다. 기본 optimizer='auto'에서는 자동으로 0.0으로 설정되므로 이를 사용하려면 옵티마이저 이름을 명시적으로 지정해야 합니다. |
distill_model | str | None | 지식 증류에 사용할 교사 모델 체크포인트의 경로(예: yolo26x.pt)입니다. 설정하면 고정된 교사의 안내를 받는 추가 증류 손실을 사용하여 학생 모델을 학습합니다. |
dis | float | 6.0 | 표준 감지 손실에 추가되는 증류 손실의 가중치입니다. 값이 클수록 교사의 특징 안내가 미치는 영향이 커집니다. |
box | float | 7.5 | 손실 함수의 박스 손실 구성 요소 가중치로, BBox 좌표를 정확하게 예측하는 데 두는 비중에 영향을 줍니다. |
cls | float | 0.5 | 전체 손실 함수에서 분류 손실의 가중치로, 다른 구성 요소에 비해 올바른 클래스 예측의 중요도에 영향을 줍니다. |
cls_pw | float | 0.0 | 역클래스 빈도를 사용하여 클래스 불균형을 처리하기 위한 클래스 가중치의 지수입니다. 0.0은 클래스 가중치를 비활성화하고, 1.0은 전체 역빈도 가중치를 적용합니다. 0과 1 사이의 값은 부분적인 가중치를 제공합니다. |
dfl | float | 1.5 | 박스 거리 회귀 항의 가중치입니다. 감지 헤드가 reg_max > 1을 사용하는 경우에는 분포 초점 손실(DFL)이고, DFL이 없는 YOLO26(reg_max: 1)에서는 정규화된 박스 거리에 대한 L1 손실입니다. |
pose | float | 12.0 | 포즈 추정용으로 학습된 모델에서 포즈 손실의 가중치로, 포즈 키포인트를 정확하게 예측하는 데 두는 비중에 영향을 줍니다. |
kobj | float | 1.0 | 포즈 추정 모델에서 키포인트 객체성 손실의 가중치로, 감지 신뢰도와 포즈 정확도 사이의 균형을 조정합니다. |
rle | float | 1.0 | 포즈 추정 모델에서 잔차 로그 가능도 추정 손실의 가중치로, 키포인트 위치 지정의 정밀도에 영향을 줍니다. |
angle | float | 1.0 | obb 모델에서 각도 손실의 가중치로, 방향성 BBox 각도 예측의 정밀도에 영향을 줍니다. |
dlog | float | 1.0 | 깊이 추정 모델에서 스케일 불변 로그(SILog) 손실의 가중치로, 깊이 정확도를 결정하는 주요 항입니다. |
dgrad | float | 0.5 | 깊이 추정 모델에서 그래디언트 손실의 가중치로, 깊이 경계의 오류에 페널티를 부여하고 더 선명한 표면 경계를 유도합니다. |
dlam | float | 1.0 | 깊이 추정 모델에서 SILog 손실의 분산 집중 계수입니다. 1.0은 손실을 완전히 스케일 불변으로 만들고, 0.0은 이를 일반 로그-RMSE로 줄입니다. |
nbs | int | 64 | 손실 정규화를 위한 기준 배치 크기입니다. |
overlap_mask | bool | True | 객체 마스크를 학습을 위해 하나의 마스크로 병합할지, 객체별로 분리하여 유지할지 결정합니다. 겹치는 경우 병합 중 더 작은 마스크를 더 큰 마스크 위에 겹쳐 놓습니다. |
mask_ratio | int | 4 | 세그멘테이션 마스크의 다운샘플링 비율로, 학습 중 사용되는 마스크의 해상도에 영향을 줍니다. |
dropout | float | 0.0 | 분류 작업의 정규화를 위한 드롭아웃 비율로, 학습 중 유닛을 무작위로 생략하여 과적합을 방지합니다. |
val | bool | True | 학습 중 검증을 활성화하여 별도의 데이터셋에서 모델 성능을 주기적으로 평가할 수 있도록 합니다. |
nms | bool, 선택 사항 | None | 에폭 검증, 체크포인트 선택 및 조기 종료에 사용되는 추론 헤드를 선택합니다. None 또는 True은 NMS가 포함된 일대다 방식을 사용하고, False는 사용 가능한 경우 NMS가 없는 헤드를 사용합니다. 두 헤드 모두 학습 손실을 유지합니다. |
plots | bool | True | 학습 및 검증 지표와 예측 예시의 플롯을 생성하고 저장하여 모델 성능과 학습 진행 상황을 시각적으로 파악할 수 있도록 합니다. |
compile | bool 또는 str | False | PyTorch 2.x torch.compile 그래프 컴파일을 backend='inductor'과 함께 활성화합니다. True → "default", False → 비활성화 또는 "default", "reduce-overhead", "max-autotune-no-cudagraphs"과 같은 문자열 모드를 사용할 수 있습니다. 지원되지 않는 경우 경고와 함께 eager 모드로 대체됩니다. |
channels_last | bool | None | 학습 중 합성곱에 channels_last (NHWC) 메모리 포맷을 사용합니다. None 설정은 PyTorch 1.11 버전 이상을 사용하는 CUDA 환경에서 자동으로 이를 활성화하지만, 성능이 더 느리게 측정된 Windows 환경은 예외로 합니다. False 설정은 이를 비활성화하며, True 설정은 명시적으로 이를 요청합니다. PyTorch 1.10 버전 이하, CPU, 그리고 MPS 환경에서는 기본적으로 NCHW를 유지합니다. |
max_det | int | 300 | 학습 검증 중 이미지당 최대 감지 횟수입니다. detect, segment, pose, OBB의 경우 기본값 300은 해당 개수가 300을 초과할 때만 가장 큰 학습/검증 레이블 지정 객체 수로 증가합니다. 다른 값은 고정된 상태로 유지되며, 한도를 초과하면 경고가 발생합니다. |
batch 인수는 세 가지 방식으로 구성할 수 있습니다:
- 고정 배치 크기: 정수 값(예:
batch=16)을 설정하여 배치당 이미지 수를 직접 지정합니다. - 자동 모드(60% GPU 메모리):
batch=-1을 사용하여 약 60%의 CUDA 메모리를 활용하도록 배치 크기를 자동으로 조정합니다. - 활용률 분율을 사용하는 자동 모드: 분율 값(예:
batch=0.70)을 설정하여 지정된 GPU 메모리 사용량 분율을 기준으로 배치 크기를 조정합니다. - OOM 자동 재시도: 첫 번째 에포크 동안 CUDA 메모리 부족(OOM) 오류가 발생하면 트레이너가 자동으로 배치 크기를 절반으로 줄이고 재시도합니다(최대 3회). 이는 단일 GPU 학습에만 적용되며, 멀티 GPU(DDP) 학습은 즉시 오류를 발생시킵니다.
- 적합한 설정을 찾지 못한 경우: 사용 가능한 프로파일을 생성하는 후보 배치 크기가 없으면 AutoBatch는 관련 없는 기본값으로 조용히 대체하지 않고 명확한
RuntimeError을 발생시킵니다.
데이터 증강 설정 및 하이퍼파라미터#
데이터 증강 기법은 학습 데이터에 가변성을 도입하여 YOLO 모델의 견고성과 성능을 향상시키는 데 필수적이며, 모델이 보지 못한 데이터에 대해 더 잘 일반화할 수 있도록 돕습니다. 다음 표는 각 데이터 증강 인수의 목적과 효과를 설명합니다:
| 인수 | 유형 | 기본값 | 지원되는 작업 | 범위 | 설명 |
|---|---|---|---|---|---|
hsv_h | float | 0.015 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 이미지의 색조를 색상환의 일정 비율만큼 조정하여 색상 변화를 도입합니다. 다양한 조명 조건에서 모델이 일반화하는 데 도움이 됩니다. classify의 경우 auto_augment=None일 때만 적용됩니다. |
hsv_s | float | 0.7 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 이미지의 채도를 일정 비율만큼 변경하여 색상의 강도에 영향을 줍니다. 다양한 환경 조건을 시뮬레이션하는 데 유용합니다. classify의 경우 auto_augment=None일 때만 적용됩니다. |
hsv_v | float | 0.4 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 이미지의 값(밝기)을 일정 비율만큼 변경하여 다양한 조명 조건에서 모델이 잘 작동하도록 합니다. classify의 경우 auto_augment=None일 때만 적용됩니다. |
degrees | float | 0 | detect, segment, semantic, depth, pose, obb | 0.0 - 180 | 지정된 각도 범위 내에서 이미지를 무작위로 회전하여 다양한 방향의 객체를 인식하는 모델의 능력을 향상합니다. |
translate | float | 0.1 | detect, segment, semantic, depth, pose, obb | 0.0 - 1.0 | 이미지 크기의 일정 비율만큼 이미지를 수평 및 수직으로 이동하여 부분적으로 보이는 객체를 detection하는 방법을 학습하도록 돕습니다. |
scale | float | tuple | 0.5 | detect, segment, semantic, depth, classify, pose, obb | 0 - 1 또는 명시적인 (min, max) 튜플(classify에는 해당하지 않음) | gain factor로 이미지 크기를 조정하여 카메라에서 서로 다른 거리에 있는 객체를 시뮬레이션합니다. |
shear | float | 0 | detect, segment, semantic, depth, pose, obb | -180 - +180 | 지정된 각도만큼 이미지를 전단하여 서로 다른 각도에서 객체를 보는 효과를 모방합니다. |
perspective | float | 0 | detect, segment, semantic, depth, pose, obb | 0.0 - 0.001 | 이미지에 무작위 perspective 변환을 적용하여 3D 공간의 객체를 이해하는 모델의 능력을 향상합니다. |
flipud | float | 0 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 지정된 확률로 이미지를 상하 반전하여 객체의 특성에는 영향을 주지 않으면서 데이터 변화를 늘립니다. |
fliplr | float | 0.5 | detect, segment, semantic, depth, classify, pose, obb | 0.0 - 1.0 | 지정된 확률로 이미지를 좌우 반전하여 대칭적인 객체를 학습하고 데이터셋의 다양성을 높이는 데 유용합니다. |
bgr | float | 0 | detect, segment, semantic, depth, pose, obb | 0.0 - 1.0 | 지정된 확률로 이미지 채널을 RGB에서 BGR로 반전하여 잘못된 채널 순서에 대한 견고성을 높이는 데 유용합니다. |
mosaic | float | 1 | detect, segment, semantic, pose, obb | 0.0 - 1.0 | 4개의 학습 이미지를 하나로 결합하여 다양한 장면 구성과 객체 상호작용을 시뮬레이션합니다. 복잡한 장면 이해에 매우 효과적입니다. |
mixup | float | 0 | detect, segment, semantic, pose, obb | 0.0 - 1.0 | 두 이미지와 해당 레이블을 혼합하여 합성 이미지를 생성합니다. 레이블 노이즈와 시각적 변화를 도입하여 모델의 일반화 능력을 향상합니다. |
cutmix | float | 0 | detect, segment, pose, obb | 0.0 - 1.0 | 두 이미지의 일부를 결합하여 각 영역을 구분하면서 부분적으로 혼합된 이미지를 생성합니다. 가림 상황을 만들어 모델의 견고성을 향상합니다. |
copy_paste | float | 0 | segment, obb | 0.0 - 1.0 | 붙여 넣을 수 있는 객체의 비율입니다. flip은 이미지 내부에서 객체을 미러링하고, mixup은 이 값을 이미지 간 적용 확률로도 사용합니다. |
copy_paste_mode | str | flip | segment, obb | - | 사용할 copy-paste 전략을 지정합니다. 옵션에는 'flip' 및 'mixup'가 포함됩니다. |
auto_augment | str | randaugment | classify | - | 사전 정의된 증강 정책('randaugment', 'autoaugment' 또는 'augmix')을 적용하여 시각적 다양성을 통해 모델 성능을 향상합니다. |
erasing | float | 0.4 | classify | 0.0 - 1.0 | 학습 중 이미지 영역을 무작위로 지워 모델이 덜 명확한 특징에 집중하도록 합니다. |
augmentations | list | None | detect, segment, semantic, depth, pose, obb | - | 고급 데이터 증강을 위한 사용자 지정 Albumentations 변환(Python API 전용)입니다. 특수한 증강 요구사항을 위해 변환 객체 목록을 허용합니다. |
이러한 설정은 데이터셋과 작업의 특정 요구사항에 맞게 조정할 수 있습니다. 다양한 값을 실험해보면 최상의 모델 성능으로 이어지는 최적의 데이터 증강 전략을 찾는 데 도움이 될 수 있습니다.
학습 데이터 증강 작업에 대한 자세한 내용은 참조 섹션을 참조하십시오.
로깅#
학습 지표, 플롯, 체크포인트는 항상 실행 디렉터리에 기록되며, Ultralytics는 설치하고 활성화한 실험 트래커(Comet, ClearML, TensorBoard, MLflow, Weights & Biases, DVCLive)로도 스트리밍합니다. 각 로거는 Ultralytics 설정(예: yolo settings tensorboard=True)을 통해 전환됩니다. 가장 일반적인 세 가지 설정은 아래에 나와 있습니다.
Comet#
Comet은(는) 데이터 과학자와 개발자가 실험 및 모델을 추적, 비교, 설명 및 최적화할 수 있는 플랫폼입니다. 실시간 메트릭, 코드 diff, 하이퍼파라미터 추적 등의 기능을 제공합니다.
Comet을 사용하려면:
# pip install comet_ml
import comet_ml
comet_ml.init()웹사이트에서 Comet 계정에 로그인하고 API 키를 확인하십시오. 실험을 기록하려면 이를 환경 변수나 스크립트에 추가해야 합니다.
ClearML#
ClearML은(는) 실험 추적을 자동화하고 리소스를 효율적으로 공유할 수 있도록 돕는 오픈소스 플랫폼입니다. 팀이 ML 작업을 보다 효율적으로 관리, 실행 및 재현할 수 있도록 설계되었습니다.
ClearML을 사용하려면:
# pip install clearml
import clearml
clearml.browser_login()이 스크립트를 실행한 후, 브라우저에서 ClearML 계정에 로그인하여 세션을 인증해야 합니다.
TensorBoard#
TensorBoard는 TensorFlow를 위한 시각화 툴킷입니다. TensorFlow 그래프를 시각화하고, 그래프 실행에 대한 정량적 메트릭을 플롯하며, 이를 통과하는 이미지와 같은 추가 데이터를 표시할 수 있습니다.
Google Colab에서 TensorBoard를 사용하려면:
%load_ext tensorboard
tensorboard --logdir ultralytics/runs # replace with 'runs' directory로컬에서 TensorBoard를 사용하려면 아래 명령을 실행하고 localhost:6006에서 결과를 확인하십시오.
tensorboard --logdir ultralytics/runs # replace with 'runs' directory이렇게 하면 TensorBoard가 로드되고 학습 로그가 저장된 디렉토리로 지정됩니다.
로거를 설정한 후 모델 학습을 진행할 수 있습니다. 모든 학습 메트릭은 선택한 플랫폼에 자동으로 기록되며, 이러한 로그에 액세스하여 시간에 따른 모델 성능을 모니터링하고, 서로 다른 모델을 비교하고, 개선 영역을 파악할 수 있습니다.
다음 단계#
별도의 테스트 데이터에 대해 학습된 모델을 검증하여 실제 정확도를 확인한 다음, ONNX, TensorRT 또는 기타 배포 형식으로 내보내기하십시오. COCO8 대신 자신만의 데이터로 학습하시나요? 데이터셋 가이드를 사용하여 먼저 형식을 지정하십시오.
FAQ#
예. Ultralytics Platform 클라우드 학습에는 시작할 수 있는 무료 크레딧이 포함되어 있습니다. 데이터셋을 업로드하고, 모델과 GPU를 선택한 다음 브라우저에서 바로 학습하십시오.
Ultralytics YOLO26을 사용하여 객체 검출 모델을 학습하려면 Python API 또는 CLI를 사용할 수 있습니다. 다음은 둘 다에 대한 예제입니다:
단일 GPU 및 CPU 학습 예제from ultralytics import YOLO # Load a model model = YOLO("yolo26n.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="coco8.yaml", epochs=100, imgsz=640)자세한 내용은 학습 설정 섹션을 참조하십시오.
Ultralytics YOLO26 학습 모드의 주요 기능은 다음과 같습니다:
- 자동 데이터셋 다운로드: COCO, VOC, ImageNet과 같은 표준 데이터셋을 자동으로 다운로드합니다.
- 멀티 GPU 지원: 더 빠른 처리를 위해 여러 GPU에서 학습을 확장합니다.
- 하이퍼파라미터 구성: YAML 파일이나 CLI 인수를 통해 하이퍼파라미터를 사용자 정의합니다.
- 시각화 및 모니터링: 더 나은 인사이트를 위해 학습 메트릭을 실시간으로 추적합니다.
이러한 기능은 학습을 효율적으로 만들고 필요에 맞게 사용자 정의할 수 있도록 해줍니다. 자세한 내용은 학습 모드의 주요 기능 섹션을 참조하십시오.
중단된 세션에서 학습을 재개하려면
resume인수를True(으)로 설정하고 마지막으로 저장된 체크포인트의 경로를 지정하십시오.학습 재개 예제from ultralytics import YOLO # Load the partially trained model model = YOLO("path/to/last.pt") # Resume training results = model.train(resume=True)자세한 내용은 중단된 학습 재개하기 섹션을 확인하십시오.
클래스 불균형은 학습 데이터에서 일부 클래스의 샘플 수가 다른 클래스보다 현저히 적을 때 발생합니다. 이로 인해 모델이 희귀 클래스에서 저조한 성능을 보일 수 있습니다. Ultralytics YOLO는 이 문제를 해결하기 위해
cls_pw인수를 통한 클래스 가중치 부여를 지원합니다.cls_pw인수는 역클래스 빈도를 기반으로 클래스 가중치 부여 강도를 제어합니다:cls_pw=0.0(기본값): 클래스 가중치 부여를 비활성화합니다.cls_pw=1.0: 전체 역빈도 가중치 부여를 적용합니다.0.0및1.0사이의 값: 완만한 불균형에 대해 부분적인 가중치를 제공합니다.
클래스 가중치는
(1.0 / class_counts) ^ cls_pw(으)로 계산되며 평균이 1.0이 되도록 정규화됩니다.불균형한 데이터셋에서 학습하기from ultralytics import YOLO # Load a pretrained model model = YOLO("yolo26n.pt") # Train with full class weighting for severely imbalanced data results = model.train(data="custom.yaml", epochs=100, imgsz=640, cls_pw=1.0) # Or use partial weighting (0.25) for moderate imbalance results = model.train(data="custom.yaml", epochs=100, imgsz=640, cls_pw=0.25)팁완만하게 불균형한 데이터셋의 경우
cls_pw=0.25(으)로 시작하고 희귀 클래스의 성능이 여전히 저조한 경우1.0(으)로 늘리십시오. 가중치 분포를 확인하기 위해 학습 로그에서 계산된 클래스 가중치를 확인할 수 있습니다.네, Ultralytics YOLO26은 Metal Performance Shaders (MPS) 프레임워크를 활용하여 Apple 실리콘 칩에서의 학습을 지원합니다. 학습 디바이스로 'mps'를 지정하십시오.
MPS 학습 예제from ultralytics import YOLO # Load a pretrained model model = YOLO("yolo26n.pt") # Train the model on Apple silicon chip (M1/M2/M3/M4) results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="mps")자세한 내용은 Apple 실리콘 MPS 학습 섹션을 참조하십시오.
Ultralytics YOLO26을 사용하면 인수를 통해 배치 크기, 학습률, 에포크 등 다양한 학습 설정을 구성할 수 있습니다. 간략한 개요는 다음과 같습니다:
인수 기본값 설명 modelNone학습을 위한 모델 파일의 경로입니다. dataNone데이터셋 YAML의 경로(예: coco8.yaml), 또는 분류를 위한 데이터셋 디렉토리나 이름(예:imagenet10)입니다.epochs100총 학습 에포크 수입니다. batch16정수 또는 자동 모드로 조절 가능한 배치 크기입니다. imgsz640학습을 위한 목표 이미지 크기입니다. deviceNonecpu,0,0,1, 또는mps과 같은 학습용 연산 디바이스입니다.saveTrue학습 체크포인트와 최종 모델 가중치의 저장을 활성화합니다. 학습 설정에 대한 심층적인 가이드를 보려면 학습 설정 섹션을 확인하십시오.