YOLO Vision 2026:

YOLOv5를 사용한 다중 GPU 학습#

이 가이드에서는 단일 머신 또는 여러 머신에서 여러 GPU를 사용하여 YOLOv5를 학습하는 방법을 설명합니다.

시작하기 전에#

Python>=3.8.0 환경에서 requirements.txt를 사용하여 리포지토리를 클론하고 설치합니다. 여기에는 PyTorch>=1.8도 포함됩니다. 모델데이터셋은 최신 YOLOv5 릴리스에서 자동으로 다운로드됩니다.

git clone https://github.com/ultralytics/yolov5 # clone
cd yolov5
pip install -r requirements.txt # install
Docker 사용

모든 multi-GPU training 실행에는 Ultralytics Docker image를 사용하는 것이 권장됩니다. Docker Quickstart Guide를 참조하십시오. Docker Pulls

PyTorch >= 1.9

torch.distributed.runPyTorch >= 1.9에서 torch.distributed.launch을 대체합니다. 자세한 내용은 PyTorch 분산 문서를 참조하세요.

학습#

학습을 시작할 사전 학습 모델을 선택합니다. 여기서는 작고 빠른 모델인 YOLOv5s를 선택합니다. 모든 모델을 전체적으로 비교하려면 README의 를 참조하세요. 이 모델을 COCO 데이터셋에서 다중 GPU로 학습합니다.

YOLOv5 Models

단일 GPU#

python train.py --batch 64 --data coco.yaml --weights yolov5s.pt --device 0

다중 GPU DataParallel 모드(⚠️ 권장하지 않음)#

여러 GPU ID를 --device에 전달하여 DataParallel 모드를 활성화합니다:

python train.py --batch 64 --data coco.yaml --weights yolov5s.pt --device 0,1

DataParallel은 단일 GPU를 사용하는 것과 비교하면 느리고 학습 속도도 거의 향상되지 않습니다.

다중 GPU DistributedDataParallel 모드(✅ 권장)#

학습 명령 앞에 python -m torch.distributed.run --nproc_per_node을 추가한 다음 일반 인수를 전달합니다:

python -m torch.distributed.run --nproc_per_node 2 train.py --batch 64 --data coco.yaml --weights yolov5s.pt --device 0,1
  • --nproc_per_node은 사용할 GPU 수입니다. 위 예제에서는 2입니다.
  • --batch은 각 GPU에 균등하게 분배되는 전체 배치 크기입니다. 위 예제에서는 GPU당 64 / 2 = 32입니다.

위 명령은 0...(N-1) GPU를 사용합니다. 대신 환경 변수를 통해 디바이스 표시 여부를 제어하려면 실행 전에 CUDA_VISIBLE_DEVICES=2,3(또는 다른 목록)을 설정합니다.

Use specific GPUs (click to expand)

--device 뒤에 특정 GPU ID를 전달합니다. 아래 예제에서는 2,3 GPU를 사용합니다.

python -m torch.distributed.run --nproc_per_node 2 train.py --batch 64 --data coco.yaml --cfg yolov5s.yaml --weights '' --device 2,3
Use SyncBatchNorm (click to expand)

SyncBatchNorm은 다중 GPU 학습의 정확도를 높일 수 있지만, 학습 속도를 크게 낮춥니다. 다중 GPU DistributedDataParallel 학습에서만 사용할 수 있습니다.

각 GPU의 배치 크기가 작을 때(<= 8) 사용하는 것이 가장 좋습니다.

SyncBatchNorm을 활성화하려면 --sync-bn을 전달합니다:

python -m torch.distributed.run --nproc_per_node 2 train.py --batch 64 --data coco.yaml --cfg yolov5s.yaml --weights '' --sync-bn
Use Multiple machines (click to expand)

다중 GPU DistributedDataParallel 학습에서만 사용할 수 있습니다.

계속하기 전에 모든 머신에서 데이터셋, 코드베이스 및 기타 종속성이 일치하는지 확인한 다음, 머신들이 네트워크에서 서로 연결될 수 있는지 확인합니다.

마스터 머신(다른 머신이 연결할 머신)을 선택하고 해당 주소(master_addr)를 확인한 다음 포트(master_port)를 선택합니다. 아래 예제에서는 master_addr = 192.168.1.1master_port = 1234을 사용합니다.

그런 다음 다음을 실행합니다:

# On master machine 0
python -m torch.distributed.run --nproc_per_node G --nnodes N --node_rank 0 --master_addr "192.168.1.1" --master_port 1234 train.py --batch 64 --data coco.yaml --cfg yolov5s.yaml --weights ''
# On machine R
python -m torch.distributed.run --nproc_per_node G --nnodes N --node_rank R --master_addr "192.168.1.1" --master_port 1234 train.py --batch 64 --data coco.yaml --cfg yolov5s.yaml --weights ''

여기서 G은 머신당 GPU 수이고, N은 머신 수이며, R0...(N-1)에서 해당 머신의 순위입니다. 예를 들어 머신 2대에 각각 GPU 2개가 있는 경우, 두 번째 머신에서 G = 2, N = 2, R = 1을 설정합니다.

모든 N 머신이 연결될 때까지 학습이 시작되지 않습니다. 출력은 마스터 머신에만 표시됩니다.

참고#

  • Windows 지원은 테스트되지 않았으며 Linux를 권장합니다.

  • --batch은 GPU 수의 배수여야 합니다.

  • GPU 0은 EMA를 유지 관리하고 체크포인트 저장을 처리하므로 다른 GPU보다 메모리를 약간 더 사용합니다.

  • RuntimeError: Address already in use 오류가 발생하면 일반적으로 여러 학습 실행이 동일한 포트를 사용하고 있다는 의미입니다. --master_port을 사용하여 다른 포트를 지정합니다:

    python -m torch.distributed.run --master_port 1234 --nproc_per_node 2 ...

Results#

1개의 COCO epoch에 대해 8x A100 SXM4-40GB가 장착된 AWS EC2 P4d 인스턴스에서 측정한 YOLOv5l의 DDP 프로파일링 결과입니다.

Profiling code
# prepare
t=ultralytics/yolov5:latest && sudo docker pull $t && sudo docker run -it --ipc=host --device nvidia.com/gpu=all -v "$(pwd)"/coco:/usr/src/coco $t
pip3 install torch==1.9.0+cu111 torchvision==0.10.0+cu111 -f https://download.pytorch.org/whl/torch_stable.html
cd .. && rm -rf app && git clone https://github.com/ultralytics/yolov5 -b master app && cd app
cp data/coco.yaml data/coco_profile.yaml

# profile
python train.py --batch-size 16 --data coco_profile.yaml --weights yolov5l.pt --epochs 1 --device 0
python -m torch.distributed.run --nproc_per_node 2 train.py --batch-size 32 --data coco_profile.yaml --weights yolov5l.pt --epochs 1 --device 0,1
python -m torch.distributed.run --nproc_per_node 4 train.py --batch-size 64 --data coco_profile.yaml --weights yolov5l.pt --epochs 1 --device 0,1,2,3
python -m torch.distributed.run --nproc_per_node 8 train.py --batch-size 128 --data coco_profile.yaml --weights yolov5l.pt --epochs 1 --device 0,1,2,3,4,5,6,7
GPU
A100
배치 크기CUDA_메모리
device0 (G)
COCO
학습
COCO
검증
1x1626GB20:390:55
2x3226GB11:430:57
4x6426GB5:570:55
8x12826GB3:090:57

결과에서 볼 수 있듯이 여러 GPU에서 DistributedDataParallel을 사용하면 학습 속도가 거의 선형적으로 향상됩니다. GPU 8개를 사용하면 디바이스당 동일한 메모리 사용량을 유지하면서 단일 GPU를 사용할 때보다 학습이 약 6.5배 빠르게 완료됩니다.

지원 환경#

Ultralytics는 프로젝트를 바로 시작할 수 있도록 CUDA, CUDNN, Python, PyTorch와 같은 필수 종속성이 사전 설치된 다양한 즉시 사용 가능한 환경을 제공합니다.

프로젝트 상태#

YOLOv5 CI

이 배지는 모든 YOLOv5 GitHub Actions 지속적 통합 (CI) 테스트가 성공적으로 통과했음을 나타냅니다. 이러한 CI 테스트는 학습, 검증, 추론, 내보내기, 벤치마크 등 여러 주요 측면에서 YOLOv5의 기능과 성능을 엄격하게 점검합니다. 또한 macOS, Windows, Ubuntu에서 일관되고 안정적으로 작동하는지 확인하며, 24시간마다 그리고 새 커밋이 생성될 때마다 테스트를 수행합니다.

크레딧#

많은 작업을 수행해 주신 @MagicFrogSJTU와 과정 전반에서 지침을 제공해 주신 @glenn-jocher에게 감사드립니다.

참고 항목#

FAQ#

이슈를 열기 전에 아래 체크리스트를 확인하세요. 이를 통해 시간을 절약할 수 있는 경우가 많습니다.

Checklist (click to expand)
  • 이 가이드를 처음부터 끝까지 읽어 보셨나요?
  • 코드베이스를 다시 클론해 보셨나요? 코드는 매일 변경됩니다.
  • 오류 메시지를 검색해 보셨나요? 누군가 이미 동일한 문제를 겪고 해결 방법을 공유했을 수 있습니다.
  • 필요한 항목을 모두 설치하셨나요(올바른 Python 및 PyTorch 버전 포함)?
  • 위에 나열된 지원 환경 중 하나를 사용해 보셨나요?
  • 근본 원인을 분리하기 위해 coco128 또는 coco2017과 같은 더 작은 데이터셋을 사용해 보셨나요?

위의 모든 항목을 확인했다면 템플릿에 따라 가능한 한 자세한 정보를 포함하여 Issue를 여세요.

댓글