YOLOv5와 YOLOv9 비교#
지난 몇 년 동안 컴퓨터 비전과 실시간 객체 탐지 분야는 눈부신 발전을 이루었습니다. 검증된 기존 모델과 최신 연구 아키텍처 중 하나를 선택하는 일은 머신러닝 엔지니어들이 흔히 마주하는 과제입니다. 이 가이드에서는 YOLO 계열에서 큰 영향력을 발휘한 두 모델인 YOLOv5와 YOLOv9를 기술적으로 종합 비교합니다.
리소스가 제한된 엣지 디바이스에 배포하거나, 고충실도 특징 추출을 연구하거나, 복잡한 객체 탐지 파이프라인을 구축하는 경우 모두, 두 모델의 아키텍처적 차이, 성능 지표, 생태계 차이를 이해하는 것이 중요합니다.
모델 개요#
아키텍처를 비교하기에 앞서 각 모델의 기원과 주요 목표를 이해하는 것이 도움이 됩니다.
Ultralytics YOLOv5#
Glenn Jocher가 개발하고 2020년 6월 26일 Ultralytics가 출시한 YOLOv5는 개발자가 비전 모델을 활용하는 방식에 큰 변화를 가져왔습니다. YOLOv5는 PyTorch 프레임워크를 전면적으로 도입하여, 초기 Darknet 기반 모델의 복잡한 컴파일 과정을 직관적이고 Python 중심적인 사용자 경험으로 대체했습니다.
- 저자: Glenn Jocher
- 조직: Ultralytics
- 날짜: 2020-06-26
- GitHub: YOLOv5 저장소
- 문서: YOLOv5 문서
YOLOv5는 다양한 하드웨어 환경에서 사용하기 쉽고 안정적인 성능을 제공하는 것으로 잘 알려져 있습니다. 탐지뿐만 아니라 이미지 분류와 인스턴스 세그멘테이션도 지원합니다.
YOLOv9#
대만 Academia Sinica 정보과학연구소의 Chien-Yao Wang과 Hong-Yuan Mark Liao가 공개한 YOLOv9은 심층 신경망의 정보 병목 문제를 완화하기 위해 아키텍처 이론에 중점을 둡니다.
- 저자: Chien-Yao Wang 및 Hong-Yuan Mark Liao
- 기관: 대만 중앙연구원 정보과학연구소
- 날짜: 2024-02-21
- Arxiv: 2402.13616
- GitHub: YOLOv9 저장소
- 문서: YOLOv9 문서
YOLOv9의 핵심은 두 가지 주요 이론적 혁신인 Programmable Gradient Information(PGI)과 Generalized Efficient Layer Aggregation Network(GELAN)에 기반합니다. 이러한 개념은 모델이 심층 네트워크 계층을 거치는 동안 중요한 공간 특징을 유지하도록 돕습니다.
YOLOv5와 YOLOv9은 모두 강력한 모델이지만, 새롭게 출시된 YOLO26은 속도와 정밀도의 궁극적인 균형을 제공합니다. 선택 가능한 엔드투엔드 NMS 없는 추론과 최대 43% 빠른 CPU 추론을 지원하는 YOLO26은 최신 엣지 컴퓨팅 및 프로덕션 배포에 적극 권장됩니다.
아키텍처 및 기술적 차이#
비전 모델의 내부 구동 방식을 이해하는 것은 모델 배포 전략을 최적화하는 데 필수적입니다.
특징 추출 및 정보 보존#
YOLOv5는 Cross Stage Partial Network(CSPNet) 백본을 사용하여 역전파 중 정확한 그래디언트 흐름을 유지하면서 연산 오버헤드를 효과적으로 줄입니다. 이 설계는 기존 GPU 연산에 고도로 최적화되어 있으며, 대규모 트랜스포머 모델보다 학습 시 메모리 요구량이 적습니다.
YOLOv9은 CSPNet 원리를 확장한 범용 아키텍처인 GELAN을 도입합니다. 보조 가역 브랜치인 PGI와 결합하여, 정확한 목적 함수를 계산하는 데 필요한 의미론적 데이터가 심층 계층에서 손실되지 않도록 합니다. 이 덕분에 YOLOv9은 특히 작은 객체에서 높은 정확도를 달성하지만, 복잡한 보조 분기가 리소스 제약이 심한 엣지 하드웨어로 내보내는 파이프라인을 복잡하게 만들 수 있습니다.
메모리 요구량 및 학습 효율성#
학습 효율성 측면에서 YOLOv5는 여전히 매우 견고합니다. 잘 관리되는 Ultralytics 생태계를 활용하면 YOLOv5 모델의 CUDA 메모리 사용량이 크게 줄어 소비자용 GPU에서 연구자가 배치 크기를 최대한 늘릴 수 있습니다. YOLOv9은 파라미터 효율성(크기 대비 높은 정확도)이 뛰어나지만, 최적화된 프레임워크를 사용하지 않으면 학습 과정에서 더 많은 리소스가 필요할 수 있습니다. 다행히 YOLOv9을 Ultralytics API에 통합하면 간소화된 리소스 관리 측면에서 YOLOv5와의 격차를 줄일 수 있습니다.
성능 및 지표#
이러한 아키텍처를 객관적으로 평가하기 위해 COCO와 같은 표준 데이터셋에서 성능을 비교합니다. 아래에는 mAP(평균 정밀도), 추론 속도, 파라미터 수 등의 지표를 자세히 정리했습니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
표에서 보듯이 YOLOv9은 동일한 등급에서 더 높은 실제 정확도를 달성하며, 이는 최신 아키텍처를 반영합니다. 하지만 YOLOv5n은 TensorRT 지연 시간이 1.12ms로 매우 낮아, 고속 로컬 엣지 컴퓨팅 애플리케이션에 여전히 강점을 보입니다.
학습 방법론 및 사용 편의성#
오늘날 컴퓨터 비전을 활용하는 진정한 이점은 도구 체인에 대한 접근성이 높다는 점입니다.
Ultralytics의 강점#
YOLOv9과 같은 모델의 기존 연구용 저장소는 기반이 되는 자료이지만, 복잡한 종속성 구성과 상용구 스크립트가 포함되는 경우가 많습니다. Ultralytics Python API는 이러한 복잡성을 완전히 추상화합니다. Ultralytics 생태계에서는 동일하고 통합된 구문으로 YOLOv5와 YOLOv9을 모두 학습, 평가, 내보낼 수 있습니다.
from ultralytics import YOLO
# 빠른 배포를 위해 사전 학습된 YOLOv5 모델을 불러옵니다
model_v5 = YOLO("yolov5su.pt") # YOLOv5u: ultralytics 패키지용 앵커 프리 YOLOv5 가중치
# 또는 고충실도 정확도를 위해 YOLOv9 모델을 활용합니다
model_v9 = YOLO("yolov9c.pt")
# 사용자 지정 데이터로 원활하게 학습합니다
results = model_v9.train(data="coco8.yaml", epochs=50, imgsz=640)
# 학습된 모델을 ONNX로 내보냅니다
model_v9.export(format="onnx")이러한 단일 API 접근 방식은 뛰어난 다용도성을 제공하며, 선택한 모델에 따라 탐지뿐 아니라 포즈 추정과 방향성 바운딩 박스(OBB)도 지원합니다. 또한 Comet ML, Weights & Biases와 같은 도구와의 견고한 통합 기능이 학습 루프에 직접 내장되어 있습니다.
적합한 사용 사례 및 실제 응용 분야#
이러한 아키텍처 중 무엇을 선택할지는 하드웨어 제약과 애플리케이션 분야에서 요구하는 정밀도에 크게 좌우됩니다.
YOLOv5를 선택할 경우#
YOLOv5는 안정성, 낮은 메모리 사용량, 폭넓은 내보내기 호환성을 중시하는 배포 환경에서 강점을 발휘하는 충분히 검증된 모델입니다.
- 모바일 배포: YOLOv5를 LiteRT 또는 CoreML로 내보내 구형 스마트폰에서 온디바이스 추론을 수행하는 과정은 매우 간단합니다.
- 레거시 엣지 하드웨어: Raspberry Pi나 초기 세대 NVIDIA Jetson Nano와 같은 디바이스에서는 YOLOv5의 단순한 합성곱 구조가 스마트 주차 관리와 같은 애플리케이션에서 안정적인 프레임 속도를 보장합니다.
- 빠른 프로토타이핑: 커뮤니티 튜토리얼, 사용자 지정 사전 학습 가중치, 광범위한 데이터셋 호환성을 활용할 수 있어 개념 증명을 가장 빠르게 검증할 수 있습니다.
YOLOv9을 선택해야 하는 경우#
YOLOv9은 약간의 연산 오버헤드가 발생하더라도 복잡한 세부 정보를 포착하고 미탐을 최소화하는 것이 무엇보다 중요한 시나리오에 적합합니다.
- 항공 및 위성 영상: PGI 프레임워크는 작은 객체의 충실도를 유지하는 데 매우 효과적이므로, YOLOv9은 드론 기반 농업 모니터링에 적합합니다.
- 의료 영상 진단: 고해상도 스캔에서 미세한 이상이나 병변을 탐지할 때 GELAN의 정확한 그래디언트 흐름은 재현율을 높이는 데 필요한 이점을 제공합니다.
- 고급 소매 분석: YOLOv9의 뛰어난 특징 보존 기능은 선반에 빽빽하게 진열된 서로 겹친 제품을 추적할 때 큰 이점을 제공합니다.
시야를 넓혀 보세요#
YOLOv5와 YOLOv9을 비교하면 2020년부터 2024년까지 아키텍처가 어떻게 발전했는지 명확히 알 수 있지만, AI 분야는 그 어느 때보다 빠르게 발전하고 있습니다. 최고의 성능을 추구하는 개발자에게는 최신 YOLO26 모델을 살펴볼 것을 적극 권장합니다. 기존 비최대 억제를 대안으로 하는 네이티브 엔드투엔드 NMS 없는 설계(nms=False)와 고급 MuSGD 옵티마이저를 활용하는 YOLO26은 연구 수준의 정확도와 프로덕션 수준의 속도 간 격차를 좁힙니다. DFL 제거(Distribution Focal Loss를 제거하여 내보내기를 간소화하고 엣지 및 저전력 디바이스 호환성을 개선)를 통해 YOLO26은 최대 43% 빠른 CPU 추론을 달성하므로 엣지 컴퓨팅에 적합합니다. 또한 ProgLoss + STAL은 손실 함수를 개선하여 소형 객체 인식 성능을 크게 높이며, 이는 IoT, 로봇 공학, 항공 영상 분야에서 중요합니다.
RT-DETR이나 뛰어난 성능을 제공하는 YOLO11과 같은 최신 모델과 이 아키텍처를 비교하는 데도 관심이 있을 수 있습니다. 통합된 Ultralytics 프레임워크를 활용하면 어떤 모델을 선택하든 개발 파이프라인을 깔끔하고 효율적으로 유지하면서 확장에 대비할 수 있습니다.