YOLOv6-3.0와 YOLOv5#
실시간 객체 검출의 발전 과정에서는 다양한 배포 시나리오에 맞게 최적화된 여러 아키텍처가 등장했습니다. 이 심층 분석에서는 업계 중심의 YOLOv6-3.0와 기반이 탄탄하고 높은 범용성을 갖춘 Ultralytics YOLOv5라는 두 가지 주요 모델을 비교합니다. 각 모델의 아키텍처 선택, 성능 지표 및 생태계 지원을 이해하면 실제 애플리케이션에 가장 적합한 컴퓨터 비전 프레임워크를 선택하는 데 도움이 됩니다.
YOLOv6-3.0: 산업용 처리량 및 하드웨어 최적화#
Meituan의 Vision AI 부서에서 개발한 YOLOv6-3.0은 높은 처리량이 요구되는 산업 환경에 중점을 두고 맞춤 설계되었습니다. 이 모델은 전용 NVIDIA GPU와 같은 하드웨어 가속기에서 프레임률을 극대화하는 데 초점을 맞춥니다.
- 저자: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, Xiangxiang Chu
- 조직: Meituan
- 날짜: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
- 문서: YOLOv6 문서
아키텍처의 강점#
YOLOv6-3.0은 속도를 위해 설계된 여러 구조적 최적화를 도입합니다. 이 모델은 GPU 추론 중 하드웨어 친화성을 높이도록 특별히 설계된 EfficientRep 백본을 사용합니다. 따라서 이 아키텍처는 오프라인 배치 처리 작업에 특히 강력합니다.
학습 단계에서 이 모델은 앵커 보조 학습(AAT) 전략을 적용합니다. 이 접근 방식은 앵커 기반 학습의 안정성과 앵커 프리 추론의 속도를 결합하려고 합니다. 또한 neck 아키텍처는 양방향 연결(BiC) 모듈을 사용하여 서로 다른 스케일 간의 feature fusion을 개선합니다. TensorRT를 사용하는 고성능 서버 GPU에 맞게 고도로 최적화되어 있지만, 이러한 특화로 인해 CPU만 사용하거나 저전력 edge device에서는 latency가 증가할 수 있습니다.
Ultralytics YOLOv5: 누구나 쉽게 사용할 수 있는 Vision AI의 선구자#
Ultralytics가 출시한 YOLOv5는 사용 편의성, 학습 효율성 및 안정적인 배포의 새로운 기준을 제시했습니다. 최신 deep learning workflow와 긴밀하게 통합하여 고성능 객체 검출을 대중화했습니다.
- 저자: Glenn Jocher
- 조직: Ultralytics
- 날짜: 2020-06-26
- GitHub: ultralytics/yolov5
- 플랫폼: Ultralytics Platform
생태계 및 다재다능함#
YOLOv5의 핵심 특징은 사용 편의성입니다. PyTorch framework를 기반으로 구축된 repository는 machine learning lifecycle을 크게 간소화하는 통합 Python API를 제공합니다. dataset 구성부터 최종 배포까지 통합된 생태계는 개발자가 environment 문제를 디버깅하는 시간은 줄이고 애플리케이션 구축에 더 많은 시간을 쏟을 수 있도록 합니다.
YOLOv5는 object detection에만 국한되지 않습니다. image classification과 instance segmentation을 기본적으로 지원하여 뛰어난 범용성을 제공합니다. 또한 smart caching, automated data loader 및 distributed multi-GPU training 기본 지원을 통해 탁월한 학습 효율성을 제공합니다.
모델 아키텍처를 비교할 때 메모리 사용량은 중요한 요소입니다. Ultralytics YOLO 모델은 고성능 Transformer 모델에 비해 학습과 추론 모두에서 훨씬 적은 VRAM을 사용하므로, 일반 소비자용 하드웨어나 Google Colab과 같은 cloud notebook을 사용하는 개발자도 쉽게 활용할 수 있습니다.
성능 및 아키텍처 비교#
아래 표는 표준 COCO dataset에서 평가한 두 아키텍처의 성능 지표를 보여줍니다. 서로 다른 environment에서 모델이 mean average precision과 inference speed 간의 trade-off를 어떻게 조정하는지 확인할 수 있습니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
분석#
YOLOv6-3.0은 인상적인 mAP 점수를 달성하며 T4 GPU의 TensorRT pipeline에 맞게 고도로 최적화되어 있습니다. 그러나 YOLOv5는 ONNX, CoreML 및 TFLite를 포함한 여러 format으로 즉시 export할 수 있는 매우 잘 유지 관리되는 생태계로 이에 대응합니다. 이러한 성능 균형 덕분에 YOLOv5는 전용 server뿐 아니라 mobile device와 Raspberry Pi와 같은 edge computing environment에서도 안정적으로 작동합니다.
코드 예시: Ultralytics를 활용한 원활한 학습#
Ultralytics 생태계의 가장 큰 장점 중 하나는 간소화된 user experience입니다. 모델을 학습하고 평가한 후 export하는 데 몇 줄의 Python 코드만 필요합니다.
from ultralytics import YOLO
# Load a pre-trained YOLOv5 small model
model = YOLO("yolov5s.pt")
# Train the model on the COCO8 dataset
# The API automatically handles dataset downloads and hyperparameter configuration
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference on an image
predictions = model("https://ultralytics.com/images/bus.jpg")
# Export the model to ONNX format for flexible deployment
model.export(format="onnx")이상적인 사용 사례 및 배포 시나리오#
이러한 아키텍처 중 하나를 선택하는 일은 대개 특정 infrastructure 제약 조건에 따라 달라집니다:
- YOLOv6-3.0을 배포할 경우: 전용 NVIDIA GPU를 사용할 수 있고 latency를 최소화해야 하는 automated manufacturing line 및 높은 처리량의 server analytics에 적합합니다. TensorRT 최적화를 최대한 활용할 수 있는 environment에서 그 아키텍처의 성능이 극대화됩니다.
- YOLOv5를 배포할 경우: 신속한 prototyping, cross-platform deployment 및 통합 pipeline을 원하는 team에 적합한 최상의 선택입니다. 다양한 export 기능을 갖추고 있어 edge device를 활용한 retail analytics, agricultural drone monitoring 및 fitness 애플리케이션의 pose estimation에 이상적입니다.
객체 검출의 미래: YOLO26의 등장#
YOLOv5와 YOLOv6가 중요한 이정표를 세웠지만, computer vision 분야는 빠르게 발전하고 있습니다. 새로운 프로젝트를 시작하거나 최고 수준의 성능을 추구하는 개발자에게는 Ultralytics YOLO26(2026년 1월 출시)로 업그레이드할 것을 적극 권장합니다.
YOLO26은 획기적인 End-to-End NMS-Free Design을 도입하여 edge-first vision AI를 새롭게 정의합니다. Non-Maximum Suppression post-processing이 필요하지 않도록 제거함으로써 배포 로직을 간소화하고 latency 변동성을 크게 줄입니다.
YOLO26의 주요 혁신 사항은 다음과 같습니다:
- MuSGD Optimizer: SGD와 Muon의 hybrid로, 고급 LLM 학습의 안정성을 computer vision에 적용하여 더 빠르고 안정적인 수렴을 실현합니다.
- 최대 43% 더 빠른 CPU 추론: 전용 가속기가 없는 environment에 맞게 고도로 최적화되었습니다.
- DFL 제거: Distribution Focal Loss를 제거하여 export process를 간소화하고 저전력 edge device와의 호환성을 향상합니다.
- ProgLoss + STAL: small-object 인식을 크게 향상하는 고급 loss function으로, aerial imagery 및 smart city IoT sensor에 매우 중요합니다.
범용 작업에는 YOLO11도 Ultralytics 제품군에서 완전히 지원되는 탁월한 선택지로 남아 있습니다.
결론#
YOLOv6-3.0과 YOLOv5는 모두 실시간 검출의 발전에 중추적인 역할을 해왔습니다. YOLOv6-3.0은 GPU 가속 처리량에 특화된 아키텍처를 제공하는 반면, YOLOv5는 방대한 문서, 사용 편의성 및 multi-task capability를 통해 타의 추종을 불허하는 개발자 경험을 제공합니다.
최신 애플리케이션에서는 통합된 Ultralytics 생태계를 활용하여 미래에도 유효한 workflow를 구축할 수 있습니다. YOLO26과 같은 최신 아키텍처를 도입하면 배포 pipeline이 속도, 정확도 및 알고리즘 단순성의 최신 발전을 활용할 수 있습니다.