RTDETRv2 vs YOLOv5#
컴퓨터 비전의 발전은 정확도와 실시간 추론 속도의 균형을 맞추기 위한 끊임없는 노력으로 대부분 정의되어 왔습니다. RTDETRv2와 Ultralytics YOLOv5를 비교할 때 개발자는 본질적으로 Transformer 아키텍처의 정교한 전역 컨텍스트 처리 능력과 고도로 최적화되고 실전에서 검증된 CNN(Convolutional Neural Network)의 효율성 중 하나를 평가하게 됩니다.
이 가이드에서는 두 가지 주요 아키텍처를 심층적으로 기술 분석하고, 성능 지표, 학습 방법론, 메모리 요구 사항 및 이상적인 배포 시나리오를 자세히 설명하여 특정 사용 사례에 가장 적합한 객체 검출 모델을 선택할 수 있도록 지원합니다.
RTDETRv2: 실시간 감지를 위한 Transformer 접근 방식#
기존 Real-Time Detection Transformer (RT-DETR)를 기반으로 구축된 RTDETRv2는 추론 지연 시간을 희생하지 않고 기준 아키텍처를 개선하기 위해 일련의 "bag-of-freebies"를 도입합니다.
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- 링크: Arxiv 논문, GitHub 저장소
아키텍처 및 기능#
RTDETRv2는 CNN-Transformer 하이브리드 아키텍처를 활용합니다. CNN은 세밀한 시각적 특징을 추출하는 백본 역할을 하며, Transformer 인코더-디코더 레이어는 전체 특징 맵을 처리하여 전역 컨텍스트를 파악합니다. RTDETRv2의 주요 특징은 엔드 투 엔드 방식으로, 비최대 억제(NMS) 후처리가 전혀 필요하지 않다는 점입니다.
RTDETRv2는 특히 객체가 겹치는 복잡하고 밀집된 장면에서 인상적인 정확도를 달성하지만, 주목할 만한 트레이드오프가 따릅니다. Transformer에 내재된 어텐션 메커니즘은 일반적인 CNN에 비해 학습 중 훨씬 더 많은 CUDA 메모리를 요구합니다. 또한 NVIDIA A100이나 T4 같은 고성능 GPU에서는 우수한 성능을 보이지만, 표준 CPU에서는 아키텍처가 눈에 띄게 느리고 엣지 디바이스에서는 심각한 제약을 받습니다.
Ultralytics YOLOv5: 효율성의 업계 표준#
Ultralytics YOLOv5는 출시 당시 응용 머신러닝의 판도를 근본적으로 바꾸었으며, 매우 직관적인 프레임워크를 통해 전 세계 개발자가 고성능 컴퓨터 비전에 쉽게 접근할 수 있도록 했습니다.
- 작성자: Glenn Jocher
- 조직: Ultralytics
- 날짜: 2020년 6월 26일
- 링크: 공식 문서, GitHub 리포지토리
생태계 및 성능 균형#
YOLOv5는 전적으로 PyTorch 프레임워크를 기반으로 구축되었으며, 매우 효율적인 CNN 아키텍처를 사용합니다. 처음부터 사용 편의성을 목표로 설계되었고, 간소화된 API와 AI 업계에서 가장 방대한 문서 중 일부를 제공합니다.
YOLOv5의 가장 큰 장점은 뛰어난 범용성과 낮은 메모리 요구 사항입니다. YOLOv5 모델을 학습하는 데는 Transformer 기반 모델보다 훨씬 적은 VRAM이 필요하므로, 하드웨어 예산이 제한적인 연구자와 엔지니어도 사용할 수 있습니다. 또한 RTDETRv2가 바운딩 박스 검출에만 집중하는 반면, YOLOv5는 인스턴스 세그멘테이션과 이미지 분류를 지원하는 다목적 모델로 발전했습니다.
가장 간소화된 워크플로를 경험하려면 Ultralytics Platform을 사용하여 YOLOv5를 직접 학습하고, 검증하고, 배포할 수 있습니다. 이 플랫폼은 클라우드 학습 기능과 코드 없이 사용할 수 있는 배포 파이프라인을 제공합니다.
성능 및 지표 비교#
표준 COCO 데이터셋에서 원시 성능을 분석하면 이러한 모델이 리소스의 우선순위를 어떻게 정하는지 명확한 차이를 확인할 수 있습니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
트레이드오프 분석#
데이터에 따르면 RTDETRv2-x는 최고 평균 정밀도(mAP) 54.3%를 달성하여 YOLOv5x의 50.7%를 소폭 앞섭니다. 그러나 이러한 미미한 정확도 향상에는 막대한 계산 비용이 따릅니다. YOLOv5x는 더 낮은 지연 시간(TensorRT에서 15.03ms 대비 11.89ms)으로 작동하며 메모리 사용량도 일부에 불과합니다. 초저전력 엣지 배포에서는 YOLOv5n(Nano)이 여전히 독보적이며, 2.6M개의 매개변수만으로 단 1.12ms에 추론을 완료합니다. RTDETRv2는 이러한 등급에는 아예 도전하지 않습니다.
학습 효율성과 코드 단순성#
Ultralytics 생태계의 주요 강점 중 하나는 통합 API입니다. 특정 고연산 작업에 Transformer 아키텍처인 RT-DETR을 사용하기로 결정하더라도, Ultralytics Python 패키지 내에서 모든 작업을 수행할 수 있으며 코드 한 줄만으로 모델을 원활하게 교체할 수 있습니다.
from ultralytics import RTDETR, YOLO
# Load the Ultralytics YOLOv5 small model
model_yolo = YOLO("yolov5s.pt")
# Load the RT-DETR large model via Ultralytics
model_rtdetr = RTDETR("rtdetr-l.pt")
# Train YOLOv5 effortlessly on your custom data
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference with both models seamlessly
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo[0].show()Ultralytics 라이브러리를 활용하면 개발자는 실험 추적 통합(Weights & Biases 및 Comet ML 등)을 포함한 잘 유지 관리되는 생태계와 ONNX 및 OpenVINO 같은 배포 형식으로의 원클릭 내보내기를 자동으로 이용할 수 있습니다.
실제 애플리케이션 및 이상적인 사용 사례#
RTDETRv2가 강점을 보이는 분야#
RTDETRv2는 하드웨어 제약이 없고 가능한 최고 수준의 정밀도만을 목표로 하는 환경에 가장 적합합니다.
- 서버 측 의료 영상: 고해상도 X-ray에서 미세한 이상 징후를 검출합니다.
- 위성 영상: 강력한 클라우드 클러스터에서 항공 감시 작업을 수행하며 밀집되고 겹치는 객체를 추적합니다.
YOLOv5가 뛰어난 분야#
YOLOv5는 다양한 하드웨어에서 실용적이고 실제적인 배포를 위한 확실한 챔피언입니다.
- 엣지 AI 디바이스: 메모리가 엄격하게 제한된 Raspberry Pi 또는 NVIDIA Jetson 디바이스에 보안 경보 시스템을 배포합니다.
- 모바일 애플리케이션: CoreML 또는 TFLite를 통해 스마트폰에서 바운딩 박스 및 세그멘테이션 추론을 빠르고 실시간으로 직접 실행합니다.
- 고속 산업 제조: 밀리초 단위의 지연 시간이 운영 성공에 중요한 고속 생산 라인에서 부품을 검사합니다.
YOLOv5는 전설적인 모델이지만 Ultralytics 생태계는 AI의 한계를 지속적으로 확장하고 있습니다. 2026년에 새 프로젝트를 위한 모델을 비교한다면 최첨단 Ultralytics YOLO26을 살펴보는 것이 좋습니다. YOLO26은 기본적으로 엔드 투 엔드 NMS 없는 설계(Transformer와 유사하지만 CNN 속도를 제공)를 통합하고, 매우 안정적인 학습을 위한 혁신적인 MuSGD Optimizer를 갖추었으며, CPU 추론을 최대 43% 더 빠르게 수행합니다. 또는 YOLO11은 포즈 추정과 OBB 검출이 필요한 다목적 배포를 위한 뛰어난 고지원 선택지로 여전히 유효합니다.
궁극적으로 RTDETRv2가 Transformer 레이어를 사용하여 정확도의 한계를 높이는 반면, Ultralytics YOLO 프레임워크는 속도, 가벼운 메모리 요구 사항 및 뛰어나게 설계된 개발자 경험을 독보적으로 균형 있게 제공하여 프로토타입에서 프로덕션까지 걸리는 시간을 크게 단축합니다.