Ultralytics YOLO27:
Get Started

YOLOv5와 RTDETRv2#

컴퓨터 비전 분야는 지난 몇 년간 크게 확장되어 개발자는 복잡한 시각 작업에 활용할 수 있는 다양한 아키텍처를 선택할 수 있게 되었습니다. 가장 인기 있는 패러다임으로는 합성곱 신경망 (CNN)과 탐지 Transformer (DETR)가 있습니다.

이 가이드에서는 두 범주를 대표하는 모델인 효율성이 높고 널리 사용되는 CNN 기반 모델 Ultralytics YOLOv5와 최신 Transformer 기반 실시간 객체 검출기 RTDETRv2를 심층적으로 기술 비교합니다.

Ultralytics YOLOv5: 효율성의 업계 표준#

출시 이후 Ultralytics YOLOv5는 전 세계 수천 개의 상용 애플리케이션과 연구 프로젝트를 지원하며 AI 커뮤니티의 핵심 모델로 자리 잡았습니다. PyTorch 프레임워크만을 기반으로 구축되었으며, 실시간 성능을 저해하지 않으면서 직관적인 개발자 경험을 우선시했습니다.

주요 특징:

아키텍처 및 강점#

YOLOv5는 매우 낮은 메모리 사용량을 유지하면서 특징 추출 효율을 극대화하도록 설계된 간소화된 CNN 아키텍처를 사용합니다. CSPDarknet 백본과 PANet 넥을 활용해 다중 스케일 특징 융합에 강력한 조합을 제공합니다.

YOLOv5의 주요 장점 중 하나는 성능 균형입니다. 속도와 정확도 간의 탁월한 균형을 이루므로 NVIDIA Jetson 기기나 스마트폰처럼 리소스가 제한된 하드웨어에서 모델 배포를 수행하기에 이상적입니다.

또한 YOLOv5는 탁월한 다용성을 자랑합니다. 바운딩 박스 예측만 수행하는 모델과 달리 YOLOv5는 이미지 분류와 인스턴스 분할을 기본적으로 지원하여 다양한 시각 작업을 위한 통합 프레임워크를 제공합니다. 학습 효율성도 뛰어나 Transformer 기반 아키텍처보다 학습 중 CUDA 메모리를 훨씬 적게 사용합니다.

단점#

YOLOv5는 구형 CNN 프레임워크를 기반으로 하므로 후처리 중 중복 바운딩 박스를 제거하기 위해 Non-Maximum Suppression (NMS)에 의존합니다. Ultralytics 프레임워크에서 고도로 최적화되어 있지만, NMS는 특수 엣지 NPU에서 간혹 지연 시간 병목을 일으킬 수 있습니다.

RTDETRv2: Baidu의 실시간 Transformer#

RTDETRv2 (Real-Time Detection Transformer v2)는 표준 DETR에서 역사적으로 문제가 되어 온 연산 비효율을 해결하면서 Transformer 아키텍처를 실시간 객체 탐지에 적용하는 데 큰 도약을 보여 줍니다.

주요 특징:

아키텍처 및 강점#

RTDETRv2는 하이브리드 인코더와 유연한 디코더 설계를 사용해 이미지를 처리함으로써 이전 버전을 발전시켰습니다. Transformer의 셀프 어텐션 메커니즘은 모델이 이미지 맥락을 전역적으로 이해하도록 하여, 객체 가림이 심한 복잡한 장면에서도 탁월한 성능을 발휘합니다.

RTDETRv2의 주요 특징은 종단 간 NMS-Free 설계입니다. 앵커 박스나 NMS 후처리 없이 객체 쿼리를 직접 예측하므로 추론 파이프라인이 간소화됩니다. 이 아키텍처는 COCO와 같은 벤치마크 데이터셋에서 인상적인 mAP (평균 정밀도)을 달성합니다.

단점#

실시간 처리 기능에도 불구하고 RTDETRv2는 YOLO 모델보다 메모리 요구 사항이 상당히 높습니다. Transformer의 어텐션 메커니즘은 시퀀스 길이에 따라 제곱으로 확장되므로, 대규모 GPU 클러스터를 사용하지 않으면 고해상도 학습 중 메모리 부족 오류가 발생할 수 있습니다. 또한 Ultralytics 생태계의 기본 제공 다용성이 부족하며, 분할이나 포즈 추정에 대한 기본 지원 없이 2D 객체 탐지에 주로 초점을 맞춥니다.

RTDETRv2 자세히 알아보기

성능 비교 표#

이 아키텍처들을 객관적으로 평가하기 위해 성능 지표를 정리했습니다. 굵게 표시된 값은 테스트한 규모 전반에서 효율성이 가장 높거나 성능이 가장 우수한 지표를 나타냅니다.

모델크기
(픽셀)
mAP검증
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv5n64028.0-1.121.94.5
YOLOv5s64037.4-1.927.216.5
YOLOv5m64045.4-4.0321.249.0
YOLOv5l64049.0-6.6146.5109.1
YOLOv5x64050.7-11.8986.7205.7
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
성능 관련 참고 사항

RTDETRv2-x는 절대 mAP가 가장 높지만, YOLOv5n보다 파라미터가 약 40배 더 많이 필요합니다. 제한된 하드웨어에서 실행되는 고속 애플리케이션의 경우 Ultralytics 모델이 일관되게 최고의 연산 효율성을 제공합니다.

Ultralytics 생태계의 이점#

모델을 연구 노트북에서 프로덕션 환경으로 옮길 때는 모델을 둘러싼 소프트웨어가 신경망 아키텍처만큼 중요합니다. Ultralytics가 제공하는 잘 관리되는 생태계는 개발 수명 주기를 크게 단축합니다.

탁월한 사용 편의성#

Ultralytics 모델은 매우 간결한 사용자 경험을 우선시합니다. 커스텀 모델을 학습하거나, 검증을 실행하거나, TensorRT 또는 ONNX와 같은 하드웨어별 형식으로 내보내려는 경우, Ultralytics Python API를 사용하면 몇 줄의 코드만으로 이를 구현할 수 있습니다.

다음은 Ultralytics 모델의 학습과 추론 실행이 얼마나 간단한지 보여 주는 실용적인 코드 예제입니다.

from ultralytics import YOLO

# 모델을 초기화합니다(가중치를 자동으로 다운로드합니다).
model = YOLO("yolov5su.pt")  # YOLOv5u: ultralytics 패키지용 앵커 프리 YOLOv5 가중치

# COCO8 데이터셋으로 모델 학습
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# 온라인 이미지에 대해 추론을 수행합니다.
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# 바운딩 박스가 표시된 결과 이미지를 출력합니다.
inference_results[0].show()

이 간단하고 통합된 API는 실험 추적 도구와의 연동을 기본적으로 지원하며, Weights & Biases 및 Comet과 같은 도구를 통해 개발자가 복잡한 상용구 코드를 작성하지 않고도 메트릭을 원활하게 기록할 수 있도록 합니다.

사용 사례 및 권장 사항#

YOLOv5와 RT-DETR 중 어느 것을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.

YOLOv5를 선택할 경우#

YOLOv5는 다음과 같은 경우에 적합합니다:

  • 프로덕션에서 검증된 시스템: YOLOv5의 오랜 안정성 기록, 방대한 문서, 대규모 커뮤니티 지원을 중요하게 여기는 기존 배포 환경입니다.
  • 리소스 제약이 있는 학습: GPU 리소스가 제한된 환경에서 YOLOv5의 효율적인 학습 파이프라인과 적은 메모리 요구 사항이 유리합니다.
  • 폭넓은 내보내기 형식 지원: ONNX, TensorRT, CoreML, LiteRT 등 다양한 형식으로 배포해야 하는 프로젝트입니다.

RT-DETR을 선택해야 하는 경우#

다음과 같은 경우 RT-DETR을 권장합니다.

  • Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
  • 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
  • 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.

  • NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
  • 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.

미래를 내다보며: YOLO11 및 YOLO26#

오늘 새로운 비전 프로젝트를 시작한다면 최신 세대의 Ultralytics 모델을 살펴보는 것을 적극 권장합니다.

YOLOv5는 여전히 매우 신뢰할 수 있지만, YOLO11은 정확도가 향상되었으며 방향성 바운딩 박스(OBB) 감지를 포함한 더 다양한 작업을 지원합니다.

더욱 중요한 점은 최첨단 YOLO26이 두 장점을 모두 결합한다는 것입니다. 엔드투엔드 NMS 없는 설계를 구현하여(YOLOv10에서 처음 선보임) CNN의 효율성을 유지하면서 후처리 오버헤드를 제거합니다. YOLO26은 또한 LLM 학습 혁신에서 영감을 얻은 MuSGD Optimizer를 도입하여 더 빠르게 수렴합니다. DFL 제거(내보내기를 간소화하고 엣지 및 저전력 장치 호환성을 높이기 위해 Distribution Focal Loss를 제거함)를 통해 YOLO26은 CPU 추론 속도를 최대 43% 향상하여 엣지 AI를 위한 최적의 선택이 됩니다. 또한 ProgLoss + STAL은 손실 함수를 개선하여 소형 객체 인식 성능을 크게 높이며, 이는 IoT, 로보틱스 및 항공 이미지 분석에 매우 중요합니다.

결론#

YOLOv5와 RTDETRv2 중 어느 것을 선택할지는 배포 제약 조건에 크게 좌우됩니다. RTDETRv2는 강력한 Transformer 어텐션 메커니즘을 활용해 mAP의 한계를 넓히지만, 메모리와 연산 오버헤드가 상당합니다.

반면 Ultralytics YOLOv5는 클라우드 서버부터 마이크로컨트롤러까지 어디서나 원활하게 실행되는 검증된 고도로 최적화된 다목적 솔루션입니다. 배포 도구를 원활하게 활용하면서 가능한 최고의 정확도를 원하는 팀에는 Ultralytics 생태계에서 YOLO26으로 업그레이드하는 것이 최신 비전 AI 애플리케이션을 위한 확실한 최첨단 솔루션입니다.

댓글