YOLO Vision 2026:

YOLOv5 대 RTDETRv2#

computer vision의 생태계는 지난 몇 년 동안 크게 확장되어 개발자들이 복잡한 시각적 작업을 처리할 수 있는 다양한 아키텍처를 제공하고 있습니다. 가장 인기 있는 패러다임 중에는 합성곱 신경망(CNN)과 Detection Transformer(DETR)가 있습니다.

이 가이드는 이러한 범주에서 매우 중요한 두 가지 모델, 즉 효율성이 높고 널리 채택된 CNN 기반 모델인 Ultralytics YOLOv5와 최첨단 Transformer 기반 실시간 객체 검출기인 RTDETRv2 간의 심층적인 기술적 비교를 제공합니다.

Ultralytics YOLOv5: 효율성의 업계 표준#

출시 이후 Ultralytics YOLOv5는 AI 커뮤니티의 핵심으로 자리 잡아 전 세계적으로 수천 개의 상용 애플리케이션과 연구 프로젝트를 지원해 왔습니다. 전적으로 PyTorch 프레임워크를 기반으로 구축되어, 실시간 성능을 저해하지 않으면서도 직관적인 개발자 경험을 우선시했습니다.

주요 특징:

아키텍처 및 강점#

YOLOv5는 매우 낮은 메모리 사용량을 유지하면서 feature extraction 효율성을 극대화하도록 설계된 간소화된 CNN 아키텍처를 활용합니다. CSPDarknet 백본과 PANet 넥을 채택하여 다중 스케일 특징 융합을 위한 강력한 조합을 만들어냅니다.

YOLOv5의 주요 장점 중 하나는 Performance Balance입니다. 속도와 정확도 사이에서 뛰어난 균형을 유지하므로 NVIDIA Jetson 기기 및 스마트폰과 같이 리소스가 제한된 하드웨어에 model deployment을 수행하기에 이상적인 선택입니다.

또한 YOLOv5는 비할 데 없는 **다재다능함(Versatility)**을 자랑합니다. 경계 박스 예측에만 국한된 모델과 달리, YOLOv5는 image classificationinstance segmentation을 기본적으로 지원하여 다양한 시각적 작업을 위한 통합 프레임워크를 제공합니다. 또한 training efficiency도 주목할 만하여, Transformer 기반 아키텍처에 비해 학습 중에 훨씬 적은 CUDA 메모리를 요구합니다.

단점#

이전의 CNN 프레임워크에 의존하기 때문에, YOLOv5는 중복된 경계 박스를 제거하기 위해 후처리 과정에서 본질적으로 Non-Maximum Suppression (NMS)에 의존합니다. Ultralytics 프레임워크 내에서 고도로 최적화되어 있지만, NMS는 특화된 엣지 NPU에서 간혹 지연 병목 현상을 유발할 수 있습니다.

YOLOv5에 대해 더 알아보기

RTDETRv2: Baidu의 실시간 Transformer#

RTDETRv2(Real-Time Detection Transformer v2)는 실시간 객체 탐지에 Transformer 아키텍처를 적용하는 데 있어 획기적인 발전을 이루었으며, 기존 DETR 모델들을 괴롭혔던 컴퓨팅 비효율성 문제를 해결했습니다.

주요 특징:

아키텍처 및 강점#

RTDETRv2는 하이브리드 인코더와 유연한 디코더 설계를 활용하여 이미지를 처리함으로써 이전 모델의 강점을 계승했습니다. Transformer의 셀프 어텐션 메커니즘은 모델에 이미지 맥락에 대한 전역적인 이해를 제공하여, 객체가 심하게 가려진 복잡한 장면에서도 탁월한 성능을 발휘하게 합니다.

RTDETRv2의 핵심 특징은 종단간(end-to-end) NMS-free 디자인입니다. anchor boxes나 NMS 후처리가 필요 없이 객체 쿼리를 직접 예측하므로 추론 파이프라인이 단순화됩니다. 이 아키텍처는 COCO와 같은 벤치마크 데이터셋에서 인상적인 mAP (mean Average Precision)을 달성합니다.

단점#

실시간 기능에도 불구하고, RTDETRv2는 YOLO 모델에 비해 메모리 요구 사항이 현저히 높습니다. Transformer의 어텐션 메커니즘은 시퀀스 길이에 따라 이차적으로 증가하므로, 대규모 GPU 클러스터를 사용하지 않으면 고해상도 학습 중에 메모리 부족(OOM) 오류가 발생할 수 있습니다. 또한 Ultralytics 생태계의 기본 제공되는 다재다능함이 부족하여, 분할이나 포즈 추정에 대한 기본 지원 없이 주로 2D object detection에만 초점을 맞추고 있습니다.

RTDETR에 대해 더 알아보기

성능 비교표#

이 아키텍처들을 객관적으로 평가하기 위해 성능 지표를 정리했습니다. 굵게 표시된 값은 테스트된 스케일 전반에서 가장 효율적이거나 높은 성능을 보인 지표를 나타냅니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv5n64028.073.61.122.67.7
YOLOv5s64037.4120.71.929.124.0
YOLOv5m64045.4233.94.0325.164.2
YOLOv5l64049.0408.46.6153.2135.0
YOLOv5x64050.7763.211.8997.2246.4
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
성능 맥락

RTDETRv2-x가 절대적으로 가장 높은 mAP를 달성하지만, YOLOv5n 파라미터의 거의 30배를 요구합니다. 제한된 하드웨어에서 실행되는 고속 애플리케이션의 경우, Ultralytics 모델이 일관되게 최상의 컴퓨팅 효율성을 제공합니다.

Ultralytics 생태계의 이점#

연구용 노트북에서 프로덕션 환경으로 모델을 옮길 때, 모델을 둘러싼 소프트웨어는 신경망 아키텍처만큼이나 중요합니다. Ultralytics가 제공하는 잘 관리된 생태계는 개발 수명 주기를 획기적으로 가속화합니다.

비할 데 없는 사용 편의성#

Ultralytics 모델은 매우 간소화된 사용자 경험을 최우선으로 합니다. 커스텀 모델을 학습하거나, 검증을 실행하거나, TensorRT 또는 ONNX와 같은 하드웨어 전용 형식으로 내보내기를 원하든, Ultralytics Python API를 사용하면 몇 줄의 코드만으로 이를 달성할 수 있습니다.

다음은 Ultralytics 모델을 사용하여 얼마나 간단하게 학습 및 추론을 실행할 수 있는지 보여주는 실용적인 코드 예제입니다:

from ultralytics import YOLO

# Initialize the model (automatically downloads the weights)
model = YOLO("yolov5s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device="cpu")

# Perform inference on an online image
inference_results = model.predict("https://ultralytics.com/images/bus.jpg")

# Display the resulting image with bounding boxes
inference_results[0].show()

이 간단하고 통합된 API는 Weights & BiasesComet과 같은 도구와의 experiment tracking 연동을 기본적으로 지원하므로, 개발자가 복잡한 상용구(boilerplate) 코드를 작성하지 않고도 메트릭을 원활하게 기록할 수 있습니다.

활용 사례 및 권장 사항#

YOLOv5와 RT-DETR 중 선택하는 것은 프로젝트의 특정 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.

YOLOv5를 선택해야 하는 경우#

YOLOv5는 다음에 추천합니다:

  • 검증된 프로덕션 시스템: YOLOv5의 긴 안정성 이력, 광범위한 문서, 방대한 커뮤니티 지원이 가치 있게 평가되는 기존 배포 환경.
  • 리소스가 제한된 학습: YOLOv5의 효율적인 학습 파이프라인과 낮은 메모리 요구 사항이 유리한, GPU 자원이 제한된 환경.
  • 광범위한 내보내기 포맷 지원: ONNX, TensorRT, CoreML, TFLite를 포함한 다양한 포맷 전반에 걸친 배포가 필요한 프로젝트.

RT-DETR을 선택해야 할 때#

RT-DETR 권장 대상:

  • Transformer 기반 탐지 연구: NMS 없이 엔드 투 엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 탐구하는 프로젝트.
  • 유연한 지연 시간을 가진 고정밀 시나리오: 탐지 정확도가 최우선이며, 약간 높은 추론 지연 시간이 허용되는 애플리케이션.
  • 대형 객체 탐지: Transformer의 글로벌 어텐션 메커니즘이 자연스러운 이점을 제공하는, 주로 중대형 객체가 있는 장면.

Ultralytics (YOLO26)를 선택해야 할 때#

대부분의 신규 프로젝트의 경우, Ultralytics YOLO26은 성능과 개발자 경험의 최상의 조합을 제공합니다.

  • NMS 미사용 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 낮은 지연 시간의 추론이 필요한 애플리케이션.
  • CPU 전용 환경: 전용 GPU 가속이 없는 디바이스에서, 최대 43% 더 빠른 YOLO26의 CPU 추론 속도가 결정적인 이점을 제공합니다.
  • 소형 객체 감지: 항공 드론 이미지나 IoT 센서 분석과 같은 까다로운 시나리오에서 ProgLoss와 STAL이 아주 작은 객체의 정확도를 크게 향상시킵니다.

향후 전망: YOLO11 및 YOLO26#

오늘 새로운 비전 프로젝트를 시작하신다면, 최신 세대의 Ultralytics 모델을 살펴보시는 것을 강력히 권장합니다.

YOLOv5는 여전히 매우 안정적이지만, YOLO11은 향상된 정확도와 Oriented Bounding Box (OBB) 검출을 포함한 확장된 작업 세트를 제공합니다.

더욱 중요한 점은 최첨단 YOLO26이 양쪽 세계의 장점을 모두 결합했다는 것입니다. (YOLOv10에서 처음 개척된) **엔드투엔드 NMS 프리 설계(End-to-End NMS-Free Design)**를 구현하여 CNN의 효율성을 유지하면서 후처리 오버헤드를 없애줍니다. 또한 YOLO26은 LLM 학습 혁신에서 영감을 받은 MuSGD Optimizer를 도입하여 더 빠른 수렴을 제공합니다. DFL 제거(DFL Removal)(간소화된 내보내기 및 더 나은 엣지/저전력 장치 호환성을 위해 Distribution Focal Loss가 제거됨)를 통해 YOLO26은 최대 43% 더 빠른 CPU 추론을 제공하므로 엣지 AI를 위한 절대적으로 최고의 선택이 됩니다. 추가로, ProgLoss + STAL은 IoT, 로보틱스, 항공 이미지에 필수적인 소형 객체 인식 능력이 크게 향상된 개선된 손실 함수를 제공합니다.

결론#

YOLOv5와 RTDETRv2 중 선택하는 것은 배포 제약 조건에 따라 크게 달라집니다. RTDETRv2는 강력한 Transformer 어텐션 메커니즘을 활용하여 mAP의 한계를 넓혔지만, 메모리 및 컴퓨팅 오버헤드라는 큰 비용이 따릅니다.

반면에 Ultralytics YOLOv5는 클라우드 서버부터 마이크로컨트롤러까지 모든 곳에서 원활하게 실행되는 검증되고 고도로 최적화되며 다재다능한 솔루션을 제공합니다. 완벽한 배포 도구와 함께 최고 수준의 정확도를 원하는 팀에게는, Ultralytics 생태계 내에서 YOLO26으로 업그레이드하는 것이 최신 vision AI 애플리케이션을 위한 결정적인 최첨단 솔루션을 제공합니다.

댓글