PP-YOLOE+ 대 RTDETRv2#
컴퓨터 비전 분야는 특히 실시간 객체 탐지 영역에서 최근 몇 년 동안 극적인 발전을 이루었습니다. 배포에 적합한 아키텍처를 선택하는 것은 느리고 메모리를 많이 사용하는 애플리케이션과 고도로 최적화되고 반응성이 뛰어난 시스템의 차이를 만들 수 있습니다. 이 기술 비교에서는 Baidu의 대표적인 두 모델인 CNN 기반 PP-YOLOE+와 Transformer 기반 RTDETRv2를 살펴봅니다. 두 모델의 아키텍처, 성능 지표 및 이상적인 사용 사례를 분석하고, 최신 기술인 Ultralytics YOLO26 플랫폼과의 비교도 검토합니다.
PP-YOLOE+: CNN 패러다임의 발전#
PP-YOLOE+는 이전 모델을 발전시킨 반복 모델로 개발되었으며, 기존 합성곱 신경망(CNN)이 객체 탐지에서 달성할 수 있는 한계를 확장합니다. YOLO 시리즈의 기본 메커니즘을 기반으로 하면서 PaddlePaddle 생태계에 맞춘 구체적인 최적화를 도입한 매우 뛰어난 anchor-free detector입니다.
모델 세부 정보:
- 저자: PaddlePaddle Authors
- 조직: Baidu
- 날짜: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetection 리포지토리
- 문서: PP-YOLOE+ 문서
아키텍처 및 방법론#
PP-YOLOE+는 고도로 최적화된 backbone과 맞춤형 feature pyramid network를 사용하여 다중 스케일 feature를 효과적으로 집계합니다. anchor-free 설계를 활용하므로 일반적으로 anchor box 생성에 필요한 휴리스틱 튜닝 프로세스를 간소화합니다. 또한 학습 단계에서 예측값과 ground truth box를 더 정확하게 매칭하기 위해 고급 label assignment 전략을 포함한 학습 방법론을 사용합니다.
강점 및 사용 사례#
PP-YOLOE+의 주요 강점은 표준 서버 하드웨어에서의 견고한 성능과 Baidu 도구와의 긴밀한 통합에 있습니다. 하드웨어 제약이 지나치게 크지 않은 제조 환경에서의 정적 결함 탐지와 같은 기존 산업 워크플로에 적합합니다.
PP-YOLOE+는 높은 정확도를 제공하지만, 최신 Ultralytics 파이프라인에서 기본적으로 제공되는 export format과 달리 기본 생태계 외부에 배포하려면 추가 변환 단계가 필요한 경우가 있습니다.
RTDETRv2: 실시간 탐지 Transformer#
순수 CNN에서 벗어나 RTDETRv2(실시간 객체 탐지 Transformer 버전 2)는 컴퓨터 비전 작업에 attention 기반 메커니즘을 도입한 도약을 보여줍니다. 이 모델은 Transformer의 전역 context 이해 능력과 실제 애플리케이션에 필요한 낮은 latency를 결합하려고 합니다.
모델 세부 정보:
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2 저장소
- 문서: RTDETRv2 README
아키텍처 및 방법론#
RTDETRv2는 feature extraction을 위한 CNN backbone과 간소화된 Transformer encoder-decoder를 결합한 hybrid architecture를 활용합니다. RTDETRv2의 대표적인 특징은 기존 비최대 억제(NMS) 후처리 과정을 우회하는 기본 end-to-end 설계입니다. 또한 다중 스케일 탐지와 복잡한 장면 처리를 도입하고, self-attention을 활용하여 멀리 떨어진 객체 간의 공간적 관계를 이해합니다.
강점 및 사용 사례#
Transformer 아키텍처 덕분에 RTDETRv2는 전역 context 이해가 중요한 시나리오에서 매우 효과적입니다. 그러나 Transformer 모델은 일반적으로 경량 CNN에 비해 학습과 추론 모두에서 훨씬 더 많은 CUDA 메모리를 요구합니다. 강력한 GPU 서버에서 실행되는 클라우드 기반 video analytics와 같이 하드웨어 제약이 없는 환경에 가장 적합합니다.
성능 및 지표 비교#
이러한 모델을 평가할 때는 평균 정밀도(mAP)와 계산 비용(FLOPs 및 inference latency로 측정됨) 간의 trade-off가 가장 중요합니다. 아래 표에는 PP-YOLOE+와 RTDETRv2의 다양한 scale에 대한 주요 지표가 정리되어 있습니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2는 더 많은 parameter 수와 FLOPs를 대가로 높은 mAP를 보여주지만, 제약이 있는 edge device에 배포하려는 개발자는 Transformer layer에 일반적인 높은 메모리 요구 사항으로 인해 병목 현상을 겪는 경우가 많습니다.
사용 사례 및 권장 사항#
PP-YOLOE+와 RT-DETR 중에서 선택하는 것은 특정 프로젝트 요구 사항, 배포 제약 및 생태계 선호도에 따라 달라집니다.
PP-YOLOE+를 선택해야 하는 경우#
다음과 같은 경우 PP-YOLOE+가 적합합니다:
- PaddlePaddle 생태계 통합: 기존 인프라가 Baidu의 PaddlePaddle 프레임워크와 도구를 기반으로 구축된 조직입니다.
- Paddle Lite 엣지 배포: Paddle Lite 또는 Paddle 추론 엔진에 특화된 고도로 최적화된 추론 커널을 갖춘 하드웨어에 배포하는 경우입니다.
- 고정밀 서버 측 감지: 프레임워크 종속성이 문제가 되지 않는 강력한 GPU 서버에서 최고 수준의 감지 정확도를 우선시하는 시나리오입니다.
RT-DETR을 선택해야 하는 경우#
다음과 같은 경우 RT-DETR을 권장합니다.
- Transformer 기반 감지 연구: NMS 없이 엔드 투 엔드 객체 감지를 수행하기 위해 attention mechanism과 Transformer 아키텍처를 탐구하는 프로젝트입니다.
- 유연한 latency를 요구하는 고정확도 시나리오: 감지 정확도가 최우선이며 약간 더 높은 추론 latency를 허용할 수 있는 애플리케이션입니다.
- 대형 객체 감지: 주로 medium-to-large 객체가 있는 장면으로, Transformer의 global attention mechanism이 자연스러운 이점을 제공하는 경우입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.
- NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
- 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.
Ultralytics의 강점: YOLO26 소개#
PP-YOLOE+와 RTDETRv2는 모두 중요한 이정표를 세웠지만, 오늘날의 개발자에게는 뛰어난 성능과 간소화된 사용 편의성의 균형을 완벽하게 갖춘 생태계가 필요합니다. Ultralytics Platform과 획기적인 YOLO26 모델이 바로 이러한 요구를 충족합니다.
2026년 1월에 출시된 YOLO26은 edge-first vision AI의 새로운 표준을 확립합니다. 기존 아키텍처와 관련된 배포 장애를 우아하게 해결하는 동시에 속도와 정확도 모두에서 이를 능가합니다.
아키텍처 혁신#
YOLO26은 기존 CNN과 무거운 Transformer를 능가하는 몇 가지 획기적인 개선 사항을 도입합니다.
- End-to-End NMS-Free Design: RTDETRv2와 마찬가지로 YOLO26은 기본적으로 end-to-end입니다. 비최대 억제(NMS) 후처리를 제거하여 latency jitter를 줄이고 더 빠르고 간단한 배포를 제공하므로, 실시간 robotics 및 자율 시스템에 적합합니다.
- 최대 43% 더 빠른 CPU Inference: YOLO26은 심층적인 아키텍처 최적화를 통해 discrete GPU가 없는 edge device에서 경쟁 모델을 크게 능가하므로 IoT 및 smart city 애플리케이션에 가장 적합한 선택입니다.
- MuSGD Optimizer: LLM 학습 혁신에서 영감을 얻은 YOLO26은 SGD와 Muon의 hybrid를 사용합니다. 이를 통해 더 안정적인 학습 경로와 놀라울 정도로 빠른 수렴을 구현하여 GPU 학습 시간을 크게 줄입니다.
- ProgLoss + STAL: 이러한 고급 loss function은 small-object recognition을 크게 향상합니다. 이는 PP-YOLOE+와 같은 모델이 역사적으로 어려움을 겪어 온 영역으로, aerial imagery 및 drone 애플리케이션에 매우 중요합니다.
- DFL Removal: Distribution Focal Loss를 제거하여 export 프로세스를 간소화하고 다양한 edge 및 low-power device에서 원활한 호환성을 보장합니다.
전문 object detector와 달리 YOLO26은 매우 다재다능하며 Instance Segmentation, Pose Estimation, Classification 및 Oriented Bounding Boxes (OBB)를 지원합니다. Pose를 위한 RLE와 OBB를 위한 특수 angle loss 등 용도에 맞춘 개선 사항도 포함합니다.
탁월한 사용 편의성#
RTDETRv2와 같은 복잡한 아키텍처를 도입할 때 가장 큰 단점 중 하나는 가파른 학습 곡선과 분리된 통합 프로세스입니다. Ultralytics 생태계는 직관적인 Python API와 종합적인 웹 기반 플랫폼을 통해 이러한 복잡성을 완전히 추상화합니다.
custom dataset을 학습하거나 빠르게 inference를 실행하는 경우에도 프로세스는 원활합니다.
from ultralytics import RTDETR, YOLO
# Initialize the state-of-the-art YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Alternatively, initialize an RT-DETR model via the same simple API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Run real-time inference effortlessly
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# Export for edge deployment in one line
model_yolo.export(format="engine", quantize=16)Ultralytics YOLO 모델은 일반적으로 메모리 요구 사항이 더 낮으므로 Transformer 기반 모델에 비해 더 빠르게 학습하고 더 저렴한 하드웨어에 배포할 수 있습니다. 또한 지속적인 개발과 세계적 수준의 문서가 production pipeline의 안정성을 보장합니다.
대안을 모색하는 팀을 위해 YOLO11은(는) 에코시스템 내에서 강력한 지원을 제공하며 뛰어난 역량을 갖춘 전세대 모델로 남아 있어, 레거시 하드웨어 통합을 위한 훌륭한 기준선을 제공합니다. 또한 YOLO11 vs RT-DETR 비교 문서를 읽어보시는 것도 유용할 수 있습니다.
요약#
PP-YOLOE+와 RTDETRv2는 각각 고급 CNN pipeline과 실시간 Transformer의 실행 가능성을 입증하며 컴퓨터 비전의 발전에 크게 기여했습니다. 그러나 2026년에 견고하고 다재다능하며 고도로 최적화된 컴퓨터 비전 애플리케이션을 배포하려는 조직에는 Ultralytics YOLO26이 독보적인 솔루션을 제공합니다. 기본적으로 NMS가 필요 없는 아키텍처, 훨씬 빠른 CPU inference 및 간소화된 생태계를 통해 개발자는 그 어느 때보다 빠르게 아이디어 구상에서 확장 가능한 production으로 전환할 수 있습니다.