PP-YOLOE+ vs RTDETRv2#
컴퓨터 비전 분야는 특히 실시간 객체 탐지 영역에서 최근 몇 년간 극적인 발전을 이루었습니다. 배포에 적합한 아키텍처를 선택하는 것은 느리고 메모리를 많이 사용하는 애플리케이션과 고도로 최적화되고 응답성이 뛰어난 시스템의 차이를 만들 수 있습니다. 이 기술 비교에서는 Baidu의 대표 모델인 CNN 기반 PP-YOLOE+와 Transformer 기반 RTDETRv2를 살펴봅니다. 두 모델의 아키텍처와 성능 지표, 이상적인 사용 사례를 분석하고, 최첨단 Ultralytics YOLO26 플랫폼과 어떻게 비교되는지도 알아봅니다.
PP-YOLOE+: CNN 패러다임의 발전#
PP-YOLOE+는 이전 모델을 발전시킨 모델로, 객체 탐지에서 기존 합성곱 신경망(CNN)이 달성할 수 있는 한계를 넓혀 갑니다. YOLO 시리즈의 기본 작동 방식을 기반으로 하면서 PaddlePaddle 생태계에 맞춘 특정 최적화를 도입한, 성능이 뛰어난 앵커 프리 탐지기입니다.
모델 세부 정보:
- 저자: PaddlePaddle 저자
- 기관: Baidu
- 날짜: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddleDetection 저장소
- 문서: PP-YOLOE+ 문서
아키텍처 및 방법론#
PP-YOLOE+는 강력하게 최적화된 백본과 사용자 지정 특성 피라미드 네트워크를 사용해 다중 스케일 특성을 효과적으로 통합합니다. 앵커 프리 설계를 채택하여 앵커 박스 생성에 일반적으로 필요한 휴리스틱 튜닝 과정을 간소화합니다. 또한 학습 방법론에 고급 레이블 할당 전략을 포함해 학습 단계에서 예측값과 정답 박스가 더 잘 대응하도록 합니다.
강점 및 사용 사례#
PP-YOLOE+의 주요 강점은 표준 서버 하드웨어에서 안정적인 성능을 제공하고 Baidu 도구와 긴밀하게 통합된다는 점입니다. 하드웨어 제약이 지나치게 크지 않은 제조 환경에서 정적 결함 탐지를 수행하는 등 기존 산업 워크플로에 적합합니다.
PP-YOLOE+는 높은 정확도를 제공하지만, 기본 생태계 외부에 배포하려면 추가 변환 단계가 필요한 경우가 있습니다. 이는 최신 Ultralytics 파이프라인에서 기본적으로 제공되는 내보내기 형식과 다릅니다.
RTDETRv2: 실시간 탐지 Transformer#
순수 CNN에서 벗어나 RTDETRv2(실시간 탐지 Transformer 버전 2)는 컴퓨터 비전 작업에 어텐션 기반 메커니즘을 도입한 도약을 보여줍니다. Transformer의 전역 문맥 이해 능력과 실제 애플리케이션에 필요한 낮은 지연 시간을 결합하고자 합니다.
모델 세부 정보:
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 기관: Baidu
- 날짜: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2 저장소
- 문서: RTDETRv2 README
아키텍처 및 방법론#
RTDETRv2는 특성 추출을 위한 CNN 백본과 간소화된 Transformer 인코더-디코더를 결합한 하이브리드 아키텍처를 활용합니다. RTDETRv2의 두드러진 특징은 기존 비최대 억제(NMS) 후처리 과정을 생략하는 기본 엔드투엔드 설계입니다. 또한 다중 스케일 탐지와 복잡한 장면 처리 기능을 도입하고, 셀프 어텐션을 활용해 멀리 떨어진 객체 사이의 공간적 관계를 파악합니다.
강점 및 사용 사례#
Transformer 아키텍처 덕분에 RTDETRv2는 전역 컨텍스트 이해가 중요한 시나리오에서 매우 효과적입니다. 그러나 Transformer 모델은 일반적으로 경량 CNN보다 학습과 추론 모두에서 훨씬 더 많은 CUDA 메모리를 요구합니다. 강력한 GPU 서버에서 실행되는 클라우드 기반 비디오 분석과 같은 하드웨어 제약이 없는 환경에 가장 적합합니다.
성능 및 지표 비교#
이 모델들을 평가할 때는 평균 정밀도(mAP)와 연산 비용(FLOPs 및 추론 지연 시간으로 측정) 간의 절충이 매우 중요합니다. 아래 표는 PP-YOLOE+와 RTDETRv2의 다양한 크기별 주요 지표를 정리합니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2는 더 많은 파라미터와 FLOPs를 대가로 높은 mAP를 보여 주지만, 제약이 있는 엣지 디바이스에 배포하려는 개발자는 Transformer 계층의 일반적인 높은 메모리 요구량으로 인해 병목 현상을 겪을 수 있습니다.
사용 사례 및 권장 사항#
PP-YOLOE+와 RT-DETR 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항과 배포 제약, 선호하는 생태계에 따라 달라집니다.
PP-YOLOE+를 선택할 경우#
PP-YOLOE+는 다음과 같은 경우에 적합합니다.
- PaddlePaddle 생태계 통합: Baidu의 PaddlePaddle 프레임워크와 도구를 기반으로 기존 인프라를 구축한 조직.
- Paddle Lite 엣지 배포: Paddle Lite 또는 Paddle 추론 엔진에 맞춰 특별히 최적화된 추론 커널을 갖춘 하드웨어에 배포하는 경우.
- 높은 정확도의 서버 측 감지: 프레임워크 종속성이 문제가 되지 않는 고성능 GPU 서버에서 최대 감지 정확도를 우선시하는 시나리오.
RT-DETR을 선택해야 하는 경우#
다음과 같은 경우 RT-DETR을 권장합니다.
- Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
- 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
- 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
Ultralytics의 강점: YOLO26 소개#
PP-YOLOE+와 RTDETRv2는 모두 중요한 이정표이지만, 오늘날 개발자에게는 뛰어난 성능과 간편한 사용성을 균형 있게 제공하는 생태계가 필요합니다. Ultralytics Platform과 획기적인 YOLO26 모델이 바로 이러한 요구를 충족합니다.
2026년 1월에 출시된 YOLO26은 엣지 우선 비전 AI의 새로운 표준을 제시합니다. 기존 아키텍처와 관련된 배포 문제를 효과적으로 해결하는 동시에 속도와 정확도 모두에서 기존 모델을 능가합니다.
아키텍처 혁신#
YOLO26은 기존 CNN과 대형 Transformer를 능가하는 여러 선구적인 개선 사항을 도입합니다:
- 엔드투엔드 NMS 프리 설계: RTDETRv2와 마찬가지로 YOLO26은 기본 엔드투엔드 추론을 지원합니다. 선택적 일대일 헤드(
nms=False)를 사용해 비최대 억제(NMS) 후처리를 생략하므로 지연 시간 변동이 줄고 배포가 더 빠르고 간편해져 실시간 로보틱스 및 자율 시스템에 적합합니다. - CPU 추론 최대 43% 향상: YOLO26은 아키텍처를 심층적으로 최적화하여 개별 GPU가 없는 엣지 디바이스에서 경쟁 모델보다 훨씬 뛰어난 성능을 발휘하므로 IoT 및 스마트 시티 애플리케이션에 최적의 선택입니다.
- MuSGD 옵티마이저: LLM 학습 혁신에서 영감을 얻은 YOLO26은 SGD와 Muon을 결합한 하이브리드 방식을 사용합니다. 이를 통해 더 안정적인 학습 경로와 놀라울 정도로 빠른 수렴을 달성하여 GPU 학습 시간을 크게 줄입니다.
- ProgLoss + STAL: 이러한 고급 손실 함수는 소형 객체 인식 성능을 크게 향상합니다. 이 영역은 PP-YOLOE+와 같은 모델이 기존에 어려움을 겪었던 부분으로, 항공 이미지 및 드론 애플리케이션에서 특히 중요합니다.
- DFL 제거: Distribution Focal Loss를 제거해 내보내기 과정을 간소화하고, 다양한 엣지 및 저전력 디바이스와 원활하게 호환되도록 합니다.
특정 객체 탐지에 특화된 모델과 달리 YOLO26은 다재다능하며 인스턴스 분할, 자세 추정, 분류, 방향성 바운딩 박스(OBB)를 지원합니다. 자세 추정을 위한 RLE와 OBB를 위한 특수 각도 손실 등 작업에 최적화된 개선 사항도 포함합니다.
탁월한 사용 편의성#
RTDETRv2와 같은 복잡한 아키텍처를 도입할 때 가장 큰 단점 중 하나는 가파른 학습 곡선과 분절된 통합 과정입니다. Ultralytics 생태계는 직관적인 Python API와 포괄적인 웹 기반 플랫폼을 통해 이러한 복잡성을 모두 추상화합니다.
사용자 지정 데이터셋 학습부터 빠른 추론 실행까지 모든 과정이 원활합니다:
from ultralytics import RTDETR, YOLO
# 최첨단 YOLO26 모델을 초기화합니다
model_yolo = YOLO("yolo26n.pt")
# 또는 동일한 간단한 API를 통해 RT-DETR 모델 초기화
model_rtdetr = RTDETR("rtdetr-l.pt")
# 간편하게 실시간 추론 실행
results = model_yolo("https://ultralytics.com/images/zidane.jpg")
results[0].show()
# 한 줄로 엣지 배포용 내보내기
model_yolo.export(format="engine", quantize=16)Ultralytics YOLO 모델은 메모리 요구량이 낮아 Transformer 기반 모델보다 더 빠르게 학습하고 저렴한 하드웨어에 배포할 수 있습니다. 또한 활발한 개발과 세계적 수준의 문서 덕분에 프로덕션 파이프라인의 안정성을 유지할 수 있습니다.
다른 대안을 검토하는 팀이라면 YOLO11도 생태계에서 폭넓게 지원되며 성능이 뛰어난 이전 모델로, 레거시 하드웨어 통합을 위한 훌륭한 기준점입니다. YOLO11과 RT-DETR 비교도 참고하시면 유용합니다.
요약#
PP-YOLOE+와 RTDETRv2는 각각 고급 CNN 파이프라인과 실시간 Transformer의 실현 가능성을 보여 주며 컴퓨터 비전 발전에 크게 기여했습니다. 그러나 2026년에 견고하고 다재다능하며 고도로 최적화된 컴퓨터 비전 애플리케이션을 배포하려는 조직에 Ultralytics YOLO26은 독보적인 솔루션을 제공합니다. 선택적 NMS 프리 추론과 훨씬 빨라진 CPU 추론, 간소화된 생태계를 통해 개발자는 아이디어 구상에서 확장 가능한 프로덕션 환경으로 그 어느 때보다 빠르게 전환할 수 있습니다.