EfficientDet과 RTDETRv2#
컴퓨터 비전 프로젝트에 최적의 아키텍처를 선택하려면 다양한 신경망을 폭넓게 살펴봐야 합니다. 이 가이드에서는 확장성이 뛰어난 합성곱 신경망 (CNN) 계열인 EfficientDet과 최첨단 실시간 Transformer 모델인 RTDETRv2라는 두 가지 접근 방식을 상세히 비교합니다. 구조적 차이, 학습 방법론, 다양한 하드웨어 환경에서의 배포 적합성을 평가합니다.
기존 방식의 효율성과 최신 Transformer 기능 간의 상충 관계를 이해하면 개발자는 합리적인 결정을 내릴 수 있습니다. 또한 새로운 Ultralytics YOLO26과 같은 최신 대안이 격차를 해소하고 탁월한 속도, 정확도, 사용 편의성을 제공하는 방식도 살펴봅니다.
EfficientDet 이해하기#
EfficientDet은 모델 스케일링에 체계적인 접근 방식을 도입해 객체 감지 분야에 혁신을 가져왔습니다.
- 저자: Mingxing Tan, Ruoming Pang, Quoc V. Le
- 조직: Google
- 날짜: 2019년 11월 20일
- Arxiv: https://arxiv.org/abs/1911.09070
- GitHub: Google AutoML 저장소
- 문서: EfficientDet 문서
아키텍처와 핵심 개념#
EfficientDet의 핵심은 EfficientNet을 백본으로 활용하고 양방향 특징 피라미드 네트워크 (BiFPN)를 도입하는 것입니다. BiFPN은 학습 가능한 가중치를 적용해 서로 다른 입력 특징의 중요도를 학습함으로써 쉽고 빠른 멀티스케일 특징 융합을 지원합니다. 여기에 백본, 특징 네트워크, 박스 및 클래스 예측 네트워크의 해상도, 깊이, 너비를 모두 동시에 균일하게 조정하는 복합 스케일링 방식을 결합합니다.
장점과 한계#
EfficientDet의 가장 큰 강점은 파라미터 효율성입니다. 출시 당시 EfficientDet-D0과 같은 모델은 이전 YOLO 버전보다 적은 파라미터와 FLOPs로 높은 정확도를 달성했습니다. 따라서 연산량이 엄격히 제한된 환경에서 매우 매력적인 선택이었습니다.
그러나 EfficientDet은 후처리 중 겹치는 바운딩 박스를 필터링하기 위해 표준 비최대 억제 (NMS)를 사용하므로 실시간 파이프라인에서 지연 시간 병목이 발생할 수 있습니다. 또한 학습 프로세스가 잘 문서화되어 있지만, 최신 도구의 고도로 최적화된 개발자 경험과 비교하면 EfficientDet을 미세 조정하는 일은 번거로울 수 있습니다.
EfficientDet은 확장형 네트워크의 기반을 마련했지만, 최신 NPU에 이러한 모델을 배포하려면 광범위한 수동 최적화가 필요한 경우가 많습니다. 간소화된 배포를 위해 최신 Ultralytics 모델은 원클릭 내보내기 기능을 제공합니다.
RTDETRv2 살펴보기#
RTDETRv2는 Transformer 기반 아키텍처의 발전을 보여주며, 기존 앵커 기반 CNN에서 벗어난 새로운 패러다임을 제시합니다.
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 기관: Baidu
- 날짜: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: RT-DETR 저장소
- 문서: RTDETRv2 문서
Transformer의 발전#
RTDETRv2는 Real-Time Detection Transformer (RT-DETR)를 기준 모델로 발전시킨 모델입니다. 전역 어텐션 메커니즘을 활용해 표준 합성곱의 국소적 제약 없이 복잡한 장면의 맥락을 파악할 수 있습니다. 가장 중요한 아키텍처상의 장점은 기본적으로 NMS가 필요 없는 설계입니다. 입력 이미지에서 객체를 직접 예측하므로 추론 파이프라인이 간소화되고 NMS 후처리에 필요한 휴리스틱 튜닝을 피할 수 있습니다.
장점과 단점#
RTDETRv2는 겹치는 객체 때문에 기존 CNN이 혼동하는 고밀도 환경에서 뛰어난 성능을 발휘합니다. COCO와 같은 복잡한 벤치마크 데이터셋에서 정확도가 높습니다.
정확도는 높지만 Transformer 모델은 특성상 상당한 메모리를 요구합니다. CNN과 비교할 때 수렴에 필요한 에포크 수가 훨씬 많고 CUDA 메모리 사용량도 높아 학습 효율이 크게 떨어집니다. 따라서 클라우드 예산이 제한적이거나 빠른 프로토타이핑이 필요한 개발자에게 RTDETRv2는 적합하지 않을 수 있습니다.
RTDETRv2와 같은 Transformer 모델을 학습하려면 일반적으로 고성능 GPU가 필요합니다. 메모리 부족(OOM) 오류가 발생하면 학습 중 메모리 요구량이 더 낮은 Ultralytics YOLO 시리즈와 같은 모델을 사용하는 것을 고려해 보세요.
성능 벤치마크 비교#
모델 선택에는 원시 성능 지표를 이해하는 것이 중요합니다. 다음 표에서는 다양한 크기의 EfficientDet과 RTDETRv2를 비교합니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| EfficientDet-d0 | 640 | 34.6 | 10.2 | 3.92 | 3.9 | 2.54 |
| EfficientDet-d1 | 640 | 40.5 | 13.5 | 7.31 | 6.6 | 6.1 |
| EfficientDet-d2 | 640 | 43.0 | 17.7 | 10.92 | 8.1 | 11.0 |
| EfficientDet-d3 | 640 | 47.5 | 28.0 | 19.59 | 12.0 | 24.9 |
| EfficientDet-d4 | 640 | 49.7 | 42.8 | 33.55 | 20.7 | 55.2 |
| EfficientDet-d5 | 640 | 51.5 | 72.5 | 67.86 | 33.7 | 130.0 |
| EfficientDet-d6 | 640 | 52.6 | 92.8 | 89.29 | 51.9 | 226.0 |
| EfficientDet-d7 | 640 | 53.7 | 122.0 | 128.07 | 51.9 | 325.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
사용 사례 및 권장 사항#
EfficientDet과 RT-DETR 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.
EfficientDet을 선택해야 하는 경우#
EfficientDet은 다음과 같은 경우에 적합합니다.
- Google Cloud 및 TPU 파이프라인: EfficientDet이 기본 최적화된 Google Cloud Vision API 또는 TPU 인프라와 긴밀하게 통합된 시스템입니다.
- 복합 스케일링 연구: 네트워크 깊이, 너비, 해상도를 균형 있게 조정하는 효과를 연구하는 데 중점을 둔 학술 벤치마킹입니다.
- LiteRT를 통한 모바일 배포: Android 또는 임베디드 Linux 장치용으로 LiteRT(구 TensorFlow Lite) 내보내기가 필요한 프로젝트입니다.
RT-DETR을 선택해야 하는 경우#
다음과 같은 경우 RT-DETR을 권장합니다.
- Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
- 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
- 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
Ultralytics의 강점: YOLO26 소개#
EfficientDet과 RTDETRv2는 컴퓨터 비전 역사에서 확고한 위치를 차지했지만, 현대적인 프로덕션 환경에는 속도, 정확도, 탁월한 개발자 경험의 완벽한 균형이 필요합니다. 최근 출시된 Ultralytics YOLO26은 이처럼 서로 다른 아키텍처의 장점을 결합합니다.
YOLO26은 Ultralytics의 간소화된 생태계와 획기적인 내부 메커니즘을 결합해 차별화됩니다.
경쟁 모델보다 YOLO26을 선택해야 하는 이유#
- 엔드투엔드 NMS 프리 설계: RTDETRv2와 같은 Transformer에서 영감을 얻은 YOLO26은 선택형 엔드투엔드 헤드 (
nms=False)를 제공해 NMS 후처리를 제거합니다. 순수 Transformer의 막대한 파라미터 부담 없이 더 빠르고 간단한 배포 파이프라인을 구현합니다. - MuSGD 옵티마이저: Moonshot AI의 Kimi K2와 같은 대규모 언어 모델 학습 혁신에서 영감을 얻은 YOLO26은 SGD와 Muon의 하이브리드를 활용합니다. 이를 통해 RTDETRv2에 필요한 긴 학습 일정과 비교해 전례 없는 학습 안정성과 훨씬 빠른 수렴 속도를 제공합니다.
- 엣지에 최적화: 최대 43% 더 빠른 CPU 추론을 제공하는 YOLO26은 엣지 AI를 위해 구축되었습니다. 휴대폰이나 스마트 카메라처럼 리소스가 제한된 하드웨어에서 무거운 Transformer 모델보다 훨씬 뛰어난 성능을 제공합니다.
- DFL 제거: Distribution Focal Loss를 제거하면 모델 그래프가 단순해져 TensorRT 및 ONNX로 원활하게 내보낼 수 있습니다.
- ProgLoss + STAL: 이러한 고급 손실 함수는 작은 객체 인식 성능을 크게 향상시켜 항공 이미지와 로보틱스 분야의 일반적인 병목 현상을 해결합니다.
- 다재다능함: 주로 탐지에 중점을 두는 RTDETRv2와 달리 YOLO26은 기본적으로 인스턴스 분할, 이미지 분류, 자세 추정, 방향 경계 상자(OBB)를 지원하며, 자세 추정을 위한 RLE와 OBB를 위한 전용 각도 손실 등의 작업별 개선 사항을 제공합니다.
Ultralytics Platform을 활용하면 데이터셋을 관리하고, 클라우드에서 YOLO26 또는 YOLO11과 같은 모델을 학습시키며, 유연한 API를 통해 원활하게 배포할 수 있습니다.
Ultralytics를 통한 간결한 코드 작성#
잘 관리되는 Ultralytics Python API를 사용하면 모델 학습과 추론을 매우 간편하게 수행할 수 있습니다. 개발자는 최소한의 상용구 코드만으로 모델을 벤치마크하거나 학습 스크립트를 실행할 수 있습니다.
from ultralytics import YOLO
# 최첨단 YOLO26 모델을 불러옵니다
model = YOLO("yolo26n.pt")
# 사용자 지정 데이터셋으로 모델을 학습합니다
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# 테스트 이미지에서 추론을 실행합니다.
predictions = model.predict("image.jpg")레거시 인프라를 관리하는 경우, 높은 평가를 받는 Ultralytics YOLOv8은 안정적이고 강력한 선택지로 남아 있으며, Ultralytics 생태계의 장기적인 신뢰성을 보여줍니다. 복잡한 실시간 추적 알고리즘을 실행하든 간단한 결함 탐지를 수행하든, YOLO26으로 업그레이드하면 시스템의 미래 대응성, 높은 정확도, 메모리 효율성을 확보할 수 있습니다.