Ultralytics YOLO27:
Get Started

RTDETRv2와 EfficientDet#

최적의 신경망 아키텍처를 선택하는 일은 모든 컴퓨터 비전 프로젝트의 성패를 좌우합니다. 이번 종합 기술 비교에서는 영향력 있는 두 객체 감지 모델, 최첨단 Transformer 기반 디텍터인 RTDETRv2와 확장성이 뛰어난 합성곱 신경망인 EfficientDet을 분석합니다. AI 파이프라인을 위한 데이터 기반 의사 결정을 돕기 위해 두 모델의 아키텍처, 성능 지표, 학습 방법론, 이상적인 배포 시나리오를 평가합니다.

RTDETRv2: 실시간 감지 Transformer#

기존 RT-DETR의 성공을 바탕으로 RTDETRv2는 Transformer 기반 객체 감지 패러다임을 개선합니다. 인코더와 디코더 구조를 최적화하여 실시간 추론 속도를 유지하면서 높은 정확도를 제공함으로써 기존 CNN과 비전 Transformer 간의 격차를 효과적으로 해소합니다.

모델 세부 정보

  • 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
  • 기관: Baidu
  • 날짜: 2024-07-24
  • 링크: Arxiv, GitHub, 문서

아키텍처 및 핵심 강점#

RTDETRv2는 강력한 CNN 백본(주로 ResNet 또는 HGNet)과 효율적인 Transformer 디코더를 결합한 하이브리드 아키텍처를 사용합니다. RTDETRv2의 가장 두드러진 특징은 기본적으로 비최대 억제(NMS)를 생략할 수 있다는 점입니다. 기존 디텍터는 중복 바운딩 박스를 필터링하기 위해 NMS가 필요하며, 후처리 과정에서 추론 지연 시간이 변동합니다. RTDETRv2는 감지를 직접 집합 예측 문제로 구성하고 이분 매칭을 사용해 중복되지 않는 예측을 출력합니다.

이 모델은 GPU 메모리가 충분한 서버 측 배포 환경에서 탁월한 성능을 발휘합니다. 전역 어텐션 메커니즘은 뛰어난 컨텍스트 인식 기능을 제공하므로 자동화된 보안 경보 시스템이나 밀집된 군중 모니터링처럼 복잡하고 밀집된 환경에서 겹치는 객체를 구분하는 데 매우 효과적입니다.

제한 사항#

Transformer 아키텍처는 강력하지만 기존 CNN보다 학습 중 CUDA 메모리를 더 많이 사용합니다. 또한 RTDETRv2를 미세 조정할 때 학습 데이터 수렴에 오랜 시간이 걸릴 수 있어, 신속한 프로토타이핑에 더 많은 리소스가 필요할 수 있습니다.

RTDETRv2 자세히 알아보기

EfficientDet: 확장 가능하고 효율적인 CNN#

EfficientDet은 폭넓은 리소스 제약 조건에서 정확도와 효율성을 모두 최적화한 객체 감지 모델 제품군을 선보였습니다. 확장 가능한 머신 비전 설계의 대표적인 사례로 자리 잡고 있습니다.

모델 세부 정보

아키텍처 및 핵심 강점#

EfficientDet의 혁신은 Bi-directional Feature Pyramid Network(BiFPN)와 복합 스케일링 기법이라는 두 가지 핵심 요소에 있습니다. BiFPN은 학습 가능한 가중치를 도입해 각 입력 특징의 중요도를 학습하고 하향식 및 상향식 다중 스케일 특징 융합을 반복 적용함으로써 간단하고 빠른 다중 스케일 특징 추출을 가능하게 합니다. 복합 스케일링 기법은 네트워크의 해상도, 깊이, 너비를 동시에 균일하게 조정합니다.

EfficientDet 모델은 초경량 D0부터 대형 D7까지 다양합니다. 따라서 개발자가 제한된 연산 예산과 정확도 요구 사항의 균형을 맞춰야 하는 엣지 AI 배포에 유연하게 적용할 수 있으며, 초기 모바일 증강 현실 애플리케이션이 한 예입니다.

제한 사항#

EfficientDet은 앵커 박스와 기존 NMS 후처리 파이프라인에 크게 의존하는 구형 아키텍처입니다. 앵커를 생성하려면 세심한 하이퍼파라미터 튜닝이 필요하며, NMS 단계는 Raspberry Pi와 같은 임베디드 하드웨어에서 배포 병목이 될 수 있습니다. 또한 자세 추정이나 회전 바운딩 박스(OBB)와 같은 최신 작업을 기본적으로 지원하지 않습니다.

EfficientDet에 대해 자세히 알아보기

성능 및 지표 비교#

이러한 모델 간의 정확한 절충점을 파악하려면 처리량과 파라미터 효율성을 분석해야 합니다. 아래 표는 최신 RTDETRv2 시리즈와 확장 가능한 EfficientDet 제품군을 비교합니다.

모델크기
(픽셀)
mAP검증
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

위에서 볼 수 있듯이 RTDETRv2는 비슷한 크기의 EfficientDet 모델과 대등하거나 더 높은 평균 정밀도(mAP)를 달성하면서 GPU에서 훨씬 빠르게 실행됩니다(예: RTDETRv2-l은 9.76 ms에 53.4 mAP, EfficientDet-d6는 89.29 ms에 52.6 mAP). Transformer 아키텍처를 적극적으로 활용해 정확도를 높입니다.

사용 사례 및 권장 사항#

RT-DETR과 EfficientDet 중에서 선택할 때는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 선호하는 생태계를 고려해야 합니다.

RT-DETR을 선택해야 하는 경우#

RT-DETR은 다음과 같은 경우에 적합합니다:

  • Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
  • 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
  • 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.

EfficientDet을 선택해야 하는 경우#

다음과 같은 경우 EfficientDet을 권장합니다.

  • Google Cloud 및 TPU 파이프라인: EfficientDet이 기본 최적화된 Google Cloud Vision API 또는 TPU 인프라와 긴밀하게 통합된 시스템입니다.
  • 복합 스케일링 연구: 네트워크 깊이, 너비, 해상도를 균형 있게 조정하는 효과를 연구하는 데 중점을 둔 학술 벤치마킹입니다.
  • LiteRT를 통한 모바일 배포: Android 또는 임베디드 Linux 장치용으로 LiteRT(구 TensorFlow Lite) 내보내기가 필요한 프로젝트입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.

  • NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
  • 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.

Ultralytics 대안: 최첨단 기술의 발전#

RTDETRv2와 EfficientDet 모두 뛰어난 장점이 있지만, 현대적인 AI 개발에는 최첨단 성능과 더불어 원활한 개발자 경험을 제공하는 프레임워크가 필요합니다. Ultralytics 생태계는 컴퓨터 비전 작업을 훨씬 더 간소화된 방식으로 수행할 수 있도록 지원합니다.

최첨단 객체 탐지 기술을 살펴보고 있다면, 새롭게 출시된 Ultralytics YOLO26은 CNN과 Transformer의 장점을 결합합니다.

YOLO26을 선택해야 하는 이유

YOLO26은 선택 사항인 종단 간 NMS 없는 설계(nms=False)를 구현하여 RTDETRv2의 간편한 배포 방식을 초고효율 YOLO 아키텍처에 적용합니다. 또한 LLM 학습 혁신에서 영감을 얻은 MuSGD 옵티마이저를 도입해 학습 안정성을 높입니다. DFL 제거(분포 초점 손실을 제거해 내보내기를 간소화하고 엣지 및 저전력 장치와의 호환성을 개선)를 통해 YOLO26은 이전 세대보다 CPU 추론 속도가 최대 43% 빠르며, 더 무거운 모델보다 엣지 컴퓨팅에 탁월한 선택입니다. 또한 ProgLoss + STAL은 손실 함수를 개선해 작은 객체 인식 성능을 크게 높이며, 이는 IoT, 로보틱스, 항공 영상 분야에서 매우 중요합니다.

Ultralytics Python 패키지가 제공하는 사용 편의성은 독보적입니다. 개발자는 연구 저장소에서 일반적으로 필요한 상용구 코드를 직접 작성하지 않고도 직관적인 API를 사용해 모델을 학습하고 검증한 뒤 내보낼 수 있습니다.

from ultralytics import RTDETR

# Ultralytics 생태계에서 사전 학습된 RT-DETR 모델을 불러옵니다
model = RTDETR("rtdetr-l.pt")

# COCO8 데이터셋으로 모델 학습
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# TensorRT에서 최적화된 추론을 위해 내보냅니다
model.export(format="engine")

Ultralytics 모델은 인스턴스 분할과 이미지 분류를 비롯한 여러 작업을 기본적으로 지원하여 다양한 산업 분야의 요구에 대응하는 다목적 툴킷을 제공합니다. 또한 최신 Ultralytics 모델에서 분포 초점 손실(DFL)을 제거해 연산 그래프를 간소화하고, 임베디드 NPU 및 TPU로 더 원활하게 내보낼 수 있습니다.

원활한 데이터 어노테이션과 모델 관리를 위해 Ultralytics Platform은 전체 머신러닝 수명 주기를 관리하는 종합적인 클라우드 환경을 제공합니다. 이를 통해 프로덕션 환경에서 견고한 컴퓨터 비전 솔루션을 배포하는 데 가장 적합한 플랫폼으로 자리매김합니다.

댓글