YOLO Vision 2026:

RTDETRv2 대 EfficientDet#

최적의 신경망 아키텍처를 선택하는 것은 모든 computer vision 프로젝트에서 매우 중요한 결정입니다. 본 종합 기술 비교에서는 최첨단 Transformer 기반 검출기인 RTDETRv2와 확장성이 뛰어난 컨볼루션 신경망인 EfficientDet이라는 두 가지 영향력 있는 객체 검출 모델을 분석합니다. AI 파이프라인에서 데이터 기반 결정을 내릴 수 있도록 각각의 독창적인 아키텍처, performance metrics, 학습 방법론 및 이상적인 배포 시나리오를 평가합니다.

RTDETRv2: 실시간 탐지 트랜스포머#

기존 RT-DETR의 성공을 바탕으로 구축된 RTDETRv2는 Transformer 기반 object detection 패러다임을 개선합니다. 인코더와 디코더 구조를 최적화하여 실시간 추론 속도를 유지하면서도 높은 정확도를 제공하며, 전통적인 CNN과 Vision Transformer 사이의 간극을 효과적으로 메워줍니다.

Model Details Authors: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, and Yi Liu
Organization: Baidu Date: 2024-07-24 Links: Arxiv, GitHub, Docs

아키텍처 및 핵심 강점#

RTDETRv2는 강력한 CNN 백본(주로 ResNet 또는 HGNet)과 효율적인 Transformer 디코더를 결합한 하이브리드 아키텍처를 활용합니다. RTDETRv2의 가장 결정적인 특징은 NMS(non-maximum suppression)를 우회하는 고유한 기능입니다. 전통적인 검출기는 중복된 바운딩 박스를 필터링하기 위해 NMS가 필요하며, 이로 인해 후처리 과정에서 가변적인 inference latency가 추가됩니다. RTDETRv2는 이분 매칭(bipartite matching)을 활용하여 고유한 예측을 출력함으로써 검출을 직접적인 집합 예측 문제로 공식화합니다.

이 모델은 GPU 메모리가 풍부한 서버 측 배포에서 뛰어난 성능을 발휘합니다. 전역 어텐션 메커니즘은 뛰어난 컨텍스트 인식 기능을 제공하므로, 자동화된 security alarm systems이나 밀집된 군중 모니터링과 같이 복잡하고 혼잡한 환경에서 겹쳐 있는 객체를 분리하는 데 매우 능숙합니다.

한계점#

Transformer 아키텍처는 강력한 만큼 표준 CNN에 비해 학습 중에 더 많은 CUDA 메모리를 본질적으로 요구합니다. 또한 RTDETRv2를 미세 조정(fine-tuning)하려면 확장된 training data 수렴 시간이 필요할 수 있으므로, 빠른 프로토타이핑에 약간 더 많은 리소스가 소모됩니다.

RTDETRv2에 대해 자세히 알아보기

EfficientDet: 확장 가능하고 효율적인 CNN#

EfficientDet은 광범위한 리소스 제약 속에서 정확도와 효율성 모두에 최적화된 객체 검출 모델 제품군을 도입했습니다. 이는 확장 가능한 machine vision 설계의 고전적인 예로 남아 있습니다.

Model Details Authors: Mingxing Tan, Ruoming Pang, and Quoc V. Le
Organization: Google
Date: 2019-11-20
Links: Arxiv, GitHub, Docs

아키텍처 및 핵심 강점#

EfficientDet의 혁신은 Bi-directional Feature Pyramid Network(BiFPN)와 복합 스케일링(compound scaling) 메서드라는 두 가지 핵심 영역에 있습니다. BiFPN은 다양한 입력 Feature의 중요도를 학습하기 위한 학습 가능한 가중치를 도입하는 동시에 하향식 및 상향식 다중 스케일 Feature 융합을 반복적으로 적용하여 빠르고 간단한 다중 스케일 feature extraction을 가능하게 합니다. 복합 스케일링 메서드는 네트워크의 해상도, 깊이, 너비를 동시에 균일하게 스케일링합니다.

EfficientDet 모델은 초경량 D0부터 대규모 D7까지 다양합니다. 이로 인해 초기 모바일 augmented reality 응용 프로그램과 같이 개발자가 엄격한 연산 예산과 정확도 요구 사항의 균형을 맞춰야 하는 edge AI 배포에 매우 다재다능합니다.

한계점#

EfficientDet은 앵커 박스와 전통적인 NMS 후처리 파이프라인에 크게 의존하는 구형 아키텍처입니다. 앵커 생성 프로세스에는 세심한 hyperparameter tuning이 필요하며, NMS 단계는 Raspberry Pi와 같은 임베디드 하드웨어에서의 배포 시 병목 현상이 될 수 있습니다. 또한 pose estimation이나 oriented bounding boxes (OBB)과 같은 최신 작업에 대한 기본 지원이 부족합니다.

EfficientDet에 대해 자세히 알아보기

성능 및 지표 비교#

이 모델들 사이의 정확한 트레이드오프를 이해하려면 처리량과 파라미터 효율성을 분석해야 합니다. 아래 표는 최신 RTDETRv2 시리즈가 확장 가능한 EfficientDet 제품군과 어떻게 비교되는지 보여줍니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

위에서 볼 수 있듯이, RTDETRv2는 중간 등급의 EfficientDet 모델과 비슷한 파라미터 수에서 훨씬 더 높은 mean Average Precision (mAP)를 달성하며, Transformer 아키텍처를 적극 활용하여 정확도를 높입니다.

활용 사례 및 권장 사항#

RT-DETR과 EfficientDet 중 선택은 귀하의 특정 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.

RT-DETR을 선택해야 할 때#

RT-DETR은 다음 경우에 강력한 선택지입니다:

  • Transformer 기반 탐지 연구: NMS 없이 엔드 투 엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 탐구하는 프로젝트.
  • 유연한 지연 시간을 가진 고정밀 시나리오: 탐지 정확도가 최우선이며, 약간 높은 추론 지연 시간이 허용되는 애플리케이션.
  • 대형 객체 탐지: Transformer의 글로벌 어텐션 메커니즘이 자연스러운 이점을 제공하는, 주로 중대형 객체가 있는 장면.

EfficientDet을 선택해야 할 때#

EfficientDet은 다음 경우에 권장됩니다:

  • Google Cloud 및 TPU 파이프라인: EfficientDet의 네이티브 최적화가 지원되는 Google Cloud Vision API 또는 TPU 인프라와 깊게 통합된 시스템.
  • 컴파운드 스케일링 연구: 네트워크 깊이, 너비 및 해상도 스케일링의 균형 잡힌 효과를 연구하는 데 중점을 둔 학술적 벤치마킹.
  • TFLite를 통한 모바일 배포: Android 또는 임베디드 Linux 기기를 위해 TensorFlow Lite 내보내기가 특별히 필요한 프로젝트.

Ultralytics (YOLO26)를 선택해야 할 때#

대부분의 신규 프로젝트의 경우, Ultralytics YOLO26은 성능과 개발자 경험의 최상의 조합을 제공합니다.

  • NMS 미사용 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 낮은 지연 시간의 추론이 필요한 애플리케이션.
  • CPU 전용 환경: 전용 GPU 가속이 없는 디바이스에서, 최대 43% 더 빠른 YOLO26의 CPU 추론 속도가 결정적인 이점을 제공합니다.
  • 소형 객체 감지: 항공 드론 이미지나 IoT 센서 분석과 같은 까다로운 시나리오에서 ProgLoss와 STAL이 아주 작은 객체의 정확도를 크게 향상시킵니다.

Ultralytics 대안: 최첨단 기술의 발전#

RTDETRv2와 EfficientDet 모두 강력한 장점이 있지만, 현대 AI 개발은 최첨단 성능과 함께 원활한 developer experience를 제공하는 프레임워크를 요구합니다. Ultralytics ecosystem은 컴퓨터 비전 작업에 대해 훨씬 더 간소화된 접근 방식을 제공합니다.

최첨단 검출을 탐색하고 있다면, 새로 출시된 Ultralytics YOLO26은 CNN과 Transformer의 장점을 모두 결합했습니다.

왜 YOLO26을 선택해야 합니까?

YOLO26은 End-to-End NMS-Free Design을 구현하여 RTDETRv2의 배포 단순성을 초효율적인 YOLO 아키텍처에 가져옵니다. 또한 LLM 학습 혁신에서 영감을 받은 MuSGD Optimizer를 도입하여 뛰어난 학습 안정성을 제공합니다. DFL Removal(간소화된 내보내기 및 더 나은 엣지/저전력 장치 호환성을 위해 Distribution Focal Loss가 제거됨)을 통해 YOLO26은 이전 세대보다 최대 43% 더 빠른 CPU 추론을 자랑하며, 더 무거운 모델에 비해 edge computing을 위한 예외적인 선택이 됩니다. 또한 ProgLoss + STAL은 IoT, 로보틱스, 항공 이미지에 매우 중요한 소형 객체 인식에서 눈에 띄는 개선을 이루어 향상된 손실 함수를 제공합니다.

Ultralytics Python package가 제공하는 사용 편의성은 독보적입니다. 개발자는 연구 리포지토리에서 일반적으로 요구하는 보일러플레이트 코드를 추상화하는 직관적인 API를 사용하여 export models, 학습 및 검증을 수행할 수 있습니다.

from ultralytics import RTDETR

# Load a pre-trained RTDETRv2 model from the Ultralytics ecosystem
model = RTDETR("rtdetr-l.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export for optimized inference on TensorRT
model.export(format="engine")

Ultralytics 모델은 instance segmentationimage classification을 포함한 여러 작업을 기본적으로 지원하여 다양한 산업 요구에 맞는 다기능 툴킷을 제공합니다. 또한 최신 Ultralytics 모델에서 Distribution Focal Loss(DFL)를 제거함으로써 연산 그래프가 단순화되어 임베디드 NPUs and TPUs로의 원활한 내보내기가 보장됩니다.

원활한 data annotation과 모델 관리를 위해 Ultralytics Platform은 전체 머신러닝 생명주기를 감독할 수 있는 포괄적인 클라우드 환경을 제공하여, 프로덕션 환경에서 강력한 컴퓨터 비전 솔루션을 배포하기 위한 최고의 선택으로 자리매김합니다.

댓글