RTDETRv2 vs DAMO-YOLO#
컴퓨터 비전 분야는 끊임없이 발전하고 있으며, 연구자와 엔지니어는 속도, 정확도, 효율성의 균형을 완벽하게 맞추는 모델을 구축하기 위해 노력하고 있습니다. 이 분야에서 큰 반향을 일으킨 두 가지 주요 아키텍처로는 Baidu가 개발한 RTDETRv2와 Alibaba Group이 제작한 DAMO-YOLO가 있습니다. 두 모델 모두 실시간 객체 감지의 한계를 확장하지만, 뛰어난 결과를 달성하기 위해 근본적으로 서로 다른 아키텍처 철학을 채택합니다.
이 기술 비교에서는 두 모델의 아키텍처, 학습 방법론 및 실제 배포 역량을 자세히 살펴봅니다. 또한 더 넓은 생태계와 비교했을 때 두 모델이 어떤 성능을 보이는지, 특히 고도로 최적화된 Ultralytics Platform 및 최첨단 YOLO26 아키텍처와 비교하여 알아봅니다.
아키텍처 혁신#
프로덕션 환경에 적합한 도구를 선택해야 하는 머신러닝 엔지니어에게는 이들 모델의 핵심 메커니즘을 이해하는 것이 매우 중요합니다.
RTDETRv2: Transformer 접근 방식#
기존 RT-DETR의 성공을 기반으로 하는 RTDETRv2는 하이브리드 인코더와 Transformer 디코더를 활용합니다. 이 설계를 통해 모델은 전역 컨텍스트를 매우 효과적으로 처리할 수 있으므로, 밀집된 장면에서 서로 겹치는 객체를 특히 잘 구분합니다. 이 아키텍처의 가장 중요한 장점은 기본적으로 NMS-free(비최대 억제) 설계를 채택했다는 점입니다. NMS 후처리 단계를 제거함으로써 RTDETRv2는 추론 파이프라인을 간소화하고 다양한 하드웨어 구성에서 더 안정적인 지연 시간을 보장합니다.
DAMO-YOLO: CNN 효율성 향상#
반면 DAMO-YOLO는 매우 성공적인 CNN 기반 YOLO 계보를 유지하면서도 몇 가지 획기적인 개선 사항을 도입합니다. DAMO-YOLO는 신경망 아키텍처 검색(NAS)을 활용하여 백본을 최적화하고, 최대한의 특징 추출 효율성을 보장합니다. 또한 효율적인 RepGFPN(재매개변수화된 일반화 특징 피라미드 네트워크)과 ZeroHead 설계를 AlignedOTA 및 지식 증류 향상 기법과 함께 통합합니다. 이러한 혁신을 통해 DAMO-YOLO는 높은 경쟁력을 갖춘 mAPval 점수를 유지하면서도 빠른 추론 속도를 달성합니다.
RTDETRv2는 NMS 없이 전역 특징을 이해하기 위해 어텐션 메커니즘을 활용하는 데 중점을 두는 반면, DAMO-YOLO는 NAS와 고급 지식 증류를 통해 기존 CNN의 효율성을 극대화합니다. 따라서 표준 후처리가 필요하지만 특정 하드웨어에서 뚜렷한 속도상의 이점을 제공합니다.
성능 및 지표 비교#
배포를 위해 모델을 평가할 때는 평균 정밀도(mAP), 추론 속도, 파라미터 수와 같은 성능 지표가 매우 중요합니다. 아래에는 두 모델 제품군에 대한 자세한 비교가 나와 있습니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
결과 분석#
표에서 볼 수 있듯이 RTDETRv2-x는 54.3의 mAPval으로 가장 높은 정확도를 달성하여, COCO 데이터셋과 같은 복잡한 검증 환경에서 Transformer 아키텍처의 강력한 성능을 보여줍니다. 그러나 그 대가로 파라미터 수(76M)와 FLOPs가 크게 증가합니다.
반대로 DAMO-YOLOt(Tiny)는 파라미터가 8.5M에 불과한 매우 경량화된 모델이므로, CUDA 메모리가 심각하게 제한된 환경에서 매우 빠른 옵션이 됩니다. DAMO-YOLO는 일반적으로 기존 엣지 디바이스에서 속도와 정확도 간에 유리한 절충점을 제공합니다.
생태계, 사용성 및 Ultralytics의 장점#
공식 RT-DETR GitHub 및 DAMO-YOLO GitHub와 같은 독립 저장소는 이러한 모델을 학습하기 위한 원시 코드를 제공하지만, 이를 프로덕션 파이프라인에 통합하려면 광범위한 보일러플레이트 코드와 수동 최적화가 필요한 경우가 많습니다.
이러한 개발자 경험을 크게 간소화하는 것이 바로 Ultralytics 생태계입니다. Ultralytics는 RTDETRv2와 같은 모델을 통합 API에 직접 통합하므로, 사용자는 한 줄의 코드만으로 모델을 학습하고 검증하며 내보낼 수 있습니다. 또한 Ultralytics 모델은 무거운 Transformer 기반 독립 저장소와 비교할 때 학습 중 메모리 요구량이 적은 것으로 알려져 있습니다.
코드 예제: 원활한 통합#
다음은 Ultralytics Python 라이브러리를 활용하여 얼마나 쉽게 추론을 실행할 수 있는지 보여주는 예제입니다. Transformer 모델을 사용하든 최첨단 CNN을 사용하든 API는 일관되게 유지됩니다.
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model for complex scene understanding
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the latest Ultralytics YOLO26 model for ultimate edge performance
model_yolo26 = YOLO("yolo26n.pt")
# Run inference on a sample image effortlessly
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo26("https://ultralytics.com/images/bus.jpg")
# Display the results
results_yolo[0].show()Ultralytics API를 사용하면 간단한 model.export(format="engine") 명령어로 학습된 모델을 TensorRT, ONNX 또는 CoreML 형식으로 원활하게 내보낼 수 있어 배포 과정의 마찰을 크게 줄일 수 있습니다.
이상적인 사용 사례#
이러한 아키텍처 중 어떤 것을 선택할지는 전적으로 프로젝트의 구체적인 요구 사항에 따라 달라집니다.
- RTDETRv2는 VRAM이 풍부한 서버 측 처리에서 뛰어난 성능을 발휘합니다. 전역 컨텍스트 인식 기능은 폐색이 자주 발생하는 의료 영상 및 밀집 군중 분석에 적합합니다.
- DAMO-YOLO는 적은 파라미터 수와 높은 FPS가 엄격하게 요구되는 임베디드 IoT 애플리케이션 및 빠르게 움직이는 산업 검사 라인에 매우 적합합니다.
미래: Ultralytics YOLO26#
RTDETRv2와 DAMO-YOLO 모두 장점이 있지만, 컴퓨터 비전 분야는 빠르게 발전하고 있습니다. 새로운 프로젝트에서는 최신 **Ultralytics YOLO26**이 속도, 정확도, 개발자 경험을 궁극적으로 결합한 솔루션을 제공합니다.
YOLO26은 엔드투엔드 NMS-Free 설계를 채택하여 막대한 연산 오버헤드 없이 Transformer의 주요 장점을 구현합니다. 또한 대규모 언어 모델 학습에서 영감을 얻은 혁신적인 MuSGD Optimizer를 통합하여 안정적이고 빠른 수렴을实现합니다. 더 나아가 DFL Removal(간소화된 내보내기와 향상된 엣지 및 저전력 디바이스 호환성을 위해 Distribution Focal Loss 제거)을 통해 YOLO26은 최대 43% 더 빠른 CPU 추론을 달성하므로 엣지 컴퓨팅에 최적의 솔루션입니다. 또한 ProgLoss + STAL은 향상된 손실 함수를 제공하며, IoT, 로보틱스, 항공 이미지 분석에 중요한 소형 객체 인식 성능을 크게 개선합니다.
경계 상자로 엄격하게 제한된 모델과 달리 YOLO26 제품군은 인스턴스 세그멘테이션 및 포즈 추정부터 방향성 경계 상자(OBB)까지 다양한 작업을 지원하는 탁월한 유연성을 제공하며, 모든 작업을 직관적인 Ultralytics Platform에서 원활하게 관리할 수 있습니다.
모델 세부 정보 및 참고 자료#
RTDETRv2#
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR Repository
DAMO-YOLO#
- 저자: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun
- 조직: Alibaba Group
- 날짜: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: DAMO-YOLO 저장소
다른 비교 내용을 살펴보고 싶은 사용자는 RTDETRv2 vs. YOLO11 또는 DAMO-YOLO vs. YOLOv8 가이드를 확인하여 이러한 모델이 이전 세대 Ultralytics 제품군과 비교해 어떤 성능을 보이는지 알아보시기 바랍니다.