DAMO-YOLO와 RTDETRv2#
컴퓨터 비전 분야가 빠르게 발전하면서 속도, 정확도, 연산 효율성의 균형을 맞추도록 설계된 다양한 아키텍처가 등장했습니다. 이러한 과제에 고유한 접근 방식으로 대응한 대표적인 두 모델은 DAMO-YOLO와 RTDETRv2입니다. 두 모델 모두 실시간 추론을 위한 최첨단 솔루션을 제공하는 것을 목표로 하지만, 아키텍처 철학은 근본적으로 다릅니다.
이 종합 가이드에서는 두 모델의 기술 사양, 아키텍처 혁신, 실제 사용 사례를 자세히 살펴보고, Ultralytics Platform과 최신 모델인 YOLO26 같은 현대적 솔루션이 배포와 사용 편의성에 대한 업계 표준을 어떻게 새롭게 정의했는지도 살펴봅니다.
모델 개요#
DAMO-YOLO 이해하기#
Alibaba Group의 연구진이 개발한 DAMO-YOLO는 신경망 아키텍처 탐색(NAS)에 크게 의존하는 빠르고 정확한 객체 탐지 방법을 도입합니다. 기존의 수작업 백본을 저지연을 목표로 NAS가 생성한 구조로 대체합니다. 또한 효율적인 RepGFPN(재매개변수화된 일반화 특징 피라미드 네트워크)과 ZeroHead 설계를 통합하여 특징 통합과 경계 상자 예측을 간소화합니다.
주요 모델 정보:
- 저자: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun
- 기관: Alibaba Group
- 날짜: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- 문서: DAMO-YOLO 문서
RTDETRv2 이해하기#
Baidu의 RTDETRv2는 실시간 탐지 Transformer 분야에서 중요한 도약을 이뤘습니다. 앵커 상자와 비최대 억제(NMS)에 의존하는 기존 합성곱 신경망(CNN)과 달리, RTDETRv2는 셀프 어텐션 메커니즘을 사용해 이미지 전체를 맥락적으로 파악합니다. 경계 상자를 직접 출력하여 NMS 후처리 단계를 완전히 생략합니다. 또한 추론 지연 시간을 늘리지 않으면서 기본 정확도를 높이는 "공짜 혜택 모음" 학습 전략을 도입합니다.
주요 모델 정보:
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 기관: Baidu
- 날짜: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR 저장소
- 문서: RTDETRv2 문서
Transformer는 더 많은 연산 리소스를 필요로 하지만, 전역 맥락을 처리하는 능력 덕분에 복잡한 장면을 이해하는 데 매우 효과적이며, 이는 RTDETRv2의 주요 강점입니다.
성능 비교#
실제 배포를 위해 모델을 평가할 때는 평균 정밀도(mAP), 추론 속도, 메모리 사용량이 중요한 요소입니다. RTDETRv2와 같은 Transformer 기반 모델은 일반적으로 DAMO-YOLO와 같은 경량 CNN보다 학습과 추론 중 더 많은 CUDA 메모리를 요구합니다.
아래에서 성능 지표를 자세히 비교합니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
적합한 사용 사례#
DAMO-YOLO가 강점을 보이는 경우: NAS로 최적화된 백본과 소형 모델 변형(예: DAMO-YOLOt)의 매우 적은 파라미터 수 덕분에 리소스가 매우 제한된 하드웨어에 배포하기에 적합합니다. ONNX와 같은 런타임이나 엣지 컴퓨팅용 특수 TensorRT 엔진을 사용하는 임베디드 디바이스 솔루션을 구축하는 경우 DAMO-YOLO는 응답성이 뛰어난 프레임워크를 제공합니다.
RTDETRv2가 강점을 보이는 경우: 서버급 GPU를 사용할 수 있고 이미지의 전역 맥락이 중요한 시나리오에서 RTDETRv2는 뛰어난 성능을 발휘합니다. Transformer 아키텍처 덕분에 NMS 없이 겹치는 경계 상자를 자연스럽게 처리할 수 있어, 멀리 떨어진 객체 간의 공간 관계가 중요한 밀집 군중 관리나 복잡한 객체 추적에 적합합니다.
Ultralytics의 강점: YOLO26 소개#
DAMO-YOLO와 RTDETRv2는 중요한 학술적 성과이지만, 두 모델을 확장 가능하고 프로덕션에 바로 사용할 수 있는 애플리케이션으로 전환하는 일은 어려울 수 있습니다. 개발자는 파편화된 코드베이스, 다중 작업 학습 지원 부족, 복잡한 배포 파이프라인 등의 문제에 자주 직면합니다.
Ultralytics 생태계는 바로 이러한 점에서 두드러집니다. 사용 편의성, 잘 관리되는 Python API, 탁월한 범용성을 우선시하여 개발자가 디버깅에 쓰는 시간을 줄이고 개발에 더 집중할 수 있도록 합니다.
최근 출시된 Ultralytics YOLO26 모델은 DAMO-YOLO와 RTDETRv2를 모두 앞서는 혁신을 제공하며 이러한 장점을 한층 더 발전시켰습니다.
- 종단 간 NMS-free 설계: YOLOv10에서 처음 선보인 YOLO26은 선택 사항인 종단 간 헤드(
nms=False)를 제공합니다. 이 설계는 NMS 후처리를 없애 기존 CNN보다 배포가 빠르고 훨씬 간단하며, RTDETRv2와 같은 직접 출력의 이점도 제공합니다. - 최대 43% 더 빠른 CPU 추론: YOLO26n은 CPU ONNX에서 YOLO11n보다 최대 43% 빠르게 실행되며, 별도의 GPU가 없는 엣지 AI 디바이스에 맞춰 집중적으로 최적화되어 있습니다. 따라서 메모리 사용량이 많은 Transformer보다 IoT 애플리케이션에 훨씬 적합합니다.
- MuSGD 옵티마이저: Moonshot AI의 Kimi K2에서 영감을 받은 SGD와 Muon의 하이브리드인 이 옵티마이저는 대규모 언어 모델(LLM) 학습 혁신을 컴퓨터 비전에 적용하여, 매우 안정적인 학습과 더 빠른 수렴을 실현합니다.
- ProgLoss + STAL: 이러한 고급 손실 함수는 모델이 기존에 어려움을 겪던 소규모 객체 인식 성능을 크게 향상합니다. 이는 항공 이미지와 드론 애플리케이션에서 매우 중요합니다.
- DFL 제거: 배포 형식을 간소화하고 저전력 엣지 디바이스와의 호환성을 높이기 위해 Distribution Focal Loss를 제거했습니다.
- 탁월한 다용성: 감지에만 엄격히 제한되는 경쟁 모델과 달리, YOLO26은 회전 경계 상자(OBB)를 위한 특화된 각도 손실, 픽셀 단위의 정확도를 위한 시맨틱 세그멘테이션 손실, 자세 추정을 위한 잔차 로그 우도 추정(RLE) 등 다양한 작업별 개선 사항을 제공합니다.
RTDETRv2와 같은 Transformer 기반 모델을 학습하려면 막대한 CUDA 메모리가 필요하며, 비용이 많이 드는 멀티 GPU 구성이 필요한 경우가 많습니다. Ultralytics YOLO 모델은 학습과 추론 모두에서 메모리 요구량을 현저히 낮게 유지하여 연구자와 취미 개발자 모두가 AI 개발에 더 쉽게 접근할 수 있도록 합니다.
코드 예제: 통합 Ultralytics API#
Ultralytics 에코시스템의 가장 큰 장점 중 하나는 통합 API입니다. 워크플로를 변경하지 않고도 RT-DETR의 PyTorch 구현과 최신 YOLO 모델을 비롯한 다양한 모델을 원활하게 불러오고, 학습하고, 검증할 수 있습니다.
from ultralytics import RTDETR, YOLO
# RT-DETR 모델 로드
model_rtdetr = RTDETR("rtdetr-l.pt")
# 최신 YOLO26 모델을 불러옵니다
model_yolo = YOLO("yolo26n.pt")
# 간단하고 통합된 인터페이스로 이미지에서 추론을 실행합니다
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# 감지된 객체를 표시합니다.
results_yolo[0].show()이러한 간편함은 사용자 지정 데이터셋 학습과 내보내기에도 적용됩니다. Ultralytics Python 패키지를 사용하면 개발자는 학습한 가중치를 단일 명령으로 CoreML 또는 OpenVINO와 같은 배포 플랫폼에 손쉽게 내보낼 수 있습니다.
결론 및 추가 탐색#
DAMO-YOLO와 RTDETRv2는 모두 실시간 객체 감지의 가능성을 분명히 확장했습니다. DAMO-YOLO는 원시 효율성을 위해 고도로 최적화된 자동 탐색 네트워크 구조를 제공하며, RTDETRv2는 NMS와 같은 기존 병목을 제거해 Transformer도 실시간 분야에서 경쟁력을 갖출 수 있음을 보여줍니다.
하지만 성능, 포괄적인 문서, 프로덕션 준비 상태의 균형을 최우선으로 고려하는 개발자에게는 Ultralytics YOLO 모델이 여전히 최고의 선택입니다. YOLO26을 통해 사용자는 선택형 Transformer 유사 종단 간 감지, LLM에서 영감을 얻은 학습 효율성, 탁월한 CPU 속도를 직관적이고 견고한 에코시스템에서 모두 활용할 수 있습니다.
다음 프로젝트에 사용할 모델을 검토 중이라면 EfficientDet과 RT-DETR 비교를 읽고, 이전 세대인 YOLO11을 살펴보거나, YOLOX와 같은 학술적 기준 모델을 검토해 보시기 바랍니다. Ultralytics 빠른 시작 가이드를 살펴보며 지금 바로 개발을 시작하세요.