DAMO-YOLO와 RTDETRv2#
빠르게 발전하는 컴퓨터 비전 분야에서는 속도, 정확도, 계산 효율성 간의 균형을 맞추도록 설계된 인상적인 아키텍처들이 다양하게 등장했습니다. 이러한 과제를 해결하기 위해 독창적인 접근 방식을 제시한 두 가지 대표 모델이 DAMO-YOLO와 RTDETRv2입니다. 두 모델 모두 실시간 추론을 위한 최첨단 솔루션을 제공하는 것을 목표로 하지만, 아키텍처 철학에서는 근본적인 차이를 보입니다.
이 종합 가이드에서는 두 모델의 기술 사양, 아키텍처 혁신 및 실제 사용 사례를 심층적으로 살펴보고, Ultralytics 플랫폼과 최첨단 YOLO26과 같은 최신 솔루션이 배포 및 사용 편의성에 대한 업계 표준을 어떻게 재정의했는지도 알아봅니다.
모델 개요#
DAMO-YOLO 이해하기#
Alibaba Group의 연구진이 개발한 DAMO-YOLO는 신경 아키텍처 탐색 (NAS)에 크게 의존하는 빠르고 정확한 객체 탐지 방법을 도입합니다. 기존의 수작업으로 설계된 백본을 저지연을 위해 NAS로 생성된 구조로 대체합니다. 또한 효율적인 RepGFPN (재매개변수화된 일반화 특징 피라미드 네트워크)과 ZeroHead 설계를 통합하여 특징 집계와 바운딩 박스 예측을 간소화합니다.
주요 모델 세부 정보:
- 저자: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun
- 조직: Alibaba Group
- 날짜: 2022-11-23
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
- 문서: DAMO-YOLO 문서
RTDETRv2 이해하기#
Baidu의 RTDETRv2는 실시간 탐지 Transformer 분야에서 중요한 도약을 보여줍니다. 앵커 박스와 비최대 억제 (NMS)에 의존하는 기존 합성곱 신경망 (CNN)과 달리, RTDETRv2는 셀프 어텐션 메커니즘을 활용하여 이미지 전체의 맥락을 파악합니다. 바운딩 박스를 직접 출력하므로 NMS 후처리 단계를 완전히 생략합니다. 이 모델은 추론 지연 시간을 늘리지 않고 기준 정확도를 향상하기 위해 "bag of freebies" 학습 전략을 도입합니다.
주요 모델 세부 정보:
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR Repository
- Docs: RTDETRv2 Documentation
Transformer는 더 많은 계산 리소스를 필요로 하지만 전역 맥락을 처리할 수 있으므로 복잡한 장면 이해에 매우 효과적이며, 이는 RTDETRv2의 주요 강점입니다.
성능 비교#
실제 배포를 위해 이러한 모델을 평가할 때는 평균 정밀도 (mAP), 추론 속도, 메모리 사용량과 같은 매개변수가 중요합니다. RTDETRv2와 같은 Transformer 기반 모델은 일반적으로 DAMO-YOLO와 같은 경량 CNN보다 학습 및 추론 중에 더 많은 CUDA 메모리를 요구합니다.
다음은 성능 지표를 상세히 비교한 내용입니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
이상적인 사용 사례#
DAMO-YOLO의 강점: NAS로 최적화된 백본과 소형 변형 모델(예: DAMO-YOLOt)의 매우 적은 파라미터 수 덕분에 리소스가 크게 제한된 하드웨어에 배포하기에 매우 적합합니다. ONNX와 같은 런타임 또는 엣지 컴퓨팅을 위한 특수 TensorRT 엔진을 사용하여 임베디드 디바이스용 솔루션을 구축하는 경우, DAMO-YOLO는 매우 반응성이 뛰어난 프레임워크를 제공합니다.
RTDETRv2의 강점: RTDETRv2는 서버급 GPU를 사용할 수 있고 이미지 전체의 맥락이 중요한 시나리오에서 뛰어난 성능을 발휘합니다. Transformer 아키텍처를 통해 NMS 없이 겹치는 바운딩 박스를 자연스럽게 처리할 수 있으므로, 공간적으로 멀리 떨어진 객체 간의 관계가 중요한 밀집 군중 관리나 복잡한 객체 추적에 강력한 선택지가 됩니다.
Ultralytics의 강점: YOLO26 소개#
DAMO-YOLO와 RTDETRv2는 모두 중요한 학문적 성과를 보여주지만, 이러한 모델을 확장 가능하고 프로덕션에 바로 사용할 수 있는 애플리케이션으로 전환하는 일은 쉽지 않을 수 있습니다. 개발자는 여러 코드베이스로 분산된 구조, 멀티태스크 학습 지원 부족, 복잡한 배포 파이프라인에 직면하는 경우가 많습니다.
이러한 측면에서 Ultralytics 생태계는 진정한 차별점을 보여줍니다. 사용 편의성, 잘 유지 관리되는 Python API, 탁월한 범용성을 우선시하여 개발자가 디버깅에 할애하는 시간은 줄이고 구축에 더 많은 시간을 사용할 수 있도록 합니다.
최근 출시된 Ultralytics YOLO26 모델은 이러한 장점을 한 단계 더 발전시켜 DAMO-YOLO와 RTDETRv2를 모두 앞서는 혁신을 제공합니다.
- 엔드 투 엔드 NMS 없는 설계: YOLOv10에서 처음 개척된 YOLO26은 기본적으로 엔드 투 엔드 방식으로 작동합니다. 따라서 NMS 후처리가 완전히 제거되어 기존 CNN보다 배포가 빠르고 훨씬 간단해지는 동시에 RTDETRv2의 직접 출력 이점도 제공합니다.
- 최대 43% 더 빠른 CPU 추론: 개별 GPU가 없는 엣지 AI 디바이스에 맞춰 고도로 최적화되어 메모리를 많이 사용하는 Transformer보다 IoT 애플리케이션에 훨씬 뛰어난 선택지가 됩니다.
- MuSGD 옵티마이저: Moonshot AI의 Kimi K2에서 영감을 받은 SGD와 Muon의 하이브리드 방식으로, 대규모 언어 모델 (LLM) 학습 혁신을 컴퓨터 비전에 도입하여 매우 안정적인 학습과 빠른 수렴을 실현합니다.
- ProgLoss + STAL: 이러한 고급 손실 함수는 기존 모델이 어려움을 겪는 분야인 소형 객체 인식에서 눈에 띄는 개선을 제공합니다. 이는 항공 이미지와 드론 애플리케이션에 매우 중요합니다.
- DFL 제거: 배포 형식을 간소화하고 저전력 엣지 디바이스와의 호환성을 높이기 위해 Distribution Focal Loss를 제거했습니다.
- 탁월한 범용성: 탐지에만 엄격히 제한된 경쟁 모델과 달리 YOLO26은 방향성 바운딩 박스 (OBB)를 위한 특수 각도 손실, 픽셀 단위의 정밀한 정확도를 위한 시맨틱 세그멘테이션 손실, 포즈 추정을 위한 잔차 로그 가능도 추정 (RLE) 등 다양한 태스크 전반에 걸쳐 태스크별 개선 사항을 포함합니다.
RTDETRv2와 같은 Transformer 기반 모델을 학습하려면 막대한 CUDA 메모리 할당이 필요하며, 이로 인해 비용이 많이 드는 멀티 GPU 구성이 요구되는 경우가 많습니다. Ultralytics YOLO 모델은 학습과 추론 모두에서 훨씬 더 적은 메모리를 필요로 하므로 연구자와 취미 개발자도 AI 개발을 활용할 수 있도록 합니다.
코드 예제: 통합 Ultralytics API#
Ultralytics 에코시스템의 가장 큰 장점 중 하나는 통합 API입니다. 워크플로우를 변경하지 않고도 PyTorch 구현의 RT-DETR 및 최첨단 YOLO 모델을 포함한 다양한 모델을 원활하게 로드, 학습 및 검증할 수 있습니다.
from ultralytics import RTDETR, YOLO
# Load an RTDETRv2 model
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load the cutting-edge YOLO26 model
model_yolo = YOLO("yolo26n.pt")
# Run inference on an image with a simple, unified interface
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_yolo = model_yolo("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
results_yolo[0].show()이러한 간편함은 사용자 지정 데이터셋 학습과 내보내기에도 적용됩니다. Ultralytics Python 패키지를 사용하면 개발자는 단일 명령으로 학습된 가중치를 CoreML 또는 OpenVINO와 같은 배포 플랫폼으로 쉽게 전송할 수 있습니다.
결론 및 추가 탐색#
DAMO-YOLO와 RTDETRv2는 모두 실시간 객체 탐지의 가능성을 크게 확장했습니다. DAMO-YOLO는 순수한 효율성을 위해 고도로 최적화된 자동 탐색 네트워크 구조를 제공하는 반면, RTDETRv2는 NMS와 같은 기존 병목을 제거하여 Transformer가 실시간 영역에서도 경쟁력을 가질 수 있음을 입증합니다.
그러나 성능, 종합적인 문서, 프로덕션 준비성 간의 최적의 균형을 원하는 개발자에게 Ultralytics YOLO 모델은 여전히 업계 표준입니다. YOLO26의 도입으로 사용자는 Transformer와 유사한 엔드 투 엔드 탐지, LLM에서 영감을 받은 학습 효율성, 탁월한 CPU 속도를 직관적이고 강력한 생태계 안에서 모두 이용할 수 있습니다.
다음 프로젝트를 위해 모델을 평가하고 있는 경우 EfficientDet vs RT-DETR 비교 문서를 읽거나, 이전 세대인 YOLO11을 탐색하거나, YOLOX와 같은 학술적 베이스라인을 검토하는 것도 유용할 수 있습니다. Ultralytics 퀵스타트 가이드를 탐색하며 지금 바로 구축을 시작해 보세요.