RTDETRv2 vs YOLOv9#
컴퓨터 비전 분야에서는 주로 합성곱 신경망(CNN)과 Transformer 기반 모델 사이에서 아키텍처 철학의 흥미로운 분화가 나타났습니다. RTDETRv2와 YOLOv9를 비교할 때 개발자는 본질적으로 전역 어텐션 메커니즘과 프로그래밍 가능한 그래디언트 정보 간의 트레이드오프를 평가하게 됩니다. 두 모델 모두 각자의 패러다임에서 정점에 해당하며, 실시간 객체 감지의 한계를 확장하고 있습니다.
모델 소개#
RTDETRv2: 실시간 감지 Transformer#
Baidu의 연구자들이 개발한 RTDETRv2는 기본 실시간 감지 Transformer를 개선하기 위해 "Bag-of-Freebies"를 도입하여 기존 RT-DETR을 기반으로 발전시킨 모델입니다. Transformer의 전통적인 병목 현상인 추론 속도 문제를 해결하여 실시간 애플리케이션에 활용할 수 있도록 합니다.
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- 링크: Arxiv, GitHub
RTDETRv2를 정의하는 특징은 네이티브 종단 간 NMS 없는 설계입니다. 후처리 과정에서 비최대 억제(NMS)를 완전히 제거하여 추론 지연 시간을 안정화하고 배포 파이프라인을 간소화합니다. 전역 어텐션 메커니즘을 통해 전체 이미지 컨텍스트를 동시에 평가하므로 복잡한 장면 이해와 밀집된 군중 분석에서 뛰어난 성능을 발휘합니다.
YOLOv9: 프로그래밍 가능한 그래디언트 정보#
매우 효율적인 CNN 기반 아키텍처인 YOLOv9는 심층 신경망에 내재된 정보 병목 문제를 해결합니다. 프로그래밍 가능한 그래디언트 정보(PGI)와 일반화된 효율적 레이어 집계 네트워크(GELAN)를 도입했습니다.
- 저자: Chien-Yao Wang 및 Hong-Yuan Mark Liao
- 기관: Academia Sinica 정보과학연구소
- 날짜: 2024년 2월 21일
- 링크: Arxiv, GitHub
YOLOv9는 검증된 합성곱 신경망 기반을 활용하면서 매개변수 효율성을 극대화합니다. 피드포워드 과정에서 중요한 정보를 유지하여 안정적인 가중치 업데이트를 보장하므로, 매우 가벼우면서도 정확도가 높은 모델을 구현합니다. 그러나 RTDETRv2와 달리 YOLOv9는 여전히 표준 NMS 후처리에 의존합니다.
성능 및 리소스 효율성#
프로덕션 환경에서 이러한 모델을 평가할 때는 평균 정밀도(mAP)와 계산 비용 간의 균형을 맞추는 것이 중요합니다. 아래 표는 MS COCO 데이터셋에서의 성능을 보여줍니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
메모리 요구 사항 및 학습 효율성#
RTDETRv2와 같은 Transformer는 학습 중 메모리를 많이 사용하는 것으로 악명 높으며, 완전히 수렴하려면 상당한 CUDA 메모리와 더 긴 학습 일정이 필요한 경우가 많습니다. 반면 YOLOv9와 같은 CNN 아키텍처 및 기타 Ultralytics YOLO 모델은 메모리 사용량이 현저히 낮아 개발자가 일반 소비자용 하드웨어에서 더 큰 배치 크기로 학습할 수 있습니다.
하드웨어 활용도를 극대화하려면 간소화된 클라우드 학습을 위해 Ultralytics Platform을 활용하는 것이 좋습니다. 이 플랫폼은 환경 설정과 최적의 배치 크기 설정을 자동으로 처리합니다.
Ultralytics의 장점: 생태계 및 사용 편의성#
공식 RTDETRv2 또는 YOLOv9 GitHub 페이지와 같은 독립형 리포지토리를 살펴보는 것은 매우 유익할 수 있지만, 프로덕션 환경에서는 안정성, 사용 편의성, 잘 유지 관리되는 생태계가 필요합니다. Ultralytics Python API를 통해 이러한 모델을 통합하면 원활한 개발자 경험을 얻을 수 있습니다.
통합 API 및 다용도성#
Ultralytics 프레임워크는 데이터 로딩, 증강 및 분산 학습의 복잡성을 추상화합니다. 또한 원본 RTDETRv2가 감지에만 엄격히 초점을 맞추는 반면, Ultralytics 생태계에서는 객체 감지, 인스턴스 세그멘테이션, 포즈 추정 간에 쉽게 전환할 수 있습니다.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model on custom data
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)
# Easily switch to RT-DETR for complex scene evaluation
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")
# Export to production-ready formats like TensorRT
model_yolo.export(format="engine")풍부한 문서, 자동화된 실험 추적, 그리고 ONNX, TensorRT, OpenVINO와 같은 형식으로의 원활한 내보내기 기능을 통해 Ultralytics는 프로토타입에서 프로덕션까지 걸리는 시간을 크게 단축합니다.
이상적인 사용 사례#
RTDETRv2가 뛰어난 분야#
전역 어텐션 메커니즘 덕분에 RTDETRv2는 서버 측 처리와 전역 컨텍스트가 가장 중요한 환경에서 강력한 성능을 발휘합니다. 다음 분야에서 뛰어납니다.
- 의료 영상: 주변 컨텍스트가 중요한 미세한 이상을 식별합니다.
- 항공 감시: 기존 CNN 합성곱의 공간적 편향 없이 고해상도 드론 영상에서 작은 객체를 식별합니다.
- 밀집 군중 분석: 심각한 가림으로 인해 일반적으로 앵커 기반 모델이 혼동하는 상황에서 개별 인물을 추적합니다.
YOLOv9가 뛰어난 분야#
YOLOv9는 리소스가 제한된 엣지 배포에 강점을 보입니다. 계산 효율성이 높아 다음과 같은 용도에 적합합니다.
- 로보틱스: 최소한의 지연 시간이 필요한 실시간 내비게이션 및 장애물 회피에 적합합니다.
- 스마트 시티 IoT: 교통 모니터링을 위해 NVIDIA Jetson과 같은 엣지 디바이스에 배포합니다.
- 산업 검사: 높은 초당 프레임 수(FPS)가 필요한 고속 조립 라인 품질 관리에 적합합니다.
미래: Ultralytics YOLO26의 등장#
YOLOv9와 RTDETRv2가 큰 폭의 발전을 보여주었지만, 기술 환경은 빠르게 변화했습니다. 최신 배포 환경에서 새롭게 출시된 **Ultralytics YOLO26**은 두 아키텍처 철학의 궁극적인 결합을 보여줍니다.
Transformer와 CNN의 장점을 결합한 YOLO26은 다음과 같은 새로운 표준을 제시합니다.
- 종단 간 NMS 없는 설계: RTDETRv2와 마찬가지로 YOLO26은 네이티브 종단 간 모델이며, NMS 후처리를 완전히 제거하여 더 빠르고 간단하며 예측 가능성이 높은 배포 파이프라인을 구현합니다.
- MuSGD 옵티마이저: 대규모 언어 모델(LLM) 학습 기법(예: Moonshot AI의 Kimi K2)에서 영감을 받은 YOLO26은 SGD와 Muon의 하이브리드 방식을 활용합니다. 이를 통해 컴퓨터 비전에서 탁월한 학습 안정성과 빠른 수렴을 제공합니다.
- 최대 43% 더 빠른 CPU 추론: 고성능 Transformer와 달리 YOLO26은 엣지 컴퓨팅 및 GPU가 없는 디바이스에 맞춰 고도로 최적화되었습니다.
- DFL 제거: Distribution Focal Loss를 제거하여 모델 그래프를 크게 단순화하고, 저전력 엣지 디바이스와 임베디드 신경망 처리 장치(NPUs)로의 원활한 내보내기를 보장합니다.
- ProgLoss + STAL: 개선된 이러한 손실 함수는 작은 객체 인식을 크게 향상하며, 이는 IoT 및 항공 데이터셋에 중요한 기능입니다.
새로운 컴퓨터 비전 프로젝트를 시작하려는 팀에는 YOLO26을 평가해 볼 것을 적극 권장합니다. 고도로 최적화된 YOLO 아키텍처의 뛰어난 속도와 학습 효율성에 Transformer의 NMS 없는 우아함을 결합합니다.
요약#
RTDETRv2와 YOLOv9 중 무엇을 선택할지는 주로 배포 하드웨어와 구체적인 정확도 요구 사항에 따라 결정됩니다. RTDETRv2는 서버 기반 애플리케이션에 최첨단 정확도와 컨텍스트 인식 기능을 제공하는 반면, YOLOv9는 엣지 디바이스에서 뛰어난 효율성을 제공합니다.
그러나 성숙한 Ultralytics 생태계를 활용하면 개발자는 두 모델을 모두 손쉽게 실험할 수 있습니다. 또한 YOLO11과 네이티브 종단 간 YOLO26 같은 최신 모델이 도입되면서, 고속 추론, 다양한 작업 지원, 낮은 메모리 사용량 사이에서 완벽한 균형을 찾는 일이 그 어느 때보다 쉬워졌습니다.