Ultralytics YOLO27:
Get Started

RTDETRv2와 YOLOv9#

컴퓨터 비전 분야에서는 주로 합성곱 신경망(CNN)과 Transformer 기반 모델 사이에서 아키텍처 철학이 흥미롭게 갈라져 왔습니다. RTDETRv2와 YOLOv9을 비교할 때 개발자는 본질적으로 전역 어텐션 메커니즘과 프로그래밍 가능한 그래디언트 정보 사이의 절충점을 평가하게 됩니다. 두 모델은 각각의 패러다임에서 정점을 이루며 실시간 객체 감지의 경계를 넓히고 있습니다.

모델 소개#

RTDETRv2: 실시간 감지 Transformer#

Baidu 연구진이 개발한 RTDETRv2는 기존 RT-DETR을 기반으로 하며, 기본 Real-Time Detection Transformer를 개선하기 위해 "Bag-of-Freebies"를 도입했습니다. Transformer의 전통적인 병목인 추론 속도 문제를 해결하여 실시간 애플리케이션에서 활용할 수 있게 합니다.

  • 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
  • 기관: Baidu
  • 날짜: 2024-07-24
  • 링크: Arxiv, GitHub

RTDETRv2의 대표적인 특징은 기본 제공되는 종단 간 NMS 프리 설계입니다. 후처리 중 비최대 억제(NMS)를 완전히 제거하여 추론 지연 시간을 안정화하고 배포 파이프라인을 간소화합니다. 전역 어텐션 메커니즘을 통해 모델은 이미지 전체 맥락을 동시에 평가하므로 복잡한 장면과 밀집된 군중을 이해하는 데 뛰어납니다.

RTDETRv2 자세히 알아보기

YOLOv9: 프로그래밍 가능한 그래디언트 정보#

매우 효율적인 CNN 기반 아키텍처인 YOLOv9은 심층 신경망에 내재된 정보 병목 문제를 해결합니다. 프로그래밍 가능한 그래디언트 정보(PGI)와 일반화된 효율적 레이어 집계 네트워크(GELAN)를 도입했습니다.

YOLOv9은 검증된 합성곱 신경망 기반을 활용하면서 파라미터 효율성을 극대화합니다. 순전파 과정에서 중요한 정보를 보존해 신뢰할 수 있는 가중치 업데이트를 보장하므로 매우 가볍고 정확한 모델을 구현합니다. 하지만 RTDETRv2와 달리 YOLOv9은 여전히 표준 NMS 후처리에 의존합니다.

YOLOv9에 대해 자세히 알아보기

성능 및 리소스 효율성#

프로덕션용 모델을 평가할 때는 평균 정밀도(mAP)와 계산 비용의 균형을 맞추는 것이 중요합니다. 아래 표는 MS COCO 데이터 세트에서의 성능을 보여 줍니다.

모델크기
(픽셀)
mAP검증
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

메모리 요구량 및 학습 효율성#

RTDETRv2와 같은 Transformer는 학습 중 메모리 사용량이 매우 많은 것으로 잘 알려져 있으며, 완전히 수렴하려면 상당한 CUDA 메모리와 더 긴 학습 일정이 필요한 경우가 많습니다. 반면 YOLOv9과 같은 CNN 아키텍처 및 다른 Ultralytics YOLO 모델은 메모리 사용량이 훨씬 적어 개발자가 일반 소비자용 하드웨어에서 더 큰 배치 크기로 학습할 수 있습니다.

효율적인 학습

하드웨어 활용을 극대화하려면 간소화된 클라우드 학습을 제공하는 Ultralytics Platform을 사용해 보세요. 환경 설정과 최적 배치 크기 지정을 자동으로 처리합니다.

Ultralytics의 장점: 에코시스템과 사용 편의성#

공식 RTDETRv2 또는 YOLOv9 GitHub 페이지와 같은 독립 리포지토리를 조사하는 것은 교육적으로 매우 유익할 수 있지만, 프로덕션 환경에는 안정성, 사용 편의성, 잘 관리되는 생태계가 필요합니다. Ultralytics Python API를 통해 이러한 모델을 통합하면 원활한 개발자 경험을 얻을 수 있습니다.

통합 API 및 범용성#

Ultralytics 프레임워크는 데이터 로딩, 증강, 분산 학습의 복잡성을 추상화합니다. 또한 기존 RTDETRv2는 감지에만 집중하지만, Ultralytics 생태계에서는 객체 감지, 인스턴스 분할, 자세 추정 간에 손쉽게 전환할 수 있습니다.

from ultralytics import RTDETR, YOLO

# 사용자 지정 데이터로 YOLOv9 모델 학습
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# 복잡한 장면 평가를 위해 RT-DETR로 간편하게 전환합니다
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# TensorRT와 같은 프로덕션 환경에 바로 사용할 수 있는 형식으로 내보냅니다
model_yolo.export(format="engine")

강력한 문서, 자동 실험 추적, 그리고 ONNX, TensorRT, OpenVINO와 같은 형식으로 원활하게 내보내는 기능을 통해 Ultralytics는 프로토타입에서 프로덕션까지 걸리는 시간을 크게 줄입니다.

적합한 사용 사례#

RTDETRv2가 강점을 발휘하는 분야#

전역 어텐션 메커니즘을 갖춘 RTDETRv2는 서버 측 처리와 전역 문맥이 중요한 환경에서 강력한 성능을 발휘합니다. 특히 다음 분야에 적합합니다.

  • 의료 영상: 주변 문맥이 중요한 상황에서 미묘한 이상 징후를 식별합니다.
  • 항공 감시: 기존 CNN 합성곱의 공간 편향 없이 고해상도 드론 영상에서 작은 객체를 포착합니다.
  • 밀집 군중 분석: 심한 가림 현상이 앵커 기반 모델을 혼란스럽게 하는 상황에서도 개인을 추적합니다.

YOLOv9가 강점을 발휘하는 분야#

YOLOv9는 리소스가 제한된 엣지 배포에 최적화되어 있습니다. 계산 효율성이 뛰어나 다음 분야에 적합합니다.

  • 로보틱스: 최소한의 지연 시간이 필요한 실시간 내비게이션과 장애물 회피에 사용됩니다.
  • 스마트 시티 IoT: 교통 모니터링을 위해 NVIDIA Jetson과 같은 엣지 디바이스에 배포합니다.
  • 산업 검사: 초당 프레임 수(FPS)가 높은 고속 조립 라인 품질 관리에 사용됩니다.

미래: Ultralytics YOLO26의 등장#

YOLOv9과 RTDETRv2가 큰 도약을 보여 주었지만, 기술 환경은 빠르게 발전해 왔습니다. 최신 배포 환경에서 새롭게 출시된 Ultralytics YOLO26은 두 아키텍처 철학의 궁극적인 시너지를 보여 줍니다.

Transformer와 CNN의 장점을 결합한 YOLO26은 새로운 표준을 제시합니다.

  • 엔드투엔드 NMS 없는 설계: RTDETRv2와 마찬가지로 YOLO26은 네이티브 엔드투엔드 추론을 지원하며, nms=False을 사용해 NMS 후처리를 생략하므로 배포 파이프라인이 더 빠르고 간결하며 예측 가능해집니다.
  • MuSGD 옵티마이저: Moonshot AI의 Kimi K2와 같은 대규모 언어 모델(LLM) 학습 기법에서 영감을 받은 YOLO26은 SGD와 Muon을 결합한 하이브리드 방식을 사용합니다. 이를 통해 컴퓨터 비전 분야에서 탁월한 학습 안정성과 빠른 수렴을 실현합니다.
  • 최대 43% 빠른 CPU 추론: 무거운 Transformer와 달리 YOLO26은 엣지 컴퓨팅과 GPU가 없는 디바이스에 맞춰 고도로 최적화되어 있습니다.
  • DFL 제거: 분포 초점 손실(Distribution Focal Loss)을 제거해 모델 그래프를 크게 단순화하고, 저전력 엣지 디바이스와 임베디드 신경망 처리 장치(NPU)로 원활하게 내보낼 수 있습니다.
  • ProgLoss + STAL: 개선된 손실 함수는 작은 객체 인식 성능을 크게 높입니다. 이는 IoT 및 항공 데이터셋에 중요한 기능입니다.

새로운 컴퓨터 비전 프로젝트를 시작하려는 팀에는 YOLO26 평가를 적극 권장합니다. Transformer의 선택적 NMS 없는 설계가 제공하는 간결함과 고도로 최적화된 YOLO 아키텍처의 뛰어난 속도 및 학습 효율성을 함께 제공합니다.

요약#

RTDETRv2와 YOLOv9 중에서 선택할 때는 배포 하드웨어와 구체적인 정확도 요구 사항을 주로 고려해야 합니다. RTDETRv2는 서버 기반 애플리케이션에 최첨단 정확도와 문맥 인식 기능을 제공하며, YOLOv9은 엣지 디바이스에서 탁월한 효율성을 제공합니다.

그러나 성숙한 Ultralytics 생태계를 활용하면 개발자는 YOLOv9과 기존 RT-DETR을 모두 손쉽게 실험할 수 있습니다. 또한 YOLO11과 같은 최신 모델과 네이티브 엔드투엔드 방식의 YOLO26이 도입되어, 빠른 추론, 다양한 작업 지원, 낮은 메모리 사용량 간의 최적의 균형을 그 어느 때보다 쉽게 찾을 수 있습니다.

댓글