Ultralytics YOLO27:
Get Started

YOLOv9과 RTDETRv2#

최근 몇 년간 실시간 객체 감지 분야에는 패러다임의 변화가 있었습니다. 고도로 최적화된 합성곱 신경망(CNN)과 실시간 Detection Transformer(DETR)라는 두 가지 서로 다른 아키텍처 철학이 이 분야를 주도하고 있습니다. 이 두 접근 방식의 정점에 있는 모델이 바로 YOLOv9과 RTDETRv2입니다.

이 종합 가이드에서는 두 강력한 모델을 비교하고, 아키텍처 혁신, 성능 지표, 적합한 배포 시나리오를 분석하여 컴퓨터 비전 파이프라인에 맞는 모델을 선택하도록 돕습니다.

요약#

두 모델 모두 최첨단 결과를 달성하지만, 배포 제약 조건과 개발 에코시스템 측면에서 약간 다른 요구 사항을 충족합니다.

  • YOLOv9을 선택해야 하는 경우: 매개변수를 매우 효율적으로 활용하고 엣지 디바이스에서 빠르게 추론해야 합니다. YOLOv9은 CNN 효율성의 이론적 한계를 넓히므로 연산 리소스가 엄격하게 제한된 환경에 적합합니다.
  • RTDETRv2를 선택해야 하는 경우: 특히 심한 폐색이나 복잡한 객체 관계가 있는 장면에서 Transformer가 제공하는 섬세한 맥락 이해가 필요하고, 약간 더 무거운 아키텍처를 지원할 하드웨어를 갖추고 있어야 합니다.
  • YOLO26을 선택해야 하는 경우(권장): 두 모델의 장점을 모두 원한다면 선택하세요. Ultralytics Platform에서 사용할 수 있는 최신 세대 모델인 YOLO26은 선택적 엔드투엔드 NMS 프리 설계(nms=False, DETR 모델과 유사하지만 훨씬 빠름)를 갖춰 후처리 병목 현상을 없애고 이전 세대보다 최대 43% 빠른 CPU 추론을 제공합니다.

기술 사양 및 개발 주체#

이러한 모델의 기원과 설계 의도를 이해하면 각 아키텍처의 선택 배경을 파악하는 데 중요한 맥락을 얻을 수 있습니다.

YOLOv9#

YOLOv9에 대해 자세히 알아보기

RTDETRv2#

RTDETRv2 자세히 알아보기

아키텍처 혁신#

YOLOv9: 정보 병목 문제 해결#

YOLOv9는 데이터가 심층 신경망을 통과할 때 발생하는 정보 손실을 해결하기 위해 설계된 두 가지 주요 혁신을 도입합니다:

  1. 프로그래밍 가능 기울기 정보(PGI): 이 보조 감독 프레임워크는 네트워크 가중치를 업데이트하는 데 신뢰할 수 있는 기울기가 생성되도록 하여, 매우 깊은 네트워크 계층에서도 중요한 특징 정보를 보존합니다.
  2. 일반화된 효율적 계층 집계 네트워크(GELAN): CSPNet과 ELAN의 강점을 결합한 새로운 아키텍처입니다. GELAN은 파라미터 효율성을 최적화하여 기존 CNN에 비해 더 적은 FLOPs로 YOLOv9가 더 높은 정확도를 달성하도록 합니다.

RTDETRv2: 실시간 Transformer 성능 향상#

기존 RT-DETR의 성공을 바탕으로, RTDETRv2는 비최대 억제(NMS)가 필요 없는 Transformer 기반 아키텍처를 활용합니다. 주요 개선 사항은 다음과 같습니다.

  1. Bag-of-Freebies 전략: v2 버전에는 추론 지연 시간에 오버헤드를 추가하지 않으면서 정확도를 크게 높이는 고급 학습 기법과 데이터 증강이 포함됩니다.
  2. 효율적인 하이브리드 인코더: 분리된 스케일 내 및 스케일 간 어텐션 메커니즘으로 다중 스케일 특징을 처리하여, RTDETRv2는 Vision Transformer의 전통적으로 높은 계산 비용을 효율적으로 관리합니다.
네이티브 엔드투엔드 탐지

RTDETRv2가 NMS 없는 탐지에 Transformer를 활용하는 반면, 새로운 YOLO26 아키텍처는 고도로 최적화된 CNN 구조 내에서 선택적 일대일 헤드(nms=False)를 통해 이를 구현합니다. 따라서 간소화된 배포를 제공하면서도 엣지 추론 속도를 훨씬 더 높입니다.

성능 비교#

프로덕션용 모델을 평가할 때 정확도와 계산 요구 사항 간의 절충은 매우 중요합니다. 아래 표는 표준 벤치마크에서 다양한 모델 크기의 성능을 보여줍니다.

모델크기
(픽셀)
mAP검증
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

분석#

데이터에서 알 수 있듯이 YOLOv9는 파라미터 효율성에서 뚜렷한 우위를 유지합니다. YOLOv9c 모델은 파라미터가 25.5M에 불과하면서도 인상적인 53.0 mAP를 달성하여 매우 경량입니다.

반면 RTDETRv2는 중형 및 대형 모델 범주에서 강력한 경쟁력을 보입니다. 그러나 여기에는 파라미터 수 증가와 FLOPs의 큰 증가가 따르며, 이는 Transformer 모델의 일반적인 특성입니다. 이러한 아키텍처 차이는 메모리 사용량에도 영향을 미칩니다. YOLO 모델은 일반적으로 Transformer 모델에 비해 학습과 추론 모두에서 훨씬 적은 CUDA 메모리를 사용합니다.

Ultralytics의 강점: 생태계와 다용성#

순수 아키텍처 지표도 중요하지만, AI 프로젝트의 성공은 소프트웨어 생태계에 좌우되는 경우가 많습니다. Ultralytics Python API를 통해 이러한 고급 모델을 사용하면 탁월한 이점을 누릴 수 있습니다.

간소화된 학습 및 배포#

Detection Transformer를 학습하려면 일반적으로 복잡한 구성 파일과 고성능 GPU가 필요합니다. Ultralytics 프레임워크를 사용하면 개발자는 YOLOv9와 RT-DETR 모델을 동일하고 간단한 구문으로 학습할 수 있으며, 효율적인 학습 파이프라인과 바로 사용할 수 있는 사전 학습 가중치의 이점도 누릴 수 있습니다.

from ultralytics import RTDETR, YOLO

# YOLOv9 모델 학습
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# 동일한 API를 사용하여 RTDETR 모델 학습
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# 모델을 OpenVINO 또는 TensorRT로 원활하게 내보내기
model_yolo.export(format="openvino")

탁월한 태스크 활용성#

RTDETRv2와 같은 전문화된 모델의 주요 한계는 바운딩 박스 탐지에만 초점을 맞춘다는 점입니다. 반면 YOLO11 및 YOLOv8과 같은 모델을 포함하는 폭넓은 Ultralytics 생태계는 다양한 컴퓨터 비전 작업을 지원합니다. 여기에는 픽셀 단위의 정밀한 인스턴스 세그멘테이션, 골격 기반 포즈 추정, 전체 이미지 분류, 항공 이미지용 회전 바운딩 박스(OBB) 탐지가 포함됩니다.

실제 애플리케이션#

고속 엣지 분석#

엣지 디바이스에서 실시간 제품 인식이 필요한 소매 환경이나 제조 라인에는 YOLOv9가 더 적합합니다. GELAN 아키텍처는 NVIDIA Jetson 시리즈와 같은 제약이 있는 하드웨어에서 높은 처리량을 보장하여, 상당한 지연 없이 자동화된 품질 관리를 지원합니다.

복잡한 장면 분석#

혼잡한 군중 모니터링이나 복잡한 교차로처럼 객체가 자주 서로를 가리는 상황에서는 RTDETRv2의 전역 어텐션 메커니즘이 강점을 발휘합니다. 이미지 전체의 문맥을 네이티브하게 추론하는 모델의 능력 덕분에 객체가 부분적으로 가려진 경우에도 안정적인 추적과 탐지를 유지할 수 있습니다.

사용 사례 및 권장 사항#

YOLOv9와 RT-DETR 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.

YOLOv9을 선택해야 하는 경우#

YOLOv9은 다음과 같은 경우에 적합합니다.

  • 정보 병목 연구: 프로그래밍 가능한 그래디언트 정보(PGI) 및 일반화된 효율적 계층 집계 네트워크(GELAN) 아키텍처를 연구하는 학술 프로젝트입니다.
  • 그래디언트 흐름 최적화 연구: 학습 중 심층 네트워크 계층의 정보 손실을 이해하고 완화하는 데 초점을 둔 연구입니다.
  • 고정확도 탐지 벤치마킹: 아키텍처 비교의 기준점으로 YOLOv9의 우수한 COCO 벤치마크 성능이 필요한 시나리오입니다.

RT-DETR을 선택해야 하는 경우#

다음과 같은 경우 RT-DETR을 권장합니다.

  • Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
  • 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
  • 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.

  • NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
  • 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.

미래: YOLO26의 등장#

YOLOv9와 RTDETRv2는 큰 성과를 거두었지만, 컴퓨터 비전 분야는 빠르게 발전하고 있습니다. 새로운 프로젝트를 시작하려는 개발자에게는 YOLO26을 최첨단 권장 솔루션으로 제안합니다.

2026년에 출시된 YOLO26은 CNN과 DETR의 장점을 결합합니다. 여기에는 선택적 엔드투엔드 NMS 없는 설계(nms=False)가 적용되어 NMS 후처리를 제거합니다. 이 기법은 YOLOv10에서 처음 선보였습니다. 또한 YOLO26은 엣지 호환성을 높이기 위해 분포 초점 손실(DFL)을 제거하고 혁신적인 MuSGD 옵티마이저를 도입합니다. 대규모 언어 모델 학습, 특히 Moonshot AI의 Kimi K2에서 영감을 받은 이 하이브리드 옵티마이저는 전례 없는 학습 안정성과 빠른 수렴을 제공합니다.

탁월한 소형 객체 인식을 위한 ProgLoss와 STAL(점진적 손실 및 소형 객체 인식 레이블 할당)을 결합한 YOLO26은 최대 43% 더 빠른 CPU 추론을 제공하여 최신 AI 배포를 위한 최적의 모델로 자리매김합니다.

댓글