Ultralytics YOLO27:

YOLOv9 vs RTDETRv2#

실시간 객체 탐지의 지형은 최근 몇 년 동안 패러다임의 전환을 겪었습니다. 이 분야를 주도하는 두 가지 뚜렷한 아키텍처 철학이 등장했습니다. 고도로 최적화된 합성곱 신경망(CNNs)과 실시간 탐지 Transformer(DETRs)입니다. 이 두 접근 방식의 정점에 있는 모델이 YOLOv9RTDETRv2입니다.

이 종합 가이드에서는 두 강력한 모델을 비교하고, 아키텍처 혁신, 성능 지표, 이상적인 배포 시나리오를 분석하여 컴퓨터 비전 파이프라인에 적합한 모델을 선택할 수 있도록 지원합니다.

핵심 요약#

두 모델 모두 최첨단 성능을 달성하지만, 배포 제약 조건과 개발 생태계 측면에서 약간 다른 요구 사항에 적합합니다.

  • YOLOv9를 선택해야 하는 경우: 엣지 디바이스에서 매우 효율적인 파라미터 활용과 빠른 추론이 필요할 때 적합합니다. YOLOv9는 CNN 효율성의 이론적 한계를 확장하므로, 컴퓨팅 리소스가 엄격하게 제한된 환경에 이상적입니다.
  • RTDETRv2를 선택해야 하는 경우: 특히 심각한 가림이나 복잡한 객체 관계가 존재하는 장면에서 Transformer가 제공하는 정교한 문맥 이해가 필요하고, 다소 무거운 아키텍처를 지원할 하드웨어를 갖춘 경우 적합합니다.
  • YOLO26(권장)을 선택해야 하는 경우: 두 가지 장점을 모두 원할 때 적합합니다. Ultralytics Platform에서 제공되는 최신 세대 모델인 YOLO26은 네이티브 End-to-End NMS-Free Design(DETR 모델과 유사하지만 훨씬 빠름)을 특징으로 하며, 후처리 병목을 제거하고 이전 세대보다 최대 43% 빠른 CPU 추론을 제공합니다.

기술 사양 및 저자 정보#

이러한 모델의 기원과 설계 의도를 이해하면 아키텍처 선택에 대한 중요한 배경을 파악할 수 있습니다.

YOLOv9#

YOLOv9에 대해 자세히 알아보기

RTDETRv2#

RT-DETR에 대해 자세히 알아보세요

아키텍처 혁신#

YOLOv9: 정보 병목 현상 해결#

Ultralytics YOLOv9는 데이터가 심층 신경망을 통과할 때 발생하는 정보 손실을 해결하기 위해 설계된 두 가지 주요 혁신을 도입합니다.

  1. 프로그래밍 가능한 그래디언트 정보(PGI): 이 보조 감독 프레임워크는 네트워크 가중치를 업데이트할 수 있는 신뢰할 만한 그래디언트를 생성하여, 매우 깊은 네트워크 레이어에서도 중요한 특징 정보를 보존합니다.
  2. 일반화된 효율적 레이어 집계 네트워크(GELAN): CSPNet과 ELAN의 장점을 결합한 새로운 아키텍처입니다. GELAN은 파라미터 효율성을 최적화하여 기존 CNN보다 적은 FLOPs로 YOLOv9가 더 높은 정확도를 달성할 수 있도록 합니다.

RTDETRv2: 실시간 Transformer 향상#

기존 RT-DETR의 성공을 바탕으로 RTDETRv2는 본질적으로 Non-Maximum Suppression(NMS)이 필요하지 않은 Transformer 기반 아키텍처를 활용합니다. 주요 개선 사항은 다음과 같습니다.

  1. Bag-of-Freebies 전략: v2 버전은 추론 지연 시간에 오버헤드를 추가하지 않으면서 정확도를 크게 향상하는 고급 학습 기법과 데이터 증강을 통합합니다.
  2. 효율적인 하이브리드 인코더: 분리된 스케일 내 및 스케일 간 어텐션 메커니즘을 통해 멀티스케일 특징을 처리함으로써, RTDETRv2는 Vision Transformer에서 전통적으로 발생하는 높은 연산 비용을 효율적으로 관리합니다.
네이티브 End-to-End 탐지

RTDETRv2가 NMS 없는 탐지를 위해 Transformer를 활용하는 반면, 새로운 YOLO26 아키텍처는 고도로 최적화된 CNN 구조 내에서 이를 네이티브하게 구현하여 동일하게 간소화된 배포 환경을 제공하면서도 엣지 추론 속도는 훨씬 더 빠릅니다.

성능 비교#

프로덕션 환경에 사용할 모델을 평가할 때는 정확도와 컴퓨팅 요구 사항 간의 트레이드오프가 중요합니다. 아래 표는 표준 벤치마크에서 다양한 모델 크기의 성능을 보여줍니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

분석#

데이터에서 확인할 수 있듯이 YOLOv9는 파라미터 효율성에서 확실한 우위를 유지합니다. YOLOv9c 모델은 25.3M개의 파라미터만으로 인상적인 53.0 mAP를 달성하여 매우 가볍습니다.

반면 RTDETRv2는 중형에서 대형 모델 범주에서 강력한 경쟁력을 제공합니다. 그러나 이는 더 많은 파라미터와 상당히 큰 FLOPs를 대가로 하며, 이는 Transformer 모델의 일반적인 특성입니다. 이러한 아키텍처 차이는 메모리 사용량에도 영향을 미칩니다. YOLO 모델은 일반적으로 학습과 추론 모두에서 Transformer 모델보다 훨씬 적은 CUDA 메모리를 필요로 합니다.

Ultralytics의 강점: 생태계와 범용성#

순수한 아키텍처 지표도 중요하지만, 소프트웨어 생태계가 AI 프로젝트의 성공을 좌우하는 경우가 많습니다. 이러한 고급 모델에 Ultralytics Python API를 통해 액세스하면 탁월한 이점을 얻을 수 있습니다.

간소화된 학습 및 배포#

Detection Transformer 훈련에는 일반적으로 복잡한 설정 파일과 고성능 GPU가 필요합니다. Ultralytics 프레임워크를 활용하면 개발자는 동일하고 간단한 구문으로 YOLOv9 및 RT-DETR 모델을 모두 훈련할 수 있으며, 고효율 훈련 파이프라인과 즉시 사용 가능한 사전 훈련된 가중치의 이점을 누릴 수 있습니다.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")

탁월한 작업 범용성#

RTDETRv2와 같은 특화 모델의 주요 한계는 바운딩 박스 탐지에만 초점을 맞춘다는 점입니다. 반면 YOLO11YOLOv8 같은 모델을 포함하는 더 폭넓은 Ultralytics 생태계는 다양한 컴퓨터 비전 작업을 지원합니다. 여기에는 픽셀 단위의 정밀한 인스턴스 세그멘테이션, 골격 기반 포즈 추정, 전체 이미지 분류, 항공 이미지용 Oriented Bounding Box(OBB) 탐지가 포함됩니다.

실제 애플리케이션#

고속 엣지 분석#

엣지 디바이스에서 실시간 제품 인식이 필요한 소매 환경이나 제조 라인에서는 YOLOv9가 더 나은 선택입니다. GELAN 아키텍처는 NVIDIA Jetson 시리즈와 같은 제한된 하드웨어에서도 높은 처리량을 보장하여, 상당한 지연 없이 자동화된 품질 관리를 수행할 수 있도록 합니다.

복잡한 장면 분석#

밀집된 군중 모니터링이나 복잡한 교차로처럼 객체가 서로를 자주 가리는 상황에서는 RTDETRv2의 전역 어텐션 메커니즘이 강점을 발휘합니다. 전체 이미지 문맥을 네이티브하게 추론하는 이 모델의 능력은 객체가 부분적으로 가려진 경우에도 안정적인 추적과 탐지를 유지할 수 있도록 합니다.

사용 사례 및 권장 사항#

YOLOv9와 RT-DETR 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.

YOLOv9을 선택해야 하는 경우#

YOLOv9은 다음과 같은 경우에 적합합니다:

  • 정보 병목 연구: 프로그래밍 가능한 그래디언트 정보(PGI) 및 일반화된 효율적 레이어 집계 네트워크(GELAN) 아키텍처를 연구하는 학술 프로젝트입니다.
  • 그래디언트 흐름 최적화 연구: 학습 중 심층 네트워크 레이어의 정보 손실을 이해하고 완화하는 데 중점을 둔 연구입니다.
  • 고정확도 탐지 벤치마킹: 아키텍처 비교를 위한 기준점으로 YOLOv9의 강력한 COCO 벤치마크 성능이 필요한 시나리오입니다.

RT-DETR을 선택해야 하는 경우#

다음과 같은 경우 RT-DETR을 권장합니다.

  • Transformer 기반 감지 연구: NMS 없이 엔드 투 엔드 객체 감지를 수행하기 위해 attention mechanism과 Transformer 아키텍처를 탐구하는 프로젝트입니다.
  • 유연한 latency를 요구하는 고정확도 시나리오: 감지 정확도가 최우선이며 약간 더 높은 추론 latency를 허용할 수 있는 애플리케이션입니다.
  • 대형 객체 감지: 주로 medium-to-large 객체가 있는 장면으로, Transformer의 global attention mechanism이 자연스러운 이점을 제공하는 경우입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

미래: YOLO26의 등장#

YOLOv9와 RTDETRv2가 괄목할 만한 성과를 나타내지만, 컴퓨터 비전 분야는 빠르게 발전하고 있습니다. 새로운 프로젝트를 시작하려는 개발자에게는 **YOLO26**이 권장되는 최첨단 솔루션입니다.

2026년에 출시된 YOLO26은 CNN과 DETR의 장점을 모두 통합합니다. End-to-End NMS-Free Design을 특징으로 하여 후처리 지연 시간을 완전히 제거하며, 이는 YOLOv10에서 처음 개척된 기법입니다. 또한 YOLO26은 엣지 호환성을 높이기 위해 Distribution Focal Loss(DFL)를 제거하고 혁신적인 MuSGD Optimizer를 도입합니다. Large Language Model 학습, 특히 Moonshot AI의 Kimi K2에서 영감을 받은 이 하이브리드 옵티마이저는 전례 없는 학습 안정성과 더 빠른 수렴을 보장합니다.

탁월한 소형 객체 인식을 위한 ProgLoss 및 STAL과 같은 향상된 손실 함수가 결합된 YOLO26은 최대 43% 빠른 CPU 추론을 제공하여, 현대적인 AI 배포를 위한 궁극적인 모델로서의 입지를 확고히 합니다.

댓글