RTDETRv2 대 YOLO11#
컴퓨터 비전 분야는 끊임없이 발전하고 있으며, 새로운 아키텍처가 엣지 디바이스와 클라우드 서버에서 가능한 범위의 한계를 확장하고 있습니다. 현재 실시간 객체 탐지 분야에서 가장 주목받는 두 경쟁 모델은 RTDETRv2와 YOLO11입니다. 두 모델 모두 뛰어난 성능을 제공하지만, 근본적으로 서로 다른 아키텍처 철학을 나타냅니다. 즉, Transformer 기반 접근 방식과 고도로 최적화된 합성곱 신경망(CNN)입니다.
이 종합적인 기술 비교에서는 두 모델의 아키텍처, 성능 지표, 학습 방법론 및 이상적인 사용 사례를 살펴보고, 다음 인공지능 애플리케이션에 적합한 선택을 내릴 수 있도록 지원합니다.
RTDETRv2: Transformer 기반 도전자#
최초의 Real-Time Detection Transformer를 발전시킨 모델로 소개된 RTDETRv2는 어텐션 메커니즘을 활용하여 시각 데이터를 처리합니다. 이미지 패치를 시퀀스로 취급함으로써 이미지 컨텍스트를 전역적으로 이해하며, 이는 복잡한 장면에서 서로 많이 겹치는 객체를 탐지하는 데 매우 유용합니다.
모델 세부 정보:
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR Repository
- Docs: RTDETRv2 Documentation
아키텍처의 강점과 약점#
RTDETRv2의 주요 혁신은 엔드투엔드 NMS-free 아키텍처입니다. 비최대 억제(NMS)를 제거하여 후처리 파이프라인을 간소화합니다. 또한 원래의 RT-DETR model보다 멀티스케일 특징 추출 기능이 향상되어 다양한 크기의 객체를 더 효과적으로 식별할 수 있습니다.
그러나 Transformer에 의존하기 때문에 RTDETRv2는 일반적으로 학습 중 훨씬 더 많은 메모리를 필요로 합니다. Transformer는 일반적으로 수렴 속도가 느리고 기존 CNN보다 훨씬 더 많은 CUDA 메모리를 요구하므로, 소비자용 하드웨어를 사용하는 연구자나 제한된 edge AI 환경에 배포하는 경우 접근성이 떨어질 수 있습니다.
Ultralytics YOLO11: CNN 효율성의 정점#
수년간의 기초 연구를 바탕으로 Ultralytics는 YOLO 계보를 크게 발전시킨 YOLO11을 출시했습니다. YOLO11은 CNN 아키텍처를 개선하여 전례 없는 속도와 정확도를 달성하는 동시에, 커뮤니티가 기대해 온 유연성과 개발자 친화적인 생태계를 유지합니다.
모델 세부 정보:
- 저자: Glenn Jocher 및 Jing Qiu
- 조직: Ultralytics
- 날짜: 2024년 9월 27일
- GitHub: Ultralytics Repository
Ultralytics의 강점#
YOLO11은 성능 균형에서 뛰어난 강점을 보입니다. 속도와 정확도 사이에서 탁월한 균형을 달성하여, 대규모 cloud computing 클러스터부터 경량 모바일 디바이스까지 다양한 실제 배포 시나리오에 매우 유연하게 대응합니다.
또한 Ultralytics YOLO 모델은 학습 및 추론 중 낮은 메모리 사용량으로 잘 알려져 있습니다. Transformer 모델은 VRAM을 쉽게 소진할 수 있는 반면, YOLO11은 일반적인 GPU에서 더 큰 배치 크기를 사용할 수 있습니다. 또한 YOLO11은 단순한 객체 탐지에만 국한되지 않으며, Instance Segmentation, Image Classification, Pose Estimation 및 Oriented Bounding Boxes (OBB)를 기본적으로 지원하는 뛰어난 범용성을 제공합니다.
성능 및 지표 비교#
원시 수치를 비교하면 RTDETRv2가 인상적인 정확도를 달성하는 반면, YOLO11은 훨씬 더 세분화된 모델 크기 선택지를 제공하며 특히 TensorRT에서 더 뛰어난 추론 속도를 보인다는 점이 분명해집니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
표에서 볼 수 있듯이 YOLO11x 모델은 RTDETRv2-x 변형보다 적은 FLOPs(194.9B 대 259B)를 사용하면서 54.7%의 더 높은 mAPval을 달성하고, TensorRT에서 더 빠른 추론 속도(11.3ms 대 15.03ms)를 제공합니다. nano 및 small YOLO11 변형은 Raspberry Pi와 같은 제한된 디바이스를 위한 탁월한 경량 옵션을 제공합니다.
생태계, 사용 편의성 및 학습#
Ultralytics 모델의 핵심 특징은 간소화된 사용자 경험입니다. ultralytics Python 패키지는 data augmentation, 분산 학습 및 모델 내보내기의 복잡한 작업을 처리하는 통합되고 직관적인 API를 제공합니다. RTDETRv2의 연구용 리포지토리에는 상당한 보일러플레이트 코드와 구성이 필요한 반면, Ultralytics는 "zero-to-hero" 파이프라인을 제공합니다.
흥미롭게도 Ultralytics 생태계는 매우 강력하여 YOLO 모델과 함께 RT-DETR 모델을 실행하는 기능을 기본적으로 지원합니다! 이를 통해 Weights & Biases 및 Comet ML과의 통합을 포함한 Ultralytics의 잘 유지 관리되는 생태계를 활용하여 실험을 손쉽게 추적할 수 있습니다.
from ultralytics import RTDETR, YOLO
# Load an RTDETR model seamlessly through the Ultralytics API
model_rtdetr = RTDETR("rtdetr-l.pt")
# Load a highly optimized YOLO11 model
model_yolo = YOLO("yolo11n.pt")
# Train YOLO11 with highly efficient memory usage
results = model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained YOLO model to ONNX format
model_yolo.export(format="onnx")머신러닝에서는 학습 효율성이 가장 중요합니다. Ultralytics 모델은 빠르게 수렴하는 사전 학습된 가중치를 사용합니다. 코드 작성 없이 데이터셋, 학습 실행 및 배포 엔드포인트를 관리하려면 통합 MLOps 경험을 제공하는 Ultralytics Platform을 살펴보세요.
실제 애플리케이션#
이러한 아키텍처 중 하나를 선택하는 일은 프로젝트의 구체적인 배포 제약 조건에 따라 결정되는 경우가 많습니다.
RTDETRv2가 뛰어난 분야: RTDETRv2의 Transformer 백본은 전역 컨텍스트가 필요한 조밀하고 심하게 가려진 객체가 있는 시나리오에서 매우 효과적입니다. 계산 예산보다 어텐션 기반 관계 매핑 자체가 더 중요한 학술 연구 및 애플리케이션에서 자주 평가됩니다.
YOLO11이 우위를 보이는 분야: YOLO11은 실용적인 실제 배포 분야에서 명실상부한 챔피언입니다. 최소한의 메모리 사용량과 매우 빠른 추론 속도 덕분에 다음과 같은 용도에 적합합니다:
- 스마트 제조: 산업용 PC를 사용하여 생산 라인에서 실시간 결함 탐지를 실행합니다.
- 농업: 드론에 배포하여 실시간 작물 상태를 모니터링하고 자동화된 수확 로봇을 운영합니다.
- 리테일 분석: 대규모 서버 팜 없이 여러 카메라 스트림을 동시에 처리하여 대기열을 관리하고 재고를 추적합니다.
사용 사례 및 권장 사항#
RT-DETR과 YOLO11 중 하나를 선택하는 것은 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.
RT-DETR을 선택해야 하는 경우#
RT-DETR이 적합한 경우:
- Transformer 기반 감지 연구: NMS 없이 엔드 투 엔드 객체 감지를 수행하기 위해 attention mechanism과 Transformer 아키텍처를 탐구하는 프로젝트입니다.
- 유연한 latency를 요구하는 고정확도 시나리오: 감지 정확도가 최우선이며 약간 더 높은 추론 latency를 허용할 수 있는 애플리케이션입니다.
- 대형 객체 감지: 주로 medium-to-large 객체가 있는 장면으로, Transformer의 global attention mechanism이 자연스러운 이점을 제공하는 경우입니다.
YOLO11을 선택해야 하는 경우#
YOLO11은 다음과 같은 경우에 권장됩니다:
- 프로덕션 엣지 배포: 신뢰성과 지속적인 유지 관리가 무엇보다 중요한 Raspberry Pi 또는 NVIDIA Jetson과 같은 디바이스에서 실행되는 상용 애플리케이션입니다.
- 멀티태스크 비전 애플리케이션: 단일 통합 프레임워크에서 감지, 세그멘테이션, 포즈 추정, OBB가 필요한 프로젝트입니다.
- 신속한 프로토타이핑 및 배포: 간소화된 Ultralytics Python API를 사용하여 데이터 수집부터 프로덕션까지 빠르게 진행해야 하는 팀입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.
- NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
- 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.
향후 전망: YOLO26의 등장#
새로운 프로젝트를 시작한다면 차세대 비전 AI도 고려해야 합니다. **Ultralytics YOLO26**입니다. 2026년 1월에 출시된 YOLO26은 양쪽의 장점을 결합합니다. 엔드투엔드 NMS-Free 설계를 도입하여(YOLOv10에서 최초로 개척), RTDETRv2와 마찬가지로 후처리 지연 시간을 완전히 제거하면서도 CNN의 탁월한 속도를 제공합니다.
YOLO26은 LLM 학습 혁신에서 영감을 얻은 MuSGD Optimizer를 탑재하여 매우 안정적이고 빠른 수렴을 실현하며, Distribution Focal Loss (DFL)를 제거하여 최대 43% 더 빠른 CPU 추론을 제공합니다. 소형 객체 인식을 크게 향상하는 특수한 ProgLoss + STAL 손실 함수를 갖춘 YOLO26은 모든 최신 컴퓨터 비전 파이프라인에 대한 최고의 권장 모델입니다.
검증된 범용성을 위해 YOLO11을 선택하든, 어텐션 메커니즘을 위해 RTDETRv2를 선택하든, 최고의 엣지 성능을 위해 최첨단 YOLO26을 선택하든, Ultralytics documentation에서 컴퓨터 비전 여정을 성공적으로 진행하는 데 필요한 모든 리소스를 제공합니다.