RTDETRv2와 YOLOX#
컴퓨터 비전 분야는 빠르게 발전해 왔으며, 비전 기반 시스템을 구축할 때 개발자와 연구자가 선택할 수 있는 다양한 아키텍처를 제공하고 있습니다. 이러한 발전 과정에서 주목할 만한 두 가지 이정표는 트랜스포머 기반 RTDETRv2와 CNN 기반 YOLOX입니다. 두 모델 모두 실시간 객체 감지 분야에 크게 기여했지만, 시각 인식 문제를 해결하는 방식에서는 근본적으로 서로 다른 접근법을 나타냅니다.
이 종합 가이드에서는 두 모델의 아키텍처 세부 사항, 성능 지표 및 이상적인 배포 시나리오를 살펴봅니다. 또한 최첨단 Ultralytics YOLO26과 같은 최신 대안이 이러한 기반 위에서 어떻게 발전하여 더 뛰어난 정확도, 효율성 및 사용 편의성을 제공하는지 검토합니다.
RTDETRv2: 실시간 탐지 Transformer#
기존 RT-DETR의 후속 모델로 소개된 RTDETRv2는 트랜스포머 아키텍처를 활용하여 고성능 실시간 객체 감지를 구현합니다. 비최대 억제(NMS)가 필요하지 않으므로 추론 파이프라인을 간소화합니다.
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- 링크: Arxiv 논문, 공식 GitHub, 문서
아키텍처 및 설계#
RTDETRv2는 트랜스포머에 내재된 셀프 어텐션 메커니즘에 크게 의존하여 모델이 이미지 전체에서 전역적인 맥락을 포착할 수 있도록 합니다. 이러한 종합적인 이해를 바탕으로 바운딩 박스와 클래스 확률을 직접 예측할 수 있습니다. 또한 다중 스케일 감지 특징을 도입하여 복잡한 환경에서 작은 객체를 인식하는 능력을 향상합니다.
트랜스포머는 전역적인 맥락을 포착하는 데 뛰어나지만, 셀프 어텐션 메커니즘은 시퀀스 길이에 따라 이차적으로 확장되므로 기존 CNN과 비교할 때 학습 중 CUDA 메모리 사용량이 크게 증가하는 경우가 많습니다.
강점과 약점#
RTDETRv2의 가장 큰 강점은 네이티브 엔드 투 엔드 설계에 있습니다. NMS를 생략함으로써 서로 겹치는 예측이 많은 경우에 흔히 발생하는 지연 시간 급증을 방지합니다. 그러나 트랜스포머 블록의 높은 연산 비용으로 인해 학습과 배포 모두에 상당한 GPU 리소스가 필요합니다. 따라서 리소스가 제한된 엣지 디바이스나 구형 모바일 하드웨어에는 적합성이 떨어집니다.
YOLOX: 앵커 프리 CNN의 발전#
학술 연구와 산업 애플리케이션 간의 격차를 해소하기 위해 개발된 YOLOX는 널리 사용되는 YOLO 모델 제품군에 디커플드 헤드와 앵커 프리 설계를 도입했습니다.
- 저자: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, Jian Sun
- 조직: Megvii
- 날짜: 2021년 7월 18일
- 링크: Arxiv 논문, 공식 GitHub, 문서
아키텍처 및 설계#
YOLOX는 사전 정의된 앵커 박스 없이 객체의 위치를 직접 예측함으로써 기존 앵커 기반 검출기에서 벗어났습니다. 이를 통해 네트워크 설계를 간소화하고 최적의 성능에 필요한 휴리스틱 튜닝 파라미터 수를 줄입니다. 또한 YOLOX는 분류 작업과 회귀 작업을 분리하는 디커플드 헤드를 사용하여 학습 중 수렴 속도를 향상합니다.
강점과 약점#
YOLOX의 앵커 프리 특성은 다양한 컴퓨터 비전 작업에 높은 적응성을 제공하며, 커스텀 데이터셋을 사용한 학습도 더 간단하게 합니다. YOLOX-Nano와 같은 경량 변형 모델은 마이크로컨트롤러와 저전력 IoT 디바이스에 배포하기에 적합합니다. 그러나 YOLOX는 NMS를 사용하지 않는 혁신이 등장하기 전에 개발되었기 때문에 여전히 기존 후처리에 의존하며, 이로 인해 복잡한 장면에서 배포가 까다로워지고 지연 시간이 증가할 수 있습니다.
성능 및 지표 비교#
이러한 모델을 비교할 때는 특정 사용 사례에 가장 적합한 모델을 결정하기 위해 속도, 정확도 및 파라미터 효율성을 평가하는 것이 중요합니다. 아래 표에는 표준 COCO 데이터셋에서 다양한 모델 크기의 성능이 정리되어 있습니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
데이터에서 확인할 수 있듯이 RTDETRv2는 가장 큰 변형 모델에서 YOLOXx보다 더 높은 최대 정확도(54.3 mAP)를 달성합니다. 그러나 YOLOX는 YOLOXs와 같이 훨씬 더 작고 빠른 변형 모델을 제공하며, YOLOXs는 NVIDIA T4 GPU에서 더 적은 파라미터 수와 더 빠른 추론 속도를 자랑합니다.
Ultralytics의 강점: YOLO26 출시#
RTDETRv2와 YOLOX 모두 고유한 장점을 제공하지만, 현대의 개발자는 높은 정확도, 매우 빠른 추론 및 접근성 높은 생태계라는 양쪽의 장점을 결합한 통합 솔루션을 필요로 하는 경우가 많습니다. 새롭게 출시된 **Ultralytics YOLO26**은 이러한 발전의 정점을 보여줍니다.
YOLO26의 주요 혁신#
- 엔드 투 엔드 NMS 프리 설계: YOLOv10에서 처음 선보인 개념을 기반으로 하는 YOLO26은 기본적으로 NMS 없이 작동합니다. 이를 통해 트랜스포머에 필요한 막대한 메모리 없이 RTDETRv2와 같은 원활한 추론을 제공합니다.
- MuSGD 옵티마이저: 대규모 언어 모델 학습의 혁신에서 영감을 얻은 하이브리드 MuSGD 옵티마이저(SGD와 Muon의 결합)는 학습 과정을 안정화하고 수렴을 크게 가속합니다.
- 최대 43% 더 빠른 CPU 추론: Distribution Focal Loss(DFL) 모듈을 전략적으로 제거한 YOLO26은 엣지 컴퓨팅과 저전력 디바이스에 특화되어 최적화되었으며, YOLO11과 같은 이전 세대보다 CPU에서 훨씬 빠르게 작동합니다.
- ProgLoss + STAL: 이러한 고급 손실 함수는 작은 객체 인식 성능을 크게 향상하여 항공 이미지와 로보틱스 애플리케이션에서 흔히 발생하는 문제를 해결합니다.
탁월한 범용성과 생태계#
순수한 성능을 넘어 Ultralytics Platform은 데이터 준비부터 프로덕션 배포까지 아우르는 종합적인 생태계를 제공합니다. 정적인 학술 리포지토리와 달리 Ultralytics 모델은 지속적으로 유지 관리되며, 직관적인 단일 API를 통해 여러 작업을 원활하게 지원합니다. 인스턴스 세그멘테이션을 수행하거나, 포즈 추정을 통해 포즈를 추적하거나, 방향성 바운딩 박스(OBB)를 사용하여 회전된 객체를 처리하는 경우에도 워크플로는 동일하게 유지됩니다.
또한 Ultralytics 모델은 학습과 추론 중 낮은 메모리 요구 사항으로 잘 알려져 있어, 연구자가 일반 소비자용 하드웨어에서 더 큰 배치 크기를 사용할 수 있습니다. 이는 트랜스포머 기반 아키텍처의 높은 리소스 사용량과 stark한 대조를 이룹니다.
학습 코드 예제#
Ultralytics 생태계의 강력함은 간결함을 통해 가장 잘 드러납니다. 최첨단 YOLO26 모델을 학습하는 데는 몇 줄의 코드만 필요하며, 데이터 로딩과 하이퍼파라미터 구성의 복잡성을 완전히 추상화합니다.
from ultralytics import YOLO
# Initialize the natively NMS-free YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the standard COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, batch=16)
# Validate the model's performance seamlessly
metrics = model.val()
print(f"Validation mAP: {metrics.box.map}")
# Export to ONNX or TensorRT for rapid deployment
model.export(format="engine", device=0)실제 애플리케이션 및 이상적인 사용 사례#
적합한 아키텍처의 선택은 전적으로 배포 제약 조건과 사용 가능한 하드웨어에 따라 달라집니다.
고품질 클라우드 처리#
애플리케이션이 고성능 서버 GPU에서 실행되고 최대 정확도를 우선시하는 경우, 예를 들어 복잡한 군중 장면을 분석하거나 고해상도 의료 이미지를 처리하는 경우에는 RTDETRv2의 강력한 어텐션 메커니즘이 매우 효과적일 수 있습니다.
레거시 엣지 배포#
최소한의 FLOPs가 필수적인 구형 모바일 휴대폰이나 리소스가 매우 제한된 마이크로컨트롤러에 배포하는 경우에는 단순한 CNN 아키텍처를 갖춘 초경량 YOLOX-Nano가 여전히 실행 가능한 대안으로 사용될 수 있습니다.
현대적 표준: AIoT 및 로보틱스#
스마트 시티 인프라, 리테일 분석, 자율 주행에 이르는 대부분의 최신 사용 사례에서 Ultralytics YOLO26이 확실한 선택입니다. CPU 추론이 43% 더 빠르므로 엣지 컴퓨팅에 비할 데 없이 적합하며, NMS 프리 설계는 낮고 일관된 지연 시간을 보장합니다. 여기에 Ultralytics 생태계의 종합적인 문서와 활발한 커뮤니티 지원이 더해져 팀은 그 어느 때보다 빠르게 데이터셋 어노테이션부터 글로벌 배포까지 진행할 수 있습니다.
컴퓨터 비전 프로젝트를 한 단계 발전시킬 준비가 되셨습니까? Ultralytics Platform의 종합적인 기능을 살펴보고 데이터를 손쉽게 관리하고, 클라우드에서 모델을 학습하며, 지능형 애플리케이션을 대규모로 배포해 보십시오.
Ultralytics 생태계의 다른 아키텍처를 살펴보고자 하는 개발자라면, 커뮤니티 통합이 폭넓게 이루어진 YOLOv8이나 레거시 파이프라인에서 탁월한 안정성을 제공하는 YOLOv5도 고려해 볼 수 있습니다. 그러나 2026년에 가능한 것의 한계를 확장하고자 한다면 YOLO26이 여전히 업계 표준입니다.