YOLOv10 vs RTDETRv2#
컴퓨터 비전의 발전 속도는 매우 빠르며, 새로운 아키텍처가 실시간 객체 검출의 최신 기술을 끊임없이 재정의하고 있습니다. 이러한 발전의 중요한 이정표로 YOLOv10과 RTDETRv2를 들 수 있습니다. 두 모델 모두 비최대 억제(NMS) 후처리를 제거하여 기존 검출 파이프라인의 근본적인 병목을 해결하고자 하지만, 이 문제에 접근하는 아키텍처 패러다임은 완전히 다릅니다.
이 기술 비교에서는 두 모델의 아키텍처, 학습 방법론 및 이상적인 배포 시나리오를 심층적으로 분석하여 개발자와 연구자가 다음 비전 AI 프로젝트에 적합한 도구를 선택할 수 있도록 지원합니다.
YOLOv10: NMS-Free 선구자#
칭화대학교 연구진이 개발한 YOLOv10은 아키텍처 효율성과 후처리 병목 제거에 중점을 둡니다. NMS-Free 학습을 위한 일관된 이중 할당을 도입하여 경쟁력 있는 성능을 유지하면서 추론 지연 시간을 크게 줄였습니다.
기술 사양#
- 저자: Ao Wang, Hui Chen, Lihao Liu 외
- 기관: 칭화대학교
- 날짜: 2024-05-23
- ArXiv: YOLOv10 논문
- GitHub: THU-MIG/yolov10
- 문서: YOLOv10 문서
아키텍처 및 방법론#
YOLOv10의 주요 혁신은 효율성과 정확도를 종합적으로 고려한 모델 설계입니다. 다양한 구성 요소를 두 관점에서 최적화하여 계산 오버헤드를 크게 줄였습니다. 일관된 이중 할당 전략을 통해 모델은 NMS에 의존하지 않고 학습할 수 있으며, 이는 간소화된 엔드투엔드 배포 파이프라인으로 이어집니다. 이는 ONNX 또는 TensorRT와 같은 엣지 형식으로 모델을 내보낼 때 특히 유용합니다. 이러한 환경에서는 후처리 작업이 예기치 않은 지연 시간을 유발할 수 있기 때문입니다.
강점과 약점#
이 모델은 특히 소형 변형 모델(N 및 S)에서 뛰어난 속도와 정확도의 균형을 자랑합니다. 짧은 지연 시간 덕분에 고속 엣지 환경에 적합합니다. 그러나 YOLOv10은 순수 검출 속도에서는 뛰어나지만, 여전히 특화된 검출 전용 모델입니다. 인스턴스 세그멘테이션 또는 포즈 추정이 필요한 팀은 더 다목적인 프레임워크를 고려해야 합니다.
RTDETRv2: 검출 Transformer 개선#
기존 실시간 검출 Transformer를 기반으로 구축된 RTDETRv2는 기준 모델을 개선하기 위해 "무료 기법 묶음"을 도입하여, Transformer가 실시간 시나리오에서 CNN과 경쟁할 수 있음을 보여줍니다.
기술 사양#
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 조직: Baidu
- 날짜: 2024-07-24
- ArXiv: RTDETRv2 논문
- GitHub: lyuwenyu/RT-DETR
- Docs: RTDETRv2 Documentation
아키텍처 및 방법론#
RTDETRv2는 시각적 특징 추출을 위한 합성곱 신경망(CNN) 백본과 포괄적인 장면 이해를 위한 Transformer 인코더-디코더를 결합한 하이브리드 아키텍처를 사용합니다. Transformer의 셀프 어텐션 메커니즘을 통해 모델은 이미지를 전역적으로 파악할 수 있으므로 복잡한 장면, 겹치는 객체 및 밀집된 군중을 처리하는 데 매우 효과적입니다.
강점과 약점#
Transformer 아키텍처는 특히 더 큰 파라미터 규모에서 뛰어난 정확도를 제공하며, NMS 없이 최종 검출 결과를 기본적으로 출력합니다. 그러나 여기에는 대가가 따릅니다. Transformer 모델은 일반적으로 학습 중 훨씬 더 많은 CUDA 메모리를 필요로 하며, 순수 CNN 아키텍처에 비해 수렴 속도가 느릴 수 있습니다. RTDETRv2는 추론 속도를 개선했지만, 일반적으로 경량 YOLO 변형 모델보다 더 많은 메모리를 사용합니다.
성능 비교#
성능 지표를 평가하면 각 모델이 어떤 부분에서 뛰어난지 더 명확하게 파악할 수 있습니다. 다음 표는 COCO 데이터셋에서의 성능을 보여줍니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
데이터를 분석하면 YOLOv10은 비슷한 크기에서 파라미터 효율성과 TensorRT 추론 속도 측면에서 확실한 우위를 유지합니다. RTDETRv2-x는 정확도에서 대형 YOLOv10x와 동등하지만, 파라미터가 거의 2,000만 개 더 필요하고 FLOPs도 훨씬 높습니다.
사용 사례 및 권장 사항#
YOLOv10과 RT-DETR 중 무엇을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.
YOLOv10을 선택해야 하는 경우#
YOLOv10은 다음과 같은 경우에 적합합니다:
- NMS-Free 실시간 탐지: 비최대 억제 없이 엔드투엔드 탐지의 이점을 활용하여 배포 복잡성을 줄이는 애플리케이션입니다.
- 균형 잡힌 속도-정확도 절충: 다양한 모델 규모에서 추론 속도와 탐지 정확도 사이의 뛰어난 균형이 필요한 프로젝트입니다.
- 일관된 지연 시간이 필요한 애플리케이션: 로보틱스 또는 자율 시스템과 같이 예측 가능한 추론 시간이 중요한 배포 시나리오입니다.
RT-DETR을 선택해야 하는 경우#
다음과 같은 경우 RT-DETR을 권장합니다.
- Transformer 기반 감지 연구: NMS 없이 엔드 투 엔드 객체 감지를 수행하기 위해 attention mechanism과 Transformer 아키텍처를 탐구하는 프로젝트입니다.
- 유연한 latency를 요구하는 고정확도 시나리오: 감지 정확도가 최우선이며 약간 더 높은 추론 latency를 허용할 수 있는 애플리케이션입니다.
- 대형 객체 감지: 주로 medium-to-large 객체가 있는 장면으로, Transformer의 global attention mechanism이 자연스러운 이점을 제공하는 경우입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.
- NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
- 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.
Ultralytics의 이점: 생태계와 혁신#
YOLOv10과 RTDETRv2는 강력한 검출 기능을 제공하지만, 모델 선택은 주변 소프트웨어 생태계에 관한 문제인 경우가 많습니다. Ultralytics Platform은 딥러닝의 복잡성을 추상화한 원활하고 통합된 인터페이스를 제공합니다.
새로운 표준: Ultralytics YOLO26#
최고의 성능을 추구하는 개발자에게 Ultralytics YOLO26은 최근 아키텍처 발전의 집약체입니다. 2026년 초에 출시된 YOLO26은 YOLOv10이 개척한 엔드투엔드 NMS-Free 설계를 계승하여 NMS 후처리를 완전히 제거하고 더 빠르고 간단한 배포를 지원합니다.
YOLO26은 MuSGD Optimizer(SGD와 Muon의 하이브리드)를 통해 LLM 학습의 혁신을 컴퓨터 비전에 도입하여 더 안정적인 학습과 빠른 수렴을 실현합니다. 또한 CPU 추론 속도가 최대 43% 향상되어 엣지 컴퓨팅을 위한 최적의 선택입니다.
또한 YOLO26은 작은 객체 인식 성능을 크게 향상시키는 ProgLoss + STAL을 도입했으며, 특화된 YOLOv10과 달리 탁월한 범용성을 제공합니다. 객체 검출, 세그멘테이션, 포즈 및 방향성 바운딩 박스(OBB)를 기본적으로 지원하며, 시맨틱 세그멘테이션 손실 및 포즈를 위한 잔차 로그 우도 추정(RLE)과 같은 작업별 개선 사항을 제공합니다. 또한 Distribution Focal Loss(DFL)를 제거하여 내보내기를 간소화하고 저전력 디바이스 호환성을 향상시켰습니다.
사용 편의성 및 학습 효율성#
Ultralytics YOLO11과 같은 구세대 모델을 실험하든 최첨단 YOLO26을 사용하든, 간소화된 Python API는 학습 중 메모리 사용량을 줄이고 워크플로를 매우 빠르게 만들어 줍니다.
from ultralytics import RTDETR, YOLO
# Train the end-to-end YOLOv10 model
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Alternatively, evaluate RTDETR within the same API
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")잘 관리되는 생태계는 간편한 하이퍼파라미터 튜닝을 위한 도구를 제공하며, 광범위한 트래킹 솔루션 및 모델 배포 옵션과 원활하게 통합됩니다.
결론#
YOLOv10과 RTDETRv2는 모두 NMS-Free 객체 검출을 향한 여정에서 중요한 이정표입니다. RTDETRv2는 더 높은 메모리 요구 사항을 감수하는 대신 Transformer가 뛰어난 전역 문맥 이해 능력으로 실시간 지연 시간을 달성할 수 있음을 입증합니다. YOLOv10은 리소스가 제한된 검출 작업에 맞춰 설계된 매우 효율적이고 빠른 CNN 대안을 제공합니다.
그러나 균형 잡힌 성능, 멀티태스크 범용성 및 가장 성숙한 생태계를 원한다면 개발자는 Ultralytics YOLO26을 적극 활용하는 것이 좋습니다. YOLO26은 이전 모델의 아키텍처 혁신과 비전 AI 배포를 원활하게 구현하는 강력하고 사용자 친화적인 도구를 훌륭하게 결합합니다.