YOLOv10과 RTDETRv2#
컴퓨터 비전 분야는 빠르게 발전하고 있으며, 새로운 아키텍처가 실시간 객체 검출의 최첨단 기준을 끊임없이 새롭게 정의하고 있습니다. 이러한 발전 과정의 주요 이정표인 YOLOv10과 RTDETRv2는 모두 비최대 억제(NMS) 후처리를 제거하여 기존 검출 파이프라인의 근본적인 병목을 해결하고자 합니다. 그러나 두 모델은 서로 완전히 다른 아키텍처 패러다임으로 이 과제에 접근합니다.
이 기술 비교에서는 아키텍처, 학습 방법론, 이상적인 배포 시나리오를 심층적으로 분석하여 개발자와 연구자가 다음 비전 AI 프로젝트에 적합한 도구를 선택할 수 있도록 돕습니다.
YOLOv10: NMS 없는 설계의 선구자#
칭화대학교 연구진이 개발한 YOLOv10은 아키텍처 효율성과 후처리 병목 제거에 중점을 둡니다. NMS 없는 학습을 위해 일관된 이중 할당을 도입하여 추론 지연 시간을 크게 줄이면서 경쟁력 있는 성능을 달성합니다.
기술 사양#
- 저자: Ao Wang, Hui Chen, Lihao Liu 외
- 조직: 칭화대학교
- 날짜: 2024-05-23
- ArXiv: YOLOv10 논문
- GitHub: THU-MIG/yolov10
- 문서: YOLOv10 문서
아키텍처 및 방법론#
YOLOv10의 핵심 혁신은 효율성과 정확성을 모두 고려한 전체적인 모델 설계입니다. 다양한 구성 요소를 두 가지 관점에서 최적화하여 연산 오버헤드를 크게 줄입니다. 일관된 이중 할당 전략을 통해 모델은 NMS에 의존하지 않고 학습할 수 있으며, 그 결과 배포 파이프라인이 간소화되고 엔드투엔드 방식으로 구성됩니다. 후처리 연산으로 예기치 않은 지연 시간이 발생할 수 있는 ONNX 및 TensorRT와 같은 엣지 형식으로 모델을 내보낼 때 특히 유용합니다.
장점과 단점#
이 모델은 특히 소형 변형 모델(N 및 S)에서 뛰어난 속도와 정확도의 균형을 자랑합니다. 지연 시간이 매우 짧아 고속 엣지 환경에 이상적입니다. 그러나 YOLOv10은 순수 검출 속도에서는 뛰어나지만 여전히 검출 전용 모델입니다. 인스턴스 분할이나 포즈 추정이 필요한 팀은 더 다목적인 프레임워크를 살펴봐야 합니다.
RTDETRv2: 검출 트랜스포머의 개선#
기존 실시간 검출 트랜스포머를 기반으로 개발된 RTDETRv2는 기본 모델을 개선하기 위해 다양한 추가 기법을 적용하여, 트랜스포머가 실시간 시나리오에서 CNN과 경쟁할 수 있음을 보여줍니다.
기술 사양#
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 기관: Baidu
- 날짜: 2024-07-24
- ArXiv: RTDETRv2 논문
- GitHub: lyuwenyu/RT-DETR
- 문서: RTDETRv2 README
아키텍처 및 방법론#
RTDETRv2는 시각적 특징 추출을 위한 합성곱 신경망(CNN) 백본과 장면을 종합적으로 이해하기 위한 트랜스포머 인코더-디코더를 결합한 하이브리드 아키텍처를 사용합니다. 트랜스포머의 셀프 어텐션 메커니즘을 통해 모델은 이미지를 전역적으로 살펴볼 수 있으므로 복잡한 장면, 겹치는 객체, 밀집 군중을 효과적으로 처리합니다.
장점과 단점#
Transformer 아키텍처는 특히 파라미터 규모가 큰 모델에서 뛰어난 정확도를 제공하며, NMS 없이 최종 탐지 결과를 기본적으로 출력합니다. 그러나 여기에는 비용이 따릅니다. Transformer 모델은 일반적으로 학습 중 CUDA 메모리를 훨씬 더 많이 사용하며, 순수 CNN 아키텍처보다 수렴 속도가 느릴 수 있습니다. RTDETRv2는 추론 속도가 개선되었지만, 대체로 경량 YOLO 모델보다 메모리를 더 많이 사용합니다.
성능 비교#
성능 지표를 평가하면 각 모델이 어떤 부분에서 강점을 보이는지 더 명확하게 파악할 수 있습니다. 다음 표는 COCO 데이터셋에서의 성능을 보여 줍니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 38.5 | - | 1.84 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.3 | - | 2.49 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.1 | - | 4.74 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.5 | - | 5.74 | 19.1 | 92.0 |
| YOLOv10l | 640 | 53.2 | - | 7.28 | 24.4 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 10.70 | 29.5 | 160.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
데이터를 분석해 보면, YOLOv10은 비슷한 크기의 모델 전반에서 파라미터 효율성과 TensorRT 추론 속도 면에서 확실한 우위를 유지합니다. RTDETRv2-x는 정확도에서 YOLOv10x와 비슷하지만, 파라미터가 2.5배 넘게 필요하며(76M 대 29.5M) FLOPs도 훨씬 많습니다.
사용 사례 및 권장 사항#
YOLOv10과 RT-DETR 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.
YOLOv10을 선택해야 하는 경우#
YOLOv10은 다음과 같은 경우에 적합합니다:
- NMS가 필요 없는 실시간 탐지: 비최대 억제 없이 엔드 투 엔드 탐지를 활용하여 배포 복잡성을 줄일 수 있는 애플리케이션입니다.
- 속도와 정확도의 균형: 다양한 모델 규모에서 추론 속도와 탐지 정확도 간의 균형이 중요한 프로젝트입니다.
- 일관된 지연 시간이 필요한 애플리케이션: 로보틱스나 자율 시스템처럼 예측 가능한 추론 시간이 중요한 배포 시나리오입니다.
RT-DETR을 선택해야 하는 경우#
다음과 같은 경우 RT-DETR을 권장합니다.
- Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
- 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
- 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
Ultralytics의 강점: 생태계와 혁신#
YOLOv10과 RTDETRv2는 강력한 탐지 기능을 제공하지만, 모델 선택은 주변 소프트웨어 생태계에 따라 결정되는 경우가 많습니다. Ultralytics Platform은 딥러닝의 복잡성을 추상화한 통합 인터페이스를 원활하게 제공합니다.
새로운 표준: Ultralytics YOLO26#
최상의 성능을 원하는 개발자에게 Ultralytics YOLO26은 최근 아키텍처 발전의 정점입니다. 2026년 초에 출시된 YOLO26은 YOLOv10이 선보인 엔드투엔드 NMS 없는 설계를 선택적 헤드(nms=False)로 채택하여 NMS 후처리를 없애고, 더 빠르고 간편한 배포를 지원합니다.
YOLO26은 MuSGD Optimizer(SGD와 Muon의 하이브리드)를 통해 LLM 학습의 혁신을 컴퓨터 비전에 도입하여 학습 안정성을 높이고 수렴을 가속합니다. 또한 최대 43% 더 빠른 CPU 추론을 제공하므로 엣지 컴퓨팅에 최적의 선택입니다.
또한 YOLO26은 작은 객체 인식 성능을 크게 개선하는 ProgLoss + STAL을 도입했으며, 특수 목적 모델인 YOLOv10과 달리 매우 폭넓은 활용성을 제공합니다. 객체 탐지, 세그멘테이션, 포즈, 방향 경계 상자(OBB)를 기본 지원하며, 시맨틱 세그멘테이션 손실과 포즈용 Residual Log-Likelihood Estimation (RLE) 같은 작업별 개선 사항도 제공합니다. 아울러 Distribution Focal Loss (DFL)를 제거하여 내보내기를 간소화하고 저전력 장치와의 호환성을 높였습니다.
사용 편의성 및 학습 효율성#
Ultralytics YOLO11과 같은 이전 세대 모델을 실험하든 최첨단 YOLO26을 사용하든, 간결한 Python API를 통해 학습 중 메모리 사용량을 줄이고 매우 빠른 워크플로를 구현할 수 있습니다.
from ultralytics import RTDETR, YOLO
# 엔드투엔드 YOLOv10 모델 학습
model_yolo = YOLO("yolov10n.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# 또는 동일한 API에서 RTDETR 평가
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")잘 관리되는 생태계는 하이퍼파라미터 튜닝을 위한 도구를 제공하고, 다양한 추적 솔루션 및 모델 배포 옵션과 원활하게 통합됩니다.
결론#
YOLOv10과 RTDETRv2는 모두 NMS 없는 객체 탐지를 향한 중요한 이정표입니다. RTDETRv2는 Transformer가 더 높은 메모리 요구량에도 불구하고 뛰어난 전역 맥락 이해를 바탕으로 실시간 지연 시간을 달성할 수 있음을 보여 줍니다. YOLOv10은 리소스 제약이 있는 탐지 작업에 맞춰 설계된 고효율·고속 CNN 대안을 제공합니다.
그러나 균형 잡힌 성능과 멀티태스크 활용성, 가장 성숙한 생태계를 원한다면 개발자는 Ultralytics YOLO26을 적극적으로 활용하는 것이 좋습니다. YOLO26은 이전 모델의 아키텍처 혁신과 배포를 원활하게 해 주는 강력하고 사용하기 쉬운 도구를 훌륭하게 결합합니다.