YOLO26과 RTDETRv2#
컴퓨터 비전 분야는 끊임없이 발전하고 있으며, 실무자는 최적화된 합성곱 신경망(CNN)을 활용할지 아니면 새로운 Transformer 기반 아키텍처를 도입할지 중요한 선택을 해야 합니다. 이 분야의 주요 경쟁 모델로는 최첨단 Ultralytics YOLO26과 Baidu의 RTDETRv2가 있습니다. 두 모델 모두 실시간 객체 탐지의 한계를 넓히고 있지만, 아키텍처 설계 철학은 근본적으로 다릅니다.
이 가이드에서는 두 모델의 구조와 성능 지표, 이상적인 사용 사례를 심층적으로 살펴보고 비교하여 다음 컴퓨터 비전 프로젝트에 적합한 기반을 선택할 수 있도록 돕습니다.
Ultralytics YOLO26: 엣지 우선 비전 AI의 정점#
Ultralytics가 개발한 YOLO26은 YOLO 제품군의 세대를 뛰어넘는 대대적인 도약을 나타냅니다. 2026년 1월에 출시된 이 모델은 클라우드와 엣지 환경 전반에서 속도와 정확성, 원활한 배포를 제공하도록 특별히 설계되었습니다.
- 저자: Glenn Jocher 및 Jing Qiu
- 조직: Ultralytics
- 날짜: 2026-01-14
- GitHub: Ultralytics 저장소
- 문서: YOLO26 공식 문서
아키텍처 혁신 및 강점#
YOLO26은 Transformer 모델뿐 아니라 YOLO11과 같은 이전 버전과도 차별화되는 여러 획기적인 기능을 도입합니다.
- 엔드투엔드 NMS-free 설계: YOLO26의 선택적 일대일 헤드(
nms=False)는 후처리 과정에서 기존 비최대 억제(NMS)를 제거합니다. YOLOv10과 같은 모델에서 처음 선보인 이 엔드투엔드 방식은 추론 지연 시간의 변동을 줄이고, 특히 엣지 하드웨어에서 배포 로직을 간소화합니다. - 최대 43% 빠른 CPU 추론: 분산형 AI에 대한 수요 증가를 고려해 YOLO26은 Raspberry Pi처럼 전용 GPU가 없는 디바이스에 맞게 고도로 최적화되어 있습니다.
- DFL 제거: Distribution Focal Loss(DFL)를 제거하여 YOLO26은 내보내기 과정을 간소화하고 저전력 엣지 디바이스 및 마이크로컨트롤러와의 호환성을 크게 높입니다.
- MuSGD 옵티마이저: 대규모 언어 모델(LLM) 학습과 컴퓨터 비전 사이의 간극을 좁히기 위해 YOLO26은 MuSGD 옵티마이저를 사용합니다. Moonshot AI의 Kimi K2에서 영감을 얻은 SGD와 Muon의 하이브리드인 이 옵티마이저는 안정적인 학습과 빠른 수렴을 보장합니다.
- ProgLoss + STAL: 고급 손실 함수는 소형 객체 인식 성능을 크게 향상합니다. 이는 항공 이미지 분석과 사물 인터넷(IoT) 센서를 활용하는 산업에 매우 중요합니다.
다양한 비전 작업에 적용#
바운딩 박스만 처리하는 모델과 달리 YOLO26은 다양한 작업을 지원합니다. 시맨틱 세그멘테이션 손실과 인스턴스 세그멘테이션을 위한 다중 스케일 프로토타입, 자세 추정을 위한 잔차 로그 가능도 추정(RLE), 회전 바운딩 박스(OBB) 작업의 경계 문제를 해결하는 특수 각도 손실 등 태스크별 개선 사항을 포함합니다.
RTDETRv2: 실시간 탐지 Transformer의 성능 향상#
Baidu 연구진이 개발한 RTDETRv2는 기존 RT-DETR 프레임워크를 기반으로 합니다. 이 모델은 탐지 Transformer(DETR)가 실시간 환경에서 고도로 최적화된 CNN과 경쟁하거나 때로는 속도와 정확성 면에서 이를 능가할 수 있음을 입증하는 것을 목표로 합니다.
- 저자: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- 기관: Baidu
- 날짜: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RTDETRv2 PyTorch 구현
- 문서: RTDETRv2 README
아키텍처 및 기능#
RTDETRv2는 Transformer 기반 아키텍처를 사용합니다. 이 아키텍처는 셀프 어텐션 메커니즘을 활용해 전역 문맥을 파악하므로 CNN과는 다른 방식으로 이미지를 처리합니다.
- Bag-of-Freebies: v2 버전은 추론 비용을 추가하지 않으면서 기준 성능을 향상하는 일련의 최적화된 학습 기법(bag-of-freebies)을 도입합니다.
- 전역 문맥 인식: Transformer 어텐션 계층을 사용하는 RTDETRv2는 전역 문맥을 통해 겹치거나 가려진 객체를 구분해야 하는 복잡한 장면을 이해하는 데 특히 적합합니다.
Transformer 모델의 한계#
RTDETRv2와 같은 Transformer 기반 탐지 모델은 강력하지만 실제 배포 과정에서 어려움을 겪는 경우가 많습니다. 일반적으로 효율적인 CNN보다 학습 시 더 많은 CUDA 메모리가 필요합니다. 또한 어텐션 계층에 필요한 복잡한 연산으로 인해 다양한 엣지 환경에 통합하기가 까다로울 수 있으므로, 리소스가 제한된 환경에서는 YOLO26과 같은 모델이 훨씬 더 적합합니다.
성능 비교#
모델을 직접 비교하면 최신 CNN 최적화의 실질적인 이점을 확인할 수 있습니다. 아래 표는 표준 벤치마크에서의 성능을 보여줍니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
결과에서 확인할 수 있듯이 YOLO26은 모든 크기 변형에서 RTDETRv2보다 일관되게 뛰어난 성능을 보입니다. YOLO26x는 RTDETRv2-x(54.3 mAP, 15.03 ms, 파라미터 76M)보다 낮은 지연 시간(TensorRT에서 11.8 ms)과 훨씬 적은 파라미터(55.7M)로 57.5 mAP라는 놀라운 성능을 달성합니다.
사용 사례 및 권장 사항#
YOLO26과 RT-DETR 중 무엇을 선택할지는 프로젝트의 구체적인 요구 사항과 배포 제약, 선호하는 생태계에 따라 달라집니다.
YOLO26을 선택해야 하는 경우#
YOLO26은 다음과 같은 경우에 적합합니다:
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
RT-DETR을 선택해야 하는 경우#
다음과 같은 경우 RT-DETR을 권장합니다.
- Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
- 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
- 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.
Ultralytics의 강점#
적합한 머신러닝 아키텍처를 선택하는 것은 전체 과정의 일부일 뿐입니다. 주변 생태계에 따라 팀이 프로토타이핑에서 프로덕션으로 얼마나 빠르게 전환할 수 있는지가 결정됩니다.
사용 편의성 및 학습 효율성#
Ultralytics Python API는 매우 간소화된 사용 경험을 제공합니다. 복잡한 모델을 학습할 때 더는 장황한 상용구 코드를 작성할 필요가 없습니다. 또한 YOLO26은 학습 효율성이 훨씬 뛰어나 RTDETRv2의 메모리 집약적인 어텐션 메커니즘보다 훨씬 적은 GPU VRAM을 사용하므로 일반 소비자용 하드웨어에서도 더 큰 배치 크기를 사용할 수 있습니다.
from ultralytics import YOLO
# 최첨단 YOLO26 Nano 모델 초기화
model = YOLO("yolo26n.pt")
# COCO8 데이터셋으로 100 에포크 학습
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 고속 NMS-free 추론 실행
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# 원활한 배포를 위해 ONNX로 내보내기
model.export(format="onnx")잘 관리되는 생태계#
Ultralytics 모델을 사용하면 개발자는 Weights & Biases, Comet ML과 같은 최신 트래킹 도구와 기본적으로 통합되는 프레임워크를 활용할 수 있습니다. 노코드 방식을 선호하는 사용자는 Ultralytics Platform에서 클라우드 학습과 데이터셋 관리, 원클릭 배포를 진행할 수 있습니다.
성능 균형#
YOLO26은 추론 속도와 정확성 사이에서 탁월한 균형을 이룹니다. 선택적으로 NMS를 제거하고 MuSGD 옵티마이저를 함께 사용하면 소형 객체에 대해서도 높은 정확성을 유지하면서(ProgLoss + STAL 덕분) 프로덕션에서 매우 빠르게 동작하는 모델을 배포할 수 있습니다. 따라서 대부분의 최신 컴퓨터 비전 애플리케이션에 더 나은 선택입니다.
생태계의 다른 모델#
YOLO26과 RTDETRv2가 실시간 탐지 분야의 최첨단 기술을 제공하지만, 레거시 파이프라인을 유지 관리하거나 다양한 효율성 특성을 살펴보는 개발자는 이미 구축된 엔터프라이즈 환경을 위해 YOLOv8을 고려하거나 EfficientDet과 같은 다른 아키텍처를 살펴볼 수도 있습니다. 그러나 새로운 프로젝트에는 YOLO26을 최우선으로 권장합니다.