Ultralytics YOLO27:

YOLO26 vs RTDETRv2#

컴퓨터 비전 분야는 끊임없이 발전하며, 실무자에게 중요한 선택을 제시합니다. 고도로 최적화된 합성곱 신경망(CNNs)을 활용해야 할까요, 아니면 더 새로운 Transformer 기반 아키텍처를 도입해야 할까요? 이 분야의 대표적인 두 경쟁 모델은 최첨단 Ultralytics YOLO26과 Baidu의 RTDETRv2입니다. 두 모델 모두 실시간 객체 감지의 한계를 확장하지만, 근본적으로 서로 다른 아키텍처 철학을 기반으로 합니다.

이 가이드에서는 두 모델의 구조, 성능 지표 및 이상적인 사용 사례를 심층적으로 기술 분석하여, 다음 컴퓨터 비전 프로젝트에 가장 적합한 기반을 선택할 수 있도록 지원합니다.

Ultralytics YOLO26: 엣지 우선 비전 AI의 정점#

Ultralytics가 개발한 YOLO26은 YOLO 제품군의 세대적 도약을 나타냅니다. 2026년 1월에 출시된 이 모델은 클라우드 및 엣지 환경 전반에서 속도, 정확도 및 원활한 배포를 제공하도록 명시적으로 설계되었습니다.

아키텍처 혁신 및 강점#

YOLO26은 Transformer 모델뿐만 아니라 YOLO11과 같은 이전 버전과도 차별화되는 여러 혁신적인 기능을 도입합니다.

  • 엔드 투 엔드 NMS 없는 설계: YOLO26은 후처리 과정에서 기존의 비최대 억제(NMS)를 제거합니다. YOLOv10과 같은 모델에서 선도적으로 도입된 이 네이티브 엔드 투 엔드 접근 방식은 추론 지연 시간의 변동을 줄이고, 특히 엣지 하드웨어에서의 배포 로직을 간소화합니다.
  • 최대 43% 더 빠른 CPU 추론: 분산형 AI에 대한 수요 증가를 반영하여 YOLO26은 Raspberry Pi와 같이 전용 GPU가 없는 디바이스에 맞게 고도로 최적화되었습니다.
  • DFL 제거: 분포 초점 손실(DFL)을 제거함으로써 YOLO26은 더욱 간소화된 export 프로세스와 저전력 엣지 디바이스 및 마이크로컨트롤러와의 훨씬 향상된 호환성을 제공합니다.
  • MuSGD Optimizer: 대규모 언어 모델(LLM) 학습과 컴퓨터 비전 사이의 간극을 해소하기 위해 YOLO26은 MuSGD optimizer를 활용합니다. Moonshot AI의 Kimi K2에서 영감을 받은 SGD와 Muon의 하이브리드인 이 optimizer는 견고한 학습 안정성과 빠른 수렴을 보장합니다.
  • ProgLoss + STAL: 고급 loss function은 small-object 인식 성능을 크게 향상합니다. 이는 aerial imagery analysis와 사물 인터넷(IoT) 센서에 의존하는 산업에서 매우 중요합니다.

비전 작업 전반의 범용성#

경계 상자에만 엄격히 제한된 모델과 달리 YOLO26은 다목적 성능을 제공합니다. instance segmentation을 위한 semantic segmentation loss 및 multi-scale proto, pose estimation을 위한 잔차 로그 가능도 추정(RLE), Oriented Bounding Box (OBB) task의 경계 문제를 해결하기 위한 특수 angle loss 등 task별 개선 사항을 포함합니다.

엣지 배포 전략

엣지 디바이스에 배포할 때는 YOLO26n (Nano) 또는 YOLO26s (Small) variant를 사용합니다. DFL 제거 및 NMS 없는 아키텍처 덕분에 이러한 모델을 CoreML 또는 TFLite로 export하는 과정이 원활하며, iOS 및 Android에서 매끄러운 실시간 성능을 보장합니다.

RTDETRv2: 실시간 감지 Transformer 향상#

Baidu의 연구자들이 개발한 RTDETRv2는 기존 RT-DETR framework를 기반으로 합니다. Detection Transformer(DETRs)가 실시간 시나리오에서 고도로 최적화된 CNNs의 속도와 정확도에 경쟁할 수 있으며 때로는 이를 능가할 수 있음을 입증하는 것을 목표로 합니다.

아키텍처 및 기능#

RTDETRv2는 Transformer 기반 아키텍처를 사용합니다. 이 아키텍처는 self-attention mechanism을 활용하여 전역 context를 이해하므로 CNNs와 본질적으로 다른 방식으로 이미지를 처리합니다.

  • Bag-of-Freebies: v2 버전은 추론 비용을 추가하지 않고 baseline 성능을 향상하는 일련의 최적화된 학습 기법(bag-of-freebies)을 도입합니다.
  • 전역 context 인식: Transformer attention layer 덕분에 RTDETRv2는 전역 context가 겹치거나 가려진 객체를 구분하는 데 필요한 복잡한 장면을 자연스럽게 이해하는 데 능숙합니다.

RT-DETR에 대해 자세히 알아보세요

Transformer 모델의 한계#

강력하지만 RTDETRv2와 같은 Transformer 기반 감지 모델은 실제 배포에서 어려움에 직면하는 경우가 많습니다. 일반적으로 효율적인 CNNs에 비해 학습 중 더 많은 CUDA memory가 필요합니다. 또한 attention layer에 필요한 복잡한 연산으로 인해 다양한 엣지 환경에 통합하기가 번거로울 수 있으므로, YOLO26과 같은 모델이 resource-constrained deployment에 훨씬 더 매력적입니다.

성능 비교#

이러한 모델을 직접 비교하면 최신 CNN 최적화의 실질적인 이점이 드러납니다. 아래 표에는 standard benchmark에서의 성능이 정리되어 있습니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

결과에서 확인할 수 있듯이 YOLO26은 모든 size variant에서 RTDETRv2를 일관되게 능가합니다. YOLO26x는 RTDETRv2-x(54.3 mAP, 15.03 ms, 76M parameters)보다 낮은 latency(TensorRT에서 11.8 ms)와 훨씬 적은 parameters(55.7M)로 놀라운 57.5 mAP를 달성합니다.

사용 사례 및 권장 사항#

YOLO26과 RT-DETR 중 무엇을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 ecosystem 선호도에 따라 달라집니다.

YOLO26을 선택해야 하는 경우#

YOLO26은 다음과 같은 경우에 적합합니다:

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

RT-DETR을 선택해야 하는 경우#

다음과 같은 경우 RT-DETR을 권장합니다.

  • Transformer 기반 감지 연구: NMS 없이 엔드 투 엔드 객체 감지를 수행하기 위해 attention mechanism과 Transformer 아키텍처를 탐구하는 프로젝트입니다.
  • 유연한 latency를 요구하는 고정확도 시나리오: 감지 정확도가 최우선이며 약간 더 높은 추론 latency를 허용할 수 있는 애플리케이션입니다.
  • 대형 객체 감지: 주로 medium-to-large 객체가 있는 장면으로, Transformer의 global attention mechanism이 자연스러운 이점을 제공하는 경우입니다.

Ultralytics의 강점#

적합한 machine learning architecture를 선택하는 것은 전체 방정식의 일부일 뿐이며, 주변 ecosystem에 따라 팀이 prototyping에서 production으로 얼마나 빠르게 전환할 수 있는지가 결정됩니다.

사용 편의성 및 학습 효율성#

Ultralytics Python API는 매우 간소화된 경험을 제공합니다. 더 이상 복잡한 모델을 학습하기 위해 장황한 boilerplate code가 필요하지 않습니다. 또한 YOLO26의 학습 효율성은 훨씬 뛰어나며, RTDETRv2의 memory-intensive attention mechanism보다 훨씬 적은 GPU VRAM을 사용하므로 consumer-grade hardware에서도 더 큰 batch size를 사용할 수 있습니다.

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

잘 유지 관리되는 ecosystem#

Ultralytics 모델을 활용하면 개발자는 Weights & BiasesComet ML과 같은 최신 tracking tool과 native로 통합되는 actively maintained framework에 액세스할 수 있습니다. no-code 방식을 선호하는 사용자를 위해 Ultralytics Platform은 cloud training, dataset management 및 one-click deployment를 지원합니다.

성능 균형#

YOLO26은 inference speed와 accuracy 사이에서 unparalleled balance를 제공합니다. NMS 제거와 MuSGD optimizer의 결합으로, ProgLoss + STAL 덕분에 small object에서 높은 정확도를 유지하면서 production 환경에서는 매우 빠르게 동작하는 모델을 배포할 수 있으므로, 대부분의 최신 computer vision applications에 더 적합한 선택입니다.

Ecosystem의 기타 모델#

YOLO26과 RTDETRv2가 실시간 감지의 최첨단을 담당하는 가운데, legacy pipeline을 유지 관리하거나 다른 efficiency curve를 탐색하는 개발자는 기존 enterprise environment에 YOLOv8을 고려하거나 EfficientDet과 같은 다른 architecture를 탐색할 수도 있습니다. 그러나 새로운 initiative라면 YOLO26을 확실히 권장합니다.

댓글