Ultralytics YOLO27:
Get Started

RTDETRv2와 YOLOv6-3.0 비교#

컴퓨터 비전 분야는 끊임없이 발전하고 있으며, 개발자는 객체 탐지를 위한 다양한 아키텍처 중에서 선택할 수 있습니다. 서로 다른 접근법을 대표하는 두 가지 주요 모델로는 최첨단 비전 Transformer인 RTDETRv2와 산업 애플리케이션에 맞춰 고도로 최적화된 합성곱 신경망(CNN)인 YOLOv6-3.0이 있습니다.

이 종합적인 기술 비교에서는 두 모델의 아키텍처, 성능 지표, 이상적인 배포 시나리오를 살펴봅니다. 또한 더 나은 개발자 경험을 제공하는 폭넓은 Ultralytics 생태계를 검토하고, 차세대 기능을 갖춘 Ultralytics YOLO26도 살펴봅니다.

RTDETRv2: 비전 Transformer 접근법#

Baidu의 연구진이 개발한 RTDETRv2는 기존 RT-DETR의 기반을 발전시켜, Transformer 기반 객체 감지 분야에서 큰 도약을 이루었습니다.

아키텍처 주요 특징#

RTDETRv2는 CNN 특징 추출기와 강력한 Transformer 디코더를 결합한 하이브리드 아키텍처를 사용합니다. 이 모델의 가장 뚜렷한 특징은 기본적으로 NMS가 필요 없는 설계입니다. 후처리 과정에서 비최대 억제(NMS)를 제거하여 모델이 바운딩 박스를 직접 예측하므로, 배포가 간소화되고 추론 지연 시간이 안정적으로 유지됩니다.

RTDETRv2에 적용된 "Bag-of-Freebies"는 복잡한 장면과 겹치는 객체를 처리하는 능력을 향상합니다. 전역 어텐션 메커니즘은 국소 합성곱보다 공간적 관계를 더 잘 파악하기 때문입니다.

Transformer의 메모리 사용량

Transformer는 복잡한 장면을 이해하는 데 뛰어나지만, 학습 중 일반적으로 CNN보다 훨씬 더 많은 CUDA 메모리를 사용합니다. 이로 인해 일반 소비자용 GPU에서 배치 크기가 제한되고 전체 학습 시간이 늘어날 수 있습니다.

RTDETRv2 자세히 알아보기

YOLOv6-3.0: 산업 처리량 극대화#

Meituan의 Vision AI Department에서 개발한 YOLOv6-3.0은 GPU 처리량이 핵심인 산업 파이프라인을 위한 차세대 감지기로 명시적으로 설계되었습니다.

  • 저자: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, Xiangxiang Chu
  • 조직: Meituan
  • 날짜: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

아키텍처 중점 사항#

YOLOv6-3.0은 NVIDIA GPU와 같은 하드웨어 가속기에서 메모리 액세스 비용을 최소화하도록 세심하게 설계된 EfficientRep 백본을 사용합니다. 넥 아키텍처에는 다양한 스케일의 특징 융합을 개선하는 양방향 연결(BiC) 모듈이 포함되어 있습니다.

학습 중에는 앵커 기반 패러다임의 이점을 활용하면서도 빠른 실행을 위해 추론 시 앵커가 필요 없는 모드를 유지하는 앵커 지원 학습(AAT) 전략을 사용합니다. 서버급 GPU(예: T4, A100)에서는 탁월한 처리량을 달성하지만, 특수한 아키텍처로 인해 CPU만 사용하는 엣지 장치에 배포하면 지연 시간이 최적 수준에 미치지 못할 수 있습니다.

YOLOv6에 대해 자세히 알아보기

성능 비교#

프로덕션용 모델을 평가할 때는 정확도(mAP)와 추론 속도 및 계산 비용(FLOPs)의 균형을 맞추는 것이 중요합니다. 아래 표는 각 모델의 성능을 비교합니다.

모델크기
(픽셀)
mAP검증
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

TensorRT에서 YOLOv6-3.0은 순수 처리 속도에서 앞서는 반면, RTDETRv2는 더 높은 mAP 점수를 기록하며 특히 대형 모델 변형에서 더 우수한 확장성을 보입니다. 그러나 두 모델 모두 최신 통합 프레임워크의 폭넓은 다기능성을 갖추지 못했습니다. YOLOv6-3.0은 주로 객체 감지에 특화되어 있으며, 기본적으로 인스턴스 분할 및 포즈 추정과 같은 작업을 지원하지 않습니다.

사용 사례 및 권장 사항#

RT-DETR과 YOLOv6 중 어떤 모델을 선택할지는 프로젝트의 구체적인 요구 사항, 배포 제약 조건, 선호하는 생태계에 따라 달라집니다.

RT-DETR을 선택해야 하는 경우#

RT-DETR은 다음과 같은 경우에 적합합니다:

  • Transformer 기반 탐지 연구: NMS를 사용하지 않는 엔드투엔드 객체 탐지를 위해 어텐션 메커니즘과 Transformer 아키텍처를 연구하는 프로젝트입니다.
  • 지연 시간 제약이 유연한 고정확도 시나리오: 탐지 정확성이 최우선이며 추론 지연 시간이 약간 높아도 괜찮은 애플리케이션입니다.
  • 대형 객체 탐지: 주로 중대형 객체가 있는 장면으로, Transformer의 전역 어텐션 메커니즘이 자연스러운 이점을 제공하는 경우입니다.

YOLOv6을 선택할 경우#

다음과 같은 경우 YOLOv6을 권장합니다.

  • 산업용 하드웨어 고려 배포: 모델의 하드웨어 고려 설계와 효율적인 재매개변수화가 특정 대상 하드웨어에서 최적화된 성능을 제공하는 시나리오입니다.
  • 빠른 단일 단계 검출: 통제된 환경에서 실시간 비디오 처리를 위해 GPU에서의 순수 추론 속도를 우선시하는 애플리케이션입니다.
  • Meituan 생태계 통합: 이미 Meituan의 기술 스택 및 배포 인프라를 사용하는 팀입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.

  • NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
  • 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.

Ultralytics의 강점#

적합한 모델을 선택할 때는 벤치마크 수치뿐만 아니라 개발자 경험, 배포 유연성, 생태계 지원도 중요합니다. Ultralytics 플랫폼에 통합된 모델을 사용하면 정적인 연구 저장소에서는 얻기 어려운 상당한 이점을 얻을 수 있습니다.

  • 사용 편의성: ultralytics Python 패키지는 원활한 API를 제공합니다. 몇 줄의 코드만으로 모델 학습, 검증, 내보내기를 수행할 수 있습니다.
  • 잘 관리되는 생태계: 독립적인 학술 저장소와 달리 Ultralytics Platform은 활발히 업데이트됩니다. ONNX, OpenVINO, CoreML과 같은 도구와 견고하게 통합됩니다.
  • 학습 효율성: Ultralytics 모델은 일반적으로 RTDETRv2와 같은 Transformer 아키텍처보다 학습 중 VRAM을 훨씬 적게 사용하므로, 소비자용 하드웨어에서도 더 큰 배치 크기를 사용할 수 있습니다.
  • 다기능성: YOLOv6-3.0의 제한적인 범위와 달리 Ultralytics 모델은 멀티태스크 모델이며, 통합 프레임워크 하나에서 분할, 이미지 분류, 방향성 바운딩 박스(OBB)를 기본 지원합니다.
간소화된 배포

Ultralytics CLI를 사용하면 다음 명령을 실행하는 것만으로 학습된 모델을 엣지 배포용으로 간편하게 내보낼 수 있습니다: yolo export model=yolo11n.pt format=tensorrt.

YOLO26 소개: 최고의 솔루션#

RTDETRv2와 YOLOv6-3.0은 각각 장점이 있지만, 이 분야는 빠르게 발전하고 있습니다. 새로운 컴퓨터 비전 프로젝트를 시작하는 팀에는 Ultralytics가 2026년 1월에 출시한 YOLO26을 적극 권장합니다.

YOLO26은 산업용 CNN과 최신 Transformer의 강점을 결합하면서 각 기술의 약점을 해소합니다:

  • 종단 간 NMS 제거 설계: YOLOv10에서 처음 선보인 혁신을 적용한 YOLO26은 선택적으로 사용할 수 있는 NMS 제거 헤드(nms=False)를 제공하여 NMS 후처리를 없앱니다. 따라서 RTDETRv2와 마찬가지로 안정적이고 예측 가능한 배포가 가능하면서 오버헤드는 훨씬 적습니다.
  • MuSGD 옵티마이저: Moonshot AI의 Kimi K2와 같은 고급 LLM 학습 기법에서 영감을 얻은 이 하이브리드 옵티마이저는 안정적인 학습과 빠른 수렴을 지원하여 기존 비전 Transformer의 고질적인 불안정성을 극복합니다.
  • 엣지 환경에 최적화: 이전 세대보다 CPU 추론 속도가 최대 43% 빠르며, Distribution Focal Loss(DFL)를 전략적으로 제거한 YOLO26은 GPU 가속을 사용할 수 없는 모바일 및 IoT 장치에 적합합니다.
  • ProgLoss + STAL: 이러한 고급 손실 함수는 CNN의 오랜 과제였던 소형 객체 인식 성능을 크게 향상하여 YOLO26을 항공 이미지 및 로보틱스에 적합하게 만듭니다.

학습 예제#

직관적인 Ultralytics API를 사용하면 최첨단 모델을 원활하게 학습할 수 있습니다. 다음은 COCO8 데이터셋으로 YOLO26 Nano 모델을 학습하는 실행 가능한 예제입니다:

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

요약#

RTDETRv2와 YOLOv6-3.0 중에서 선택할 때는 주로 사용 중인 하드웨어와 지연 시간 제약을 고려해야 합니다. RTDETRv2는 겹치는 복잡한 객체를 처리하는 것이 중요한 연구 환경과 서버 측 처리에서 강점을 보입니다. YOLOv6-3.0은 강력한 NVIDIA GPU를 갖춘 고처리량 제조 라인에 적합한 선택입니다.

하지만 Transformer의 NMS 제거 설계와 CNN의 뛰어난 속도 및 낮은 메모리 사용량을 모두 원하는 개발자에게는 YOLO26이 독보적인 선택입니다. Ultralytics 생태계의 포괄적인 문서와 활발한 커뮤니티의 지원을 바탕으로 YOLO26은 비전 AI 프로젝트의 견고성, 확장성, 미래 대응성을 보장합니다.

댓글