Ultralytics YOLO27:

RTDETRv2와 YOLOv6-3.0#

컴퓨터 비전 분야는 끊임없이 발전하며, 객체 감지를 위한 다양한 아키텍처 선택지를 개발자에게 제시하고 있습니다. 서로 다른 접근 방식을 대표하는 두 가지 주요 모델로는 최첨단 비전 Transformer인 RTDETRv2와 산업 애플리케이션에 맞게 고도로 최적화된 합성곱 신경망(CNN)인 YOLOv6-3.0이 있습니다.

이 종합적인 기술 비교에서는 두 모델의 아키텍처, 성능 지표 및 이상적인 배포 시나리오를 살펴봅니다. 또한 더 폭넓은 Ultralytics 생태계가 어떻게 탁월한 개발자 경험을 제공하는지 검토하고, 궁극적으로 차세대 기능을 갖춘 Ultralytics YOLO26을 살펴봅니다.

RTDETRv2: 비전 Transformer 접근 방식#

Baidu의 연구진이 개발한 RTDETRv2는 기존 RT-DETR을 기반으로 구축되었으며, Transformer 기반 객체 감지에서 크게 도약한 모델입니다.

아키텍처 주요 특징#

RTDETRv2는 CNN feature extractor와 강력한 Transformer decoder를 결합한 하이브리드 아키텍처를 사용합니다. 이 모델의 가장 큰 특징은 기본적으로 NMS가 필요 없는 설계입니다. 후처리 과정에서 비최대 억제(NMS)를 제거하여 모델이 bounding box를 직접 예측하므로 배포가 간소화되고 추론 latency가 안정화됩니다.

RTDETRv2에 통합된 "Bag-of-Freebies"는 복잡한 장면과 겹치는 객체를 처리하는 능력을 향상합니다. 전역 attention 메커니즘이 국소화된 convolution보다 공간적 관계를 본질적으로 더 잘 이해하기 때문입니다.

Transformer 메모리 사용량

Transformer는 복잡한 장면 이해에 뛰어나지만, 일반적으로 CNN보다 학습 중 훨씬 더 많은 CUDA 메모리를 필요로 합니다. 이로 인해 일반 소비자용 GPU에서 batch size가 제한되고 전체 학습 시간이 증가할 수 있습니다.

RT-DETR에 대해 자세히 알아보세요

YOLOv6-3.0: 산업 처리량 극대화#

Meituan의 Vision AI Department에서 개발된 YOLOv6-3.0은 GPU 처리량이 가장 중요한 산업 파이프라인을 위한 차세대 detector로 명시적으로 설계되었습니다.

  • 저자: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, Xiangxiang Chu
  • 조직: Meituan
  • 날짜: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

아키텍처 초점#

YOLOv6-3.0은 NVIDIA GPU와 같은 hardware accelerator에서 메모리 access cost를 최소화하도록 세심하게 설계된 EfficientRep backbone을 사용합니다. Neck architecture에는 서로 다른 scale 간 feature fusion을 개선하는 양방향 연결(BiC) 모듈이 포함되어 있습니다.

학습 중에는 anchor 기반 패러다임의 이점을 활용하면서도 더 빠른 실행을 위해 anchor-free 추론 모드를 유지하는 Anchor-Aided Training(AAT) 전략을 사용합니다. T4 및 A100과 같은 server-grade GPU에서 뛰어난 처리량을 달성하지만, 특수한 아키텍처로 인해 CPU만 사용하는 edge device에 배포할 경우 latency가 최적 수준에 미치지 못할 수 있습니다.

YOLOv6에 대해 자세히 알아보세요

성능 비교#

Production 환경에 배포할 모델을 평가할 때는 정확도(mAP)와 추론 속도 및 계산 비용(FLOPs)의 균형을 맞추는 것이 중요합니다. 아래 표는 이러한 모델의 상대적인 성능을 보여줍니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

YOLOv6-3.0은 TensorRT에서 순수 처리 속도 면에서 우세한 반면, RTDETRv2는 특히 더 큰 모델 variant로 확장할수록 더 높은 mAP 점수를 기록합니다. 그러나 두 모델 모두 최신 통합 framework에서 제공하는 폭넓은 versatility가 부족합니다. YOLOv6-3.0은 주로 detection에 특화되어 있으며, instance segmentationpose estimation과 같은 task를 기본적으로 지원하지 않습니다.

사용 사례 및 권장 사항#

RT-DETR과 YOLOv6 중에서 선택하는 것은 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.

RT-DETR을 선택해야 하는 경우#

RT-DETR이 적합한 경우:

  • Transformer 기반 감지 연구: NMS 없이 엔드 투 엔드 객체 감지를 수행하기 위해 attention mechanism과 Transformer 아키텍처를 탐구하는 프로젝트입니다.
  • 유연한 latency를 요구하는 고정확도 시나리오: 감지 정확도가 최우선이며 약간 더 높은 추론 latency를 허용할 수 있는 애플리케이션입니다.
  • 대형 객체 감지: 주로 medium-to-large 객체가 있는 장면으로, Transformer의 global attention mechanism이 자연스러운 이점을 제공하는 경우입니다.

YOLOv6을 선택해야 하는 경우#

다음과 같은 경우 YOLOv6을 권장합니다:

  • 산업용 하드웨어 인식 배포: 모델의 하드웨어 인식 설계와 효율적인 재매개변수화가 특정 대상 하드웨어에서 최적화된 성능을 제공하는 시나리오입니다.
  • 고속 단일 단계 감지: 제어된 환경에서 실시간 비디오 처리를 위해 GPU에서의 순수 추론 속도를 우선시하는 애플리케이션입니다.
  • Meituan 생태계 통합: 이미 Meituan의 기술 스택과 배포 인프라를 사용하고 있는 팀입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

Ultralytics의 강점#

적합한 모델을 선택하는 일은 단순히 benchmark 수치만 비교하는 것 이상을 의미합니다. 개발자 경험, 배포 유연성 및 생태계 지원도 똑같이 중요합니다. Ultralytics platform에 통합된 모델을 사용하면 정적인 research repository에 비해 상당한 이점을 얻을 수 있습니다.

  • 사용 편의성: ultralytics Python package는 원활한 API를 제공합니다. 모델을 학습하고 검증하며 export하는 데 몇 줄의 코드만 필요합니다.
  • 잘 유지 관리되는 생태계: 독립적인 academic repository와 달리 Ultralytics Platform은 지속적으로 업데이트됩니다. 또한 ONNX, OpenVINO, CoreML과 같은 도구를 위한 강력한 integration을 제공합니다.
  • 학습 효율성: Ultralytics 모델은 일반적으로 RTDETRv2와 같은 Transformer architecture보다 학습 중 훨씬 적은 VRAM을 사용하므로 consumer-grade hardware에서 더 큰 batch size를 사용할 수 있습니다.
  • 범용성: YOLOv6-3.0의 집중된 범위와 달리, Ultralytics 모델은 멀티태스킹을 지원하며 단일 통합 프레임워크 내에서 이미지 분류, 지향성 바운딩 박스 (OBB), 분할을 기본적으로 지원합니다.
간소화된 배포

Ultralytics CLI를 사용하면 다음을 실행하는 것만큼 간단하게 학습된 모델을 edge 배포용으로 export할 수 있습니다: yolo export model=yolo11n.pt format=tensorrt.

YOLO26 소개: 궁극적인 솔루션#

RTDETRv2와 YOLOv6-3.0이 각각의 이점을 제공하지만, 이 분야는 빠르게 발전하고 있습니다. 새로운 컴퓨터 비전 프로젝트를 시작하는 팀에는 2026년 1월 Ultralytics가 출시한 **YOLO26**을 적극 권장합니다.

YOLO26은 산업용 CNN과 최신 Transformer의 강점을 결합하는 동시에 각각의 약점을 제거합니다.

  • End-to-End NMS-Free 설계: YOLOv10에서 처음 도입된 획기적인 방식을 채택한 YOLO26은 기본적으로 NMS 후처리를 제거합니다. 따라서 RTDETRv2와 유사하게 안정적이고 예측 가능한 배포를 보장하면서도 overhead는 훨씬 적습니다.
  • MuSGD Optimizer: Moonshot AI의 Kimi K2와 같은 고급 LLM 학습 기법에서 영감을 받은 이 hybrid optimizer는 안정적인 학습과 더 빠른 수렴을 보장하여 기존 vision Transformer의 악명 높은 불안정성을 극복합니다.
  • Edge에 최적화: 이전 세대보다 최대 43% 빠른 CPU 추론을 제공하고 Distribution Focal Loss(DFL)를 전략적으로 제거한 YOLO26은 GPU acceleration을 사용할 수 없는 mobile 및 IoT device에 매우 적합합니다.
  • ProgLoss + STAL: 이러한 고급 loss function은 CNN의 오랜 과제였던 small-object recognition을 크게 향상하여 YOLO26을 aerial imagery 및 robotics에 이상적인 모델로 만듭니다.

학습 예제#

직관적인 Ultralytics API를 사용하면 최첨단 모델을 원활하게 학습할 수 있습니다. 아래에는 COCO8 dataset에서 YOLO26 Nano 모델을 학습하는 실행 가능한 예제가 나와 있습니다.

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

요약#

RTDETRv2와 YOLOv6-3.0을 비교할 때 선택은 주로 사용 중인 hardware와 latency 제약 조건에 따라 달라집니다. RTDETRv2는 복잡하게 겹치는 객체를 처리하는 것이 중요한 research environment 및 server-side processing에서 뛰어난 성능을 발휘합니다. YOLOv6-3.0은 강력한 NVIDIA GPU를 갖춘 high-throughput manufacturing line에 여전히 강력한 선택지입니다.

그러나 Transformer의 NMS-free 설계와 CNN의 뛰어난 속도 및 낮은 memory footprint를 모두 원하는 개발자에게는 YOLO26이 독보적인 선택입니다. 포괄적인 문서와 Ultralytics 생태계의 활발한 커뮤니티를 기반으로 하는 YOLO26은 컴퓨터 비전 AI 프로젝트의 견고성, 확장성 및 미래 대응력을 보장합니다.

댓글