Ultralytics YOLO27:

RTDETRv2와 YOLOv7#

컴퓨터 비전의 분야는 지난 몇 년간 합성곱 신경망(CNNs)과 비전 Transformer(ViTs) 모두의 지속적인 혁신에 힘입어 크게 확장되었습니다. 배포에 적합한 아키텍처를 선택하려면 속도, 정확도, 컴퓨팅 오버헤드 간의 미묘한 트레이드오프를 이해해야 합니다. 이 가이드에서는 높은 평가를 받는 두 아키텍처인 RTDETRv2와 YOLOv7의 기술적 차이를 살펴보고, 최신 Ultralytics YOLO26에서 제공하는 현대적인 발전 사항도 함께 소개합니다.

RTDETRv2: 실시간 감지를 위한 Transformer 접근 방식#

RTDETRv2(실시간 감지 Transformer 버전 2)는 이전 버전의 기반을 발전시켜, Transformer 기반 아키텍처가 기존의 후처리 단계에 의존하지 않고도 실시간 시나리오에서 효과적으로 경쟁할 수 있음을 입증합니다.

아키텍처 주요 특징#

RTDETRv2는 하이브리드 인코더와 Transformer 디코더 아키텍처를 활용합니다. self-attention 메커니즘을 활용하여 모델은 전체 이미지를 종합적으로 처리하므로, 엄밀히 국소화된 합성곱 커널보다 복잡한 공간적 관계를 더 잘 이해할 수 있습니다. 가장 두드러지는 특징 중 하나는 기본적으로 NMS가 필요 없는 설계입니다. 비최대 억제(NMS)를 제거함으로써 RTDETRv2는 배포 중 가변적인 추론 지연 시간을 유발하는 일반적인 병목을 없앱니다.

강점과 한계#

RTDETRv2의 주요 강점은 복잡한 장면에서 밀집되고 서로 겹치는 객체를 처리하는 능력에 있습니다. Transformer attention 레이어가 제공하는 전역 컨텍스트 덕분에 특히 가림 현상이 빈번한 시나리오에서 높은 정확도를 보입니다.

그러나 이러한 장점에는 컴퓨팅 비용이 따릅니다. Transformer 모델은 일반적으로 CNN보다 학습 및 추론 중 더 많은 메모리를 필요로 합니다. 또한 RTDETRv2는 분산 학습 중 수렴하는 데 일반적으로 더 많은 epoch가 필요하므로, 커스텀 데이터셋을 조정하는 개발자의 반복 주기가 길어집니다.

RTDETRv2에 대해 자세히 알아보기

YOLOv7: 속도를 위한 CNN 기준 모델#

RTDETRv2보다 1년 먼저 출시된 YOLOv7은 기존 YOLO 프레임워크에 여러 구조적 최적화를 도입하여, 출시 당시 CNN 기반 실시간 감지기의 강력한 벤치마크를 세웠습니다.

아키텍처 주요 특징#

YOLOv7의 아키텍처는 확장 효율적 레이어 집계 네트워크(E-ELAN) 개념을 중심으로 구축되었습니다. 이 접근 방식은 그래디언트 경로를 최적화하여 컴퓨팅 복잡도를 크게 높이지 않고도 모델이 더 효과적으로 학습하도록 합니다. 또한 저자들은 학습 중 모델 정확도를 향상시키면서 엣지 디바이스에서의 추론 속도에는 영향을 주지 않는 일련의 방법인 "trainable bag-of-freebies"를 도입했습니다.

강점과 한계#

YOLOv7은 표준 객체 감지 작업에 여전히 매우 뛰어난 모델이며, 소비자용 GPU에서 탁월한 처리 속도를 제공합니다. CNN 특성상 RTDETRv2와 같은 Transformer 기반 모델보다 학습 중 더 적은 CUDA 메모리를 필요로 하는 경우가 일반적입니다.

이러한 장점에도 불구하고 YOLOv7은 후처리를 위해 여전히 NMS에 의존합니다. 예측이 매우 밀집된 환경에서는 NMS 단계로 인해 처리 시간이 변동할 수 있어 엄격한 실시간 보장이 어려워집니다. 또한 최신 프레임워크와 비교하면 인스턴스 세그멘테이션포즈 추정과 같은 다양한 작업을 처리하는 과정이 분산되어 있을 수 있습니다.

YOLOv7에 대해 자세히 알아보세요

성능 비교#

이러한 모델을 평가하려면 평균 정밀도(mAP), 파라미터 수, 추론 속도 간의 섬세한 균형을 살펴봐야 합니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
성능 맥락

RTDETRv2-x는 가장 높은 mAP를 달성하지만, 파라미터 수와 FLOPs도 가장 많습니다. RTDETRv2-s와 같은 소형 변형 모델은 TensorRT에서 경쟁력 있는 속도를 제공하지만, 전용 GPU가 없는 저전력 환경을 대상으로 하는 사용자는 CPU 추론 성능을 신중하게 평가해야 합니다.

현대적인 솔루션: YOLO26의 등장#

RTDETRv2와 YOLOv7이 컴퓨터 비전 애플리케이션의 한계를 확장하는 데 중추적인 역할을 했지만, AI 분야는 빠르게 발전합니다. 2026년 1월에 출시된 **YOLO26**은 CNN의 효율성과 Transformer와 유사한 NMS 불필요 아키텍처의 장점을 결합합니다.

새로운 시스템을 구축하는 개발자와 연구자에게 통합된 Ultralytics Platform과 Python 생태계는 기술 부채를 크게 줄이는 통합된 경험을 제공합니다.

YOLO26의 주요 혁신#

  • 엔드투엔드 NMS 불필요 설계: YOLO26은 기본적으로 엔드투엔드 방식이므로 NMS 후처리를 제거하여 더 빠르고 간단한 배포를 지원합니다. 이 획기적인 접근 방식은 YOLOv10에서 처음 개척되었으며, 객체 밀도와 관계없이 안정적인 지연 시간을 보장합니다.
  • 최대 43% 더 빠른 CPU 추론: 엣지 컴퓨팅과 GPU가 없는 디바이스에 맞게 특별히 최적화되어, 무거운 Transformer 모델보다 현장 배포에 훨씬 더 유연하게 사용할 수 있습니다.
  • MuSGD Optimizer: SGD와 Muon(Moonshot AI의 Kimi K2에서 영감을 얻음)을 결합한 하이브리드 옵티마이저로, LLM 학습 혁신을 컴퓨터 비전에 적용하여 더 안정적인 학습과 빠른 수렴을 제공합니다.
  • DFL 제거: Distribution Focal Loss를 제거하여 임베디드 NPU 및 TensorRT 환경으로 더 원활하게 내보낼 수 있는 단순화된 컴퓨팅 그래프를 제공합니다.
  • ProgLoss + STAL: 향상된 손실 함수로 소형 객체 인식이 크게 개선되며, 이는 로보틱스, IoT, 항공 이미지 분석에 매우 중요합니다.
  • 작업별 개선 사항: YOLO26은 감지 전용 모델이 아닙니다. 세그멘테이션을 위한 멀티스케일 프로토타입, 포즈 추적을 위한 Residual Log-Likelihood Estimation(RLE), 방향성 바운딩 박스(OBB) 경계 문제를 해결하는 특수 각도 손실을 제공합니다.

간소화된 개발자 경험#

YOLO26(또는 많은 인기를 얻고 있는 YOLO11)과 같은 Ultralytics 모델을 선택할 때의 진정한 장점은 잘 유지 관리되는 생태계입니다. 커스텀 데이터셋을 학습하는 데 필요한 보일러플레이트 코드는 최소한입니다:

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)

이상적인 사용 사례 및 적용 분야#

이러한 아키텍처 중 선택하는 일은 대상 하드웨어와 구체적인 운영 요구 사항에 크게 좌우됩니다.

RTDETRv2를 고려해야 하는 경우#

RTDETRv2는 강력한 GPU를 갖춘 서버 측 처리 환경에서 매우 효과적입니다. 전역 attention 메커니즘은 복잡한 장면 이해에 적합하므로, 매우 혼잡한 이벤트 모니터링이나 겹치는 특징에 대한 심층적인 컨텍스트 분석이 필요한 특수 의료 이미지와 같은 작업에 사용할 수 있습니다.

YOLOv7을 고려할 시점#

YOLOv7은 학술 연구에서 기준 비교 모델로 레거시 환경에서 유지 관리되는 경우가 많습니다. 또한 기존 파이프라인이 특정 PyTorch 버전에 맞게 하드코딩되어 있고 최신 프레임워크의 멀티태스크 유연성이 필요하지 않은 오래된 산업 배포 환경에서도 사용됩니다.

YOLO26이 권장 표준인 이유#

최신 스마트 시티 인프라, 드론 내비게이션, 고속 제조 분야에서 YOLO26은 탁월한 균형을 제공합니다. 더 낮은 메모리 요구 사항 덕분에 소비자용 하드웨어에서도 하이퍼파라미터 튜닝과 학습을 수행할 수 있으며, NMS가 필요 없는 추론으로 Raspberry Pi나 NVIDIA Jetson과 같은 제약이 있는 엣지 디바이스에서도 빠르게 실행할 수 있습니다.

더 많은 비교 살펴보기

이 모델들이 다른 아키텍처와 어떻게 비교되는지 궁금하십니까? 비전 AI 프로젝트에 가장 적합한 모델을 찾으려면 YOLO11 대 RT-DETRYOLOv8 대 YOLOv7에 대한 상세 가이드를 확인해 보십시오.

댓글