Ultralytics YOLO27:

EfficientDet와 RTDETRv2#

컴퓨터 비전 프로젝트에 최적의 아키텍처를 선택하려면 다양한 신경망을 폭넓게 검토해야 합니다. 이 가이드에서는 서로 다른 두 접근 방식인 확장성이 뛰어난 합성곱 신경망(CNN) 제품군 EfficientDet과 최첨단 실시간 Transformer 모델 RTDETRv2를 상세히 기술적으로 비교합니다. 두 모델의 구조적 차이, 학습 방법론, 다양한 하드웨어 환경에서의 배포 적합성을 평가합니다.

레거시 효율성과 최신 Transformer 기능 간의 절충점을 이해하면 개발자가 정보에 기반한 결정을 내릴 수 있습니다. 또한 새로운 Ultralytics YOLO26과 같은 최신 대안이 뛰어난 속도, 정확도, 사용 편의성을 제공하며 그 격차를 어떻게 해소하는지도 살펴봅니다.

EfficientDet 이해하기#

EfficientDet은 체계적인 모델 스케일링 방식을 도입하여 객체 검출에 혁신을 가져왔습니다.

아키텍처 및 핵심 개념#

EfficientDet은 기본적으로 EfficientNet을 백본으로 사용하며 양방향 특징 피라미드 네트워크(BiFPN)를 도입합니다. BiFPN은 학습 가능한 가중치를 적용하여 서로 다른 입력 특징의 중요도를 학습함으로써 쉽고 빠른 멀티스케일 특징 융합을 지원합니다. 또한 모든 백본, 특징 네트워크, 박스/클래스 예측 네트워크의 해상도, 깊이, 너비를 동시에 균일하게 확장하는 복합 스케일링 방법을 결합합니다.

강점과 한계#

EfficientDet의 주요 강점은 파라미터 효율성에 있습니다. 출시 당시 EfficientDet-D0과 같은 모델은 이전 YOLO 버전보다 적은 파라미터와 FLOPs로 더 높은 정확도를 달성했습니다. 따라서 컴퓨팅 자원이 엄격하게 제한된 환경에서 매우 매력적인 선택지가 되었습니다.

그러나 EfficientDet은 후처리 과정에서 표준 비최대 억제(NMS)를 사용해 겹치는 바운딩 박스를 필터링하므로 실시간 파이프라인에서 지연 시간 병목이 발생할 수 있습니다. 또한 학습 과정에 대한 문서화는 잘 되어 있지만, 최신 도구에서 제공하는 고도로 최적화된 개발자 경험과 비교하면 EfficientDet의 파인튜닝은 번거로울 수 있습니다.

EfficientDet에 대해 자세히 알아보기

레거시 지원

EfficientDet은 확장 가능한 네트워크의 길을 열었지만, 최신 NPU에 이러한 모델을 배포하려면 광범위한 수동 최적화가 필요한 경우가 많습니다. 더욱 간소화된 배포를 위해 최신 Ultralytics 모델은 원클릭 내보내기 기능을 제공합니다.

RTDETRv2 살펴보기#

RTDETRv2는 Transformer 기반 아키텍처의 발전을 보여주며, 기존 앵커 기반 CNN에서 벗어나는 새로운 패러다임을 제시합니다.

Transformer의 발전#

RTDETRv2는 실시간 객체 검출 Transformer(RT-DETR) 베이스라인을 기반으로 구축되었습니다. 전역 어텐션 메커니즘을 활용하여 표준 합성곱의 국소적 제약 없이 복잡한 장면의 맥락을 이해할 수 있습니다. 가장 중요한 아키텍처상의 장점은 기본적으로 NMS가 필요 없는 설계입니다. 입력 이미지에서 직접 객체를 예측하므로 추론 파이프라인이 단순해지고, NMS 후처리에 필요한 휴리스틱 튜닝을 피할 수 있습니다.

강점과 약점#

RTDETRv2는 겹치는 객체가 기존 CNN을 혼동시키는 고밀도 환경에서 뛰어난 성능을 발휘합니다. 복잡한 벤치마크 데이터셋인 COCO에서 높은 정확도를 보입니다.

정확도는 높지만 Transformer 모델은 본질적으로 상당한 메모리를 요구합니다. 학습 효율성도 눈에 띄게 낮으며, CNN과 비교해 수렴하려면 훨씬 더 많은 에포크와 더 큰 CUDA 메모리 용량이 필요합니다. 따라서 클라우드 예산이 제한적이거나 신속한 프로토타이핑이 필요한 개발자에게 RTDETRv2는 적합성이 떨어질 수 있습니다.

RTDETRv2에 대해 자세히 알아보기

Transformer 메모리 제약

RTDETRv2와 같은 Transformer 모델을 학습하려면 일반적으로 고성능 GPU가 필요합니다. 메모리 부족(OOM) 오류가 발생하면 학습 중 메모리 요구량이 더 낮은 모델, 예를 들어 Ultralytics YOLO 시리즈를 사용해 보세요.

성능 벤치마크 비교#

원시 성능 지표를 이해하는 것은 모델 선택에 매우 중요합니다. 다음 표에서는 다양한 크기에서 EfficientDet과 RTDETRv2를 비교합니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

사용 사례 및 권장 사항#

EfficientDet과 RT-DETR 중 무엇을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.

EfficientDet을 선택해야 하는 경우#

EfficientDet는 다음과 같은 경우에 적합한 선택입니다.

  • Google Cloud 및 TPU 파이프라인: EfficientDet의 네이티브 최적화를 활용할 수 있는 Google Cloud Vision API 또는 TPU 인프라와 긴밀하게 통합된 시스템입니다.
  • 복합 스케일링 연구: 균형 잡힌 네트워크 깊이, 너비 및 해상도 스케일링의 영향을 연구하는 데 중점을 둔 학술적 벤치마킹입니다.
  • TFLite를 통한 모바일 배포: Android 또는 임베디드 Linux 디바이스에 TensorFlow Lite 형식으로 내보내야 하는 프로젝트입니다.

RT-DETR을 선택해야 하는 경우#

다음과 같은 경우 RT-DETR을 권장합니다.

  • Transformer 기반 감지 연구: NMS 없이 엔드 투 엔드 객체 감지를 수행하기 위해 attention mechanism과 Transformer 아키텍처를 탐구하는 프로젝트입니다.
  • 유연한 latency를 요구하는 고정확도 시나리오: 감지 정확도가 최우선이며 약간 더 높은 추론 latency를 허용할 수 있는 애플리케이션입니다.
  • 대형 객체 감지: 주로 medium-to-large 객체가 있는 장면으로, Transformer의 global attention mechanism이 자연스러운 이점을 제공하는 경우입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

Ultralytics의 강점: YOLO26 소개#

EfficientDet과 RTDETRv2는 컴퓨터 비전 역사에서 확고한 위치를 차지했지만, 최신 프로덕션 환경에서는 속도, 정확도, 뛰어난 개발자 경험 사이의 완벽한 균형이 필요합니다. 최근 출시된 Ultralytics YOLO26은 서로 다른 이 두 아키텍처의 장점을 종합합니다.

YOLO26은 Ultralytics가 자랑하는 간소화된 생태계와 혁신적인 내부 메커니즘을 결합하여 차별화됩니다.

경쟁 제품보다 YOLO26을 선택해야 하는 이유#

  • 엔드투엔드 NMS 없는 설계: RTDETRv2와 같은 Transformer에서 영감을 얻은 YOLO26은 기본적으로 엔드투엔드 방식으로 작동합니다. NMS 후처리를 제거하여 대규모 파라미터 증가 없이 더 빠르고 간단한 배포 파이프라인을 보장합니다.
  • MuSGD Optimizer: 대규모 언어 모델 학습의 혁신(예: Moonshot AI의 Kimi K2)에서 영감을 얻은 YOLO26은 SGD와 Muon의 하이브리드 방식을 사용합니다. 이를 통해 RTDETRv2에 필요한 장기 학습 스케줄과 비교하여 전례 없는 학습 안정성과 훨씬 빠른 수렴 속도를 제공합니다.
  • 엣지 최적화: 최대 43% 더 빠른 CPU 추론을 제공하는 YOLO26은 엣지 AI를 위해 설계되었습니다. 모바일 디바이스와 스마트 카메라 같은 제약이 있는 하드웨어에서 무거운 Transformer 모델보다 쉽게 뛰어난 성능을 발휘합니다.
  • DFL 제거: Distribution Focal Loss를 제거하여 모델 그래프를 단순화하고 원활한 TensorRTONNX 내보내기를 지원합니다.
  • ProgLoss + STAL: 이러한 고급 손실 함수는 작은 객체 인식 성능을 크게 향상하여 항공 이미지와 로보틱스에서 흔히 발생하는 병목을 해결합니다.
  • 다용도성: 주로 검출에 초점을 맞추는 RTDETRv2와 달리 YOLO26은 기본적으로 인스턴스 세그멘테이션, 포즈 추정, 이미지 분류, 방향성 바운딩 박스(OBB)를 지원하며, 포즈를 위한 RLE와 OBB를 위한 특수 각도 손실 등 작업별 개선 사항도 제공합니다.
통합 생태계

Ultralytics Platform을 활용하면 데이터셋을 관리하고, 클라우드에서 YOLO26 또는 YOLO11과 같은 모델을 학습하며, 유연한 API를 통해 원활하게 배포할 수 있습니다.

Ultralytics를 활용한 간단한 코드#

잘 유지 관리되는 Ultralytics Python API를 사용하면 모델 학습과 추론을 간단하게 수행할 수 있습니다. 개발자는 최소한의 보일러플레이트 코드만으로 모델을 쉽게 벤치마크하거나 학습 스크립트를 실행할 수 있습니다.

from ultralytics import YOLO

# Load the state-of-the-art YOLO26 model
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run inference on a test image
predictions = model.predict("image.jpg")

레거시 인프라를 관리하는 경우에도 높은 평가를 받는 Ultralytics YOLOv8은 안정적이고 강력한 선택지로 남아 있으며, Ultralytics 생태계의 장기적인 안정성을 보여줍니다. 복잡한 실시간 트래킹 알고리즘을 실행하든 간단한 결함 검출을 수행하든, YOLO26으로 업그레이드하면 시스템의 미래 경쟁력을 확보하고 높은 정확도와 메모리 효율성을 얻을 수 있습니다.

댓글