Ultralytics YOLO27:

YOLOv8과 EfficientDet#

빠르게 발전하는 객체 탐지 분야에서 최적의 neural network architecture를 선택하는 것은 정확도, inference 속도, 배포 가능성 간의 균형을 맞추는 데 매우 중요합니다. 이 기술 심층 분석에서는 영향력이 큰 두 architecture를 비교합니다. 현대 computer vision 생태계의 다목적 표준인 **Ultralytics YOLOv8**과 compound scaling 전략으로 잘 알려진 Google의 기반 모델 EfficientDet입니다.

고성능 cloud server를 대상으로 배포하든 리소스가 제한된 edge device를 대상으로 배포하든, 이러한 모델의 architecture적 특성을 이해하면 프로젝트를 성공으로 이끄는 데 도움이 됩니다.

아키텍처 개요#

두 모델 모두 convolutional neural network를 사용해 이미지 내 객체를 식별하고 위치를 추정하지만, feature extraction과 bounding box regression을 수행하는 방법은 서로 다릅니다.

Ultralytics YOLOv8#

2023년 1월 Ultralytics에서 출시된 YOLOv8은 YOLO 제품군에서 큰 도약을 이루었습니다. Glenn Jocher, Ayush Chaurasia, Jing Qiu가 개발한 이 모델은 객체 탐지, instance segmentation, pose estimation, image classification을 비롯한 여러 vision task를 원활하게 지원하도록 처음부터 설계되었습니다.

이 architecture는 anchor-free detection head를 도입하여 box prediction 수를 크게 줄이고 Non-Maximum Suppression(NMS) 속도를 높입니다. backbone은 C2f module(두 개의 convolution을 사용하는 Cross-Stage Partial bottleneck)을 활용하여 lightweight한 구조를 유지하면서 training 중 gradient flow를 개선합니다. 따라서 NVIDIA TensorRT 또는 ONNX와 같은 format으로 compile할 때 YOLOv8은 매우 높은 효율을 제공합니다.

EfficientDet#

Google의 Mingxing Tan, Ruoming Pang, Quoc V. Le가 개발하고 2019년 말 출시한 EfficientDet은 확장 가능한 효율성에 중점을 둡니다. 공식 Arxiv 논문에 설명된 이 모델은 AutoML 생태계를 적극적으로 활용합니다.

EfficientDet의 핵심 특징은 **양방향 Feature Pyramid Network(BiFPN)**으로, 쉽고 빠른 multi-scale feature fusion을 지원합니다. EfficientNet backbone과 결합된 이 architecture는 compound scaling method를 사용하여 backbone, feature network, box/class prediction network의 resolution, depth, width를 모두 동시에 균일하게 확장합니다. 그 결과 parameter 효율성은 뛰어나지만, 복잡한 network topology로 인해 일반적인 GPU에서 최적의 real-time 속도를 달성하는 데 어려움을 겪는 경우가 많습니다.

EfficientDet에 대해 자세히 알아보기

성능 및 지표 비교#

객체 detector를 비교할 때는 평균 정밀도(mAP)와 inference latency가 주요 benchmark입니다. 아래 표는 COCO와 같은 dataset에서 표준 metric을 기준으로 YOLOv8 variant와 EfficientDet(d0-d7) 제품군을 비교하여 보여줍니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv8n64037.380.41.473.28.7
YOLOv8s64044.9128.42.6611.228.6
YOLOv8m64050.2234.75.8625.978.9
YOLOv8l64052.9375.29.0643.7165.2
YOLOv8x64053.9479.114.3768.2257.8
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
성능 균형 분석

EfficientDet은 이론적인 FLOPs가 더 적으면서도 뛰어난 정확도를 달성하지만, 실제 GPU inference 속도에서는 Ultralytics YOLOv8이 우위를 차지합니다. 예를 들어 YOLOv8x는 EfficientDet-d7(53.7)보다 약간 높은 mAP(53.9)를 달성하면서도 T4 GPU에서 이미지를 훨씬 더 빠르게 처리합니다(14.37ms 대 128.07ms). 따라서 YOLOv8은 real-time video analytics에 적합한 분명한 선택입니다.

학습 방법론과 생태계#

machine learning architecture를 선택할 때 developer experience는 중요한 요소입니다. open-source community의 지원과 생태계 tooling이 바로 이러한 모델 간의 차이를 크게 만드는 부분입니다.

EfficientDet은 TensorFlow와 특화된 AutoML pipeline에 크게 의존합니다. 대규모 distributed cloud training에는 효과적이지만, EfficientDet GitHub repository에 있는 environment를 설정하고 anchor를 조정하며 복잡한 configuration file을 분석하는 작업은 빠르게 진행되는 engineering team에 부담이 될 수 있습니다.

반면 Ultralytics YOLOv8은 기본적으로 PyTorch 기반으로 구축되어 탁월한 사용 편의성을 제공합니다. 개발자는 한 줄의 Python code 또는 CLI command만으로 복잡한 training loop를 시작할 수 있습니다. 또한 training 중 모델의 memory requirement가 크게 최적화되어 있어, 일반 소비자용 GPU에서도 robust model을 학습할 수 있으며 transformer 중심 architecture에서 자주 발생하는 out-of-memory(OOM) error를 피할 수 있습니다.

Ultralytics Platform과의 원활한 integration은 dataset annotation, model training, one-click cloud deployment를 위한 no-code interface를 제공하여 이러한 장점을 한 단계 더 발전시킵니다. 자동 hyperparameter tuning과 같은 기능을 사용하면 custom dataset에서 항상 가능한 최상의 정확도를 얻을 수 있습니다.

Python Code Example: YOLOv8 Inference#

Ultralytics GitHub repository를 사용하여 최신 detector를 실행하는 작업은 매우 간단합니다:

from ultralytics import YOLO

# Initialize the YOLOv8 model natively in PyTorch
model = YOLO("yolov8n.pt")

# Train the model on the COCO8 example dataset
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run fast inference on an image URL
inference_results = model("https://ultralytics.com/images/bus.jpg")

# Display the bounding boxes
inference_results[0].show()

차세대 모델: Ultralytics YOLO26으로 업그레이드#

YOLOv8은 여전히 뛰어난 production model이지만, AI 성능의 최첨단을 추구하는 research 및 development 담당자는 2026년 1월에 출시된 **Ultralytics YOLO26**을 평가해야 합니다.

YOLO26은 native End-to-End NMS-Free Design을 도입하여 객체 탐지 paradigm을 새롭게 정의합니다. 초기 YOLO version부터 존재해 온 bottleneck인 post-processing 단계의 Non-Maximum Suppression 필요성을 제거함으로써 latency variance를 사실상 없앴습니다. 이는 low-power device에 배포할 때 획기적인 변화입니다.

또한 YOLO26은 몇 가지 획기적인 training innovation을 도입합니다:

  • MuSGD Optimizer: 고급 LLM training technique에서 영감을 받은 SGD와 Muon의 hybrid로, 매우 안정적인 training과 크게 향상된 convergence rate를 보장합니다.
  • 최대 43% 더 빠른 CPU Inference: NMS를 제거하고 backbone을 대폭 최적화한 덕분에 YOLO26은 전용 NPU에 의존하지 않고 CPU만 사용하는 edge device에서 전례 없는 속도를 달성합니다.
  • ProgLoss + STAL: 이러한 고급 loss function은 small-object recognition 정확도를 크게 향상시켜 YOLO26을 aerial imagery와 정밀 IoT sensor에 필수적인 모델로 만듭니다.
  • DFL 제거: Distribution Focal Loss를 완전히 제거하여 OpenVINO 및 CoreML과 같은 format으로 export하는 과정을 크게 단순화했습니다.

사용 사례 및 권장 사항#

궁극적으로 이러한 architecture 중에서 선택하는 일은 배포 제약 조건과 legacy requirement에 따라 달라집니다.

  • 다음과 같은 경우 Ultralytics YOLOv8을 선택합니다: 높은 정확도, real-time GPU inference, frictionless한 developer experience가 필요한 최신의 다목적 computer vision application을 구축하는 경우입니다. classification, segmentation, detection task 전반에서 강력한 성능을 제공하므로 retail analytics, robotics, security system을 위한 강력한 multi-tool로 활용할 수 있습니다.
  • 다음과 같은 경우 EfficientDet을 선택합니다: legacy TensorFlow workflow를 사용해야 하며, 엄격한 real-time industrial deployment보다는 research 목적 등으로 parameter 수와 이론적 FLOPs를 최소화하는 것이 주요 관심사인 경우입니다.
  • 다음과 같은 경우 Ultralytics YOLO26을 선택합니다: 새 프로젝트를 시작하며 최고의 성능이 필요한 경우입니다. native end-to-end NMS-free architecture를 갖춘 YOLO26은 초고속 edge deployment와 대규모 cloud processing 모두에 최적의 선택입니다.

Ultralytics 생태계에서 높은 성능을 제공하는 다른 framework를 살펴보고 있다면, 균형 잡힌 legacy 성능을 위한 Ultralytics YOLO11이나 real-time detection에 transformer 기반 접근 방식을 적용하는 RT-DETR도 고려할 수 있습니다.

댓글