Ultralytics YOLO27:

DAMO-YOLO와 EfficientDet#

컴퓨터 비전의 발전으로 다양한 실제 요구 사항에 맞춰 설계된 강력한 아키텍처가 다수 등장했습니다. 일부 프레임워크는 대규모 확장성을 우선시하는 반면, 다른 프레임워크는 실시간 추론 속도에 중점을 둡니다. 이 기술 비교에서는 객체 감지 문제를 해결하는 서로 다른 접근 방식을 보여주는 영향력 있는 두 모델인 DAMO-YOLOEfficientDet을 살펴봅니다. 두 모델의 아키텍처를 분석하고 벤치마크 성능을 비교한 다음, 새롭게 출시된 Ultralytics YOLO26이 최신 프로덕션 배포에 최적의 선택인 이유를 살펴봅니다.

아키텍처 개요#

두 모델 모두 효율성과 정확도 간의 상충 관계를 해결하도록 설계되었지만, 목표를 달성하기 위해 근본적으로 서로 다른 메커니즘을 사용합니다.

DAMO-YOLO: Neural Architecture Search를 통한 속도 향상#

실시간 감지의 한계를 확장하기 위해 개발된 DAMO-YOLO는 자동화된 검색 기법을 활용하여 지연 시간이 짧은 환경에 맞춘 고효율 네트워크를 구축합니다.

DAMO-YOLO 세부 정보:

DAMO-YOLO는 속도와 정확도를 모두 최적화하는 Neural Architecture Search(NAS) 백본을 중심으로 구축되었습니다. RepGFPN(Reparameterized Generalized Feature Pyramid Network)을 도입하여 높은 추론 속도를 유지하면서 특징 융합을 향상합니다. 또한 ZeroHead 설계를 통해 감지 헤드와 일반적으로 관련된 계산 오버헤드를 최소화합니다. 이 모델은 AlignedOTA(Aligned Optimal Transport Assignment)와 지식 증류 향상의 이점도 활용하므로, 가장 작은 변형 모델도 더 큰 모델에서 풍부한 표현을 학습할 수 있습니다.

EfficientDet: Compound Scaling을 통한 확장성#

속도를 우선시하는 접근 방식과 달리 EfficientDet은 다양한 컴퓨팅 예산에 걸쳐 체계적인 확장성에 중점을 둡니다.

EfficientDet 세부 정보:

EfficientDet은 BiFPN(Bidirectional Feature Pyramid Network)을 도입하여 쉽고 빠른 다중 스케일 특징 융합을 지원합니다. 레이어나 채널을 임의로 추가하여 아키텍처를 확장하는 기존 방식과 달리, EfficientDet은 백본, 특징 네트워크, 박스/클래스 예측 네트워크의 해상도, 깊이, 너비를 동시에 균일하게 확장하는 compound scaling 방식을 사용합니다. 이를 통해 고사양 하드웨어에서는 최첨단 정확도를 달성하는 동시에, 제약이 있는 환경을 위한 더 작은 변형 모델도 제공합니다.

EfficientDet에 대해 자세히 알아보기

성능 및 지표 비교#

이러한 모델을 나란히 비교하면 순수한 정확도와 추론 속도 간의 상충 관계가 명확해집니다. 아래 표에는 주요 성능 지표가 정리되어 있으며, DAMO-YOLO의 추론 성능EfficientDet 모델 제품군과 어떻게 비교되는지 보여줍니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0

위에서 확인할 수 있듯이 EfficientDet-d7은 전반적으로 가장 높은 정확도를 달성하므로 엄격한 클라우드 기반 애플리케이션에 적합합니다. 반면 DAMO-YOLO 시리즈는 GPU 하드웨어에서 훨씬 낮은 지연 시간으로 매우 경쟁력 있는 정확도를 제공하므로 실시간 엣지 배포에 더 적합한 후보입니다.

사용 사례 및 권장 사항#

DAMO-YOLO와 EfficientDet 중 무엇을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.

DAMO-YOLO를 선택해야 하는 경우#

DAMO-YOLO가 적합한 경우:

  • High-Throughput Video Analytics: batch-1 throughput이 주요 metric인 고정 NVIDIA GPU infrastructure에서 high-FPS video stream을 처리하는 경우입니다.
  • Industrial Manufacturing Lines: assembly line에서의 real-time quality inspection과 같이 전용 하드웨어에서 엄격한 GPU latency constraint가 있는 경우입니다.
  • Neural Architecture Search Research: automated architecture search(MAE-NAS)와 효율적인 reparameterized backbone이 detection performance에 미치는 영향을 연구하는 경우입니다.

EfficientDet을 선택해야 하는 경우#

다음과 같은 경우 EfficientDet을 권장합니다:

  • Google Cloud 및 TPU 파이프라인: EfficientDet의 네이티브 최적화를 활용할 수 있는 Google Cloud Vision API 또는 TPU 인프라와 긴밀하게 통합된 시스템입니다.
  • 복합 스케일링 연구: 균형 잡힌 네트워크 깊이, 너비 및 해상도 스케일링의 영향을 연구하는 데 중점을 둔 학술적 벤치마킹입니다.
  • TFLite를 통한 모바일 배포: Android 또는 임베디드 Linux 디바이스에 TensorFlow Lite 형식으로 내보내야 하는 프로젝트입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

최신 대안: Ultralytics YOLO26#

DAMO-YOLO와 EfficientDet 모두 학문적으로 중요한 이정표이지만, 실제 배포에는 더 균형 잡히고 기능이 풍부하며 개발자 친화적인 접근 방식이 필요한 경우가 많습니다. 이러한 점에서 Ultralytics YOLO26이 새로운 업계 표준을 제시합니다.

2026년 1월에 출시된 YOLO26은 Ultralytics YOLO11YOLOv8을 비롯한 이전 모델의 유산을 기반으로 하며, 객체 감지에 접근하는 방식을 획기적으로 전환합니다.

End-to-End 단순성

YOLO26은 기본 End-to-End NMS-Free Design을 제공합니다. 수년간 객체 감지기를 괴롭혀 온 병목인 후처리 단계의 Non-Maximum Suppression(NMS)을 제거하여, 특히 엣지 하드웨어에서 더 단순하고 훨씬 빠른 배포 파이프라인을 제공합니다.

탁월한 성능과 다용도성#

YOLO26은 단순히 속도만 향상한 모델이 아니라, 학습 안정성과 정확도를 새롭게 정의합니다. LLM 학습 혁신에서 영감을 받은 SGD와 Muon의 하이브리드인 MuSGD Optimizer를 도입하여 수렴 속도를 크게 높이고 학습 효율을 향상합니다. RT-DETR과 같은 무거운 Transformer 기반 대안과 달리 YOLO26은 메모리 요구 사항이 매우 낮아 소비자용 하드웨어에서도 학습할 수 있습니다.

또한 YOLO26은 ProgLoss + STAL을 통합하여 소형 객체 인식 성능을 크게 향상합니다. 이는 드론 항공 이미지 및 로보틱스와 같은 사용 사례에 매우 중요합니다. 저전력 디바이스에 최적화하기 위해 YOLO26은 Distribution Focal Loss(DFL)를 제거했으며, 그 결과 이전 세대와 비교하여 CPU 추론 속도가 최대 43% 향상되었습니다.

생태계 및 사용 편의성#

EfficientDet과 같은 모델의 가장 큰 난관 중 하나는 복잡한 통합 프로세스입니다. 반면 Ultralytics Platform은 지속적으로 유지 관리되는 엔드투엔드 생태계를 제공합니다. 통합 API를 사용하면 사용자는 감지, 인스턴스 세그멘테이션, 포즈 추정, 이미지 분류, 방향성 바운딩 박스(OBB) 간에 쉽게 전환할 수 있습니다.

다음은 Ultralytics Python 패키지를 사용하여 YOLO26을 학습하고 추론을 실행하는 간단한 방법입니다.

from ultralytics import YOLO

# Load the state-of-the-art YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset with minimal memory footprint
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Run ultra-fast NMS-free inference
predictions = model.predict("image.jpg")

결론#

DAMO-YOLO와 EfficientDet 비교를 통해 Neural Architecture Search와 compound scaling 간의 트레이드오프를 훌륭하게 파악할 수 있지만, 최신 개발자에게는 학술 연구와 실제 프로덕션 환경 간의 격차를 해소하는 도구가 필요합니다.

사용 편의성, 활발한 오픈 소스 커뮤니티, 속도와 정확도 간의 균형을 중시하는 개발자에게 Ultralytics YOLO26은 확실한 선택입니다. NMS가 필요 없는 아키텍처, 낮은 학습 오버헤드, 포괄적인 Ultralytics 생태계와의 원활한 통합을 갖춘 YOLO26은 다음 컴퓨터 비전 프로젝트를 위한 최적의 프레임워크입니다.

댓글