Ultralytics YOLO27:

EfficientDet와 DAMO-YOLO#

확장 가능한 컴퓨터 비전 파이프라인을 구축할 때 적절한 모델 아키텍처를 선택하는 것은 배포 가능성과 탐지 정확도 모두에 영향을 미치는 중요한 결정입니다. 이 가이드에서는 시각 인식 분야에서 잘 알려진 두 아키텍처인 EfficientDet과 DAMO-YOLO를 심층적으로 기술 비교합니다.

두 모델 모두 객체 탐지 분야에 상당한 혁신을 가져왔지만, 비전 AI의 급속한 발전은 더욱 통합된 생태계로 나아가는 길을 열었습니다. 이 분석에서는 이러한 레거시 네트워크의 핵심 작동 원리를 살펴보는 동시에, Ultralytics PlatformUltralytics YOLO26과 같은 최신 솔루션이 프로덕션 환경의 업계 표준이 된 이유를 설명합니다.

EfficientDet: 확장 가능하고 효율적인 객체 탐지#

Google의 연구자들이 발표한 EfficientDet은 높은 효율성을 유지하면서 모델 아키텍처를 체계적으로 확장하도록 설계되었습니다. 네트워크 깊이, 너비, 입력 해상도 전반에 걸쳐 복합 스케일링을 활용하여 이를 달성했습니다.

EfficientDet 세부 정보:

아키텍처 혁신#

EfficientDet의 주요 기여는 양방향 특징 피라미드 네트워크(BiFPN)입니다. 기존 FPN과 달리 BiFPN은 학습 가능한 가중치를 활용하여 다양한 입력 특징의 중요도를 파악함으로써 쉽고 빠른 멀티 스케일 특징 융합을 지원합니다. 여기에 EfficientNet 백본을 결합하여 예측 가능한 방식으로 확장되는 D0부터 D7까지의 모델 제품군을 구성합니다.

강점과 약점#

EfficientDet의 핵심 강점은 파라미터 효율성에 있습니다. 고도로 제한된 클라우드 환경에서 평균 정밀도(mAP)를 최대화해야 하는 작업의 경우, 복합 스케일링 방식의 예측 가능성이 매우 높습니다. 그러나 EfficientDet은 처음부터 학습하기가 매우 복잡한 것으로 악명 높으며, 상당한 하이퍼파라미터 튜닝이 필요한 경우가 많습니다. 또한 특정 TensorFlow 연산에 크게 의존하기 때문에 ONNX 또는 TensorRT를 통한 엣지 배포로 전환하는 작업이 최신 YOLO 모델의 간소화된 내보내기 기능에 비해 더 까다롭습니다.

EfficientDet에 대해 자세히 알아보기

DAMO-YOLO: 실제로 적용된 자동 아키텍처 탐색#

DAMO-YOLO는 실시간 추론을 위한 최적의 네트워크 구조를 자동으로 설계하기 위해 신경망 아키텍처 탐색(NAS)을 활용하는 독특한 접근 방식을 제시합니다.

DAMO-YOLO 세부 정보:

아키텍처 혁신#

DAMO-YOLO는 몇 가지 새로운 기술을 도입합니다. NAS로 생성된 MAE-NAS라는 백본, 넥에 효율적인 RepGFPN, 그리고 탐지 헤드의 연산 비용을 크게 줄이는 ZeroHead 설계를 활용합니다. 또한 레이블 할당에 AlignedOTA를 사용하고 지식 증류 강화에 크게 의존하여 더 작은 변형 모델의 성능을 향상합니다.

강점과 약점#

DAMO-YOLO는 특히 TensorRT를 사용하는 NVIDIA 아키텍처 배포에 맞게 설계되어 GPU 추론 속도에서 뛰어난 성능을 발휘합니다. 무거운 헤드 구조를 제거하여 모델은 낮은 지연 시간으로 예측을 수행합니다. 반면 자동 아키텍처 탐색으로 인해 모델 구조가 불투명해질 수 있으며, 사용자 지정 엣지 디바이스에 맞게 수동으로 디버깅하거나 미세 조정하기가 어렵습니다. 높은 범용성을 갖춘 Ultralytics YOLO11과 달리 DAMO-YOLO는 주로 표준 바운딩 박스 탐지에 초점을 맞추며, 포즈 추정이나 방향성 바운딩 박스(OBB) 탐지와 같은 고급 작업을 기본적으로 지원하지 않습니다.

성능 비교#

모델을 선택하려면 실증적 트레이드오프를 이해하는 것이 필수적입니다. 아래 표에서는 주요 성능 지표를 기준으로 EfficientDet 제품군과 DAMO-YOLO 시리즈를 비교합니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
EfficientDet-d064034.610.23.923.92.54
EfficientDet-d164040.513.57.316.66.1
EfficientDet-d264043.017.710.928.111.0
EfficientDet-d364047.528.019.5912.024.9
EfficientDet-d464049.742.833.5520.755.2
EfficientDet-d564051.572.567.8633.7130.0
EfficientDet-d664052.692.889.2951.9226.0
EfficientDet-d764053.7122.0128.0751.9325.0
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
데이터 분석

EfficientDet-d7은 이론적으로 가장 높은 정확도를 달성하지만 막대한 컴퓨팅 성능이 필요하므로 엣지 AI에 적합하지 않습니다. DAMO-YOLO는 뛰어난 TensorRT 속도를 제공하지만, 일반적으로 비슷한 정확도를 달성하려면 하위 EfficientDet 모델보다 더 많은 파라미터가 필요합니다.

사용 사례 및 권장 사항#

EfficientDet과 DAMO-YOLO 중 어느 것을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.

EfficientDet을 선택해야 하는 경우#

EfficientDet는 다음과 같은 경우에 적합한 선택입니다.

  • Google Cloud 및 TPU 파이프라인: EfficientDet의 네이티브 최적화를 활용할 수 있는 Google Cloud Vision API 또는 TPU 인프라와 긴밀하게 통합된 시스템입니다.
  • 복합 스케일링 연구: 균형 잡힌 네트워크 깊이, 너비 및 해상도 스케일링의 영향을 연구하는 데 중점을 둔 학술적 벤치마킹입니다.
  • TFLite를 통한 모바일 배포: Android 또는 임베디드 Linux 디바이스에 TensorFlow Lite 형식으로 내보내야 하는 프로젝트입니다.

DAMO-YOLO를 선택해야 하는 경우#

다음과 같은 경우 DAMO-YOLO를 권장합니다.

  • High-Throughput Video Analytics: batch-1 throughput이 주요 metric인 고정 NVIDIA GPU infrastructure에서 high-FPS video stream을 처리하는 경우입니다.
  • Industrial Manufacturing Lines: assembly line에서의 real-time quality inspection과 같이 전용 하드웨어에서 엄격한 GPU latency constraint가 있는 경우입니다.
  • Neural Architecture Search Research: automated architecture search(MAE-NAS)와 효율적인 reparameterized backbone이 detection performance에 미치는 영향을 연구하는 경우입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

Ultralytics의 장점: 레거시 모델을 넘어선 발전#

EfficientDet과 DAMO-YOLO는 귀중한 학술적 통찰을 제공하지만, 최신 개발자에게는 최첨단 성능과 개발자 친화성을 모두 갖춘 프레임워크가 필요합니다. 바로 이 부분에서 Ultralytics 생태계가 뛰어난 성능을 발휘합니다.

탁월한 사용 편의성과 생태계#

서로 다른 고도로 사용자 지정된 연구 리포지토리의 모델을 배포하면 통합 과정에서 악몽과 같은 문제가 발생하는 경우가 많습니다. Ultralytics는 광범위한 문서와 Python 스타일의 API를 갖춘 통합되고 철저하게 잘 유지 관리되는 생태계를 제공합니다. 학습에 Google Colab을 사용하든 모바일 추론을 위해 CoreML로 내보내든, 파이프라인에는 몇 줄의 코드만 필요합니다.

from ultralytics import YOLO

# Load the highly recommended YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model effortlessly on a custom dataset
model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Export the trained model to ONNX for production
model.export(format="onnx")

YOLO26의 혁신#

EfficientDet 또는 DAMO-YOLO를 평가하는 개발자에게 Ultralytics YOLO26은 궁극적인 진화 단계에 해당합니다. 2026년 초에 출시된 YOLO26은 패러다임을 바꾸는 다음과 같은 기능을 도입합니다.

  • 엔드 투 엔드 NMS 없는 설계: YOLOv10에서 처음 개척한 방식으로, YOLO26은 비최대 억제(NMS) 후처리의 필요성을 기본적으로 제거합니다. 이를 통해 배포 아키텍처가 크게 단순화되고 다양한 하드웨어에서 일관된 지연 시간이 구현됩니다.
  • 최대 43% 더 빠른 CPU 추론: 고성능 GPU가 없는 엣지 배포 환경, 즉 DAMO-YOLO가 어려움을 겪는 시나리오에서 YOLO26은 고도로 최적화되어 표준 CPU에서 크게 향상된 속도를 제공합니다.
  • MuSGD 옵티마이저: LLM의 혁신과 컴퓨터 비전 사이의 격차를 해소하기 위해 YOLO26은 MuSGD 옵티마이저(Moonshot AI에서 영감을 받음)를 도입하여 EfficientDet의 불안정한 학습 루프에 비해 매우 안정적인 학습과 빠른 수렴을 보장합니다.
  • DFL 제거: Distribution Focal Loss를 제거하면 내보내기 과정이 단순화되어 저전력 마이크로컨트롤러 및 Raspberry Pi 디바이스와의 호환성이 향상됩니다.
  • ProgLoss + STAL: 이러한 고급 손실 함수는 소형 객체 인식 성능을 크게 향상합니다. 소형 객체 인식은 기존 아키텍처가 전통적으로 취약한 영역입니다.

메모리 효율성과 작업 범용성#

트랜스포머 모델이나 고도로 융합된 NAS 네트워크와 달리, Ultralytics 모델은 엄격한 메모리 효율성을 특징으로 합니다. 학습 중 CUDA 메모리를 현저히 적게 사용하므로 소비자용 하드웨어에서 신속하게 반복 작업을 수행할 수 있습니다.

또한 EfficientDet과 DAMO-YOLO가 바운딩 박스로 엄격하게 제한되는 것과 달리, Ultralytics는 동일하고 직관적인 프레임워크 내에서 인스턴스 세그멘테이션이미지 분류를 기본적으로 지원합니다. 기존 프로젝트를 유지 관리하는 사용자의 경우 Ultralytics YOLOv8이 여전히 널리 배포된 매우 안정적인 대안이므로 검토할 가치가 있습니다.

결론#

적절한 비전 아키텍처를 선택하려면 이론상의 순수 성능과 실제 배포 환경을 비교하여 고려해야 합니다. EfficientDet은 수학적으로 우아한 스케일링 방식을 제공하고 DAMO-YOLO는 뛰어난 순수 GPU 속도를 제공합니다. 그러나 신속한 개발, 안정적인 배포, 최첨단 기능을 우선시하는 팀에게는 Ultralytics 모델이 명확한 우위를 점합니다. NMS 없는 추론과 MuSGD 최적화 같은 혁신을 결합함으로써 YOLO26은 오늘날 이용 가능한 가장 강력하고 유지 관리가 용이하며 효율적인 기반 위에 컴퓨터 비전 프로젝트를 구축할 수 있도록 합니다.

댓글