DAMO-YOLO와 YOLOv9 비교#
실시간 객체 탐지 분야는 숨 가쁜 속도로 계속 발전하고 있습니다. 엔지니어링 팀과 연구자들이 정확도, 추론 속도, 연산 효율성의 완벽한 균형을 추구하는 가운데 연구 커뮤니티에서 주목할 만한 두 아키텍처인 DAMO-YOLO와 YOLOv9가 등장했습니다. 두 모델 모두 컴퓨터 비전의 가능성을 확장하기 위한 중요한 아키텍처 혁신을 도입합니다.
이 상세 기술 가이드에서는 두 모델의 고유한 아키텍처 접근 방식, 학습 방법론, 실제 배포 역량을 비교하고 심층적으로 분석합니다. 또한 통합 플랫폼인 Ultralytics Platform과 차세대 모델인 YOLO26의 장점을 조명하면서, 더 넓은 소프트웨어 생태계가 현대 AI 개발에서 수행하는 중요한 역할도 살펴봅니다.
요약: 적합한 아키텍처 선택#
두 모델 모두 딥러닝 연구에서 중요한 이정표이지만, 배포 철학은 조금씩 다릅니다.
DAMO-YOLO는 강력한 신경망 아키텍처 탐색(NAS)을 활용해 특정 성능 특성을 끌어내는 환경에서 뛰어나므로 맞춤형 엣지 배포를 연구하기에 흥미로운 모델입니다. 반면 YOLOv9는 딥러닝의 정보 병목 문제 해결에 집중해 매우 높은 파라미터 효율성을 제공합니다.
하지만 프로덕션에 바로 적용할 수 있는 배포를 위해 엔지니어링 팀은 통합된 Ultralytics 생태계를 활용할 것을 꾸준히 권장합니다. 새로운 프로젝트에 적합한 최신 YOLO26 모델은 최첨단 정확도와 복잡한 후처리가 필요 없는 선택적 종단 간 설계를 결합해 두 접근 방식의 장점을 모두 제공합니다.
DAMO-YOLO와 YOLOv9는 강력한 학술 모델이지만, 프로덕션에 배포하려면 상당한 사용자 지정 엔지니어링이 필요한 경우가 많습니다. Ultralytics YOLO26을 사용하면 간소화되고 유지 관리하기 쉬운 API를 통해 최첨단 성능을 활용할 수 있습니다.
기술 사양 및 개발 주체#
이 모델들의 기원과 개발 목표를 이해하면 각 모델의 강점을 파악하는 데 필요한 맥락을 얻을 수 있습니다.
DAMO-YOLO#
Alibaba Group의 연구자들이 개발한 DAMO-YOLO는 자동화된 아키텍처 생성과 효율적인 특징 융합에 중점을 둡니다.
- 저자: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun
- 기관: Alibaba Group
- 출시일: 2022년 11월 23일
- Arxiv 논문: DAMO-YOLO 연구 논문
- 공식 GitHub: tinyvision/DAMO-YOLO 저장소
- 문서: DAMO-YOLO README
YOLOv9#
심층 합성곱 신경망의 정보 손실 문제를 해결하기 위해 도입된 YOLOv9는 학습 중 기울기 보존의 이론적 한계를 확장합니다.
- 저자: Chien-Yao Wang 및 Hong-Yuan Mark Liao
- 기관: 대만 중앙연구원 정보과학연구소
- 출시일: 2024년 2월 21일
- Arxiv 논문: YOLOv9 연구 논문
- 공식 GitHub: WongKinYiu/yolov9 저장소
- 문서: YOLOv9 Ultralytics 문서
아키텍처 혁신#
DAMO-YOLO: 신경망 아키텍처 탐색 기반#
DAMO-YOLO는 고도로 맞춤화된 머신 생성 구성 요소를 통해 차별화됩니다. 백본은 신경망 아키텍처 탐색(NAS)을 사용해 생성되며, 다양한 하드웨어에서 지연 시간이 짧은 추론을 구현하는 데 중점을 둡니다.
이 아키텍처는 특징 융합을 위한 효율적인 RepGFPN(재매개변수화된 일반화 특징 피라미드 네트워크)을 채택해 연산 오버헤드를 과도하게 늘리지 않으면서 다중 스케일 객체 탐지를 개선합니다. 또한 ZeroHead 설계로 탐지 헤드를 간소화하고 레이블 할당에 AlignedOTA를 사용하며, 학습 중에는 정교한 증류 강화 프로세스를 적용합니다. 이러한 기법은 빠른 추론을 가능하게 하지만, 다단계 증류 프로세스에는 상당한 VRAM과 긴 학습 시간이 필요한 경우가 많습니다.
YOLOv9: 정보 병목 문제 해결#
YOLOv9는 심층 네트워크의 근본적인 문제, 즉 입력 데이터가 연속된 레이어를 통과하면서 정보가 점진적으로 손실되는 문제를 해결합니다.
이를 해결하기 위해 저자들은 심층 레이어의 핵심 세부 정보를 보존하고 가중치 업데이트에 매우 신뢰할 수 있는 그래디언트를 생성하도록 설계된 보조 감독 프레임워크인 프로그래밍 가능한 그래디언트 정보(PGI)를 도입했습니다. PGI와 함께 GELAN(일반화된 효율적 레이어 집계 네트워크) 아키텍처도 제시했습니다. GELAN은 CSPNet과 ELAN의 장점을 결합해 정보 흐름을 극대화하면서 부동소수점 연산(FLOPs)을 엄격하게 최소화하여 파라미터 효율성을 최적화합니다.
성능 분석 및 지표#
성능을 평가하면 두 모델 모두 COCO와 같은 표준 벤치마크에서 높은 평균 정밀도(mAP)를 보여 줍니다. YOLOv9은 비슷한 파라미터 수에서 더 높은 정확도를 달성하며, 전반적으로 가장 높은 절대 정확도를 기록합니다. 이는 어려운 데이터셋에서도 높은 충실도를 유지하는 PGI 아키텍처의 이점을 활용한 결과입니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
위에서 볼 수 있듯이 YOLOv9-E가 가장 높은 정확도를 달성하며, 더 작은 DAMO-YOLO 및 YOLOv9 변형 모델은 TensorRT 최적화를 통해 매우 경쟁력 있는 추론 속도를 유지합니다.
학습 방법론 및 생태계#
아키텍처 자체도 중요하지만, 실제 애플리케이션에서는 모델 생태계가 좌우하는 사용성과 학습 효율성이 무엇보다 중요합니다.
DAMO-YOLO는 지식 증류에 의존하기 때문에 대상인 '학생' 모델에 지식을 전달하기 전에 번거로운 '교사' 모델을 학습해야 하는 경우가 많습니다. 이러한 전통적인 연구 방식은 메모리 요구량과 학습 주기를 크게 늘립니다. 마찬가지로 기존 YOLOv9 리포지토리는 복잡한 구성 파일을 살펴봐야 하므로 민첩한 개발이 느려질 수 있습니다.
반면 모델을 Ultralytics Platform에 통합하면 개발자 경험이 완전히 달라집니다. Ultralytics Python 패키지는 반복적인 보일러플레이트 코드를 추상화하므로, 팀은 데이터 증강, 하이퍼파라미터 튜닝, 모델 내보내기를 손쉽게 처리할 수 있습니다.
실제 애플리케이션 및 사용 사례#
아키텍처마다 리소스 요구 사항과 정확도 특성에 따라 특정 산업 분야에서 자연스럽게 강점을 발휘합니다.
- 엣지 AI 분야의 DAMO-YOLO: NAS 최적화 백본 덕분에 DAMO-YOLO는 하드웨어별 재매개변수화가 필수적인 임베디드 시스템에서 자주 검토됩니다. 예를 들어 맞춤형 ASIC을 활용하는 기본적인 제조 품질 관리에 적용할 수 있습니다.
- 정밀 분석 분야의 YOLOv9: 높은 파라미터 효율성과 PGI 기반 그래디언트 보존 기능을 갖춘 YOLOv9은 항공 이미지 분석이나 혼잡한 소매 환경에서 작은 객체를 추적하는 등 밀집 객체 탐지 시나리오에 적합합니다.
사용 사례 및 권장 사항#
DAMO-YOLO와 YOLOv9 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 선호하는 생태계에 따라 달라집니다.
DAMO-YOLO를 선택해야 하는 경우#
DAMO-YOLO는 다음과 같은 경우에 적합합니다:
- 높은 처리량의 비디오 분석: 배치 크기 1의 처리량이 주요 지표인 고정형 NVIDIA GPU 인프라에서 높은 FPS의 비디오 스트림을 처리하는 경우입니다.
- 산업 제조 라인: 조립 라인의 실시간 품질 검사처럼 전용 하드웨어에서 GPU 지연 시간 제약이 엄격한 시나리오입니다.
- 신경망 아키텍처 탐색 연구: 자동 아키텍처 탐색(MAE-NAS)과 효율적으로 재매개변수화된 백본이 감지 성능에 미치는 영향을 연구하는 경우입니다.
YOLOv9을 선택해야 하는 경우#
다음과 같은 경우 YOLOv9을 권장합니다:
- 정보 병목 연구: 프로그래밍 가능한 그래디언트 정보(PGI) 및 일반화된 효율적 계층 집계 네트워크(GELAN) 아키텍처를 연구하는 학술 프로젝트입니다.
- 그래디언트 흐름 최적화 연구: 학습 중 심층 네트워크 계층의 정보 손실을 이해하고 완화하는 데 초점을 둔 연구입니다.
- 고정확도 탐지 벤치마킹: 아키텍처 비교의 기준점으로 YOLOv9의 우수한 COCO 벤치마크 성능이 필요한 시나리오입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
Ultralytics의 강점: YOLO26으로의 발전#
기존 아키텍처를 비교하는 사용자에게 최신 Ultralytics 생태계, 특히 최신 YOLO26 모델로 전환하면 독보적인 이점을 얻을 수 있습니다.
YOLO26은 종단 간 NMS 없는 설계를 통해 배포 환경을 근본적으로 바꿉니다. 선택적으로 사용할 수 있는 원투원 헤드(nms=False)는 비최대 억제(NMS) 후처리를 제거하여 더 빠르고 훨씬 단순한 배포 아키텍처를 제공합니다. 분포 초점 손실(DFL)도 제거하여 YOLO26은 엣지 및 저전력 장치와의 호환성이 뛰어납니다.
또한 YOLO26은 LLM 학습 혁신에서 영감을 얻은 확률적 그래디언트 하강법과 Muon 최적화를 결합한 하이브리드인 혁신적인 MuSGD Optimizer를 적용합니다. 이를 통해 Transformer 중심의 대안보다 메모리 사용량을 현저히 낮게 유지하면서도 매우 안정적인 학습 수렴을 달성합니다.
직관적인 Ultralytics API를 사용하면 Python 코드 몇 줄만으로 실험 추적 기능이 내장된 최첨단 YOLO26 모델을 학습시킬 수 있습니다.
from ultralytics import YOLO
# 최신 YOLO26 모델을 불러옵니다
model = YOLO("yolo26n.pt")
# 사용자 지정 데이터셋으로 효율적으로 학습합니다
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 학습한 모델을 ONNX 형식으로 내보냅니다.
model.export(format="onnx")고급 인스턴스 분할, 높은 정확도의 자세 추정, 표준 바운딩 박스 탐지 중 무엇이 필요하든, Ultralytics 프레임워크의 다재다능함 덕분에 팀은 딥러닝 환경 구성에 드는 시간을 줄이고 안정적인 AI 솔루션 배포에 더 집중할 수 있습니다. 작은 객체 인식을 향상하는 ProgLoss + STAL과 같은 작업별 개선 사항을 갖춘 YOLO26은 차세대 비전 애플리케이션을 위한 최적의 선택입니다.