YOLOv9와 DAMO-YOLO#
컴퓨터 비전의 급속한 발전으로 배포 제약 조건과 정확도 요구 사항에 맞는 다양한 강력한 아키텍처가 등장했습니다. 이 분야의 주목할 만한 모델로는 정보 병목 현상을 효과적으로 처리하는 YOLOv9와 신경망 아키텍처 탐색(NAS) 및 효율적인 특징 피라미드에 중점을 둔 DAMO-YOLO가 있습니다.
이 가이드에서는 YOLOv9와 DAMO-YOLO의 아키텍처 차이, 학습 방법론, 적합한 배포 시나리오를 심층적으로 기술 비교합니다. 또한 Ultralytics 생태계가 개발에서 프로덕션까지 원활한 경로를 제공하는 방식과 YOLO26과 같은 최신 모델이 새로운 프로젝트의 권장 표준이 된 이유도 살펴봅니다.
아키텍처 심층 분석#
각 모델을 구동하는 핵심 메커니즘을 이해하면 다양한 지표에서 성능 차이가 발생하는 이유를 파악할 수 있습니다.
YOLOv9: 프로그래밍 가능한 그래디언트 정보#
YOLOv9는 심층 신경망을 통해 데이터가 흐르면서 발생하는 정보 손실을 직접 해결하도록 설계되었습니다.
YOLOv9는 프로그래밍 가능 기울기 정보(PGI)와 일반화된 효율적 계층 집계 네트워크(GELAN)를 도입합니다. PGI는 순전파 과정에서 중요한 공간 및 의미 정보가 유지되도록 하여 가중치 업데이트에 사용되는 기울기의 저하를 방지합니다. GELAN은 파라미터 효율성을 극대화하여 이를 보완하며, 기존 CNN보다 적은 FLOPs로 최첨단 평균 정밀도(mAP)를 달성하도록 합니다.
DAMO-YOLO: NAS 기반 효율성#
Alibaba Group이 개발한 DAMO-YOLO는 자동화된 아키텍처 탐색을 활용하여 속도와 정확도 간 최적의 균형을 찾는 다른 접근 방식을 취합니다.
- 저자: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun
- 조직: Alibaba Group
- 날짜: 2022년 11월 23일
- 링크: Arxiv, GitHub
DAMO-YOLO는 효율적인 네트워크 구조를 자동 생성하기 위해 MAE-NAS(최대 엔트로피 신경망 아키텍처 탐색) 백본을 사용합니다. 견고한 특징 융합을 위해 RepGFPN(재매개변수화된 일반화 특징 피라미드 네트워크)을 활용하며, 탐지 헤드의 계산 부담을 최소화하는 "ZeroHead" 설계를 적용합니다. 또한 소형 모델 변형의 성능을 높이기 위해 레이블 할당과 지식 증류에 AlignedOTA를 적용합니다.
신경망 아키텍처 탐색(NAS)은 인공 신경망 설계를 자동화합니다. DAMO-YOLO와 같이 효율성이 높은 모델을 만들 수 있지만, 아키텍처 탐색 공간을 검색하려면 대규모 계산 리소스가 필요한 경우가 많습니다. 이는 YOLOv9와 같은 모델의 보다 결정론적인 설계 철학과 대조됩니다.
성능 및 지표 비교#
객체 탐지 모델을 선택할 때는 정확도, 속도, 계산 리소스 사용량 간의 균형을 맞추는 것이 중요합니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
분석#
- 정확도와 파라미터: YOLOv9는 일반적으로 파라미터 대비 정확도 비율이 더 높습니다. 예를 들어 YOLOv9c는 파라미터 25.5M으로 mAP 53.0%를 달성하는 반면, DAMO-YOLOl은 mAP 50.8%를 달성하는 데 훨씬 많은 파라미터(42.1M)가 필요합니다.
- 추론 속도: DAMO-YOLO의 아키텍처는 T4 GPU에서 경쟁력 있는 TensorRT 추론 속도를 제공하며, 중간 규모 모델에서는 YOLOv9보다 약간 빠릅니다. 그러나 YOLOv9는 FLOPs와 파라미터 수 측면에서 효율적이어서 탁월한 GPU 메모리 효율성을 제공합니다.
- 메모리 요구 사항: YOLOv9를 포함한 Ultralytics YOLO 모델은 일반적으로 복잡한 NAS 생성 모델이나 대규모 Transformer 아키텍처보다 학습과 추론 모두에서 메모리를 적게 사용하므로, 제약이 있는 엣지 하드웨어에 쉽게 배포할 수 있습니다.
Ultralytics 생태계의 이점#
이론적 지표도 중요하지만 실제 구현이 프로젝트의 성공을 크게 좌우합니다. 이 점에서 Ultralytics Platform과 포괄적인 소프트웨어 생태계는 DAMO-YOLO와 같은 독립형 저장소보다 뛰어난 강점을 제공합니다.
사용 편의성 및 학습 효율성#
맞춤형 YOLOv9 모델을 학습하는 데는 상용구 코드가 거의 필요하지 않습니다. Ultralytics Python API는 데이터 증강, 분산 학습, 하드웨어 최적화와 같은 복잡한 프로세스를 추상화합니다.
from ultralytics import YOLO
# 사전 학습된 YOLOv9 모델을 불러옵니다
model = YOLO("yolov9c.pt")
# 사용자 지정 데이터셋으로 모델을 학습합니다
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 모델 성능을 검증합니다
metrics = model.val()
# 프로덕션 배포를 위해 내보냅니다
model.export(format="onnx")반면 DAMO-YOLO를 사용하려면 고유한 학습 파이프라인에 특화된 경직된 구성 파일과 복잡한 종속성 체인을 다뤄야 하는 경우가 많아 학습 곡선이 더 가파릅니다.
다양한 작업 지원#
Ultralytics 모델의 특징은 본질적인 다용도성입니다. 표준 바운딩 박스 탐지를 넘어 Ultralytics 프레임워크는 인스턴스 세그멘테이션, 자세 추정, 이미지 분류, 방향 바운딩 박스(OBB) 탐지 등의 작업을 원활하게 지원합니다. DAMO-YOLO는 2D 객체 탐지에만 엄격하게 최적화되어 있어 다른 시각적 패러다임에 적용하려면 상당한 재설계가 필요합니다.
사용 사례 및 권장 사항#
YOLOv9와 DAMO-YOLO 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 에코시스템 선호도에 따라 달라집니다.
YOLOv9을 선택해야 하는 경우#
YOLOv9은 다음과 같은 경우에 적합합니다.
- 정보 병목 연구: 프로그래밍 가능한 그래디언트 정보(PGI) 및 일반화된 효율적 계층 집계 네트워크(GELAN) 아키텍처를 연구하는 학술 프로젝트입니다.
- 그래디언트 흐름 최적화 연구: 학습 중 심층 네트워크 계층의 정보 손실을 이해하고 완화하는 데 초점을 둔 연구입니다.
- 고정확도 탐지 벤치마킹: 아키텍처 비교의 기준점으로 YOLOv9의 우수한 COCO 벤치마크 성능이 필요한 시나리오입니다.
DAMO-YOLO를 선택해야 하는 경우#
다음과 같은 경우 DAMO-YOLO를 권장합니다.
- 높은 처리량의 비디오 분석: 배치 크기 1의 처리량이 주요 지표인 고정형 NVIDIA GPU 인프라에서 높은 FPS의 비디오 스트림을 처리하는 경우입니다.
- 산업 제조 라인: 조립 라인의 실시간 품질 검사처럼 전용 하드웨어에서 GPU 지연 시간 제약이 엄격한 시나리오입니다.
- 신경망 아키텍처 탐색 연구: 자동 아키텍처 탐색(MAE-NAS)과 효율적으로 재매개변수화된 백본이 감지 성능에 미치는 영향을 연구하는 경우입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
미래: YOLO26으로 전환하기#
YOLOv9와 DAMO-YOLO는 중요한 역사적 이정표를 보여 주지만, 현대 컴퓨터 비전은 네이티브 엔드투엔드 아키텍처로 발전했습니다. 새로운 개발에는 YOLO26을 표준 모델로 권장합니다.
2026년에 출시된 YOLO26은 이전 모델의 성공을 바탕으로 정확도와 배포 간소화 측면에서 비약적인 발전을 이뤘습니다.
YOLO26의 주요 혁신#
- 엔드투엔드 NMS 없는 설계: YOLO26의 선택형 일대일 헤드(
nms=False)는 비최대 억제(NMS) 후처리를 완전히 제거합니다. 이를 통해 네이티브 엔드투엔드 방식의 간소화된 배포 파이프라인을 구현합니다. 이 획기적인 방식은 YOLOv10에서 처음 선보였습니다. - DFL 제거: 분포 초점 손실(DFL)을 제거하여 내보내기를 간소화하고 엣지 디바이스 및 저전력 디바이스와의 호환성을 높였습니다.
- CPU 추론 최대 43% 향상: DFL을 제거하고 핵심 합성곱 연산을 최적화한 YOLO26은 전용 GPU가 없는 엣지 컴퓨팅 환경에 특히 적합합니다.
- MuSGD 옵티마이저: LLM 학습 혁신에서 영감을 얻은 YOLO26은 SGD와 Muon의 하이브리드인 MuSGD를 사용하여 더욱 안정적인 학습과 눈에 띄게 빠른 수렴을 보장합니다.
- ProgLoss + STAL: 이러한 고급 손실 함수는 작은 객체 인식 성능을 크게 향상시켜 YOLO26을 고고도 항공 이미지와 IoT 디바이스에 적합하게 만듭니다.
다음 프로젝트를 위해 YOLO11 또는 YOLOv8을 검토하고 있다면, YOLO26으로 업그레이드하여 현재 이용 가능한 가장 최적화된 최첨단 비전 AI 프레임워크를 활용할 수 있습니다.
요약#
적합한 모델은 구체적인 운영 제약 조건에 따라 달라집니다.
- DAMO-YOLO는 NAS 기반 최적화의 흥미로운 사례로, RepGFPN 아키텍처가 강점을 발휘하는 매우 특정한 하드웨어 구성에서 경쟁력 있는 속도를 제공합니다.
- YOLOv9는 세밀한 시각 정보를 보존하는 데 중점을 둔 연구자에게 탁월한 선택입니다. PGI 아키텍처를 활용해 심층 네트워크의 정보 손실을 방지합니다.
- Ultralytics YOLO26은 현대적인 엔터프라이즈 및 연구 애플리케이션을 위한 확실한 선택입니다. 탁월한 사용 편의성, NMS 없는 아키텍처, 최첨단 MuSGD 학습 최적화를 바탕으로 컴퓨터 비전 분야에서 가장 안정적이고 정확하며 쉽게 배포할 수 있는 모델입니다.