DAMO-YOLO와 YOLO26 비교#
컴퓨터 비전 분야는 높은 정확도와 낮은 지연 시간의 추론을 균형 있게 제공하는 아키텍처에 대한 요구에 따라 끊임없이 발전하고 있습니다. 이 비교에서는 DAMO-YOLO와 Ultralytics YOLO26의 기술적 세부 사항을 살펴보고, 두 모델의 아키텍처 혁신, 학습 방법론, 이상적인 사용 사례를 알아봅니다.
비전 모델을 엣지 기기에 배포하거나 처리량이 높은 클라우드 파이프라인을 구축할 때, 두 모델 간의 미묘한 차이를 이해하는 것은 현대 AI 개발에서 합리적인 아키텍처를 결정하는 데 매우 중요합니다.
DAMO-YOLO: 대규모 신경망 아키텍처 탐색#
Alibaba Group이 개발한 DAMO-YOLO는 2022년 11월 23일에 공개되었습니다. Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun이 설계한 이 모델은 신경 아키텍처 탐색(NAS)을 사용해 효율적인 아키텍처를 자동으로 발견하는 데 중점을 둡니다.
원본 연구는 ArXiv 논문에서 확인하거나 DAMO-YOLO GitHub 저장소에서 소스 코드를 살펴볼 수 있습니다.
주요 아키텍처 특징#
DAMO-YOLO는 실시간 객체 탐지의 한계를 넓히도록 설계된 여러 기술 혁신을 도입했습니다:
- MAE-NAS 백본: DAMO-YOLO는 최대 엔트로피 기반 탐색을 사용해 최적의 백본을 찾습니다. 이 NAS 접근 방식은 특정 하드웨어에서 탐지 정확도와 추론 속도의 균형을 엄격하게 맞추는 아키텍처를 발견합니다.
- 효율적인 RepGFPN: 특징 융합을 크게 향상하는 대형 넥 설계로, 항공 이미지에서 볼 수 있는 복잡한 장면을 분석할 때 특히 유용합니다.
- ZeroHead 설계: 최종 예측 계층의 계산 복잡성을 최소화하는 매우 간소화된 탐지 헤드입니다.
- AlignedOTA 및 지식 증류: DAMO-YOLO는 레이블 할당의 모호성을 해결하기 위해 정렬 최적 전송 할당(AlignedOTA)을 사용하며, 강력한 지식 증류 향상 전략을 함께 적용해 대형 교사 네트워크를 활용하여 소형 학생 모델의 정확도를 높입니다.
Ultralytics의 강점: YOLO26#
Glenn Jocher와 Jing Qiu가 Ultralytics에서 2026년 1월 14일 공개한 YOLO26은 누구나 쉽게 활용할 수 있는 고성능 비전 AI의 정점입니다. YOLO11과 YOLOv10의 기반 위에 개발된 YOLO26은 엣지 우선 배포, 멀티태스크 활용성, 탁월한 사용 편의성을 목표로 처음부터 설계되었습니다.
YOLO26의 혁신#
Ultralytics YOLO26은 현대적인 컴퓨터 비전 애플리케이션에 가장 적합한 선택이 되도록 여러 획기적인 기능을 도입했습니다:
- 엔드투엔드 NMS 프리 설계: YOLO26의 기본 일대일 헤드(
nms=False)는 비최대 억제(NMS) 후처리를 제거합니다. YOLOv10에서 처음 선보인 이 엔드투엔드 접근 방식은 배포 파이프라인을 크게 간소화하고 결정론적이며 지연 시간이 낮은 추론을 보장합니다. - CPU 추론 속도 최대 43% 향상: 엣지 컴퓨팅에 맞게 아키텍처를 최적화한 YOLO26은 엣지 기기와 표준 CPU에서 뛰어난 속도를 제공하므로 배터리 구동 IoT 기기에 적합합니다.
- MuSGD 옵티마이저: LLM 학습에서 영감을 얻은 YOLO26은 Moonshot AI의 Kimi K2와 같은 사례에서 착안해 SGD와 Muon을 결합한 하이브리드 방식을 적용합니다. 이를 통해 대규모 언어 모델 학습의 안정성을 컴퓨터 비전에 적용하여 더 빠르고 안정적인 수렴을 구현합니다.
- DFL 제거: 분포 초점 손실을 제거하면 모델 그래프가 간소화되어 ONNX 및 TensorRT와 같은 형식으로 원활하게 내보낼 수 있습니다.
- ProgLoss + STAL: 이 고급 손실 함수는 소형 객체 인식 성능을 크게 높이며, 드론 운용 및 농업 분야에 중요한 기능입니다.
YOLO26은 여러 모달리티에 걸쳐 특화된 개선 사항을 제공합니다. 인스턴스 세그멘테이션을 위한 멀티스케일 프로토, 포즈 추정을 위한 잔차 로그 가능도 추정(RLE), 방향성 바운딩 박스(OBB) 탐지의 경계 문제를 완화하는 고급 각도 손실이 포함됩니다.
성능 비교#
모델을 평가할 때 정확도(mAP)와 계산 효율성(속도/FLOPs)의 균형이 무엇보다 중요합니다. 아래 표에서는 업계 표준인 COCO 데이터셋을 사용해 모델 간 성능을 비교합니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
위에서 볼 수 있듯이 YOLO26은 훨씬 적은 파라미터와 FLOPs로 꾸준히 더 높은 정확도를 제공하므로 학습과 추론 모두에서 훨씬 효율적인 아키텍처를 구현합니다.
학습 효율성과 사용성#
DAMO-YOLO의 복잡성#
DAMO-YOLO는 경쟁력 있는 정확도를 제공하지만 학습 방법론이 매우 복잡합니다. 신경 아키텍처 탐색(NAS)과 대규모 지식 증류에 의존하기 때문에 커스텀 모델을 학습하려면 상당한 GPU 리소스와 전문 지식이 필요한 경우가 많습니다. 대형 교사 모델을 학습한 후 소형 학생 모델에 지식을 증류하는 이 다단계 과정은 커스텀 데이터셋을 빠르게 반복 개선하려는 민첩한 엔지니어링 팀에 병목 현상을 일으킬 수 있습니다.
간소화된 Ultralytics 경험#
반면 Ultralytics YOLO26은 "제로에서 전문가 수준까지" 쉽게 사용할 수 있도록 설계되었습니다. 학습, 검증, 배포의 전체 수명 주기를 깔끔하고 통합된 Python API와 CLI로 추상화했습니다. 또한 YOLO26은 RT-DETR과 같은 Transformer 기반 모델보다 학습 중 필요한 CUDA 메모리가 훨씬 적어, 연구자가 일반 소비자용 하드웨어에서도 최첨단 모델을 학습할 수 있습니다.
Ultralytics SDK를 사용하면 YOLO26 모델을 간단히 학습하고 평가한 뒤 내보낼 수 있습니다. 다음은 그 예시입니다:
from ultralytics import YOLO
# 최신 YOLO26 나노 모델을 불러옵니다
model = YOLO("yolo26n.pt")
# COCO8 데이터셋으로 50 에포크 동안 모델 학습
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# 검증 세트에서 모델 성능 평가하기
metrics = model.val()
# 샘플 이미지에서 추론 실행
results = model("https://ultralytics.com/images/bus.jpg")
results[0].show()
# 배포를 위해 모델을 ONNX 형식으로 내보냅니다
model.export(format="onnx")노코드 환경을 선호하는 팀을 위해 Ultralytics Platform은 데이터셋 어노테이션, 클라우드 학습, 원활한 배포를 위한 직관적인 인터페이스를 제공합니다.
실제 애플리케이션#
적절한 아키텍처는 대상 배포 환경과 하드웨어 제약 조건에 따라 크게 달라집니다.
산업용 품질 관리#
고속 제조 자동화에서 DAMO-YOLO는 전용 GPU 하드웨어를 사용할 때 우수한 성능을 발휘할 수 있습니다. 그러나 현대적인 조립 라인에는 YOLO26이 더 적합합니다. 엔드투엔드 NMS 프리 설계는 결정론적이고 지터가 없는 지연 시간을 보장하여 실시간으로 시각 데이터와 로봇 액추에이터를 동기화할 때 필수적인 요건을 충족합니다.
엣지 AI 및 모바일 기기#
배터리 구동 기기에 컴퓨터 비전을 배포하려면 탁월한 효율성이 필요합니다. DAMO-YOLO는 특정 RepGFPN 넥에 의존하는 반면, YOLO26n(나노)은 엣지 컴퓨팅에 맞게 특별히 최적화되었습니다. DFL 제거와 43% 더 빠른 CPU 추론 덕분에 스마트 카메라, 모바일 애플리케이션, 보안 경보 시스템에 최적의 솔루션입니다.
멀티태스크 프로젝트 요구 사항#
프로젝트에서 객체 탐지 외에 스포츠 분야의 포즈 추정을 통한 선수 동작 분석이나 인스턴스 세그멘테이션을 통한 정확한 픽셀 경계 추출이 필요하다면, YOLO26은 통합된 단일 코드베이스에서 이러한 모든 태스크를 기본 지원합니다. DAMO-YOLO는 바운딩 박스 탐지로 기능이 엄격히 제한됩니다.
사용 사례 및 권장 사항#
DAMO-YOLO와 YOLO26 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 에코시스템 선호도에 따라 달라집니다.
DAMO-YOLO를 선택해야 하는 경우#
DAMO-YOLO는 다음과 같은 경우에 적합합니다:
- 높은 처리량의 비디오 분석: 배치 크기 1의 처리량이 주요 지표인 고정형 NVIDIA GPU 인프라에서 높은 FPS의 비디오 스트림을 처리하는 경우입니다.
- 산업 제조 라인: 조립 라인의 실시간 품질 검사처럼 전용 하드웨어에서 GPU 지연 시간 제약이 엄격한 시나리오입니다.
- 신경망 아키텍처 탐색 연구: 자동 아키텍처 탐색(MAE-NAS)과 효율적으로 재매개변수화된 백본이 감지 성능에 미치는 영향을 연구하는 경우입니다.
YOLO26을 선택해야 하는 경우#
YOLO26은 다음과 같은 경우에 권장됩니다:
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
결론#
두 아키텍처 모두 딥러닝 분야의 중요한 성과입니다. DAMO-YOLO는 특정 하드웨어 벤치마크에 맞춘 신경 아키텍처 탐색과 지식 증류 기법의 강력한 가능성을 보여 줍니다.
그러나 프로덕션 환경에 바로 적용할 수 있는 솔루션을 찾는 개발자, 연구자, 기업에는 Ultralytics YOLO26이 더 나은 선택입니다. 엔드투엔드 NMS 프리 설계, 크게 향상된 CPU 추론 성능, 멀티태스크 활용성, 체계적으로 유지 관리되는 Ultralytics 에코시스템과의 통합을 갖춘 YOLO26은 오늘날 실제 컴퓨터 비전 과제를 해결하기 위한 가장 견고하고 실용적인 도구입니다.
Ultralytics 에코시스템의 다른 모델을 살펴보려는 사용자를 위해 YOLO11, YOLOv8, Transformer 기반 RT-DETR에 대한 포괄적인 문서를 제공합니다.