YOLOv10 대 DAMO-YOLO#
최신 컴퓨터 비전 파이프라인을 구축할 때 적합한 실시간 객체 검출 아키텍처를 선택하는 것은 매우 중요합니다. 이 종합적인 기술 분석에서는 YOLOv10과 DAMO-YOLO의 아키텍처, 성능 지표 및 이상적인 사용 사례를 살펴봅니다. 두 모델 모두 객체 검출 성능을 크게 향상했지만, 목표를 달성하기 위해 서로 다른 아키텍처 경로를 선택합니다.
프로젝트에 제한된 엣지 AI 하드웨어에 배포해야 하거나 클라우드 GPU에서 최고의 정확도를 요구하는 경우와 관계없이, 이러한 아키텍처의 세부적인 차이를 이해하면 정보에 기반한 결정을 내리는 데 도움이 됩니다.
YOLOv10 살펴보기#
칭화대학교 연구진이 발표한 YOLOv10은 네이티브 엔드 투 엔드 접근 방식을 도입하여 YOLO 제품군을 혁신했으며, 후처리 과정에서 비최대 억제(NMS)가 필요하지 않도록 했습니다.
YOLOv10 세부 정보:
- 저자: Ao Wang, Hui Chen, Lihao Liu 외
- 기관: 칭화대학교
- 날짜: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- Docs: https://docs.ultralytics.com/models/yolov10
주요 아키텍처 특징#
YOLOv10의 핵심 혁신은 NMS가 필요 없는 학습을 위한 일관된 이중 할당 전략입니다. 기존 객체 검출기는 겹치는 바운딩 박스를 필터링하기 위해 NMS에 크게 의존하며, 이로 인해 자율주행 차량과 고속 로보틱스 같은 실시간 애플리케이션에서 상당한 병목 현상인 예측하기 어려운 지연 시간이 발생합니다. YOLOv10은 객체마다 최적의 바운딩 박스 하나를 직접 예측하여 예측 가능한 초저지연 추론을 달성합니다.
또한 이 모델은 전체적인 효율성-정확도 중심 설계를 적용합니다. 아키텍처는 경량 분류 헤드와 공간-채널 분리 다운샘플링을 비롯한 다양한 구성 요소를 최적화하여 계산 중복을 크게 줄입니다. 그 결과, 경쟁력 있는 평균 정밀도(mAP)를 유지하면서도 파라미터 수와 FLOPs가 더 적은 아키텍처가 구현됩니다.
사용 예시#
YOLOv10은 Ultralytics 생태계에 긴밀하게 통합되어 있어 Ultralytics Python 패키지를 통해 매우 쉽게 사용할 수 있습니다.
from ultralytics import YOLO
# Load a pre-trained YOLOv10 nano model
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Export the model to TensorRT format
model.export(format="engine", quantize=16)DAMO-YOLO 살펴보기#
Alibaba Group에서 개발한 DAMO-YOLO는 자동화된 신경망 아키텍처 탐색(NAS)을 통해 매우 효율적인 네트워크 구조를 찾는 데 중점을 두며, 속도와 정확도의 파레토 프런티어를 확장하는 것을 목표로 합니다.
DAMO-YOLO 세부 정보:
- 저자: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang, Xiuyu Sun
- 조직: Alibaba Group
- 날짜: 2022-11-23
- Arxiv: https://arxiv.org/abs/2211.15444v2
- GitHub: https://github.com/tinyvision/DAMO-YOLO
주요 아키텍처 특징#
DAMO-YOLO는 산업용 애플리케이션에 맞춘 여러 가지 새로운 기술을 도입합니다. 이 모델의 기반은 최대 엔트로피 유도 탐색을 통해 생성된 **MAE-NAS 백본(MAE-NAS Backbone)**입니다. 이 자동화된 프로세스는 사전 정의된 연산 예산표를 엄격히 준수하는 백본 구조를 찾아내며, 정확도와 추론 지연 시간 간의 미세한 균형을 맞춥니다.
또한 이 아키텍처는 Efficient RepGFPN Neck을 사용합니다. 이 Feature Pyramid Network는 서로 다른 스케일의 Feature Fusion을 개선하도록 설계되었으며, 객체 크기가 크게 달라지는 항공 이미지 분석과 같은 복잡한 작업에 매우 중요합니다. 이를 보완하기 위해 DAMO-YOLO는 최종 예측 레이어의 복잡도를 크게 줄이는 미니멀리스트 검출 헤드인 ZeroHead를 구현하여 추론 중 귀중한 계산 시간을 절약합니다.
성능 비교#
객체 검출 아키텍처를 평가할 때는 추론 속도, 파라미터 효율성 및 검출 정확도 사이의 적절한 균형을 찾는 것이 가장 중요합니다. 아래 표에서는 각 모델 크기에 따른 YOLOv10과 DAMO-YOLO의 성능을 비교합니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
벤치마크에서 확인할 수 있듯이 YOLOv10은 TensorRT에서 일관되게 뛰어난 지연 시간 특성을 제공하며, 특히 nano 변형에서 DAMO-YOLO의 동급 모델보다 훨씬 적은 파라미터와 FLOPs를 사용합니다. DAMO-YOLO는 tiny 변형에서 높은 mAP를 제공하지만, YOLOv10 제품군의 파라미터 효율성과 추론 지연 시간은 제한된 배포 환경에서 뚜렷한 이점을 제공합니다.
사용 사례 및 권장 사항#
YOLOv10과 DAMO-YOLO 중 무엇을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.
YOLOv10을 선택해야 하는 경우#
YOLOv10은 다음과 같은 경우에 적합합니다:
- NMS-Free 실시간 탐지: 비최대 억제 없이 엔드투엔드 탐지의 이점을 활용하여 배포 복잡성을 줄이는 애플리케이션입니다.
- 균형 잡힌 속도-정확도 절충: 다양한 모델 규모에서 추론 속도와 탐지 정확도 사이의 뛰어난 균형이 필요한 프로젝트입니다.
- 일관된 지연 시간이 필요한 애플리케이션: 로보틱스 또는 자율 시스템과 같이 예측 가능한 추론 시간이 중요한 배포 시나리오입니다.
DAMO-YOLO를 선택해야 하는 경우#
다음과 같은 경우 DAMO-YOLO를 권장합니다.
- High-Throughput Video Analytics: batch-1 throughput이 주요 metric인 고정 NVIDIA GPU infrastructure에서 high-FPS video stream을 처리하는 경우입니다.
- Industrial Manufacturing Lines: assembly line에서의 real-time quality inspection과 같이 전용 하드웨어에서 엄격한 GPU latency constraint가 있는 경우입니다.
- Neural Architecture Search Research: automated architecture search(MAE-NAS)와 효율적인 reparameterized backbone이 detection performance에 미치는 영향을 연구하는 경우입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.
- NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
- 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.
Ultralytics의 강점#
두 모델 모두 기술적으로 인상적이지만, 프로덕션을 위한 아키텍처를 선택할 때는 단순한 성능 지표 이상의 요소를 고려해야 합니다. Ultralytics 생태계가 네이티브로 지원하는 모델을 사용하면 개발자와 연구자 모두에게 비교할 수 없는 이점을 제공합니다.
사용 편의성과 체계적으로 유지 관리되는 생태계#
자주 방치되는 독립형 학술 리포지토리와 달리, Ultralytics는 강력하고 활발하게 유지 관리되는 생태계를 제공합니다. NAS 파이프라인에 크게 의존하는 모델을 위해 복잡한 환경을 설정하는 일은 부담스러울 수 있습니다. 반면 Ultralytics는 광범위한 문서를 기반으로 표준화되고 직관적인 Python API와 강력한 CLI를 제공합니다. 이를 통해 맞춤형 비전 솔루션의 출시까지 걸리는 시간을 크게 단축할 수 있습니다.
학습 효율성 및 메모리 요구 사항#
대규모 모델을 학습하면 계산 비용이 빠르게 증가할 수 있습니다. Ultralytics YOLO 아키텍처는 학습 및 추론 중 낮은 CUDA 메모리 사용량으로 오랫동안 알려져 왔습니다. 이러한 효율성 덕분에 개발자는 소비자용 하드웨어나 비용 효율적인 클라우드 인스턴스에서 모델을 학습할 수 있으며, RT-DETR과 같은 Transformer 기반 모델을 사용할 때 흔히 발생하는 메모리 부족 오류도 방지할 수 있습니다.
Ultralytics는 주요 MLOps 도구와 네이티브로 통합됩니다. Weights & Biases, Comet 또는 ClearML과의 통합을 사용하면 추가적인 보일러플레이트 코드 없이 모델 학습 진행 상황을 쉽게 추적할 수 있습니다.
다양한 작업 지원#
많은 특화 검출 모델의 주요 한계는 초점이 좁다는 것입니다. Ultralytics 생태계에서는 객체 검출에만 국한되지 않습니다. 도구가 컴퓨터 비전 작업 전반으로 원활하게 확장되며, 여기에는 인스턴스 세그멘테이션, 이미지 분류, 포즈 추정 및 방향성 바운딩 박스(OBB) 검출이 포함됩니다.
미래를 향해: YOLO26의 진화#
YOLOv10이 NMS가 필요 없는 추론을 개척하고 DAMO-YOLO가 NAS의 강력한 성능을 보여주었지만, 컴퓨터 비전 분야는 빠르게 발전하고 있습니다. 최고 수준의 최첨단 솔루션을 찾는 개발자에게는 Ultralytics YOLO26을 확인해 보시기를 권장합니다.
YOLO11의 확정적 후속 모델로 출시된 YOLO26은 YOLOv10이 구축한 NMS가 필요 없는 기반을 계승하면서 이를 크게 발전시켰습니다.
YOLO26의 주요 발전 사항은 다음과 같습니다:
- 최대 43% 더 빠른 CPU 추론: 엣지 컴퓨팅 및 저전력 디바이스에 맞춰 특별히 최적화되었습니다.
- DFL 제거: Distribution Focal Loss를 제거하여 Export를 간소화하고 다양한 배포 대상과의 호환성을 향상했습니다.
- MuSGD Optimizer: SGD와 Muon을 결합한 하이브리드 Optimizer로, 고급 LLM 학습 안정성과 더 빠른 수렴을 컴퓨터 비전에 직접 적용합니다.
- ProgLoss + STAL: 손실 함수를 크게 개선하여 소형 객체 인식 성능을 향상합니다. 이는 농업 및 원격 탐사와 같은 사용 사례에 필수적입니다.
새롭게 개편된 Ultralytics Platform을 활용하면 개발자는 YOLO26과 같은 차세대 모델에 주석을 추가하고, 학습하며, 배포하는 작업을 몇 번의 클릭만으로 원활하게 수행할 수 있어 컴퓨터 비전 파이프라인을 최첨단이면서도 미래에 대비된 상태로 유지할 수 있습니다.