YOLOv9와 YOLOv10 비교#
실시간 computer vision 분야는 연구자들이 성능과 효율성의 경계를 지속적으로 확장하면서 크게 발전해 왔습니다. 최신 vision 모델의 발전 과정을 분석할 때 YOLOv9와 YOLOv10은 두 가지 중요한 이정표로 평가됩니다. 2024년 초에 출시된 두 모델은 정보 병목부터 후처리 지연 시간까지, 심층 신경망의 오랜 과제를 해결하기 위해 패러다임을 전환하는 아키텍처 설계를 도입했습니다.
이 포괄적인 기술 비교에서는 두 모델의 아키텍처, 성능 지표 및 이상적인 배포 시나리오를 살펴보고, 최신 객체 감지 생태계의 복잡성을 탐색하는 데 도움을 드립니다.
모델의 기원과 아키텍처 혁신#
특정 computer vision 프로젝트에 적합한 아키텍처를 선택하려면 이러한 모델의 계보와 이론적 기반을 이해하는 것이 중요합니다.
YOLOv9: 정보 흐름의 정교한 제어#
2024년 2월 21일에 공개된 YOLOv9는 데이터가 심층 신경망을 통과할 때 발생하는 정보 손실이라는 이론적 문제를 해결합니다.
- 저자: Chien-Yao Wang 및 Hong-Yuan Mark Liao
- 기관: 대만 중앙연구원 정보과학연구소
- 참고 문헌: YOLOv9 arXiv 논문
- 저장소: YOLOv9 GitHub
YOLOv9는 CSPNet과 ELAN의 강점을 결합하여 매개변수 활용도를 극대화하는 **일반화 효율적 계층 집계 네트워크(GELAN)**를 도입합니다. 또한 심층 계층이 중요한 공간 정보를 유지하도록 보장하는 보조 supervision 메커니즘인 **프로그래밍 가능한 그래디언트 정보(PGI)**를 사용합니다. 이를 통해 YOLOv9는 의료 영상 분석이나 원거리 감시처럼 높은 feature 충실도가 필요한 작업에서 특히 강력한 성능을 발휘합니다.
YOLOv10: 실시간 엔드투엔드 효율성#
2024년 5월 23일에 곧이어 출시된 YOLOv10은 객체 감지에서 가장 악명 높은 지연 시간 병목 중 하나인 비최대 억제(NMS)를 제거하여 배포 파이프라인을 새롭게 설계합니다.
- 저자: Ao Wang, Hui Chen, Lihao Liu 외
- 기관: 칭화대학교
- 참고 문헌: YOLOv10 arXiv 논문
- 저장소: YOLOv10 GitHub
YOLOv10은 학습 중 일관된 이중 할당을 사용하여 네이티브 NMS-free 설계를 구현합니다. 이를 통해 추론 중 후처리 오버헤드가 제거되어 지연 시간이 크게 줄어듭니다. 전체적인 효율성과 정확도를 고려한 모델 설계가 결합된 YOLOv10은 경쟁력 있는 정밀도를 유지하면서 연산 오버헤드(FLOPs)를 낮추어 뛰어난 균형을 달성하므로, 엣지 컴퓨팅 애플리케이션에 매우 매력적인 선택지입니다.
성능 및 지표 비교#
표준 MS COCO 데이터셋에서 이 두 강력한 모델을 벤치마킹하면 순수 정확도와 추론 지연 시간 사이에서 뚜렷한 trade-off가 나타납니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
데이터 분석#
- 지연 시간과 정확도: YOLOv10 모델은 일반적으로 더 우수한 추론 속도를 제공합니다. 예를 들어 YOLOv10s는 TensorRT에서 2.66ms 만에 46.7% mAP를 달성하는 반면, YOLOv9s는 거의 동일한 46.8% mAP를 달성하는 데 3.54ms가 필요합니다.
- 최상위 정밀도: 최고의 감지 정확도가 필요한 연구 시나리오에서는 YOLOv9e가 여전히 강력한 선택지이며, 인상적인 55.6% mAP에 도달합니다. PGI 아키텍처는 미세한 feature를 안정적으로 추출하도록 보장합니다.
- 효율성: YOLOv10은 FLOPs 효율성에서 뛰어난 성능을 보입니다. 이는 배터리로 작동하는 기기에서 실행되는 vision AI 모델에 중요한 지표인 낮은 전력 소비로 직접 이어집니다.
CPU 또는 Raspberry Pi와 같은 리소스가 제한된 엣지 하드웨어에 배포하는 경우, YOLOv10의 NMS-free 아키텍처는 비결정적 후처리 단계를 제거하여 일반적으로 더 원활한 파이프라인을 제공합니다.
Ultralytics의 강점: 학습 및 생태계#
아키텍처 차이도 중요하지만, 프로젝트의 성공 여부는 주변 software 생태계에 크게 좌우됩니다. YOLOv9와 YOLOv10은 모두 Ultralytics 생태계에 완전히 통합되어 탁월한 개발자 경험을 제공합니다.
사용 편의성과 메모리 효율성#
막대한 메모리 팽창으로 어려움을 겪는 복잡한 Transformer 기반 아키텍처와 달리, Ultralytics YOLO 모델은 최적의 GPU 메모리 사용을 위해 설계되었습니다. 이를 통해 연구자들은 일반 소비자용 하드웨어에서 더 큰 배치 크기를 사용할 수 있으므로, 최신 AI 기술에 더욱 쉽게 접근할 수 있습니다.
통합 Python API는 데이터 증강 및 하이퍼파라미터 튜닝의 복잡성을 추상화합니다. weight 파일 문자열만 변경하면 아키텍처 간에 원활하게 전환할 수 있습니다.
from ultralytics import YOLO
# Load a YOLOv10 model (Easily swap to "yolov9c.pt" for YOLOv9)
model = YOLO("yolov10n.pt")
# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Validate the model's performance
metrics = model.val()
# Export the trained model to ONNX format for deployment
model.export(format="onnx")MLflow에 metric을 기록하거나 고속 하드웨어 배포를 위해 TensorRT로 export해야 하는 경우에도 Ultralytics 플랫폼이 이를 네이티브로 처리합니다.
이상적인 사용 사례#
이러한 모델 중 선택은 배포 제약 조건에 따라 달라집니다.
- YOLOv9를 선택해야 하는 경우: GELAN 아키텍처의 feature 보존이 가장 높은 충실도를 제공하는 항공 드론 이미지나 작은 종양 감지와 같은 소형 객체 감지 작업을 수행하는 경우입니다.
- YOLOv10을 선택해야 하는 경우: 엣지 디바이스에서의 실시간 추론이 주요 목표인 경우입니다. NMS-free 설계는 자율 로보틱스, 실시간 교통 모니터링 및 스마트 감시에 적합합니다.
미래 대비: YOLO26으로의 전환#
YOLOv8, YOLOv9 및 YOLOv10은 뛰어난 모델이지만, 최신 AI 솔루션을 구축하려는 개발자는 2026년 1월에 출시된 **Ultralytics YOLO26**을 고려해야 합니다.
YOLO26은 이전 세대의 궁극적인 종합 모델로, YOLOv9의 정확도와 YOLOv10의 효율성에서 가장 뛰어난 요소를 결합합니다.
YOLO26의 주요 혁신#
- 엔드투엔드 NMS-free 설계: YOLOv10이 마련한 기반을 바탕으로 YOLO26은 더 간단한 배포를 위해 NMS 후처리를 네이티브로 제거합니다.
- MuSGD Optimizer: SGD와 Muon의 하이브리드로, 고급 LLM 학습 혁신을 computer vision에 도입하여 매우 안정적이고 빠른 수렴을 구현합니다.
- 최대 43% 더 빠른 CPU 추론: 엣지 컴퓨팅 및 전용 GPU가 없는 디바이스에 맞게 특별히 최적화되었습니다.
- DFL 제거: Distribution Focal Loss를 제거하여 모델 export를 간소화하고 저전력 디바이스 호환성을 향상했습니다.
- ProgLoss + STAL: 이러한 개선된 loss 함수는 소형 객체 인식에서 눈에 띄는 성능 향상을 제공하여 YOLOv9의 기능과 동등하거나 이를 뛰어넘습니다.
기존 아키텍처를 평가하는 연구자에게는 RT-DETR과 YOLO11도 Ultralytics 생태계에서 잘 문서화된 대안입니다. 그러나 모든 vision 작업에서 최대한의 활용성을 확보하려면 Ultralytics Platform에서 YOLO26으로 전환하여 오픈 소스 vision AI의 정점을 활용하는 것이 좋습니다.