YOLO26과 YOLOv9 비교#
컴퓨터 비전 분야는 빠르게 발전하고 있으며, 새로운 아키텍처가 지속적으로 속도와 정확도의 한계를 넓히고 있습니다. 이 기술 비교에서는 실시간 객체 탐지 분야에서 큰 영향력을 발휘한 두 모델인 YOLO26과 YOLOv9의 차이를 살펴봅니다. 두 모델 모두 뚜렷한 아키텍처 혁신을 제공하지만, 적합한 도구를 선택하려면 성능상의 장단점, 배포 역량, 하드웨어 요구 사항을 이해하는 것이 중요합니다.
YOLO26: 엣지 최적화의 강자#
2026년 초에 출시된 Ultralytics YOLO26은 배포 효율성과 모델 학습 안정성 측면에서 세대적 도약을 보여 줍니다. 네이티브 엔드 투 엔드 프레임워크로 설계되어, 엣지 AI 애플리케이션에서 기존에 문제가 되었던 배포 병목 현상을 직접 해결합니다.
모델 세부 정보:
- 저자: Glenn Jocher 및 Jing Qiu
- 조직: Ultralytics
- 날짜: 2026-01-14
- GitHub: Ultralytics 저장소
- 문서: YOLO26 문서
아키텍처 및 혁신#
YOLO26은 엔드 투 엔드 NMS 프리 설계를 도입해 후처리 파이프라인을 근본적으로 재설계했습니다. 선택적 일대일 헤드(nms=False)를 사용해 실행하면 모델이 비최대 억제(NMS)를 생략하여 지연 시간의 변동 폭을 크게 줄입니다. 따라서 특히 ONNX 및 Apple CoreML과 같은 프레임워크로 내보낼 때 모바일 및 엣지 플랫폼에 훨씬 쉽게 배포할 수 있습니다.
또한 분포 초점 손실(DFL)을 제거해 내보내기 과정을 간소화하고 저전력 마이크로컨트롤러와의 호환성을 높였습니다. 학습 안정성을 개선하기 위해 YOLO26은 확률적 경사 하강법(SGD)과 Muon을 결합한 하이브리드이자 대규모 언어 모델 학습 혁신에서 영감을 얻은 새로운 MuSGD 옵티마이저를 통합했습니다. 이를 통해 까다로운 데이터셋 전반에서 더 빠르게 수렴하고 더욱 견고하게 특징을 추출합니다.
아키텍처를 간소화하고 DFL을 제거한 덕분에 YOLO26은 CPU 추론 속도를 최대 43% 향상하여 Raspberry Pi 또는 NVIDIA Jetson Nano와 같은 리소스 제약이 있는 엣지 디바이스에 이상적인 선택입니다.
드론 항공 이미지와 같이 탐지가 매우 까다로운 장면의 객체를 탐지하기 위해 YOLO26은 업데이트된 ProgLoss + STAL 손실 함수를 활용합니다. 이 손실 함수는 작은 객체의 인식 재현율을 크게 높입니다. 또한 인스턴스 세그멘테이션을 위한 멀티스케일 프로토, 자세 추정을 위한 잔차 로그 가능도 추정(RLE), 방향성 바운딩 박스(OBB) 탐지를 위한 특수 각도 손실 등 작업별 개선 사항도 제공합니다.
YOLOv9: 프로그래밍 가능한 그래디언트 정보#
2024년 초에 공개된 YOLOv9은 학습 단계에서 신경망의 그래디언트 흐름 처리 방식에 이론적 발전을 가져왔으며, 파라미터 효율성과 심층 특징 보존에 중점을 둡니다.
모델 세부 정보:
- 저자: Chien-Yao Wang 및 Hong-Yuan Mark Liao
- 기관: 대만 중앙연구원 정보과학연구소
- 날짜: 2024-02-21
- Arxiv: YOLOv9 논문
- GitHub: YOLOv9 저장소
- 문서: YOLOv9 문서
아키텍처 및 강점#
YOLOv9은 프로그래밍 가능한 그래디언트 정보(PGI)와 일반화된 효율적 계층 집계 네트워크(GELAN)를 중심으로 구축되었습니다. 이 개념들은 심층 신경망에서 흔히 나타나는 정보 병목 문제를 해결합니다. 순전파 과정에서 필수 정보를 보존함으로써 GELAN은 가중치 업데이트에 사용되는 그래디언트의 신뢰성을 유지합니다. 이 아키텍처는 높은 정확도를 제공하며, PyTorch 프레임워크를 사용한 신경망 이론 및 그래디언트 경로 최적화 연구에 YOLOv9을 강력한 후보로 만듭니다.
제한 사항#
파라미터 효율성은 뛰어나지만, YOLOv9은 바운딩 박스 후처리에 기존 NMS를 크게 의존하므로 엣지 디바이스에서 추론할 때 연산 병목이 발생할 수 있습니다. 또한 공식 저장소는 객체 탐지에 주로 초점을 맞추고 있어 추적이나 자세 추정과 같은 특수 작업에 적용하려면 상당한 맞춤 엔지니어링이 필요합니다.
성능 비교#
실제 배포를 위해 이러한 모델을 평가할 때는 정확도(mAP), 추론 속도, 메모리 사용량 간의 균형이 중요합니다. Ultralytics 모델은 학습과 추론 중 메모리 요구량이 적은 것으로 잘 알려져 있으며, RT-DETR과 같은 Transformer 기반 대안보다 훨씬 적은 CUDA 메모리를 사용합니다.
다음은 COCO 데이터셋에서 YOLO26과 YOLOv9의 성능을 직접 비교한 결과입니다. 각 열의 최상위 값은 굵게 표시했습니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
참고: YOLOv9의 CPU 속도는 NMS 설정에 따라 크게 달라지고 일반적으로 YOLO26의 네이티브 NMS 프리 구현보다 느리므로 생략했습니다.
사용 사례 및 권장 사항#
YOLO26과 YOLOv9 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.
YOLO26을 선택해야 하는 경우#
YOLO26은 다음과 같은 경우에 적합합니다:
- NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
- 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.
YOLOv9을 선택해야 하는 경우#
다음과 같은 경우 YOLOv9을 권장합니다:
- 정보 병목 연구: 프로그래밍 가능한 그래디언트 정보(PGI) 및 일반화된 효율적 계층 집계 네트워크(GELAN) 아키텍처를 연구하는 학술 프로젝트입니다.
- 그래디언트 흐름 최적화 연구: 학습 중 심층 네트워크 계층의 정보 손실을 이해하고 완화하는 데 초점을 둔 연구입니다.
- 고정확도 탐지 벤치마킹: 아키텍처 비교의 기준점으로 YOLOv9의 우수한 COCO 벤치마크 성능이 필요한 시나리오입니다.
Ultralytics의 강점#
모델 선택은 정확도 벤치마크만 확인하는 것 이상의 의미가 있습니다. 데이터 수집부터 프로덕션까지 얼마나 빠르게 진행할 수 있는지는 이를 뒷받침하는 소프트웨어 생태계에 달려 있습니다.
사용 편의성 및 생태계#
Ultralytics Python API는 원활한 "초보에서 전문가로"의 경험을 제공합니다. 복잡한 저장소를 복제하거나 분산 학습 스크립트를 수동으로 구성할 필요 없이, 개발자는 pip을 통해 패키지를 설치하고 즉시 학습을 시작할 수 있습니다. 활발하게 관리되는 Ultralytics 생태계는 빈번한 업데이트, Weights & Biases와 같은 ML 플랫폼과의 자동화된 통합, 광범위한 문서를 제공합니다.
다양한 비전 작업에 적용#
YOLOv9이 주로 탐지 엔진인 반면, YOLO26은 범용 비전 도구입니다. 통합된 단일 구문을 사용하면 객체 탐지에서 픽셀 단위로 정밀한 이미지 세그멘테이션이나 전체 이미지 분류로 쉽게 전환할 수 있습니다. 이러한 유연성은 서로 다른 컴퓨터 비전 기능을 위해 여러 개의 분리된 코드베이스를 유지 관리할 때 발생하는 기술 부채를 줄여 줍니다.
효율적인 학습 및 배포#
학습 효율성은 Ultralytics 철학의 핵심입니다. YOLO26은 쉽게 구할 수 있는 사전 학습 가중치를 활용하며, 대규모 비전 Transformer에 비해 메모리 사용량이 훨씬 적습니다. 학습이 완료되면 내장된 내보내기 파이프라인을 사용해 TensorRT 또는 LiteRT와 같은 최적화된 형식으로 클릭 한 번에 변환할 수 있어 프로덕션 배포 과정을 간소화합니다.
코드 예제: YOLO26 시작하기#
YOLO26 구현은 매우 간단합니다. 다음 Python 코드 예제는 사전 학습 모델을 불러와 사용자 정의 데이터로 학습하고 Ultralytics API를 사용해 추론하는 방법을 보여 줍니다.
from ultralytics import YOLO
# 최신 최첨단 YOLO26 나노 모델 불러오기
model = YOLO("yolo26n.pt")
# COCO8 데이터셋으로 모델 학습하기(optimizer='auto'는 학습 시간이 긴 경우 MuSGD를 선택함)
results = model.train(
data="coco8.yaml",
epochs=100,
imgsz=640,
device=0, # GPU 0을 사용하거나, CPU 학습에는 'cpu' 사용
)
# 샘플 이미지에서 NMS 프리 추론 실행하기
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# 바운딩 박스 및 신뢰도 표시하기
predictions[0].show()YOLO26의 속도와 간소화된 아키텍처, 강력한 생태계를 활용하면 팀은 그 어느 때보다 빠르게, 더 적은 기술적 장애물로 고급 비전 AI 애플리케이션을 시장에 선보일 수 있습니다.