Ultralytics YOLO27:
Get Started

YOLOv6-3.0과 YOLOv9#

실시간 객체 탐지는 더 높은 정확도, 더 낮은 지연 시간, 향상된 하드웨어 활용률에 대한 요구에 따라 계속 발전하고 있습니다. 이 종합 비교에서는 산업용 처리량을 위해 개발된 YOLOv6-3.0과 딥러닝의 정보 병목을 극복하기 위해 새로운 아키텍처를 도입한 YOLOv9이라는 두 가지 중요한 이정표를 살펴봅니다.

두 모델 모두 독창적인 아키텍처 혁신을 제공하지만, 성능과 배포 간편성의 최적 균형을 원하는 개발자는 종종 최신 생태계로 전환합니다. 새로운 프로젝트를 시작한다면 기본적으로 엔드투엔드 방식인 Ultralytics YOLO26을 권장합니다. 훨씬 간소화된 개발자 경험과 함께 최첨단 정확도를 제공합니다.

YOLOv6-3.0: 산업용 처리량 최적화#

Meituan의 Vision AI 부서에서 개발한 YOLOv6-3.0은 특히 GPU 하드웨어를 사용하는 산업 애플리케이션에서 처리량을 극대화하도록 집중적으로 설계되었습니다.

  • 저자: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, Xiangxiang Chu
  • 조직: Meituan
  • 날짜: 2023년 1월 13일
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

아키텍처 혁신#

YOLOv6-3.0은 특징 융합과 하드웨어 효율성을 향상하기 위해 몇 가지 주요 변경 사항을 도입했습니다. 아키텍처의 넥에는 더 정확한 위치 추정 신호를 제공하는 양방향 연결(BiC) 모듈이 포함되어 있습니다. 또한 앵커 지원 학습(AAT) 전략을 활용합니다. 이 접근 방식은 앵커 기반 학습의 풍부한 가이드와 앵커 프리 방식의 추론 속도를 결합하여 배포 속도를 늦추지 않으면서 성능을 향상합니다.

백본은 GPU 추론에 적합하도록 세심하게 최적화된 EfficientRep 설계를 기반으로 합니다. 따라서 고부하 배치 처리가 일반적인 산업 제조 시나리오에 매우 적합합니다.

장점과 단점#

YOLOv6-3.0의 주요 강점은 NVIDIA T4와 같은 GPU에서 높은 프레임률을 제공한다는 점이며, 고밀도 비디오 이해 스트림에 적합합니다. 그러나 특정 하드웨어 최적화에 크게 의존하므로 CPU 전용 엣지 디바이스에서는 최적이 아닌 지연 시간이 발생할 수 있습니다. 또한 통합 프레임워크에 비해 학습 파이프라인 설정이 복잡할 수 있습니다.

YOLOv6에 대해 자세히 알아보기

YOLOv9: 프로그래밍 가능한 그래디언트 정보#

1년 뒤 출시된 YOLOv9은 심층 신경망에 내재된 정보 병목 문제를 해결하고 CNN 아키텍처의 이론적 한계를 넓히는 데 주력합니다.

아키텍처 혁신#

YOLOv9의 주요 기여는 프로그래밍 가능 경사도 정보(PGI)로, 중요한 데이터가 여러 네트워크 레이어를 통과하는 동안 유지되도록 해 더 신뢰할 수 있는 가중치 업데이트를 지원합니다. PGI와 함께 이 모델에는 일반화 효율적 레이어 집계 네트워크(GELAN)가 적용되었습니다. GELAN은 파라미터 효율성을 극대화하여 YOLOv9이 많은 이전 모델보다 적은 계산 FLOPs로 더 높은 정확도를 달성하도록 합니다.

장점과 단점#

YOLOv9은 COCO와 같은 벤치마크 데이터셋에서 뛰어난 평균 정밀도(mAP)를 달성하므로 순수 정확도를 중시하는 연구자들에게 인기가 높습니다. 그러나 YOLOv6과 마찬가지로 후처리에 기존 비최대 억제(NMS)를 사용합니다. 이로 인해 지연 시간이 늘어나고, 특히 ONNX 또는 TensorRT와 같은 형식을 사용해 엣지 디바이스로 포팅할 때 모델 배포 파이프라인이 복잡해집니다.

YOLOv9에 대해 자세히 알아보기

성능 비교#

이러한 모델을 비교할 때는 정확도, 파라미터 수, 추론 속도 간의 균형을 살펴보는 것이 중요합니다.

모델크기
(픽셀)
mAP검증
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Ultralytics의 강점: YOLO26 소개#

YOLOv6-3.0과 YOLOv9은 견고한 아키텍처를 제공하지만, 프로덕션 환경에는 잘 관리되는 생태계, 낮은 메모리 요구량, 뛰어난 사용 편의성이 필요합니다. Ultralytics Platform과 YOLO11 및 최첨단 YOLO26과 같은 모델이 두각을 나타내는 이유가 바로 여기에 있습니다.

2026년 초에 출시된 YOLO26은 기존 병목을 제거해 배포 효율성을 근본적으로 새롭게 정의합니다.

기본 엔드투엔드 설계

YOLO26은 엔드투엔드 NMS 프리 설계를 특징으로 합니다. 선택적 원투원 헤드(nms=False)를 통해 비최대 억제 후처리가 필요하지 않습니다. 이로써 추론 지연 시간의 편차가 크게 줄고 엣지 배포 로직이 간소화됩니다.

YOLO26의 주요 혁신#

  1. MuSGD 옵티마이저: LLM 학습(Moonshot AI의 Kimi K2 등)에서 영감을 얻은 YOLO26은 SGD와 Muon의 하이브리드 방식을 사용합니다. 이를 통해 컴퓨터 비전 작업에서 탁월한 학습 안정성과 더 빠른 수렴을 구현합니다.
  2. 최대 43% 빠른 CPU 추론: YOLO26은 YOLOv6의 강력한 GPU 중심 설계와 달리 엣지 디바이스에 최적화되어 있습니다. Distribution Focal Loss(DFL)를 제거해 헤드를 간소화하므로 저전력 CPU 및 엣지 컴퓨팅 하드웨어와 호환성이 뛰어납니다.
  3. ProgLoss + STAL: 고급 손실 함수는 소형 객체 탐지를 크게 향상하며, 이는 항공 이미지 분석과 로보틱스에 매우 중요합니다.
  4. 탁월한 유연성: YOLOv6이 탐지 전용 엔진인 반면, YOLO26은 인스턴스 분할, 분류, 자세 추정, 방향 바운딩 박스(OBB) 탐지를 원활하게 처리합니다.

Ultralytics를 통한 원활한 학습#

최첨단 모델을 학습하기 위해 복잡한 bash 스크립트가 필요해서는 안 됩니다. Ultralytics Python API는 자동 데이터 로드, 최소한의 CUDA 메모리 사용량, 기본 제공 추적 기능으로 간소화된 경험을 제공합니다.

from ultralytics import YOLO

# 최첨단 YOLO26 나노 모델을 로드합니다
model = YOLO("yolo26n.pt")

# COCO8 데이터셋에서 학습 (optimizer='auto'는 학습 실행 시간이 길수록 MuSGD를 선택합니다)
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# 단일 명령으로 학습된 모델을 ONNX로 내보내기
model.export(format="onnx")

적합한 사용 사례#

적절한 아키텍처는 전적으로 목표 배포 환경에 따라 달라집니다:

  • YOLOv6-3.0 사용: A100과 같은 서버급 GPU가 충분하고 배치 처리로 처리량을 극대화할 수 있는 공장 자동화 및 결함 탐지에 적합합니다.
  • YOLOv9 사용: COCO와 같은 표준화된 데이터셋에서 가능한 한 가장 높은 mAP를 달성하는 것이 주목표인 학술 연구나 대회에 적합합니다.
  • YOLO26 사용: 거의 모든 현대 상용 애플리케이션에 적합합니다. 선택적 NMS 프리 추론, 적은 메모리 사용량, 빠른 CPU 추론 덕분에 보안 경보 시스템, 스마트 리테일, 임베디드 디바이스의 실시간 객체 추적에 이상적입니다.

포괄적인 Ultralytics 생태계를 활용하면 개발자는 YOLOv8, YOLO11, YOLO26을 쉽게 실험하여 구체적인 실제 문제에 가장 적합한 성능 균형을 찾을 수 있습니다.

댓글