Ultralytics YOLO27:
Get Started

YOLOv6-3.0과 YOLOv7#

실시간 컴퓨터 비전의 발전은 아키텍처 효율성과 학습 방법론의 빠른 개선으로 이어져 왔습니다. 이 분야에 큰 영향을 준 대표적인 두 모델은 YOLOv6-3.0과 YOLOv7입니다. 두 프레임워크 모두 추론 속도와 탐지 정확도의 균형을 맞추는 새로운 기법을 도입했으며, 고급 서버 GPU부터 엣지 디바이스까지 다양한 배포 환경을 겨냥합니다.

이 포괄적인 기술 비교에서는 두 모델의 아키텍처, 성능 지표, 이상적인 사용 사례를 살펴보고, 최신 Ultralytics Platform과 최신 모델인 YOLO26이 이러한 기반 개념을 바탕으로 개발자에게 비교할 수 없는 경험을 제공하는 방식도 조명합니다.

YOLOv6-3.0: 산업용 처리량 최적화#

Meituan의 Vision AI 부서에서 개발한 YOLOv6-3.0은 고처리량 산업용 애플리케이션을 위해 명시적으로 설계되었습니다. 하드웨어 가속기에서 성능을 극대화하는 데 집중하므로 전용 GPU를 활용한 배치 처리가 가능한 환경에 적합합니다.

  • 저자: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, Xiangxiang Chu
  • 조직: Meituan
  • 날짜: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

아키텍처 혁신#

YOLOv6-3.0은 GPU 메모리 액세스 비용을 최적화하도록 설계된 하드웨어 친화적 아키텍처인 EfficientRep 백본을 사용합니다. 다양한 스케일의 특징 융합을 강화하기 위해 모델의 넥에 양방향 연결(BiC) 모듈을 도입했습니다. 이를 통해 네트워크는 이전 버전보다 복잡한 공간 계층 구조를 더 효과적으로 포착할 수 있습니다.

또한 YOLOv6-3.0은 앵커 지원 학습(AAT) 전략을 적용합니다. 이 접근법은 앵커 기반 학습의 풍부한 그래디언트 신호와 앵커 프리 추론의 간소한 배포 이점을 결합하여 후처리 속도를 희생하지 않으면서 모델이 더 안정적으로 수렴하도록 지원합니다.

YOLOv6에 대해 자세히 알아보기

하드웨어 고려 사항

YOLOv6-3.0은 서버급 GPU(예: NVIDIA T4)에서 뛰어난 성능을 발휘하지만, 특정 구조적 재매개변수화에 크게 의존하므로 최신 아키텍처와 비교했을 때 CPU에만 의존하는 엣지 디바이스에서는 간혹 지연 시간이 최적 수준에 미치지 못할 수 있습니다.

YOLOv7: 백 오브 프리 기능의 선구자#

Academia Sinica의 연구진이 출시한 YOLOv7은 다른 접근법을 취했습니다. 추론 비용은 늘리지 않으면서 그래디언트 경로 분석과 학습 시점 최적화에 집중했으며, 저자들은 이를 "학습 가능한 공짜 혜택 모음"이라고 부릅니다.

  • 저자: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
  • 기관: 대만 중앙연구원 정보과학연구소
  • 날짜: 2022-07-06
  • Arxiv: 2207.02696
  • GitHub: WongKinYiu/yolov7

아키텍처 혁신#

YOLOv7의 핵심은 확장형 효율적 계층 집계 네트워크(E-ELAN)입니다. E-ELAN은 원래 네트워크 토폴로지를 유지하면서 서로 다른 계층이 더욱 다양한 특징을 학습할 수 있도록 해 그래디언트 경로를 최적화합니다. 그 결과 최상위 수준의 평균 정밀도(mAP)를 달성할 수 있는 표현력이 높은 모델이 완성됩니다.

YOLOv7은 모델 재매개변수화도 폭넓게 활용해 추론 중 합성곱 계층을 배치 정규화와 병합합니다. 이를 통해 NVIDIA TensorRT 또는 ONNX와 같은 프레임워크로 배포할 때 파라미터 수를 줄이고 순전파 속도를 높입니다.

YOLOv7에 대해 자세히 알아보기

성능 비교#

MS COCO 데이터셋에서 이 모델들을 평가하면 YOLOv6의 초경량 변형 모델과 파라미터가 많고 정확도에 집중한 YOLOv7 아키텍처 사이의 뚜렷한 절충 관계를 확인할 수 있습니다.

모델크기
(픽셀)
mAP검증
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

데이터에 따르면 YOLOv6-3.0n은 추론 속도가 매우 빨라 고빈도 비디오 분석에 적합합니다. 반면 YOLOv7x는 가장 높은 mAP를 달성해 원시 프레임 속도보다 탐지 정확도가 중요한 작업에서 뛰어난 성능을 보입니다.

사용 사례 및 권장 사항#

YOLOv6과 YOLOv7 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약, 선호하는 에코시스템에 따라 달라집니다.

YOLOv6을 선택할 경우#

YOLOv6은 다음과 같은 경우에 적합합니다:

  • 산업용 하드웨어 고려 배포: 모델의 하드웨어 고려 설계와 효율적인 재매개변수화가 특정 대상 하드웨어에서 최적화된 성능을 제공하는 시나리오입니다.
  • 빠른 단일 단계 검출: 통제된 환경에서 실시간 비디오 처리를 위해 GPU에서의 순수 추론 속도를 우선시하는 애플리케이션입니다.
  • Meituan 생태계 통합: 이미 Meituan의 기술 스택 및 배포 인프라를 사용하는 팀입니다.

YOLOv7을 선택할 경우#

YOLOv7은 다음과 같은 경우에 권장됩니다.

  • 학술 벤치마킹: 2022년 당시의 최첨단 결과를 재현하거나 E-ELAN 및 학습 가능한 bag-of-freebies 기법의 효과를 연구하는 경우입니다.
  • 재파라미터화 연구: 계획된 재파라미터화 컨볼루션과 복합 모델 스케일링 전략을 조사하는 경우입니다.
  • 기존 커스텀 파이프라인: YOLOv7의 특정 아키텍처를 중심으로 구축되어 쉽게 리팩터링할 수 없는 맞춤형 파이프라인을 사용하는 프로젝트입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에는 성능과 개발자 경험을 가장 잘 조합한 Ultralytics YOLO26을 권장합니다.

  • NMS가 필요 없는 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관된 저지연 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 빠른 CPU 추론은 결정적인 이점을 제공합니다.
  • 작은 객체 탐지: 항공 드론 이미지나 IoT 센서 분석과 같이 작은 객체의 정확도를 ProgLoss와 STAL이 크게 높여 주는 까다로운 시나리오입니다.

Ultralytics의 장점: 미래로 나아가기#

YOLOv6-3.0과 YOLOv7은 중요한 이정표이지만, 서로 다른 저장소를 프로덕션 파이프라인에 통합하면 모델 배포와 하이퍼파라미터 튜닝에 어려움이 생기는 경우가 많습니다. Ultralytics 에코시스템은 간소화된 통합 인터페이스를 제공해 이러한 문제를 해결합니다.

Ultralytics를 선택해야 하는 이유#

  • 사용 편의성: Ultralytics Python API를 사용하면 몇 줄의 코드만으로 모델을 불러오고 학습하고 내보낼 수 있습니다. 이전 모델에서 최신 아키텍처로 전환할 때도 문자열 하나만 바꾸면 됩니다.
  • 잘 관리되는 에코시스템: Ultralytics는 자주 업데이트하고 활발한 커뮤니티 지원과 견고한 문서를 제공합니다.
  • 다목적성: 주로 바운딩 박스에 집중했던 이전 모델과 달리 Ultralytics 모델은 인스턴스 분할, 자세 추정, 방향성 바운딩 박스(OBB)를 비롯한 멀티태스크 학습을 기본적으로 지원합니다.
  • 메모리 요구량: Ultralytics YOLO 모델은 RT-DETR과 같은 Transformer 기반 아키텍처에 비해 학습 중 메모리 사용량이 적어 연구자가 일반 소비자용 하드웨어에서도 효과적으로 학습할 수 있습니다.

YOLO26으로 업그레이드#

최고 수준의 성능을 원하는 개발자에게 YOLO26(2026년 1월 출시)은 객체 탐지의 패러다임을 근본적으로 바꿉니다. 선택형 종단 간 NMS 프리 설계(nms=False)를 도입해 복잡한 후처리 로직을 제거하고 엣지 디바이스의 지연 시간 변동을 크게 줄입니다.

YOLO26의 주요 혁신은 다음과 같습니다.

  • MuSGD 옵티마이저: SGD와 Muon의 정교한 하이브리드로, 매우 안정적인 학습 동역학과 빠른 수렴을 지원합니다.
  • DFL 제거: 분포 초점 손실을 제거하여 YOLO26의 내보내기 호환성을 간소화하고 저전력 디바이스에서 성능을 높입니다.
  • ProgLoss + STAL: 소형 객체 인식 성능을 크게 향상하는 고급 손실 함수입니다.
  • 탁월한 속도: 이전 세대보다 CPU 추론 속도가 최대 43% 빨라 Raspberry Pi 또는 Apple CoreML 배포와 같은 임베디드 시스템에 적합합니다.

에코시스템의 다른 고성능 모델로는 YOLO11과 YOLOv8이 있으며, 두 모델 모두 구형 하드웨어 통합에 적합한 탁월한 성능 균형을 제공합니다.

파이프라인의 미래 경쟁력 확보

Ultralytics Platform을 기반으로 컴퓨터 비전 애플리케이션을 구축하면 데이터셋 로더나 배포 스크립트를 다시 작성하지 않고도 향후 최신 모델을 즉시 활용할 수 있습니다.

코드 예제: 간소화된 학습#

다음 코드 예제에서는 Ultralytics API를 사용해 최첨단 YOLO26 모델을 얼마나 간편하게 학습할 수 있는지 보여 줍니다. 이 워크플로는 YOLO11 또는 YOLOv8에도 원활하게 적용되므로 이전 저장소에서 일반적으로 필요한 상용구 코드를 추상화합니다.

from ultralytics import YOLO

# 빠른 학습을 위해 최첨단 YOLO26 나노 모델을 불러옵니다
model = YOLO("yolo26n.pt")

# COCO8 데이터셋으로 모델 학습
# API가 데이터셋 다운로드, 증강, 하이퍼파라미터 구성을 처리합니다
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="cuda:0",  # PyTorch GPU 가속을 자동으로 활용합니다
)

# 테스트 이미지에서 종단 간 NMS 프리 추론을 실행합니다
predictions = model.predict("https://ultralytics.com/images/bus.jpg", nms=False)

# 크로스 플랫폼 배포를 위해 ONNX로 내보냅니다
model.export(format="onnx")

결론#

YOLOv6-3.0과 YOLOv7은 실시간 탐지 과제의 서로 다른 측면을 성공적으로 해결했습니다. YOLOv6-3.0은 특수 목적 산업용 GPU 환경에서 강력한 성능을 발휘하며, YOLOv7은 엄격한 그래디언트 경로 최적화를 통해 높은 정확도를 제공합니다.

그러나 비교할 수 없는 다목적성, 최소한의 배포 마찰, 최첨단 성능이 필요한 최신 애플리케이션에는 Ultralytics YOLO26이 확실한 선택입니다. NMS 프리 아키텍처, 고급 MuSGD 옵티마이저, Ultralytics Platform과의 긴밀한 통합을 통해 개발자는 강력하고 확장 가능한 비전 AI 솔루션을 그 어느 때보다 빠르게 배포할 수 있습니다.

댓글