Ultralytics YOLO27:

YOLOv6-3.0와 YOLOv7#

실시간 컴퓨터 비전의 발전은 아키텍처 효율성과 학습 방법론의 급격한 발전으로 이어져 왔습니다. 이 분야에 큰 영향을 미친 두 가지 주요 모델은 YOLOv6-3.0YOLOv7입니다. 두 프레임워크 모두 추론 속도와 탐지 정확도의 균형을 맞추기 위한 새로운 기법을 도입했으며, 고성능 서버 GPU부터 엣지 디바이스까지 다양한 배포 환경을 대상으로 합니다.

이 종합적인 기술 비교에서는 두 모델의 아키텍처, 성능 지표 및 이상적인 사용 사례를 살펴보고, 최신 Ultralytics Platform과 최신 YOLO26 모델이 이러한 기반 개념을 어떻게 발전시켜 탁월한 개발자 경험을 제공하는지도 알아봅니다.

YOLOv6-3.0: 산업 처리량 최적화#

Meituan의 Vision AI Department에서 개발한 YOLOv6-3.0은 높은 처리량이 요구되는 산업용 애플리케이션을 위해 설계되었습니다. 하드웨어 가속기에서 성능을 극대화하는 데 중점을 두므로, 전용 GPU에서 배치 처리가 가능한 환경에 적합합니다.

  • 저자: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, Xiangxiang Chu
  • 조직: Meituan
  • 날짜: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

아키텍처 혁신#

YOLOv6-3.0은 GPU의 메모리 액세스 비용을 최적화하도록 설계된 하드웨어 친화적 아키텍처인 EfficientRep 백본을 사용합니다. 다양한 스케일의 특징을 더 효과적으로 융합하기 위해 넥에 양방향 연결(BiC) 모듈을 도입했습니다. 이를 통해 네트워크는 이전 세대보다 복잡한 공간 계층 구조를 더욱 효과적으로 포착할 수 있습니다.

또한 YOLOv6-3.0은 앵커 보조 학습(AAT) 전략을 구현합니다. 이 접근 방식은 앵커 기반 학습의 풍부한 그래디언트 신호와 앵커 프리 추론의 간소화된 배포 이점을 결합하여, 후처리 속도를 저하시키지 않으면서 모델이 더 안정적으로 수렴하도록 지원합니다.

YOLOv6에 대해 자세히 알아보세요

하드웨어 고려 사항

YOLOv6-3.0은 서버급 GPU(예: NVIDIA T4)에서 뛰어난 성능을 보이지만, 특정 구조적 재매개변수화에 대한 높은 의존성으로 인해 최신 아키텍처와 비교하면 CPU에만 의존하는 엣지 디바이스에서 지연 시간이 최적화되지 않을 수 있습니다.

YOLOv7: Bag-of-Freebies의 선구자#

Academia Sinica의 연구진이 발표한 YOLOv7은 다른 접근 방식을 취했습니다. 추론 비용을 증가시키지 않는 그래디언트 경로 분석과 학습 시점 최적화에 중점을 두었으며, 저자들은 이를 "학습 가능한 무료 기법 모음"이라고 부릅니다.

  • 저자: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
  • 기관: 대만 중앙연구원 정보과학연구소
  • 날짜: 2022-07-06
  • Arxiv: 2207.02696
  • GitHub: WongKinYiu/yolov7

아키텍처 혁신#

YOLOv7의 핵심은 **확장된 효율적 레이어 집계 네트워크(E-ELAN)**입니다. E-ELAN은 원래 네트워크 토폴로지를 방해하지 않으면서 서로 다른 레이어가 더욱 다양한 특징을 학습하도록 하여 그래디언트 경로를 최적화합니다. 그 결과, 높은 표현력을 갖추고 최상위 수준의 평균 정밀도(mAP)를 달성할 수 있는 모델이 완성됩니다.

YOLOv7은 또한 모델 재매개변수화를 적극적으로 활용하여 추론 중 합성곱 레이어와 배치 정규화를 병합합니다. 이를 통해 매개변수 수를 줄이고 NVIDIA TensorRT 또는 ONNX와 같은 프레임워크로 배포할 때 순전파 속도를 높입니다.

YOLOv7에 대해 자세히 알아보세요

성능 비교#

MS COCO 데이터셋에서 이러한 모델을 평가하면 YOLOv6의 초경량 변형과 매개변수가 많고 정확도에 중점을 둔 YOLOv7 아키텍처 사이에 뚜렷한 트레이드오프가 있음을 확인할 수 있습니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9

데이터에 따르면 YOLOv6-3.0n은 탁월한 추론 속도를 제공하므로 고주파 비디오 분석에 적합합니다. 반면 YOLOv7x는 가장 높은 mAP를 달성하여 원시 프레임 속도보다 탐지 정확도가 중요한 작업에서 우수한 성능을 보입니다.

사용 사례 및 권장 사항#

YOLOv6과 YOLOv7 중 무엇을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.

YOLOv6을 선택해야 하는 경우#

YOLOv6이 적합한 경우:

  • 산업용 하드웨어 인식 배포: 모델의 하드웨어 인식 설계와 효율적인 재매개변수화가 특정 대상 하드웨어에서 최적화된 성능을 제공하는 시나리오입니다.
  • 고속 단일 단계 감지: 제어된 환경에서 실시간 비디오 처리를 위해 GPU에서의 순수 추론 속도를 우선시하는 애플리케이션입니다.
  • Meituan 생태계 통합: 이미 Meituan의 기술 스택과 배포 인프라를 사용하고 있는 팀입니다.

YOLOv7을 선택해야 하는 경우#

다음과 같은 경우 YOLOv7을 권장합니다:

  • 학술 벤치마킹: 2022년 당시의 state-of-the-art 결과를 재현하거나 E-ELAN 및 학습 가능한 bag-of-freebies 기법의 효과를 연구하는 경우입니다.
  • 재매개변수화 연구: 계획된 재매개변화 컨볼루션과 복합 모델 스케일링 전략을 조사하는 경우입니다.
  • 기존 사용자 지정 파이프라인: YOLOv7의 특정 아키텍처를 기반으로 구축되어 쉽게 리팩터링할 수 없는 고도로 사용자 지정된 파이프라인을 사용하는 프로젝트입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

Ultralytics의 장점: 미래를 향한 도약#

YOLOv6-3.0과 YOLOv7은 중요한 이정표를 세웠지만, 서로 다른 저장소를 프로덕션 파이프라인에 통합하면 모델 배포와 하이퍼파라미터 튜닝에 어려움이 발생하는 경우가 많습니다. Ultralytics 생태계는 간소화된 통합 인터페이스를 제공하여 이러한 문제를 해결합니다.

Ultralytics를 선택하는 이유#

  • 사용 편의성: Ultralytics Python API를 사용하면 개발자가 몇 줄의 코드만으로 모델을 로드하고 학습하며 내보낼 수 있습니다. 이전 모델에서 최신 아키텍처로 전환할 때 단 하나의 문자열만 변경하면 됩니다.
  • 잘 유지 관리되는 생태계: Ultralytics는 잦은 업데이트, 활발한 커뮤니티 지원 및 탄탄한 문서를 제공합니다.
  • 다용도성: 주로 바운딩 박스에 중점을 둔 이전 모델과 달리 Ultralytics 모델은 인스턴스 세그멘테이션, 포즈 추정, 방향성 바운딩 박스(OBB)를 비롯한 멀티태스크 학습을 기본적으로 지원합니다.
  • 메모리 요구 사항: Ultralytics YOLO 모델은 RT-DETR과 같은 Transformer 기반 아키텍처에 비해 학습 중 메모리 사용량이 적으므로, 연구자는 소비자용 하드웨어에서도 효과적으로 학습할 수 있습니다.

YOLO26으로 업그레이드#

최고 수준의 성능을 추구하는 개발자를 위해 YOLO26(2026년 1월 출시)은 객체 탐지의 패러다임을 근본적으로 전환합니다. 완전한 종단 간 NMS 프리 설계를 도입하여 복잡한 후처리 로직을 제거하고 엣지 디바이스에서 지연 시간 변동을 크게 줄입니다.

YOLO26의 주요 혁신 사항은 다음과 같습니다:

  • MuSGD 옵티마이저: SGD와 Muon을 결합한 정교한 하이브리드 옵티마이저로, 매우 안정적인 학습 동역학과 더 빠른 수렴을 보장합니다.
  • DFL 제거: Distribution Focal Loss를 제거하여 YOLO26의 내보내기 호환성을 간소화하고 저전력 디바이스에서의 성능을 향상합니다.
  • ProgLoss + STAL: 작은 객체 인식 성능을 크게 향상하는 고급 손실 함수입니다.
  • 탁월한 속도: 이전 세대보다 CPU 추론 속도가 최대 43% 빠르므로 Raspberry Pi 또는 Apple CoreML 배포와 같은 임베디드 시스템에 적합합니다.

생태계에는 YOLO11YOLOv8과 같은 뛰어난 성능의 다른 모델도 포함되어 있으며, 두 모델 모두 레거시 하드웨어 통합에 적합한 우수한 성능 균형을 제공합니다.

파이프라인의 미래 경쟁력 확보

Ultralytics Platform을 기반으로 컴퓨터 비전 애플리케이션을 구축하면 데이터셋 로더나 배포 스크립트를 다시 작성하지 않고도 최신 최첨단 모델에 즉시 액세스할 수 있습니다.

코드 예제: 간소화된 학습#

다음 코드는 Ultralytics API를 사용하여 최첨단 YOLO26 모델을 얼마나 간편하게 학습할 수 있는지 보여줍니다. 이와 동일한 워크플로는 YOLO11 또는 YOLOv8에도 원활하게 적용되므로, 이전 저장소에서 일반적으로 필요했던 보일러플레이트 코드를 추상화합니다.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 nano model for rapid training
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset
# The API handles dataset downloading, augmentation, and hyperparameter configuration
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device="cuda:0",  # Automatically utilizes PyTorch GPU acceleration
)

# Run an end-to-end, NMS-free inference on a test image
predictions = model.predict("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for cross-platform deployment
model.export(format="onnx")

결론#

YOLOv6-3.0과 YOLOv7은 실시간 탐지라는 과제의 서로 다른 측면을 성공적으로 해결했습니다. YOLOv6-3.0은 특수 산업용 GPU 환경에서 강력한 성능을 발휘하며, YOLOv7은 엄격한 그래디언트 경로 최적화를 통해 높은 정확도를 제공합니다.

그러나 탁월한 다용도성, 최소한의 배포 마찰 및 최첨단 성능이 필요한 최신 애플리케이션에서는 Ultralytics YOLO26이 확실한 선택입니다. NMS 프리 아키텍처, 고급 MuSGD 옵티마이저 및 Ultralytics Platform과의 긴밀한 통합을 통해 개발자는 그 어느 때보다 빠르게 강력하고 확장 가능한 비전 AI 솔루션을 배포할 수 있습니다.

댓글