PP-YOLOE+와 YOLOv6-3.0#
실시간 컴퓨터 비전 분야는 빠르게 확장되어 왔으며, 다양한 배포 시나리오에 최적화된 고도로 전문화된 아키텍처가 등장했습니다. 개발자들은 높은 처리량과 안정적인 정확도의 균형이 필요한 애플리케이션을 구축할 때 PP-YOLOE+와 YOLOv6-3.0을 자주 비교합니다. 두 모델 모두 출시 당시 아키텍처를 크게 개선했으며, 산업 및 엣지 애플리케이션을 위한 추론 속도 향상에 중점을 두었습니다.
자세한 아키텍처 분석에 앞서 아래 차트를 통해 속도와 정확도 측면에서 이러한 모델이 서로 어떻게 성능을 발휘하는지 확인해 보시기 바랍니다.
PP-YOLOE+: 아키텍처의 강점과 약점#
PaddlePaddle Authors가 개발한 PP-YOLOE+는 이전 모델을 기반으로 구축된 대표적인 앵커 프리 검출기로, 다양한 규모의 요구 사항에서 견고한 성능을 제공합니다.
- 저자: PaddlePaddle Authors
- 조직: Baidu
- 날짜: 2022-04-02
- Arxiv: 2203.16250
- GitHub: PaddlePaddle/PaddleDetection
아키텍처 주요 특징#
PP-YOLOE+는 기존 PP-YOLOE 설계에 비해 몇 가지 중요한 개선 사항을 도입했습니다. 강력한 CSPRepResNet 백본을 활용하여 계산 비용과 특징 추출 역량의 균형을 효율적으로 유지합니다. 또한 고급 피처 피라미드 네트워크 (FPN)를 Path Aggregation Network (PAN)과 결합하여 멀티 스케일 특징 융합을 보장합니다. 특히 주목할 만한 기능 중 하나는 ET-head (효율적인 태스크 정렬 헤드)로, 객체 검출 중 분류와 위치 지정 간의 조정을 크게 개선합니다.
PP-YOLOE+는 인상적인 평균 정밀도 (mAP)를 달성하지만, PaddlePaddle 생태계에 대한 의존성으로 인해 PyTorch 기반 워크플로에 익숙한 연구자에게는 학습 곡선이 가파를 수 있습니다. 직접적인 Paddle 추론 지원이 없는 이기종 엣지 디바이스를 대상으로 할 경우 모델 배포 프로세스가 다소 복잡해질 수 있습니다.
PP-YOLOE+는 Baidu의 기술 스택 내 배포에 고도로 최적화되어 있으므로, 프로덕션 환경이 Paddle 추론 도구에 크게 의존한다면 탁월한 선택입니다.
YOLOv6-3.0: 산업용 처리량#
Meituan Vision AI Department에서 출시한 YOLOv6-3.0은 산업 애플리케이션을 위한 차세대 객체 검출기로 명시적으로 설계되었으며, GPU 하드웨어에서 대규모 처리량을 우선시합니다.
- 저자: Chuyi Li, Lulu Li, Yifei Geng 외
- 조직: Meituan
- 날짜: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
아키텍처 주요 특징#
YOLOv6-3.0은 하드웨어 활용도를 극대화하도록 특별히 설계된 EfficientRep 백본을 사용하며, 특히 TensorRT를 사용하는 NVIDIA GPU에서 효과적입니다. v3.0 업데이트에서는 넥에 Bi-directional Concatenation (BiC) 모듈을 도입하여 파라미터 수를 크게 늘리지 않고 공간적 특징 보존을 향상했습니다. 또한 모델 학습 중 앵커 기반 안정성의 이점과 실시간 추론 중 빠른 앵커 프리 아키텍처를 결합하는 Anchor-Aided Training (AAT) 전략을 도입했습니다.
그러나 YOLOv6-3.0은 서버급 GPU에 고도로 최적화되어 있으므로, CPU만 사용하는 제약이 큰 엣지 디바이스에 배포하면 지연 시간 개선 효과가 감소하는 경우가 있습니다. 이러한 전문화 덕분에 오프라인 비디오 분석과 같은 환경에서는 뛰어난 성능을 발휘하지만, 더 작고 로컬화된 하드웨어에서는 동적으로 최적화된 모델보다 성능이 뒤처질 수 있습니다.
성능 비교 표#
다음 표에서는 두 아키텍처의 다양한 스케일 변형을 직접 비교하여 주요 성능 지표를 보여 줍니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| PP-YOLOE+t | 640 | 39.9 | - | 2.84 | 4.85 | 19.15 |
| PP-YOLOE+s | 640 | 43.7 | - | 2.62 | 7.93 | 17.36 |
| PP-YOLOE+m | 640 | 49.8 | - | 5.56 | 23.43 | 49.91 |
| PP-YOLOE+l | 640 | 52.9 | - | 8.36 | 52.2 | 110.07 |
| PP-YOLOE+x | 640 | 54.7 | - | 14.3 | 98.42 | 206.59 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
사용 사례 및 권장 사항#
PP-YOLOE+와 YOLOv6 중 선택할 때는 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도를 고려해야 합니다.
PP-YOLOE+를 선택해야 하는 경우#
PP-YOLOE+는 다음과 같은 경우에 적합합니다:
- PaddlePaddle 생태계 통합: 기존 인프라가 Baidu의 PaddlePaddle 프레임워크와 도구를 기반으로 구축된 조직입니다.
- Paddle Lite 엣지 배포: Paddle Lite 또는 Paddle 추론 엔진에 특화된 고도로 최적화된 추론 커널을 갖춘 하드웨어에 배포하는 경우입니다.
- 고정밀 서버 측 감지: 프레임워크 종속성이 문제가 되지 않는 강력한 GPU 서버에서 최고 수준의 감지 정확도를 우선시하는 시나리오입니다.
YOLOv6을 선택해야 하는 경우#
다음과 같은 경우 YOLOv6을 권장합니다:
- 산업용 하드웨어 인식 배포: 모델의 하드웨어 인식 설계와 효율적인 재매개변수화가 특정 대상 하드웨어에서 최적화된 성능을 제공하는 시나리오입니다.
- 고속 단일 단계 감지: 제어된 환경에서 실시간 비디오 처리를 위해 GPU에서의 순수 추론 속도를 우선시하는 애플리케이션입니다.
- Meituan 생태계 통합: 이미 Meituan의 기술 스택과 배포 인프라를 사용하고 있는 팀입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.
- NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
- 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.
Ultralytics의 장점: 레거시 모델을 넘어선 발전#
PP-YOLOE+와 YOLOv6-3.0은 특정 목적에 맞는 솔루션을 제공하지만, 현대적인 AI 개발에는 다목적이며 메모리 효율적인 워크플로가 필요합니다. 이러한 상황에서 Ultralytics Platform은 탁월한 개발자 경험을 제공합니다. 통합 Python API를 사용하면 오래된 연구 저장소에서 일반적으로 발생하는 막대한 구성 오버헤드 없이 최첨단 모델을 원활하게 학습, 검증 및 배포할 수 있습니다.
Ultralytics 모델은 표준 검출을 넘어 인스턴스 세그멘테이션, 포즈 추정, 이미지 분류, 방향성 바운딩 박스 (OBB) 추출을 비롯한 다양한 비전 작업을 기본적으로 지원합니다. 또한 학습 중 더 적은 메모리를 사용하도록 고도로 최적화되어 있으며, 이는 일반적으로 막대한 GPU VRAM 할당을 요구하는 Transformer 기반 모델인 RT-DETR과 stark한 대조를 이룹니다.
YOLO26 알아보기: 새로운 표준#
최첨단 비전 모델을 배포하려는 조직을 위해 Ultralytics YOLO26(2026년 1월 출시)은 성능의 한계를 새롭게 정의합니다. 몇 가지 중요한 혁신을 통해 이전 세대를 크게 능가합니다.
- 엔드 투 엔드 NMS 프리 설계: YOLOv10의 개념을 기반으로 구축된 YOLO26은 비최대 억제 (NMS) 후처리를 완전히 제거합니다. 이 네이티브 엔드 투 엔드 접근 방식은 실시간 안전 시스템에 필수적인 예측 가능한 초저지연 추론을 보장합니다.
- 최대 43% 더 빠른 CPU 추론: 아키텍처에서 Distribution Focal Loss (DFL)를 제거함으로써 YOLO26은 엣지 컴퓨팅과 전용 GPU 가속이 없는 환경에 맞게 획기적으로 최적화되었습니다.
- MuSGD 옵티마이저: 이 하이브리드 옵티마이저는 비전 모델에 LLM 학습의 안정성을 통합하며(Moonshot AI에서 영감을 받음), 빠른 수렴과 매우 안정적인 커스텀 학습 세션을 지원합니다.
- ProgLoss + STAL: 이러한 고급 손실 공식은 항공 드론 이미지 및 혼잡한 장면 분석과 같은 애플리케이션에 필수적인 소형 객체 인식 성능을 크게 향상합니다.
오늘 새로운 프로젝트를 구축하고 있다면 레거시 아키텍처를 우회하고 YOLO26을 채택하는 것을 적극 권장합니다. 메모리 효율성과 NMS 프리 속도 덕분에 프로덕션 환경에 훨씬 쉽게 배포할 수 있습니다.
원활한 구현#
Ultralytics Python 패키지를 사용하여 최첨단 모델을 학습하고 내보내는 작업은 매우 간단합니다. 다음 예제에서는 최신 YOLO26 모델을 학습하고 신속한 엣지 배포를 위해 ONNX로 내보내는 방법을 보여 줍니다.
from ultralytics import YOLO
# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 example dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference on a test image (NMS-free speed)
predict_results = model.predict("https://ultralytics.com/images/bus.jpg")
# Export to ONNX format for edge deployment
model.export(format="onnx")기존 워크플로에 깊이 통합되어 있으면서 현대적인 안정성을 원하는 팀에게는 Ultralytics YOLO11을 살펴보는 것도 탁월한 전환 단계입니다. 전체 Ultralytics 생태계를 기반으로 포괄적인 작업 유연성을 제공합니다.