Ultralytics YOLO27:

PP-YOLOE+와 YOLO26#

실시간 컴퓨터 비전 분야는 확장 가능하고 효율적이며 매우 정확한 object detection 모델에 대한 수요를 바탕으로 크게 성장해 왔습니다. 이 분야에서 두드러지는 두 가지 아키텍처로는 PaddlePaddle 생태계의 강력한 detector인 **PP-YOLOE+**와 엣지 배포 및 training 효율성을 새롭게 정의하는 최신 state-of-the-art 모델인 **Ultralytics YOLO26**이 있습니다.

이 종합 가이드에서는 두 모델의 아키텍처, 성능 지표, training 방법론 및 이상적인 사용 사례를 비교하여 다음 AI 프로젝트에 적합한 결정을 내릴 수 있도록 지원합니다.

기술 사양 및 저자 정보#

이러한 모델의 기원과 설계 철학을 이해하면 실제 적용에 필요한 중요한 맥락을 파악할 수 있습니다.

PP-YOLOE+ 세부 정보:

PP-YOLOE+에 대해 자세히 알아보기

YOLO26 세부 정보:

아키텍처 혁신#

PP-YOLOE+ 아키텍처#

이전 모델인 PP-YOLOv2를 기반으로 구축된 PP-YOLOE+는 산업용 애플리케이션에 맞춘 견고한 설계를 도입했습니다. CSPRepResNet backbone과 ET-head(효율적인 task-aligned head)를 활용하여 속도와 정확도의 균형을 맞춥니다. PP-YOLOE+는 동적 label assignment(TAL)을 사용하며 Baidu의 PaddlePaddle framework와 원활하게 통합되므로 T4 및 V100과 같은 NVIDIA GPU에 고도로 최적화되어 있습니다. 그러나 PaddlePaddle 생태계에 크게 의존하므로 PyTorch workflow를 사용하는 개발자에게는 마찰이 발생할 수 있습니다.

YOLO26 아키텍처: 엣지 우선 혁신#

2026년 초에 출시된 Ultralytics YOLO26은 실시간 detection pipeline을 완전히 재구상하여 배포 간소화와 엣지 효율성에 특히 중점을 둡니다.

YOLO26의 주요 혁신은 다음과 같습니다:

  • End-to-End NMS-Free 설계: YOLO26은 기본적으로 end-to-end 방식이므로 비최대 억제(NMS) post-processing이 전혀 필요하지 않습니다. YOLOv10에서 처음 개척된 이 혁신은 장면의 혼잡도와 관계없이 일관된 inference latency를 보장하여 배포를 크게 간소화합니다.
  • DFL 제거: Distribution Focal Loss(DFL)를 제거하여 YOLO26은 output head를 크게 간소화합니다. 그 결과 엣지 디바이스 및 microcontroller와의 호환성이 훨씬 향상됩니다.
  • 최대 43% 빠른 CPU inference: DFL 제거와 구조적 최적화 덕분에 YOLO26은 전용 GPU가 없는 환경에 고도로 최적화되어 있으며, YOLO11과 비교해 CPU에서 최대 43% 빠른 inference 속도를 달성합니다.
  • MuSGD Optimizer: Moonshot AI의 기법과 같은 고급 LLM training 기법에서 영감을 받은 YOLO26은 SGD와 Muon을 결합한 hybrid 방식을 도입합니다. 이를 통해 computer vision task에서 탁월한 training 안정성과 더 빠른 convergence를 제공합니다.
  • ProgLoss + STAL: 고급 loss function이 small-object recognition을 직접 겨냥하여 개선하며, 이는 드론 운영과 IoT 엣지 센서에 매우 중요합니다.
YOLO26의 task별 개선 사항

YOLO26은 표준 bounding box를 넘어 모든 vision task에 걸쳐 구체적인 업그레이드를 도입합니다. Segmentation에는 semantic segmentation loss와 multi-scale prototyping을, Pose Estimation에는 Residual Log-Likelihood Estimation(RLE)을 사용하며, Oriented Bounding Box(OBB) detection의 경계 문제를 해결하기 위해 특수한 angle loss를 적용합니다.

성능 및 지표#

아래 표는 다양한 모델 크기에서 PP-YOLOE+와 YOLO26이 어떻게 비교되는지 종합적으로 보여줍니다. YOLO26 모델은 raw speed, parameter efficiency 및 전체 평균 정밀도(mAP)에서 확실히 우위를 점합니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9

참고: 굵게 표시된 값은 모든 모델에서 가장 우수한 성능을 보인 지표를 강조합니다.

분석#

  • 메모리 요구 사항 및 효율성: YOLO26은 더 높은 mAP 점수를 달성하면서도 훨씬 적은 parameter와 FLOPs를 필요로 합니다. 예를 들어 YOLO26n(Nano) 모델은 2.4M parameter만으로 40.9 mAP를 달성하여 PP-YOLOE+t 모델을 능가하며, 크기는 대략 절반에 불과합니다. 이는 training과 배포 중 메모리 사용량을 모두 줄여 줍니다.
  • Inference 속도: TensorRT를 사용하여 export하면 YOLO26이 latency 지표에서 우위를 점합니다. NMS를 제거했기 때문에 T4 GPU에서 1.7ms의 inference 시간이 완전히 안정적으로 유지되는 반면, PP-YOLOE+는 변동 가능성이 있는 post-processing 시간에 의존합니다.

Ultralytics의 장점: 생태계 및 사용 편의성#

raw metric도 중요하지만 개발자 경험이 프로젝트의 성공을 좌우하는 경우가 많습니다. **Ultralytics Platform**은 오래된 framework를 훨씬 능가하는, 잘 유지 관리되는 생태계를 제공합니다.

  1. 사용 편의성: Ultralytics는 복잡한 boilerplate code를 추상화합니다. YOLO26 training에는 Python 몇 줄만 필요하므로 PP-YOLOE+에 필요한 방대한 configuration file을 사용하지 않아도 됩니다.
  2. 범용성: PP-YOLOE+는 주로 object detection 아키텍처입니다. YOLO26은 segmentation, classification, pose estimation 및 OBB를 기본적으로 지원합니다.
  3. Training 효율성: Ultralytics YOLO 모델은 RT-DETR과 같은 대규모 Transformer 모델이나 기존 아키텍처에 비해 훨씬 적은 CUDA 메모리를 필요로 하므로, 연구자들이 consumer-grade hardware에서 state-of-the-art 모델을 training할 수 있습니다.
기타 Ultralytics 모델

YOLO26이 현재 연구의 정점에 해당하지만 Ultralytics 생태계에는 YOLO11YOLOv8도 포함되어 있습니다. 두 모델 모두 대규모 community 지원을 바탕으로 높은 역량을 유지하고 있어, 오래된 legacy system에서 마이그레이션하는 사용자에게 적합합니다.

코드 예제: YOLO26 학습#

Ultralytics를 사용하면 손쉽게 시작할 수 있습니다. 다음은 YOLO26 모델을 load, train 및 validate하는 방법을 보여 주는 완전히 실행 가능한 예제입니다.

from ultralytics import YOLO

# Load the cutting-edge YOLO26 small model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset using the new MuSGD optimizer
results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    batch=16,
    optimizer="auto",  # MuSGD is automatically engaged for YOLO26
)

# Export seamlessly to ONNX for CPU deployment
export_path = model.export(format="onnx")
print(f"Model successfully exported to: {export_path}")

이상적인 사용 사례#

PP-YOLOE+를 선택해야 하는 경우#

  • 기존 PaddlePaddle 인프라: enterprise가 이미 Baidu 기술 stack에 깊이 통합되어 있고 Paddle Inference용으로 사전 구성된 hardware를 사용한다면 PP-YOLOE+는 안전하고 안정적인 선택입니다.
  • 아시아 제조 허브: 아시아의 많은 산업용 vision pipeline은 자동 defect detection에서 PP-YOLOE+를 위한 강력한 기존 지원을 제공합니다.

YOLO26을 선택해야 하는 경우#

  • 엣지 Computing 및 IoT: 43% 더 빠른 CPU inference와 DFL 제거 덕분에 YOLO26은 Raspberry Pis, mobile phone 및 embedded device 배포에서 확실한 선두 주자입니다.
  • 혼잡한 장면 및 스마트 시티: End-to-End NMS-Free 아키텍처는 주차 관리와 traffic monitoring처럼 기존 NMS가 bottleneck을 유발하는 밀집 환경에서도 안정적인 latency를 보장합니다.
  • Multi-Task 프로젝트: pipeline에서 object tracking, human pose estimation 또는 pixel-perfect mask 생성이 필요한 경우 YOLO26은 하나의 통합된 Python package 내에서 이 모든 작업을 처리합니다.

결론#

PP-YOLOE+는 특정 생태계 내에서 여전히 뛰어난 detector이지만, YOLO26의 출시는 paradigm을 전환했습니다. Ultralytics는 LLM에서 영감을 받은 training 최적화(MuSGD)와 끊임없이 최적화된 NMS-free 아키텍처를 결합하여 매우 정확하면서도 손쉽게 배포할 수 있는 모델을 만들었습니다. 속도, 정확도 및 개발자 경험의 최적의 균형을 원하는 현대적인 개발자에게 YOLO26은 확실한 선택입니다.

댓글