YOLOv5와 YOLO11#
새 프로젝트에 적합한 컴퓨터 비전 아키텍처를 선택할 때는 최첨단 모델의 발전 과정을 이해하는 것이 중요합니다. 초기 아키텍처에서 최신 통합 프레임워크로 이어지는 발전은 알고리즘 효율성과 개발자 경험 모두에서 상당한 도약을 보여줍니다. 이 가이드는 Ultralytics가 개발한 두 가지 주요 모델인 선구적인 YOLOv5와 고도로 개선된 YOLO11을 기술적으로 심층 비교합니다.
모델 소개#
이 두 아키텍처는 모두 실시간 객체 감지 분야에서 중요한 이정표를 나타내며, 배포 환경과 레거시 요구 사항에 따라 각기 다른 장점을 제공합니다.
YOLOv5: 업계의 주력 모델#
2020년 여름에 출시된 YOLOv5는 기본 PyTorch 구현을 제공하여 학습과 배포의 진입 장벽을 크게 낮춘 덕분에 빠르게 업계 표준이 되었습니다. 또한 이전 버전의 복잡한 Darknet C 프레임워크에서 벗어나 Pythonic한 모델 구축 방식을 제공했습니다.
- 저자: Glenn Jocher
- 조직: Ultralytics
- 날짜: 2020-06-26
- GitHub: ultralytics/yolov5
- 문서: YOLOv5 Documentation
YOLOv5는 사용 편의성을 위한 강력한 기준선을 확립했으며, 고급 모자이크 데이터 증강과 오토 앵커링을 비롯한 강력한 학습 방법론을 도입했습니다. 잘 문서화되고 충분히 테스트된 코드베이스를 기반으로 구축하는 연구자들 사이에서 여전히 매우 높은 인기를 유지하고 있습니다.
YOLO11: 통합 비전 프레임워크#
수년간 축적된 피드백과 아키텍처 연구를 바탕으로 YOLO11은 여러 비전 작업을 기본적으로 처리할 수 있는 통합 프레임워크의 일부로 도입되었습니다. 단순한 바운딩 박스를 넘어, 최고의 다용도성과 효율성을 제공하도록 처음부터 설계되었습니다.
- 저자: Glenn Jocher 및 Jing Qiu
- 조직: Ultralytics
- 날짜: 2024-09-27
- GitHub: ultralytics/ultralytics
- 문서: YOLO11 문서
YOLO11은 ultralytics Python 패키지를 통해 간소화된 사용자 경험을 제공하며, 객체 감지, 인스턴스 세그멘테이션, 분류, 포즈 추정, 방향성 바운딩 박스(OBB)를 통합하는 간단한 API를 지원합니다. 또한 속도와 정확도 사이에서 매우 뛰어난 균형을 달성하여 다양한 실제 배포 시나리오에 적합합니다.
두 모델 모두 잘 유지 관리되는 Ultralytics Platform 생태계의 이점을 활용합니다. 이 통합 환경은 다양한 하드웨어 대상에 대한 데이터셋 어노테이션, 클라우드 학습, 모델 내보내기 과정을 간소화합니다.
성능 및 지표 비교#
이러한 모델을 직접 비교하면 아키텍처 개선이 어떻게 실질적인 성능 향상으로 이어지는지 확인할 수 있습니다. 아래 표는 COCO 데이터셋에서 평가한 평균 정밀도(mAP)와 CPU 및 GPU 추론 속도, 파라미터 수를 함께 보여줍니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
결과 분석#
이 지표는 YOLO11이 달성한 성능 균형의 뚜렷한 도약을 보여줍니다. 예를 들어 YOLO11n(나노) 모델은 YOLOv5n의 28.0%보다 높은 39.5% mAP를 달성하는 동시에 ONNX를 통해 내보냈을 때 CPU 추론 시간도 단축합니다. 또한 YOLO11은 대형 Transformer 기반 모델에 비해 학습 중 메모리 요구 사항이 현저히 낮아 소비자용 하드웨어와 엣지 디바이스에 배포하기가 매우 용이합니다.
아키텍처 차이#
YOLO11의 성능 향상은 몇 가지 핵심적인 아키텍처 발전에서 비롯됩니다. YOLOv5가 C3 모듈을 포함한 표준 CSPNet 백본을 사용한 반면, YOLO11은 C2f와 이후의 C3k2와 같은 더욱 효율적인 특징 추출 블록을 도입하여 그래디언트 흐름을 최적화하고 계산 오버헤드를 줄였습니다.
YOLO11은 또한 크게 개선된 헤드를 제공합니다. 이전 모델의 앵커 기반 설계에서 벗어나 최신 Ultralytics 아키텍처는 앵커 프리 방식을 채택합니다. 이를 통해 박스 예측 수를 줄이고 후처리 파이프라인을 간소화하며, 다양한 스케일과 종횡비에 걸쳐 모델의 일반화 성능을 향상합니다. 또한 이러한 모델은 더욱 뛰어난 학습 효율성을 제공하고, 사전 학습된 가중치를 즉시 사용할 수 있어 파인튜닝된 데이터셋의 수렴을 가속합니다.
구현 및 코드 예제#
Ultralytics 생태계의 가장 뛰어난 특징 중 하나는 단순성입니다. YOLOv5가 빠른 추론을 위해 torch.hub 사용을 대중화했다면, YOLO11은 통합 ultralytics Python 패키지를 통해 이를 한 단계 더 발전시켰습니다.
YOLO11을 사용한 학습#
모델을 로드하고 학습하며 검증하는 데 필요한 보일러플레이트 코드는 최소한으로 충분합니다. API가 하이퍼파라미터 튜닝과 모델 관리를 원활하게 처리합니다.
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11s.pt")
# Train on a custom dataset for 50 epochs
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run fast inference and display results
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# Easily export the model to TensorRT for hardware acceleration
model.export(format="engine")YOLOv5를 사용한 레거시 추론#
기존 파이프라인을 유지 관리하고 있다면 YOLOv5는 PyTorch의 기본 로딩 메커니즘과 직접 통합되므로 기존 추론 스크립트에 간단히 추가할 수 있습니다.
import torch
# Load a custom or pretrained YOLOv5 model from PyTorch Hub
model = torch.hub.load("ultralytics/yolov5", "yolov5s")
# Perform inference on an image URL
results = model("https://ultralytics.com/images/zidane.jpg")
# Print prediction details to the console
results.print()두 모델 모두 다양한 내보내기 형식을 지원합니다. TensorRT를 사용하여 NVIDIA Jetson을 대상으로 하든, CoreML을 사용하여 iOS 애플리케이션을 대상으로 하든, 배포 프로세스는 철저히 문서화되어 있으며 커뮤니티의 지원을 받을 수 있습니다.
이상적인 사용 사례#
이러한 모델 중 어떤 것을 선택할지는 프로젝트의 수명 주기 단계와 구체적인 요구 사항에 따라 크게 달라집니다.
YOLOv5를 선택해야 하는 경우#
- 레거시 코드베이스 유지 관리: 운영 환경이 YOLOv5 리포지토리 구조 또는 특정 하이퍼파라미터 진화 기법에 크게 맞춤화된 경우입니다.
- 학술적 기준선: 확립된 2020~2022년 컴퓨터 비전 표준과 직접 벤치마킹해야 하는 연구를 발표하는 경우입니다.
YOLO11을 선택해야 하는 경우#
- 멀티태스크 프로젝트: 단일 통합 API를 사용하여 포즈 추정과 인스턴스 세그멘테이션 같은 여러 작업을 조합해야 하는 경우입니다.
- 엣지 배포: 주어진 컴퓨팅 예산(FLOPs)에서 최대 mAP를 확보하는 것이 중요한 엣지 컴퓨팅 시나리오의 경우입니다.
- 상용 AI 솔루션: Ultralytics Platform의 강력한 지원을 활용하는 소매 및 보안 분야의 엔터프라이즈 애플리케이션에 적합합니다.
차세대 모델: Ultralytics YOLO26#
YOLO11은 속도와 정확도 사이에서 뛰어난 균형을 제공하지만 인공지능 분야는 빠르게 발전합니다. 현재 새로운 프로젝트를 시작하는 개발자에게는 비전 AI의 최신 표준인 **Ultralytics YOLO26**을 검토할 것을 적극 권장합니다.
2026년 1월에 출시된 YOLO26은 최신 배포 요구 사항을 위해 특별히 설계된 패러다임 전환 수준의 발전을 제공합니다.
- 엔드 투 엔드 NMS 프리 설계: YOLOv10에서 처음 개척된 개념을 기반으로 YOLO26은 기본적으로 엔드 투 엔드 방식으로 작동합니다. 비최대 억제(NMS) 후처리의 필요성을 제거하여 배포 파이프라인을 크게 간소화하고 지연 시간을 줄입니다.
- MuSGD 옵티마이저: Moonshot AI의 Kimi K2와 같은 모델에서 활용된 LLM 학습 혁신에서 영감을 받은 SGD와 Muon의 하이브리드 방식으로, 매우 안정적인 학습과 훨씬 빠른 수렴을 보장합니다.
- 탁월한 CPU 속도: 분포 초점 손실(DFL)을 제거하여 YOLO26은 최대 43% 더 빠른 CPU 추론을 달성하므로, 전용 GPU가 없는 엣지 디바이스와 환경에 절대적으로 가장 적합한 선택입니다.
- 고급 손실 함수: ProgLoss와 STAL을 통합하여 소형 객체 인식 성능을 크게 향상합니다. 이는 드론 분석, IoT, 로보틱스에 매우 중요합니다.
- 작업별 개선: 포즈 작업을 위한 잔차 로그 가능도 추정(RLE)과 방향성 바운딩 박스를 위한 특수 각도 손실 등 전문화된 최적화를 도입하여 모든 컴퓨터 비전 작업에서 뛰어난 성능을 보장합니다.
표준 객체 감지를 넘어서는 특수 아키텍처에 관심이 있는 사용자는 Transformer 기반 감지를 위한 RT-DETR이나 오픈 보캐뷸러리 추적 및 감지를 위한 YOLO-World와 같은 모델도 검토할 수 있습니다. 잘 유지 관리되고 고도로 최적화된 이러한 도구를 활용하면 컴퓨터 비전 파이프라인을 효율적이고 확장 가능하게 유지하며 기술 발전의 흐름을 앞서갈 수 있습니다.