YOLOv5와 YOLO11#
새 프로젝트에 적합한 컴퓨터 비전 아키텍처를 선택하려면 최첨단 모델의 발전 과정을 이해하는 것이 중요합니다. 초기 아키텍처에서 최신 통합 프레임워크에 이르는 발전 과정은 알고리즘 효율성과 개발자 경험 모두에서 큰 도약을 보여줍니다. 이 가이드에서는 Ultralytics가 개발한 두 주요 모델, 선구적인 YOLOv5와 크게 개선된 YOLO11을 심층적으로 비교합니다.
모델 소개#
두 아키텍처는 모두 실시간 객체 탐지 분야의 중요한 이정표이며, 배포 환경과 레거시 요구사항에 따라 각기 다른 장점을 제공합니다.
YOLOv5: 업계의 주력 모델#
2020년 여름에 출시된 YOLOv5는 네이티브 PyTorch 구현을 통해 학습 및 배포의 진입 장벽을 크게 낮추면서 빠르게 업계 표준으로 자리 잡았습니다. 이전 버전의 복잡한 Darknet C 프레임워크에서 벗어나 Python다운 모델 구축 방식을 제공했습니다.
- 저자: Glenn Jocher
- 조직: Ultralytics
- 날짜: 2020-06-26
- GitHub: ultralytics/yolov5
- 문서: YOLOv5 문서
YOLOv5는 사용 편의성의 견고한 기준을 마련하고 고급 모자이크 데이터 증강 및 자동 앵커링을 비롯한 강력한 학습 방법론을 도입했습니다. 문서가 잘 정리되고 충분히 검증된 코드베이스를 기반으로 개발하는 연구자들 사이에서 여전히 큰 인기를 얻고 있습니다.
YOLO11: 통합 비전 프레임워크#
수년간의 피드백과 아키텍처 연구를 바탕으로, YOLO11은 여러 비전 작업을 네이티브로 처리할 수 있는 통합 프레임워크의 일부로 출시되었습니다. 바운딩 박스에만 머무르지 않고, 처음부터 다용도성과 효율성을 극대화하도록 설계되었습니다.
- 저자: Glenn Jocher 및 Jing Qiu
- 조직: Ultralytics
- 날짜: 2024-09-27
- GitHub: ultralytics/ultralytics
- 문서: YOLO11 문서
YOLO11은 ultralytics Python 패키지를 통해 간소화된 사용자 경험을 제공하며, 객체 탐지, 인스턴스 세그멘테이션, 분류, 포즈 추정, 방향성 바운딩 박스(OBB)를 통합하는 간단한 API를 갖추고 있습니다. 속도와 정확도 사이에서 매우 유리한 절충점을 달성하여 다양한 실제 배포 시나리오에 적합합니다.
두 모델 모두 잘 유지 관리되는 Ultralytics Platform 생태계의 이점을 누립니다. 이 통합 환경은 다양한 하드웨어 대상에 대한 데이터셋 어노테이션, 클라우드 학습, 모델 내보내기를 간소화합니다.
성능 및 지표 비교#
두 모델을 직접 비교하면 아키텍처 개선이 실제 성능 향상으로 이어지는 방식을 확인할 수 있습니다. 아래 표에서는 COCO 데이터셋에서 평가한 평균 정밀도(mAP)와 CPU 및 GPU 추론 속도, 파라미터 수를 보여줍니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.6 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.1 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 87.2 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 195.3 |
결과 분석#
지표는 YOLO11이 성능 균형 측면에서 뚜렷한 도약을 이루었음을 보여줍니다. 예를 들어, YOLO11n(nano) 모델은 YOLOv5n의 28.0%와 비교해 39.5% mAP를 달성하여 파라미터를 0.7M만 추가하고도 11.5포인트 향상했습니다. 또한 YOLO11은 대형 Transformer 기반 모델에 비해 학습 중 메모리 요구량이 눈에 띄게 낮아 일반 소비자용 하드웨어와 엣지 디바이스에 쉽게 배포할 수 있습니다.
아키텍처 차이#
YOLO11의 성능 향상은 몇 가지 핵심적인 아키텍처 발전에서 비롯됩니다. YOLOv5는 C3 모듈을 사용하는 표준 CSPNet 백본을 활용했지만, 최신 Ultralytics 모델은 C2f(YOLOv8) 및 C3k2(YOLO11)와 같이 더 효율적인 특징 추출 블록을 도입하여 그래디언트 흐름을 최적화하고 연산 오버헤드를 줄였습니다.
YOLO11은 크게 개선된 헤드도 갖추고 있습니다. 이전 모델의 앵커 기반 설계에서 벗어나 최신 Ultralytics 아키텍처는 앵커 프리 방식을 채택합니다. 이를 통해 바운딩 박스 예측 수를 줄여 후처리 파이프라인을 간소화하고, 모델이 다양한 스케일과 종횡비에 더 잘 일반화되도록 합니다. 또한 이러한 모델은 우수한 학습 효율성을 제공하며, 파인튜닝된 데이터셋의 수렴을 가속하는 사전 학습 가중치를 쉽게 사용할 수 있습니다.
구현 및 코드 예제#
Ultralytics 생태계의 두드러진 특징 중 하나는 간편함입니다. YOLOv5는 빠른 추론을 위해 torch.hub 사용을 대중화했으며, YOLO11은 통합된 ultralytics Python 패키지를 통해 이를 한 단계 발전시켰습니다.
YOLO11 학습#
모델 로드, 학습, 검증에는 상용구 코드가 거의 필요하지 않습니다. API가 하이퍼파라미터 튜닝과 모델 관리를 원활하게 처리합니다.
from ultralytics import YOLO
# 사전 학습된 YOLO11 모델 로드
model = YOLO("yolo11s.pt")
# 사용자 지정 데이터셋으로 50 에포크 동안 학습합니다
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# 빠른 추론을 실행하고 결과를 표시합니다
predictions = model("https://ultralytics.com/images/bus.jpg")
predictions[0].show()
# 하드웨어 가속을 위해 모델을 TensorRT로 간편하게 내보냅니다
model.export(format="engine")YOLOv5를 사용한 레거시 추론#
이전 파이프라인을 유지 관리하는 경우, YOLOv5는 PyTorch의 네이티브 로딩 메커니즘과 직접 통합되므로 기존 추론 스크립트에 간단히 추가할 수 있습니다.
import torch
# PyTorch Hub에서 사용자 지정 또는 사전 학습된 YOLOv5 모델을 로드합니다
model = torch.hub.load("ultralytics/yolov5", "yolov5s")
# 이미지 URL에서 추론을 수행합니다
results = model("https://ultralytics.com/images/zidane.jpg")
# 예측 세부 정보를 콘솔에 출력합니다
results.print()두 모델 모두 다양한 내보내기 포맷을 지원합니다. TensorRT를 사용하는 NVIDIA Jetson이나 CoreML을 사용하는 iOS 애플리케이션을 대상으로 하더라도, 배포 과정은 상세히 문서화되어 있으며 커뮤니티의 지원을 받을 수 있습니다.
적합한 사용 사례#
두 모델 중 무엇을 선택할지는 주로 프로젝트의 수명 주기 단계와 구체적인 요구사항에 따라 달라집니다.
YOLOv5를 선택할 경우#
- 레거시 코드베이스 유지 관리: 프로덕션 환경이 YOLOv5 리포지토리 구조나 특정 하이퍼파라미터 진화 기법에 크게 맞춤화되어 있는 경우입니다.
- 학술 기준선: 2020~2022년에 확립된 컴퓨터 비전 표준과 직접 벤치마킹해야 하는 연구를 발표하는 경우입니다.
YOLO11을 선택해야 하는 경우#
- 멀티태스크 프로젝트: 단일 통합 API를 사용해 포즈 추정 및 인스턴스 세그멘테이션과 같은 여러 작업을 수행해야 하는 애플리케이션입니다.
- 엣지 배포: 제한된 연산 예산(FLOPs)에서 최대 mAP를 확보하는 것이 중요한 엣지 컴퓨팅 시나리오입니다.
- 상업용 AI 솔루션: Ultralytics Platform의 견고한 지원을 활용하는 소매 및 보안 분야의 엔터프라이즈 애플리케이션에 적합합니다.
차세대 모델: Ultralytics YOLO26#
YOLO11은 속도와 정확도 면에서 훌륭한 균형을 제공하지만, 인공지능 분야는 빠르게 발전하고 있습니다. 오늘 새 프로젝트를 시작하는 개발자에게는 최신 비전 AI 표준인 Ultralytics YOLO26을 살펴볼 것을 적극 권장합니다.
2026년 1월에 출시된 YOLO26은 최신 배포 요구사항에 맞춰 설계된 패러다임 전환 수준의 발전을 선보입니다.
- 종단 간 NMS-Free 설계: YOLOv10에서 처음 선보인 개념을 바탕으로 YOLO26은 네이티브 종단 간 방식으로 설계되었습니다. 선택적 일대일 헤드(
nms=False)는 비최대 억제(NMS) 후처리를 불필요하게 만들어 배포 파이프라인을 크게 간소화하고 지연 시간을 줄입니다. - MuSGD 옵티마이저: Moonshot AI의 Kimi K2와 같은 모델의 LLM 학습 혁신에서 영감을 받은 이 SGD와 Muon의 하이브리드 방식은 매우 안정적인 학습과 훨씬 빠른 수렴을 지원합니다.
- 전례 없는 CPU 속도: 분포 초점 손실(DFL)을 제거하여 YOLO26은 CPU 추론 속도를 최대 43% 높입니다. 따라서 엣지 디바이스와 전용 GPU가 없는 환경에 가장 적합한 선택입니다.
- 고급 손실 함수: ProgLoss 및 STAL 통합으로 소형 객체 인식 성능이 크게 향상됩니다. 이는 드론 분석, IoT, 로봇 공학에 필수적입니다.
- 작업별 개선 사항: 포즈 추정을 위한 잔차 로그 가능도 추정(RLE)과 방향성 바운딩 박스를 위한 전용 각도 손실과 같은 특화된 최적화를 도입하여 모든 컴퓨터 비전 작업에서 우수한 성능을 보장합니다.
표준 객체 탐지를 넘어선 특화 아키텍처에 관심이 있는 사용자는 Transformer 기반 탐지를 위한 RT-DETR이나 오픈 보캐뷸러리 추적 및 탐지를 위한 YOLO-World와 같은 모델도 살펴볼 수 있습니다. 유지 관리가 잘되고 최적화된 이러한 도구를 활용하면 컴퓨터 비전 파이프라인을 효율적이고 확장 가능하며 최신 기술에 뒤처지지 않도록 유지할 수 있습니다.