YOLO11과 YOLOv10#
실시간 컴퓨터 비전 분야는 끊임없이 발전하고 있으며, 새로운 아키텍처가 엣지 디바이스와 클라우드 인프라 모두에서 가능한 범위의 한계를 확장하고 있습니다. 이 상세한 기술 분석에서는 해당 분야의 두 핵심 모델인 Ultralytics YOLO11과 YOLOv10의 차이점을 살펴봅니다. 두 모델 모두 객체 감지 기능에서 중요한 도약을 보여주지만, 성능을 달성하기 위해 근본적으로 서로 다른 아키텍처 철학을 채택합니다.
YOLO11 아키텍처 살펴보기#
YOLO11 세부 정보:
- 저자: Glenn Jocher 및 Jing Qiu
- 조직: Ultralytics
- 날짜: 2024-09-27
- GitHub: https://github.com/ultralytics/ultralytics
- 문서: https://docs.ultralytics.com/models/yolo11
다재다능한 강력한 모델로 소개된 YOLO11은 수년간 축적된 컴퓨터 비전 및 AI 기초 연구를 기반으로 구축되었습니다. YOLO11의 핵심 설계 철학은 다양한 컴퓨터 비전 작업 전반에서 풍부한 특징 표현과 뛰어난 범용성을 제공하는 데 있습니다.
YOLO11의 주요 개선 사항 중 하나는 C3k2 Block의 구현입니다. 이 개선된 보틀넥 모듈은 네트워크 전체의 그래디언트 흐름을 최적화하여 높은 정확도를 유지하면서 파라미터 효율성을 크게 향상합니다. 또한 YOLO11은 향상된 공간 어텐션 메커니즘을 사용하며, 이는 작거나 부분적으로 가려진 항목을 식별하는 데 매우 중요합니다. 따라서 항공 이미지 사용 사례와 상세한 의료 이미지 분석에 탁월한 선택입니다.
YOLO11은 앵커 프리 설계를 사용하여 하이퍼파라미터 튜닝의 복잡성을 줄이고, 방대한 종류의 커스텀 데이터셋에 대해 강건한 일반화 성능을 제공합니다. 또한 학습 중 메모리 요구량이 Transformer 기반 아키텍처보다 훨씬 낮아, 연구자들이 일반적인 소비자용 하드웨어에서 대규모 모델을 효율적으로 학습할 수 있습니다.
YOLOv10 아키텍처 살펴보기#
YOLOv10 세부 정보:
- 저자: Ao Wang, Hui Chen, Lihao Liu 외
- 소속: Tsinghua University
- 날짜: 2024-05-23
- Arxiv: https://arxiv.org/abs/2405.14458
- GitHub: https://github.com/THU-MIG/yolov10
- Docs: https://docs.ultralytics.com/models/yolov10
Tsinghua University의 연구자들이 개발한 YOLOv10은 YOLO 제품군에서 엔드투엔드 선구자로 주목받았습니다. YOLOv10의 핵심 특징은 NMS-Free Training 방법론입니다. 학습 단계에서 일관된 이중 할당을 사용함으로써 모델은 객체당 정확히 하나의 바운딩 박스를 자연스럽게 예측합니다. 이 획기적인 방식은 추론 중 비최대 억제(NMS)의 필요성을 완전히 제거합니다. 비최대 억제는 과거 배포 파이프라인에서 지연 시간 병목을 일으켰던 후처리 단계입니다.
이 아키텍처는 전체적인 효율성-정확도 설계 전략도 도입합니다. 공간-채널 분리형 다운샘플링과 순위 기반 블록 설계를 통합하여 네트워크 단계에서 중복성을 선택적으로 줄입니다. 그 결과 평균 정밀도(mAP)를 크게 희생하지 않으면서 FLOPs와 계산 오버헤드를 줄일 수 있습니다. 매 밀리초가 중요한 실시간 애플리케이션에서 NMS 제거는 엣지 AI 디바이스에 매우 적합한 결정론적 추론 그래프를 제공합니다.
성능 지표 및 벤치마크#
이 두 모델을 평가할 때는 정확도, 파라미터 수, 속도의 균형을 살펴봅니다. 다음 표에서는 COCO 데이터셋의 다양한 규모에서 두 모델을 비교합니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
| YOLOv10n | 640 | 39.5 | - | 1.56 | 2.3 | 6.7 |
| YOLOv10s | 640 | 46.7 | - | 2.66 | 7.2 | 21.6 |
| YOLOv10m | 640 | 51.3 | - | 5.48 | 15.4 | 59.1 |
| YOLOv10b | 640 | 52.7 | - | 6.54 | 24.4 | 92.0 |
| YOLOv10l | 640 | 53.3 | - | 8.33 | 29.5 | 120.3 |
| YOLOv10x | 640 | 54.4 | - | 12.2 | 56.9 | 160.4 |
YOLO 성능 지표에서 확인할 수 있듯이 YOLO11은 일반적으로 각 변형에서, 특히 대형 모델에서 약간 더 높은 mAP 점수를 달성합니다. YOLOv10의 NMS-free 설계는 매우 안정적인 엔드투엔드 추론 시간을 보장하지만, YOLO11은 NVIDIA 하드웨어에서 TensorRT로 최적화할 경우에도 뛰어난 처리량을 제공합니다.
모델을 배포할 준비를 할 때 최적화된 형식으로 내보내는 작업은 매우 중요합니다. YOLO11과 YOLOv10 모두 Ultralytics 프레임워크를 사용하여 ONNX 및 TensorRT와 같은 형식으로 원활하게 내보낼 수 있습니다. 단계별 지침은 모델 배포 옵션 가이드를 참조하십시오.
Ultralytics 생태계의 이점#
독립적인 성능 지표도 중요하지만, 머신 러닝 프로젝트의 실질적인 성공은 이를 둘러싼 프레임워크에 따라 결정됩니다. YOLO11은 Ultralytics 생태계의 네이티브 구성원으로서 이 부분에서 진정한 강점을 발휘합니다.
Ultralytics Platform은 매우 간소화된 사용자 경험을 제공합니다. 간단하고 통합된 Python API를 사용하면 개발자가 기본적인 바운딩 박스를 넘어선 작업을 처리할 수 있습니다. YOLO11은 인스턴스 세그멘테이션, 포즈 추정, 이미지 분류, Oriented Bounding Box(OBB) 감지를 기본적으로 지원합니다. 이러한 뛰어난 범용성은 특화된 연구 리포지토리에서 부족한 경우가 많습니다.
또한 이 생태계는 광범위한 문서와 활발한 커뮤니티 지원을 기반으로 합니다. 실험 추적을 위한 Weights & Biases, Intel 하드웨어 최적화를 위한 OpenVINO와 같은 도구와의 통합 기능이 라이브러리에 직접 포함되어 있습니다. 모델 학습에는 보일러플레이트 코드가 거의 필요하지 않으며, RT-DETR과 같은 대형 Transformer 모델보다 적은 CUDA 메모리를 사용하는 매우 효율적인 학습 프로세스의 이점을 누릴 수 있습니다.
실습 코드 예제#
Ultralytics를 사용한 학습과 추론 실행은 최대한 직관적으로 설계되었습니다. 동일한 API로 YOLO11과 YOLOv10을 모두 손쉽게 처리할 수 있습니다.
from ultralytics import YOLO
# Initialize the model (YOLO11n or YOLOv10n)
model = YOLO("yolo11n.pt")
# Train the model efficiently on a custom dataset
# Ultralytics automatically handles hyperparameters and memory optimization
results = model.train(data="coco8.yaml", epochs=50, imgsz=640, device=0)
# Run inference on an image
inference_results = model("https://ultralytics.com/images/bus.jpg")
# Display the detected objects
inference_results[0].show()사용 사례 및 권장 사항#
YOLO11과 YOLOv10 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건, 생태계 선호도에 따라 달라집니다.
YOLO11을 선택해야 하는 경우#
YOLO11은 다음과 같은 경우에 적합합니다.
- 프로덕션 엣지 배포: 신뢰성과 지속적인 유지 관리가 무엇보다 중요한 Raspberry Pi 또는 NVIDIA Jetson과 같은 디바이스에서 실행되는 상용 애플리케이션입니다.
- 멀티태스크 비전 애플리케이션: 단일 통합 프레임워크에서 감지, 세그멘테이션, 포즈 추정, OBB가 필요한 프로젝트입니다.
- 신속한 프로토타이핑 및 배포: 간소화된 Ultralytics Python API를 사용하여 데이터 수집부터 프로덕션까지 빠르게 진행해야 하는 팀입니다.
YOLOv10을 선택해야 하는 경우#
YOLOv10은 다음과 같은 경우에 권장됩니다:
- NMS-Free 실시간 탐지: 비최대 억제 없이 엔드투엔드 탐지의 이점을 활용하여 배포 복잡성을 줄이는 애플리케이션입니다.
- 균형 잡힌 속도-정확도 절충: 다양한 모델 규모에서 추론 속도와 탐지 정확도 사이의 뛰어난 균형이 필요한 프로젝트입니다.
- 일관된 지연 시간이 필요한 애플리케이션: 로보틱스 또는 자율 시스템과 같이 예측 가능한 추론 시간이 중요한 배포 시나리오입니다.
Ultralytics(YOLO26)를 선택해야 하는 경우#
대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.
- NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
- CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
- 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.
차세대 모델: YOLO26#
YOLOv10이 혁신적인 NMS-free 패러다임을 도입하고 YOLO11이 멀티태스크 범용성을 완성했지만, AI 분야는 빠르게 발전합니다. 현재 새로운 프로덕션 배포를 시작하는 개발자에게는 Ultralytics YOLO26을 살펴볼 것을 적극 권장합니다.
2026년 1월에 출시된 YOLO26은 두 모델의 장점을 결합합니다. YOLOv10이 개척한 End-to-End NMS-Free Design을 기본적으로 채택하여 배포 파이프라인을 크게 단순화하고 일관된 지연 시간을 보장합니다. 또한 YOLO26은 특화된 엣지 컴퓨팅 최적화를 통합합니다. DFL Removal(Distribution Focal Loss 제거)을 실행함으로써 아키텍처는 더 쉬운 내보내기를 보장하고 기존 모델보다 최대 43% 빠른 CPU 추론을 달성하므로, 저전력 IoT 디바이스와 모바일 애플리케이션에 최적의 선택입니다.
YOLO26은 혁신적인 MuSGD Optimizer를 통해 대규모 언어 모델(LLM) 학습의 안정성을 컴퓨터 비전에 적용합니다. 이는 최신 AI 연구에서 영감을 받은 하이브리드 방식입니다. ProgLoss + STAL 손실 함수와 결합된 YOLO26은 작은 객체에서 탁월한 정밀도를 제공하며, 이는 상세한 교통 영상 감지와 복잡한 로봇 자동화에 필수적입니다.
결론#
적합한 비전 모델의 선택은 구체적인 운영상의 제약 조건에 따라 달라집니다. YOLOv10은 학계에서 중요한 이정표로 자리 잡았으며, 감지 파이프라인에서 NMS를 효과적으로 제거할 수 있음을 입증했습니다. 그러나 성능, 종합적인 작업 범위, 원활한 배포 도구의 균형을 원한다면 YOLO11이 강력하고 엔터프라이즈 환경에 바로 사용할 수 있는 솔루션을 제공합니다.
최첨단 기술을 원하는 엔지니어에게는 엔드투엔드의 간소함과 매우 빠른 엣지 성능을 결합한 최신 YOLO26으로의 마이그레이션을 최종적으로 권장합니다. 종합적인 Ultralytics Platform을 활용하면 프로젝트가 잘 유지 관리되고 매우 효율적이며 미래 지향적인 기반 위에 구축되도록 할 수 있습니다.