YOLOX와 YOLOv5#
적절한 객체 탐지 모델을 선택하는 것은 모든 컴퓨터 비전 프로젝트의 성공을 좌우하는 중요한 결정입니다. 이 가이드에서는 AI 분야의 두 핵심 모델인 Megvii의 YOLOX와 Ultralytics YOLOv5를 종합적으로 기술 비교합니다. 아키텍처, 성능 지표, 학습 생태계를 분석하여 개발자와 연구자가 각자의 배포 환경에 맞는 정보에 근거한 선택을 내릴 수 있도록 돕고자 합니다.
모델 소개#
두 모델은 실시간 객체 탐지가 빠르게 발전하던 시기에 등장했지만, 각기 다른 아키텍처 철학을 바탕으로 성능을 구현했습니다.
YOLOX: 앵커 프리 접근 방식#
2021년 7월 18일, Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, Jian Sun 연구진이 Megvii에서 공개한 YOLOX는 기존 앵커 박스를 사용하지 않는 중요한 변화를 도입했습니다. Arxiv 기술 보고서에 자세히 설명된 YOLOX는 앵커 프리 설계와 분리형 헤드, SimOTA 라벨 할당 전략을 결합했습니다. 이 설계는 표준 데이터셋에서 높은 성능을 제공하면서 학술 연구와 산업 응용 간의 격차를 좁히는 것을 목표로 했습니다.
YOLOv5: 프로덕션 비전 AI의 표준#
Glenn Jocher가 작성하고 Ultralytics가 2020년 6월 26일 공개한 YOLOv5는 빠르게 배포형 컴퓨터 비전의 업계 표준이 되었습니다. PyTorch 프레임워크를 기반으로 구축되어, 탁월한 사용 편의성, 매우 빠른 학습 속도, 완성도 높은 저장소를 제공함으로써 최첨단 AI를 대중화했습니다. YOLOv5 아키텍처는 속도, 정확도, 배포 편의성의 이상적인 균형에 중점을 두어 엣지 디바이스부터 대규모 클라우드 배포까지 다양한 용도에서 선호되었습니다.
아키텍처 차이#
이 네트워크 간의 핵심적인 메커니즘 차이를 이해하면 다양한 작업에서 성능이 달라지는 이유를 명확히 파악할 수 있습니다.
앵커 프리와 앵커 기반 비교#
가장 두드러지는 차이점은 YOLOX의 앵커 프리 메커니즘입니다. YOLOv5와 같은 기존 모델은 바운딩 박스를 예측하기 위해 사전 정의된 앵커 박스를 사용하며, 최적의 앵커 크기를 결정하려면 학습 데이터셋에 대한 클러스터링 분석이 필요합니다. YOLOX는 이 과정을 없애고 각 공간 위치에서 바운딩 박스 좌표를 직접 예측합니다. 앵커 프리 접근 방식은 설계 매개변수 수와 휴리스틱 튜닝을 줄이는 반면, 자동 앵커 기능으로 보완된 YOLOv5의 정교한 앵커 기반 접근 방식은 처음부터 매우 안정적이고 예측 가능한 학습 수렴을 보장합니다.
분리형 헤드와 결합형 헤드 비교#
YOLOX는 분리형 헤드를 사용합니다. 즉, 분류 작업과 회귀 작업을 별도의 신경망 분기로 나눕니다. 저자들은 이 방식이 공간 특징 학습과 의미 특징 학습 간의 충돌을 해결한다고 주장했습니다. 반면 YOLOv5는 초기 버전에서 계산 효율을 극대화하고 추론 지연 시간을 줄이는 고도로 최적화된 결합형 헤드를 사용했습니다. 이는 실시간 엣지 컴퓨팅에 매우 중요합니다.
라벨 할당 전략#
YOLOX는 라벨 할당에 SimOTA를 활용합니다. 이는 정답 객체와 예측 결과의 쌍을 최적 수송 문제로 정식화합니다. 동적 할당을 통해 혼잡한 장면을 더 효과적으로 처리합니다. YOLOv5는 견고한 형상 규칙 기반 할당 방식을 사용하여 고품질 양성 샘플을 손실 함수에 일관되게 전달하며, 이는 뛰어난 학습 안정성에 기여합니다.
성능 및 벤치마크#
속도와 정확도의 절충은 이 아키텍처를 평가하는 궁극적인 기준입니다. 아래 표는 표준 벤치마크에서 여러 모델 크기의 성능을 보여줍니다.
| 모델 | 크기 (픽셀) | mAP검증 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | - | 1.12 | 1.9 | 4.5 |
| YOLOv5s | 640 | 37.4 | - | 1.92 | 7.2 | 16.5 |
| YOLOv5m | 640 | 45.4 | - | 4.03 | 21.2 | 49.0 |
| YOLOv5l | 640 | 49.0 | - | 6.61 | 46.5 | 109.1 |
| YOLOv5x | 640 | 50.7 | - | 11.89 | 86.7 | 205.7 |
YOLOX는 특히 대형 변형 모델에서 경쟁력 있는 mAP 점수를 달성하지만, YOLOv5는 전반적으로 TensorRT 추론 속도에서 두드러진 이점을 유지합니다. 예를 들어 YOLOv5s 모델은 속도와 정확도의 비율이 탁월하여 1밀리초도 중요한 실시간 애플리케이션에 매우 적합합니다.
Ultralytics의 강점: 학습과 사용성#
연구에서 프로덕션으로 전환할 때는 모델 자체만큼이나 모델을 둘러싼 생태계도 중요합니다. 이 점에서 Ultralytics 생태계의 장점이 분명하게 드러납니다.
간소화된 사용자 경험#
YOLOv5는 "초보자에서 전문가로" 이어지는 개발자 경험으로 널리 호평받고 있습니다. Ultralytics Python API와 CLI를 사용하면 한 줄의 코드로 모델을 불러오고, 학습시키고, 배포할 수 있습니다. 반면 Megvii GitHub 저장소에서 YOLOX를 실행하려면 환경 변수 수동 설정, 복잡한 Python 경로 구성, 학술 연구 코드베이스 특유의 가파른 학습 과정이 필요합니다.
학습 효율성 및 메모리 요구 사항#
Ultralytics 모델은 학습 중 메모리 사용량을 최소화하도록 세심하게 설계되었습니다. YOLOv5는 RT-DETR과 같은 매개변수가 많은 Transformer 모델이나 최적화되지 않은 연구 모델보다 CUDA 메모리를 훨씬 적게 사용합니다. 따라서 개발자는 일반 소비자용 하드웨어에서도 더 큰 배치 크기로 학습할 수 있어 반복적인 개발 주기를 단축할 수 있습니다.
다양한 작업 지원#
YOLOX는 객체 탐지 전용 프레임워크인 반면, Ultralytics 생태계는 YOLOv5가 여러 비전 작업을 지원하도록 발전시켰습니다. 별도의 설정 없이 동일한 API 구문으로 이미지 분류, 인스턴스 세그멘테이션, 객체 탐지를 수행할 수 있습니다.
자세 추정이나 방향성 바운딩 박스(OBB) 탐지와 같은 더욱 고급 작업이 필요하다면, 이러한 작업을 기본적으로 지원하고 최첨단 정확도를 제공하는 최신 Ultralytics YOLO26 아키텍처로 업그레이드하는 것을 적극 권장합니다.
코드 비교#
사용성의 차이는 코드를 통해 가장 잘 드러납니다.
YOLOv5로 학습하기:
from ultralytics import YOLO
# 사전 학습된 YOLOv5s 모델 로드
model = YOLO("yolov5su.pt") # YOLOv5u: ultralytics 패키지용 앵커 프리 YOLOv5 가중치
# COCO8 예제 데이터셋으로 모델 학습
model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 이미지에서 추론 실행
results = model("https://ultralytics.com/images/zidane.jpg")
# 결과 표시
results[0].show()YOLOX로 학습하기: (저장소 수동 복제, setup.py 설치, 복잡한 CLI 인수 필요)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oUltralytics 방식을 사용하면 설정 파일 디버깅 대신 데이터셋과 애플리케이션 로직에 집중할 수 있어 불필요한 작업이 줄어듭니다. 또한 Weights & Biases와 Comet ML의 기본 제공 통합 기능으로 실험을 원활하게 추적할 수 있습니다.
적합한 사용 사례 및 실제 응용 분야#
이 모델 중 무엇을 선택할지는 프로젝트의 운영 환경에 따라 달라집니다.
YOLOX가 강점을 보이는 분야#
YOLOX는 앵커 프리 패러다임이나 라벨 할당 전략을 명시적으로 연구하는 학술 환경에서 여전히 강력한 후보입니다. 혼잡한 장면 탐지가 가장 중요한 지표이고 엣지 배포 속도는 부차적인 시나리오에서도 유용합니다.
YOLOv5의 강점#
YOLOv5는 실용적인 배포 분야에서 확고한 선두 모델입니다.
- 고속 제조: 조립 라인 결함 탐지에서 YOLOv5는 엣지 GPU의 짧은 추론 지연 시간으로 벨트 속도를 늦추지 않고 제품을 검사할 수 있습니다.
- 드론 및 항공 이미지: 메모리 사용량이 적어 드론의 경량 보조 컴퓨터에서 농업 모니터링, 야생 동물 추적과 같은 작업을 실행할 수 있습니다.
- 스마트 리테일: 자동 결제부터 재고 관리까지, YOLOv5는 TensorRT와 ONNX로 손쉽게 내보낼 수 있어 수천 대의 매장 카메라에 대규모로 배포할 수 있습니다.
앞으로의 방향: YOLO26의 이점#
YOLOv5는 뛰어난 모델이지만 AI 분야는 빠르게 발전하고 있습니다. 지금 새 프로젝트를 시작한다면 최신 세대의 Ultralytics 모델을 살펴보는 것을 적극 권장합니다.
2026년에 출시된 Ultralytics YOLO26은 비약적인 발전을 보여줍니다. 선택적으로 사용할 수 있는 엔드투엔드 NMS 프리 설계(nms=False)를 적용해 Non-Maximum Suppression 후처리가 필요 없으므로 배포 로직이 크게 간소화됩니다. Distribution Focal Loss(DFL)를 제거하고 최첨단 MuSGD Optimizer를 활용하여, YOLO26은 이전 세대보다 CPU 추론 속도를 최대 43% 높이는 동시에 정확도도 향상합니다. 특히 새로운 ProgLoss + STAL(점진적 손실 및 소형 객체 인식 라벨 할당) 덕분에 작은 객체에서 더욱 높은 정확도를 제공합니다.
검증된 YOLOv5의 안정성을 선택하든 최신 YOLO26의 성능을 선택하든, Ultralytics Platform은 컴퓨터 비전 솔루션을 구상에서 프로덕션까지 원활하게 구현할 수 있도록 최상의 도구를 제공합니다. AI 파이프라인의 잠재력을 온전히 활용하려면 종합적인 Ultralytics 문서를 살펴보세요.