YOLOX vs YOLOv5#
적절한 객체 검출 모델을 선택하는 것은 모든 컴퓨터 비전 프로젝트의 성공을 좌우하는 중요한 결정입니다. 이 가이드에서는 AI 분야에서 중요한 두 모델인 Megvii의 YOLOX와 Ultralytics YOLOv5를 포괄적으로 기술 비교합니다. 아키텍처, 성능 지표, 학습 생태계를 분석하여 개발자와 연구자가 각자의 배포 환경에 맞는 합리적인 선택을 할 수 있도록 지원합니다.
모델 소개#
두 모델은 실시간 객체 검출이 빠르게 발전하던 시기에 등장했지만, 성능을 달성하기 위해 서로 다른 아키텍처 철학을 채택했습니다.
YOLOX: 앵커 프리 접근 방식#
Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, Jian Sun 연구원이 Megvii에서 2021년 7월 18일 공개한 YOLOX는 기존 앵커 박스에서 벗어나는 중대한 변화를 도입했습니다. Arxiv 기술 보고서에 문서화된 YOLOX는 분리형 헤드 및 SimOTA 라벨 할당 전략과 함께 앵커 프리 설계를 통합했습니다. 이 설계는 표준 데이터셋에서 우수한 성능을 제공하여 학술 연구와 산업적 적용 간의 격차를 해소하는 것을 목표로 했습니다.
YOLOv5: 프로덕션 비전 AI의 표준#
Glenn Jocher가 작성하고 2020년 6월 26일 Ultralytics에서 출시한 YOLOv5는 배포형 컴퓨터 비전의 업계 표준으로 빠르게 자리 잡았습니다. PyTorch 프레임워크를 기반으로 네이티브하게 구축된 YOLOv5는 탁월한 사용 편의성, 매우 빠른 학습 속도, 고도로 완성도 높은 리포지토리를 제공하여 최첨단 AI를 대중화했습니다. YOLOv5의 아키텍처는 속도, 정확도, 배포 편의성 사이의 완벽한 균형에 초점을 맞추었으며, 엣지 디바이스부터 대규모 클라우드 배포까지 다양한 용도에서 선호되는 모델이 되었습니다.
아키텍처 차이#
이러한 네트워크의 핵심적인 기계적 차이를 이해하면 다양한 작업에서 성능이 서로 다르게 나타나는 이유를 명확히 알 수 있습니다.
앵커 프리 vs. 앵커 기반#
가장 두드러지는 차이는 YOLOX의 앵커 프리 메커니즘입니다. YOLOv5와 같은 기존 모델은 바운딩 박스를 예측하기 위해 사전 정의된 앵커 박스에 의존하며, 최적의 앵커 크기를 결정하려면 학습 데이터셋에 대한 클러스터링 분석이 필요합니다. YOLOX는 이 과정을 제거하고 각 공간 위치에서 바운딩 박스 좌표를 직접 예측합니다. 앵커 프리 접근 방식은 설계 매개변수와 휴리스틱 튜닝의 수를 줄이지만, YOLOv5의 개선된 앵커 기반 접근 방식은 오토 앵커 기능을 통해 처음부터 매우 안정적이고 예측 가능한 학습 수렴을 보장합니다.
디커플드 헤드 vs. 커플드 헤드#
YOLOX는 디커플드 헤드를 사용하며, 이는 분류와 회귀 작업을 서로 분리된 신경망 브랜치로 나눈다는 의미입니다. 저자들은 이 방식이 공간적 특징 학습과 의미적 특징 학습 간의 충돌을 해결한다고 주장했습니다. 반면 YOLOv5는 초기 버전에서 고도로 최적화된 커플드 헤드를 사용하여 계산 효율성을 극대화하고 추론 지연 시간을 줄였으며, 이는 실시간 엣지 컴퓨팅에 매우 중요합니다.
레이블 할당 전략#
YOLOX는 레이블 할당에 SimOTA를 사용하며, 이는 정답 객체와 예측 결과의 매칭을 최적 수송 문제로 정식화합니다. 이 동적 할당 방식은 복잡한 장면을 더욱 효과적으로 처리합니다. YOLOv5는 견고한 형상 규칙 기반 할당을 사용하여 고품질 양성 샘플이 손실 함수에 일관되게 입력되도록 하며, 이는 전설적인 학습 안정성에 기여합니다.
성능 및 벤치마크#
속도와 정확도 사이의 절충은 이러한 아키텍처에 대한 궁극적인 시험입니다. 아래 표는 표준 벤치마크에서 다양한 모델 크기의 성능을 보여줍니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLOv5n | 640 | 28.0 | 73.6 | 1.12 | 2.6 | 7.7 |
| YOLOv5s | 640 | 37.4 | 120.7 | 1.92 | 9.1 | 24.0 |
| YOLOv5m | 640 | 45.4 | 233.9 | 4.03 | 25.1 | 64.2 |
| YOLOv5l | 640 | 49.0 | 408.4 | 6.61 | 53.2 | 135.0 |
| YOLOv5x | 640 | 50.7 | 763.2 | 11.89 | 97.2 | 246.4 |
YOLOX는 특히 대형 변형 모델에서 경쟁력 있는 mAP 점수를 달성하지만, YOLOv5는 전반적으로 TensorRT 추론 속도에서 놀라운 우위를 유지합니다. 예를 들어 YOLOv5s 모델은 속도와 정확도의 비율이 탁월하여 1밀리초도 중요한 실시간 애플리케이션에 매우 적합합니다.
Ultralytics의 강점: 학습 및 사용 편의성#
연구에서 프로덕션으로 전환할 때는 모델 자체만큼이나 모델을 둘러싼 생태계도 중요합니다. 이러한 측면에서 Ultralytics 생태계의 장점은 매우 분명하게 드러납니다.
간소화된 사용자 경험#
YOLOv5는 "제로에서 전문가까지" 이어지는 개발자 경험으로 널리 호평받고 있습니다. Ultralytics Python API와 CLI를 사용하면 한 줄의 코드로 모델을 로드하고 학습하며 배포할 수 있습니다. 반면 Megvii GitHub 리포지토리에서 YOLOX를 실행하려면 환경 변수의 수동 구성, 복잡한 Python 경로 설정, 학술 연구 코드베이스에 일반적인 더 가파른 학습 곡선이 필요합니다.
학습 효율성 및 메모리 요구 사항#
Ultralytics 모델은 학습 중 메모리 사용량을 최소화하도록 세심하게 설계되었습니다. YOLOv5는 RT-DETR과 같은 매개변수가 많은 Transformer 모델이나 최적화되지 않은 연구 모델에 비해 훨씬 적은 CUDA 메모리를 사용합니다. 따라서 개발자는 일반 소비자용 하드웨어에서 더 큰 배치 크기로 학습할 수 있어 반복적인 개발 주기를 단축할 수 있습니다.
다양한 작업 지원#
YOLOX가 엄 strictly 객체 검출 프레임워크인 반면, Ultralytics 생태계는 YOLOv5를 발전시켜 여러 비전 작업을 지원하도록 했습니다. 별도의 설정 없이 동일한 API 구문으로 이미지 분류, 인스턴스 세그멘테이션, 객체 검출을 수행할 수 있습니다.
자세 추정이나 방향성 바운딩 박스(OBB) 검출과 같은 더욱 고급 작업이 필요하다면, 이러한 기능을 모두 네이티브하게 지원하면서 최첨단 정확도를 제공하는 최신 Ultralytics YOLO26 아키텍처로 업그레이드할 것을 적극 권장합니다.
코드 비교#
사용 편의성의 차이는 코드를 통해 가장 잘 확인할 수 있습니다.
YOLOv5를 사용한 학습:
from ultralytics import YOLO
# Load a pretrained YOLOv5s model
model = YOLO("yolov5su.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/zidane.jpg")
# Display results
results[0].show()YOLOX를 사용한 학습: (리포지토리 수동 클론, setup.py 설치, 복잡한 CLI 인수가 필요합니다)
# Example YOLOX training command
python tools/train.py -f exps/default/yolox_s.py -d 1 -b 64 --fp16 -oUltralytics 방식은 불필요한 작업을 제거하여 설정 파일을 디버깅하는 대신 데이터셋과 애플리케이션 로직에 집중할 수 있도록 합니다. 또한 Weights & Biases 및 Comet ML과의 기본 제공 통합 기능을 통해 실험을 원활하게 추적할 수 있습니다.
이상적인 사용 사례 및 실제 애플리케이션#
이러한 모델 중 무엇을 선택할지는 프로젝트의 운영 환경에 따라 결정됩니다.
YOLOX의 강점#
YOLOX는 연구자가 앵커 프리 패러다임이나 레이블 할당 전략을 명시적으로 연구하는 학술 환경에서 여전히 강력한 후보입니다. 또한 복잡한 장면 검출이 절대적으로 가장 중요한 지표이고 엣지 배포 속도는 부차적인 시나리오에서도 유용합니다.
YOLOv5가 뛰어난 분야#
YOLOv5는 실용적인 배포 분야에서 확고한 최강자입니다.
- 고속 제조: 조립 라인의 결함 검출에서는 엣지 GPU에서 YOLOv5의 짧은 추론 지연 시간 덕분에 벨트 속도를 늦추지 않고 제품을 검사할 수 있습니다.
- 드론 및 항공 이미지: 메모리 사용량이 효율적이므로 드론의 경량 컴패니언 컴퓨터에서 실행하여 농업 모니터링 및 야생동물 추적과 같은 작업을 수행할 수 있습니다.
- 스마트 리테일: 자동 결제부터 재고 관리까지, YOLOv5는 TensorRT와 ONNX로 쉽게 내보낼 수 있어 수천 개 매장 카메라에 대규모로 배포할 수 있습니다.
미래를 향한 전망: YOLO26의 장점#
YOLOv5는 전설적인 모델이지만 AI 분야는 빠르게 발전하고 있습니다. 오늘 새로운 프로젝트를 시작한다면 최신 세대의 Ultralytics 모델을 살펴볼 것을 강력히 권장합니다.
2026년에 출시된 **Ultralytics YOLO26**은 대대적인 도약을 보여줍니다. 엔드 투 엔드 NMS 프리 설계를 적용하여 Non-Maximum Suppression 후처리의 필요성을 완전히 제거하고 배포 로직을 크게 단순화합니다. Distribution Focal Loss (DFL)를 제거하고 최첨단 MuSGD Optimizer를 활용한 YOLO26은 새로운 ProgLoss + STAL 손실 함수 덕분에 특히 작은 객체에서 더 높은 정확도를 유지하면서 이전 세대보다 CPU 추론 속도가 최대 43% 빠릅니다.
검증된 YOLOv5의 안정성을 선택하든 최첨단 YOLO26의 성능을 선택하든, Ultralytics Platform은 컴퓨터 비전 솔루션을 개념에서 프로덕션까지 원활하게 구현하는 데 필요한 최상의 도구를 제공합니다. AI 파이프라인의 잠재력을 최대한 활용하려면 종합적인 Ultralytics 문서를 반드시 살펴보시기 바랍니다.