YOLOX와 YOLO11#
컴퓨터 비전의 발전은 높은 정확도와 추론 속도의 균형을 이루는 실시간 객체 감지 프레임워크를 추구하는 과정에 크게 힘입었습니다. 이러한 여정에서 가장 주목할 만한 이정표로는 YOLOX와 Ultralytics YOLO11이 있습니다. 두 모델 모두 이 분야에 크게 기여했지만, 기본 아키텍처와 설계 철학, 개발자 생태계는 상당히 다릅니다.
이 종합적인 기술 비교에서는 아키텍처, 성능 지표, 학습 방법론 및 이상적인 배포 시나리오를 살펴보고, 다음 인공지능 프로젝트에 적합한 결정을 내릴 수 있도록 지원합니다.
YOLOX 개요#
2021년 7월 18일, Megvii의 연구원 Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, Jian Sun이 공개한 YOLOX는 YOLO 시리즈에 큰 변화를 가져왔습니다. YOLOX는 앵커 프리 설계를 도입하여 학술 연구와 산업적 적용 간의 격차를 성공적으로 해소했습니다.
더 자세한 기술적 배경은 원본 YOLOX Arxiv 논문에서 확인할 수 있습니다.
주요 아키텍처 특징#
YOLOX는 디커플드 헤드와 앵커 프리 메커니즘을 채택하여 기존의 앵커 기반 감지 방식에서 벗어났습니다. 이 설계는 설계 매개변수의 수를 줄이고 다양한 벤치마크에서 모델의 성능을 향상했습니다. 또한 SimOTA와 같은 고급 라벨 할당 전략을 도입하여 학습 프로세스를 가속하고 수렴 성능을 개선했습니다.
YOLOX는 당시 기준으로 뛰어난 정확도를 제공하지만, 주로 바운딩 박스 객체 감지에 초점을 맞추며 기본적으로 다른 복잡한 비전 작업을 지원하지 않습니다.
사전 정의된 앵커 박스를 제거함으로써 YOLOX는 다양한 데이터셋에 필요한 휴리스틱 튜닝을 크게 줄였으며, 앵커 프리 방법론 연구를 위한 강력한 기준선이 되었습니다.
Ultralytics YOLO11 개요#
2024년 9월 27일 Ultralytics의 Glenn Jocher와 Jing Qiu가 공개한 YOLO11은 컴퓨터 비전에서 다재다능함과 사용 편의성을 새롭게 정의하는 최첨단 모델입니다. 수년간 축적된 기반 연구를 바탕으로 구축된 이 모델은 다양한 작업에서 탁월한 성능을 발휘하는 고도로 정 refined되고 프로덕션에 바로 사용할 수 있는 솔루션을 제공합니다.
Ultralytics의 강점#
YOLO11은 단순한 객체 감지기가 아니라 인스턴스 세그멘테이션, 이미지 분류, 포즈 추정, 방향성 바운딩 박스(OBB) 감지를 지원하는 통합 프레임워크입니다. 속도, 매개변수 수, 정확도 간의 원활한 균형을 우선시하는 매우 효율적인 아키텍처를 자랑합니다.
또한 YOLO11은 Ultralytics Platform에 완전히 통합되어 데이터 어노테이션, 모델 학습 및 배포를 위한 간소화된 생태계를 제공합니다.
성능 및 지표 비교#
이러한 모델을 비교하면 성능 간의 균형이 분명해집니다. YOLO11은 대부분의 크기 범주에서 YOLOX 대응 모델보다 훨씬 적은 매개변수와 FLOPs로 더 높은 평균 정밀도(mAP)를 달성합니다.
| 모델 | 크기 (픽셀) | mAPval 50-95 | 속도 CPU ONNX (ms) | 속도 T4 TensorRT10 (ms) | 파라미터 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| YOLO11n | 640 | 39.5 | 56.1 | 1.5 | 2.6 | 6.5 |
| YOLO11s | 640 | 47.0 | 90.0 | 2.5 | 9.4 | 21.5 |
| YOLO11m | 640 | 51.5 | 183.2 | 4.7 | 20.1 | 68.0 |
| YOLO11l | 640 | 53.4 | 238.6 | 6.2 | 25.3 | 86.9 |
| YOLO11x | 640 | 54.7 | 462.8 | 11.3 | 56.9 | 194.9 |
앞서 살펴본 것처럼 YOLO11 모델은 더 적은 매개변수 규모를 유지하면서도 정확도에서 일관되게 YOLOX를 능가합니다. 예를 들어 YOLO11m은 20.1M parameters만으로 51.5 mAP를 달성하는 반면, YOLOXx는 이와 유사한 51.1 mAP를 달성하기 위해 무려 99.1M parameters가 필요합니다. 학습 및 추론 중 메모리 효율이 높기 때문에 YOLO11은 엣지 AI 디바이스에 매우 적합하며, RT-DETR과 같은 구형 모델 또는 Transformer 기반 모델에서 일반적으로 요구되는 높은 CUDA 메모리 요구 사항을 피할 수 있습니다.
Ultralytics 모델은 YOLOX 및 Transformer 기반 아키텍처에 비해 학습 중 필요한 GPU 메모리가 훨씬 적으므로, 연구자들이 일반적인 소비자용 하드웨어에서 강력한 모델을 학습할 수 있습니다.
생태계 및 사용 편의성#
두 프레임워크의 가장 두드러진 차이점 중 하나는 개발자 경험입니다.
YOLOX는 리포지토리를 클론하고, 복잡한 환경을 설정하며, 모델을 학습하고 ONNX 또는 TensorRT와 같은 형식으로 내보내기 위해 장황한 명령줄 인수를 실행해야 하는 경우가 많습니다.
이와 대조적으로 Ultralytics YOLO11은 매우 간단한 Python API와 CLI를 제공합니다. Ultralytics 라이브러리는 데이터 증강, 하이퍼파라미터 튜닝 및 내보내기를 자동으로 처리합니다.
from ultralytics import YOLO
# Load a pretrained YOLO11 model
model = YOLO("yolo11n.pt")
# Train the model effortlessly on custom data
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export the trained model to TensorRT for optimized deployment
model.export(format="engine")이 잘 유지 관리되는 생태계는 광범위한 문서와 실험 추적을 위한 Weights & Biases와 같은 도구와의 원활한 통합을 기반으로 합니다.
이상적인 사용 사례#
이러한 모델 중 무엇을 선택할지는 배포 환경의 구체적인 특성에 따라 결정되는 경우가 많습니다.
YOLOX를 사용해야 하는 경우#
- 레거시 시스템: MegEngine 프레임워크 또는 2021년 초의 객체 감지 패러다임을 중심으로 명시적으로 구축된 기존 파이프라인이 있는 경우입니다.
- 학술적 기준선: 2021년 당시의 기반 앵커 프리 아키텍처와 직접 벤치마킹해야 하는 연구를 수행하는 경우입니다.
YOLO11을 사용해야 하는 경우#
- 프로덕션 배포: 견고하게 유지 관리되는 코드와 높은 정확도가 필수적인 스마트 리테일 또는 보안 경보 시스템의 상용 애플리케이션에 적합합니다.
- 멀티태스크 파이프라인: 단일 통합 프레임워크를 사용하여 객체 추적, 사람 포즈 추정 및 인스턴스 세그멘테이션을 수행해야 하는 프로젝트에 적합합니다.
- 리소스가 제한된 엣지 디바이스: 매개변수 수가 적고 처리량이 높기 때문에 YOLO11은 Raspberry Pi에 배포하거나 CoreML 및 NCNN을 통해 모바일 엣지 노드에 배포하는 데 적합합니다.
미래를 향해: YOLO26의 장점#
YOLO11이 YOLOX를 크게 앞서지만 컴퓨터 비전 분야는 빠르게 발전하고 있습니다. 현재 새로운 프로젝트를 시작하는 개발자에게는 **Ultralytics YOLO26**을 가장 확실한 선택으로 권장합니다.
2026년 1월에 공개된 YOLO26은 YOLO11의 뛰어난 아키텍처를 기반으로 다음과 같은 여러 획기적인 기능을 도입합니다.
- 종단간 NMS 미적용 설계: YOLO26은 더 빠르고 단순한 배포 파이프라인을 위해 비최대억제(NMS) 후처리를 제거했습니다(YOLOv10에서 처음 탐구된 개념입니다).
- 최대 43% 더 빠른 CPU 추론: Distribution Focal Loss(DFL)를 제거하여 YOLO26은 CPU와 저전력 엣지 디바이스에서 훨씬 더 효율적으로 작동합니다.
- MuSGD 옵티마이저: Moonshot AI의 LLM 학습 혁신에서 영감을 받은 MuSGD 옵티마이저는 매우 안정적인 학습 실행과 빠른 수렴을 보장합니다.
- 고급 손실 함수: ProgLoss + STAL을 활용하는 YOLO26은 소형 객체 인식에서 주목할 만한 성능 향상을 달성하며, 이는 드론 이미지와 자율 로보틱스에 매우 중요합니다.
대부분의 최신 컴퓨터 비전 작업에서 파이프라인을 업그레이드하여 YOLO26을 활용하면 속도, 정확도 및 배포 간편성 간의 최상의 균형을 얻을 수 있습니다.