Ultralytics YOLO27:

DAMO-YOLO와 YOLOv6-3.0#

컴퓨터 비전의 급속한 발전으로 산업 애플리케이션에 맞게 설계된 고도로 전문화된 아키텍처가 등장했습니다. 그중에서도 실시간 성능과 배포 효율성에 중점을 둔 두 가지 대표 모델로 DAMO-YOLOYOLOv6-3.0을 들 수 있습니다. 이 페이지에서는 배포 선택에 도움이 되도록 두 모델의 아키텍처, 성능 지표 및 학습 방법론을 심층적으로 비교합니다.

DAMO-YOLO: 신경망 아키텍처 탐색과 객체 탐지의 결합#

Alibaba Group의 연구진이 개발한 DAMO-YOLO는 신경망 아키텍처 탐색(NAS)을 백본 설계에 깊이 통합하여 YOLO 제품군에 새로운 접근 방식을 도입합니다.

아키텍처 혁신#

DAMO-YOLO는 MAE-NAS라는 NAS 최적화 백본을 사용합니다. 이 백본은 특정 지연 시간 제약 조건에서 최적의 네트워크 구조를 자동으로 탐색합니다. 이를 통해 다양한 하드웨어 프로파일에 걸쳐 모델을 효율적으로 확장할 수 있습니다. 또한 아키텍처는 특징 융합을 개선하기 위해 Efficient RepGFPN(재매개변수화된 일반화 특징 피라미드 네트워크)을 사용하여 멀티스케일 표현을 크게 향상합니다.

또한 이 모델은 "ZeroHead" 설계를 도입합니다. 탐지 헤드의 복잡한 멀티 브랜치 구조를 제거하여 공간 정보를 더욱 효과적으로 보존하는 동시에 계산 오버헤드를 줄입니다. 학습 방법론에서는 정렬된 최적 수송 할당(AlignedOTA)과 강력한 지식 증류도 활용하므로, 더 작은 student 모델이 더 큰 teacher 네트워크에서 학습할 수 있습니다.

증류의 복잡성

지식 증류를 통해 DAMO-YOLO는 높은 정확도를 달성할 수 있지만, 다단계 학습 파이프라인이 필요합니다. 이로 인해 표준 단일 단계 모델을 학습할 때보다 필요한 GPU 컴퓨팅이 크게 증가합니다.

YOLOv6-3.0: 산업 처리량 극대화#

Meituan Vision AI Department가 개척한 YOLOv6-3.0은 산업용 객체 탐지기로 명시적으로 정의되었으며, NVIDIA 하드웨어에서 처리량을 극대화하도록 특별히 설계되었습니다.

  • 저자: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu, Xiangxiang Chu
  • 조직: Meituan
  • 날짜: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

주요 기능 및 개선 사항#

YOLOv6-3.0은 하드웨어 친화적인 EfficientRep 백본을 기반으로 구축되어 최신 GPU에서 TensorRT와 같은 최적화를 활용할 때 매우 빠른 속도를 제공합니다. v3.0 버전에서는 네트워크에 양방향 연결 모듈(Bi-directional Concatenation, BiC)이 통합되어 다양한 크기의 객체에 대한 위치 지정을 개선합니다.

또 다른 주요 기능은 앵커 보조 학습(Anchor-Aided Training, AAT) 전략입니다. AAT는 학습 중 앵커 기반 detector의 안정성과 앵커 프리 설계의 추론 속도를 결합합니다. 이 하이브리드 접근 방식은 배포 지연 시간을 희생하지 않고 뛰어난 수렴을 달성하므로, 스마트 시티 분석 및 무인 계산 시스템에서 대규모 비디오 스트림을 처리하는 데 강력한 선택지가 됩니다.

YOLOv6에 대해 자세히 알아보세요

성능 비교#

이러한 모델을 실시간 추론에 대해 평가할 때는 파라미터, FLOPs 및 정확도의 균형을 맞추는 것이 중요합니다. 아래에서는 두 모델의 성능을 비교한 자세한 평가를 제공합니다.

모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT10
(ms)
파라미터
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

DAMO-YOLO는 small 등급에서 근소한 우위(46.0 mAP 대 45.0 mAP)를 보이지만, YOLOv6-3.0은 medium 및 large 등급에서 우수한 확장성을 보여 앞서며, nano 구성에서는 절대적으로 가장 적은 파라미터를 유지합니다.

두 모델 중 선택하기

하드웨어 환경에서 백본을 맞춤 설정하기 위한 대규모 자동 탐색을 수행할 수 있다면 DAMO-YOLO의 NAS 접근 방식이 매우 효과적입니다. 그러나 T4 또는 A100과 같은 표준화된 GPU 가속에 전적으로 의존한다면 YOLOv6의 EfficientRep 구조가 더 높은 실제 FPS로 이어지는 경우가 많습니다.

사용 사례 및 권장 사항#

DAMO-YOLO와 YOLOv6 중 어떤 모델을 선택할지는 구체적인 프로젝트 요구 사항, 배포 제약 조건 및 생태계 선호도에 따라 달라집니다.

DAMO-YOLO를 선택해야 하는 경우#

DAMO-YOLO가 적합한 경우:

  • High-Throughput Video Analytics: batch-1 throughput이 주요 metric인 고정 NVIDIA GPU infrastructure에서 high-FPS video stream을 처리하는 경우입니다.
  • Industrial Manufacturing Lines: assembly line에서의 real-time quality inspection과 같이 전용 하드웨어에서 엄격한 GPU latency constraint가 있는 경우입니다.
  • Neural Architecture Search Research: automated architecture search(MAE-NAS)와 효율적인 reparameterized backbone이 detection performance에 미치는 영향을 연구하는 경우입니다.

YOLOv6을 선택해야 하는 경우#

다음과 같은 경우 YOLOv6을 권장합니다:

  • 산업용 하드웨어 인식 배포: 모델의 하드웨어 인식 설계와 효율적인 재매개변수화가 특정 대상 하드웨어에서 최적화된 성능을 제공하는 시나리오입니다.
  • 고속 단일 단계 감지: 제어된 환경에서 실시간 비디오 처리를 위해 GPU에서의 순수 추론 속도를 우선시하는 애플리케이션입니다.
  • Meituan 생태계 통합: 이미 Meituan의 기술 스택과 배포 인프라를 사용하고 있는 팀입니다.

Ultralytics(YOLO26)를 선택해야 하는 경우#

대부분의 신규 프로젝트에서 Ultralytics YOLO26은 성능과 개발자 경험의 최적 조합을 제공합니다.

  • NMS-Free 엣지 배포: 비최대 억제 후처리의 복잡성 없이 일관되고 지연 시간이 짧은 추론이 필요한 애플리케이션입니다.
  • CPU 전용 환경: 전용 GPU 가속 기능이 없는 디바이스에서 YOLO26의 최대 43% 더 빠른 CPU 추론이 결정적인 이점을 제공하는 경우입니다.
  • 소형 객체 탐지: 항공 드론 이미지나 IoT 센서 분석처럼 ProgLoss와 STAL이 작은 객체의 정확도를 크게 향상하는 까다로운 시나리오입니다.

Ultralytics의 강점: YOLO26 소개#

DAMO-YOLO와 YOLOv6-3.0은 모두 뛰어난 역량을 갖추었지만, 생태계의 파편화, 단일 작업의 한계 및 복잡한 배포 파이프라인이라는 문제가 있습니다. 현대적인 엔지니어링 팀에는 획기적인 YOLO26으로 이어지는 Ultralytics 모델이 훨씬 더 나은 개발자 경험을 제공합니다.

2026년 1월에 출시된 YOLO26은 엣지 및 클라우드 배포를 위한 새로운 표준을 제시하며, 메모리 요구 사항과 계산 효율성을 대폭 최적화합니다.

YOLO26을 선택해야 하는 이유#

  1. 엔드 투 엔드 NMS 프리 설계: YOLOv10의 개념을 기반으로 하는 YOLO26은 비최대 억제 후처리를 기본적으로 제거합니다. 이를 통해 배포 코드가 크게 간소화되고 모든 엣지 디바이스에서 추론 지연 시간의 변동성이 줄어듭니다.
  2. 탁월한 최적화: YOLO26은 SGD와 Muon(대규모 언어 모델에서 영감을 받은)을 결합한 하이브리드인 MuSGD Optimizer를 사용하여 매우 안정적인 학습 실행과 더 빠른 수렴을 실현합니다.
  3. 하드웨어 범용성: DFL Removal(Distribution Focal Loss 제거)을 구현하여 출력 헤드를 단순화하고 엣지 디바이스 호환성을 향상합니다. 실제로 YOLO26은 최대 43% 더 빠른 CPU 추론을 달성하므로 모바일 또는 IoT 엣지 환경에서 YOLOv6보다 훨씬 뛰어납니다.
  4. 향상된 정확도: ProgLoss + STAL을 활용하는 YOLO26은 소형 객체 탐지 성능을 크게 향상하므로 항공 이미지 및 결함 검사에 최적의 선택입니다.
  5. 탁월한 범용성: 바운딩 박스만 지원하는 산업용 모델들과 달리, YOLO26 패밀리는 이미지 분류, 인스턴스 세그멘테이션, 포즈 추정, 그리고 지향성 바운딩 박스 (OBB)를 포함한 다양한 태스크를 지원합니다.

원활한 생태계 경험#

Ultralytics Platform은 전체 머신 러닝 수명 주기를 혁신합니다. 이제 모델 학습이 더 이상 다단계 증류로 인한 복잡한 문제가 아닙니다. 자동 데이터 증강, 통합 하이퍼파라미터 튜닝 및 ONNX, OpenVINO, CoreML과 같은 형식으로의 원클릭 내보내기를 통해 데이터셋에서 프로덕션까지 몇 주가 아니라 몇 시간 만에 진행할 수 있습니다.

또한 Ultralytics 모델은 메모리 효율성이 뛰어난 것으로 알려져 있어 RT-DETR과 같은 Transformer 아키텍처를 괴롭히는 막대한 VRAM 병목을 피할 수 있습니다.

빠른 시작 코드 예제#

YOLO26과 같은 Ultralytics 모델을 사용한 학습 및 추론은 매우 간단합니다. 다음 Python 스크립트는 몇 줄의 코드만으로 즉시 객체 추적을 시작하는 방법을 보여줍니다.

from ultralytics import YOLO

# Load the highly efficient, NMS-free YOLO26 nano model
model = YOLO("yolo26n.pt")

# Train the model on your custom dataset seamlessly
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference on a sample image
prediction = model("https://ultralytics.com/images/bus.jpg")

# Export to TensorRT for maximum GPU throughput
model.export(format="engine", dynamic=True)

결론#

DAMO-YOLO와 YOLOv6-3.0은 모두 산업용 객체 탐지의 한계를 확장하는 인상적인 엔지니어링 성과입니다. 그러나 고도로 전문화된 도구이므로 복잡한 설정과 엄격한 하드웨어 제약이 필요한 경우가 많습니다.

완벽한 성능 균형, 멀티태스크 기능 및 활발하게 유지 관리되는 생태계를 필요로 하는 개발자와 연구자에게 Ultralytics YOLO26은 독보적인 선택입니다. LLM에서 영감을 받은 옵티마이저와 깔끔한 NMS 프리 아키텍처를 결합한 YOLO26은 엣지 및 클라우드 환경 전반에서 최신 수준의 정확도를 제공하면서 AI 배포를 간소화합니다.

새로운 컴퓨터 비전 프로젝트를 위해 모델을 평가하고 있다면 Ultralytics YOLO 생태계의 기능을 살펴보는 것을 적극 권장합니다. 실시간 비전 AI의 발전 과정을 완전히 이해하기 위해 EfficientDet과 같은 다른 아키텍처나 이전의 주요 이정표인 YOLO11과 비교해 보는 것도 유용합니다.

댓글