YOLO Vision 2026:

YOLO12: 어텐션 중심 객체 탐지#

개요#

2025년 초에 출시된 YOLO12는 이전 YOLO 모델에서 사용되던 기존 CNN 기반 접근 방식에서 벗어난 어텐션 중심 아키텍처를 도입하는 동시에, 많은 애플리케이션에 필수적인 실시간 추론 속도를 유지합니다. 이 모델은 어텐션 메커니즘과 전체 네트워크 아키텍처의 새로운 방법론적 혁신을 통해 실시간 성능을 유지하면서도 높은 객체 검출 정확도를 달성합니다. 이러한 장점에도 불구하고, YOLO12는 무거운 어텐션 블록으로 인해 학습 불안정성, 높은 메모리 소비, 느린 CPU 처리량을 보일 수 있는 커뮤니티 주도형 릴리스이므로, Ultralytics에서는 대부분의 프로덕션 워크로드에 YOLO11 또는 YOLO26을 권장합니다.

커뮤니티 모델

YOLO12는 주로 벤치마킹과 연구 목적으로 유지관리됩니다. 안정적인 학습, 예측 가능한 메모리 사용량, 최적화된 CPU 추론이 필요한 경우 배포를 위해 YOLO11 또는 YOLO26을 선택하십시오.



Watch: How to Use YOLO12 for Object Detection with the Ultralytics Package | Is YOLO12 Fast or Slow? 🚀

주요 특징#

  • 영역 어텐션 메커니즘(Area Attention Mechanism): 대규모 수용 영역(receptive field)을 효율적으로 처리하는 새로운 셀프 어텐션 방식입니다. 복잡한 연산을 피하고 큰 유효 수용 영역을 유지하면서 feature maps을 수평 또는 수직으로 l개의 동일한 크기 영역(기본값 4)으로 나눕니다. 이는 표준 셀프 어텐션에 비해 연산 비용을 크게 줄여줍니다.
  • 잔차 효율적 계층 집계 네트워크(R-ELAN): 특히 대규모 어텐션 중심 모델에서 최적화 문제를 해결하기 위해 ELAN을 기반으로 개선된 특성 집계 모듈입니다. R-ELAN은 다음을 도입합니다:
    • 스케일링이 적용된 블록 수준의 잔차 연결(계층 스케일링과 유사).
    • 병목 구조를 생성하는 재설계된 특성 집계 방법.
  • 최적화된 어텐션 아키텍처: YOLO12는 더 높은 효율성과 YOLO 프레임워크와의 호환성을 위해 표준 어텐션 메커니즘을 간소화했습니다. 여기에는 다음이 포함됩니다:
    • 메모리 액세스 오버헤드를 최소화하기 위한 FlashAttention 사용.
    • 더 깔끔하고 빠른 모델을 위해 위치 인코딩 제거.
    • 어텐션 계층과 피드포워드 계층 간의 연산 균형을 맞추기 위한 MLP 비율 조정(일반적인 4에서 1.2 또는 2로 변경).
    • 더 나은 최적화를 위해 적층 블록의 깊이 축소.
    • 계산 효율성을 위해 (적절한 경우) 합성곱 연산 활용.
    • 위치 정보를 암묵적으로 인코딩하기 위해 어텐션 메커니즘에 7x7 분리 가능한 합성곱("위치 인식기") 추가.
  • 포괄적인 태스크 지원: YOLO12는 객체 검출, instance segmentation, image classification, 자세 추정, 지향성 객체 검출(OBB) 등 다양한 핵심 컴퓨터 Vision 태스크를 지원합니다.
  • 향상된 효율성: 이전의 많은 모델과 비교하여 더 적은 파라미터로 더 높은 정확도를 달성하며, 속도와 정확도 사이의 개선된 균형을 보여줍니다.
  • 유연한 배포: 엣지 디바이스부터 클라우드 인프라까지 다양한 플랫폼에 배포하도록 설계되었습니다.

YOLO12 comparison visualization

지원되는 작업 및 모드#

YOLO12는 다양한 컴퓨터 비전 작업을 지원합니다. 아래 표는 작업 지원 여부와 각 작업에 대해 활성화된 작동 모드(추론, 검증, 학습 및 내보내기)를 보여줍니다:

사전 학습된 가중치 가용성

감지 가중치(yolo12n.pt, yolo12s.pt, yolo12m.pt, yolo12l.pt, yolo12x.pt)만 ultralytics/assets에 배포됩니다. 세분화, 분류, 포즈 및 OBB 아키텍처는 ultralytics/cfg/models/12/에 정의되어 있으므로 해당 변형은 .yaml 설정을 사용하여 처음부터 학습을 지원하지만, 현재 사전 학습된 .pt 파일은 제공되지 않습니다. 사전 학습된 세분화, 포즈, 분류 또는 OBB 체크포인트의 경우 Ultralytics는 YOLO11 또는 YOLO26을 권장합니다.

모델 유형작업사전 학습된 가중치학습검증추론내보내기(Export)
YOLO12탐지
YOLO12-segSegmentation
YOLO12-cls분류
YOLO12-posePose
YOLO12-obbOBB

모든 YOLO12 아키텍처는 학습된 체크포인트가 준비되면 모든 모드를 지원합니다. Pretrained Weights 열은 Ultralytics가 ultralytics/assets에 공식 사전 학습된 .pt을 게시하는지 여부만을 나타냅니다. 세분화, 포즈, 분류 및 OBB의 경우 추론, 검증 또는 내보내기를 실행하기 전에 해당 .yaml에서 자체 체크포인트를 학습해야 합니다.

성능 지표#

YOLO12는 가장 빠른 이전 YOLO 모델에 비해 속도면에서 일부 트레이드오프가 있지만, 모든 모델 크기 전반에 걸쳐 상당한 accuracy 향상을 보여줍니다. COCO 검증 데이터셋에서의 object detection 양적 결과는 다음과 같습니다.

탐지 성능 (COCO val2017)#

성능
모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT
(ms)
파라미터
(M)
FLOPs
(B)
비교
(mAP/속도)
YOLO12n64040.6-1.642.67.6+2.1%/-9% (YOLOv10n 대비)
YOLO12s64048.0-2.619.323.7+0.1%/+42% (RT-DETRv2 대비)
YOLO12m64052.5-4.8620.271.3+1.0%/-3% (YOLO11m 대비)
YOLO12l64053.7-6.7726.496.3+0.4%/-8% (YOLO11l 대비)
YOLO12x64055.2-11.7959.1210.2+0.6%/-4% (YOLO11x 대비)
  • 추론 속도는 TensorRT FP16 precision을 사용하는 NVIDIA T4 GPU에서 측정되었습니다.
  • 비교 결과는 mAP의 상대적 개선과 속도의 백분율 변화를 나타냅니다(양수는 더 빠름, 음수는 더 느림). 비교는 가능한 경우 공개된 YOLOv10, YOLO11 및 RT-DETR 결과와 대조했습니다.

사용 예제#

이 섹션에서는 YOLO12를 이용한 학습 및 추론 예제를 제공합니다. 이 모드 및 기타 모드(ValidationExport 포함)에 대한 보다 자세한 문서는 전용 PredictTrain 페이지를 참조하십시오.

아래 예제들은 YOLO12 Detect 모델(객체 검출용)에 중점을 둡니다. 지원되는 다른 태스크(세분화, 분류, 자세 추정, 지향성 객체 검출)에 대해서는 각각의 태스크별 문서인 Segment, Classify, Pose, OBB를 참조하십시오.

예시

사전 학습된 *.pt 모델(PyTorch 사용)과 configuration *.yaml 파일을 YOLO() 클래스에 전달하여 Python에서 모델 인스턴스를 생성할 수 있습니다.

from ultralytics import YOLO

# Load a COCO-pretrained YOLO12n model
model = YOLO("yolo12n.pt")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with the YOLO12n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

주요 개선 사항#

  1. 향상된 Feature Extraction:

    • 영역 어텐션(Area Attention): 대규모 receptive fields를 효율적으로 처리하여 연산 비용을 줄입니다.
    • 최적화된 균형: 어텐션과 피드포워드 네트워크 연산 간의 향상된 균형.
    • R-ELAN: R-ELAN 아키텍처를 사용하여 특성 집계 기능을 향상합니다.
  2. 최적화 혁신:

    • 잔차 연결: 특히 대규모 모델에서 학습을 안정화하기 위해 스케일링이 포함된 잔차 연결을 도입합니다.
    • 정교한 특성 통합: R-ELAN 내의 특성 통합을 위한 개선된 방법을 구현합니다.
    • FlashAttention: 메모리 액세스 오버헤드를 줄이기 위해 FlashAttention을 포함합니다.
  3. 아키텍처 효율성:

    • 파라미터 축소: 많은 이전 모델과 비교하여 정확도를 유지하거나 향상하면서 더 낮은 파라미터 수를 달성합니다.
    • 간소화된 어텐션: 위치 인코딩을 피하는 단순화된 어텐션 구현을 사용합니다.
    • 최적화된 MLP 비율: 계산 리소스를 보다 효과적으로 할당하도록 MLP 비율을 조정합니다.

요구 사항#

Ultralytics YOLO12 구현은 기본적으로 FlashAttention을 필요로 하지 않습니다. 그러나 선택적으로 FlashAttention을 컴파일하여 YOLO12와 함께 사용할 수 있습니다. FlashAttention을 컴파일하려면 다음 NVIDIA GPU 중 하나가 필요합니다:

인용 및 감사의 글#

연구에 YOLO12를 사용하는 경우 University at BuffaloUniversity of Chinese Academy of Sciences의 원저작물을 인용해 주십시오.

인용
@inproceedings{tian2025yolov12,
  title={YOLOv12: Attention-Centric Real-Time Object Detectors},
  author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
  booktitle={Advances in Neural Information Processing Systems},
  volume={38},
  pages={78433--78457},
  year={2025},
  url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}

@software{yolo12,
  author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
  title = {YOLO12: Attention-Centric Real-Time Object Detectors},
  year = {2025},
  url = {https://github.com/sunsmarterjie/yolov12},
  license = {AGPL-3.0}
}

YOLO12 논문은 NeurIPS 2025 proceedings에 출판되었으며, 프리프린트는 arXiv에서 확인할 수 있습니다.

FAQ#

YOLO12는 어떻게 높은 정확도를 유지하면서 실시간 객체 탐지를 달성합니까?#

YOLO12는 속도와 정확도의 균형을 맞추기 위해 몇 가지 주요 혁신을 통합했습니다. 영역 Attention mechanism은 대규모 수용 영역을 효율적으로 처리하여 표준 셀프 어텐션에 비해 연산 비용을 줄여줍니다. R-ELAN(Residual Efficient Layer Aggregation Networks)은 피처 집계를 개선하여 더 큰 어텐션 중심 모델의 최적화 과제를 해결합니다. FlashAttention 사용 및 위치 인코딩 제거를 포함한 최적화된 어텐션 아키텍처는 효율성을 더욱 향상시킵니다. 이러한 기능 덕분에 YOLO12는 많은 애플리케이션에 필수적인 실시간 추론 속도를 유지하면서 최고 수준의 정확도를 달성할 수 있습니다.

YOLO12는 어떤 computer vision 태스크를 지원합니까?#

YOLO12는 다양한 핵심 컴퓨터 Vision 태스크를 지원하는 다목적 모델입니다. 객체 detection, instance segmentation, image classification, pose estimation, 지향성 객체 검출(OBB) 분야에서 뛰어난 성능을 발휘합니다(세부 정보 참조). 이러한 포괄적인 태스크 지원 덕분에 YOLO12는 robotics 및 자율주행부터 의료 영상 및 산업용 검사에 이르기까지 다양한 애플리케이션을 위한 강력한 도구가 됩니다. 현재 사전 학습된 .pt 가중치는 검출용으로만 게시되어 있으며, 세분화, 자세, 분류 및 OBB 아키텍처는 처음부터 학습하기 위한 .yaml config로 제공된다는 점에 유의하십시오.

YOLO12는 다른 YOLO 모델 및 RT-DETR과 같은 경쟁 모델과 어떻게 비교됩니까?#

YOLO12는 YOLOv10 및 YOLO11과 같은 이전 YOLO 모델에 비해 모든 모델 크기에서 상당한 정확도 향상을 보여주며, 가장 빠른 이전 모델에 비해 속도면에서는 일부 트레이드오프가 있습니다. 예를 들어, YOLO12n은 COCO val2017 데이터셋에서 YOLOv10n 대비 +2.1%, YOLO11n 대비 +1.2%의 mAP 향상을 달성합니다. RT-DETR과 같은 모델에 비해 YOLO12s는 +1.5%의 mAP 향상과 무려 +42%의 속도 증가를 제공합니다. 이러한 지표는 YOLO12가 정확도와 효율성 사이에서 강력한 균형을 이룬다는 것을 보여줍니다. 자세한 비교는 performance metrics section을 참조하십시오.

YOLO12를 실행하기 위한 하드웨어 요구 사항, 특히 FlashAttention을 사용하기 위한 요구 사항은 무엇입니까?#

기본적으로 Ultralytics YOLO12 구현은 FlashAttention을 필요로 하지 않습니다. 그러나 메모리 액세스 오버헤드를 최소화하기 위해 FlashAttention을 선택적으로 컴파일하여 YOLO12와 함께 사용할 수 있습니다. FlashAttention을 컴파일하려면 다음 NVIDIA GPU 중 하나가 필요합니다: Turing GPU(예: T4, Quadro RTX 시리즈), Ampere GPU(예: RTX30 시리즈, A30/40/100), Ada Lovelace GPU(예: RTX40 시리즈) 또는 Hopper GPU(예: H100/H200). 이러한 유연성을 통해 사용자는 하드웨어 리소스가 허용될 때 FlashAttention의 이점을 활용할 수 있습니다.

YOLO12에 대한 사용 예제와 더 자세한 문서는 어디서 찾을 수 있습니까?#

이 페이지에서는 학습 및 추론을 위한 기본 usage examples을 제공합니다. ValidationExport를 포함한 이 모드 및 기타 모드에 대한 포괄적인 문서는 전용 PredictTrain 페이지를 참조하십시오. 태스크별 정보(세분화, 분류, 자세 추정 및 지향성 객체 검출)에 대해서는 각각의 문서인 Segment, Classify, Pose, OBB를 참조하십시오. 이러한 리소스는 다양한 시나리오에서 YOLO12를 효과적으로 활용하기 위한 심층적인 지침을 제공합니다.

댓글