Ultralytics YOLO27:

YOLO12: 어텐션 중심 객체 탐지#

개요#

2025년 초에 출시된 YOLO12는 이전 YOLO 모델에서 사용된 전통적인 CNN 기반 접근 방식에서 벗어난 어텐션 중심 아키텍처를 도입하면서도 다양한 애플리케이션에 필수적인 실시간 추론 속도를 유지합니다. 이 모델은 어텐션 메커니즘과 전체 네트워크 아키텍처의 새로운 방법론적 혁신을 통해 높은 객체 탐지 정확도를 달성하면서 실시간 성능을 유지합니다. 이러한 장점에도 불구하고 YOLO12는 커뮤니티 주도로 출시된 모델이므로 학습 불안정성, 높은 메모리 사용량, 무거운 어텐션 블록으로 인한 느린 CPU 처리량이 나타날 수 있습니다. 따라서 Ultralytics는 대부분의 프로덕션 워크로드에 YOLO11 또는 YOLO26을 권장합니다.

커뮤니티 모델

YOLO12는 주로 벤치마킹과 연구를 위해 유지 관리됩니다. 안정적인 학습, 예측 가능한 메모리 사용량, 최적화된 CPU 추론이 필요하다면 배포에 YOLO11 또는 YOLO26을 선택하십시오.



Watch: How to Use YOLO12 for Object Detection with the Ultralytics Package | Is YOLO12 Fast or Slow? 🚀

주요 기능#

  • 영역 어텐션 메커니즘: 넓은 수용 영역을 효율적으로 처리하는 새로운 셀프 어텐션 접근 방식입니다. 특징 맵l개의 동일한 크기 영역(기본값 4개)으로 수평 또는 수직 분할하여 복잡한 연산을 피하고 넓은 유효 수용 영역을 유지합니다. 이를 통해 표준 셀프 어텐션에 비해 계산 비용을 크게 줄입니다.
  • 잔차 효율적 레이어 집계 네트워크(R-ELAN): ELAN을 기반으로 개선된 특징 집계 모듈로, 특히 대규모 어텐션 중심 모델의 최적화 문제를 해결하도록 설계되었습니다. R-ELAN은 다음을 도입합니다:
    • 스케일링이 적용된 블록 수준 잔차 연결(레이어 스케일링과 유사합니다).
    • 병목 구조와 유사한 구조를 생성하는 재설계된 특징 집계 방식입니다.
  • 최적화된 어텐션 아키텍처: YOLO12는 표준 어텐션 메커니즘을 간소화하여 효율성과 YOLO 프레임워크와의 호환성을 높였습니다. 여기에는 다음이 포함됩니다:
    • 메모리 액세스 오버헤드를 최소화하기 위해 FlashAttention을 사용합니다.
    • 더 깔끔하고 빠른 모델을 위해 위치 인코딩을 제거합니다.
    • 어텐션과 피드포워드 레이어 간 계산 균형을 개선하기 위해 MLP 비율을 일반적인 4에서 1.2 또는 2로 조정합니다.
    • 최적화를 개선하기 위해 스택 블록의 깊이를 줄입니다.
    • 계산 효율성이 높은 컨볼루션 연산을 적절한 경우 활용합니다.
    • 위치 정보를 암묵적으로 인코딩하기 위해 7x7 분리형 컨볼루션("position perceiver")을 어텐션 메커니즘에 추가합니다.
  • 종합적인 태스크 지원: YOLO12는 객체 탐지, 인스턴스 세그멘테이션, 이미지 분류, 포즈 추정, 방향성 객체 탐지(OBB) 등 다양한 핵심 컴퓨터 비전 태스크를 지원합니다.
  • 향상된 효율성: 많은 이전 모델에 비해 더 적은 파라미터로 높은 정확도를 달성하여 속도와 정확도 간의 균형이 개선되었음을 보여줍니다.
  • 유연한 배포: 엣지 디바이스부터 클라우드 인프라까지 다양한 플랫폼에 배포할 수 있도록 설계되었습니다.

YOLO12 비교 시각화

지원되는 태스크 및 모드#

YOLO12는 다양한 컴퓨터 비전 태스크를 지원합니다. 아래 표에는 각 태스크에 대해 지원되는 태스크와 활성화된 운영 모드(추론, 검증, 학습, 내보내기)가 나와 있습니다:

사전 학습된 가중치 제공 여부

탐지 가중치(yolo12n.pt, yolo12s.pt, yolo12m.pt, yolo12l.pt, yolo12x.pt)만 ultralytics/assets에 출시되어 있습니다. 세그멘테이션, 분류, 포즈, OBB 아키텍처는 ultralytics/cfg/models/12/에 정의되어 있으므로, 해당 변형은 .yaml 구성에서 처음부터 학습할 수 있습니다. 그러나 현재 이들에 대한 사전 학습된 .pt 파일은 제공되지 않습니다. 사전 학습된 세그멘테이션, 포즈, 분류 또는 OBB 체크포인트가 필요한 경우 Ultralytics는 YOLO11 또는 YOLO26을 권장합니다.

모델 유형태스크사전 학습된 가중치학습검증추론내보내기
YOLO12탐지
YOLO12-seg세그멘테이션
YOLO12-cls분류
YOLO12-pose포즈
YOLO12-obbOBB

학습된 체크포인트를 사용할 수 있으면 모든 YOLO12 아키텍처는 모든 모드를 지원합니다. Pretrained Weights 열은 Ultralytics가 ultralytics/assets에 공식 사전 학습 .pt을 게시하는지 여부만 나타냅니다. 세그멘테이션, 포즈, 분류, OBB의 경우 추론, 검증 또는 내보내기를 실행하기 전에 해당 .yaml에서 자체 체크포인트를 학습해야 합니다.

성능 지표#

YOLO12는 모든 모델 규모에서 상당한 정확도 향상을 보여주지만, 이전 YOLO 모델 중 가장 빠른 모델과 비교하면 속도에서 일부 절충이 있습니다. 다음은 COCO 검증 데이터셋에서의 객체 탐지 정량적 결과입니다:

탐지 성능(COCO val2017)#

성능
모델크기
(픽셀)
mAPval
50-95
속도
CPU ONNX
(ms)
속도
T4 TensorRT
(ms)
파라미터
(M)
FLOPs
(B)
비교
(mAP/속도)
YOLO12n64040.6-1.642.67.5+2.1%/-9% (YOLOv10n 대비)
YOLO12s64048.0-2.619.323.3+0.1%/+42% (RT-DETRv2 대비)
YOLO12m64052.5-4.8620.270.7+1.0%/-3% (YOLO11m 대비)
YOLO12l64053.7-6.7726.495.4+0.4%/-8% (YOLO11l 대비)
YOLO12x64055.2-11.7959.1208.9+0.6%/-4% (YOLO11x 대비)
  • 추론 속도는 TensorRT FP16 정밀도를 사용하여 NVIDIA T4 GPU에서 측정했습니다.
  • 비교 결과는 mAP의 상대적 개선율과 속도의 백분율 변화를 보여줍니다(양수는 더 빠름, 음수는 더 느림을 의미합니다). 가능한 경우 YOLOv10, YOLO11, RT-DETR에 대해 게시된 결과를 기준으로 비교했습니다.

사용 예시#

이 섹션에서는 YOLO12를 사용한 학습 및 추론 예제를 제공합니다. 이러한 모드와 기타 모드(검증내보내기 포함)에 대한 보다 종합적인 문서는 전용 PredictTrain 페이지를 참조하십시오.

아래 예제는 YOLO12 Detect 모델(객체 탐지용)에 중점을 둡니다. 기타 지원 태스크(세그멘테이션, 분류, 포즈 추정, 방향성 객체 탐지)의 경우 해당 태스크별 문서인 Segment, Classify, Pose, OBB를 참조하십시오.

예시

사전 학습된 *.pt 모델(PyTorch 사용)과 구성 *.yaml 파일을 YOLO() 클래스에 전달하여 Python에서 모델 인스턴스를 생성할 수 있습니다:

from ultralytics import YOLO

# Load a COCO-pretrained YOLO12n model
model = YOLO("yolo12n.pt")

# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Run inference with the YOLO12n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")

주요 개선 사항#

  1. 향상된 특징 추출:

    • 영역 어텐션: 넓은 수용 영역을 효율적으로 처리하여 계산 비용을 줄입니다.
    • 최적화된 균형: 어텐션과 피드포워드 네트워크 계산 간의 균형을 개선했습니다.
    • R-ELAN: R-ELAN 아키텍처를 사용하여 특징 집계를 향상합니다.
  2. 최적화 혁신:

    • 잔차 연결: 특히 대규모 모델에서 학습을 안정화하기 위해 스케일링이 적용된 잔차 연결을 도입합니다.
    • 개선된 특징 통합: R-ELAN 내부의 특징 통합을 위한 개선된 방식을 구현합니다.
    • FlashAttention: 메모리 액세스 오버헤드를 줄이기 위해 FlashAttention을 통합합니다.
  3. 아키텍처 효율성:

    • 파라미터 감소: 많은 이전 모델과 비교해 정확도를 유지하거나 향상하면서 더 적은 파라미터 수를 달성합니다.
    • 간소화된 어텐션: 위치 인코딩을 사용하지 않는 단순화된 어텐션 구현을 사용합니다.
    • 최적화된 MLP 비율: 계산 리소스를 더욱 효과적으로 할당하도록 MLP 비율을 조정합니다.

요구 사항#

Ultralytics YOLO12 구현은 기본적으로 FlashAttention을 필요로 하지 않습니다. 그러나 FlashAttention을 선택적으로 컴파일하여 YOLO12와 함께 사용할 수 있습니다. FlashAttention을 컴파일하려면 다음 NVIDIA GPU 중 하나가 필요합니다:

인용 및 감사의 글#

연구에서 YOLO12를 사용하는 경우 University at BuffaloUniversity of Chinese Academy of Sciences의 원 논문을 인용해 주십시오:

인용문
@inproceedings{tian2025yolov12,
  title={YOLOv12: Attention-Centric Real-Time Object Detectors},
  author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
  booktitle={Advances in Neural Information Processing Systems},
  volume={38},
  pages={78433--78457},
  year={2025},
  url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}

@software{yolo12,
  author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
  title = {YOLO12: Attention-Centric Real-Time Object Detectors},
  year = {2025},
  url = {https://github.com/sunsmarterjie/yolov12},
  license = {AGPL-3.0}
}

YOLO12 논문은 NeurIPS 2025 proceedings에 게재되었으며, arXiv에 프리프린트가 공개되어 있습니다.

FAQ#

  • YOLO12는 속도와 정확도의 균형을 맞추기 위해 몇 가지 핵심 혁신을 도입합니다. 영역 어텐션 메커니즘은 넓은 수용 영역을 효율적으로 처리하여 표준 셀프 어텐션에 비해 계산 비용을 줄입니다. 잔차 효율적 레이어 집계 네트워크(R-ELAN)는 특징 집계를 개선하여 대규모 어텐션 중심 모델의 최적화 문제를 해결합니다. FlashAttention 사용과 위치 인코딩 제거를 포함한 최적화된 어텐션 아키텍처는 효율성을 더욱 향상합니다. 이러한 기능을 통해 YOLO12는 다양한 애플리케이션에 중요한 실시간 추론 속도를 유지하면서 최신 수준의 정확도를 달성할 수 있습니다.

  • YOLO12는 다양한 핵심 컴퓨터 비전 태스크를 지원하는 다목적 모델입니다. 객체 탐지, 인스턴스 세그멘테이션, 이미지 분류, 포즈 추정, 방향성 객체 탐지(OBB)(세부 정보 보기)에서 뛰어난 성능을 발휘합니다. 이러한 종합적인 태스크 지원 덕분에 YOLO12는 로보틱스와 자율 주행부터 의료 영상 및 산업 검사에 이르기까지 다양한 애플리케이션에 강력한 도구로 활용될 수 있습니다. 현재 사전 학습된 .pt 가중치는 탐지용으로만 게시되어 있으며, 세그멘테이션, 포즈, 분류, OBB 아키텍처는 처음부터 학습할 수 있는 .yaml 구성으로 제공됩니다.

  • YOLO12는 YOLOv10 및 YOLO11과 같은 이전 YOLO 모델에 비해 모든 모델 규모에서 상당한 정확도 향상을 보여주지만, 이전 모델 중 가장 빠른 모델과 비교하면 속도에서 일부 절충이 있습니다. 예를 들어 YOLO12n은 COCO val2017 데이터셋에서 YOLOv10n보다 mAP가 +2.1%, YOLO11n보다 +1.2% 향상됩니다. RT-DETR과 같은 모델과 비교하면 YOLO12s는 mAP가 +1.5% 향상되고 속도가 상당히 높은 +42% 증가합니다. 이러한 지표는 YOLO12가 정확도와 효율성 간에 뛰어난 균형을 이룬다는 점을 보여줍니다. 자세한 비교는 성능 지표 섹션을 참조하십시오.

  • 기본적으로 Ultralytics YOLO12 구현은 FlashAttention을 필요로 하지 않습니다. 그러나 메모리 액세스 오버헤드를 최소화하기 위해 FlashAttention을 선택적으로 컴파일하여 YOLO12와 함께 사용할 수 있습니다. FlashAttention을 컴파일하려면 다음 NVIDIA GPU 중 하나가 필요합니다: Turing GPU(예: T4, Quadro RTX 시리즈), Ampere GPU(예: RTX30 시리즈, A30/40/100), Ada Lovelace GPU(예: RTX40 시리즈) 또는 Hopper GPU(예: H100/H200)입니다. 이러한 유연성 덕분에 하드웨어 리소스가 허용되는 경우 사용자는 FlashAttention의 이점을 활용할 수 있습니다.

  • 이 페이지에서는 학습 및 추론을 위한 기본 사용 예제를 제공합니다. 검증내보내기를 포함한 이러한 모드와 기타 모드에 대한 종합적인 문서는 전용 예측학습 페이지를 참조하십시오. 작업별 정보(세그멘테이션, 분류, 포즈 추정 및 방향성 객체 탐지)는 해당 문서인 세그먼트, 분류, 포즈OBB를 참조하십시오. 이러한 리소스에서는 다양한 시나리오에서 YOLO12를 효과적으로 활용하는 방법을 자세히 안내합니다.

댓글