YOLO12: Dikkat Odaklı Nesne Algılama#
Genel Bakış#
2025'in başlarında yayımlanan YOLO12, önceki YOLO modellerinde kullanılan geleneksel CNN tabanlı yaklaşımlardan ayrılan, ancak birçok uygulama için vazgeçilmez olan gerçek zamanlı çıkarım hızını koruyan dikkat odaklı bir mimari sunar. Bu model, dikkat mekanizmalarındaki ve genel ağ mimarisindeki yeni yöntemsel yenilikler sayesinde yüksek nesne algılama doğruluğuna ulaşırken gerçek zamanlı performansı da korur. Bu avantajlara rağmen YOLO12, topluluk tarafından geliştirilen bir sürüm olmaya devam ediyor ve ağır dikkat blokları nedeniyle eğitim kararsızlığı, yüksek bellek tüketimi ve daha düşük CPU iş hacmi gösterebilir. Bu nedenle Ultralytics, çoğu üretim iş yükü için YOLO11 veya YOLO26 kullanılmasını önerir.
İzle: Ultralytics Paketiyle Nesne Algılama İçin YOLO12 Nasıl Kullanılır | YOLO12 Hızlı mı, Yavaş mı? 🚀
Temel Özellikler#
- Alan Dikkat Mekanizması: Geniş alıcı alanlarını verimli biçimde işleyen yeni bir öz dikkat yaklaşımı. Karmaşık işlemlerden kaçınmak ve geniş bir etkin alıcı alanını korumak için özellik haritalarını yatay veya dikey olarak l eşit boyutlu bölgeye (varsayılan 4) ayırır. Bu, standart öz dikkate kıyasla hesaplama maliyetini önemli ölçüde azaltır.
- Artık Bağlantılı Verimli Katman Toplama Ağları (R-ELAN): Özellikle daha büyük ölçekli, dikkat odaklı modellerde optimizasyon zorluklarını gidermek üzere tasarlanmış, ELAN tabanlı gelişmiş bir özellik toplama modülü. R-ELAN şunları sunar:
- Ölçeklendirmeli blok düzeyinde artık bağlantılar (katman ölçeklendirmeye benzer).
- Darboğaz benzeri bir yapı oluşturan, yeniden tasarlanmış özellik toplama yöntemi.
- Optimize Edilmiş Dikkat Mimarisi: YOLO12, standart dikkat mekanizmasını daha verimli ve YOLO çerçevesiyle daha uyumlu hâle getirir. Buna şunlar dahildir:
- Bellek erişimi ek yükünü en aza indirmek için FlashAttention kullanılması.
- Daha sade ve hızlı bir model elde etmek için konumsal kodlamanın kaldırılması.
- Dikkat ve ileri beslemeli katmanlar arasındaki hesaplama dengesini daha iyi kurmak için MLP oranının (tipik 4 değerinden 1,2 veya 2 değerine) ayarlanması.
- Optimizasyonu iyileştirmek için istiflenmiş blokların derinliğinin azaltılması.
- Hesaplama verimliliği nedeniyle uygun yerlerde evrişim işlemlerinden yararlanılması.
- Konumsal bilgiyi örtük olarak kodlamak için dikkat mekanizmasına 7x7 ayrılabilir evrişim ("konum algılayıcı") eklenmesi.
- Kapsamlı Görev Desteği: YOLO12, temel bilgisayarlı görü görevlerinden birkaçını destekler: nesne algılama, örnek segmentasyonu, görüntü sınıflandırma, poz kestirimi ve yönlendirilmiş nesne algılama (OBB).
- Gelişmiş Verimlilik: Önceki birçok modele kıyasla daha az parametreyle daha yüksek doğruluk elde ederek hız ve doğruluk arasında daha iyi bir denge kurar.
- Esnek Dağıtım: Uç cihazlardan bulut altyapısına kadar farklı platformlara dağıtılmak üzere tasarlanmıştır.

Desteklenen Görevler ve Modlar#
YOLO12 çeşitli bilgisayarlı görü görevlerini destekler. Aşağıdaki tabloda her görev için destek durumu ve etkinleştirilen çalışma modları (Çıkarım, Doğrulama, Eğitim ve Dışa Aktarma) gösterilir:
Yalnızca algılama ağırlıkları (yolo12n.pt, yolo12s.pt, yolo12m.pt, yolo12l.pt, yolo12x.pt) ultralytics/assets üzerinde yayımlanmıştır. Segmentasyon, sınıflandırma, poz ve OBB mimarileri ultralytics/cfg/models/12/ içinde tanımlanmıştır. Bu nedenle bu varyantlar .yaml yapılandırmasıyla sıfırdan eğitimi destekler, ancak şu anda bunlar için önceden eğitilmiş .pt dosyaları mevcut değildir. Önceden eğitilmiş segmentasyon, poz, sınıflandırma veya OBB kontrol noktaları için Ultralytics, YOLO11 veya YOLO26 kullanılmasını önerir.
| Model Türü | Görev | Önceden Eğitilmiş Ağırlıklar | Eğitim | Doğrulama | Çıkarım | Dışa aktar |
|---|---|---|---|---|---|---|
| YOLO12 | Algılama | ✅ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-seg | Segmentasyon | ❌ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-cls | Sınıflandırma | ❌ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-pose | Poz | ❌ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-obb | OBB | ❌ | ✅ | ✅ | ✅ | ✅ |
Eğitilmiş bir kontrol noktası mevcut olduğunda tüm YOLO12 mimarileri her modu destekler. Pretrained Weights sütunu, yalnızca Ultralytics'in ultralytics/assets üzerinde resmi, önceden eğitilmiş bir .pt yayımlayıp yayımlamadığını gösterir: segmentasyon, poz, sınıflandırma ve OBB için çıkarım, doğrulama veya dışa aktarma işlemlerini çalıştırmadan önce ilgili .yaml üzerinden kendi kontrol noktanı eğitmen gerekir.
Performans Metrikleri#
YOLO12, tüm model ölçeklerinde doğruluk açısından önemli iyileşmeler gösterirken önceki en hızlı YOLO modellerine kıyasla hızda bazı ödünler verir. Aşağıda COCO doğrulama veri kümesinde nesne algılama için nicel sonuçlar verilmiştir:
Algılama Performansı (COCO val2017)#
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT (ms) | parametre (M) | FLOPs (B) | Karşılaştırma (mAP/Hız) |
|---|---|---|---|---|---|---|---|
| YOLO12n | 640 | 40.6 | - | 1.64 | 2.6 | 7.5 | +2.1%/-9% (YOLOv10n ile karşılaştırıldığında) |
| YOLO12s | 640 | 48.0 | - | 2.61 | 9.3 | 23.3 | +0.1%/+42% (RT-DETRv2 ile karşılaştırıldığında) |
| YOLO12m | 640 | 52.5 | - | 4.86 | 20.2 | 70.7 | +1.0%/-3% (YOLO11m ile karşılaştırıldığında) |
| YOLO12l | 640 | 53.7 | - | 6.77 | 26.4 | 95.4 | +0.4%/-8% (YOLO11l ile karşılaştırıldığında) |
| YOLO12x | 640 | 55.2 | - | 11.79 | 59.1 | 208.9 | +0.6%/-4% (YOLO11x ile karşılaştırıldığında) |
- NVIDIA T4 GPU üzerinde TensorRT FP16 hassasiyeti kullanılarak ölçülen çıkarım hızı.
- Karşılaştırmalar, mAP'teki göreli iyileşmeyi ve hızdaki yüzde değişimini gösterir (pozitif daha hızlı, negatif daha yavaş anlamına gelir). Karşılaştırmalar, mevcut olduğunda YOLOv10, YOLO11 ve RT-DETR için yayımlanmış sonuçlara göre yapılır.
Kullanım Örnekleri#
Bu bölümde YOLO12 ile eğitim ve çıkarım örnekleri sunulmaktadır. Bu modlar ve diğer modlarla ilgili ( Doğrulama ve Dışa Aktarma dâhil) daha kapsamlı belgeler için özel Tahmin ve Eğitim sayfalarına bak.
Aşağıdaki örneklerde, YOLO12 Algılama modellerine (nesne algılama için) odaklanılır. Desteklenen diğer görevlerle (segmentasyon, sınıflandırma, poz kestirimi ve yönlendirilmiş nesne algılama) ilgili bilgi için ilgili göreve özel belgelere bak: Segmentasyon, Sınıflandırma, Poz ve OBB.
Önceden eğitilmiş *.pt modelleri (PyTorch kullanılarak) ve *.yaml yapılandırma dosyaları, Python'da bir model örneği oluşturmak için YOLO() sınıfına aktarılabilir:
from ultralytics import YOLO
# COCO üzerinde önceden eğitilmiş bir YOLO12n modelini yükle
model = YOLO("yolo12n.pt")
# Modeli COCO8 örnek veri kümesinde 100 dönem boyunca eğit
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# 'bus.jpg' görüntüsünde YOLO12n modeliyle çıkarım yap
results = model("path/to/bus.jpg")Temel İyileştirmeler#
-
Gelişmiş Özellik Çıkarımı:
- Alan Dikkati: Geniş alıcı alanlarını verimli biçimde işler ve hesaplama maliyetini azaltır.
- Optimize Edilmiş Denge: Dikkat ve ileri beslemeli ağ hesaplamaları arasındaki dengeyi iyileştirir.
- R-ELAN: R-ELAN mimarisini kullanarak özellik toplamayı geliştirir.
-
Optimizasyon Yenilikleri:
- Artık Bağlantılar: Özellikle büyük modellerde eğitimi kararlı hâle getirmek için ölçeklendirmeli artık bağlantılar sunar.
- İyileştirilmiş Özellik Bütünleştirme: R-ELAN içindeki özellik bütünleştirmeyi iyileştiren bir yöntem uygular.
- FlashAttention: Bellek erişimi ek yükünü azaltmak için FlashAttention kullanır.
-
Mimari Verimlilik:
- Azaltılmış Parametre Sayısı: Önceki birçok modele kıyasla doğruluğu korurken veya iyileştirirken daha az parametreye ulaşır.
- Basitleştirilmiş Dikkat: Konumsal kodlamadan kaçınan, sadeleştirilmiş bir dikkat uygulaması kullanır.
- Optimize Edilmiş MLP Oranları: Hesaplama kaynaklarını daha etkili tahsis etmek için MLP oranlarını ayarlar.
Gereksinimler#
Ultralytics YOLO12 uygulaması varsayılan olarak FlashAttention gerektirmez. Ancak FlashAttention isteğe bağlı olarak derlenip YOLO12 ile kullanılabilir. FlashAttention'ı derlemek için aşağıdaki NVIDIA GPU'lardan biri gerekir:
- Turing GPU'ları (ör. T4, Quadro RTX serisi)
- Ampere GPU'ları (ör. RTX30 serisi, A30/40/100)
- Ada Lovelace GPU'ları (ör. RTX40 serisi)
- Hopper GPU'ları (ör. H100/H200)
Atıflar ve Teşekkürler#
Araştırmanda YOLO12 kullanıyorsan lütfen University at Buffalo ve University of Chinese Academy of Sciences tarafından yayımlanan özgün çalışmaya atıfta bulun:
@inproceedings{tian2025yolov12,
title={YOLOv12: Attention-Centric Real-Time Object Detectors},
author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
booktitle={Advances in Neural Information Processing Systems},
volume={38},
pages={78433--78457},
year={2025},
url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}
@software{yolo12,
author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
title = {YOLO12: Attention-Centric Real-Time Object Detectors},
year = {2025},
url = {https://github.com/sunsmarterjie/yolov12},
license = {AGPL-3.0}
}YOLO12 makalesi NeurIPS 2025 bildirilerinde yayımlandı; ön baskısı ise arXiv üzerinde.
Sık Sorulan Sorular#
YOLO12, hız ve doğruluğu dengelemek için birçok önemli yenilikten yararlanır. Alan dikkat mekanizması, geniş alıcı alanları standart öz dikkat mekanizmasına kıyasla daha düşük hesaplama maliyetiyle verimli biçimde işler. Artık Verimli Katman Toplama Ağları (R-ELAN), özellik toplama işlemini iyileştirerek dikkat odaklı daha büyük modellerdeki optimizasyon zorluklarını giderir. FlashAttention kullanımı ve konumsal kodlamanın kaldırılması dâhil olmak üzere Optimize Edilmiş Dikkat Mimarisi, verimliliği daha da artırır. Bu özellikler, YOLO12'nin birçok uygulama için kritik olan gerçek zamanlı çıkarım hızını korurken son teknoloji doğruluğa ulaşmasını sağlar.
YOLO12, çok çeşitli temel bilgisayarlı görü görevlerini destekleyen çok yönlü bir modeldir. Nesne algılama, örnek segmentasyonu, görüntü sınıflandırması, poz tahmini ve yönlendirilmiş nesne algılamada (OBB) başarılıdır (ayrıntılara bak). Bu kapsamlı görev desteği, YOLO12'yi robotik ve otonom sürüşten tıbbi görüntülemeye ve endüstriyel denetime kadar farklı uygulamalar için güçlü bir araç hâline getirir. Önceden eğitilmiş
.ptağırlıklarının şu anda yalnızca algılama için yayımlandığını; segmentasyon, poz, sınıflandırma ve OBB mimarilerinin ise sıfırdan eğitim için.yamlyapılandırmaları olarak sunulduğunu unutma.YOLO12, YOLOv10 ve YOLO11 gibi önceki YOLO modellerine kıyasla tüm model ölçeklerinde önemli doğruluk iyileştirmeleri sunar; ancak önceki en hızlı modellere göre hız konusunda bazı ödünler verir. Örneğin YOLO12n, COCO val2017 veri kümesinde YOLOv10n'ye kıyasla %2,1, YOLO11n'ye kıyasla ise %1,2 mAP artışı sağlar. RT-DETR gibi modellerle karşılaştırıldığında YOLO12s, %1,5 mAP artışı ve kayda değer ölçüde %42 hız artışı sunar. Bu ölçümler, YOLO12'nin doğruluk ve verimlilik arasındaki güçlü dengeyi ortaya koyar. Ayrıntılı karşılaştırmalar için performans ölçümleri bölümüne bak.
Ultralytics YOLO12 uygulaması varsayılan olarak FlashAttention gerektirmez. Ancak bellek erişimi ek yükünü en aza indirmek için FlashAttention isteğe bağlı olarak derlenip YOLO12 ile kullanılabilir. FlashAttention'ı derlemek için aşağıdaki NVIDIA GPU'lardan biri gerekir: Turing GPU'ları (ör. T4, Quadro RTX serisi), Ampere GPU'ları (ör. RTX30 serisi, A30/40/100), Ada Lovelace GPU'ları (ör. RTX40 serisi) veya Hopper GPU'ları (ör. H100/H200). Bu esneklik, donanım kaynakları elverdiğinde kullanıcıların FlashAttention avantajlarından yararlanmasını sağlar.
Bu sayfada eğitim ve çıkarım için temel kullanım örnekleri yer alır. Doğrulama ve Dışa Aktarma dâhil olmak üzere bu ve diğer modlara ilişkin kapsamlı belgeler için özel Tahmin ve Eğitim sayfalarına bak. Göreve özgü bilgiler (segmentasyon, sınıflandırma, poz tahmini ve yönlendirilmiş nesne algılama) için ilgili belgelere başvur: Segment, Sınıflandır, Poz ve OBB. Bu kaynaklar, YOLO12'yi çeşitli senaryolarda etkili biçimde kullanman için ayrıntılı yönergeler sunar.