Ultralytics YOLO27:

RTDETRv2 ve YOLOv7#

Bilgisayarlı görü alanı, hem Evrişimli Sinir Ağları (CNNs) hem de Görsel Transformer'larda (ViTs) süregelen yeniliklerin etkisiyle son birkaç yılda büyük ölçüde gelişti. Dağıtımın için doğru mimariyi seçmek, hız, doğruluk ve hesaplama yükü arasındaki ince ödünleşimleri anlamanı gerektirir. Bu kılavuz, saygın iki mimari olan RTDETRv2 ve YOLOv7 arasındaki teknik farkları incelerken daha yeni Ultralytics YOLO26 sürümündeki modern gelişmeleri de öne çıkarır.

RTDETRv2: Gerçek Zamanlı Tespit için Transformer Yaklaşımı#

RTDETRv2 (Gerçek Zamanlı Tespit Transformer'ı sürüm 2), önceki sürümünün temelleri üzerine inşa edilerek Transformer tabanlı mimarilerin geleneksel son işleme adımlarına ihtiyaç duymadan gerçek zamanlı senaryolarda etkili biçimde rekabet edebileceğini kanıtlar.

Mimari Öne Çıkanlar#

RTDETRv2, hibrit bir kodlayıcı ve bir Transformer kod çözücü mimarisi kullanır. Model, öz-dikkat mekanizmalarından yararlanarak görüntünün tamamını bütünsel olarak işler ve böylece karmaşık uzamsal ilişkileri, yalnızca yerel çalışan evrişim çekirdeklerine kıyasla daha iyi anlamasını sağlar. En belirgin özelliklerinden biri, yerel olarak NMS'siz tasarıma sahip olmasıdır. Maksimum Olmayan Bastırma (NMS) adımını ortadan kaldıran RTDETRv2, dağıtım sırasında değişken çıkarım gecikmesine neden olan yaygın bir darboğazı ortadan kaldırır.

Güçlü Yönler ve Sınırlamalar#

RTDETRv2'nin temel gücü, karmaşık sahnelerde yoğun ve üst üste binen nesneleri işleyebilmesidir. Transformer dikkat katmanlarının sağladığı küresel bağlam, özellikle örtüşmelerin sık görüldüğü senaryolarda modeli son derece doğru kılar.

Ancak bunun bir hesaplama maliyeti vardır. Transformer modelleri, eğitim ve çıkarım sırasında geleneksel olarak CNN'lere kıyasla daha fazla bellek kullanır. Ayrıca RTDETRv2'nin dağıtık eğitim sırasında yakınsaması genellikle daha fazla epoch gerektirir; bu da özel veri kümelerini ayarlayan geliştiriciler için daha uzun yineleme döngülerine yol açar.

RTDETRv2 hakkında daha fazla bilgi edin

YOLOv7: Hız için bir CNN Temeli#

RTDETRv2'den bir yıl önce yayımlanan YOLOv7, klasik YOLO çerçevesine çeşitli yapısal optimizasyonlar getirerek yayımlandığı dönemde CNN tabanlı gerçek zamanlı algılayıcılar için güçlü bir ölçüt oluşturdu.

Mimari Öne Çıkanlar#

YOLOv7'nin mimarisi, Genişletilmiş Verimli Katman Birleştirme Ağı (E-ELAN) kavramı etrafında oluşturulmuştur. Bu yaklaşım, hesaplama karmaşıklığını önemli ölçüde artırmadan modelin daha etkili öğrenmesini sağlayarak gradyan yolunu optimize eder. Yazarlar ayrıca, uç cihazlardaki çıkarım hızını etkilemeden eğitim sırasında model doğruluğunu artıran bir dizi yöntem olan "eğitilebilir ücretsiz kazanımlar"ı da tanıttı.

Güçlü Yönler ve Sınırlamalar#

YOLOv7, standart nesne tespiti görevleri için son derece yetkin bir model olmayı sürdürür ve tüketici GPU'larında mükemmel işlem hızları sunar. CNN yapısı sayesinde eğitim sırasında genellikle RTDETRv2 gibi Transformer tabanlı modellere kıyasla daha az CUDA belleği gerektirir.

Bu avantajlara rağmen YOLOv7, son işleme için hâlâ NMS'ye dayanır. Tahmin yoğunluğunun yüksek olduğu ortamlarda NMS adımı işlem süresinde dalgalanmalara neden olabilir ve katı gerçek zamanlı garantileri zorlaştırabilir. Ayrıca modern çerçevelerle karşılaştırıldığında, örnek bölütleme ve poz tahmini gibi çeşitli görevlerin işlenmesi parçalı olabilir.

YOLOv7 hakkında daha fazla bilgi edin

Performans Karşılaştırması#

Bu modelleri değerlendirmek, Ortalama Hassasiyet (mAP), parametre sayısı ve çıkarım hızı arasındaki hassas dengeyi incelemeyi gerektirir.

Modelboyut
(piksel)
mAPval
50-95
Hız
CPU ONNX
(ms)
Hız
T4 TensorRT10
(ms)
parametre
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Performans Bağlamı

RTDETRv2-x en yüksek mAP değerine ulaşsa da en fazla parametre sayısına ve FLOPs değerine de sahiptir. RTDETRv2-s gibi daha küçük varyantlar TensorRT üzerinde rekabetçi hız sunar, ancak özel GPU'lar olmadan düşük güç tüketimli ortamları hedefleyen kullanıcıların CPU çıkarım yeteneklerini dikkatle değerlendirmesi gerekir.

Modern Çözüm: YOLO26 ile Tanış#

RTDETRv2 ve YOLOv7, bilgisayarlı görü uygulamalarının sınırlarını zorlamada önemli rol oynamış olsa da yapay zekâ alanı hızla gelişiyor. Ocak 2026'da yayımlanan YOLO26, hem CNN verimliliğinin hem de Transformer benzeri NMS'siz mimarilerin en iyi yönlerini bir araya getirir.

Yeni sistemler geliştiren geliştiriciler ve araştırmacılar için entegre Ultralytics Platformu ve Python ekosistemi, teknik borcu önemli ölçüde azaltan birleşik bir deneyim sunar.

YOLO26'daki Temel Yenilikler#

  • Uçtan Uca NMS'siz Tasarım: YOLO26, yerel olarak uçtan uca çalışır ve daha hızlı, daha basit dağıtım için NMS son işlemesini ortadan kaldırır. Bu çığır açıcı yaklaşım ilk olarak YOLOv10 tarafından öncülendi ve nesne yoğunluğundan bağımsız olarak kararlı gecikme sağladı.
  • %43'e Kadar Daha Hızlı CPU Çıkarımı: Özellikle uç bilişim ve GPU'suz cihazlar için optimize edilmiştir; bu da onu sahadaki dağıtımlarda ağır Transformer modellerine kıyasla çok daha esnek kılar.
  • MuSGD Optimizörü: SGD ile Muon'un (Moonshot AI'ın Kimi K2'sinden esinlenilmiştir) birleşimidir ve daha kararlı eğitim ile daha hızlı yakınsama için LLM eğitimi yeniliklerini bilgisayarlı görüye taşır.
  • DFL'nin Kaldırılması: Dağılımsal Odaklanmış Kayıp kaldırılarak gömülü NPU'lara ve TensorRT ortamlarına daha sorunsuz dışa aktarma için hesaplama grafiği basitleştirilmiştir.
  • ProgLoss + STAL: İyileştirilmiş kayıp işlevleri, robotik, IoT ve hava görüntüsü analizleri için kritik olan küçük nesne tanımada dikkate değer iyileştirmeler sağlar.
  • Göreve Özel İyileştirmeler: YOLO26 yalnızca tespit için değildir. Bölütleme için çok ölçekli prototipler, poz takibi için Artık Log-Olasılık Tahmini (RLE) ve yönlendirilmiş sınırlayıcı kutu (OBB) sınır sorunlarını ele alan özel açı kaybı içerir.

Kolaylaştırılmış Geliştirici Deneyimi#

YOLO26 (veya son derece popüler YOLO11) gibi bir Ultralytics modeli seçmenin gerçek avantajı, iyi bakımı yapılan ekosistemidir. Özel bir veri kümesini eğitmek için çok az şablon kod gerekir:

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)

İdeal Kullanım Alanları ve Uygulamalar#

Bu mimariler arasındaki seçim büyük ölçüde hedef donanıma ve belirli operasyonel gereksinimlere bağlıdır.

RTDETRv2 Ne Zaman Değerlendirilmeli?#

RTDETRv2, güçlü GPU'larla donatılmış sunucu tarafı işleme ortamlarında oldukça etkilidir. Küresel dikkat mekanizması, yoğun etkinlik izleme veya örtüşen özelliklerin derin bağlamsal analiz gerektirdiği özel tıbbi görüntüleme gibi karmaşık sahne anlama görevleri için uygundur.

YOLOv7 Ne Zaman Değerlendirilmeli?#

YOLOv7, akademik araştırmalarda temel karşılaştırma modeli olarak sıklıkla kullanılmaya devam eder. Ayrıca mevcut işlem hatlarının belirli PyTorch sürümleri için sabit kodlandığı ve daha yeni çerçevelerin çok görevli esnekliğine ihtiyaç duyulmayan eski endüstriyel dağıtımlarda da bulunur.

YOLO26 Neden Önerilen Standarttır?#

Modern akıllı şehir altyapısı, drone navigasyonu ve yüksek hızlı üretim için YOLO26 eşsiz bir denge sunar. Daha düşük bellek gereksinimleri, hiperparametre ayarlamayı ve eğitimi tüketici donanımlarında erişilebilir kılarken NMS'siz çıkarımı, Raspberry Pi veya NVIDIA Jetson gibi kısıtlı uç cihazlarda hızlı çalışmayı sağlar.

Daha Fazla Karşılaştırma Keşfet

Bu modellerin diğer mimarilerle nasıl karşılaştırıldığını merak ediyor musun? Görsel yapay zeka projen için mükemmel uyumu bulmak üzere YOLO11 vs. RT-DETR ve YOLOv8 vs. YOLOv7 hakkındaki detaylı rehberlerimize göz at.

Yorumlar