Ultralytics YOLO27:
Get Started

RTDETRv2 ile YOLOv7#

Bilgisayarlı görü alanı, Evrişimli Sinir Ağları (CNN'ler) ve Görsel Transformer'lar (ViT'ler) alanındaki sürekli yeniliklerin etkisiyle son birkaç yılda büyük ölçüde genişledi. Dağıtım için doğru mimariyi seçmek, hız, doğruluk ve hesaplama yükü arasındaki ince farkları anlamayı gerektirir. Bu kılavuz, RTDETRv2 ve YOLOv7 adlı, büyük saygı gören iki mimari arasındaki teknik farklılıkları incelerken daha yeni Ultralytics YOLO26 modelindeki modern gelişmeleri de öne çıkarıyor.

RTDETRv2: Gerçek Zamanlı Algılamada Transformer Yaklaşımı#

RTDETRv2 (Gerçek Zamanlı Algılama Transformer'ı sürüm 2), transformer tabanlı mimarilerin geleneksel son işleme adımlarına bağlı kalmadan gerçek zamanlı senaryolarda etkili biçimde rekabet edebileceğini göstererek önceki sürümünün temellerini geliştirir.

Mimari Öne Çıkanlar#

RTDETRv2, hibrit kodlayıcı ve transformer kod çözücü mimarisinden yararlanır. Öz dikkat mekanizmalarını kullanarak görüntünün tamamını bütünsel biçimde işler; bu sayede karmaşık uzamsal ilişkileri, yalnızca yerel özelliklere odaklanan evrişim çekirdeklerinden daha iyi kavrar. En belirgin özelliklerinden biri, yerel olarak NMS gerektirmeyen tasarımıdır. Maksimum Olmayan Bastırma'yı (NMS) ortadan kaldıran RTDETRv2, dağıtım sırasında değişken çıkarım gecikmesine yol açan yaygın bir darboğazı giderir.

Güçlü Yönler ve Sınırlamalar#

RTDETRv2'nin başlıca gücü, karmaşık sahnelerde yoğun ve örtüşen nesneleri ele alabilmesidir. Transformer dikkat katmanlarının sağladığı küresel bağlam, özellikle örtüşmenin sık yaşandığı senaryolarda yüksek doğruluk sunar.

Ancak bunun bir hesaplama maliyeti vardır. Transformer modelleri, eğitim ve çıkarım sırasında geleneksel olarak CNN'lere kıyasla daha fazla bellek kullanır. Ayrıca RTDETRv2, dağıtık eğitim sırasında yakınsamak için genellikle daha fazla epok gerektirir; bu da özel veri kümelerini ayarlayan geliştiricilerin yineleme döngülerini uzatır.

RTDETRv2 hakkında daha fazla bilgi edin

YOLOv7: Hız İçin Bir CNN Temeli#

RTDETRv2'den iki yıl önce yayımlanan YOLOv7, klasik YOLO çerçevesine çeşitli yapısal optimizasyonlar getirdi ve yayımlandığı dönemde CNN tabanlı gerçek zamanlı algılayıcılar için güçlü bir ölçüt belirledi.

Mimari Öne Çıkanlar#

YOLOv7'nin mimarisi, Genişletilmiş Verimli Katman Birleştirme Ağı (E-ELAN) kavramı üzerine kuruludur. Bu yaklaşım, hesaplama karmaşıklığını önemli ölçüde artırmadan modelin daha etkili öğrenmesini sağlayarak gradyan yolunu optimize eder. Makale yazarları ayrıca, uç cihazlarda çıkarım hızını etkilemeden eğitim sırasında model doğruluğunu artıran bir dizi yöntem olan "eğitilebilir ücretsiz avantajlar paketi"ni tanıttı.

Güçlü Yönler ve Sınırlamalar#

YOLOv7, standart nesne algılama görevleri için son derece yetenekli bir model olmaya devam eder ve tüketici GPU'larında mükemmel işlem hızları sunar. CNN yapısı sayesinde RTDETRv2 gibi transformer tabanlı modellere kıyasla eğitim sırasında genellikle daha az CUDA belleği gerektirir.

Bu avantajlara rağmen YOLOv7, son işleme için hâlâ NMS'ye dayanır. Tahmin yoğunluğunun yüksek olduğu ortamlarda NMS adımı, işlem süresinde dalgalanmalara yol açarak katı gerçek zamanlı garantiler vermeyi zorlaştırabilir. Ayrıca modern çerçevelerle karşılaştırıldığında örnek segmentasyonu ve poz tahmini gibi farklı görevleri ele alma süreci parçalı olabilir.

YOLOv7 hakkında daha fazla bilgi edin

Performans Karşılaştırması#

Bu modelleri değerlendirirken ortalama Hassasiyet (mAP), parametre sayısı ve çıkarım hızı arasındaki hassas dengeyi göz önünde bulundurmak gerekir.

Modelboyut
(piksel)
mAPval
50-95
Hız
CPU ONNX
(ms)
Hız
T4 TensorRT10
(ms)
parametre
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Performans Bağlamı

RTDETRv2-x en yüksek mAP değerine ulaşırken en fazla parametreye ve FLOP'a da sahiptir. RTDETRv2-s gibi daha küçük varyantlar TensorRT'de rekabetçi hızlar sunar; ancak özel GPU'su olmayan, düşük güçlü ortamları hedefleyen kullanıcıların CPU çıkarım özelliklerini dikkatle değerlendirmesi gerekir.

Modern Çözüm: YOLO26 ile Tanış#

RTDETRv2 ve YOLOv7, bilgisayarlı görü uygulamalarının sınırlarını zorlamada önemli rol oynamış olsa da yapay zekâ alanı hızla gelişiyor. Ocak 2026'da yayımlanan YOLO26, CNN verimliliğinin ve transformer benzeri, NMS gerektirmeyen mimarilerin en iyi yönlerini bir araya getiriyor.

Yeni sistemler geliştiren geliştiriciler ve araştırmacılar için tümleşik Ultralytics Platformu ve Python ekosistemi, teknik borcu önemli ölçüde azaltan birleşik bir deneyim sunar.

YOLO26'daki Temel Yenilikler#

  • Uçtan Uca, NMS Gerektirmeyen Tasarım: YOLO26, isteğe bağlı bire bir başlığıyla (nms=False) yerel olarak uçtan uca çalışır ve daha hızlı, daha basit dağıtım için NMS son işlemesini atlar. Bu çığır açan yaklaşım ilk kez YOLOv10 tarafından kullanıma sunuldu ve nesne yoğunluğundan bağımsız, kararlı gecikme sağlıyor.
  • CPU'da %43'e Varan Hızlı Çıkarım: Uç bilişim ve GPU içermeyen cihazlar için özel olarak optimize edildiğinden, saha dağıtımlarında ağır transformer modellerinden çok daha fazla çok yönlülük sunar.
  • MuSGD Optimize Edici: SGD ile Muon'un hibriti olan bu yöntem, (Moonshot AI'ın Kimi K2'sinden esinlenerek) LLM eğitim yeniliklerini bilgisayarlı görüye taşır; daha kararlı eğitim ve daha hızlı yakınsama sağlar.
  • DFL'nin Kaldırılması: Distribution Focal Loss kaldırılarak gömülü NPU'lara ve TensorRT ortamlarına daha sorunsuz aktarım sağlayan, sadeleştirilmiş bir hesaplama grafiği elde edildi.
  • ProgLoss + STAL: Geliştirilmiş kayıp fonksiyonları, robotik, IoT ve hava görüntüsü analizleri için kritik olan küçük nesne tanımada kayda değer iyileşmeler sağlar.
  • Göreve Özel İyileştirmeler: YOLO26 yalnızca algılama için değildir. Segmentasyon için çok ölçekli prototipler, poz tahmini için Artık Log-Olasılık Tahmini (RLE) ve yönlendirilmiş sınırlayıcı kutu (OBB) sınır sorunlarını ele alan özel açı kaybı içerir.

Geliştirici Deneyimini Sadeleştirme#

YOLO26 (veya çok popüler YOLO11) gibi bir Ultralytics modelini seçmenin gerçek avantajı, bakımı iyi yapılan ekosistemidir. Özel bir veri kümesini eğitmek için çok az temel kod gerekir:

from ultralytics import YOLO

# Son teknoloji YOLO26 modelini başlat
model = YOLO("yolo26s.pt")

# Modeli COCO8 veri kümesinde eğit
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Uç dağıtımı için sorunsuz bir şekilde dışa aktar
model.export(format="onnx", dynamic=True)

İdeal Kullanım Alanları ve Uygulamalar#

Bu mimariler arasında seçim yapmak büyük ölçüde hedef donanıma ve özel operasyonel gereksinimlere bağlıdır.

RTDETRv2'yi Ne Zaman Değerlendirmeli?#

RTDETRv2, güçlü GPU'larla donatılmış sunucu tarafı işleme ortamlarında son derece etkilidir. Küresel dikkat mekanizması; yoğun kalabalık bulunan etkinliklerin izlenmesi veya örtüşen özelliklerin derinlemesine bağlamsal analiz gerektirdiği özel tıbbi görüntüleme gibi karmaşık sahneleri anlamaya uygun olmasını sağlar.

YOLOv7'yi Ne Zaman Tercih Etmeli?#

YOLOv7, akademik araştırmalarda temel karşılaştırma modeli olarak çoğu zaman eski sistemlerde kullanılmaya devam eder. Ayrıca mevcut işlem hatlarının belirli PyTorch sürümlerine göre sabit kodlandığı ve yeni çerçevelerin çok görevli esnekliğinin gerekmediği eski endüstriyel dağıtımlarda da kullanılır.

Modern akıllı şehir altyapısı, drone navigasyonu ve yüksek hızlı üretim için YOLO26 benzersiz bir denge sunar. Düşük bellek gereksinimleri, hiperparametre ayarlama ve eğitimi tüketici donanımlarında erişilebilir kılarken NMS gerektirmeyen çıkarımı, Raspberry Pi veya NVIDIA Jetson gibi kaynakları kısıtlı uç cihazlarda hızlı çalışmasını sağlar.

Diğer Karşılaştırmaları İncele

Bu modellerin diğer mimariler karşısındaki durumunu merak ediyor musun? Görsel yapay zekâ projen için en uygun modeli bulmak üzere YOLO11 ile RT-DETR ve YOLOv8 ile YOLOv7 hakkındaki ayrıntılı kılavuzlarımıza göz at.

Yorumlar