YOLO Vision 2026:

RTDETRv2 ile YOLOv7 karşılaştırması#

Bilgisayarla görü alanı, Evrişimli Sinir Ağları (CNN'ler) ve Görme Transformer'ları (ViT'ler) alanındaki sürekli yeniliklerin etkisiyle son birkaç yılda dramatik biçimde genişledi. Dağıtımın için doğru mimariyi seçmek; hız, doğruluk ve hesaplama yükü arasındaki ince ödünleşimleri anlamayı gerektirir. Bu kılavuz, son derece saygın iki mimari arasındaki teknik farkları incelerken: RTDETRv2 ve YOLOv7, aynı zamanda daha yeni olan Ultralytics YOLO26 içerisindeki modern gelişmeleri de vurguluyor.

RTDETRv2: Gerçek Zamanlı Tespit için Transformer Yaklaşımı#

RTDETRv2 (Gerçek Zamanlı Tespit Transformer'ı sürüm 2), geleneksel işlem sonrası adımlarına güvenmeden transformer tabanlı mimarilerin gerçek zamanlı senaryolarda etkili bir şekilde rekabet edebileceğini kanıtlamak için selefinin temelleri üzerine inşa edilmiştir.

Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
Kuruluş: Baidu Tarih: 2024-07-24 Arxiv: https://arxiv.org/abs/2407.17140
GitHub: RTDETRv2 Deposu

Mimari Öne Çıkanlar#

RTDETRv2, hibrit bir kodlayıcı ve bir transformer kod çözücü mimarisi kullanır. Öz-dikkat mekanizmalarından yararlanan model, tüm görüntüyü bütünsel olarak işleyerek karmaşık uzamsal ilişkileri, kesin olarak yerelleştirilmiş evrişim çekirdeklerinden daha iyi anlamasını sağlar. En belirgin özelliklerinden biri, yerel olarak NMS içermeyen tasarımıdır. Non-Maximum Suppression (NMS) adımını ortadan kaldıran RTDETRv2, dağıtım sırasında değişken çıkarım gecikmesi yaratan yaygın bir darboğazı ortadan kaldırır.

Güçlü ve Zayıf Yönler#

RTDETRv2'nin birincil gücü, karmaşık sahnelerdeki yoğun ve örtüşen nesneleri işleme yeteneğinde yatar. Transformer dikkat katmanları tarafından sağlanan küresel bağlam, özellikle örtüşmelerin sık olduğu senaryolarda onu oldukça doğru kılar.

Ancak bu, bir hesaplama maliyetiyle gelir. Transformer modelleri geleneksel olarak CNN'lere kıyasla eğitim ve çıkarım sırasında daha yüksek bir bellek kaplama alanı gerektirir. Dahası, RTDETRv2 genellikle dağıtık eğitim sırasında yakınsama için daha fazla epoch gerektirir, bu da özel veri setlerini ince ayarlayan geliştiriciler için daha uzun iterasyon döngülerine yol açar.

RTDETRv2 hakkında daha fazla bilgi edin

YOLOv7: Hız için bir CNN Temel Modeli#

RTDETRv2'den bir yıl önce yayınlanan YOLOv7, klasik YOLO çerçevesinde birkaç yapısal optimizasyon getirerek yayınlandığı dönemde CNN tabanlı gerçek zamanlı dedektörler için güçlü bir kıyaslama standardı belirledi.

Yazarlar: Chien-Yao Wang, Alexey Bochkovskiy ve Hong-Yuan Mark Liao
Kuruluş: Institute of Information Science, Academia Sinica, Taiwan
Tarih: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: YOLOv7 Deposu

Mimari Öne Çıkanlar#

YOLOv7'nin mimarisi, Genişletilmiş Verimli Katman Toplama Ağı (E-ELAN) kavramı etrafında inşa edilmiştir. Bu yaklaşım, gradyan yolunu optimize ederek modelin hesaplama karmaşıklığını önemli ölçüde artırmadan daha etkili bir şekilde öğrenmesini sağlar. Yazarlar ayrıca, uç cihazlardaki çıkarım hızını etkilemeden eğitim sırasında model doğruluğunu artıran bir dizi yöntem olan "trainable bag-of-freebies" (eğitilebilir hediye çantası) kavramını tanıttılar.

Güçlü ve Zayıf Yönler#

YOLOv7, standart nesne tespiti görevleri için son derece yetenekli bir model olmaya devam etmekte ve tüketici GPU'larında mükemmel işleme hızları sunmaktadır. CNN yapısı, RTDETRv2 gibi transformer tabanlı modellere kıyasla eğitim sırasında genellikle daha az CUDA belleği gerektirdiği anlamına gelir.

Bu avantajlara rağmen YOLOv7, son işlem için hâlâ NMS'ye güvenmektedir. Yüksek yoğunlukta tahminlerin olduğu ortamlarda, NMS adımı işleme süresinde dalgalanmalara neden olarak katı gerçek zamanlı garantileri zorlaştırabilir. Ek olarak, modern çerçevelere kıyasla örnek bölütleme ve poz tahmini gibi çeşitli görevleri ele alma süreci parçalı olabilir.

YOLOv7 hakkında daha fazla bilgi edinin

Performans Karşılaştırması#

Bu modelleri değerlendirmek, ortalama Duyarlılık (mAP), parametre sayısı ve çıkarım hızı arasındaki hassas dengenin incelenmesini gerektirir.

Modelboyut
(piksel)
mAPval
50-95
Hız
CPU ONNX
(ms)
Hız
T4 TensorRT10
(ms)
parametreler
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv7l64051.4-6.8436.9104.7
YOLOv7x64053.1-11.5771.3189.9
Performans Bağlamı

RTDETRv2-x en yüksek mAP değerine ulaşsa da, aynı zamanda en büyük parametre sayısına ve FLOP değerine sahiptir. RTDETRv2-s gibi daha küçük varyantlar TensorRT'de rekabetçi hızlar sunar, ancak özel GPU'ları olmayan düşük güçlü ortamları hedefleyen kullanıcıların CPU çıkarım yeteneklerini dikkatlice değerlendirmeleri gerekir.

Modern Çözüm: YOLO26 ile Tanışın#

RTDETRv2 ve YOLOv7, bilgisayarla görü uygulamaları alanının sınırlarını zorlamada çok önemli bir rol oynamış olsa da yapay zeka sektörü hızla evrilmektedir. Ocak 2026'da yayınlanan YOLO26, hem CNN verimliliğinin hem de transformer benzeri NMS'siz mimarilerin en iyi yönlerini sentezler.

Yeni sistemler kuran geliştiriciler ve araştırmacılar için entegre Ultralytics Platform ve Python ekosistemi, teknik borcu önemli ölçüde azaltan birleşik bir deneyim sağlar.

YOLO26'daki Temel Yenilikler#

  • Uçtan Uca NMS'siz Tasarım: YOLO26, yerel olarak uçtan uca olup daha hızlı ve daha basit dağıtım için NMS son işlemini ortadan kaldırır. Bu çığır açan yaklaşım ilk olarak YOLOv10 içinde öncülük edilmişti ve nesne yoğunluğundan bağımsız olarak kararlı bir gecikme süresi sağlar.
  • %43'e Varan Daha Hızlı CPU Çıkarımı: Uç bilişim ve GPU'su olmayan cihazlar için özel olarak optimize edilmiştir; bu da onu ağır transformer modellerine kıyasla saha dağıtımları için çok daha esnek hale getirir.
  • MuSGD Optimize Edici: SGD ve Muon'un (Moonshot AI'nin Kimi K2'sinden esinlenilmiştir) bir melezi olup, daha kararlı eğitim ve daha hızlı yakınsama için LLM eğitim yeniliklerini bilgisayarlı görüye taşır.
  • DFL Kaldırıldı: Dağıtım Odak Kaybı (Distribution Focal Loss) kaldırılmış olup gömülü NPU'lara ve TensorRT ortamlarına daha sorunsuz aktarım için basitleştirilmiş bir hesaplama grafiği ile sonuçlanmıştır.
  • ProgLoss + STAL: İyileştirilmiş kayıp fonksiyonları, robotik, IoT ve havadan görüntü analizi için kritik önem taşıyan küçük nesne tanımada belirgin geliştirmeler sağlar.
  • Göreve Özel İyileştirmeler: YOLO26 sadece tespit için değildir. Bölütleme için çok ölçekli prototipler, poz takibi için Artık Log-Olabilirlik Tahmini (RLE) ve yönlendirilmiş sınırlayıcı kutu (OBB) sınır sorunlarını ele alan özel açı kayıpları içerir.

Kolaylaştırılmış Geliştirici Deneyimi#

YOLO26 (veya son derece popüler olan YOLO11) gibi bir Ultralytics modelini seçmenin gerçek avantajı, bakımı iyi yapılan ekosistemdir. Özel bir veri setini eğitmek minimum düzeyde şablon kod gerektirir:

from ultralytics import YOLO

# Initialize the state-of-the-art YOLO26 model
model = YOLO("yolo26s.pt")

# Train the model on the COCO8 dataset
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export seamlessly for edge deployment
model.export(format="onnx", dynamic=True)

YOLO26 hakkında daha fazla bilgi edin

İdeal Kullanım Senaryoları ve Uygulamalar#

Bu mimariler arasında seçim yapmak, büyük ölçüde hedef donanıma ve özel operasyonel gereksinimlere bağlıdır.

RTDETRv2 Ne Zaman Düşünülmeli#

RTDETRv2, güçlü GPU'larla donatılmış sunucu tarafı işleme ortamlarında son derece etkilidir. Küresel dikkat mekanizması; üst üste binen özelliklerin derin bağlamsal analiz gerektirdiği, oldukça kalabalık etkinlik izleme veya özel tıbbi görüntüleme gibi karmaşık sahne anlaşılması için uygun hale getirir.

YOLOv7 Ne Zaman Dikkate Alınmalı#

YOLOv7 genellikle eski akademik araştırmalarda temel karşılaştırma modeli olarak korunur. Ayrıca, mevcut hatların belirli PyTorch sürümleri için kodlandığı ve daha yeni çerçevelerin çoklu görev esnekliğine ihtiyaç duymayan eski endüstriyel dağıtımlarda da bulunur.

Neden YOLO26 Önerilen Standarttır#

Modern akıllı şehir altyapısı, drone navigasyonu ve yüksek hızlı üretim için YOLO26 benzersiz bir denge sunar. Daha düşük bellek gereksinimleri hiperparametre optimizasyonunu ve eğitimi tüketici donanımında erişilebilir kılararken, NMS'siz çıkarımı Raspberry Pi veya NVIDIA Jetson gibi kısıtlı uç cihazlarda hızlı yürütme sağlar.

Daha Fazla Karşılaştırmayı Keşfet

Bu modellerin diğer mimarilere karşı nasıl bir performans gösterdiğini merak ediyor musun? Vizyon yapay zeka projen için mükemmel uyumu bulmak adına YOLO11 vs. RTDETR ve YOLOv8 vs. YOLOv7 hakkındaki ayrıntılı kılavuzlarımıza göz at.

Yorumlar