YOLOv7 ve RTDETRv2#
Bilgisayarlı görü dünyası, Evrişimli Sinir Ağları (CNN'ler) ve Görsel Transformerlar (ViT'ler) arasındaki rekabetin etkisiyle hızla gelişmeye devam ediyor. Bu teknik karşılaştırma, iki ağır siklet mimariyi derinlemesine inceliyor: oldukça optimize edilmiş bir CNN tabanlı nesne tespit modeli olan YOLOv7 ve son teknoloji bir Gerçek Zamanlı Tespit Transformer'ı olan RTDETRv2.
Mimari farklılıklarını, performans metriklerini ve ideal dağıtım senaryolarını analiz ederek, bu yapay zeka modellerini üretim hatlarına entegre ederken bilinçli kararlar alabilirsin.
YOLOv7: Bag-of-Freebies CNN Mimarisi#
YOLOv7, geleneksel YOLO ailesine paradigma değiştiren birçok yapısal optimizasyon getirerek, bir dizi "eğitilebilir bedava özellikler (trainable bag-of-freebies)" ile gerçek zamanlı nesne tespitinin sınırlarını zorladı.
Önemli Özellikler:
Yazarlar: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
Kurum: Institute of Information Science, Academia Sinica
Tarih: 2022-07-06
Arxiv: https://arxiv.org/abs/2207.02696
GitHub: WongKinYiu/yolov7
Mimari ve Güçlü Yönler#
YOLOv7, Genişletilmiş Verimli Katman Birleştirme Ağı (E-ELAN) mimarisiyle öne çıkar. Bu yapısal tasarım, modelin orijinal gradyan yolunu bozmadan daha çeşitli özellikler öğrenmesini sağlar. Ayrıca, doğruluktan ödün vermeden çıkarım hızını optimize eden planlı yeniden parametrelendirilmiş konvolüsyonları bünyesinde barındırır. Eğitilebilir ücretsiz araçlar (bag-of-freebies) yaklaşımı, hız ve doğruluk arasında etkileyici dengeler kurmasına olanak tanıyarak sunucu sınıfı GPU'larda gerçek zamanlı nesne tespiti görevleri için son derece uygun olmasını sağlar.
YOLOv7 ayrıca oldukça çok yönlüdür. Standart sınırlayıcı kutu tespitinin ötesinde, depo; uyarlanabilirliğini gösteren poz tahmini ve örnek bölütleme için dallar sunar.
Sınırlamalar#
Birçok eski CNN modeli gibi, YOLOv7 de son işleme (post-processing) için Maksimum Olmayan Baskılama (NMS) yöntemine güvenir. NMS, özellikle kalabalık sahnelerde değişken gecikme süreleri ortaya çıkarır; bu durum, uç cihazlarda katı gerçek zamanlı garantileri zorlaştırabilir.
YOLOv7 hakkında daha fazla bilgi edinin
RTDETRv2: Gerçek Zamanlı Transformerların İlerletilmesi#
RTDETRv2, orijinal RT-DETR çerçevesi üzerine inşa edilerek, transformerların gerçek zamanlı gecikme sürelerinde YOLO mimarileriyle rekabet edebileceğini ve aynı zamanda yüksek uzamsal doğruluğu koruyabildiğini daha da kanıtlar.
Önemli Özellikler:
Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
Kurum: Baidu
Tarih: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR
Mimari ve Güçlü Yönler#
RTDETRv2, Vision Transformers için önemli bir ileri adımı temsil eder. Çok ölçekli özellikleri hızlı bir şekilde işlemek için esnek bir sorgu seçim sürecinden ve verimli bir hibrit kodlayıcıdan yararlanır. Detection Transformers (DETRs) için özel olarak uyarlanmış yeni bir "ücretsiz araçlar" (bag-of-freebies) sunarak uzamsal akıl yürütmeyi sınırlarına kadar zorlar. Yerel olarak NMS içermediğinden, titiz akıllı şehir uygulamaları ve otonom sürüş için kritik bir özellik olan deterministik çıkarım süreleri sağlar.
Sınırlamalar#
Gelişmelerine rağmen RTDETRv2, transformer tabanlı mimarilerin geleneksel yüklerini taşır. CNN'lere kıyasla hem eğitim hem de çıkarım sırasında önemli ölçüde daha yüksek CUDA belleği gerektirir. Ek olarak, eğitim yakınsama süreleri belirgin şekilde daha uzundur; bu da çok miktarda yüksek kaliteli etiketlenmiş veri (COCO veri seti gibi) ve ağır hesaplama kaynakları gerektirir.
RTDETRv2 hakkında daha fazla bilgi edin
Performans Karşılaştırması#
Bu modelleri kıyaslarken hassasiyeti, ham çıkarım hızını ve hesaplama ayak izini kapsayan bütünsel bir resme bakmalıyız. Aşağıda doğrudan bir karşılaştırma tablosu yer almaktadır.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametreler (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2-x, %54.3 ile mutlak en yüksek mAPval değerini talep etse de, devasa 259 milyar FLOP gerektirir. Buna karşılık, YOLOv7 mimarileri mükemmel bir temel sağlar ancak saf ağ gecikme metriklerinde tam olarak yakalanamayan eski NMS yükü sorunundan muzdariptir.
Ultralytics Avantajı: Ekosistem ve Evrim#
YOLOv7 ve RTDETRv2 güçlü özellikler sunsa da, bunları üretim ortamlarında dağıtmak genellikle lojistik sürtünmeleri ortaya çıkarır. İşte Ultralytics ekosistemi tam bu noktada öne çıkar. Kesintisiz uçtan uca entegrasyon için tasarlanan Ultralytics çerçevesi, geliştiricilere bilgisayarlı görü hatlarının tipik karmaşıklıklarını soyutlayan birleşik bir API sunar.
Benzersiz Çok Yönlülük ve Bellek Verimliliği#
Devasa miktarlarda VRAM tüketen katı transformer modellerinin aksine, Ultralytics YOLO modelleri sıkı bir bellek verimliliği korur. Bu, erişilebilir donanım üzerinde hızlı model eğitimi yapılmasını sağlar. Ekosistem, RTDETRv2'nin şu anda eksik olduğu bir esneklik sunarak, görüntü sınıflandırma ve yönlendirilmiş sınırlayıcı kutu (OBB) tespiti dahil olmak üzere tek bir kod tabanından birden fazla bilgisayarlı görü görevini doğal olarak destekler.
Kesintisiz Dağıtım#
Araştırmadan üretime geçmek, sağlam dağıtım seçenekleri gerektirir. Ultralytics API, endüstri standardı formatlara tek tıkla model dışa aktarmayı yerel olarak yönetir. İster çapraz platform uyumluluğu için ONNX ister maksimum GPU hızlandırması için TensorRT hedefliyor olun, boru hattı tamamen otomatiktir ve güvenilirdir.
Nihai Yükseltme: Ultralytics YOLO26#
YOLOv7 ve RTDETRv2 arasında kararsız kalan geliştiriciler için en iyi yol aslında yapay görmedeki yeni standarttır: Ultralytics YOLO26. Ocak 2026'da piyasaya sürülen YOLO26, CNN'lerin hızı ile transformerların gelişmiş akıl yürütme yeteneği arasındaki boşluğu doldururken, her ikisinin zayıf yönlerini tamamen ortadan kaldırır.
YOLO26 hakkında daha fazla bilgi edin
YOLO26, hem sunucu hem de uç cihaz dağıtımları için özel olarak hazırlanmış çığır açan yenilikler sunar:
- Uçtan Uca NMS İçermeyen Tasarım: İlk olarak YOLOv10 ile öncülük edilen YOLO26, NMS sonrası işlemeyi yerel olarak ortadan kaldırır. Bu, bir transformer'ın külfetli hesaplama yükü olmaksızın RTDETRv2'nin deterministik gecikmesini sağlar.
- MuSGD Optimize Edici: (Moonshot AI'ın Kimi K2'si gibi) büyük dil modeli eğitim tekniklerinden esinlenen YOLO26, SGD ve Muon hibrit bir yapı kullanır. Bu, ViT'lerin kullandığı standart AdamW uygulamalarına kıyasla benzeri görülmemiş bir eğitim kararlılığı ve önemli ölçüde daha hızlı yakınsama süreleri sunar.
- ProgLoss + STAL: Bu gelişmiş kayıp fonksiyonları, robotik otomasyon için kritik olan RTDETRv2'nin çok ölçekli özellik avantajlarıyla doğrudan rekabet eden küçük nesne tanımada belirgin iyileştirmeler sağlar.
- Uç Cihaz Optimizasyonu ve DFL Kaldırma: Dağılım Odaklı Kayıp (DFL) değerini kaldırarak, YOLO26 çıktı kafasını düzene sokar ve %43'e kadar daha hızlı CPU çıkarımı sağlar; bu da onu ağır transformer modellerine göre uç cihazlarda çok daha dağıtılabilir kılar.
Ultralytics ile Eğitim Örneği#
Ultralytics Python API'sinin basitliği sayesinde, son teknoloji YOLO26 modelini sadece birkaç satır kodla eğitebilirsin:
from ultralytics import YOLO
# Load the highly efficient YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
# The framework automatically manages data augmentation and hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")
# Effortlessly export to TensorRT for deployment
model.export(format="engine", dynamic=True)İdeal Kullanım Senaryoları#
Doğru mimariyi seçmek, büyük ölçüde dağıtım kısıtlamalarına ve donanım kullanılabilirliğine bağlıdır:
Ne zaman YOLOv7 düşünmelisin:
- YOLOv7'nin yerleşik bir temel olarak kabul edildiği eski araştırma projelerinde.
- Ham GPU hızlandırmasının bol olduğu ve NMS gecikme dalgalanmalarının kabul edilebilir olduğu ortamlarda.
Ne zaman RTDETRv2 düşünmelisin:
- Mutlak maksimum mAP gerektiren üst düzey sunucu dağıtımlarında.
- Deterministik çıkarım gecikmesinin (NMS-free) kesinlikle gerekli olduğu ve transformer omurgasını destekleyecek VRAM'e sahip olduğun senaryolarda.
Ne zaman Ultralytics YOLO26 seçmelisin:
- Neredeyse her zaman. RTDETRv2'nin NMS içermeyen determinizmini sunar, YOLOv7'nin hızını ve doğruluğunu aşar, önemli ölçüde daha az VRAM kullanır ve zahmetsiz veri seti yönetimi, eğitim ve dağıtım için Ultralytics Platform ile tamamen entegredir.
Diğer mimarilerin nasıl performans gösterdiğini merak ediyor musunuz? YOLO11 ve YOLOv8 gibi önceki nesillere yaptığımız derinlemesine incelemeleri keşfedin veya projenizin doğruluğunu en üst düzeye çıkarmak için hiperparametre optimizasyonundan nasıl yararlanacağınızı öğrenin.