YOLOv7 ve RTDETRv2#
Bilgisayarlı görü alanı, Evrişimsel Sinir Ağları (CNNs) ile Görsel Transformer'lar (ViTs) arasındaki rekabetin etkisiyle hızla gelişmeye devam ediyor. Bu teknik karşılaştırmada iki iddialı mimari inceleniyor: son derece optimize edilmiş CNN tabanlı bir nesne algılayıcı olan YOLOv7 ve son teknoloji bir Gerçek Zamanlı Algılama Transformer'ı olan RTDETRv2.
Geliştiriciler, mimari farklılıkları, performans ölçütlerini ve ideal dağıtım senaryolarını inceleyerek bu yapay zekâ destekli görüntü modellerini üretim işlem hatlarına entegre ederken bilinçli kararlar verebilir.
YOLOv7: Bedava Avantajlar Paketi Sunan CNN Mimarisi#
YOLOv7, eğitilebilir "bedava avantajlar paketi" yaklaşımıyla geleneksel YOLO ailesine paradigma değiştirici çeşitli yapısal optimizasyonlar getirerek gerçek zamanlı nesne algılamanın sınırlarını zorladı.
Temel Özellikler:
- Yazarlar: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
- Kuruluş: Academia Sinica Bilgi Bilimi Enstitüsü
- Tarih: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: WongKinYiu/yolov7
Mimari ve Güçlü Yönler#
YOLOv7, Genişletilmiş Verimli Katman Toplama Ağı (E-ELAN) mimarisiyle öne çıkar. Bu yapısal tasarım, özgün gradyan yolunu bozmadan modelin daha çeşitli özellikler öğrenmesini sağlar. Ayrıca doğruluğu düşürmeden çıkarım hızını artıran, planlı yeniden parametrelendirilmiş evrişimler içerir. Eğitilebilir bedava avantajlar paketi yaklaşımı, hız ve doğruluk arasında etkileyici dengeler kurmasını sağlar; bu da modeli sunucu sınıfı GPU'larda gerçek zamanlı nesne algılama görevleri için son derece uygun hâle getirir.
YOLOv7 aynı zamanda oldukça esnektir. Standart sınırlayıcı kutu algılamanın yanı sıra depo, uyarlanabilirliğini gösteren poz tahmini ve örnek segmentasyonu dalları da sunar.
Sınırlamalar#
Birçok eski CNN modeli gibi YOLOv7 de son işleme için Maksimum Olmayan Bastırma (NMS) kullanır. NMS, özellikle kalabalık sahnelerde değişken gecikmeye neden olur ve uç cihazlarda katı gerçek zamanlı çalışma garantilerini zorlaştırabilir.
YOLOv7 hakkında daha fazla bilgi edin
RTDETRv2: Gerçek Zamanlı Transformer'ları Geliştirmek#
RTDETRv2, özgün RT-DETR çerçevesini temel alır ve Transformer'ların yüksek uzamsal doğruluğu korurken gerçek zamanlı gecikme açısından YOLO mimarileriyle rekabet edebildiğini daha da ortaya koyar.
Temel Özellikler:
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- Kurum: Baidu
- Tarih: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
Mimari ve Güçlü Yönler#
RTDETRv2, Görsel Transformer'lar için önemli bir ilerlemeyi temsil eder. Çok ölçekli özellikleri hızla işlemek için esnek bir sorgu seçme sürecinden ve verimli bir hibrit kodlayıcıdan yararlanır. Özellikle Algılama Transformer'ları (DETR'ler) için tasarlanmış yeni bir "bedava avantajlar paketi" sunarak uzamsal akıl yürütmeyi en üst düzeye taşır. Yerel olarak NMS'siz çalıştığı için kesin çıkarım süreleri sunar; bu özellik, zorlu akıllı şehir uygulamaları ve otonom sürüş için kritik önem taşır.
Sınırlamalar#
Gelişmiş özelliklerine rağmen RTDETRv2, Transformer tabanlı mimarilerin geleneksel yüklerini taşır. Eğitim ve çıkarım sırasında CNN'lere kıyasla çok daha fazla CUDA belleği gerektirir. Ayrıca eğitim yakınsama süreleri belirgin biçimde daha uzundur; bu nedenle COCO veri kümesi gibi büyük miktarda yüksek kaliteli etiketlenmiş veriye ve yoğun hesaplama kaynaklarına ihtiyaç duyar.
RTDETRv2 hakkında daha fazla bilgi edin
Performans Karşılaştırması#
Bu modelleri kıyaslarken kesinlik, ham çıkarım hızı ve hesaplama ayak izini kapsayan bütüncül bir değerlendirme yapmalıyız. Aşağıda doğrudan bir karşılaştırma tablosu yer alıyor.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2-x, 54.3% ile en yüksek mAPval değerine sahip olduğunu iddia etse de 259 milyar FLOPs gerektirir. Buna karşılık YOLOv7 mimarileri mükemmel bir temel sunar ancak saf ağ gecikmesi ölçütlerinde tam olarak yansıtılmayan eski NMS ek yüküne sahiptir.
Ultralytics'in Avantajı: Ekosistem ve Gelişim#
YOLOv7 ve RTDETRv2 güçlü yetenekler sunsa da bunları üretim ortamlarında dağıtmak çoğu zaman operasyonel zorlukları ortaya çıkarır. Ultralytics ekosisteminin öne çıktığı nokta tam da burasıdır. Baştan sona sorunsuz entegrasyon için tasarlanan Ultralytics çerçevesi, bilgisayarlı görü işlem hatlarının tipik karmaşıklıklarını soyutlayan birleşik bir API sunar.
Eşsiz Çok Yönlülük ve Bellek Verimliliği#
Büyük miktarda VRAM tüketen katı Transformer modellerinin aksine Ultralytics YOLO modelleri yüksek bellek verimliliğini korur. Böylece erişilebilir donanımlarda hızlı model eğitimi mümkün olur. Ekosistem, tek bir kod tabanından görüntü sınıflandırması ve yönlendirilmiş sınırlayıcı kutu (OBB) algılama dâhil olmak üzere birden fazla bilgisayarlı görü görevini doğal olarak destekleyerek RTDETRv2'nin şu anda sunamadığı bir esneklik sağlar.
Sorunsuz Dağıtım#
Araştırmadan üretime geçiş, güçlü dağıtım seçenekleri gerektirir. Ultralytics API'si, endüstri standardı biçimlere tek tıklamayla model aktarımını doğal olarak destekler. Platformlar arası uyumluluk için ONNX ya da GPU hızlandırmasını en üst düzeye çıkarmak için TensorRT hedefliyor ol, işlem hattı tamamen otomatik ve güvenilirdir.
En İyi Yükseltme: Ultralytics YOLO26#
YOLOv7 ile RTDETRv2 arasında seçim yapmayı düşünen geliştiriciler için en iyi ilerleme yolu, aslında yapay zekâ destekli görüntü alanının yeni standardı olan Ultralytics YOLO26 modelidir. Ocak 2026'da yayımlanan YOLO26, CNN'lerin hızı ile Transformer'ların gelişmiş akıl yürütme yeteneklerini bir araya getirirken her iki mimarinin de zayıf yönlerini tamamen ortadan kaldırıyor.
YOLO26, hem sunucu hem de uç dağıtımlara yönelik çığır açan yenilikler sunuyor:
- Uçtan Uca NMS'siz Tasarım: İlk olarak YOLOv10 modelinde öncülük edilen yaklaşımı kullanan YOLO26, NMS son işlemesini ortadan kaldıran yerel, NMS'siz bir başlık (
nms=False) sunar. Böylece Transformer'ın ağır hesaplama ek yükü olmadan RTDETRv2'nin kesin gecikme süresi sağlanır. - MuSGD Optimizatörü: Büyük dil modeli eğitim tekniklerinden (Moonshot AI'ın Kimi K2 modeli gibi) esinlenen YOLO26, SGD ile Muon'un bir birleşimini kullanır. Bu yaklaşım, ViT'lerde kullanılan standart AdamW uygulamalarına kıyasla benzersiz bir eğitim kararlılığı ve önemli ölçüde daha hızlı yakınsama süreleri sunar.
- ProgLoss + STAL: Bu gelişmiş kayıp fonksiyonları, RTDETRv2'nin çok ölçekli özellik avantajlarıyla doğrudan rekabet ederek küçük nesne tanımada kayda değer iyileştirmeler sağlar. Bu özellik, robotik otomasyon için kritik önem taşır.
- Uç Optimizasyonu ve DFL'nin Kaldırılması: YOLO26, Dağılım Odaklı Kaybı (DFL) kaldırarak çıktı başlığını yalınlaştırır ve %43'e kadar daha hızlı CPU çıkarımı sağlar; böylece ağır Transformer modellerine kıyasla uç cihazlarda çok daha kolay dağıtılabilir.
Ultralytics ile Eğitim Örneği#
Ultralytics Python API'sinin sunduğu basitlik, son teknoloji YOLO26 modelini yalnızca birkaç satır kodla eğitmene olanak tanır:
from ultralytics import YOLO
# Son derece verimli YOLO26 küçük modelini yükle
model = YOLO("yolo26s.pt")
# Modeli COCO8 veri kümesinde eğit
# Çerçeve, veri artırma ve optimizatör seçimini otomatik olarak yönetir
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")
# Dağıtım için TensorRT'ye zahmetsizce aktar
model.export(format="engine", dynamic=True)İdeal Kullanım Alanları#
Doğru mimariyi seçmek büyük ölçüde dağıtım kısıtlarına ve donanımın kullanılabilirliğine bağlıdır:
YOLOv7'yi değerlendirebileceğin durumlar:
- YOLOv7'nin yerleşik bir temel model olduğu eski araştırma projeleri.
- Ham GPU hızlandırma kaynaklarının bol olduğu ve NMS gecikme dalgalanmalarının kabul edilebilir olduğu ortamlar.
RTDETRv2'yi değerlendirmek için uygun durumlar:
- En yüksek mAP değerini gerektiren üst düzey sunucu dağıtımları.
- Transformer omurgasını destekleyecek yeterli VRAM'e sahip olman koşuluyla, kesin çıkarım gecikmesinin (NMS'siz çalışma) zorunlu olduğu senaryolar.
Ultralytics YOLO26'yı seçmek için uygun durumlar:
- Neredeyse her zaman. RTDETRv2'nin NMS'siz çalışmasının sağladığı kesinliği sunar, YOLOv7'nin hızını ve doğruluğunu aşar, çok daha az VRAM kullanır ve veri kümesi yönetimi, eğitim ve dağıtımı zahmetsiz hâle getirmek için Ultralytics Platformu ile tamamen entegredir.
Diğer mimarilerin performansını mı merak ediyorsun? YOLO11 ve YOLOv8 gibi önceki nesiller hakkındaki derinlemesine incelemelerimize göz atabilir veya projenin doğruluğunu en üst düzeye çıkarmak için hiperparametre ayarlama yöntemlerinden nasıl yararlanacağını öğrenebilirsin.