YOLOv7 ve RTDETRv2#
Bilgisayarlı görü alanı, Evrişimli Sinir Ağları (CNN'ler) ile Görsel Transformer'lar (ViT'ler) arasındaki rekabetin güçlü etkisiyle hızla gelişmeye devam ediyor. Bu teknik karşılaştırma, iki güçlü mimariyi inceliyor: yüksek düzeyde optimize edilmiş CNN tabanlı nesne algılama modeli YOLOv7 ve son teknoloji Gerçek Zamanlı Algılama Transformer'ı olan RTDETRv2.
Geliştiriciler, mimari farklılıklarını, performans metriklerini ve ideal dağıtım senaryolarını analiz ederek bu görsel yapay zekâ modellerini üretim iş akışlarına entegre ederken bilinçli kararlar verebilir.
YOLOv7: Ücretsiz Avantajlar CNN Mimarisi#
YOLOv7, geleneksel YOLO ailesine çeşitli paradigma değiştiren yapısal optimizasyonlar getirerek bir dizi "eğitilebilir ücretsiz avantaj" aracılığıyla gerçek zamanlı nesne algılamanın sınırlarını zorladı.
Temel Özellikler:
- Yazarlar: Chien-Yao Wang, Alexey Bochkovskiy, Hong-Yuan Mark Liao
- Kuruluş: Institute of Information Science, Academia Sinica
- Tarih: 2022-07-06
- Arxiv: https://arxiv.org/abs/2207.02696
- GitHub: WongKinYiu/yolov7
Mimari ve Güçlü Yönler#
YOLOv7 gücünü Extended Efficient Layer Aggregation Network (E-ELAN) mimarisinden alır. Bu yapısal tasarım, özgün gradyan yolunu bozmadan modelin daha çeşitli özellikler öğrenmesini sağlar. Ayrıca doğruluğu düşürmeden çıkarım hızını optimize eden planlı yeniden parametreleştirilmiş evrişimler içerir. Eğitilebilir ücretsiz avantaj yaklaşımı, hız ve doğruluk arasında etkileyici dengeler kurmasını sağlayarak sunucu sınıfı GPU'larda gerçek zamanlı nesne algılama görevleri için son derece uygun hale getirir.
YOLOv7 aynı zamanda son derece çok yönlüdür. Standart sınırlayıcı kutu algılamanın ötesinde depo, poz tahmini ve örnek bölütleme için dallar sunarak uyarlanabilirliğini gösterir.
Sınırlamalar#
Birçok eski CNN modeli gibi YOLOv7 de son işleme için Maksimum olmayan bastırmaya (NMS) dayanır. NMS, özellikle kalabalık sahnelerde değişken gecikmeye neden olur ve uç cihazlarda katı gerçek zamanlı garantileri karmaşıklaştırabilir.
YOLOv7 hakkında daha fazla bilgi edin
RTDETRv2: Gerçek Zamanlı Transformer'ları İleriye Taşımak#
RTDETRv2, özgün RT-DETR çerçevesi üzerine inşa edilerek transformer'ların yüksek uzamsal doğruluğu korurken gerçek zamanlı gecikme açısından YOLO mimarileriyle rekabet edebileceğini daha da ortaya koyar.
Temel Özellikler:
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang, Yi Liu
- Kuruluş: Baidu
- Tarih: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
Mimari ve Güçlü Yönler#
RTDETRv2, Görsel Transformer'lar için önemli bir ilerlemeyi temsil eder. Çok ölçekli özellikleri hızlıca işlemek için esnek bir sorgu seçimi sürecinden ve verimli bir hibrit kodlayıcıdan yararlanır. Özellikle Algılama Transformer'larına (DETR'ler) göre uyarlanmış yeni bir "ücretsiz avantajlar" yaklaşımı sunarak uzamsal akıl yürütmenin sınırlarını zorlar. Yerel olarak NMS içermediği için, zorlu akıllı şehir uygulamaları ve otonom sürüş için kritik bir özellik olan deterministik çıkarım süreleri sağlar.
Sınırlamalar#
İlerlemelerine rağmen RTDETRv2, transformer tabanlı mimarilerin geleneksel yüklerini taşır. CNN'lere kıyasla hem eğitim hem de çıkarım sırasında önemli ölçüde daha fazla CUDA belleği gerektirir. Ayrıca eğitim yakınsama süreleri belirgin biçimde daha uzundur; bu nedenle yüksek kaliteli anotasyonlu büyük miktarda veriye (örneğin COCO veri kümesi) ve yoğun hesaplama kaynaklarına ihtiyaç duyar.
RTDETRv2 hakkında daha fazla bilgi edin
Performans Karşılaştırması#
Bu modelleri kıyaslarken kesinlik, ham çıkarım hızı ve hesaplama ayak izi dahil olmak üzere bütünsel bir tabloya bakmalıyız. Aşağıda doğrudan bir karşılaştırma tablosu yer alıyor.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2-x mutlak olarak en yüksek mAPval değerini %54,3 olarak iddia etse de 259 milyar FLOP gerektirir. Buna karşılık YOLOv7 mimarileri mükemmel bir temel sunar, ancak saf ağ gecikmesi metriklerinde tam olarak yakalanmayan eski NMS ek yükünden olumsuz etkilenir.
Ultralytics Avantajı: Ekosistem ve Evrim#
YOLOv7 ve RTDETRv2 güçlü yetenekler sunsa da bunları üretim ortamlarında dağıtmak çoğu zaman lojistik sorunları ortaya çıkarır. Ultralytics ekosistemi tam da bu noktada öne çıkar. Sorunsuz uçtan uca entegrasyon için tasarlanan Ultralytics çerçevesi, bilgisayarlı görü iş akışlarının tipik karmaşıklıklarını soyutlayan birleşik bir API ile geliştiricilere destek olur.
Eşsiz Çok Yönlülük ve Bellek Verimliliği#
Büyük miktarda VRAM tüketen katı transformer modellerinin aksine Ultralytics YOLO modelleri yüksek bellek verimliliğini korur. Bu, erişilebilir donanımlarda hızlı model eğitimi yapılmasını sağlar. Ekosistem, tek bir kod tabanından görüntü sınıflandırma ve yönlendirilmiş sınırlayıcı kutu (OBB) algılama dahil olmak üzere birden çok bilgisayarlı görü görevini doğal olarak destekler ve RTDETRv2'nin şu anda sahip olmadığı bir esneklik sunar.
Sorunsuz Dağıtım#
Araştırmadan üretime geçiş, güçlü dağıtım seçenekleri gerektirir. Ultralytics API, endüstri standardı biçimlere tek tıklamayla model dışa aktarma işlemini yerel olarak yönetir. Platformlar arası uyumluluk için ONNX veya en yüksek GPU hızlandırması için TensorRT hedefliyor ol, işlem hattı tamamen otomatik ve güvenilirdir.
En Büyük Yükseltme: Ultralytics YOLO26#
YOLOv7 ve RTDETRv2 arasında karar vermeye çalışan geliştiriciler için ilerlemenin en iyi yolu aslında görsel yapay zekâdaki yeni standart olan Ultralytics YOLO26'dır. Ocak 2026'da yayımlanan YOLO26, CNN'lerin hızını transformer'ların gelişmiş akıl yürütme yeteneğiyle birleştirirken her ikisinin de zayıflıklarını tamamen ortadan kaldırır.
YOLO26, hem sunucu hem de uç dağıtımları için tasarlanmış çığır açan yenilikler sunar:
- Uçtan Uca NMS'siz Tasarım: İlk olarak YOLOv10 ile ortaya konan YOLO26, NMS son işlemesini yerel olarak ortadan kaldırır. Bu, transformer'ın ağır hesaplama ek yükü olmadan RTDETRv2'nin deterministik gecikmesini sağlar.
- MuSGD Optimize Edicisi: Büyük dil modeli eğitim tekniklerinden (Moonshot AI'ın Kimi K2'si gibi) ilham alan YOLO26, SGD ve Muon'un bir hibritini kullanır. Bu yaklaşım, ViT'lerde kullanılan standart AdamW uygulamalarına kıyasla benzeri görülmemiş eğitim kararlılığı ve önemli ölçüde daha hızlı yakınsama süreleri sağlar.
- ProgLoss + STAL: Bu gelişmiş kayıp işlevleri, RTDETRv2'nin çok ölçekli özellik avantajlarıyla doğrudan rekabet ederek küçük nesne tanımada dikkate değer iyileştirmeler sağlar; bu da robotik otomasyon için kritik öneme sahiptir.
- Uç Optimizasyonu ve DFL'nin Kaldırılması: Dağılım Odaklı Kaybın (DFL) kaldırılması, çıktı başlığını sadeleştirerek CPU çıkarımında %43'e kadar daha yüksek hız sağlar ve YOLO26'yı ağır transformer modellerine kıyasla uç cihazlarda sonsuz derecede daha kolay dağıtılabilir hale getirir.
Ultralytics ile Eğitim Örneği#
Ultralytics Python API'sinin basitliği, son teknoloji YOLO26 modelini yalnızca birkaç satır kodla eğitmene olanak tanır:
from ultralytics import YOLO
# Load the highly efficient YOLO26 small model
model = YOLO("yolo26s.pt")
# Train the model on the COCO8 dataset
# The framework automatically manages data augmentation and hyperparameter tuning
results = model.train(data="coco8.yaml", epochs=100, imgsz=640, device="0")
# Effortlessly export to TensorRT for deployment
model.export(format="engine", dynamic=True)İdeal Kullanım Alanları#
Doğru mimariyi seçmek büyük ölçüde dağıtım kısıtlarına ve donanım kullanılabilirliğine bağlıdır:
YOLOv7'yi ne zaman değerlendirmelisin:
- YOLOv7'nin yerleşik bir temel olduğu eski araştırma projeleri.
- Ham GPU hızlandırmasının bol olduğu ve NMS gecikme dalgalanmasının kabul edilebilir olduğu ortamlar.
RTDETRv2 ne zaman değerlendirilmeli:
- Mutlak olarak en yüksek mAP değerini gerektiren üst düzey sunucu dağıtımları.
- Transformer omurgasını destekleyecek yeterli VRAM'e sahip olman koşuluyla deterministik çıkarım gecikmesinin (NMS'siz) kesinlikle gerekli olduğu senaryolar.
Ultralytics YOLO26 ne zaman seçilmeli:
- Neredeyse her zaman. RTDETRv2'nin NMS'siz determinizmini sunar, YOLOv7'nin hızını ve doğruluğunu aşar, önemli ölçüde daha az VRAM kullanır ve sorunsuz veri kümesi yönetimi, eğitim ve dağıtım için Ultralytics Platformu ile tamamen entegredir.
Diğer mimarilerin nasıl karşılaştırıldığını merak ediyor musun? YOLO11 ve YOLOv8 gibi önceki nesillere ilişkin kapsamlı incelemelerimizi keşfet veya projenin doğruluğunu en üst düzeye çıkarmak için hiperparametre ayarlamadan nasıl yararlanacağını öğren.