RTDETRv2 ve YOLOv8#
Bilgisayarlı görü dünyası sürekli değişiyor; bu değişim çoğu zaman geleneksel Evrişimli Sinir Ağları (CNNs) ile daha yeni Transformer tabanlı mimariler arasındaki süregelen rekabetle öne çıkıyor. Bu kapsamlı teknik karşılaştırmada, önde gelen bir görsel Transformer olan RTDETRv2 ile sektörde en yaygın kullanılan ve çok yönlü CNN modellerinden biri olan Ultralytics YOLOv8'in performansını karşılaştırıyoruz. Her iki model de mühendisler ve araştırmacılar için güçlü yetenekler sunuyor, ancak temel mimarileri eğitim yöntemleri, dağıtım kısıtlamaları ve genel performans açısından belirgin farklılıklara yol açıyor.
Model Genel Bakışı: RTDETRv2#
RTDETRv2 (Gerçek Zamanlı Tespit Transformer'ı sürüm 2), görsel Transformer mimarisini gerçek zamanlı çıkarım hızları için optimize ederek önceki sürümünün temel başarısını ileriye taşır.
Temel Teknik Ayrıntılar:
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
- Kuruluş: Baidu
- Tarih: 2024-07-24
- Bağlantılar: ArXiv Yayını | GitHub Deposu
Mimari ve Güçlü Yönler#
RTDETRv2'nin temelinde, bir CNN omurgasını Transformer kodlayıcı-kod çözücü yapısıyla birleştiren hibrit bir mimari bulunur. Bu yapı, modelin görüntünün tamamını bağlamsal olarak incelemesini sağlayarak örtüşen nesnelerin bulunduğu karmaşık sahneleri ele almada son derece başarılı olmasını sağlar. En belirgin özelliklerinden biri, Maksimum Olmayan Bastırma (NMS) son işleme adımını tamamen devre dışı bırakan yerel uçtan uca tasarımıdır. Bu, tespit işlem hattının son aşamalarındaki algoritmik karmaşıklığı azaltır. Ayrıca çok ölçekli tespit yetenekleri, hem devasa yapıları hem de arka plandaki küçük unsurları etkili bir şekilde belirlemesini sağlar.
Zayıf yönler#
Güçlü bağlamsal kavrayışına rağmen RTDETRv2 gibi Transformer tabanlı mimariler, eğitim sırasında çok yüksek hesaplama maliyeti gerektirir. Önemli miktarda CUDA belleğine ihtiyaç duyduklarından tüketici sınıfı donanımlarda eğitilmeleri zordur. Ayrıca özel bir veri kümesi oluşturmak ve eğitim hiperparametrelerini ayarlamak, modelin son derece iyi geliştirilmiş ve yeni başlayanlara uygun bir yazılım sarmalayıcısı olmaması nedeniyle genellikle derin alan uzmanlığı gerektirir. Eski Raspberry Pi donanımı gibi düşük güçlü uç cihazlara dağıtım da ağır dikkat mekanizmaları nedeniyle zorlayıcı olabilir.
RTDETRv2 hakkında daha fazla bilgi edin
Model Genel Bakışı: YOLOv8#
Yayımlandığı günden bu yana Ultralytics YOLOv8, üst düzey doğruluğun yanı sıra kusursuz bir geliştirici deneyimine öncelik vererek üretim kalitesindeki bilgisayarlı görü görevlerinde sektör standardı hâline geldi.
Temel Teknik Ayrıntılar:
- Yazarlar: Glenn Jocher, Ayush Chaurasia ve Jing Qiu
- Kuruluş: Ultralytics
- Tarih: 10 Ocak 2023
- Bağlantılar: Resmî Dokümantasyon | GitHub Deposu
Mimari ve Güçlü Yönler#
YOLOv8, önceki nesillere kıyasla nesne konumlandırma ve sınıflandırma doğruluğunu önemli ölçüde artıran, ayrıştırılmış başlığa sahip yüksek düzeyde optimize edilmiş anchorsız bir CNN mimarisi kullanır. En büyük gücü, olağanüstü verimliliği ve çok yönlülüğünde yatar. Mimarinin eğitim sırasında görsel Transformer'lara kıyasla çok daha az belleğe ihtiyaç duyması, uygulayıcıların standart GPU'larda daha büyük toplu iş boyutları kullanmasına olanak tanır. Ayrıca Ultralytics ekosistemi, eşsiz ve sorunsuz bir iş akışı sunar. Birleşik Python API'si, yalnızca birkaç satır kodla hiperparametre ayarlama, eğitim, doğrulama ve dışa aktarma işlemlerini mümkün kılar.
Zayıf yönler#
YOLOv8, son işleme aşamasında geleneksel NMS'ye dayanır. Ultralytics motoru bunu arka planda verimli bir şekilde gerçekleştirse de bu durum, yerel olarak NMS'siz mimarilerle karşılaştırıldığında teknik olarak son işlem gecikmesine neden olur.
Performans ve Metrik Karşılaştırması#
Ham sayılar karşılaştırıldığında, her iki modelin de dağıtım işlem hattının farklı yönlerine öncelik verdiği görülür. Aşağıda yan yana bir performans analizi yer alıyor.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
RTDETRv2-x, YOLOv8x'in 53,9 değerine kıyasla 54,3 ile marjinal olarak daha yüksek bir en yüksek mAP değerine ulaşsa da YOLOv8 serisi çıkarım hızı ve parametre verimliliğinde öne çıkar. Örneğin YOLOv8s, bir TensorRT motorunda RTDETRv2-s'ye kıyasla neredeyse iki kat daha hızlı çalışırken yaklaşık yarısı kadar parametre gerektirir.
Bellek Gereksinimleri ve Eğitim Verimliliği#
Hem bağımsız geliştiriciler hem de kurumsal ekipler için en kritik faktörlerden biri eğitim maliyetidir. Ultralytics YOLO modelleri, eğitim süreci sırasında Transformer mimarilerine kıyasla önemli ölçüde daha az CUDA belleği gerektirir. Standart bir RTDETRv2 modeli, tüketici tipi bir GPU'da kolayca darboğaz oluşturabilirken YOLOv8, NVIDIA RTX 4070 gibi donanımlarda hızlı ve güvenilir bir şekilde yakınsar.
Ekosistem, API ve Kullanım Kolaylığı#
Modern yapay zekâ çözümlerini gerçekten farklılaştıran unsur, onları destekleyen yazılım çerçevesidir. Ultralytics ekosistemi, karmaşık mühendislik engellerini basitleştirir. Discord gibi platformlarda aktif geliştirme ve güçlü topluluk desteği sayesinde YOLOv8, projenin yetersiz dokümantasyon nedeniyle duraksamamasını sağlar.
Ayrıca YOLOv8, standart nesne tespitinin ötesine geçer. Örnek Segmentasyonu, Poz Tahmini, Görüntü Sınıflandırma ve Yönlendirilmiş Sınırlayıcı Kutular (OBB) için yerel destek sunan gerçek bir çok görevli ağdır. RTDETRv2 ise büyük ölçüde yalnızca tespite odaklanır.
Kod Örneği: Birleşik Sadelik#
Ultralytics Python API'sini kullanarak her iki model ailesiyle de birleşik bir ortamda sorunsuz bir şekilde denemeler yapabilirsin.
from ultralytics import RTDETR, YOLO
# Load an RT-DETR model and a YOLOv8 model seamlessly
model_transformer = RTDETR("rtdetr-l.pt")
model_cnn = YOLO("yolov8l.pt")
# Predict on a sample image using the exact same API
results_transformer = model_transformer("https://ultralytics.com/images/bus.jpg")
results_cnn = model_cnn("https://ultralytics.com/images/bus.jpg")
# Export YOLOv8 to ONNX for rapid edge deployment
model_cnn.export(format="onnx")Eğitildikten sonra YOLOv8, ONNX, TensorRT ve OpenVINO formatlarına tek tıklamayla dışa aktarmayı destekleyerek farklı donanım arka uçlarında yüksek aktarım hızlı çıkarımı garanti eder.
Kullanım Alanları ve Öneriler#
RT-DETR ve YOLOv8 arasında seçim yapmak, özel proje gereksinimlerine, dağıtım kısıtlamalarına ve ekosistem tercihlerine bağlıdır.
RT-DETR Ne Zaman Seçilmeli?#
RT-DETR şu durumlar için güçlü bir seçenektir:
- Transformer Tabanlı Tespit Araştırması: NMS olmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
- Esnek Gecikmeyle Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en yüksek öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
- Büyük Nesne Tespiti: Transformer'ların küresel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.
YOLOv8 Ne Zaman Seçilmeli?#
YOLOv8 şu durumlarda önerilir:
- Çok Görevli Çok Yönlü Dağıtım: Ultralytics ekosistemi içinde algılama, segmentasyon, sınıflandırma ve poz tahmini için kendini kanıtlamış bir model gerektiren projeler.
- Kurulu Üretim Sistemleri: YOLOv8 mimarisi üzerine kurulmuş, kararlı ve kapsamlı biçimde test edilmiş dağıtım işlem hatlarına sahip mevcut üretim ortamları.
- Geniş Topluluk ve Ekosistem Desteği: YOLOv8'in kapsamlı eğitimlerinden, üçüncü taraf entegrasyonlarından ve aktif topluluk kaynaklarından yararlanan uygulamalar.
Ultralytics (YOLO26) Ne Zaman Seçilmeli?#
Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi birleşimini sunar:
- NMS'siz Uç Dağıtımı: Maksimum Olmayan Bastırma son işleme karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
- Yalnızca CPU Kullanılan Ortamlar: Özel GPU hızlandırması olmayan ve YOLO26'nın %43'e varan daha hızlı CPU çıkarımının belirleyici bir avantaj sağladığı cihazlar.
- Küçük Nesne Algılama: ProgLoss ve STAL'ın küçük nesnelerde doğruluğu önemli ölçüde artırdığı hava drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.
Geleceğe Bakış: YOLO26'nın Avantajı#
YOLOv8 efsanevi bir dönüm noktası olmaya devam etse de bilgisayarlı görü inanılmaz bir hızla ilerliyor. 2026'da en ileri teknolojiyi arayan ekipler için Ultralytics YOLO26, bir sonraki paradigma değişimini temsil ediyor.
RTDETRv2'nin NMS'siz tasarımı ilgini çekiyorsa YOLO26, yerel Uçtan Uca NMS'siz Tasarım özelliğini kullanarak Transformer'ların son işlem basitliğini CNN'lerin yüksek hızıyla birleştirir. Ayrıca YOLO26, çığır açan MuSGD Optimizasyonu ile LLM tarzı eğitim kararlılığını görsel modellere taşıyarak son derece hızlı yakınsama sağlar. DFL Kaldırma ile (basitleştirilmiş dışa aktarma ve uç/düşük güçlü cihazlarla daha iyi uyumluluk için Distribution Focal Loss kaldırılmıştır) YOLO26, %43'e kadar daha hızlı CPU çıkarımı elde eder. Üstün küçük nesne tespiti için gelişmiş ProgLoss + STAL mekanizmalarıyla bir araya geldiğinde YOLO26, hem YOLOv8 hem de RTDETRv2 için kesinlikle önerilen yükseltme yoludur.
Alternatif modeller hakkında daha fazla bilgi edinmek için YOLO11 rehberlerimizi inceleyebilir veya NMS'siz mimarinin YOLO ailesinde nasıl geliştiğini görmek için YOLOv10 ve YOLOv8 arasındaki ayrıntılı karşılaştırmayı okuyabilirsin.