YOLOv8 ve RTDETRv2#
Bilgisayarlı görü alanı sürekli gelişiyor ve yeni mimariler, gerçek zamanlı nesne algılamada mümkün olanların sınırlarını zorluyor. Büyük ilgi gören iki önemli model, Ultralytics YOLOv8 ve Baidu'nun RTDETRv2 modelidir. Bu kılavuz, bu iki güçlü model arasında mimarilerini, performans ölçümlerini ve ideal dağıtım senaryolarını inceleyen kapsamlı bir teknik karşılaştırma sunar.
YOLOv8'e Genel Bakış#
Ultralytics YOLOv8, YOLO (Yalnızca Bir Kez Bak) model ailesinde önemli bir dönüm noktasını temsil eder. Yıllar süren temel araştırmalar üzerine inşa edilen model, çok çeşitli görevlerde olağanüstü hız, doğruluk ve kullanım kolaylığı sunar.
Temel Özellikler:
- Yazarlar: Glenn Jocher, Ayush Chaurasia ve Jing Qiu
- Kuruluş: Ultralytics
- Tarih: 10 Ocak 2023
- GitHub: Ultralytics Deposu
- Belgeler: YOLOv8 Belgeleri
Mimari ve Güçlü Yönler#
YOLOv8, hem özellik çıkarımını hem de sınırlayıcı kutu regresyonunu optimize eden yalınlaştırılmış bir mimari sunar. Bu model, tahmin başlığını basitleştiren ve eğitim sırasında gereken hiperparametre ayarlarının sayısını azaltan anchorsız bir algılayıcıdır. Bu mimari, çıkarım hızı ile ortalama kesinlik (mAP) arasında mükemmel bir performans dengesi sağlayarak modeli hem uç cihazlarda hem de bulut sunucularında gerçek dünya dağıtımları için son derece uygun hâle getirir.
Ayrıca YOLOv8, Transformer tabanlı mimarilere kıyasla eğitim sırasında önemli ölçüde daha düşük bellek gereksinimlerine ihtiyaç duyar. Bu sayede geliştiriciler, bellek yetersizliği hatalarıyla karşılaşmadan standart tüketici GPU'larında model eğitebilir.
Çok Yönlülük#
YOLOv8'in belirleyici güçlü yönlerinden biri, yerleşik çok yönlülüğüdür. Pek çok model yalnızca sınırlayıcı kutulara odaklanırken YOLOv8, nesne algılama, örnek bölütleme, görüntü sınıflandırma, poz tahmini ve yönlendirilmiş sınırlayıcı kutu (OBB) algılama için kullanıma hazır destek sunar.
RTDETRv2'ye Genel Bakış#
RTDETRv2 (Gerçek Zamanlı Algılama Transformer'ı sürüm 2), özgün RT-DETR üzerine inşa edilmiştir ve Vision Transformer'ların güçlü dikkat mekanizmalarını gerçek zamanlı nesne algılama uygulamalarına taşımayı amaçlar.
Temel Özellikler:
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
- Kuruluş: Baidu
- Tarih: 2024-07-24
- Arxiv: 2407.17140
- GitHub: RT-DETR Deposu
- Belgeler: RTDETRv2 README
Mimari ve Güçlü Yönler#
RTDETRv2, Evrişimli Sinir Ağı (CNN) omurgasını Transformer kodlayıcı-kod çözücü yapısıyla birleştiren hibrit bir mimariden yararlanır. Bu sayede model, öz-dikkat mekanizmaları aracılığıyla karmaşık uzamsal ilişkileri ve küresel bağlamı yakalayabilir. Bir dizi "bedava kazanım" eğitim stratejisinden yararlanan RTDETRv2, COCO veri kümesi gibi standart kıyaslama veri kümelerinde rekabetçi mAP skorları elde eder.
Zayıf yönler#
Yüksek doğruluğuna rağmen RTDETRv2'nin Transformer tabanlı yapısı, saf CNN mimarilerine kıyasla daha yüksek bellek tüketimine ve daha yavaş eğitim sürelerine yol açar. Transformer'lar doğaları gereği daha fazla VRAM gerektirir ve bu da kaynakları kısıtlı donanımlarda eğitilmelerini zorlaştırır. Ayrıca RTDETRv2 algılamada güçlü olsa da Ultralytics ekosisteminin yerleşik çok görevli çok yönlülüğünden (poz ve bölütleme gibi) yoksundur.
RTDETRv2 hakkında daha fazla bilgi edin
Performans Karşılaştırması#
Modelleri üretim için değerlendirirken model boyutu, çıkarım hızı ve doğruluk arasındaki denge büyük önem taşır. Aşağıdaki tablo, YOLOv8 ve RTDETRv2 varyantlarının doğrudan karşılaştırmasını sunar.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv8n | 640 | 37.3 | 80.4 | 1.47 | 3.2 | 8.7 |
| YOLOv8s | 640 | 44.9 | 128.4 | 2.66 | 11.2 | 28.6 |
| YOLOv8m | 640 | 50.2 | 234.7 | 5.86 | 25.9 | 78.9 |
| YOLOv8l | 640 | 52.9 | 375.2 | 9.06 | 43.7 | 165.2 |
| YOLOv8x | 640 | 53.9 | 479.1 | 14.37 | 68.2 | 257.8 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Hızlar bir Amazon EC2 P4d örneği kullanılarak ölçüldü. CPU çıkarımında ONNX, GPU hızlarının testinde ise TensorRT kullanıldı.
Kullanım Alanları ve Öneriler#
YOLOv8 ve RT-DETR arasındaki seçim, özel proje gereksinimlerine, dağıtım kısıtlamalarına ve ekosistem tercihlerine bağlıdır.
YOLOv8 Ne Zaman Seçilmeli?#
YOLOv8 şu durumlar için güçlü bir seçenektir:
- Çok Görevli Çok Yönlü Dağıtım: Ultralytics ekosistemi içinde algılama, segmentasyon, sınıflandırma ve poz tahmini için kendini kanıtlamış bir model gerektiren projeler.
- Kurulu Üretim Sistemleri: YOLOv8 mimarisi üzerine kurulmuş, kararlı ve kapsamlı biçimde test edilmiş dağıtım işlem hatlarına sahip mevcut üretim ortamları.
- Geniş Topluluk ve Ekosistem Desteği: YOLOv8'in kapsamlı eğitimlerinden, üçüncü taraf entegrasyonlarından ve aktif topluluk kaynaklarından yararlanan uygulamalar.
RT-DETR Ne Zaman Seçilmeli?#
RT-DETR şu durumlarda önerilir:
- Transformer Tabanlı Tespit Araştırması: NMS olmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
- Esnek Gecikmeyle Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en yüksek öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
- Büyük Nesne Tespiti: Transformer'ların küresel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.
Ultralytics (YOLO26) Ne Zaman Seçilmeli?#
Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi birleşimini sunar:
- NMS'siz Uç Dağıtımı: Maksimum Olmayan Bastırma son işleme karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
- Yalnızca CPU Kullanılan Ortamlar: Özel GPU hızlandırması olmayan ve YOLO26'nın %43'e varan daha hızlı CPU çıkarımının belirleyici bir avantaj sağladığı cihazlar.
- Küçük Nesne Algılama: ProgLoss ve STAL'ın küçük nesnelerde doğruluğu önemli ölçüde artırdığı hava drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.
Ultralytics Avantajı#
Model seçimi yalnızca ham ölçümlerin ötesine geçer; çevresindeki yazılım ekosistemi, geliştirici üretkenliği açısından kritik öneme sahiptir. Ultralytics ekosistemi, tüm makine öğrenimi yaşam döngüsünü basitleştiren birleşik bir Python API sunması ve kullanım kolaylığıyla tanınır.
Ultralytics, veri kümesi yönetiminden dağıtık eğitime kadar karmaşık hazır kodları soyutlar. Geliştiriciler, kullanıma hazır önceden eğitilmiş ağırlıklardan ve Hugging Face gibi platformlarla ve izleme araçlarıyla sorunsuz entegrasyondan yararlanır. İyi bakımı yapılan bu ekosistem; aktif geliştirmeyi, sık güncellemeleri ve güçlü topluluk desteğini garanti eder.
Ayrıca eğitim verimliliği, Ultralytics YOLO modellerinin ayırt edici özelliklerinden biridir. Bu modeller, eğitim süreci sırasında hızlı yakınsama ve daha düşük bellek kullanımı için büyük ölçüde optimize edilmiştir; bu da RTDETRv2 gibi Transformer tabanlı algılayıcılara kıyasla deneme döngülerini önemli ölçüde hızlandırır.
Geleceğe Bakış: YOLO26'nın Gücü#
YOLOv8 güçlü bir model olmaya devam etse de en ileri teknolojiyi arayan geliştiriciler, Ocak 2026'da yayımlanan ve büyük merakla beklenen YOLO26 sürümüne geçmeyi değerlendirmelidir. YOLO26, çığır açan çeşitli yeniliklerle en gelişmiş teknoloji standardını yeniden tanımlar:
- Uçtan Uca NMS'siz Tasarım: YOLO26, Maksimum Olmayan Bastırma (NMS) son işleme adımını ortadan kaldırarak daha hızlı ve daha deterministik dağıtım iş akışları sağlar.
- DFL'nin Kaldırılması: Distribution Focal Loss'un kaldırılması, modeli uç ve düşük güç tüketimli cihazlarla uyumluluk açısından yalınlaştırır.
- MuSGD Optimize Edicisi: LLM eğitimindeki yenilikleri entegre eden MuSGD optimize edicisi, daha kararlı eğitim çalıştırmaları ve daha hızlı yakınsama sağlar.
- %43'e Kadar Daha Hızlı CPU Çıkarımı: Özel GPU'ları olmayan ortamlar için büyük ölçüde optimize edilmiştir.
- ProgLoss + STAL: Bu gelişmiş kayıp işlevleri, hava görüntüleri ve robotik için kritik olan küçük nesne tanımada kayda değer iyileştirmeler sağlar.
Ultralytics paketi içinde keşfedilmeye değer diğer modern alternatifler arasında, eski projeler için güçlü performans sunan YOLO11 de bulunur; ancak tüm yeni dağıtımlar için YOLO26 önerilir.
Kod Örneği: Eğitim ve Çıkarım#
Ultralytics API'sinin basitliği, modelleri yalnızca birkaç satır Python koduyla yükleyebilmeni, eğitebilmeni ve dağıtabilmeni sağlar. Aşağıdaki örneği çalıştırmadan önce PyTorch kurulu olduğundan emin ol.
from ultralytics import YOLO
# Load a pretrained YOLOv8 small model
model = YOLO("yolov8s.pt")
# Train the model on your custom dataset
# Memory efficient training allows for larger batch sizes
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640, batch=16)
# Run inference on a test image
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()
# Export seamlessly for edge deployment
export_path = model.export(format="onnx")Ultralytics; ONNX, TensorRT ve CoreML dâhil olmak üzere çok sayıda formata tek tıklamayla dışa aktarmayı destekler ve farklı donanım mimarilerindeki model dağıtım seçeneklerini basitleştirir.
Sonuç#
Hem YOLOv8 hem de RTDETRv2, gerçek zamanlı nesne algılama için etkileyici yetenekler sunar. RTDETRv2, küresel bağlamı yakalamada Transformer'ların gücünü gösterir ve çıkarım hızı ile bellek yükünün birincil kısıtlar olmadığı karmaşık uzamsal akıl yürütme görevleri için uygundur.
Ancak hız, doğruluk ve kaynak verimliliği arasında olağanüstü bir dengeye öncelik veren geliştiriciler için Ultralytics YOLO modelleri üstün seçenek olmaya devam eder. YOLOv8'in hafif yapısı; benzersiz kullanım kolaylığı, birden çok görü görevi genelindeki çok yönlülüğü ve gelişen açık kaynak ekosistemiyle birleşerek modeli ölçeklenebilir üretim ortamları için başvurulacak çözüm hâline getirir. Uç performansının zirvesini arayanlar için yeni yayımlanan YOLO26, sektörde liderliğini sürdürmesini sağlayan benzersiz NMS'siz verimlilik sunar.