RTDETRv2 ile YOLOv6-3.0#
Bilgisayarlı görü alanı sürekli gelişiyor ve geliştiricilere nesne algılama için çok sayıda mimari seçeneği sunuyor. Farklı yaklaşımları temsil eden iki önemli model, son teknoloji bir görsel transformer olan RTDETRv2 ve endüstriyel uygulamalara yönelik, yüksek düzeyde optimize edilmiş bir Evrişimli Sinir Ağıdır (CNN): YOLOv6-3.0.
Bu kapsamlı teknik karşılaştırmada modellerin mimarileri, performans metrikleri ve ideal dağıtım senaryoları inceleniyor. Ayrıca daha geniş Ultralytics ekosisteminin nasıl daha üstün bir geliştirici deneyimi sunduğunu ve yeni nesil Ultralytics YOLO26 özelliklerinin neler getirdiğini ele alacağız.
RTDETRv2: Görsel Transformer Yaklaşımı#
Baidu'daki araştırmacılar tarafından geliştirilen RTDETRv2, orijinal RT-DETR'nin temelini ileri taşıyarak Transformer tabanlı nesne algılamada önemli bir sıçramayı temsil ediyor.
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
- Kurum: Baidu
- Tarih: 2024-07-24
- Arxiv: 2407.17140
- GitHub: lyuwenyu/RT-DETR
- Belgeler: RTDETRv2 GitHub README
Mimari Öne Çıkanlar#
RTDETRv2, CNN özellik çıkarıcısını güçlü bir Transformer kod çözücüyle birleştiren hibrit bir mimari kullanır. Bu modelin en belirgin özelliği, yerleşik olarak NMS gerektirmeyen tasarımıdır. Son işlem sırasında Maksimum Olmayan Bastırma'yı (NMS) ortadan kaldıran model, sınırlayıcı kutuları doğrudan tahmin eder; böylece dağıtım basitleşir ve çıkarım gecikmesi kararlı hale gelir.
RTDETRv2'ye dahil edilen "Bedava Kazanımlar", karmaşık sahneleri ve üst üste binen nesneleri işleme becerisini artırır; çünkü global dikkat mekanizmaları uzamsal ilişkileri, yerel evrişimlerden daha iyi kavrar.
Transformer'lar karmaşık sahneleri anlamada başarılı olsa da eğitim sırasında genellikle CNN'lere kıyasla çok daha fazla CUDA belleği gerektirir. Bu durum standart tüketici GPU'larında toplu iş boyutlarını sınırlayabilir ve toplam eğitim süresini artırabilir.
RTDETRv2 hakkında daha fazla bilgi edin
YOLOv6-3.0: Endüstriyel Verimi En Üst Düzeye Çıkarma#
Meituan'daki Vision AI Departmanı tarafından geliştirilen YOLOv6-3.0, GPU veriminin son derece önemli olduğu endüstriyel işlem hatları için yeni nesil bir algılayıcı olarak hizmet vermek üzere özel olarak tasarlandı.
- Yazarlar: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu ve Xiangxiang Chu
- Kuruluş: Meituan
- Tarih: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Mimari Odak Noktası#
YOLOv6-3.0, NVIDIA GPU'ları gibi donanım hızlandırıcılarındaki bellek erişim maliyetlerini en aza indirmek için özenle tasarlanmış bir EfficientRep omurgasına dayanır. Boyun mimarisi, farklı ölçeklerde özellik birleştirmeyi iyileştirmek için Çift Yönlü Birleştirme (BiC) modülü içerir.
Eğitim sırasında, bağlantı noktası tabanlı yaklaşımlardan yararlanırken daha hızlı yürütme için çıkarım aşamasında bağlantı noktası kullanmayan bir modu koruyan Anchor-Aided Training (AAT) stratejisinden yararlanır. Sunucu sınıfı GPU'larda (ör. T4, A100) olağanüstü verim sunsa da özel mimarisi, yalnızca CPU kullanan uç cihazlarda ideal olmayan bir gecikmeye yol açabilir.
YOLOv6 hakkında daha fazla bilgi edin
Performans Karşılaştırması#
Üretim ortamında kullanılacak modelleri değerlendirirken doğruluğu (mAP), çıkarım hızı ve hesaplama maliyetiyle (FLOPs) dengelemek kritik önem taşır. Aşağıdaki tablo, bu modellerin birbirleriyle karşılaştırmasını gösteriyor.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
YOLOv6-3.0, TensorRT'de ham işlem hızı açısından öne çıkarken RTDETRv2 daha yüksek mAP puanlarına ulaşır ve özellikle daha büyük model çeşitlerinde daha iyi ölçeklenir. Ancak her iki model de modern, birleşik çerçevelerin sunduğu kapsamlı esneklikten yoksundur. YOLOv6-3.0 öncelikli olarak bir algılama uzmanıdır ve kutudan çıktığı haliyle örnek segmentasyonu ve poz tahmini gibi görevleri yerel olarak desteklemez.
Kullanım Alanları ve Öneriler#
RT-DETR ile YOLOv6 arasında seçim yapmak, projene özgü gereksinimlere, dağıtım kısıtlamalarına ve ekosistem tercihlerine bağlıdır.
RT-DETR Ne Zaman Seçilmeli?#
RT-DETR şu durumlar için güçlü bir seçenektir:
- Transformer Tabanlı Tespit Araştırmaları: NMS kullanmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
- Gecikme Esnekliğinin Olduğu Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en önemli öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
- Büyük Nesne Tespiti: Transformer'ların genel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.
YOLOv6'yı Ne Zaman Seçmeli?#
YOLOv6 şu durumlarda önerilir:
- Endüstriyel Donanımı Dikkate Alan Dağıtım: Modelin donanımı dikkate alan tasarımının ve verimli yeniden parametreleştirmesinin belirli hedef donanımlarda performans optimizasyonu sağladığı senaryolar.
- Hızlı Tek Aşamalı Algılama: Kontrollü ortamlarda gerçek zamanlı video işleme için GPU'da ham çıkarım hızına öncelik veren uygulamalar.
- Meituan Ekosistemi Entegrasyonu: Teknoloji yığını ve dağıtım altyapısı olarak hâlihazırda Meituan'ın sistemlerini kullanan ekipler.
Ultralytics'i (YOLO26) Ne Zaman Seçmeli#
Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi bileşimini sunar:
- NMS Olmadan Uç Dağıtımı: Maksimum Olmayan Bastırma son işleminin karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
- Yalnızca CPU Kullanılan Ortamlar: YOLO26'nın CPU'da %43'e varan daha hızlı çıkarımının belirleyici bir avantaj sağladığı, özel GPU hızlandırması bulunmayan cihazlar.
- Küçük Nesne Algılama: ProgLoss ve STAL'ın çok küçük nesnelerde doğruluğu önemli ölçüde artırdığı havadan drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.
Ultralytics Avantajı#
Doğru modeli seçmek, yalnızca ham kıyaslama sonuçlarından ibaret değildir; geliştirici deneyimi, dağıtım esnekliği ve ekosistem desteği de aynı derecede önemlidir. Ultralytics platformuna entegre edilmiş modelleri kullanan kullanıcılar, statik araştırma depolarına kıyasla önemli avantajlar elde eder.
- Kullanım Kolaylığı:
ultralyticsPython paketi, sorunsuz bir API sunar. Modelleri eğitmek, doğrulamak ve dışa aktarmak yalnızca birkaç satır kod gerektirir. - İyi Bakımı Yapılan Ekosistem: Yalıtılmış akademik depoların aksine Ultralytics Platformu etkin biçimde güncellenir. ONNX, OpenVINO ve CoreML gibi araçlarla sağlam entegrasyonlar sunar.
- Eğitim Verimliliği: Ultralytics modelleri, eğitim sırasında genellikle RTDETRv2 gibi Transformer mimarilerine kıyasla çok daha az VRAM kullanır. Böylece tüketici sınıfı donanımlarda daha büyük toplu iş boyutlarına olanak tanır.
- Esneklik: YOLOv6-3.0'ın odaklı kapsamının aksine Ultralytics modelleri çok görevlidir; tek bir birleşik çerçevede segmentasyonu, görüntü sınıflandırmasını ve yönlendirilmiş sınırlayıcı kutuları (OBB) yerel olarak destekler.
Ultralytics CLI'yi kullanarak eğitilmiş bir modeli uç dağıtımı için dışa aktarmak şu komutu çalıştırmak kadar kolaydır: yolo export model=yolo11n.pt format=tensorrt.
YOLO26 ile Tanış: Nihai Çözüm#
RTDETRv2 ve YOLOv6-3.0 belirli avantajlar sunsa da alan hızla ilerliyor. Yeni bilgisayarlı görü projelerine başlayan ekipler için Ultralytics tarafından Ocak 2026'da yayımlanan YOLO26 modelini özellikle öneriyoruz.
YOLO26, endüstriyel CNN'lerin ve modern Transformer'ların güçlü yönlerini bir araya getirirken her ikisinin de zayıflıklarını ortadan kaldırır:
- Uçtan Uca, NMS Gerektirmeyen Tasarım: İlk kez YOLOv10 ile sunulan çığır açıcı yaklaşımı benimseyen YOLO26, NMS son işlemesini ortadan kaldıran isteğe bağlı, NMS gerektirmeyen bir başlık (
nms=False) sunar. Böylece çok daha düşük ek yükle RTDETRv2'ye benzer, kararlı ve öngörülebilir bir dağıtım sağlar. - MuSGD Optimize Edici: Moonshot AI'ın Kimi K2'si gibi gelişmiş LLM eğitim tekniklerinden esinlenen bu hibrit optimize edici, kararlı eğitim ve daha hızlı yakınsama sağlayarak geleneksel görsel Transformer'ların bilinen kararsızlığını giderir.
- Uç Cihazlar İçin Optimize Edildi: Önceki nesillere kıyasla CPU çıkarımını %43'e kadar hızlandıran ve Distribution Focal Loss'u (DFL) stratejik olarak kaldıran YOLO26, GPU hızlandırmasının bulunmadığı mobil ve IoT cihazları için son derece uygundur.
- ProgLoss + STAL: Bu gelişmiş kayıp işlevleri, CNN'ler için tarihsel bir zorluk olan küçük nesneleri tanımada kayda değer iyileşmeler sağlar. Bu da YOLO26'yı hava görüntüleri ve robotik uygulamalar için ideal hale getirir.
Eğitim Örneği#
Sezgisel Ultralytics API'si, en yeni modelleri sorunsuz biçimde eğitmene olanak tanır. Aşağıda, COCO8 veri kümesinde YOLO26 Nano modelinin nasıl eğitileceğini gösteren çalıştırılabilir bir örnek bulunuyor:
from ultralytics import YOLO
# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")
# Export the trained model to ONNX format for production
model.export(format="onnx")Özet#
RTDETRv2 ile YOLOv6-3.0'ı karşılaştırırken karar büyük ölçüde kullandığın donanıma ve gecikme kısıtlamalarına bağlıdır. RTDETRv2, karmaşık ve üst üste binen nesneleri işlemenin kritik olduğu araştırma ortamlarında ve sunucu tarafı işlemede öne çıkar. YOLOv6-3.0 ise güçlü NVIDIA GPU'larıyla donatılmış, yüksek verimli üretim hatları için güçlü bir seçenek olmayı sürdürür.
Ancak Transformer'ların NMS gerektirmeyen zarif yapısını CNN'lerin olağanüstü hızı ve düşük bellek kullanımıyla birleştiren her iki dünyanın da en iyisini arayan geliştiriciler için YOLO26 rakipsizdir. Ultralytics ekosisteminin kapsamlı belgeleri ve etkin topluluğu tarafından desteklenen YOLO26, görsel yapay zekâ projelerinin sağlam, ölçeklenebilir ve geleceğe hazır olmasını sağlar.