RTDETRv2 ve YOLOv6-3.0#
Bilgisayarlı görü dünyası sürekli gelişiyor ve geliştiricilere nesne algılama için çok çeşitli mimari seçenekler sunuyor. Farklı yaklaşımları temsil eden iki öne çıkan model RTDETRv2, son teknoloji bir görsel Transformer, ve endüstriyel uygulamalar için uyarlanmış, yüksek düzeyde optimize edilmiş bir Evrişimli Sinir Ağı (CNN) olan YOLOv6-3.0'dır.
Bu kapsamlı teknik karşılaştırma, ilgili mimarilerini, performans ölçümlerini ve ideal dağıtım senaryolarını inceliyor. Ayrıca daha geniş Ultralytics ekosisteminin nasıl üstün bir geliştirici deneyimi sunduğunu ve nihayetinde Ultralytics YOLO26 ile gelecek nesil yeteneklere nasıl baktığını da ele alacağız.
RTDETRv2: Vision Transformer yaklaşımı#
Baidu'daki araştırmacılar tarafından geliştirilen RTDETRv2, özgün RT-DETR'ın temelini geliştirerek Transformer tabanlı nesne algılamada önemli bir ilerlemeyi temsil ediyor.
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
- Kuruluş: Baidu
- Tarih: 2024-07-24
- Arxiv: 2407.17140
- GitHub: lyuwenyu/RT-DETR
- Belgeler: RTDETRv2 GitHub README
Mimari Öne Çıkanlar#
RTDETRv2, bir CNN özellik çıkarıcıyı güçlü bir Transformer kod çözücüyle birleştiren hibrit bir mimari kullanır. Bu modelin en belirleyici özelliği, yerel olarak NMS'siz tasarımıdır. Son işleme sırasında Maksimum Olmayan Bastırma (NMS) işlemini ortadan kaldıran model, sınırlayıcı kutuları doğrudan tahmin eder; bu da dağıtımı basitleştirir ve çıkarım gecikmesini kararlı hâle getirir.
RTDETRv2'ye dâhil edilen "Bag-of-Freebies", küresel dikkat mekanizmalarının uzamsal ilişkileri yerel evrişimlerden daha iyi anlaması sayesinde karmaşık sahneleri ve örtüşen nesneleri ele alma yeteneğini geliştirir.
Transformer'lar karmaşık sahne anlayışında başarılı olsa da eğitim sırasında genellikle CNN'lere kıyasla çok daha fazla CUDA belleği gerektirir. Bu durum, standart tüketici GPU'larında toplu iş boyutlarını sınırlayabilir ve genel eğitim süresini artırabilir.
RT-DETR hakkında daha fazla bilgi edin
YOLOv6-3.0: Endüstriyel İşlem Hızını En Üst Düzeye Çıkarma#
Meituan'ın Vision AI Departmanı'ndan çıkan YOLOv6-3.0, GPU işlem hızının öncelikli olduğu endüstriyel hatlarda yeni nesil bir algılayıcı olarak hizmet vermek üzere özel olarak tasarlanmıştır.
- Yazarlar: Chuyi Li, Lulu Li, Yifei Geng, Hongliang Jiang, Meng Cheng, Bo Zhang, Zaidan Ke, Xiaoming Xu ve Xiangxiang Chu
- Kuruluş: Meituan
- Tarih: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
Mimari Odak#
YOLOv6-3.0, NVIDIA GPU'ları gibi donanım hızlandırıcılarında bellek erişim maliyetlerini en aza indirmek için titizlikle tasarlanmış bir EfficientRep omurgasına dayanır. Boyun mimarisi, farklı ölçeklerde özellik birleştirmeyi iyileştirmek için Çift Yönlü Birleştirme (BiC) modülüne sahiptir.
Eğitim sırasında, bağlantı noktası tabanlı paradigmalardan yararlanırken daha hızlı yürütme için bağlantı noktası içermeyen bir çıkarım modunu koruyan Anchor-Aided Training (AAT) stratejisini kullanır. Sunucu sınıfı GPU'larda (ör. T4, A100) olağanüstü işlem hızına ulaşsa da özel mimarisi, yalnızca CPU kullanan uç cihazlarda dağıtıldığında optimumun altında bir gecikmeye neden olabilir.
YOLOv6 hakkında daha fazla bilgi edin
Performans Karşılaştırması#
Modeller üretim için değerlendirilirken doğruluğu (mAP), çıkarım hızı ve hesaplama maliyetiyle (FLOPs) dengelemek kritik öneme sahiptir. Aşağıdaki tablo, bu modellerin birbirleriyle karşılaştırıldığında nasıl performans gösterdiğini ortaya koyuyor.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
YOLOv6-3.0, TensorRT üzerinde ham işlem hızında öne çıkarken RTDETRv2, özellikle daha büyük model varyantlarında daha iyi ölçeklenerek daha yüksek mAP skorlarına ulaşır. Ancak her iki model de modern birleşik çerçevelerde bulunan kapsamlı çok yönlülükten yoksundur. YOLOv6-3.0 öncelikle bir algılama uzmanıdır; örnek bölütleme ve poz tahmini gibi görevler için yerel desteği kutudan çıktığı hâliyle sunmaz.
Kullanım Alanları ve Öneriler#
RT-DETR ve YOLOv6 arasında seçim yapmak, özel proje gereksinimlerine, dağıtım kısıtlamalarına ve ekosistem tercihlerine bağlıdır.
RT-DETR Ne Zaman Seçilmeli?#
RT-DETR şu durumlar için güçlü bir seçenektir:
- Transformer Tabanlı Tespit Araştırması: NMS olmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
- Esnek Gecikmeyle Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en yüksek öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
- Büyük Nesne Tespiti: Transformer'ların küresel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.
YOLOv6 Ne Zaman Seçilmeli#
YOLOv6 şu durumlarda önerilir:
- Endüstriyel Donanım Farkındalıklı Dağıtım: Modelin donanım farkındalıklı tasarımının ve verimli yeniden parametrelendirmesinin belirli hedef donanımlarda optimize edilmiş performans sağladığı senaryolar.
- Hızlı Tek Aşamalı Algılama: Kontrollü ortamlarda gerçek zamanlı video işleme için GPU üzerinde ham çıkarım hızına öncelik veren uygulamalar.
- Meituan Ekosistemi Entegrasyonu: Zaten Meituan'ın teknoloji yığını ve dağıtım altyapısı içinde çalışan ekipler.
Ultralytics (YOLO26) Ne Zaman Seçilmeli?#
Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi birleşimini sunar:
- NMS'siz Uç Dağıtımı: Maksimum Olmayan Bastırma son işleme karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
- Yalnızca CPU Kullanılan Ortamlar: Özel GPU hızlandırması olmayan ve YOLO26'nın %43'e varan daha hızlı CPU çıkarımının belirleyici bir avantaj sağladığı cihazlar.
- Küçük Nesne Algılama: ProgLoss ve STAL'ın küçük nesnelerde doğruluğu önemli ölçüde artırdığı hava drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.
Ultralytics Avantajı#
Doğru modeli seçmek yalnızca ham kıyaslama sayılarından ibaret değildir; geliştirici deneyimi, dağıtım esnekliği ve ekosistem desteği de aynı derecede önemlidir. Ultralytics platformuyla entegre modelleri kullanarak kullanıcılar, statik araştırma depolarına kıyasla önemli avantajlar elde eder.
- Kullanım Kolaylığı:
ultralyticsPython paketi sorunsuz bir API sunar. Modelleri eğitmek, doğrulamak ve dışa aktarmak yalnızca birkaç satır kod gerektirir. - İyi Bakımı Yapılan Ekosistem: Yalıtılmış akademik depoların aksine Ultralytics Platformu etkin biçimde güncellenir. ONNX, OpenVINO ve CoreML gibi araçlar için güçlü entegrasyonlara sahiptir.
- Eğitim Verimliliği: Ultralytics modelleri, eğitim sırasında genellikle RTDETRv2 gibi Transformer mimarilerine kıyasla çok daha az VRAM kullanır ve tüketici sınıfı donanımlarda daha büyük toplu iş boyutlarına olanak tanır.
- Çok Yönlülük: YOLOv6-3.0 modelinin odaklanılmış kapsamından farklı olarak Ultralytics modelleri; görüntü sınıflandırma, yönlendirilmiş sınırlayıcı kutular (OBB) ve segmentasyonu tek bir birleşik çerçeve içinde yerel olarak destekleyen çok görevlidir.
Ultralytics CLI'ı kullanarak eğitilmiş bir modeli uç dağıtımı için dışa aktarmak şu komutu çalıştırmak kadar basittir: yolo export model=yolo11n.pt format=tensorrt.
YOLO26 ile Tanışın: Nihai Çözüm#
RTDETRv2 ve YOLOv6-3.0 belirli avantajlar sunsa da alan hızla ilerliyor. Yeni bilgisayarlı görü projelerine başlayan ekipler için Ocak 2026'da Ultralytics tarafından yayımlanan YOLO26 modelini kesinlikle öneriyoruz.
YOLO26, endüstriyel CNN'lerin ve modern Transformer'ların güçlü yönlerini bir araya getirirken her birinin zayıflıklarını ortadan kaldırır:
- Uçtan Uca NMS'siz Tasarım: YOLOv10 ile ilk kez sunulan çığır açıcı yaklaşımı benimseyen YOLO26, NMS son işlemesini yerel olarak ortadan kaldırır ve RTDETRv2'ye benzer biçimde kararlı, öngörülebilir bir dağıtım sağlarken çok daha az ek yük oluşturur.
- MuSGD Optimize Edicisi: Gelişmiş LLM eğitim tekniklerinden (Moonshot AI'ın Kimi K2'si gibi) ilham alan bu hibrit optimize edici, kararlı eğitim ve daha hızlı yakınsama sağlayarak geleneksel görsel Transformer'ların kötü şöhretli kararsızlığının üstesinden gelir.
- Uç Cihazlar için Optimize Edildi: Önceki nesillere kıyasla %43'e kadar daha hızlı CPU çıkarımı ve Distribution Focal Loss (DFL)'un stratejik olarak kaldırılması sayesinde YOLO26, GPU hızlandırmasının bulunmadığı mobil ve IoT cihazları için son derece uygundur.
- ProgLoss + STAL: Bu gelişmiş kayıp işlevleri, CNN'ler için tarihsel bir zorluk olan küçük nesne tanımada dikkate değer iyileştirmeler sağlar ve YOLO26'yı hava görüntüleri ile robotik uygulamalar için ideal hâle getirir.
Eğitim Örneği#
Sezgisel Ultralytics API'si, son teknoloji modelleri sorunsuz biçimde eğitmene olanak tanır. Aşağıda, COCO8 veri kümesi üzerinde YOLO26 Nano modelinin nasıl eğitileceğini gösteren çalıştırılabilir bir örnek yer alıyor:
from ultralytics import YOLO
# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")
# Export the trained model to ONNX format for production
model.export(format="onnx")Özet#
RTDETRv2 ve YOLOv6-3.0 karşılaştırılırken karar büyük ölçüde özel donanımına ve gecikme kısıtlamalarına bağlıdır. RTDETRv2, karmaşık ve örtüşen nesneleri ele almanın kritik olduğu araştırma ortamlarında ve sunucu tarafı işlemede öne çıkar. YOLOv6-3.0, güçlü NVIDIA GPU'larla donatılmış yüksek işlem hızlı üretim hatları için güçlü bir seçenek olmaya devam eder.
Ancak Transformer'ların NMS'siz zarafetini CNN'lerin göz kamaştırıcı hızı ve düşük bellek ayak iziyle birleştirerek her iki dünyanın da en iyisini arayan geliştiriciler için YOLO26 rakipsizdir. Ultralytics ekosisteminin kapsamlı belgeleri ve aktif topluluğu tarafından desteklenen YOLO26, görsel yapay zekâ projelerinin sağlam, ölçeklenebilir ve geleceğe hazır olmasını sağlar.