YOLOv9 ile RTDETRv2#
Gerçek zamanlı nesne algılama alanı son yıllarda köklü bir değişim geçirdi. Alana iki farklı mimari yaklaşım yön veriyor: yüksek düzeyde optimize edilmiş Evrişimli Sinir Ağları (CNN'ler) ve gerçek zamanlı Algılama Transformer'ları (DETR'ler). Bu iki yaklaşımın zirvesini YOLOv9 ve RTDETRv2 temsil ediyor.
Bu kapsamlı kılavuz, mimari yeniliklerini, performans ölçütlerini ve ideal dağıtım senaryolarını analiz ederek güçlü iki modeli karşılaştırıyor ve bilgisayarlı görü işlem hattın için doğru modeli seçmene yardımcı oluyor.
Yönetici Özeti#
Her iki model de son teknoloji sonuçlara ulaşsa da biraz farklı dağıtım kısıtlarına ve geliştirme ekosistemlerine hitap ediyor.
- YOLOv9'u seç: Parametreleri son derece verimli kullanman ve uç cihazlarda hızlı çıkarım yapman gerekiyorsa. YOLOv9, CNN verimliliğinin kuramsal sınırlarını zorlayarak hesaplama kaynaklarının kesin biçimde kısıtlı olduğu ortamlar için ideal hâle geliyor.
- RTDETRv2'yi seç: Özellikle yoğun örtüşme veya karmaşık nesne ilişkilerinin bulunduğu sahnelerde Transformer'ların sunduğu ayrıntılı bağlam anlayışına ihtiyacın varsa ve biraz daha ağır bir mimariyi destekleyecek donanıma sahipsen.
- YOLO26'yı seç (Önerilen): Her iki dünyanın da en iyisini istiyorsan. Ultralytics Platform üzerinde bulunan en yeni nesil YOLO26; DETR modellerine benzeyen ancak çok daha hızlı olan, isteğe bağlı bir Uçtan Uca, NMS'siz Tasarım (
nms=False) içerir. Bu tasarım, son işleme darboğazlarını ortadan kaldırır ve önceki nesillere kıyasla CPU çıkarımını %43'e kadar hızlandırır.
Teknik Özellikler ve Yazarlar#
Bu modellerin kökenlerini ve tasarım amaçlarını anlamak, mimari tercihleri hakkında önemli bir bağlam sunar.
YOLOv9#
- Yazarlar: Chien-Yao Wang ve Hong-Yuan Mark Liao
- Kuruluş: Academia Sinica Bilgi Bilimi Enstitüsü
- Tarih: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
YOLOv9 hakkında daha fazla bilgi edin
RTDETRv2#
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
- Kurum: Baidu
- Tarih: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
RTDETRv2 hakkında daha fazla bilgi edin
Mimari Yenilikler#
YOLOv9: Bilgi Darboğazını Çözme#
YOLOv9, veriler derin sinir ağlarından geçerken oluşan bilgi kaybını gidermek için tasarlanmış iki önemli yenilik sunar:
- Programlanabilir Gradyan Bilgisi (PGI): Bu yardımcı denetim çerçevesi, ağ ağırlıklarını güncellemek için güvenilir gradyanlar üretilmesini sağlayarak çok derin ağ katmanlarında bile kritik özellik bilgilerinin korunmasına yardımcı olur.
- Genelleştirilmiş Verimli Katman Birleştirme Ağı (GELAN): CSPNet ve ELAN'ın güçlü yönlerini bir araya getiren yeni bir mimari. GELAN, parametre verimliliğini optimize ederek YOLOv9'un geleneksel CNN'lere kıyasla daha az FLOPs ile daha yüksek doğruluk elde etmesini sağlar.
RTDETRv2: Gerçek Zamanlı Transformer'ları Geliştirme#
Özgün RT-DETR'nin başarısını temel alan RTDETRv2, Maksimum Olmayanların Bastırılması (NMS) gereksinimini doğal olarak ortadan kaldıran Transformer tabanlı bir mimari kullanır. İyileştirmeleri şunları içerir:
- Ücretsiz Kazanımlar Stratejisi: v2 sürümü, çıkarım gecikmesine herhangi bir ek yük getirmeden doğruluğu önemli ölçüde artıran gelişmiş eğitim teknikleri ve veri artırımları içerir.
- Verimli Hibrit Kodlayıcı: RTDETRv2, çok ölçekli özellikleri ölçek içi ve ölçekler arası ayrıştırılmış bir dikkat mekanizmasıyla işleyerek Görsel Transformer'ların geleneksel olarak yüksek hesaplama maliyetini verimli biçimde yönetir.
RTDETRv2, NMS gerektirmeyen algılama için Transformer'lardan yararlanırken yeni YOLO26 mimarisi, son derece optimize edilmiş bir CNN yapısı içinde isteğe bağlı bire bir başlık (nms=False) ile bunu başarır; böylece aynı yalın dağıtım deneyimini çok daha yüksek uç cihaz çıkarım hızlarıyla sunar.
Performans Karşılaştırması#
Modelleri üretim ortamı için değerlendirirken doğruluk ile hesaplama gereksinimleri arasındaki denge kritik önem taşır. Aşağıdaki tablo, çeşitli model boyutlarının standart kıyaslamalardaki performansını gösterir.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Analiz#
Verilerin gösterdiği üzere YOLOv9, parametre verimliliğinde belirgin bir üstünlüğü korur. YOLOv9c modeli yalnızca 25.5M parametreyle etkileyici bir 53.0 mAP değerine ulaşarak son derece hafif bir model olduğunu kanıtlar.
Buna karşılık RTDETRv2, orta ve büyük model kategorilerinde güçlü bir rakiptir. Ancak bunun bedeli daha fazla parametre ve önemli ölçüde daha yüksek FLOPs değeridir; bu, Transformer modellerinin tipik bir özelliğidir. Bu mimari farklılık bellek kullanımına da yansır: YOLO modelleri, eğitim ve çıkarım sırasında genellikle Transformer muadillerine kıyasla çok daha az CUDA belleği gerektirir.
Ultralytics'in Avantajı: Ekosistem ve Çok Yönlülük#
Saf mimari ölçütler önemli olsa da bir AI projesinin başarısını çoğu zaman yazılım ekosistemi belirler. Bu gelişmiş modellere Ultralytics Python API üzerinden erişmek benzersiz avantajlar sağlar.
Kolaylaştırılmış Eğitim ve Dağıtım#
Bir Algılama Transformer'ını eğitmek genellikle karmaşık yapılandırma dosyaları ve üst düzey GPU'lar gerektirir. Ultralytics çerçevesinden yararlanan geliştiriciler, son derece verimli eğitim işlem hatlarından ve kullanıma hazır önceden eğitilmiş ağırlıklardan faydalanarak hem YOLOv9 hem de RT-DETR modellerini aynı basit söz dizimiyle eğitebilir.
from ultralytics import RTDETR, YOLO
# Bir YOLOv9 modeli eğit
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Aynı API'yi kullanarak bir RTDETR modeli eğit
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Modelleri OpenVINO veya TensorRT'ye sorunsuz biçimde aktar
model_yolo.export(format="openvino")Eşsiz Görev Çeşitliliği#
RTDETRv2 gibi özel modellerin önemli bir sınırlaması, odaklarının daraltılmış kutu algılamayla sınırlı olmasıdır. Buna karşılık, YOLO11 ve YOLOv8 gibi modelleri kapsayan daha geniş Ultralytics ekosistemi, çok çeşitli bilgisayarlı görü görevlerini destekler. Bunlar arasında piksel düzeyinde hassas örnek segmentasyonu, iskelet tabanlı poz tahmini, tüm görüntü üzerinde sınıflandırma ve hava görüntüleri için Yönlendirilmiş Sınırlayıcı Kutu (OBB) algılama yer alır.
Gerçek Dünya Uygulamaları#
Yüksek Hızlı Uç Cihaz Analitiği#
Uç cihazlarda gerçek zamanlı ürün tanıma gerektiren perakende ortamları veya üretim hatları için YOLOv9 daha iyi bir seçimdir. GELAN mimarisi, NVIDIA Jetson serisi gibi kısıtlı donanımlarda yüksek verim sağlayarak önemli gecikmeler olmadan otomatik kalite kontrolü yapılmasına olanak tanır.
Karmaşık Sahne Analizi#
Nesnelerin sık sık birbirini örttüğü kalabalık izleme veya karmaşık trafik kavşakları gibi senaryolarda RTDETRv2'nin küresel dikkat mekanizmaları öne çıkar. Modelin tüm görüntü bağlamı üzerinde doğal olarak akıl yürütebilmesi, nesneler kısmen gizlendiğinde bile sağlam izleme ve algılama performansını sürdürmesini sağlar.
Kullanım Alanları ve Öneriler#
YOLOv9 ile RT-DETR arasındaki seçim, projene özgü gereksinimlere, dağıtım kısıtlamalarına ve ekosistem tercihlerine bağlıdır.
YOLOv9'u Ne Zaman Seçmeli?#
YOLOv9 şu durumlarda güçlü bir seçenektir:
- Bilgi Darboğazı Araştırmaları: Programlanabilir Gradyan Bilgisi (PGI) ve Genelleştirilmiş Verimli Katman Toplama Ağı (GELAN) mimarilerini inceleyen akademik projeler.
- Gradyan Akışı Optimizasyonu Çalışmaları: Eğitim sırasında derin ağ katmanlarındaki bilgi kaybını anlamaya ve azaltmaya odaklanan araştırmalar.
- Yüksek Doğruluklu Algılama Karşılaştırmaları: YOLOv9'un güçlü COCO karşılaştırma testi performansının mimari karşılaştırmalarda referans noktası olarak gerektiği senaryolar.
RT-DETR Ne Zaman Seçilmeli?#
RT-DETR şu durumlarda önerilir:
- Transformer Tabanlı Tespit Araştırmaları: NMS kullanmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
- Gecikme Esnekliğinin Olduğu Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en önemli öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
- Büyük Nesne Tespiti: Transformer'ların genel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.
Ultralytics'i (YOLO26) Ne Zaman Seçmeli#
Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi bileşimini sunar:
- NMS Olmadan Uç Dağıtımı: Maksimum Olmayan Bastırma son işleminin karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
- Yalnızca CPU Kullanılan Ortamlar: YOLO26'nın CPU'da %43'e varan daha hızlı çıkarımının belirleyici bir avantaj sağladığı, özel GPU hızlandırması bulunmayan cihazlar.
- Küçük Nesne Algılama: ProgLoss ve STAL'ın çok küçük nesnelerde doğruluğu önemli ölçüde artırdığı havadan drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.
Gelecek: YOLO26 ile Tanış#
YOLOv9 ve RTDETRv2 önemli başarılara imza atmış olsa da bilgisayarlı görü alanı hızla ilerliyor. Yeni projelere başlayacak geliştiriciler için YOLO26, önerilen son teknoloji çözümdür.
2026'da yayımlanan YOLO26, CNN'lerin ve DETR'ların en iyi özelliklerini bir araya getirir. İlk kez YOLOv10 ile ortaya konan bir teknik olan NMS son işlemeyi ortadan kaldıran isteğe bağlı Uçtan Uca, NMS Gerektirmeyen Tasarım (nms=False) özelliğini sunar. Ayrıca YOLO26, uç cihazlarla uyumluluğu artırmak için Dağılım Odaklı Kaybı (DFL) kaldırır ve çığır açan MuSGD Optimize Edicisini kullanıma sunar. Büyük Dil Modeli eğitiminden (özellikle Moonshot AI'ın Kimi K2 modelinden) esinlenen bu hibrit optimize edici, benzersiz eğitim kararlılığı ve daha hızlı yakınsama sağlar.
Olağanüstü küçük nesne tanıma performansı için ProgLoss ve STAL'ı (Aşamalı Kayıp ve Küçük Nesne Farkındalıklı Etiket Ataması) kullanan YOLO26, %43'e kadar daha hızlı CPU çıkarımı sunarak modern AI dağıtımları için en iyi model olarak konumunu sağlamlaştırır.