YOLOv9 ve RTDETRv2#
Gerçek zamanlı nesne algılama alanı, son yıllarda bir paradigma değişimi yaşadı. Alana hâkim olmak üzere iki farklı mimari yaklaşım öne çıktı: yüksek düzeyde optimize edilmiş Evrişimli Sinir Ağları (CNNs) ve gerçek zamanlı Algılama Transformer'ları (DETRs). Bu iki yaklaşımın en ileri örnekleri YOLOv9 ve RTDETRv2'dir.
Bu kapsamlı kılavuz, doğru modeli bilgisayarlı görü işlem hattın için seçmene yardımcı olmak amacıyla bu iki güçlü modeli karşılaştırır ve mimari yeniliklerini, performans ölçümlerini ve ideal dağıtım senaryolarını analiz eder.
Yönetici Özeti#
Her iki model de son teknoloji sonuçlara ulaşıyor, ancak biraz farklı dağıtım kısıtlarına ve geliştirme ekosistemlerine hitap ediyor.
- Şu durumlarda YOLOv9'u seç: Parametreleri son derece verimli kullanmaya ve uç cihazlarda hızlı çıkarıma ihtiyacın varsa. YOLOv9, CNN verimliliğinin teorik sınırlarını zorluyor ve bu sayede hesaplama kaynaklarının ciddi ölçüde kısıtlı olduğu ortamlar için ideal hale geliyor.
- Şu durumlarda RTDETRv2'yi seç: Özellikle nesnelerin yoğun biçimde örtüştüğü veya aralarında karmaşık ilişkilerin bulunduğu sahnelerde Transformer'ların sağladığı ayrıntılı bağlam anlayışına ihtiyacın varsa ve biraz daha ağır bir mimariyi destekleyecek donanıma sahipsen.
- Her iki dünyanın da en iyisini istiyorsan YOLO26'yı seç (Önerilir): Ultralytics Platformu üzerinde sunulan en yeni nesil model olan YOLO26, yerel Uçtan Uca NMS'siz Tasarım özelliğine sahiptir (DETR modellerine benzer, ancak çok daha hızlıdır); bu özellik, son işleme darboğazlarını ortadan kaldırır ve önceki nesillere kıyasla CPU çıkarımını %43'e kadar hızlandırır.
Teknik Özellikler ve Yazarlık#
Bu modellerin kökenini ve tasarım amacını anlamak, mimari tercihleri hakkında önemli bir bağlam sağlar.
YOLOv9#
- Yazarlar: Chien-Yao Wang ve Hong-Yuan Mark Liao
- Kuruluş: Institute of Information Science, Academia Sinica
- Tarih: 2024-02-21
- Arxiv: https://arxiv.org/abs/2402.13616
- GitHub: WongKinYiu/yolov9
YOLOv9 hakkında daha fazla bilgi edin
RTDETRv2#
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
- Kuruluş: Baidu
- Tarih: 2024-07-24
- Arxiv: https://arxiv.org/abs/2407.17140
- GitHub: lyuwenyu/RT-DETR
RT-DETR hakkında daha fazla bilgi edin
Mimari Yenilikler#
YOLOv9: Bilgi Darboğazını Çözmek#
Ultralytics YOLOv9, veriler derin sinir ağlarından geçerken oluşan bilgi kaybını ele almak üzere tasarlanmış iki temel yenilik sunar:
- Programlanabilir Gradyan Bilgisi (PGI): Bu yardımcı denetim çerçevesi, ağ ağırlıklarını güncellemek için güvenilir gradyanlar oluşturulmasını sağlayarak çok derin ağ katmanlarında bile kritik özellik bilgilerinin korunmasına yardımcı olur.
- Genelleştirilmiş Verimli Katman Birleştirme Ağı (GELAN): CSPNet ve ELAN'ın güçlü yönlerini birleştiren yeni bir mimaridir. GELAN, parametre verimliliğini optimize ederek YOLOv9'un geleneksel CNN'lere kıyasla daha az FLOP ile daha yüksek doğruluk elde etmesini sağlar.
RTDETRv2: Gerçek Zamanlı Transformer'ları Geliştirmek#
Orijinal RT-DETR'ın başarısı üzerine inşa edilen RTDETRv2, doğal olarak Maksimum Olmayan Bastırma (NMS) ihtiyacını ortadan kaldıran Transformer tabanlı bir mimari kullanır. İyileştirmeleri şunları içerir:
- Bag-of-Freebies Stratejisi: v2 sürümü, çıkarım gecikmesine herhangi bir ek yük getirmeden doğruluğu önemli ölçüde artıran gelişmiş eğitim tekniklerini ve veri artırma yöntemlerini içerir.
- Verimli Hibrit Kodlayıcı: RTDETRv2, çok ölçekli özellikleri ölçek içi ve ölçekler arası ayrıştırılmış bir dikkat mekanizmasıyla işleyerek Vision Transformer'ların geleneksel olarak yüksek hesaplama maliyetini verimli biçimde yönetir.
RTDETRv2, NMS'siz algılama için Transformer'lardan yararlanırken yeni YOLO26 mimarisi, bunu yüksek düzeyde optimize edilmiş bir CNN yapısı içinde yerel olarak gerçekleştirir ve çok daha yüksek uç çıkarım hızlarıyla aynı yalınlaştırılmış dağıtımı sunar.
Performans Karşılaştırması#
Modelleri üretim için değerlendirirken doğruluk ile hesaplama gereksinimleri arasındaki denge kritik önem taşır. Aşağıdaki tabloda çeşitli model boyutlarının standart kıyaslamalardaki performansı özetlenmiştir.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.1 | 26.4 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.0 | 76.3 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.3 | 102.1 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 57.3 | 189.0 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
Analiz#
Verilerin gösterdiği üzere YOLOv9, parametre verimliliğinde belirgin bir üstünlüğünü koruyor. YOLOv9c modeli yalnızca 25,3 milyon parametreyle etkileyici bir 53,0 mAP değerine ulaşarak son derece hafif bir yapı sunuyor.
Buna karşılık RTDETRv2, orta ve büyük model kategorilerinde güçlü bir rekabet sunuyor. Ancak bu, daha yüksek parametre sayıları ve Transformer modellerinin tipik özelliği olan önemli ölçüde daha yüksek FLOP maliyetiyle geliyor. Bu mimari fark bellek kullanımına da yansıyor: YOLO modelleri, Transformer karşılıklarına kıyasla hem eğitim hem de çıkarım sırasında genellikle çok daha az CUDA belleği gerektiriyor.
Ultralytics Avantajı: Ekosistem ve Çok Yönlülük#
Saf mimari ölçütler önemli olsa da yazılım ekosistemi çoğu zaman bir AI projesinin başarısını belirler. Bu gelişmiş modellere Ultralytics Python API üzerinden erişmek benzersiz avantajlar sunar.
Yalınlaştırılmış Eğitim ve Dağıtım#
Bir Detection Transformer (Algılama Transformatörü) eğitimi genellikle karmaşık yapılandırma dosyaları ve üst düzey GPU'lar gerektirir. Ultralytics framework kullanarak hem YOLOv9 hem de RT-DETR modellerini özdeş ve basit bir sözdizimiyle eğitebilir, son derece verimli eğitim boru hatlarından ve hazır önceden eğitilmiş ağırlıklardan yararlanabilirsin.
from ultralytics import RTDETR, YOLO
# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)
# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)
# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")Eşsiz Görev Çok Yönlülüğü#
RTDETRv2 gibi uzmanlaşmış modellerin önemli bir sınırlaması, odaklarının daraltılmış kutu algılamayla sınırlı olmasıdır. Buna karşılık, YOLO11 ve YOLOv8 gibi modelleri kapsayan daha geniş Ultralytics ekosistemi, çok çeşitli bilgisayarlı görü görevlerini destekler. Buna piksel düzeyinde hassas örnek bölütleme, iskelet tabanlı poz tahmini, tüm görüntü sınıflandırması ve hava görüntüleri için Yönlendirilmiş Sınırlayıcı Kutu (OBB) algılama dahildir.
Gerçek Dünya Uygulamaları#
Yüksek Hızlı Uç Analitiği#
Uç cihazlarda gerçek zamanlı ürün tanıma gerektiren perakende ortamları veya üretim hatları için YOLOv9 üstün seçenektir. GELAN mimarisi, NVIDIA Jetson serisi gibi kısıtlı donanımlarda yüksek iş hacmi sağlayarak önemli bir gecikme olmadan otomatik kalite kontrolü mümkün kılar.
Karmaşık Sahne Analizi#
Yoğun kalabalık izleme veya nesnelerin sık sık birbirini örttüğü karmaşık trafik kavşakları gibi senaryolarda RTDETRv2'nin küresel dikkat mekanizmaları öne çıkar. Modelin tüm görüntü bağlamı hakkında doğal olarak akıl yürütebilmesi, nesneler kısmen gizlense bile güvenilir izleme ve algılamayı sürdürmesini sağlar.
Kullanım Alanları ve Öneriler#
YOLOv9 ile RT-DETR arasında seçim yapmak, özel proje gereksinimlerine, dağıtım kısıtlarına ve ekosistem tercihlerine bağlıdır.
YOLOv9 Ne Zaman Seçilmeli?#
YOLOv9 şu durumlar için güçlü bir seçenektir:
- Bilgi Darboğazı Araştırması: Programmable Gradient Information (PGI) ve Generalized Efficient Layer Aggregation Network (GELAN) mimarilerini inceleyen akademik projeler.
- Gradyan Akışı Optimizasyonu Çalışmaları: Eğitim sırasında derin ağ katmanlarındaki bilgi kaybını anlamaya ve azaltmaya odaklanan araştırmalar.
- Yüksek Doğruluklu Algılama Karşılaştırmaları: YOLOv9'un güçlü COCO benchmark performansının mimari karşılaştırmalar için referans noktası olarak gerekli olduğu senaryolar.
RT-DETR Ne Zaman Seçilmeli?#
RT-DETR şu durumlarda önerilir:
- Transformer Tabanlı Tespit Araştırması: NMS olmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
- Esnek Gecikmeyle Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en yüksek öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
- Büyük Nesne Tespiti: Transformer'ların küresel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.
Ultralytics (YOLO26) Ne Zaman Seçilmeli?#
Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi birleşimini sunar:
- NMS'siz Uç Dağıtımı: Maksimum Olmayan Bastırma son işleme karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
- Yalnızca CPU Kullanılan Ortamlar: Özel GPU hızlandırması olmayan ve YOLO26'nın %43'e varan daha hızlı CPU çıkarımının belirleyici bir avantaj sağladığı cihazlar.
- Küçük Nesne Algılama: ProgLoss ve STAL'ın küçük nesnelerde doğruluğu önemli ölçüde artırdığı hava drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.
Gelecek: YOLO26 Sahneye Çıkıyor#
YOLOv9 ve RTDETRv2 büyük başarılara imza atmış olsa da bilgisayarlı görü alanı hızla ilerliyor. Yeni projelere başlamak isteyen geliştiriciler için YOLO26, önerilen son teknoloji çözümdür.
2026'da yayımlanan YOLO26, CNN'lerin ve DETR'ların en iyi özelliklerini bir araya getiriyor. Uçtan Uca NMS'siz Tasarım sunarak son işleme gecikmesini tamamen ortadan kaldırıyor; bu teknik ilk olarak YOLOv10 tarafından öncülendi. Ayrıca YOLO26, daha iyi uç uyumluluğu için Dağılım Odaklı Kaybı (DFL) kaldırıyor ve devrim niteliğindeki MuSGD Optimize Edicisini kullanıma sunuyor. Büyük Dil Modeli eğitiminden, özellikle Moonshot AI'nin Kimi K2'sinden esinlenen bu hibrit optimize edici, benzeri görülmemiş eğitim kararlılığı ve daha hızlı yakınsama sağlıyor.
Olağanüstü küçük nesne tanıma için ProgLoss ve STAL gibi geliştirilmiş kayıp işlevleriyle bir araya gelen YOLO26, CPU çıkarımını %43'e kadar hızlandırarak modern AI dağıtımları için en üstün model konumunu pekiştiriyor.