YOLO Vision 2026:

YOLOv9 ile RTDETRv2 karşılaştırması#

Gerçek zamanlı object detection alanı son yıllarda büyük bir paradigma değişiminden geçti. Bu alanda baskın olmak üzere iki farklı mimari felsefe ortaya çıktı: son derece optimize edilmiş Evrişimli Sinir Ağları (CNN'ler) ve gerçek zamanlı Algılama Transformer'ları (DETR'ler). Bu iki yaklaşımın zirvesini YOLOv9 ve RTDETRv2 temsil etmektedir.

Bu kapsamlı kılavuz, computer vision boru hattın için doğru modeli seçmene yardımcı olmak amacıyla bu iki güçlü modeli mimari yenilikleri, performance metrics ve ideal dağıtım senaryoları açısından karşılaştırıyor.

Yönetici Özeti#

Her iki model de en üst düzey sonuçlar elde ediyor ancak biraz farklı dağıtım kısıtlamalarına ve geliştirme ekosistemlerine hitap ediyorlar.

  • YOLOv9'u şu durumlarda seç: Yüksek verimli parametre kullanımına ve uç cihazlarda hızlı çıkarıma ihtiyacın varsa. YOLOv9, CNN verimliliğinin teorik sınırlarını zorlar ve bu da onu hesaplama kaynaklarının kesin olarak sınırlı olduğu ortamlar için ideal hale getirir.
  • RTDETRv2'yi şu durumlarda seç: Transformer'ların sağladığı incelikli bağlam anlayışına, özellikle şiddetli tıkanıklık veya karmaşık nesne ilişkilerinin olduğu sahnelerde ihtiyacın varsa ve biraz daha ağır bir mimariyi destekleyecek donanıma sahipsen.
  • Şu durumda YOLO26'yı (Önerilen) seç: Her iki dünyanın da en iyisini istiyorsun. Ultralytics Platform üzerinde mevcut olan en yeni nesil olan YOLO26, yerel bir Uçtan Uca NMS İçermeyen Tasarım (DETR modellerine benzer ancak çok daha hızlı) sunarak işlem sonrası darboğazları ortadan kaldırır ve önceki nesillere kıyasla %43'e kadar daha hızlı CPU çıkarımı sunar.

Teknik Özellikler ve Yazarlık#

Bu modellerin kökenlerini ve tasarım amaçlarını anlamak, mimari seçimleri için hayati bir bağlam sağlar.

YOLOv9#

Yazarlar: Chien-Yao Wang ve Hong-Yuan Mark Liao
Kuruluş: Institute of Information Science, Academia Sinica
Tarih: 2024-02-21
Arxiv: https://arxiv.org/abs/2402.13616
GitHub: WongKinYiu/yolov9

YOLOv9 hakkında daha fazla bilgi edin

RTDETRv2#

Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
Kuruluş: Baidu
Tarih: 2024-07-24
Arxiv: https://arxiv.org/abs/2407.17140
GitHub: lyuwenyu/RT-DETR

RTDETR hakkında daha fazla bilgi edinin

Mimari Yenilikler#

YOLOv9: Bilgi Darboğazını Çözmek#

Ultralytics YOLOv9, veriler derin sinir ağlarından geçerken yaşanan bilgi kaybını gidermek için tasarlanmış iki büyük yenilik sunar:

  1. Programlanabilir Gradyan Bilgisi (PGI): Bu yardımcı denetim çerçevesi, ağ ağırlıklarını güncellemek için güvenilir gradyanların üretilmesini sağlar ve çok derin ağ katmanlarında bile kritik özellik bilgilerini korur.
  2. Genelleştirilmiş Verimli Katman Birleştirme Ağı (GELAN): CSPNet ve ELAN'ın güçlü yanlarını birleştiren yeni bir mimari. GELAN, parametre verimliliğini optimize ederek YOLOv9'un geleneksel CNN'lere kıyasla daha az FLOP ile daha yüksek doğruluk elde etmesini sağlar.

RTDETRv2: Gerçek Zamanlı Transformer'ları Geliştirmek#

Orijinal RT-DETR'nin başarısının üzerine inşa edilen RTDETRv2, Non-Maximum Suppression (NMS) ihtiyacını doğası gereği ortadan kaldıran Transformer tabanlı bir mimari kullanır. İyileştirmeleri şunları içerir:

  1. Bag-of-Freebies Stratejisi: v2 yinelemesi, çıkarım gecikmesine herhangi bir yük eklemeden doğruluğu önemli ölçüde artıran gelişmiş eğitim tekniklerini ve veri artırma yöntemlerini içerir.
  2. Verimli Hibrit Kodlayıcı: Çok ölçekli özellikleri, ölçek içi ve ölçekler arası ayrıştırılmış bir dikkat mekanizması aracılığıyla işleyerek, RTDETRv2, Vision Transformer'ların geleneksel olarak yüksek olan hesaplama maliyetini verimli bir şekilde yönetir.
Yerel Uçtan Uca Algılama

RTDETRv2, NMS içermeyen algılama için Transformer'lardan yararlanırken, yeni YOLO26 architecture bunu son derece optimize edilmiş bir CNN yapısı içinde yerel olarak gerçekleştirerek aynı akıcı dağıtımı sağlar, ancak çok daha üstün kenar çıkarım hızları sunar.

Performans Karşılaştırması#

Modelleri üretim için değerlendirirken, accuracy ve hesaplama gereksinimleri arasındaki denge çok önemlidir. Aşağıdaki tablo, standart kıyaslamalar genelinde çeşitli model boyutlarının performansını özetlemektedir.

Modelboyut
(piksel)
mAPval
50-95
Hız
CPU ONNX
(ms)
Hız
T4 TensorRT10
(ms)
parametreler
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Analiz#

Verilerin gösterdiği gibi, YOLOv9 parametre verimliliğinde katı bir avantaja sahiptir. YOLOv9c modeli, sadece 25.3M parametre ile etkileyici bir 53.0 mAP elde ederek onu inanılmaz derecede hafif kılar.

Buna karşılık RTDETRv2, orta ve büyük model kategorilerinde güçlü bir rekabet sunar. Ancak bu, Transformer models için tipik olan daha yüksek parametre sayıları ve önemli ölçüde daha büyük FLOP'lar pahasına gelir. Bu mimari fark, bellek kullanımına da yansır: YOLO modelleri, Transformer muadillerine kıyasla hem eğitim hem de çıkarım sırasında tipik olarak çok daha az CUDA belleği gerektirir.

Ultralytics Avantajı: Ekosistem ve Çok Yönlülük#

Saf mimari metrikler önemli olsa da, yazılım ekosistemi genellikle bir yapay zeka projesinin başarısını belirler. Bu gelişmiş modellere Ultralytics Python API üzerinden erişmek eşsiz avantajlar sunar.

Kolaylaştırılmış Eğitim ve Dağıtım#

Bir Detection Transformer Eğitmek genellikle karmaşık yapılandırma dosyaları ve üst düzey GPU'lar gerektirir. Ultralytics framework kullanarak geliştiriciler, son derece verimli eğitim boru hatlarından ve kullanıma hazır önceden eğitilmiş ağırlıklardan yararlanarak hem YOLOv9 hem de RTDETR modellerini aynı, basit sözdizimiyle eğitebilirler.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")

Benzersiz Görev Çok Yönlülüğü#

RTDETRv2 gibi özel modellerin en büyük kısıtlamalarından biri, sınırlayıcı kutu algılamasına olan dar odaklanmalarıdır. Buna karşın, YOLO11 ve YOLOv8 gibi modelleri kapsayan daha geniş Ultralytics ekosistemi, geniş bir yelpazedeki computer vision tasks işlemlerini destekler. Bunlar arasında piksel düzeyinde instance segmentation, iskelet tabanlı pose estimation, tüm görüntü classification ve hava görüntüsü için Oriented Bounding Box (OBB) tespiti yer alır.

Gerçek Dünya Uygulamaları#

Yüksek Hızlı Uç Analitiği#

Uç cihazlarda gerçek zamanlı ürün tanıma gerektiren perakende ortamları veya üretim hatları için YOLOv9 üstün seçimdir. GELAN architecture yapısı, NVIDIA Jetson serisi gibi kısıtlı donanımlarda yüksek aktarım hızı sağlayarak önemli bir gecikme yaşamadan otomatik kalite kontrolünü mümkün kılar.

Karmaşık Sahne Analizi#

Nesnelerin birbirini sık sık kapattığı yoğun kalabalık izleme veya karmaşık trafik kavşakları gibi senaryolarda, RTDETRv2'nin küresel dikkat mekanizmaları parlar. Modelin tüm görüntü bağlamı hakkında yerel olarak mantık yürütme yeteneği, nesneler kısmen gizlendiğinde bile sağlam takip ve algılamayı sürdürmesine olanak tanır.

Kullanım Durumları ve Öneriler#

YOLOv9 ve RT-DETR arasında seçim yapmak; projenin özel gereksinimlerine, dağıtım kısıtlamalarına ve ekosistem tercihlerine bağlıdır.

Ne Zaman YOLOv9 Seçilmeli#

YOLOv9 şunlar için güçlü bir seçimdir:

  • Bilgi Darboğazı Araştırması: Programlanabilir Gradyan Bilgisi (PGI) ve Genelleştirilmiş Verimli Katman Birleştirme Ağı (GELAN) mimarilerini inceleyen akademik projeler.
  • Gradyan Akışı Optimizasyonu Çalışmaları: Eğitim sırasında derin ağ katmanlarındaki bilgi kaybını anlamaya ve azaltmaya odaklanan araştırmalar.
  • Yüksek Doğrulukta Algılama Kıyaslaması: YOLOv9'un güçlü COCO karşılaştırma performansının mimari karşılaştırmalar için referans noktası olarak gerektiği senaryolar.

RT-DETR Ne Zaman Seçilmeli#

RT-DETR şunlar için önerilir:

  • Transformer Tabanlı Algılama Araştırması: NMS olmadan uçtan uca nesne algılama için dikkat mekanizmalarını ve transformer mimarilerini keşfeden projeler.
  • Esnek Gecikmeli Yüksek Doğruluklu Senaryolar: Algılama doğruluğunun en önemli öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebilir olduğu uygulamalar.
  • Büyük Nesne Algılama: Transformer'ların küresel dikkat mekanizmasının doğal bir avantaj sağladığı, ağırlıklı olarak orta-büyük nesnelerin olduğu sahneler.

Ultralytics (YOLO26) Ne Zaman Seçilmeli#

Çoğu yeni proje için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi kombinasyonunu sunar:

  • NMS-Free Uç Dağıtımı: Non-Maximum Suppression işlem sonrası karmaşıklığı olmadan tutarlı, düşük gecikmeli çıkarım gerektiren uygulamalar.
  • Sadece CPU Ortamları: YOLO26'nın %43'e kadar daha hızlı CPU çıkarımının belirleyici bir avantaj sağladığı, özel GPU hızlandırması olmayan cihazlar.
  • Küçük Nesne Tespiti: ProgLoss ve STAL'ın çok küçük nesneler üzerindeki doğruluğu önemli ölçüde artırdığı havadan drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.

Gelecek: YOLO26 ile Tanış#

YOLOv9 ve RTDETRv2 devasa başarıları temsil etse de computer vision alanı hızla ilerlemektedir. Yeni projeler başlatmak isteyen geliştiriciler için YOLO26 önerilen en son teknoloji ürünü çözümdür.

2026 yılında piyasaya sürülen YOLO26, hem CNN'lerin hem de DETR'lerin en iyi özelliklerini bünyesinde barındırır. İlk olarak YOLOv10 ile öncülük edilen bir teknik olan ve işlem sonrası gecikmeyi tamamen ortadan kaldıran Uçtan Uca NMS İçermeyen Tasarım özelliğine sahiptir. Dahası YOLO26, daha iyi kenar uyumluluğu için Dağılım Odak Kaybını (DFL) ortadan kaldırır ve devrim niteliğindeki MuSGD Optimizer optimizasyon aracını sunar. Büyük Dil Modeli eğitiminden (özellikle Moonshot AI'ın Kimi K2'sinden) ilham alan bu hibrit optimizer, benzeri görülmemiş bir eğitim kararlılığı ve daha hızlı yakınsama sağlar.

Olağanüstü küçük nesne algılama için ProgLoss ve STAL gibi geliştirilmiş kayıp fonksiyonlarıyla birleştirilen YOLO26, %43'e kadar daha hızlı CPU çıkarımı sunarak modern yapay zeka dağıtımları için nihai model olarak konumunu sağlamlaştırır.

Yorumlar