Ultralytics YOLO27:
Get Started

RTDETRv2 ile YOLOv9#

Bilgisayarlı görü alanında, özellikle Evrişimli Sinir Ağları (CNN'ler) ile Transformer tabanlı modeller arasında mimari yaklaşımlar bakımından ilgi çekici bir ayrışma yaşandı. Geliştiriciler RTDETRv2 ile YOLOv9'u karşılaştırırken esasen genel dikkat mekanizmaları ile programlanabilir gradyan bilgisi arasındaki ödünleşimleri değerlendiriyor. Her iki model de kendi yaklaşımlarının zirvesini temsil ederek gerçek zamanlı nesne algılamanın sınırlarını zorluyor.

Modellere Giriş#

RTDETRv2: Gerçek Zamanlı Algılama Transformer'ı#

Baidu araştırmacıları tarafından geliştirilen RTDETRv2, temel Gerçek Zamanlı Algılama Transformer'ını iyileştirmek için bir "Bedavalar Paketi" yaklaşımı sunarak ilk RT-DETR modelini temel alır. Transformer'ların geleneksel darboğazı olan çıkarım hızını ele alarak bu modelleri gerçek zamanlı uygulamalar için elverişli hâle getirir.

  • Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
  • Kurum: Baidu
  • Tarih: 2024-07-24
  • Bağlantılar: Arxiv, GitHub

RTDETRv2'nin belirleyici özelliklerinden biri, yerel olarak uçtan uca çalışan ve NMS gerektirmeyen tasarımıdır. Son işleme sırasında Maksimum Olmayan Bastırma'yı (NMS) tamamen kaldırarak çıkarım gecikmesini kararlı hâle getirir ve dağıtım işlem hattını basitleştirir. Genel dikkat mekanizması, tüm görüntünün bağlamını aynı anda değerlendirdiği için modelin karmaşık sahneleri anlamada ve yoğun kalabalıklarda başarılı olmasını sağlar.

RTDETRv2 hakkında daha fazla bilgi edin

YOLOv9: Programlanabilir Gradyan Bilgisi#

Yüksek verimlilik sunan CNN tabanlı YOLOv9, derin sinir ağlarının doğasında bulunan bilgi darboğazı sorununu ele alır. Programlanabilir Gradyan Bilgisi (PGI) ve Genelleştirilmiş Verimli Katman Birleştirme Ağı'nı (GELAN) kullanıma sunar.

YOLOv9, kanıtlanmış evrişimli sinir ağı temellerine dayanırken parametre verimliliğini en üst düzeye çıkarır. İleri beslemeli işlem sırasında kritik bilgileri koruyarak ağırlık güncellemelerinin güvenilir olmasını sağlar ve böylece son derece hafif ama yüksek doğruluklu bir model sunar. Ancak RTDETRv2'nin aksine YOLOv9, son işleme aşamasında hâlâ standart NMS'ye dayanır.

YOLOv9 hakkında daha fazla bilgi edin

Performans ve Kaynak Verimliliği#

Bu modelleri üretim için değerlendirirken ortalama hassasiyeti (mAP) hesaplama maliyetiyle dengelemek kritik önem taşır. Aşağıdaki tablo, MS COCO veri kümesindeki performanslarını gösterir.

Modelboyut
(piksel)
mAPval
50-95
Hız
CPU ONNX
(ms)
Hız
T4 TensorRT10
(ms)
parametre
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.226.7
YOLOv9m64051.4-6.4320.176.8
YOLOv9c64053.0-7.1625.5102.8
YOLOv9e64055.6-16.7758.1192.5

Bellek Gereksinimleri ve Eğitim Verimliliği#

RTDETRv2 gibi Transformer'lar, eğitim sırasında belleği yoğun biçimde kullanmalarıyla bilinir; tam olarak yakınsamaları için genellikle önemli miktarda CUDA belleği ve daha uzun eğitim süreleri gerekir. Buna karşılık YOLOv9 ve diğer Ultralytics YOLO modelleri gibi CNN mimarileri çok daha az bellek kullanır ve geliştiricilerin tüketici sınıfı donanımlarda daha büyük yığın boyutlarıyla eğitim yapmasına olanak tanır.

Verimli Eğitim

Donanım kullanımını en üst düzeye çıkarmak için akıcı bulut eğitimi sağlayan Ultralytics Platformundan yararlanmayı düşün. Platform, ortam kurulumunu ve en uygun yığın boyutunu otomatik olarak yönetir.

Ultralytics Avantajı: Ekosistem ve Kullanım Kolaylığı#

Resmî RTDETRv2 veya YOLOv9 GitHub sayfaları gibi bağımsız depoları incelemek öğretici olsa da üretim ortamlarında kararlılık, kullanım kolaylığı ve bakımı iyi yapılan bir ekosistem gerekir. Bu modelleri Ultralytics Python API üzerinden entegre etmek, geliştiricilere sorunsuz bir deneyim sunar.

Birleşik API ve Çok Yönlülük#

Ultralytics çerçevesi; veri yükleme, artırma ve dağıtık eğitim işlemlerinin karmaşıklığını soyutlar. Ayrıca, ilk RTDETRv2 modeli yalnızca algılamaya odaklanırken Ultralytics ekosistemi kullanıcıların Nesne Algılama, Örnek Segmentasyonu ve Poz Tahmini arasında kolayca geçiş yapmasına olanak tanır.

from ultralytics import RTDETR, YOLO

# Özel veriler üzerinde bir YOLOv9 modeli eğit
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=50, imgsz=640)

# Karmaşık sahne değerlendirmesi için RT-DETR'ye kolayca geç
model_rtdetr = RTDETR("rtdetr-l.pt")
results = model_rtdetr.predict("https://ultralytics.com/images/bus.jpg")

# TensorRT gibi üretime hazır biçimlere aktar
model_yolo.export(format="engine")

Kapsamlı dokümantasyon, otomatik deney takibi ve ONNX, TensorRT ve OpenVINO gibi biçimlere sorunsuz aktarım özellikleri sayesinde Ultralytics, prototipten üretime geçiş süresini büyük ölçüde kısaltır.

İdeal Kullanım Alanları#

RTDETRv2'nin Öne Çıktığı Alanlar#

Küresel dikkat mekanizması sayesinde RTDETRv2, sunucu tarafında işleme ve genel bağlamın son derece önemli olduğu ortamlar için güçlü bir seçenektir. Şu alanlarda öne çıkar:

  • Tıbbi Görüntüleme: Çevresindeki bağlamın kritik olduğu ince anormallikleri belirleme.
  • Hava Gözetimi: Geleneksel CNN evrişimlerinin uzamsal yanlılıklarına maruz kalmadan, yüksek çözünürlüklü drone görüntülerindeki küçük nesneleri saptama.
  • Yoğun Kalabalık Analizi: Yoğun örtüşmenin genellikle çapa tabanlı modellerin kafasını karıştırdığı durumlarda bireyleri takip etme.

YOLOv9'un Öne Çıktığı Alanlar#

YOLOv9, kaynakları kısıtlı uç dağıtımlarda öne çıkar. Hesaplama verimliliği onu şu alanlar için ideal kılar:

  • Robotik: En düşük gecikmenin gerektiği gerçek zamanlı navigasyon ve engellerden kaçınma.
  • Akıllı Şehir IoT: Trafik izleme için NVIDIA Jetson gibi uç cihazlara dağıtım.
  • Endüstriyel Denetim: Saniyede yüksek kare hızı (FPS) gerektiren, yüksek hızlı montaj hattı kalite kontrolü.

Gelecek: Ultralytics YOLO26 ile Tanış#

YOLOv9 ve RTDETRv2 büyük ilerlemeler sunsa da alan hızla değişti. Modern dağıtımlar için yeni yayımlanan Ultralytics YOLO26, her iki mimari yaklaşımın ideal birleşimini temsil ediyor.

Transformer'ların ve CNN'lerin en iyi yönlerini bir araya getiren YOLO26, yeni bir standart belirliyor:

  • Uçtan Uca, NMS Gerektirmeyen Tasarım: RTDETRv2 gibi YOLO26 da yerel uçtan uca çıkarımı destekler; daha hızlı, basit ve son derece öngörülebilir dağıtım işlem hatları için nms=False ile NMS son işlemesini atlar.
  • MuSGD Optimize Edici: Büyük Dil Modeli (LLM) eğitim tekniklerinden (Moonshot AI'ın Kimi K2'si gibi) esinlenen YOLO26, SGD ile Muon'un hibritini kullanır. Bu, bilgisayarlı görü alanına benzersiz eğitim kararlılığı ve hızlı yakınsama kazandırır.
  • CPU'da %43'e Varan Hızlı Çıkarım: Ağır transformer'lardan farklı olarak YOLO26, uç bilişim ve GPU içermeyen cihazlar için yoğun biçimde optimize edilmiştir.
  • DFL'nin Kaldırılması: Distribution Focal Loss'un kaldırılması, model grafiğini önemli ölçüde basitleştirerek düşük güçlü uç cihazlara ve gömülü Sinir İşlem Birimlerine (NPU'lar) sorunsuz aktarım sağlar.
  • ProgLoss + STAL: Bu geliştirilmiş kayıp fonksiyonları, IoT ve hava görüntüsü veri kümeleri için kritik olan küçük nesne tanımayı önemli ölçüde iyileştirir.

Yeni bir bilgisayarlı görü projesine başlamak isteyen ekiplere YOLO26'yı değerlendirmelerini önemle öneriyoruz. Transformer'ın isteğe bağlı NMS gerektirmeyen zarafetini, son derece optimize edilmiş bir YOLO mimarisinin yüksek hızı ve eğitim verimliliğiyle birleştirir.

Özet#

RTDETRv2 ile YOLOv9 arasında seçim yapmak büyük ölçüde dağıtım donanımına ve özel doğruluk gereksinimlerine bağlıdır. RTDETRv2, sunucu destekli uygulamalar için en ileri düzeyde doğruluk ve bağlam farkındalığı sunarken YOLOv9, uç cihazlarda olağanüstü verimlilik sağlar.

Ancak geliştiriciler, olgun Ultralytics ekosisteminden yararlanarak hem YOLOv9'u hem de özgün RT-DETR'yi zahmetsizce deneyebilir. Ayrıca YOLO11 gibi daha yeni modellerin ve yerel uçtan uca YOLO26'nın kullanıma sunulmasıyla yüksek hızlı çıkarım, çok yönlü görev desteği ve düşük bellek tüketimi arasında ideal dengeyi bulmak hiç bu kadar kolay olmamıştı.

Yorumlar