Ultralytics YOLO27:
Get Started

RTDETRv2 ve PP-YOLOE+#

Bilgisayarlı görü alanının hızla gelişmesi, karmaşık gerçek zamanlı nesne algılama sorunlarını çözmek için farklı mimari yaklaşımlar ortaya çıkardı. Son dönemdeki en dikkate değer gelişmeler arasında, görsel tanımaya temelden farklı tasarım felsefeleriyle yaklaşan iki güçlü model RTDETRv2 ve PP-YOLOE+ bulunuyor. Her iki model de yüksek performanslı algılama sunmayı hedeflese de temel çalışma biçimleri, eğitim yaklaşımları ve ideal dağıtım senaryoları önemli ölçüde farklılık gösteriyor.

Bu kapsamlı kılavuz, geliştiricilerin ve araştırmacıların kendi dağıtım gereksinimlerine en uygun çözümü seçmesine yardımcı olmak için her iki modelin teknik ayrıntılarını ele alıyor; mimarilerini, performans ölçütlerini ve ekosistem desteğini karşılaştırıyor.

Modellere Genel Bakış#

Performans verilerini incelemeden önce her modelin kökenini ve mimari hedeflerini anlamak önemlidir. Her iki model de Baidu'daki araştırma ekiplerinden çıkmış olsa da nesne algılama ailesinin farklı kollarını temsil ediyor.

RTDETRv2#

RTDETRv2, Transformer tabanlı görsel mimarilerde önemli bir sıçramayı temsil ediyor. Orijinal Gerçek Zamanlı Algılama Transformer'ını temel alarak CNN omurgasını verimli bir hibrit kodlayıcı ve Transformer kod çözücüyle birleştiriyor. En belirgin özelliği yerel uçtan uca tahmin yeteneği; böylece son işlem sırasında Maksimum Olmayan Bastırma (NMS) gereksinimini tamamen ortadan kaldırıyor.

  • Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
  • Kurum: Baidu
  • Tarih: 2024-07-24
  • Arxiv: 2407.17140
  • GitHub: RT-DETR Deposu

RTDETRv2 hakkında daha fazla bilgi edin

PP-YOLOE+#

PP-YOLOE+, yüksek performanslı endüstriyel uygulamalar için büyük ölçüde optimize edilmiş, YOLO serisinin gelişmiş bir yinelemesidir. Bağlantı noktası kullanmayan algılama başlığına sahip, ölçeklenebilir bir CNN mimarisi sunar. Hız ve doğruluk arasında olağanüstü bir denge sağlamak üzere tasarlanan model, küçük nesne algılamayı iyileştirmek için ET-head ve genelleştirilmiş odak kaybı işlevi gibi güçlü tekniklerden yararlanır.

PP-YOLOE+ hakkında daha fazla bilgi edin

Ekosistem Entegrasyonu

Her iki modelin de bağımsız araştırma depoları olsa da birleşik bir API'den ve akıcı dışa aktarma seçeneklerinden yararlanarak orijinal RT-DETR'yi doğrudan Ultralytics Python paketi içinde kolayca deneyebilirsin.

Mimari Farklılıklar#

Bu iki model arasındaki temel fark, görsel bağlamı işleme ve tahmin üretme biçimleridir.

PP-YOLOE+, geleneksel ancak son derece optimize edilmiş bir Evrişimli Sinir Ağı (CNN) omurgası kullanır. Özellikleri çıkarmak için yerel alıcı alanlardan yararlanır; bu da standart dağıtımlarda modeli son derece hızlı ve verimli kılar. Ancak üst üste binen sınırlayıcı kutuları filtrelemek için standart NMS son işlemesi hâlâ gerekir; bu işlem yoğun sahnelerde gecikme darboğazlarına yol açabilir.

Buna karşılık RTDETRv2, Hibrit Kodlayıcı ve Transformer Kod Çözücü kullanır. Böylece model, görüntünün tamamındaki global bağlamı aynı anda yakalayabilir. Dikkat mekanizmaları nesneler arasındaki ilişkileri doğal olarak kavrayarak modelin NMS kullanmadan nihai sınırlayıcı kutuları doğrudan üretmesini sağlar. Bu uçtan uca yaklaşım, algılanan nesne sayısından bağımsız olarak çıkarım gecikmesinin kararlı kalmasını sağlar.

Performans Ölçütleri ve Karşılaştırma#

YOLO performans ölçütlerini değerlendirirken doğruluğu (mAP), hesaplama maliyeti (FLOPs) ve çıkarım hızıyla dengelemek kritik önem taşır. Aşağıdaki tablo, her iki modelin çeşitli boyutlardaki performansını gösteriyor.

Modelboyut
(piksel)
mAPval
50-95
Hız
CPU ONNX
(ms)
Hız
T4 TensorRT10
(ms)
parametre
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
PP-YOLOE+t64039.9-2.844.8519.15
PP-YOLOE+s64043.7-2.627.9317.36
PP-YOLOE+m64049.8-5.5623.4349.91
PP-YOLOE+l64052.9-8.3652.2110.07
PP-YOLOE+x64054.7-14.398.42206.59

PP-YOLOE+x, COCO veri kümesinde %54,7 ile biraz daha yüksek bir mAPval değerine ulaşırken RTDETRv2 modelleri, NMS gerektirmeyen tasarımları sayesinde genellikle tutarlı gecikme avantajıyla rekabetçi doğruluk sunar. Ancak PP-YOLOE+ daha küçük modellerde parametre sayısı ve FLOPs açısından belirgin üstünlüğünü koruyarak uç dağıtımları için son derece verimli hale gelir.

Ultralytics Avantajı: YOLO26 ile Tanış#

RTDETRv2 ve PP-YOLOE+ kendi başlarına güçlü modeller olsa da teknoloji gelişmeye devam ediyor. Hız, doğruluk ve ekosistem desteği arasında en iyi dengeyi arayan geliştiriciler için Ultralytics YOLO26 yeni endüstri standardını temsil ediyor.

YOLO26, CNN'lerin ve Transformer'ların en iyi özelliklerini bir araya getirir. Modern mimarilerin öncülük ettiği, isteğe bağlı uçtan uca ve NMS gerektirmeyen bir çıkarım modu (nms=False) kullanır ve bu mod etkinleştirildiğinde son işlem darboğazlarını ortadan kaldırır. Ayrıca LLM eğitimindeki yeniliklerden esinlenen, son derece kararlı eğitim ve hızlı yakınsama sağlayan devrim niteliğindeki MuSGD Optimize Ediciyi sunar.

Uç Cihazlar İçin Optimize Edildi

Yüksek miktarda CUDA belleği gerektiren ağır Transformer modellerinin aksine YOLO26, DFL Kaldırma (Distribution Focal Loss) özelliğini sunar ve özellikle uç bilişim için optimize edilmiştir; böylece önceki nesillere kıyasla CPU çıkarımını %43'e kadar hızlandırır.

Ayrıca YOLO26 yalnızca basit nesne algılamayla sınırlı değildir. Yerleşik olarak çok yönlüdür; PP-YOLOE+ öncelikli olarak sınırlayıcı kutu algılamaya odaklanırken YOLO26 kutudan çıktığı haliyle örnek segmentasyonunu, poz tahminini ve yönlendirilmiş sınırlayıcı kutuları (OBB) destekler.

Eğitim Yöntemleri ve Ekosistem#

Bağımsız araştırma depolarına kıyasla Ultralytics ekosisteminin öne çıktığı alanlar eğitim verimliliği ve kullanım kolaylığıdır. PP-YOLOE+ PaddlePaddle çerçevesine dayanırken RTDETRv2 çoğu zaman karmaşık ortam kurulumları gerektirir; modelleri Ultralytics aracılığıyla entegre etmek ise sorunsuz bir deneyim sunar.

Ultralytics API'si sayesinde eğitim sırasında daha düşük bellek gereksinimlerinden, otomatik veri kümesi yönetiminden ve basitleştirilmiş hiperparametre ayarından yararlanırsın. Ayrıca modelleri ONNX veya TensorRT gibi üretim biçimlerine tek bir komutla dağıtabilirsin.

Kod Örneği: Akıcı Çıkarım#

Aşağıda, Ultralytics Python paketini kullanarak önerilen YOLO26 modeliyle birlikte RT-DETR'den ne kadar kolay yararlanabileceğini gösteren bir örnek bulunuyor:

from ultralytics import RTDETR, YOLO

# RT-DETR modelini başlat (Ultralytics orijinal RT-DETR-L ve RT-DETR-X modellerini destekler)
model_rtdetr = RTDETR("rtdetr-l.pt")

# Bir test görüntüsünde NMS gerektirmeyen çıkarım yap
results_rtdetr = model_rtdetr("https://ultralytics.com/images/bus.jpg")
results_rtdetr[0].show()

# Daha yüksek hız ve esneklik için en yeni YOLO26 modelini başlat
model_yolo26 = YOLO("yolo26n.pt")

# Optimize edilmiş bellek kullanımıyla YOLO26 modelini zahmetsizce eğit
model_yolo26.train(data="coco8.yaml", epochs=50, imgsz=640)

# TensorRT'ye dışa aktararak uç cihazlara dağıt
model_yolo26.export(format="engine")

Gerçek Dünya Uygulamaları ve Kullanım Alanları#

Bu mimariler arasında seçim yapmak genellikle belirli donanım ve uygulama gereksinimlerine bağlıdır.

  • RTDETRv2, sunucu tarafı ortamlarda ve karmaşık sahneleri anlamada öne çıkar. Küresel dikkat mekanizması, standart NMS algoritmalarının genellikle başarısız olduğu, nesnelerin üst üste bindiği kalabalık yönetimi ve yoğun tıbbi görüntü analizi için son derece etkilidir.
  • PP-YOLOE+, yüksek hızlı endüstriyel denetim ve PaddlePaddle ekosistemine yoğun yatırım yapmış ortamlar için oldukça uygundur. Küçük ölçeklerdeki düşük parametre sayısı, onu bazı robotik uygulamalarında kullanılabilir kılar.
  • Ultralytics YOLO26, kapsamlı ticari dağıtımlar için evrensel olarak önerilen çözümdür. Geliştirilmiş ProgLoss + STAL işlevleriyle, hava aracı operasyonları ve akıllı şehir trafik izleme için kritik olan küçük nesneleri tanıma becerisini önemli ölçüde geliştirir.

Kullanım Alanları ve Öneriler#

RT-DETR ve PP-YOLOE+ arasındaki seçim, projenin özel gereksinimlerine, dağıtım kısıtlarına ve ekosistem tercihlerine bağlıdır.

RT-DETR Ne Zaman Seçilmeli?#

RT-DETR şu durumlar için güçlü bir seçenektir:

  • Transformer Tabanlı Tespit Araştırmaları: NMS kullanmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
  • Gecikme Esnekliğinin Olduğu Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en önemli öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
  • Büyük Nesne Tespiti: Transformer'ların genel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.

PP-YOLOE+'ı Ne Zaman Seçmeli#

PP-YOLOE+ şu durumlarda önerilir:

  • PaddlePaddle Ekosistemiyle Entegrasyon: Altyapısı ve araçları Baidu'nun PaddlePaddle çerçevesi üzerine kurulu kuruluşlar.
  • Paddle Lite ile Uç Dağıtım: Özellikle Paddle Lite veya Paddle çıkarım motoru için optimize edilmiş çıkarım çekirdeklerine sahip donanımlara dağıtım.
  • Sunucu Tarafında Yüksek Doğruluklu Tespit: Çerçeve bağımlılığının önemli olmadığı güçlü GPU sunucularında en yüksek tespit doğruluğuna öncelik veren senaryolar.

Ultralytics'i (YOLO26) Ne Zaman Seçmeli#

Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi bileşimini sunar:

  • NMS Olmadan Uç Dağıtımı: Maksimum Olmayan Bastırma son işleminin karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
  • Yalnızca CPU Kullanılan Ortamlar: YOLO26'nın CPU'da %43'e varan daha hızlı çıkarımının belirleyici bir avantaj sağladığı, özel GPU hızlandırması bulunmayan cihazlar.
  • Küçük Nesne Algılama: ProgLoss ve STAL'ın çok küçük nesnelerde doğruluğu önemli ölçüde artırdığı havadan drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.

Sonuç#

Hem RTDETRv2 hem de PP-YOLOE+, bilgisayarlı görüde mümkün olanın sınırlarını zorlayarak hem Transformer hem de yüksek düzeyde optimize edilmiş CNN mimarilerinin uygulanabilirliğini kanıtladı. Ancak parçalı araştırma kod tabanlarını dağıtmanın karmaşıklığı, üretim takvimlerini aksatabilir.

Modern yapay zekâ mühendisleri, Ultralytics Platform avantajından yararlanabilir. YOLO11 veya en yeni YOLO26 gibi sorunsuz entegre edilen modellere geçiş yapan ekipler, bellek gereksinimlerini ve geliştirme yükünü önemli ölçüde azaltırken mümkün olan en yüksek doğruluk-hız oranlarına ulaşabilir.

Yorumlar