Ultralytics YOLO27:

YOLO11 ve RTDETRv2#

Bilgisayarlı görü alanı hızla genişleyerek geliştiricilere sağlam görü tabanlı uygulamalar oluşturmak için sayısız seçenek sunuyor. Gerçek zamanlı nesne algılama alanında, Evrişimli Sinir Ağları (CNNs) ile Görsel Transformer'lar (ViTs) arasındaki tartışma hiç olmadığı kadar öne çıkıyor. Bu teknik karşılaştırma, iki lider mimariyi ele alıyor: son derece optimize edilmiş CNN çerçevelerinin zirvesini temsil eden YOLO11 ve Detection Transformer ailesinin güçlü bir sürümü olan RTDETRv2.

Bu kılavuz, mimarilerini, performans ölçümlerini ve ideal dağıtım senaryolarını analiz ederek makine öğrenimi mühendislerinin bilinçli kararlar vermesine yardımcı olmayı amaçlıyor. Her iki model de doğruluğun sınırlarını zorlasa da Ultralytics YOLO modelleri genellikle gerçek dünya üretim ortamları için hız, ekosistem desteği ve kullanım kolaylığı arasında üstün bir denge sunuyor.

YOLO11: Gerçek Dünya Çok Yönlülüğü için Referans Model#

Ultralytics tarafından tanıtılan YOLO11, hızlı, doğru ve son derece çok yönlü bir model sunmak için yıllarca süren temel araştırmaların üzerine inşa edilmiştir. Nesne algılama, örnek segmentasyonu, görüntü sınıflandırma, poz tahmini ve yönlendirilmiş sınırlayıcı kutu (OBB) çıkarma işlemlerini yerel olarak sorunsuz şekilde gerçekleştirecek biçimde tasarlanmıştır.

Mimari ve Güçlü Yönler#

YOLO11, geliştirilmiş bir CNN omurgası ve gelişmiş uzaysal özellik piramitleri barındırarak olağanüstü düzeyde kaynak verimliliği sağlar. Hem eğitim hem de çıkarım sırasında minimum bellek ayak izi sunarak katı donanım kısıtlamalarına sahip ortamlarda mükemmel performans gösterir. Ultralytics Platform, farklı MLOps araçlarını bir araya getirme gereksinimi duymadan akıcı model takibi, veri etiketleme ve bulut tabanlı eğitim olanağı tanıyarak YOLO11 için yerel destek sağlar.

Uç bilişimi hedefleyen geliştiriciler için YOLO11 son derece düşük gecikme süresi sunar. Hafif yapısı, Raspberry Pi cihazlarından tüketici sınıfı cep telefonlarına kadar çeşitli cihazlarda verimli şekilde çalışmasını sağlar; bu da onu akıllı perakende, üretimde kalite kontrolü ve otomatik trafik yönetimi için bir standart haline getirir.

RTDETRv2: Baidu'nun Gerçek Zamanlı Transformer'ları#

RTDETRv2 (Gerçek Zamanlı Detection Transformer sürüm 2), Transformer tabanlı mimarileri gerçek zamanlı görevler için uygulanabilir hale getirme konusunda Baidu'nun çabasını temsil eder. Çıkarım gecikmesini artırmadan temel doğruluğu iyileştirmek için "bag-of-freebies" yaklaşımını ekleyerek özgün RT-DETR'ın üzerine inşa edilmiştir.

RT-DETR hakkında daha fazla bilgi edin

Mimari ve Güçlü Yönler#

Geleneksel CNN'lerin aksine RTDETRv2, öz-dikkat mekanizmalarına sahip bir kodlayıcı-kod çözücü mimarisi kullanarak görüntü genelindeki küresel bağlamı yakalamasını sağlar. Bu özellik, örtülmelerin sık görüldüğü kalabalık sahnelerde özellikle avantajlıdır. RTDETRv2, son işleme aşamasında Maksimum Olmayan Bastırma (NMS) gereksinimini ortadan kaldırır; bunun yerine eğitim sırasında bire bir iki parçalı eşleştirme için Hungarian eşleştirmesine dayanır.

Bununla birlikte Transformer modelleri VRAM ve CUDA belleğine karşı ünlü derecede talepkârdır. RTDETRv2'yi sıfırdan eğitmek veya özel veri kümelerinde ince ayar yapmak genellikle üst düzey GPU kümeleri gerektirir; bu durum, Ultralytics modellerinin hafif eğitim ayak izine kıyasla daha küçük ve çevik ekipler için engel oluşturabilir.

Performans ve Ölçüm Analizi#

Bu modelleri standart COCO veri kümesi üzerinde değerlendirdiğimizde parametreler, FLOP'lar ve ham doğruluk arasında belirgin ödünleşimler gözlemliyoruz.

Modelboyut
(piksel)
mAPval
50-95
Hız
CPU ONNX
(ms)
Hız
T4 TensorRT10
(ms)
parametre
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

Sonuçları Ayrıntılı İnceleme#

Tabloda görüldüğü üzere YOLO11, performans-boyut açısından inanılmaz bir oran sunuyor. YOLO11x, RTDETRv2-x'e (54.3) kıyasla daha yüksek mAPval (54.7) değerine ulaşırken önemli ölçüde daha az parametre (56.9M'e karşı 76M) ve çok daha az hesaplama FLOP'u (194.9B'ye karşı 259B) kullanıyor.

Ayrıca YOLO11'in T4 TensorRT üzerindeki çıkarım hızları son derece yüksek. YOLO11s çıkarımı yalnızca 2.5 ms'de tamamlarken en küçük RTDETRv2-s modeli bunu 5.03 ms'de gerçekleştiriyor. Bu durum, kare işleme süresinin temel darboğaz olduğu yüksek hızlı, gerçek zamanlı video analizi akışları için YOLO11'i kesin tercih haline getiriyor.

Transformer'ların Maliyeti

RTDETRv2, dikkat katmanları sayesinde mükemmel doğruluk elde etse de bu mekanizmalar görüntü çözünürlüğüyle karesel olarak ölçeklenir ve hem eğitim hem de çıkarım sırasında daha yüksek VRAM tüketimine yol açar. YOLO11 ise bunu hiper verimli evrişimli bloklarıyla aşar.

Eğitim Ekosistemi ve Kullanılabilirlik#

Bir Ultralytics modelini benimsemenin temel avantajı, onu çevreleyen ekosistemde yatar. RTDETRv2'yi eğitmek genellikle karmaşık, araştırma düzeyindeki depolarda gezinmeyi, karmaşık iki parçalı eşleştirme kaybı ağırlıklarını ayarlamayı ve önemli bellek ek yükünü yönetmeyi gerektirir.

Buna karşılık Ultralytics, geliştirici deneyimine büyük önem verir. Birleşik Python API'si kalıp kodunu soyutlar, deney takibi için Weights & Biases gibi araçlarla sorunsuz şekilde entegre olur ve veri artırmalarını otomatik olarak yönetir.

ultralytics paketini kullanarak bir modeli eğitmenin ve dışa aktarmanın ne kadar kolay olduğunu burada görebilirsin:

from ultralytics import YOLO

# Initialize YOLO11 model with pre-trained weights
model = YOLO("yolo11n.pt")

# Train the model efficiently on a local GPU or cloud instance
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Utilize CUDA GPU
)

# Export the trained model to ONNX for widespread deployment
export_path = model.export(format="onnx")

Eğitim tamamlandıktan sonra bir YOLO11 modelini ONNX, OpenVINO veya CoreML gibi formatlara aktarmak yalnızca tek bir komut gerektirir; böylece görü işlem hattının farklı donanım arka uçları arasında zahmetsizce ölçeklenmesi sağlanır.

Çoklu Görev Yetenekleri

RTDETRv2'nin yalnızca sınırlayıcı kutu algılamaya odaklandığını, YOLO11 mimarisinin ise yerel olarak poz tahminini ve örnek segmentasyonunu desteklediğini unutma. Bu sayede birden fazla görü görevini tek bir model ailesinde birleştirebilirsin.

Kullanım Alanları ve Öneriler#

YOLO11 ve RT-DETR arasındaki seçim, özel proje gereksinimlerine, dağıtım kısıtlarına ve ekosistem tercihlerine bağlıdır.

YOLO11 Ne Zaman Seçilmeli?#

YOLO11 şu durumlar için güçlü bir seçenektir:

  • Üretim Ortamında Uç Dağıtım: Güvenilirliğin ve aktif bakımın büyük önem taşıdığı Raspberry Pi veya NVIDIA Jetson gibi cihazlardaki ticari uygulamalar.
  • Çok Görevli Görü Uygulamaları: Tek bir birleşik framework içinde algılama, bölütleme, poz tahmini ve OBB gerektiren projeler.
  • Hızlı Prototipleme ve Dağıtım: Kolaylaştırılmış Ultralytics Python API kullanarak veri toplamadan üretime hızla geçmesi gereken ekipler.

RT-DETR Ne Zaman Seçilmeli?#

RT-DETR şu durumlarda önerilir:

  • Transformer Tabanlı Tespit Araştırması: NMS olmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
  • Esnek Gecikmeyle Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en yüksek öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
  • Büyük Nesne Tespiti: Transformer'ların küresel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.

Ultralytics (YOLO26) Ne Zaman Seçilmeli?#

Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi birleşimini sunar:

  • NMS'siz Uç Dağıtımı: Maksimum Olmayan Bastırma son işleme karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
  • Yalnızca CPU Kullanılan Ortamlar: Özel GPU hızlandırması olmayan ve YOLO26'nın %43'e varan daha hızlı CPU çıkarımının belirleyici bir avantaj sağladığı cihazlar.
  • Küçük Nesne Algılama: ProgLoss ve STAL'ın küçük nesnelerde doğruluğu önemli ölçüde artırdığı hava drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.

Geleceğe Bakış: YOLO26'nın Gücü#

YOLO11 mükemmel bir üretim tercihi olsa da en ileri teknolojiyi arayan ekipler YOLO26 modelini ciddi şekilde değerlendirmelidir. Ocak 2026'da yayımlanan YOLO26, doğrudan çekirdeğine Uçtan Uca NMS'siz Tasarım'ı (ilk olarak YOLOv10'da öncülük edilmiştir) dahil ederek mimari boşluğu kapatır ve son işleme gecikmesini ve dağıtım mantığının karmaşıklığını tamamen ortadan kaldırır.

YOLO26 ayrıca birçok devrim niteliğinde özellik sunar:

  • MuSGD Optimizer: Moonshot AI'nin Kimi K2 LLM eğitim tekniklerinden ilham alan bu SGD ve Muon hibriti, son derece kararlı eğitim ve çok daha hızlı yakınsama sağlar.
  • DFL'nin Kaldırılması: Distribution Focal Loss, daha temiz ve basitleştirilmiş bir dışa aktarma süreci için kaldırılmış; düşük güçlü uç cihazlarla uyumluluk büyük ölçüde iyileştirilmiştir.
  • ProgLoss + STAL: Bu gelişmiş kayıp işlevleri, drone gözetimi, tarımsal izleme ve IoT uç sensörleri için kritik bir gereksinim olan küçük nesne tanımada kayda değer iyileştirmeler sağlar.
  • %43'e Kadar Daha Hızlı CPU Çıkarımı: Özel GPU'lara sahip olmayan dağıtımlar için YOLO26, CPU üzerinde çalışacak şekilde özel olarak optimize edilmiştir ve önceki nesillerden çok daha iyi performans gösterir.

Daha geniş bir mimari yelpazesini keşfetmek isteyenler için Ultralytics belgeleri ayrıca YOLOv8, yaygın olarak benimsenen YOLOv5 ve açık kelime dağarcıklı algılama uygulamalarına yönelik YOLO-World gibi özel modeller hakkında bilgiler sunar. Sonuç olarak, ister YOLO11'in kanıtlanmış kararlılığına ister YOLO26'nın çığır açan yeniliklerine öncelik ver, Ultralytics ekosistemi bilgisayarlı görü çözümlerini hayata geçirmen için eşsiz araçlar sunar.

Yorumlar