YOLOX ve RTDETRv2#
Bilgisayarlı görü uygulamaları için en uygun mimariyi seçmek; doğruluk, çıkarım hızı ve dağıtımın uygulanabilirliği arasında dikkatli bir denge kurmayı gerektirir. Bu kapsamlı teknik analizde, son derece başarılı bağlayıcısız bir CNN mimarisi olan YOLOX ile son teknoloji ürünü gerçek zamanlı algılama Transformer'ı RTDETRv2 arasındaki temel farkları inceliyoruz.
Her iki model de nesne algılama alanına önemli katkılarda bulunmuş olsa da üretime hazır uygulamalar geliştiren kişiler, Ultralytics YOLO26 gibi modern alternatiflerin daha verimli eğitim, daha düşük bellek gereksinimleri ve daha sağlam bir dağıtım ekosistemi sunduğunu görüyor.
YOLOX: Araştırma ile Sektör Arasındaki Boşluğu Kapatıyor#
YOLOX, YOLO serisinin oldukça popüler bağlayıcısız bir uyarlaması olarak ortaya çıktı ve yayımlandığı dönemde etkileyici performans artışları sağlayan basitleştirilmiş bir tasarım sundu.
- Yazarlar: Zheng Ge, Songtao Liu, Feng Wang, Zeming Li ve Jian Sun
- Kuruluş: Megvii
- Tarih: 18 Temmuz 2021
- Bağlantılar: Arxiv, GitHub, Belgeler
Mimari Yenilikler#
YOLOX, ayrık bir başlığı ve gelişmiş SimOTA etiket atama stratejisini entegre ederek YOLO ailesini bağlayıcısız bir yaklaşıma taşıdı. Bağlayıcı kutuları ortadan kaldıran mimari, tasarım parametrelerinin sayısını önemli ölçüde azalttı ve çeşitli kıyaslama veri kümelerinde genelleme başarısını artırdı. YOLOX-Nano ve YOLOX-Tiny gibi hafif sürümler, uç cihazlarda görsel yapay zekâ uygulamaları dağıtmak için popüler seçenekler hâline geldi.
YOLOX kayda değer ilerlemeler sağlasa da yoğun veri artırma işlem hatlarına ve eski son işleme rutinlerine (geleneksel NMS gibi) dayanması, yerel olarak uçtan uca çalışan modellere kıyasla daha yüksek gecikmeye yol açabilir.
YOLOX hakkında daha fazla bilgi edin
RTDETRv2: Gerçek Zamanlı Görsel Transformer'ları Geliştiriyor#
RTDETRv2, önceki sürümünün temelleri üzerine inşa edilerek gerçek zamanlı çıkarım hızından ödün vermeden son derece rekabetçi doğruluk elde etmek için Görsel Transformer'ların (ViT'ler) gücünden yararlanıyor.
- Yazarlar: Wenyu Lv, Yian Zhao, Qinyao Chang, Kui Huang, Guanzhong Wang ve Yi Liu
- Kurum: Baidu
- Tarih: 2024-07-24
- Bağlantılar: Arxiv, GitHub
Mimari Yenilikler#
RTDETRv2, Maksimum Olmayan Bastırmayı (NMS) yerel olarak atlayan Transformer tabanlı bir mimari kullanarak algılama işlem hattını temelden yeniden tasarlıyor. Bunu, nesne sorgularının başlatılmasını iyileştiren hibrit bir kodlayıcı ve IoU duyarlı sorgu seçimiyle sağlıyor. Model, çok ölçekli özellikleri etkili biçimde işleyerek gece trafik videosu algılama gibi karmaşık ortamlardaki ince ayrıntıları yakalayabiliyor.
Ancak Transformer modelleri doğaları gereği yoğun kaynak kullanır. RTDETRv2'yi eğitmek genellikle CNN tabanlı alternatiflere kıyasla çok daha fazla GPU belleği ve hesaplama süresi gerektirir; bu durum, sıkı bütçe kısıtlarıyla çalışan veya sık sık model ayarı yapması gereken ekipler için engel oluşturabilir.
RTDETRv2 hakkında daha fazla bilgi edin
Performans Karşılaştırma Tablosu#
Bu mimarileri nesnel biçimde değerlendirmek için COCO veri kümesindeki performanslarını inceliyoruz. Aşağıdaki tablo; doğruluk (mAP), parametre sayısı ve hesaplama karmaşıklığı arasındaki ödünleşimleri gösteriyor.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLOXnano | 416 | 25.8 | - | - | 0.91 | 1.08 |
| YOLOXtiny | 416 | 32.8 | - | - | 5.06 | 6.45 |
| YOLOXs | 640 | 40.5 | - | 2.56 | 9.0 | 26.8 |
| YOLOXm | 640 | 46.9 | - | 5.43 | 25.3 | 73.8 |
| YOLOXl | 640 | 49.7 | - | 9.04 | 54.2 | 155.6 |
| YOLOXx | 640 | 51.1 | - | 16.1 | 99.1 | 281.9 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
RTDETRv2 etkileyici bir doğruluk sunsa da özellikle Nano ve Tiny varyantlarıyla YOLOX, hafif parametre profilleri açısından avantajını koruyor.
Kullanım Alanları ve Öneriler#
YOLOX ile RT-DETR arasında seçim yapmak, projenin özel gereksinimlerine, dağıtım kısıtlarına ve ekosistem tercihlerine bağlıdır.
YOLOX Ne Zaman Seçilmeli#
YOLOX şu durumlarda iyi bir tercihtir:
- Çapasız Algılama Araştırmaları: Yeni algılama başlıklarını veya kayıp fonksiyonlarını denemek için YOLOX'in yalın, çapasız mimarisini temel alan akademik araştırmalar.
- Ultra Hafif Uç Cihazlar: YOLOX-Nano sürümünün son derece küçük boyutunun (0.91M parametre) kritik olduğu mikrodenetleyicilere veya eski mobil donanımlara dağıtım.
- SimOTA Etiket Atama Çalışmaları: Optimal taşıma tabanlı etiket atama stratejilerini ve bunların eğitim yakınsaması üzerindeki etkilerini inceleyen araştırma projeleri.
RT-DETR Ne Zaman Seçilmeli?#
RT-DETR şu durumlarda önerilir:
- Transformer Tabanlı Tespit Araştırmaları: NMS kullanmadan uçtan uca nesne tespiti için dikkat mekanizmalarını ve Transformer mimarilerini inceleyen projeler.
- Gecikme Esnekliğinin Olduğu Yüksek Doğruluk Gerektiren Senaryolar: Tespit doğruluğunun en önemli öncelik olduğu ve biraz daha yüksek çıkarım gecikmesinin kabul edilebildiği uygulamalar.
- Büyük Nesne Tespiti: Transformer'ların genel dikkat mekanizmasının doğal bir avantaj sağladığı, çoğunlukla orta ve büyük nesneler içeren sahneler.
Ultralytics'i (YOLO26) Ne Zaman Seçmeli#
Yeni projelerin çoğu için Ultralytics YOLO26, performans ve geliştirici deneyiminin en iyi bileşimini sunar:
- NMS Olmadan Uç Dağıtımı: Maksimum Olmayan Bastırma son işleminin karmaşıklığı olmadan tutarlı ve düşük gecikmeli çıkarım gerektiren uygulamalar.
- Yalnızca CPU Kullanılan Ortamlar: YOLO26'nın CPU'da %43'e varan daha hızlı çıkarımının belirleyici bir avantaj sağladığı, özel GPU hızlandırması bulunmayan cihazlar.
- Küçük Nesne Algılama: ProgLoss ve STAL'ın çok küçük nesnelerde doğruluğu önemli ölçüde artırdığı havadan drone görüntüleri veya IoT sensör analizi gibi zorlu senaryolar.
Ultralytics'in Avantajı: YOLO26#
Hem YOLOX hem de RTDETRv2 kendine özgü güçlü yönler sunsa da yeni yayımlanan Ultralytics YOLO26, hız, doğruluk ve dağıtım kolaylığı arasındaki tarihsel ödünleşimleri gidererek görsel yapay zekâ alanında en gelişmiş teknolojinin sınırlarını yeniden belirliyor.
1. Uçtan Uca NMS'siz Mimari#
CNN'lerin verimliliğini korurken Transformer modellerinden ilham alan YOLO26, isteğe bağlı uçtan uca NMS'siz bir tasarıma (nms=False) sahip. Maksimum Olmayan Bastırmayı bir son işleme adımı olmaktan çıkaran YOLO26, karmaşık eşik ayarlarının yükünü ortadan kaldırarak dağıtım işlem hatlarını büyük ölçüde basitleştiriyor ve çeşitli uç cihazlarda tutarlı çıkarım gecikmesi sağlıyor.
2. CPU Çıkarımında %43'e Kadar Daha Yüksek Hız#
Üst düzey GPU'lara yoğun biçimde dayanan RTDETRv2 gibi Transformer mimarilerinin aksine YOLO26, özellikle uç bilişim ortamları için optimize edildi. Distribution Focal Loss (DFL) yöntemini kaldırarak model dışa aktarımını kolaylaştırıyor ve CPU çıkarımını %43'e kadar hızlandırıyor. Böylece Raspberry Pi gibi donanımlara veya standart mobil cihazlara entegrasyon için ideal bir seçenek oluyor.
3. MuSGD ile Eğitim Verimliliği#
Transformer modellerini eğitmek çoğu zaman aşırı CUDA bellek tüketimine ve uzun eğitim sürelerine yol açar. YOLO26, Stokastik Gradyan İnişi ile LLM'lerden ilham alan Muon optimizasyon yöntemini birleştiren yeni MuSGD Optimizer'ı sunuyor. Bu yenilik, son derece kararlı bir eğitim ve daha hızlı yakınsama sağlarken RTDETRv2'ye kıyasla donanım gereksinimlerini önemli ölçüde düşürüyor.
4. Rakipsiz Ekosistem ve Çok Yönlülük#
Ultralytics ekosistemi, sezgisel ve sorunsuz bir geliştirici deneyimi sunar. Kapsamlı belgeler, etkin topluluk desteği ve bulut destekli Ultralytics Platform sayesinde yapay zekâ yaşam döngüsünün tamamını yönetmek hiç bu kadar kolay olmamıştı. Ayrıca YOLO26 son derece çok yönlüdür. Nesne algılamaya odaklanan RTDETRv2'nin aksine YOLO26, örnek segmentasyonunu, görüntü sınıflandırmasını, poz tahminini ve Yönlendirilmiş Sınırlayıcı Kutu (OBB) görevlerini yerel olarak sorunsuz biçimde destekler. Yeni ProgLoss + STAL (İlerlemeli Kayıp ve Küçük Hedef Duyarlı Etiket Ataması) ile geliştirilen YOLO26, hava görüntüleri ve endüstriyel kusur algılama için kritik bir özellik olan küçük nesne tanımada da öne çıkar.
Ultralytics ile Sorunsuz Entegrasyon#
Model dağıtmak, karmaşık ve parçalı kod tabanlarıyla uğraşmayı gerektirmemeli. Ultralytics Python API, en gelişmiş modelleri yalnızca birkaç satır kodla yüklemene, eğitmene ve dışa aktarmana olanak tanır.
from ultralytics import YOLO
# Uç performansı için en güncel YOLO26 nano modelini yükle
model = YOLO("yolo26n.pt")
# Bellek yükünü en aza indirerek modeli özel veri kümenle eğit
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Modelin performansını doğrula
metrics = model.val()
# Dağıtım için ONNX veya TensorRT biçimine sorunsuzca aktar
model.export(format="onnx")Ultralytics'ten yararlanarak araştırma depolarında sıkça karşılaşılan karmaşık ortam yapılandırmalarını atlayabilir ve pazara sunma süreni kısaltabilirsin.
Sonuç#
YOLOX ve RTDETRv2, gerçek zamanlı nesne algılamanın gelişiminde önemli kilometre taşlarıdır. YOLOX, son derece verimli bağlayıcısız CNN'lerin uygulanabilirliğini kanıtlarken RTDETRv2, Transformer modellerini gerçek zamanlı kısıtlamalara başarıyla uyarladı.
Ancak akıllı perakende analitiğinden gömülü robotik sistemlere kadar uzanan modern uygulamalar için Ultralytics YOLO26 kesin çözümü sunuyor. NMS'siz çıkarımı rakipsiz CPU hızları, daha düşük bellek kullanımı ve Ultralytics Platform'un güçlü desteğiyle birleştiren YOLO26, geliştiricilerin yeni nesil güvenilir ve yüksek performanslı bilgisayarlı görü sistemleri kurmasını sağlıyor.