DAMO-YOLO ve YOLOv7#
Bilgisayarlı görü alanının hızla gelişmesi, hassasiyet ile hesaplama maliyetini dengelemek üzere tasarlanmış son derece verimli nesne algılama modellerinin ortaya çıkmasını sağladı. 2022'de tanıtılan iki önemli model DAMO-YOLO ve YOLOv7'dir. Her ikisi de gerçek zamanlı görüntü işleme görevlerinin sınırlarını zorlamayı amaçlasa da sonuçlara çok farklı mimari yaklaşımlar ve eğitim yöntemleriyle ulaşır.
Bu kapsamlı teknik karşılaştırma, makine öğrenimi mühendislerinin kendi bilgisayarlı görü uygulamaları için doğru aracı seçmelerine yardımcı olmak üzere her iki modelin farklı yaklaşımlarını inceliyor; mimarileri, dağıtım potansiyelleri ve performans ölçütlerini ele alıyor.
Model Kökenleri ve Meta Verileri#
Derin teknik analize geçmeden önce bu iki bilgisayarlı görü modelinin kökenlerini bağlam içine oturtmak önemlidir.
DAMO-YOLO#
Alibaba Group araştırmacıları tarafından geliştirilen DAMO-YOLO, otomatik mimari araması ve damıtım yoluyla hem hızı hem de doğruluğu optimize etmek amacıyla tanıtıldı.
- Yazarlar: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang ve Xiuyu Sun
- Kuruluş: Alibaba Group
- Tarih: 23 Kasım 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
DAMO-YOLO hakkında daha fazla bilgi edin
YOLOv7#
2022 ortasında son teknoloji bir model olarak yayımlanan YOLOv7, dağıtım maliyetlerini artırmadan eğitilebilir "ücretsiz avantajlar paketi" tekniklerini sunarak gerçek zamanlı çıkarımı daha ileri taşıdı.
- Yazarlar: Chien-Yao Wang, Alexey Bochkovskiy ve Hong-Yuan Mark Liao
- Kurum: Institute of Information Science, Academia Sinica, Taiwan
- Tarih: 6 Temmuz 2022
- Arxiv: 2207.02696
- Belgeler: YOLOv7 Belgeleri
YOLOv7 hakkında daha fazla bilgi edin
Ultralytics, YOLOv7 ağırlıklarını veya YAML dosyalarını yayımlamadığından YOLOv7, Ultralytics paketiyle yerel olarak eğitilemez. Kaynak depoda eğitilmiş YOLOv7 modelleri ONNX veya TensorRT biçimine aktarılabilir ve Ultralytics ile çıkarım için çalıştırılabilir.
Mimari Yenilikler#
DAMO-YOLO: NAS ve Damıtım#
DAMO-YOLO, en yüksek verimliliği hedefleyen çeşitli ileri teknikleri bir araya getirir:
- NAS Omurgaları: Gecikmenin kritik olduğu ortamlar için tasarlanmış en uygun omurgaları (MAE-NAS) otomatik olarak oluşturmak üzere Sinir Ağı Mimarisi Aramasından (NAS) yararlanır.
- Verimli RepGFPN: Birden fazla ölçekte özellik birleştirme verimliliğini önemli ölçüde artıran, değiştirilmiş bir Genelleştirilmiş Özellik Piramidi Ağı.
- ZeroHead ve AlignedOTA: Hesaplama yükünü azaltmak için hafif bir algılama başlığı ve optimize edilmiş bir etiket atama stratejisi (AlignedOTA) kullanır.
- Damıtım İyileştirmesi: Parametre sayılarını artırmadan daha küçük model varyantlarının performansını yükseltmek için eğitim sırasında bilgi damıtımından yoğun biçimde yararlanır.
YOLOv7: E-ELAN ve Ücretsiz Avantajlar Paketi#
YOLOv7, gradyan yolu optimizasyonuna ve güçlü eğitim stratejilerine odaklanan daha yapısal bir mühendislik yaklaşımı benimsedi.
- E-ELAN Mimarisi: Genişletilmiş Verimli Katman Birleştirme Ağı, en kısa ve en uzun gradyan yollarını denetleyerek modelin daha çeşitli özellikler öğrenmesini sağlar ve öğrenmenin etkili biçimde yakınsamasına yardımcı olur.
- Model Ölçekleme: Birleştirme tabanlı modellere özel bileşik bir ölçekleme yöntemi sunarak yapısal uyum için derinliği ve genişliği eş zamanlı olarak ölçekler.
- Eğitilebilir Ücretsiz Avantajlar Paketi: Kimlik bağlantıları içermeyen yeniden parametrelendirilmiş evrişimler (RepConv) ve dinamik etiket atama stratejileri gibi teknikleri kullanır; bunlar çıkarım hızını etkilemeden eğitim sırasında doğruluğu artırır.
Performans Analizi#
ortalama Hassasiyet (mAP), hız ve verimlilik değerlendirilirken her iki model de etkileyici ölçütler sergiler; ancak modeller biraz farklı segmentleri hedefler. YOLOv7, yüksek doğruluklu GPU dağıtımına yoğun biçimde odaklanırken DAMO-YOLO'nun NAS ile elde edilen yapıları, CPU ve uç cihazlarda düşük gecikmeli dağıtımı hedefler.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Ölçütlerde görüldüğü gibi DAMO-YOLO son derece hafif varyantlar sunsa da (yalnızca 8,5 milyon parametreye sahip tiny model gibi), YOLOv7 genel olarak daha yüksek bir doğruluk zirvesine ulaşır; YOLOv7x, COCO veri kümesinde etkileyici 53,1 mAP değerine erişir.
Ultralytics Ekosisteminin Avantajı#
Teorik mimari önemli olsa da bir modelin pratik kullanışlılığını ekosistemi belirler. YOLO26 gibi yerel Ultralytics modelleri, bakımı iyi yapılan bir ekosistemden ve benzersiz kullanım kolaylığından yararlanır.
- Performans Dengesi: Ultralytics modelleri çıkarım hızı ile algılama doğruluğu arasında sürekli olarak ideal bir denge kurar; bu sayede hem uç cihazlarda hem de bulut tabanlı model dağıtımlarında kullanıma uygundur.
- Bellek Gereksinimleri: Daha ağır Transformer tabanlı modellerden farklı olarak Ultralytics YOLO modelleri eğitim sırasında düşük CUDA bellek gereksinimlerini korur. Bu sayede daha büyük yığın boyutları kullanabilir ve tüketici sınıfı donanımlarda bile eğitim sürecini kolaylaştırabilirsin.
- Esneklik: Ultralytics çerçevesi, nesne algılamanın yanı sıra Örnek Segmentasyonu ve Poz Tahmini gibi görevleri de kapsayarak geliştiricilere eksiksiz bir bilgisayarlı görü araç seti sunar.
Ultralytics paketi, yüksek düzeyde optimize edilmiş veri yükleyicilerden ve önceden eğitilmiş ağırlıklardan yararlanarak veri kümelerinden tamamen eğitilmiş bir modele dakikalar içinde sorunsuzca geçmeni sağlar.
Kod Örneği: Ultralytics ile YOLOv7 Çalıştırma#
Yukarı akıştaki YOLOv7 ONNX dışa aktarımını YOLOv7 kullanım örneklerinde açıklandığı şekilde dönüştürdükten sonra Ultralytics Python API ile çalıştırabilirsin.
from ultralytics import YOLO
# Ultralytics için dönüştürülmüş bir YOLOv7 ONNX modelini yükle
model = YOLO("yolov7-ultralytics.onnx", task="detect")
# Çıkarımı çalıştır
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)Yeni Standart: YOLO26 ile Tanış#
YOLOv7 ve DAMO-YOLO 2022'de önemli atılımları temsil etse de görüntü işleme alanındaki yapay zekâ hızla ilerliyor. Bugün yeni projelere başlayan ekipler için önerilen model, Ocak 2026'da yayımlanan son teknoloji Ultralytics YOLO26 modelidir.
YOLO26, son teknoloji yenilikleri bir araya getirerek performans ve kullanılabilirlikte nesiller arası bir sıçrama sunar:
- Uçtan Uca, NMS İçermeyen Tasarım: YOLO26 yerel bir uçtan uca başlık (
nms=False) sunar. Maksimum Olmayan Bastırma (NMS) son işlem adımını ortadan kaldırarak daha hızlı ve daha basit dağıtım mantığı sağlar; bu yaklaşımın öncülüğünü YOLOv10 yapmıştır. - MuSGD İyileştiricisi: Moonshot AI'ın Kimi K2'si gibi büyük dil modeli yeniliklerinden ilham alan YOLO26, SGD ile Muon'un birleşimini kullanır. Bu iyileştirici, son derece kararlı eğitim dinamikleri ve çok daha hızlı yakınsama oranları sağlar.
- %43'e Kadar Daha Hızlı CPU Çıkarımı: Dağılım Odaklı Kayıp'ın (DFL) hedefli biçimde kaldırılması ve kapsamlı yapısal iyileştirmeler sayesinde YOLO26, düşük güç tüketimli uç bilişim için kapsamlı biçimde optimize edilmiştir ve GPU dışı donanımlarda önceki nesillerden daha iyi performans gösterir.
- ProgLoss + STAL: Havadan çekilmiş görüntüler, robotik ve güvenlik izleme uygulamaları için temel bir yetenek olan küçük nesne tanımayı açıkça hedefleyen ve geliştiren yeni, gelişmiş kayıp işlevlerini içerir.
- Göreve Özel İyileştirmeler: YOLO26, standart algılamanın ötesinde segmentasyon için çok ölçekli prototipleme, poz tahmini için RLE ve Yönlendirilmiş Sınırlayıcı Kutular (OBB) için özel açı kayıpları dâhil olmak üzere farklı görevlere yönelik iyileştirmeler içerir.
İdeal Kullanım Alanları#
Doğru mimariyi seçmek tamamen hedef dağıtım ortamına ve proje kısıtlarına bağlıdır.
DAMO-YOLO'yu ne zaman seçmelisin:
- Parametre sayısının son derece düşük tutulması gereken, kaynakları kısıtlı uç ortamlarda (ör. mikrodenetleyiciler) çalışıyorsun.
- Alibaba'nın özel bulut hizmetleriyle bütünleşik otomatik makine öğrenimi işlem hatlarından yararlanıyorsun.
YOLOv7'yi ne zaman seçmelisin:
- Çapa tabanlı, yüksek doğruluklu çıkarım için hâlihazırda optimize edilmiş eski GPU işlem hatların var.
- Gerçek zamanlı doğruluğun kritik önem taşıdığı, yüksek hızlı otonom araçlar veya gelişmiş robotik gibi ortamlarda çalışıyorsun.
YOLO26'yı ne zaman seçmelisin (Önerilen):
- Sıfırdan yeni bir bilgisayarlı görü uygulaması geliştiriyor ve hem hassasiyet hem de CPU/uç çıkarım hızı açısından mutlak en ileri düzey performansa ihtiyaç duyuyorsun.
- NMS operatörü kısıtlamalarıyla uğraşmadan hızlı ve sorunsuz dağıtım (örneğin CoreML veya TensorRT dışa aktarımı) gerekiyor.
- Bulut eğitimi, veri kümesi yönetimi ve otomatik dağıtım için Ultralytics Platform yeteneklerinin tamamından yararlanmak istiyorsun.
Ultralytics modellerinin güçlü ekosisteminden yararlanan geliştiriciler, gerçek dünya uygulamalarında üst düzey tahmin performansı elde ederken mühendislik için harcadıkları zamanı önemli ölçüde azaltabilir.