DAMO-YOLO ve YOLOv7#
Bilgisayarlı görü alanındaki hızlı gelişim, kesinlik ile hesaplama maliyetini dengelemek üzere tasarlanmış, son derece verimli nesne algılama modellerinin ortaya çıkmasını sağladı. 2022'de tanıtılan iki dikkat çekici model DAMO-YOLO ve YOLOv7'dir. Her ikisi de gerçek zamanlı görü görevlerinin sınırlarını zorlamayı amaçlasa da sonuçlarına büyük ölçüde farklı mimari yaklaşımlar ve eğitim yöntemleriyle ulaşır.
Bu kapsamlı teknik karşılaştırma, her iki modelin farklı yaklaşımlarını inceler; makine öğrenimi mühendislerinin kendi bilgisayarlı görü uygulamaları için doğru aracı seçmesine yardımcı olmak üzere mimarilerini, dağıtım potansiyellerini ve performans metriklerini ele alır.
Model Kökenleri ve Meta Verileri#
Ayrıntılı teknik analize geçmeden önce, bu iki bilgisayarlı görü modelinin kökenlerini bağlam içine yerleştirmek önemlidir.
DAMO-YOLO#
Alibaba Group araştırmacıları tarafından geliştirilen DAMO-YOLO, otomatik mimari arama ve damıtma yoluyla hem hızı hem de kesinliği optimize etmek amacıyla tanıtıldı.
- Yazarlar: Xianzhe Xu, Yiqi Jiang, Weihua Chen, Yilun Huang, Yuan Zhang ve Xiuyu Sun
- Kuruluş: Alibaba Group
- Tarih: 23 Kasım 2022
- Arxiv: 2211.15444v2
- GitHub: tinyvision/DAMO-YOLO
DAMO-YOLO hakkında daha fazla bilgi edin
YOLOv7#
2022'nin ortalarında son teknoloji bir model olarak yayımlanan YOLOv7, dağıtım maliyetlerini artırmadan eğitilebilir "bedava kazanımlar paketi" sunarak gerçek zamanlı çıkarımı daha ileri taşıdı.
- Yazarlar: Chien-Yao Wang, Alexey Bochkovskiy ve Hong-Yuan Mark Liao
- Kuruluş: Institute of Information Science, Academia Sinica, Taiwan
- Tarih: 6 Temmuz 2022
- Arxiv: 2207.02696
- Belgeler: YOLOv7 Belgeleri
YOLOv7 hakkında daha fazla bilgi edin
YOLOv7, Ultralytics ekosistemi içinde resmi olarak desteklenir ve birleşik bir API ile sorunsuz eğitim, doğrulama ve dışa aktarma olanağı sunar.
Mimari Yenilikler#
DAMO-YOLO: NAS ve Damıtma#
DAMO-YOLO, en yüksek verimliliği hedefleyen çeşitli son teknoloji teknikleri bir araya getirir:
- NAS Omurgaları: Gecikmenin kritik olduğu ortamlar için uyarlanmış en uygun omurgaları (MAE-NAS) otomatik olarak tasarlamak üzere Sinirsel Mimari Arama'yı (NAS) kullanır.
- Verimli RepGFPN: Birden fazla ölçekte özellik birleştirme verimliliğini önemli ölçüde artıran, değiştirilmiş bir Genelleştirilmiş Özellik Piramidi Ağıdır.
- ZeroHead ve AlignedOTA: Hesaplama yükünü azaltmak için hafif bir algılama başlığı ve optimize edilmiş bir etiket atama stratejisi (AlignedOTA) kullanır.
- Damıtma Geliştirmesi: Daha küçük model varyantlarının performansını parametre sayılarını artırmadan yükseltmek için eğitim sırasında bilgi damıtmadan yoğun biçimde yararlanır.
YOLOv7: E-ELAN ve Bedava Kazanımlar Paketi#
YOLOv7, gradyan yolu optimizasyonuna ve sağlam eğitim stratejilerine odaklanarak daha yapısal bir mühendislik yaklaşımı benimsedi.
- E-ELAN Mimarisi: Genişletilmiş Verimli Katman Birleştirme Ağı, en kısa ve en uzun gradyan yollarını kontrol ederek modelin daha çeşitli özellikler öğrenmesini ve etkili öğrenme yakınsamasını sağlar.
- Model Ölçekleme: Birleştirmeye dayalı modeller için uyarlanmış bileşik bir ölçekleme yöntemi sunar; yapısal uyumu korumak üzere derinliği ve genişliği aynı anda ölçekler.
- Eğitilebilir Bedava Kazanımlar Paketi: Özdeşlik bağlantıları olmayan yeniden parametrelendirilmiş evrişimler (RepConv) ve dinamik etiket atama stratejileri gibi teknikleri kullanır; bunlar çıkarım hızını etkilemeden eğitim sırasında kesinliği artırır.
Performans Analizi#
Ortalama Kesinlik (mAP), hız ve verimlilik değerlendirilirken her iki model de etkileyici metrikler sergiler, ancak biraz farklı segmentleri hedefler. YOLOv7 yüksek kesinlikli GPU dağıtımına yoğun biçimde odaklanırken DAMO-YOLO'nun NAS kaynaklı yapıları düşük gecikmeli CPU ve uç dağıtımını agresif biçimde hedefler.
| Model | boyut (piksel) | mAPval 50-95 | Hız CPU ONNX (ms) | Hız T4 TensorRT10 (ms) | parametre (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv7l | 640 | 51.4 | - | 6.84 | 36.9 | 104.7 |
| YOLOv7x | 640 | 53.1 | - | 11.57 | 71.3 | 189.9 |
Metriklerde görüldüğü üzere DAMO-YOLO son derece hafif varyantlar sunsa da (yalnızca 8,5 milyon parametreli tiny model gibi), YOLOv7 daha yüksek bir genel kesinlik tepe noktası elde eder; YOLOv7x, COCO veri kümesinde etkileyici bir 53,1 mAP değerine ulaşır.
Ultralytics Ekosisteminin Avantajı#
Teorik mimari önemli olsa da bir modelin pratikliği ekosistemi tarafından belirlenir. YOLOv7 gibi Ultralytics tarafından desteklenen modeller, iyi bakımı yapılan bir ekosistemden ve eşsiz kullanım kolaylığından yararlanır.
- Performans Dengesi: Ultralytics modelleri, çıkarım hızı ile algılama kesinliği arasında sürekli olarak en uygun dengeyi kurarak hem uç cihazlar hem de bulut tabanlı model dağıtımı için ideal hale gelir.
- Bellek Gereksinimleri: Daha ağır Transformer tabanlı modellerin aksine Ultralytics YOLO modelleri, eğitim sırasında düşük CUDA bellek gereksinimlerini korur. Bu, daha büyük batch boyutlarına olanak tanıyarak tüketici sınıfı donanımlarda bile eğitim sürecini kolaylaştırır.
- Çok Yönlülük: Ultralytics çerçevesi, nesne algılamanın ötesine geçerek Örnek Segmentasyonu ve Poz Tahmini gibi görevleri de destekler ve geliştiricilere eksiksiz bir bilgisayarlı görü araç seti sunar.
Ultralytics paketi, yüksek düzeyde optimize edilmiş veri yükleyicilerden ve önceden eğitilmiş ağırlıklardan yararlanarak veri kümelerinden tamamen eğitilmiş bir modele yalnızca birkaç dakika içinde sorunsuzca geçmeni sağlar.
Kod Örneği: Ultralytics ile YOLOv7 Eğitimi#
Ultralytics Python API'sini kullanarak YOLOv7'yi bilgisayarlı görü işlem hattına entegre etmek son derece kolaydır.
from ultralytics import YOLO
# Load a pre-trained YOLOv7 model
model = YOLO("yolov7.pt")
# Train the model on your custom dataset
results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Run inference and validate results
metrics = model.val()
predictions = model.predict("https://ultralytics.com/images/bus.jpg", save=True)Yeni Standart: YOLO26'yı Tanıtıyoruz#
YOLOv7 ve DAMO-YOLO 2022'de önemli atılımları temsil etmiş olsa da görü yapay zekâsı alanı hızla ilerliyor. Bugün yeni projeler başlatan ekipler için önerilen model, Ocak 2026'da yayımlanan son teknoloji Ultralytics YOLO26 modelidir.
YOLO26, son teknoloji yenilikleri bir araya getirerek performans ve kullanılabilirlikte nesil atlaması sunar:
- Uçtan Uca NMS'siz Tasarım: YOLO26 yerel olarak uçtan uca çalışır. Maksimum Olmayan Bastırma (NMS) son işleme adımını ortadan kaldırarak daha hızlı ve basit dağıtım mantığı sunar; bu yaklaşımın öncülüğünü ilk olarak YOLOv10 yaptı.
- MuSGD Optimize Edicisi: Moonshot AI'ın Kimi K2'si gibi büyük dil modeli yeniliklerinden ilham alan YOLO26, SGD ve Muon'un bir birleşimini kullanır. Bu optimize edici, son derece kararlı eğitim dinamikleri ve önemli ölçüde daha hızlı yakınsama oranları sağlar.
- %43'e Kadar Daha Hızlı CPU Çıkarımı: Distribution Focal Loss'un (DFL) hedefli biçimde kaldırılması ve kapsamlı yapısal iyileştirmeler sayesinde YOLO26, düşük güçlü uç bilişim için yoğun biçimde optimize edilmiştir ve GPU olmayan donanımlarda önceki nesillerden daha iyi performans gösterir.
- ProgLoss + STAL: Küçük nesne tanımayı açıkça hedefleyen ve geliştiren yeni, gelişmiş kayıp işlevlerini bir araya getirir; bu, hava görüntüleri, robotik ve güvenlik izleme uygulamaları için temel bir yetenektir.
- Göreve Özel İyileştirmeler: Standart algılamanın ötesinde YOLO26; segmentasyon için çok ölçekli prototipleme, poz tahmini için RLE ve Yönlendirilmiş Sınırlayıcı Kutular (OBB) için özel açı kayıpları dahil olmak üzere çeşitli görevlere yönelik iyileştirmeler sunar.
İdeal Kullanım Alanları#
Doğru mimariyi seçmek tamamen hedef dağıtım ortamına ve proje kısıtlarına bağlıdır.
DAMO-YOLO ne zaman seçilmeli:
- Ham parametre sayısının son derece düşük tutulması gereken, kaynakları ciddi biçimde kısıtlı uç ortamlarda (ör. mikrodenetleyiciler) çalışıyorsun.
- Alibaba'nın özel bulut hizmetleriyle özellikle entegre edilmiş otomatik makine öğrenimi işlem hatlarını kullanıyorsun.
YOLOv7 ne zaman seçilmeli:
- Çapa tabanlı, yüksek kesinlikli çıkarım için önceden optimize edilmiş eski GPU işlem hatlarına sahipsin.
- Yüksek hızlı otonom araçlar veya gelişmiş robotik gibi gerçek zamanlı kesinliğin kritik olduğu ortamlarda çalışıyorsun.
YOLO26 ne zaman seçilmeli (Önerilen):
- Sıfırdan yeni bir bilgisayarlı görü uygulaması geliştiriyor ve hem kesinlik hem de CPU/uç çıkarım hızında mutlak son teknoloji performansa ihtiyaç duyuyorsun.
- NMS operatörü kısıtlarıyla uğraşmadan hızlı ve sorunsuz dağıtım yapman gerekiyor (ör. CoreML veya TensorRT biçimine dışa aktarma).
- Bulut eğitimi, veri kümesi yönetimi ve otomatik dağıtım için Ultralytics Platform'un tüm özelliklerinden yararlanmak istiyorsun.
Geliştiriciler, Ultralytics modellerinin sağlam ekosisteminden yararlanarak gerçek dünya uygulamaları için üst düzey tahmin performansını güvence altına alırken mühendislik süresini önemli ölçüde azaltabilir.