Veri Kümelerine Genel Bakış#
Ultralytics; algılama, örnek segmentasyonu, anlamsal segmentasyon, derinlik tahmini, sınıflandırma, poz tahmini ve yönlendirilmiş sınırlayıcı kutular (OBB) gibi bilgisayarlı görü görevlerini kolaylaştırmak için çeşitli veri kümelerini destekler. Aşağıda başlıca Ultralytics veri kümelerinin listesi ve her bilgisayarlı görü göreviyle ilgili veri kümelerinin özeti yer alıyor. İzleme modu, izleyiciye özgü eğitim gerektirmeden algılama, segmentasyon, poz ve OBB modelleri üzerinde çalışır; izleme veri kümelerine göz at.
İzle: Ultralytics Veri Kümelerine Genel Bakış
Nesne Algılama#
Sınırlayıcı kutu nesne algılama, her nesnenin etrafına bir sınırlayıcı kutu çizerek görüntüdeki nesneleri algılamayı ve konumlarını belirlemeyi içeren bir bilgisayarlı görü tekniğidir.
- African-wildlife: Bufalo, fil, gergedan ve zebra dâhil olmak üzere Afrika yaban hayatına ait görüntüleri içeren bir veri kümesi.
- Argoverse: Zengin açıklamalarla şehir ortamlarından alınan 3B izleme ve hareket tahmini verilerini içeren bir veri kümesi.
- Brain-tumor: Tümör varlığı, konumu ve özelliklerine ilişkin ayrıntılar içeren MRI veya CT tarama görüntülerini kapsayan, beyin tümörlerini algılamaya yönelik bir veri kümesi.
- COCO: Bağlam İçinde Yaygın Nesneler (COCO), 80 nesne kategorisi içeren, büyük ölçekli bir nesne algılama, segmentasyon ve altyazı veri kümesidir.
- COCO8: COCO train2017'deki ilk 8 görüntünün 4'ü eğitim, 4'ü doğrulama için kullanılan daha küçük bir alt kümesi; hızlı testler için uygundur.
- COCO8-Grayscale: RGB'nin gri tonlamaya dönüştürülmesiyle oluşturulan, tek kanallı model değerlendirmesi için kullanışlı bir COCO8 gri tonlama sürümü.
- COCO8-Multispectral: RGB dalga boylarının enterpolasyonuyla oluşturulan, spektral farkındalıklı model değerlendirmesi için kullanışlı, 10 kanallı çok spektrumlu bir COCO8 sürümü.
- COCO12-Formats: Görüntü yükleme hatlarını doğrulamak için desteklenen 12 görüntü biçimini (AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WebP) kapsayan, 12 görüntülük bir test veri kümesi.
- COCO128: COCO train2017'deki ilk 128 görüntünün testler için uygun, daha küçük bir alt kümesi.
- Construction-PPE: Baret, yelek, eldiven, bot ve gözlük gibi temel güvenlik ekipmanları ile eksik ekipmana ilişkin etiketlerle açıklanmış şantiye görüntülerinden oluşan; mevzuata uyum ve çalışanların korunması için yapay zekâ modelleri geliştirilmesini destekleyen bir veri kümesi.
- Global Wheat 2020: 2020 Global Wheat Challenge için buğday başaklarının görüntülerini içeren bir veri kümesi.
- HomeObjects-3K: Akıllı ev sistemleri, robotik ve artırılmış gerçeklikte bilgisayarlı görü modelleri geliştirmek ve test etmek için ideal, yaygın 12 ev eşyasını içeren, açıklamaları yapılmış iç mekân sahnelerinden oluşan bir veri kümesi.
- KITTI: Farklı yol sahnelerinde 2B nesne algılama için kullanılan; stereo, LiDAR ve GPS/IMU girişlerini içeren, iyi bilinen bir otonom sürüş veri kümesi.
- LVIS: 1.203 nesne kategorisi içeren, büyük ölçekli bir nesne algılama ve örnek segmentasyonu veri kümesi.
- Medical-pills: İlaç kalite kontrolü, sınıflandırma ve sektör standartlarına uygunluğun sağlanması gibi görevlere yardımcı olmak üzere tasarlanmış, etiketli tıbbi hap görüntülerini içeren bir veri kümesi.
- Objects365: 365 nesne kategorisi ve 1,7 milyondan fazla açıklama eklenmiş görüntü içeren, nesne algılamaya yönelik yüksek kaliteli ve büyük ölçekli bir veri kümesi.
- OpenImagesV7: Google'ın 1,7 milyon eğitim görüntüsü ve 42 bin doğrulama görüntüsü içeren kapsamlı bir veri kümesi.
- RF100: Kapsamlı model değerlendirmesi için yedi görüntü alanına yayılan 100 veri kümesini içeren, çeşitli nesne algılama kıyaslama veri kümesi.
- Signature: Belge doğrulama ve sahtecilik tespiti araştırmalarını destekleyen, imzaları işaretlenmiş çeşitli belge görüntülerini içeren bir veri kümesi.
- SKU-110K: 11 binden fazla görüntü ve 1,7 milyon sınırlayıcı kutuyla perakende ortamlarında yoğun nesne algılamayı içeren bir veri kümesi.
- TT100K: 221 işaret kategorisini kapsayan 16.817 sokak görünümü görüntüsünden oluşan Tsinghua-Tencent 100K trafik işareti veri kümesi.
- VisDrone: 10 binden fazla görüntü ve video dizisiyle, drone görüntülerinden elde edilen nesne algılama ve çoklu nesne izleme verilerini içeren bir veri kümesi.
- VOC: 20 nesne sınıfı ve 21 binden fazla görüntü içeren, nesne algılama ve segmentasyon için Pascal Görsel Nesne Sınıfları (VOC) veri kümesi.
- xView: 60 nesne kategorisi ve 1 milyondan fazla açıklama eklenmiş nesne içeren, havadan çekilmiş görüntülerde nesne algılamaya yönelik bir veri kümesi.
Örnek Segmentasyonu#
Örnek segmentasyonu, görüntüdeki nesneleri piksel düzeyinde tanımlamayı ve konumlarını belirlemeyi içeren bir bilgisayarlı görü tekniğidir. Yalnızca her pikseli sınıflandıran anlamsal segmentasyonun aksine örnek segmentasyonu, aynı sınıftaki farklı örnekleri birbirinden ayırır.
- Carparts-seg: Tasarım, üretim ve araştırma ihtiyaçlarına yönelik, araç parçalarını tanımlamak için özel olarak hazırlanmış bir veri kümesi. Hem nesne algılama hem de segmentasyon görevlerinde kullanılabilir.
- COCO: 200 binden fazla etiketli görüntü içeren, nesne algılama, segmentasyon ve altyazı görevleri için tasarlanmış büyük ölçekli bir veri kümesi.
- COCO8-seg: Segmentasyon açıklamaları eklenmiş 8 COCO görüntüsünün bir alt kümesini içeren, örnek segmentasyonu görevleri için daha küçük bir veri kümesi.
- COCO128-seg: Segmentasyon açıklamaları eklenmiş 128 COCO görüntüsünün bir alt kümesini içeren, örnek segmentasyonu görevleri için daha küçük bir veri kümesi.
- Crack-seg: Yollardaki ve duvarlardaki çatlakları algılamak için özel olarak hazırlanmış; hem nesne algılama hem de segmentasyon görevlerinde kullanılabilen bir veri kümesi.
- Package-seg: Depolarda veya endüstriyel ortamlarda paketleri tanımlamak için tasarlanmış, hem nesne algılama hem de segmentasyon uygulamalarına uygun bir veri kümesi.
Anlamsal Segmentasyon#
Anlamsal segmentasyon, bir görüntüdeki her piksele sınıf etiketi atar ve otonom sürüş, sahne ayrıştırma ve arazi örtüsü haritalama gibi uygulamalar için yoğun sahne haritaları üretir.
- Cityscapes: Eğitim için 19 sınıf içeren, kentsel sokak sahnelerine yönelik anlamsal segmentasyon veri kümesi.
- Cityscapes8: Anlamsal segmentasyon hatlarını hızlıca kontrol etmek için Cityscapes'in 8 görüntülük kompakt bir alt kümesi.
- ADE20K: 150 anlamsal sınıf içeren sahne ayrıştırma veri kümesi.
Derinlik Tahmini#
Tek görüntüden monoküler derinlik tahmini, piksel başına metre cinsinden bir derinlik haritası öngörür; 3B sahne yeniden yapılandırma, robot navigasyonu ve AR/VR uygulamalarını destekler.
- Depth8: Hatları hızlıca kontrol etmek için SUN RGB-D'nin 8 görüntülük kompakt bir alt kümesi.
- ARKitScenes: Apple ARKit LiDAR ile yakalanmış gerçek iç mekân RGB-D verileri; gerçek dünyadan elde edilen en büyük eğitim kaynağı.
- SUN RGB-D: Dört farklı RGB-D sensörüyle yakalanmış gerçek iç mekân sahneleri.
- DIODE: Ölçme hassasiyetinde bir lazer tarayıcıyla elde edilmiş yoğun iç ve dış mekân derinlik verileri.
- Hypersim: Piksel düzeyinde kusursuz derinlik verilerine sahip, fotogerçekçi sentetik iç mekân sahneleri.
- TartanAir: Yaklaşık 80 m'ye kadar yoğun derinlik verisi içeren sentetik AirSim ortamları.
- Virtual KITTI 2: Yoğun derinlik verileriyle KITTI sürüş sahnelerinin sentetik yeniden oluşturumu.
- KITTI: Velodyne LiDAR derinlik verileri içeren gerçek dünya dış mekân otonom sürüş sahneleri; aynı zamanda KITTI Eigen kıyaslama veri kümesi.
- ImageNet (sözde etiketli): Damıtma için Depth Anything 3 sözde etiketleri içeren ImageNet-1K görüntüleri.
- NYU Depth V2: Microsoft Kinect v1 ile yakalanmış standart iç mekân derinlik kıyaslama veri kümesi.
- ETH3D: Yüksek hassasiyetli iç ve dış mekân lazer tarayıcı kıyaslama veri kümesi.
- Make3D: Dağılım dışı dış mekân kampüs kıyaslama veri kümesi.
- iBims-1: Derinlik kenarları ve düzlemsel yüzeyler için yüksek kaliteli iç mekân kıyaslama veri kümesi.
Sınıflandırma#
Görüntü sınıflandırma, bir görüntüyü görsel içeriğine göre önceden tanımlanmış bir veya daha fazla sınıf ya da kategoriye ayırmayı içeren bir bilgisayarlı görü görevidir.
- Caltech 101: Görüntü sınıflandırma görevleri için 101 nesne kategorisinin görüntülerini içeren bir veri kümesi.
- Caltech 256: 256 nesne kategorisi ve daha zorlu görüntüler içeren, Caltech 101'in genişletilmiş sürümü.
- CIFAR-10: Her sınıfta 6 bin olmak üzere, 10 sınıfa ayrılmış 60 bin adet 32x32 renkli görüntüden oluşan bir veri kümesi.
- CIFAR-100: 100 nesne kategorisi ve her sınıfta 600 görüntü içeren, CIFAR-10'un genişletilmiş sürümü.
- Fashion-MNIST: Görüntü sınıflandırma görevleri için 10 moda kategorisine ait 70.000 gri tonlamalı görüntüden oluşan bir veri kümesi.
- ImageNet: 14 milyondan fazla görüntü ve 20.000 kategori içeren, nesne algılama ve görüntü sınıflandırma için büyük ölçekli bir veri kümesi.
- ImageNet-10: Daha hızlı deneme ve testler için 10 kategoriden oluşan, ImageNet'in daha küçük bir alt kümesi.
- Imagenette: Daha hızlı eğitim ve test için kolayca ayırt edilebilen 10 sınıf içeren, ImageNet'in daha küçük bir alt kümesi.
- Imagewoof: Görüntü sınıflandırma görevleri için 10 köpek ırkı kategorisi içeren, ImageNet'in daha zorlu bir alt kümesi.
- MNIST: Görüntü sınıflandırma görevleri için el yazısıyla yazılmış rakamların 70.000 gri tonlamalı görüntüsünden oluşan bir veri kümesi.
- MNIST160: Hem MNIST eğitim hem de test bölümlerinden her rakamın (0-9) ilk 8 görüntüsü. Veri kümesi toplam 160 görüntü içerir.
Poz Tahmini#
Poz tahmini, nesnenin kameraya veya dünya koordinat sistemine göre pozunu belirlemek için kullanılan bir tekniktir. Bu teknik, özellikle insan veya hayvan gibi nesnelerdeki temel noktaları ya da eklemleri tanımlamayı içerir.
- COCO: Poz tahmini görevleri için tasarlanmış, insan poz açıklamaları içeren büyük ölçekli bir veri kümesi.
- COCO8-pose: İnsan pozu açıklamaları eklenmiş 8 COCO görüntüsünün bir alt kümesini içeren, poz tahmini görevlerine yönelik daha küçük bir veri kümesi.
- Dog-pose: Poz tahmini görevlerine yönelik, köpek başına 24 temel nokta açıklaması eklenmiş ve köpeklere odaklanan yaklaşık 8.500 görüntü içeren kapsamlı bir veri kümesi.
- Hand-Keypoints: Poz tahmini görevleri için tasarlanmış, insan ellerine odaklanan ve el başına 21 temel nokta açıklaması eklenmiş 26 binden fazla görüntü içeren kompakt bir veri kümesi.
- Tiger-pose: Poz tahmini görevleri için kaplan başına 12 temel nokta açıklaması eklenmiş, kaplanlara odaklanan 263 görüntülük kompakt bir veri kümesi.
Yönlendirilmiş Sınırlayıcı Kutular (OBB)#
Yönlendirilmiş Sınırlayıcı Kutular (OBB), döndürülmüş sınırlayıcı kutular kullanarak görüntülerdeki açılı nesneleri algılamaya yönelik bir bilgisayarlı görü yöntemidir ve genellikle havadan ya da uydu görüntülerinde uygulanır. Geleneksel sınırlayıcı kutuların aksine OBB, nesnelere farklı yönelimlerde daha iyi uyum sağlar.
- DOTA-v2: 1,7 milyon örnek ve 11.268 görüntü içeren, popüler bir OBB havadan görüntü veri kümesi.
- DOTA8: Hızlı testler için uygun; DOTAv1 bölünmüş kümesindeki ilk 8 görüntünün, 4'ü eğitim ve 4'ü doğrulama için kullanılan daha küçük bir alt kümesi.
- DOTA128: OBB modellerini test ederken boyut ve çeşitlilik arasında iyi bir denge sunan, eğitim ve doğrulama için DOTA veri kümesinden 128 görüntülük bir alt küme.
Yeni Veri Kümelerine Katkıda Bulun#
Yeni bir veri kümesine katkıda bulunmak, mevcut altyapıyla uyumlu olmasını sağlamak için birkaç adım gerektirir. Gerekli adımlar şunlardır:
İzle: Ultralytics Veri Kümelerine Nasıl Katkıda Bulunulur
Yeni Veri Kümesine Katkıda Bulunma Adımları#
-
Görüntüleri Topla: Veri kümesine ait görüntüleri topla. Bu görüntüleri herkese açık veri tabanları veya kendi koleksiyonun gibi çeşitli kaynaklardan edinebilirsin.
-
Görüntülere Açıklama Ekle: Göreve bağlı olarak bu görüntülere sınırlayıcı kutular, segmentler veya temel noktalarla açıklama ekle.
-
Açıklamaları Dışa Aktar: Bu açıklamaları, Ultralytics'in desteklediği YOLO
*.txtdosya biçimine dönüştür. -
Veri Kümesini Düzenle: Veri kümeni doğru klasör yapısına göre düzenle. Üst düzeyde
images/velabels/dizinleri, bunların her birinin içinde detrain/veval/alt dizinleri bulunmalı.dataset/ ├── images/ │ ├── train/ │ └── val/ └── labels/ ├── train/ └── val/ -
data.yamlDosyası Oluştur: Veri kümesinin kök dizininde veri kümesini, sınıfları ve diğer gerekli bilgileri açıklayan birdata.yamldosyası oluştur. -
Görüntüleri Optimize Et (İsteğe Bağlı): Daha verimli işleme için veri kümesinin boyutunu küçültmek istiyorsan aşağıdaki kodu kullanarak görüntüleri optimize edebilirsin. Bu zorunlu değildir ancak daha küçük veri kümeleri ve daha hızlı indirme için önerilir.
-
Veri Kümesini Zip'le: Veri kümesinin tamamını bir zip dosyasına sıkıştır.
-
Belgelendir ve PR oluştur: Veri kümeni ve mevcut çerçeveye nasıl uyduğunu açıklayan bir belge sayfası oluştur. Ardından bir Pull Request (PR) gönder. PR gönderme hakkında daha fazla bilgi için Ultralytics Katkı Kuralları sayfasına bak.
Veri Kümesini Optimize Etme ve Zip'leme için Örnek Kod#
from pathlib import Path
from ultralytics.data.utils import compress_one_image
from ultralytics.utils.downloads import zip_directory
# Veri kümesi dizinini tanımla
path = Path("path/to/dataset")
# Veri kümesindeki görüntüleri optimize et (isteğe bağlı)
for f in path.rglob("*.jpg"):
compress_one_image(f)
# 'path/to/dataset.zip' içine veri kümesini zip'le
zip_directory(path)Bu adımları izleyerek Ultralytics'ın mevcut yapısıyla iyi bütünleşen yeni bir veri kümesine katkıda bulunabilirsin.
Sık Sorulan Sorular#
Ultralytics, nesne algılama için aşağıdakiler de dahil olmak üzere çok çeşitli veri kümelerini destekler:
- COCO: 80 nesne kategorisi içeren, büyük ölçekli bir nesne algılama, segmentasyon ve altyazı veri kümesi.
- LVIS: Daha ayrıntılı nesne algılama ve segmentasyon için tasarlanmış, 1.203 nesne kategorisi içeren kapsamlı bir veri kümesi.
- Argoverse: Zengin açıklamalarla şehir ortamlarından alınan 3B izleme ve hareket tahmini verilerini içeren bir veri kümesi.
- VisDrone: Drone ile çekilmiş görüntülerden elde edilen nesne algılama ve çoklu nesne izleme verilerini içeren bir veri kümesi.
- SKU-110K: 11 binden fazla görüntüyle perakende ortamlarında yoğun nesne algılamayı ele alan bir veri kümesi.
Bu veri kümeleri, çeşitli nesne algılama uygulamaları için sağlam Ultralytics YOLO modelleri eğitmeyi kolaylaştırır.
Yeni bir veri kümesine katkıda bulunmak birkaç adımdan oluşur:
- Görüntüleri Topla: Görüntüleri herkese açık veri tabanlarından veya kişisel koleksiyonlardan topla.
- Görüntülere Etiket Ekle: Göreve bağlı olarak sınırlayıcı kutular, segmentler veya kilit noktalar ekle.
- Etiketleri Dışa Aktar: Etiketleri YOLO
*.txtbiçimine dönüştür. - Veri Kümesini Düzenle:
images/velabels/dizinlerini; her birinin içindetrain/veval/alt dizinleri olacak şekilde kullan. - Bir
data.yamlDosyası Oluştur: Veri kümesi açıklamalarını, sınıfları ve diğer ilgili bilgileri ekle. - Görüntüleri Optimize Et (İsteğe Bağlı): Verimliliği artırmak için veri kümesinin boyutunu küçült.
- Veri Kümesini Zip'le: Veri kümesini bir zip dosyasına sıkıştır.
- Belgelendir ve PR oluştur: Veri kümeni açıkla ve Ultralytics Katkı Kuralları doğrultusunda bir Pull Request gönder.
Kapsamlı bir kılavuz için Yeni Veri Kümelerine Katkıda Bulun sayfasını ziyaret et.
Ultralytics Platform, veri kümesi yönetimi ve analizi için aşağıdakiler de dahil olmak üzere güçlü özellikler sunar:
- Sorunsuz Veri Kümesi Yönetimi: Veri kümelerini tek bir yerden yükle, düzenle ve yönet.
- Anında Eğitim Entegrasyonu: Yüklediğin veri kümelerini ek kurulum yapmadan doğrudan model eğitiminde kullan.
- Görselleştirme Araçları: Veri kümesi görüntülerini ve etiketlerini incele ve görselleştir.
- Veri Kümesi Analizi: Veri kümesi dağılımın ve özellikleri hakkında içgörüler edin.
Platform, veri kümesi yönetiminden model eğitimine geçişi kolaylaştırarak tüm süreci daha verimli hale getirir. Ultralytics Platform Veri Kümeleri hakkında daha fazla bilgi edin.
Ultralytics YOLO modelleri, bilgisayarlı görü görevleri için çeşitli benzersiz özellikler sunar:
- Gerçek Zamanlı Performans: Zamana duyarlı uygulamalar için yüksek hızlı çıkarım ve eğitim yetenekleri.
- Çok Yönlülük: Algılama, örnek segmentasyonu, anlamsal segmentasyon, derinlik tahmini, sınıflandırma, poz tahmini ve yönlendirilmiş sınırlayıcı kutu (OBB) görevlerini tek bir çerçevede destekler.
- Önceden Eğitilmiş Modeller: Eğitim süresini kısaltan, çeşitli uygulamalara yönelik yüksek performanslı ve önceden eğitilmiş modellere erişim.
- Kapsamlı Topluluk Desteği: Sorun giderme ve geliştirme için aktif bir topluluk ve kapsamlı belgeler.
- Kolay Entegrasyon: Mevcut projelere ve iş akışlarına entegrasyon için basit bir API.
YOLO modelleri hakkında daha fazla bilgi edinmek için Ultralytics Modelleri sayfasını ziyaret et.
Ultralytics araçlarıyla bir veri kümesini optimize edip zip'lemek için bu örnek kodu izle:
Veri Kümesini Optimize Etme ve Zip'lemefrom pathlib import Path from ultralytics.data.utils import compress_one_image from ultralytics.utils.downloads import zip_directory # Veri kümesi dizinini tanımla path = Path("path/to/dataset") # Veri kümesindeki görüntüleri optimize et (isteğe bağlı) for f in path.rglob("*.jpg"): compress_one_image(f) # 'path/to/dataset.zip' içine veri kümesini zip'le zip_directory(path)Bu işlem, daha verimli depolama ve daha hızlı indirme için veri kümesinin boyutunu küçültmeye yardımcı olur. Veri Kümesini Optimize Etme ve Zip'leme hakkında daha fazla bilgi edin.