Ultralytics YOLO27:

Veri Kümelerine Genel Bakış#

Ultralytics; nesne tespiti, örnek segmentasyonu, anlamsal segmentasyon, derinlik tahmini, sınıflandırma, poz tahmini ve yönlendirilmiş sınırlayıcı kutular (OBB) gibi bilgisayarlı görü görevlerini desteklemek için çeşitli veri kümeleri sunar. Aşağıda, başlıca Ultralytics veri kümelerinin listesi ve her bilgisayarlı görü göreviyle ilgili veri kümelerinin özeti yer alır. Takip modu, takipçiye özel eğitim gerektirmeden algılama, segmentasyon, poz ve OBB modelleri üzerinde çalışır; takip veri kümelerine bakabilirsin.



Watch: Ultralytics Datasets Overview

Nesne Tespiti#

Sınırlayıcı kutu ile nesne tespiti, bir görüntüdeki nesneleri her nesnenin çevresine bir sınırlayıcı kutu çizerek algılamayı ve konumlandırmayı içeren bir bilgisayarlı görü tekniğidir.

  • African-wildlife: Bufalolar, filler, gergedanlar ve zebralar da dahil olmak üzere Afrika yaban hayatına ait görüntüler içeren bir veri kümesidir.
  • Argoverse: Zengin açıklamalara sahip kentsel ortamlardan 3B takip ve hareket tahmini verileri içeren bir veri kümesidir.
  • Brain-tumor: Tümör varlığı, konumu ve özelliklerine ilişkin ayrıntılar içeren MRI veya CT tarama görüntülerinden oluşan, beyin tümörlerini tespit etmeye yönelik bir veri kümesidir.
  • COCO: Bağlamdaki Yaygın Nesneler (COCO), 80 nesne kategorisine sahip, geniş ölçekli bir nesne tespiti, segmentasyon ve açıklama veri kümesidir.
  • COCO8: COCO train2017 veri kümesinden ilk 8 görselin yer aldığı daha küçük bir alt küme (4 görsel eğitim, 4 görsel doğrulama için), hızlı testler için uygundur.
  • COCO8-Grayscale: RGB'nin gri tonlamaya dönüştürülmesiyle oluşturulan COCO8'in gri tonlamalı sürümüdür ve tek kanallı model değerlendirmesi için kullanışlıdır.
  • COCO8-Multispectral: RGB dalga boylarının enterpolasyonuyla oluşturulan, 10 kanallı multispektral COCO8 sürümüdür ve spektral farkındalığa sahip model değerlendirmesi için kullanışlıdır.
  • COCO12-Formats: Görsel yükleme işlem hatlarını doğrulamak amacıyla desteklenen 12 görsel formatını (AVIF, BMP, DNG, HEIC, JP2, JPEG, JPG, MPO, PNG, TIF, TIFF, WebP) içeren 12 görsellendirme test veri kümesi.
  • COCO128: COCO train2017'deki ilk 128 görüntünün daha küçük bir alt kümesidir ve testler için uygundur.
  • Construction-PPE: Kask, yelek, eldiven, bot ve koruyucu gözlük gibi temel güvenlik ekipmanlarıyla açıklanmış inşaat sahası görüntülerinden oluşan; ayrıca eksik ekipman etiketleri içeren ve uygunluk ile çalışanların korunmasına yönelik yapay zeka modellerinin geliştirilmesini destekleyen bir veri kümesidir.
  • Global Wheat 2020: 2020 Global Wheat Challenge için buğday başaklarının görüntülerini içeren bir veri kümesidir.
  • HomeObjects-3K: 12 yaygın ev eşyasının yer aldığı, açıklamalı iç mekân sahnelerinden oluşan; akıllı ev sistemleri, robotik ve artırılmış gerçeklikte bilgisayarlı görü modelleri geliştirmek ve test etmek için ideal bir veri kümesidir.
  • KITTI: Çeşitli yol sahnelerinde 2B nesne tespiti için kullanılan; stereo, LiDAR ve GPS/IMU girdilerine sahip, bilinen bir otonom sürüş veri kümesi.
  • LVIS: 1203 nesne kategorisine sahip, geniş ölçekli bir nesne tespiti, segmentasyon ve açıklama veri kümesidir.
  • Medical-pills: İlaçların kalite kontrolü, sınıflandırılması ve sektör standartlarına uygunluğun sağlanması gibi görevleri desteklemek amacıyla tasarlanmış, etiketli tıbbi hap görüntülerinden oluşan bir veri kümesidir.
  • Objects365: 365 nesne kategorisine ve 600 binden fazla açıklamalı görüntüye sahip, nesne tespiti için yüksek kaliteli ve geniş ölçekli bir veri kümesidir.
  • OpenImagesV7: Google tarafından oluşturulmuş; 1,7 milyon eğitim görüntüsü ve 42 bin doğrulama görüntüsü içeren kapsamlı bir veri kümesidir.
  • RF100: Kapsamlı model değerlendirmesi için yedi görüntü alanına yayılan 100 veri kümesinden oluşan çeşitli bir nesne tespiti kıyaslamasıdır.
  • Signature: Belge doğrulama ve sahtecilik tespiti araştırmalarını destekleyen, açıklamalı imzalar içeren çeşitli belge görüntülerinden oluşan bir veri kümesidir.
  • SKU-110K: 11 binden fazla görüntü ve 1,7 milyon sınırlayıcı kutuyla perakende ortamlarında yoğun nesne tespiti içeren bir veri kümesidir.
  • TT100K: 221 trafik işareti kategorisinde 16.817 sokak görünümü görseli içeren Tsinghua-Tencent 100K trafik işareti veri kümesi.
  • VisDrone: 10 binden fazla görüntü ve video dizisiyle, dronlarla çekilmiş görüntülerden nesne tespiti ve çoklu nesne takip verileri içeren bir veri kümesidir.
  • VOC: 20 nesne sınıfı ve 11 binden fazla görüntü içeren, nesne tespiti ve segmentasyonu için Pascal Görsel Nesne Sınıfları (VOC) veri kümesidir.
  • xView: 60 nesne kategorisine ve 1 milyondan fazla açıklamalı nesneye sahip, havadan çekilmiş görüntülerde nesne tespiti için kullanılan bir veri kümesidir.

Örnek Segmentasyonu#

Örnek segmentasyonu, bir görüntüdeki nesneleri piksel düzeyinde tanımlamayı ve konumlandırmayı içeren bir bilgisayarlı görü tekniğidir. Yalnızca her pikseli sınıflandıran anlamsal segmentasyondan farklı olarak, örnek segmentasyonu aynı sınıfa ait farklı örnekleri birbirinden ayırır.

  • Carparts-seg: Tasarım, üretim ve araştırma ihtiyaçlarına yönelik, araç parçalarını tanımlamak için özel olarak oluşturulmuş bir veri kümesidir. Hem nesne tespiti hem de segmentasyon görevlerinde kullanılır.
  • COCO: Nesne tespiti, segmentasyon ve açıklama görevleri için tasarlanmış, 200 binden fazla etiketli görüntü içeren geniş ölçekli bir veri kümesidir.
  • COCO8-seg: Segmentasyon açıklamalarına sahip 8 COCO görüntüsünün bir alt kümesini içeren, örnek segmentasyonu görevleri için daha küçük bir veri kümesidir.
  • COCO128-seg: Segmentasyon açıklamalarına sahip 128 COCO görüntüsünün bir alt kümesini içeren, örnek segmentasyonu görevleri için daha küçük bir veri kümesidir.
  • Crack-seg: Yollardaki ve duvarlardaki çatlakları tespit etmek için özel olarak oluşturulmuş, hem nesne tespiti hem de segmentasyon görevlerinde kullanılabilen bir veri kümesidir.
  • Package-seg: Depolarda veya endüstriyel ortamlarda paketleri tanımlamak için hazırlanmış, hem nesne tespiti hem de segmentasyon uygulamalarına uygun bir veri kümesidir.

Anlamsal Segmentasyon#

Anlamsal segmentasyon, bir görüntüdeki her piksele sınıf etiketi atayarak otonom sürüş, sahne ayrıştırma ve arazi örtüsü haritalama gibi uygulamalar için yoğun sahne haritaları üretir.

  • Cityscapes: 19 eğitim sınıfına sahip, kentsel sokak sahneleri için anlamsal segmentasyon veri kümesidir.
  • Cityscapes8: Anlamsal segmentasyon işlem hatlarını hızlıca kontrol etmek için kullanılan, Cityscapes'in 8 görüntülük kompakt bir alt kümesidir.
  • ADE20K: 150 anlamsal sınıfa sahip bir sahne ayrıştırma veri kümesidir.

Derinlik Tahmini#

Tek görüntülü derinlik tahmini, tek bir RGB görüntüsünden piksel başına metre cinsinden derinlik haritası tahmin eder ve 3B sahne yeniden oluşturma, robot navigasyonu ve AR/VR uygulamalarını destekler.

  • Depth8: İşlem hattı kontrollerini hızlıca yapmak için kullanılan, SUN RGB-D'nin 8 görüntülük kompakt bir alt kümesidir.
  • ARKitScenes: Apple ARKit LiDAR ile yakalanan ve en büyük gerçek eğitim kaynağı olan gerçek iç mekan RGB-D verileri.
  • SUN RGB-D: Dört farklı RGB-D sensörü ile yakalanan gerçek iç mekan sahneleri.
  • DIODE: Arazi ölçüm sınıfı bir lazer tarayıcıdan alınan yoğun iç ve dış mekan derinlik verileri.
  • Hypersim: Kusursuz piksel başına derinliğe sahip fotogerçekçi sentetik iç mekan sahneleri.
  • TartanAir: ~80 m'ye kadar yoğun derinliğe sahip sentetik AirSim ortamları.
  • Virtual KITTI 2: Yoğun derinliğe sahip KITTI sürüş sahnelerinin sentetik olarak yeniden oluşturulmuş hali.
  • KITTI: Velodyne LiDAR derinliğine sahip gerçek dünya dış mekan otonom sürüş sahneleri, ayrıca KITTI Eigen kıyaslaması.
  • ImageNet (pseudo-labeled): Damıtma için Depth Anything 3 sözde etiketlerine sahip ImageNet-1K görselleri.
  • NYU Depth V2: Microsoft Kinect v1 ile yakalanmış standart bir iç mekân derinlik kıyaslamasıdır.
  • ETH3D: Yüksek hassasiyetli iç ve dış mekan lazer tarayıcı kıyaslaması.
  • Make3D: Dağılım dışı dış mekan kampüs kıyaslaması.
  • iBims-1: Derinlik kenarları ve düzlemsel yüzeyler için yüksek kaliteli iç mekan kıyaslaması.

Sınıflandırma#

Görüntü sınıflandırma, bir görüntüyü görsel içeriğine göre önceden tanımlanmış bir veya daha fazla sınıfa ya da kategoriye ayırmayı içeren bir bilgisayarlı görü görevidir.

  • Caltech 101: Görüntü sınıflandırma görevleri için 101 nesne kategorisine ait görüntüler içeren bir veri kümesidir.
  • Caltech 256: 256 nesne kategorisi ve daha zorlu görüntüler içeren, Caltech 101'in genişletilmiş sürümüdür.
  • CIFAR-10: 10 sınıfta 60 bin adet 32x32 renkli görüntüden oluşan ve sınıf başına 6 bin görüntü içeren bir veri kümesidir.
  • CIFAR-100: 100 nesne kategorisi ve sınıf başına 600 görüntü içeren, CIFAR-10'un genişletilmiş sürümüdür.
  • Fashion-MNIST: Görüntü sınıflandırma görevleri için 10 moda kategorisine ait 70.000 gri tonlamalı görüntüden oluşan bir veri kümesidir.
  • ImageNet: 14 milyondan fazla görüntü ve 20.000 kategori içeren, nesne tespiti ve görüntü sınıflandırma için kullanılan geniş ölçekli bir veri kümesidir.
  • ImageNet-10: Daha hızlı deneme ve test için ImageNet'in 10 kategorili daha küçük bir alt kümesidir.
  • Imagenette: Daha hızlı eğitim ve test için kolayca ayırt edilebilen 10 sınıf içeren, ImageNet'in daha küçük bir alt kümesidir.
  • Imagewoof: Görüntü sınıflandırma görevleri için 10 köpek ırkı kategorisi içeren, ImageNet'in daha zorlu bir alt kümesidir.
  • MNIST: Görüntü sınıflandırma görevleri için el yazısıyla yazılmış rakamların 70.000 gri tonlamalı görüntüsünden oluşan bir veri kümesidir.
  • MNIST160: MNIST'in hem eğitim hem de test bölümlerindeki her rakamın (0-9) ilk 8 görüntüsünden oluşur. Veri kümesinde toplam 160 görüntü bulunur.

Poz Tahmini#

Poz tahmini, bir nesnenin kameraya veya dünya koordinat sistemine göre pozunu belirlemek için kullanılan bir tekniktir. Bu işlem, özellikle insanlar veya hayvanlar üzerindeki temel noktaların ya da eklemlerin tanımlanmasını içerir.

  • COCO: Poz tahmini görevleri için tasarlanmış, insan pozu açıklamalarına sahip geniş ölçekli bir veri kümesidir.
  • COCO8-pose: İnsan pozu açıklamalarına sahip 8 COCO görüntüsünün bir alt kümesini içeren, poz tahmini görevleri için daha küçük bir veri kümesidir.
  • Dog-pose: Köpeklere odaklanan yaklaşık 8.500 görüntü içeren ve her köpek için 24 temel noktayla açıklanmış, poz tahmini görevlerine uygun kapsamlı bir veri kümesidir.
  • Hand-Keypoints: İnsan ellerine odaklanan 26 binden fazla görüntü içeren ve her el için 21 temel noktayla açıklanmış, poz tahmini görevleri için tasarlanmış özlü bir veri kümesidir.
  • Tiger-pose: Kaplanlara odaklanan 263 görüntüden oluşan ve poz tahmini görevleri için her kaplanı 12 temel noktayla açıklayan kompakt bir veri kümesidir.

Yönlendirilmiş Sınırlayıcı Kutular (OBB)#

Yönlendirilmiş Sınırlayıcı Kutular (OBB), görüntülerdeki açılı nesneleri döndürülmüş sınırlayıcı kutular kullanarak tespit etmeye yönelik ve genellikle hava ve uydu görüntülerinde uygulanan bir bilgisayarlı görü yöntemidir. Geleneksel sınırlayıcı kutuların aksine OBB, farklı yönelimlerdeki nesnelere daha iyi uyum sağlayabilir.

  • DOTA-v2: 1,7 milyon örneğe ve 11.268 görüntüye sahip popüler bir OBB hava görüntüsü veri kümesidir.
  • DOTA8: DOTAv1 bölme kümesindeki ilk 8 görüntünün; 4'ü eğitim, 4'ü doğrulama için kullanılan ve hızlı testlere uygun daha küçük bir alt kümesidir.
  • DOTA128: Eğitim ve doğrulama için 128 görüntü içeren DOTA veri kümesinin 128 görüntülük bir alt kümesidir ve OBB modellerini test etmek için boyut ile çeşitlilik arasında iyi bir denge sunar.

Yeni Veri Kümelerine Katkıda Bulun#

Yeni bir veri kümesine katkıda bulunmak, mevcut altyapıyla iyi şekilde uyumlu olmasını sağlamak için birkaç adım içerir. Gerekli adımlar aşağıdadır:



Watch: How to Contribute to Ultralytics Datasets

Yeni Veri Kümesine Katkıda Bulunma Adımları#

  1. Görüntüleri Topla: Veri kümesine ait görüntüleri topla. Bu görüntüler herkese açık veritabanları veya kendi koleksiyonun gibi çeşitli kaynaklardan toplanabilir.

  2. Görüntüleri Açıkla: Göreve bağlı olarak bu görüntülere sınırlayıcı kutular, segmentler veya temel noktalar ekle.

  3. Açıklamaları Dışa Aktar: Bu açıklamaları, Ultralytics'in desteklediği YOLO *.txt dosya biçimine dönüştür.

  4. Veri Kümesini Düzenle: Veri kümeni doğru klasör yapısında düzenle. Üst düzeyde images/ ve labels/ dizinlerine, her birinin içinde de train/ ve val/ alt dizinlerine sahip olmalısın.

    dataset/
    ├── images/
    │   ├── train/
    │   └── val/
    └── labels/
        ├── train/
        └── val/
  5. Bir data.yaml Dosyası Oluştur: Veri kümenin kök dizininde, veri kümesini, sınıfları ve diğer gerekli bilgileri açıklayan bir data.yaml dosyası oluştur.

  6. Görüntüleri Optimize Et (İsteğe Bağlı): Daha verimli işleme için veri kümesinin boyutunu küçültmek istiyorsan aşağıdaki kodu kullanarak görüntüleri optimize edebilirsin. Bu işlem gerekli değildir ancak daha küçük veri kümeleri ve daha hızlı indirme hızları için önerilir.

  7. Veri Kümesini Sıkıştır: Veri kümesinin tamamını bir zip dosyasına sıkıştır.

  8. Belgele ve PR Oluştur: Veri kümeni ve mevcut çerçeveye nasıl uyduğunu açıklayan bir belge sayfası oluştur. Ardından bir Pull Request (PR) gönder. PR gönderme hakkında daha fazla bilgi için Ultralytics Katkı Kurallarına bak.

Veri Kümesini Optimize Etme ve Sıkıştırma için Örnek Kod#

Veri Kümesini Optimize Et ve Sıkıştır
from pathlib import Path

from ultralytics.data.utils import compress_one_image
from ultralytics.utils.downloads import zip_directory

# Define dataset directory
path = Path("path/to/dataset")

# Optimize images in dataset (optional)
for f in path.rglob("*.jpg"):
    compress_one_image(f)

# Zip dataset into 'path/to/dataset.zip'
zip_directory(path)

Bu adımları izleyerek Ultralytics'in mevcut yapısıyla iyi şekilde bütünleşen yeni bir veri kümesine katkıda bulunabilirsin.

SSS#

  • Ultralytics, nesne tespiti için aşağıdakiler de dahil olmak üzere çok çeşitli veri kümelerini destekler:

    • COCO: 80 nesne kategorisine sahip, geniş ölçekli bir nesne tespiti, segmentasyon ve açıklama veri kümesidir.
    • LVIS: Daha ayrıntılı nesne tespiti ve segmentasyonu için tasarlanmış, 1203 nesne kategorisine sahip kapsamlı bir veri kümesidir.
    • Argoverse: Zengin açıklamalara sahip kentsel ortamlardan 3B takip ve hareket tahmini verileri içeren bir veri kümesidir.
    • VisDrone: Dronlarla çekilmiş görüntülerden nesne tespiti ve çoklu nesne takip verileri içeren bir veri kümesidir.
    • SKU-110K: 11 binden fazla görüntüyle perakende ortamlarında yoğun nesne tespiti içerir.

    Bu veri kümeleri, çeşitli nesne tespiti uygulamaları için güçlü Ultralytics YOLO modellerinin eğitilmesini kolaylaştırır.

  • Yeni bir veri kümesine katkıda bulunmak birkaç adım içerir:

    1. Görüntüleri Topla: Görüntüleri herkese açık veritabanlarından veya kişisel koleksiyonlardan topla.
    2. Görüntüleri Açıkla: Göreve bağlı olarak sınırlayıcı kutular, segmentler veya temel noktalar ekle.
    3. Açıklamaları Dışa Aktar: Açıklamaları YOLO *.txt biçimine dönüştür.
    4. Veri Kümesini Düzenle: Her birinde images/ ve labels/ alt dizinleri bulunan train/ ve val/ dizinlerinden oluşan klasör yapısını kullan.
    5. Bir data.yaml Dosyası Oluştur: Veri kümesi açıklamalarını, sınıfları ve diğer ilgili bilgileri ekle.
    6. Görüntüleri Optimize Et (İsteğe Bağlı): Verimlilik için veri kümesinin boyutunu küçült.
    7. Veri Kümesini Sıkıştır: Veri kümesini bir zip dosyasına sıkıştır.
    8. Belgele ve PR Oluştur: Veri kümeni açıkla ve Ultralytics Katkı Kurallarını izleyerek bir Pull Request gönder.

    Kapsamlı bir kılavuz için Yeni Veri Kümelerine Katkıda Bulun sayfasını ziyaret et.

  • Ultralytics Platform, aşağıdakiler de dahil olmak üzere veri kümesi yönetimi ve analizi için güçlü özellikler sunar:

    • Sorunsuz Veri Kümesi Yönetimi: Veri kümelerini tek bir yerden yükle, düzenle ve yönet.
    • Anında Eğitim Entegrasyonu: Yüklenen veri kümelerini ek kurulum yapmadan doğrudan model eğitimi için kullan.
    • Görselleştirme Araçları: Veri kümesi görüntülerini ve anotasyonlarını keşfet ve görselleştir.
    • Veri Kümesi Analizi: Veri kümesi dağılımın ve özelliklerin hakkında içgörüler edin.

    Platform, veri kümesi yönetiminden model eğitimine geçişi kolaylaştırarak tüm süreci daha verimli hâle getirir. Ultralytics Platform Veri Kümeleri hakkında daha fazla bilgi edin.

  • Ultralytics YOLO modelleri, bilgisayarlı görü görevleri için çeşitli benzersiz özellikler sunar:

    • Gerçek Zamanlı Performans: Zaman açısından kritik uygulamalar için yüksek hızlı çıkarım ve eğitim yetenekleri.
    • Çok Yönlülük: Birleşik bir çerçevede nesne tespiti, örnek segmentasyonu, anlamsal segmentasyon, derinlik tahmini, sınıflandırma ve poz tahmini görevlerini destekler.
    • Önceden Eğitilmiş Modeller: Eğitim süresini azaltan, çeşitli uygulamalar için yüksek performanslı ve önceden eğitilmiş modellere erişim.
    • Kapsamlı Topluluk Desteği: Sorun giderme ve geliştirme için aktif topluluk ve kapsamlı dokümantasyon.
    • Kolay Entegrasyon: Mevcut projeler ve iş akışlarıyla entegrasyon için basit API.

    YOLO modelleri hakkında Ultralytics Modelleri sayfasında daha fazla bilgi edin.

  • Ultralytics araçlarını kullanarak bir veri kümesini optimize edip zip dosyasına dönüştürmek için şu örnek kodu izleyebilirsin:

    Veri Kümesini Optimize Et ve Sıkıştır
    from pathlib import Path
    
    from ultralytics.data.utils import compress_one_image
    from ultralytics.utils.downloads import zip_directory
    
    # Define dataset directory
    path = Path("path/to/dataset")
    
    # Optimize images in dataset (optional)
    for f in path.rglob("*.jpg"):
        compress_one_image(f)
    
    # Zip dataset into 'path/to/dataset.zip'
    zip_directory(path)

    Bu işlem, daha verimli depolama ve daha yüksek indirme hızları için veri kümesi boyutunu azaltmaya yardımcı olur. Bir Veri Kümesini Optimize Etme ve Zip Dosyasına Dönüştürme hakkında daha fazla bilgi edin.

Yorumlar