Link to this sectionImageNet (Sözde Etiketli) Derinlik Veri Seti#
ImageNet (sözde etiketli derinlik) veri seti, temel doğruluk (ground-truth) derinlik bilgisine sahip olmayan 1.281.167 adet ImageNet-1K eğitim görüntüsünü yeniden kullanır ve her görüntüyü, bir Depth Anything V3 öğretmen modeli (monoküler ve metrik) tarafından üretilen sözde derinlik haritasıyla eşleştirir. Bu veri seti tamamen bilgi damıtma işlemi ve ImageNet'in sağladığı sahne ve nesne çeşitliliği için kullanılır. Yaklaşık 2,19 milyon görüntülük YOLO26-Depth ön eğitim karışımındaki en büyük tek kaynak olması (yaklaşık %58) nedeniyle, eklenmesi iç mekan alanlar arası genelleme için belirleyici olmuştur.
Link to this sectionTemel Özellikler#
- Çok geniş bir nesne, sahne ve bağlam yelpazesini kapsayan 1.281.167 ImageNet-1K eğitim görüntüsü.
- Temel doğruluk derinlik bilgisi yok: her derinlik hedefi, bir Depth Anything V3 öğretmeni (monoküler, metrik) tarafından oluşturulan bir sözde etikettir.
- Bir kıyaslama (benchmark) olarak değil, tamamen bilgi damıtma ve sahne/nesne çeşitliliği için kullanılır.
- ~2,19 milyon görüntülük ön eğitim karışımındaki en büyük tek kaynak (~%58); iç mekan alanlar arası genelleme için belirleyici.
- Doğrulama ayrımı yok — doğrulama yalnızca gerçek temel doğruluk veri setleri üzerinde gerçekleştirilir.
Link to this sectionVeri Kümesi Yapısı#
Sözde etiketli ImageNet kaynağı, görüntü başına bir adet makine tarafından oluşturulmuş derinlik haritasına sahip ImageNet-1K eğitim görüntülerinden oluşur:
- Eğitim görüntüleri: ~2,19 milyon görüntülük YOLO26-Depth ön eğitim karışımının en büyük tek bileşeni (~%58) olan 1.281.167 ImageNet-1K eğitim görüntüsü.
- Doğrulama: yok. Bu kaynağın bir doğrulama ayrımı yoktur; YOLO26-Depth doğrulaması yalnızca NYU Depth V2 ve KITTI Eigen gibi gerçek temel doğruluk veri setlerini kullanır.
Link to this sectionSözde etiketlerin oluşturulma yöntemi#
ImageNet derinlik açıklamaları olmadan sunulduğu için, derinlik hedefleri ölçülmek yerine çevrimdışı olarak üretilir:
- Her ImageNet eğitim görüntüsü, piksel başına metrik derinlik haritası tahmin etmek için önceden eğitilmiş bir Depth Anything V3 öğretmen modelinden geçirilir.
- The teacher prediction is saved as a
.npyfloat32 array in meters, following the Ultralytics depth dataset format, and paired with its source image by file stem. - Sözde etiketli çiftler daha sonra, bir öğrenci YOLO26-Depth modelinin öğretmeni taklit etmeyi öğrendiği ve aynı zamanda gerçek temel doğruluk kaynakları üzerinde eğitildiği daha büyük bir eğitim karışımının bir bileşeni olarak eklenir.
Bu sözde etiketli kaynak, yayınlanan YOLO26-Depth ağırlıklarını önceden eğitmek için kullanılan dahili karma eğitim yapılandırmasının bir bileşenidir ve bağımsız bir indirme olarak dağıtılmaz.
Link to this sectionYOLO26-Depth içindeki rolü#
Bu kaynak, YOLO26-Depth ön eğitim verilerinin büyük kısmını ve en geniş sahne ve nesne çeşitliliğini sağlar. Güçlü bir Depth Anything V3 öğretmenini bir milyondan fazla görüntü üzerinde damıtarak, geniş sahne ön bilgilerini öğrenciye aktarır. Uygulamada, bu kaynağın eklenmesi iç mekan alanlar arası genelleme için belirleyici olmuş ve modelin gerçek temel doğruluk eğitim dağılımlarının ötesindeki iç mekan sahnelerinde iyi performans göstermesine yardımcı olmuştur.
Link to this sectionKullanım#
Sözde etiketli ImageNet verileri tek başına eğitilmez; genel bir derinlik karışımının bir bileşeni olarak kullanılır ve genel bir veri seti indirmesi yerine dahili/deney amaçlı bir YAML dosyası tarafından tanımlanır. Kavramsal olarak, böyle bir karışım üzerinde eğitim aşağıdaki gibi görünür:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this sectionÖnceden Eğitilmiş Modeller#
Önceden eğitilmiş YOLO26-Depth modelleri, ismen ilk referans verildiklerinde Ultralytics v8.4.0 varlık sürümünden otomatik olarak indirilir:
Link to this sectionAlıntılar ve Teşekkür#
ImageNet veri setini araştırma veya geliştirme çalışmalarında kullanıyorsan, lütfen şu makaleye atıfta bulun:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}Veri setini oluşturdukları ve sürdürdükleri için ImageNet ekibine ve sözde derinlik etiketlerini oluşturmak için kullanılan öğretmen modelindeki Depth Anything yazarlarına teşekkür ederiz.