ImageNet (Sözde Etiketli) Derinlik Veri Kümesi#
ImageNet (sözde etiketli derinlik) veri kümesi, gerçek derinlik etiketi bulunmayan 1,281,167 ImageNet-1K eğitim görüntüsünü yeniden kullanır ve her görüntüyü, tek görüntüden tahmin ve metrik kontrol noktalarını birleştiren bir Depth Anything 3 öğretmen modeli tarafından üretilmiş sözde derinlik haritasıyla eşleştirir. Bu veri kümesi yalnızca bilgi damıtımı ve ImageNet'in sağladığı sahne ve nesne çeşitliliği için kullanılır. Yaklaşık 2.19M görüntülük YOLO26-Depth ön eğitim karışımındaki en büyük tek kaynak olarak (yaklaşık %58), bu verilerin eklenmesi iç mekân alanlar arası genelleme açısından belirleyici olmuştur.
Temel Özellikler#
- Çok çeşitli nesneleri, sahneleri ve bağlamları kapsayan 1,281,167 ImageNet-1K eğitim görüntüsü.
- Gerçek derinlik etiketi yoktur: her derinlik hedefi, Depth Anything 3 öğretmen modelinin (
DA3MONO-LARGEsahne yapısı için,DA3METRIC-LARGEmetrik ölçek için) ürettiği bir sözde etikettir. - Bir kıyaslama olarak değil, yalnızca bilgi damıtımı ve sahne/nesne çeşitliliği için kullanılır.
- ~2.19M görüntülük ön eğitim karışımındaki en büyük tek kaynak (~%58); iç mekân alanlar arası genelleme açısından belirleyicidir.
- Doğrulama bölümü yoktur — doğrulama yalnızca gerçek derinlik gerçek değerleri bulunan veri kümelerinde yapılır.
Veri Kümesi Yapısı#
Sözde etiketli ImageNet kaynağı, her görüntü için makine tarafından üretilmiş bir derinlik haritası içeren ImageNet-1K eğitim görüntülerinden oluşur:
- Eğitim görüntüleri: 1,281,167 ImageNet-1K eğitim görüntüsü; yaklaşık 2.19M görüntülük YOLO26-Depth ön eğitim karışımının en büyük tek bileşeni (~%58).
- Doğrulama: yok. Bu kaynakta doğrulama bölümü bulunmaz; YOLO26-Depth doğrulamasında yalnızca NYU Depth V2 ve KITTI Eigen gibi gerçek derinlik gerçek değerleri bulunan veri kümeleri kullanılır.
Sözde etiketlerin oluşturulması#
ImageNet derinlik açıklamaları içermediğinden, derinlik hedefleri ölçülmek yerine çevrimdışı olarak üretilir. Biri sahne yapısı, diğeri mutlak ölçek için kullanılan iki Depth Anything 3 kontrol noktası birleştirilir:
- Her ImageNet eğitim görüntüsü, bilinmeyen görüntü başına ölçek ve kaymaya kadar tanımlı, son derece ayrıntılı bir derinlik haritası tahmin eden
depth-anything/DA3MONO-LARGEüzerinden ve çıktısı daha kaba ancak gerçek birimlerle olandepth-anything/DA3METRIC-LARGEüzerinden çalıştırılır. - Görüntü başına sağlam bir afin uyum, tek görüntüden tahmini metrik tahmine dönüştürür:
label = a * mono + b. Böylece her pikseldeki ayrıntı tek görüntüden tahmin yapan kontrol noktasından gelirken, metrik kontrol noktası haritayı metre eksenine yerleştiren yalnızca iki skaler değeri belirler. Kamera iç parametreleri kullanılmadığından kalibrasyonu olmayan görüntüler de etiketlenebilir. - Sonuç, Ultralytics derinlik veri kümesi biçimine uygun olarak 16 bit milimetre PNG'si şeklinde kaydedilir ve dosya adı gövdesi kullanılarak kaynak görüntüsüyle eşleştirilir.
- Sözde etiketli çiftler daha sonra daha büyük bir eğitim karışımının bileşeni olarak eklenir. Burada bir YOLO26-Depth öğrenci modeli, gerçek derinlik gerçek değerleri içeren kaynaklarda da eğitim alırken öğretmen modelin çıktısını eşleştirmeyi öğrenir.
Ölçek bir ölçümden değil tahminden geldiğinden, her haritada genel bir ölçek hatası olabilir. YOLO26-Depth, ölçekten bağımsız log (SILog) kaybı ve gradyan eşleştirme ile eğitilir ve medyan hizalamasıyla doğrulanır; bu nedenle sözde etiketlerdeki görüntü başına ölçek farkı büyük ölçüde giderilir.
Bu sözde etiketli kaynak, yayımlanan YOLO26-Depth ağırlıklarını önceden eğitmek için kullanılan dahili karma eğitim yapılandırmasının bir bileşenidir ve bağımsız bir indirme olarak dağıtılmaz.
YOLO26-Depth'teki rolü#
Bu kaynak, YOLO26-Depth ön eğitim verilerinin büyük bölümünü ve en geniş sahne ve nesne çeşitliliğini sağlar. Bir milyondan fazla görüntü üzerinde güçlü bir Depth Anything 3 öğretmen modelinden damıtma yaparak geniş kapsamlı sahne öncüllerini öğrenci modele aktarır. Uygulamada, bu verilerin eklenmesi iç mekân alanlar arası genelleme açısından belirleyici olmuş ve modelin gerçek derinlik gerçek değerleri içeren eğitim dağılımlarının dışındaki iç mekân sahnelerinde de iyi performans göstermesine yardımcı olmuştur.
Kullanım#
Sözde etiketli ImageNet verileri tek başına kullanılmaz; genel bir veri kümesi indirmesi yerine dahili/deneysel bir YAML ile tanımlanan birleşik bir derinlik karışımının bileşenidir. Böyle bir karışımla yapılan eğitim kavramsal olarak şöyledir:
from ultralytics import YOLO
# Önceden eğitilmiş bir derinlik modelini yükle
model = YOLO("yolo26n-depth.pt")
# Birleşik derinlik karışımıyla eğit (kendi çok kaynaklı veri kümesi YAML dosyan)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Önceden Eğitilmiş Modeller#
Önceden eğitilmiş YOLO26-Depth modelleri, adlarıyla ilk kez belirtildiklerinde Ultralytics v8.4.0 varlık sürümünden otomatik indirilir:
Atıflar ve Teşekkürler#
ImageNet veri kümesini araştırma veya geliştirme çalışmalarında kullanıyorsan lütfen aşağıdaki makaleye atıfta bulun:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Veri kümesini oluşturup sürdürdükleri için ImageNet ekibine ve sözde derinlik etiketlerini oluşturmak için kullanılan öğretmen modellerin yazarlarına, yani Depth Anything 3 ekibine teşekkür ederiz.
Sık Sorulan Sorular#
Ölçülmüş derinlik bilgisi bulunmayan 1.281.167 ImageNet-1K eğitim görüntüsünü yeniden kullanır ve her görüntüyü bir Depth Anything 3 öğretmen modeli tarafından tahmin edilen derinlik haritasıyla eşleştirir. Yaklaşık 2,19 milyon görüntüden oluşan YOLO26-Depth ön eğitim karışımındaki en büyük tek kaynaktır (yaklaşık %58) ve yalnızca bilgi damıtma ile sahne çeşitliliği için kullanılır.
Her görüntü, ayrıntılı göreli yapı için
DA3MONO-LARGEve metrik ölçek içinDA3METRIC-LARGEüzerinden işlenir. Görüntü başına sağlam bir afin uyum, tek gözlü tahmini metrik tahmine eşler ve sonuç, Ultralytics derinlik biçiminde 16 bitlik milimetre PNG dosyası olarak kaydedilir. Ayrıntılar için Sözde etiketlerin nasıl oluşturulduğu bölümüne bak.Hayır. Bu kaynak, yayımlanan YOLO26-Depth ağırlıklarının arkasındaki dahili karma eğitim yapılandırmasının bir parçasıdır ve bağımsız bir indirme olarak dağıtılmaz. Benzer bir küme oluşturmak için kendi görüntülerine bir derinlik öğretmeniyle sözde etiketler üret ve bunları standart derinlik düzeninde sakla.