ImageNet (Sözde Etiketli) Derinlik Veri Kümesi#
ImageNet (sözde etiketli derinlik) veri kümesi, gerçek referans derinliği bulunmayan 1.281.167 ImageNet-1K eğitim görüntüsünü yeniden kullanır ve her görüntüyü, Depth Anything 3 öğretmeninin monoküler ve metrik ağırlıklarını birleştirerek ürettiği sözde bir derinlik haritasıyla eşleştirir. Bu veri kümesi yalnızca bilgi damıtma ve ImageNet'in sunduğu sahne ve nesne çeşitliliği için kullanılır. Yaklaşık 2,19 milyon görüntüden oluşan YOLO26-Depth ön eğitim karışımındaki en büyük tek kaynak olarak (yaklaşık %58), eklenmesi iç mekânlar arası alan genellemesi açısından belirleyici olmuştur.
Temel Özellikler#
- Çok geniş bir nesne, sahne ve bağlam yelpazesini kapsayan 1.281.167 ImageNet-1K eğitim görüntüsü.
- Gerçek referans derinliği yoktur: her derinlik hedefi, bir Depth Anything 3 öğretmeninin eşleştirmesiyle üretilen sözde bir etikettir (
DA3MONO-LARGEsahne yapısı için,DA3METRIC-LARGEmetrik ölçek için). - Bir kıyaslama testi olarak değil, yalnızca bilgi damıtma ve sahne/nesne çeşitliliği için kullanılır.
2,19 milyon görüntülük ön eğitim karışımındaki en büyük tek kaynak (%58); iç mekânlar arası alan genellemesi için belirleyicidir.- Doğrulama bölümü yoktur — doğrulama yalnızca gerçek referans etiketli veri kümeleri üzerinde gerçekleştirilir.
Veri Kümesi Yapısı#
Sözde etiketli ImageNet kaynağı, görüntü başına bir makine tarafından üretilmiş derinlik haritasına sahip ImageNet-1K eğitim görüntülerinden oluşur:
- Eğitim görüntüleri: 1.281.167 ImageNet-1K eğitim görüntüsü; yaklaşık 2,19 milyon görüntülük YOLO26-Depth ön eğitim karışımının en büyük tek bileşeni (~%58).
- Doğrulama: yok. Bu kaynakta doğrulama bölümü bulunmaz; YOLO26-Depth doğrulamasında yalnızca NYU Depth V2 ve KITTI Eigen gibi gerçek referans etiketli veri kümeleri kullanılır.
Sözde etiketler nasıl oluşturulur#
ImageNet derinlik açıklamaları olmadan sunulduğu için derinlik hedefleri ölçülmek yerine çevrimdışı olarak üretilir. Biri sahne yapısı, diğeri mutlak ölçek için olmak üzere iki Depth Anything 3 ağırlığı birleştirilir:
- Her ImageNet eğitim görüntüsü, görüntü başına bilinmeyen bir ölçek ve kaymaya kadar tanımlı olan son derece ayrıntılı bir derinlik haritası tahmin eden
depth-anything/DA3MONO-LARGEüzerinden ve çıktısı daha kaba ancak gerçek birimlerde olandepth-anything/DA3METRIC-LARGEüzerinden geçirilir. - Görüntü başına sağlam bir afin uydurma, monoküler tahmini metrik tahmin olan
label = a * mono + büzerine eşler. Bu nedenle piksel başına tüm ayrıntılar monoküler ağırlıklardan gelir; metrik ağırlıklar ise yalnızca haritayı metre eksenine yerleştiren iki skaler değeri belirler. Kamera iç parametreleri kullanılmadığından kalibrasyonu olmayan görüntüler de etiketlenebilir. - Sonuç, Ultralytics derinlik veri kümesi biçimine uygun olarak 16 bitlik milimetre PNG dosyası biçiminde kaydedilir ve dosya kökü aracılığıyla kaynak görüntüsüyle eşleştirilir.
- Sözde etiketli çiftler daha sonra daha büyük bir eğitim karışımının bir bileşeni olarak eklenir. Bu karışımda öğrenci YOLO26-Depth modeli, gerçek referans etiketli kaynaklarla da eğitim alırken öğretmeni eşleştirmeyi öğrenir.
Ölçek bir ölçümden değil tahminden geldiği için her haritada küresel bir ölçek hatası bulunabilir. YOLO26-Depth, gradyan eşleştirme ile birlikte ölçekten bağımsız log (SILog) kaybıyla eğitilir ve medyan hizalamayla doğrulanır; bu nedenle sözde etiketlerdeki görüntü başına ölçek kayması büyük ölçüde giderilir.
Bu sözde etiketli kaynak, yayımlanan YOLO26-Depth ağırlıklarını önceden eğitmek için kullanılan dahili karma eğitim yapılandırmasının bir bileşenidir ve bağımsız bir indirme olarak dağıtılmaz.
YOLO26-Depth İçindeki Rolü#
Bu kaynak, YOLO26-Depth ön eğitim verilerinin büyük bölümünü ve en geniş sahne ve nesne çeşitliliğini sağlar. Güçlü bir Depth Anything 3 öğretmenini bir milyondan fazla görüntü üzerinde damıtarak geniş kapsamlı sahne öncüllerini öğrenciye aktarır. Uygulamada, bu kaynağın eklenmesi iç mekânlar arası alan genellemesi açısından belirleyici olmuştur ve modelin gerçek referans etiketli eğitim dağılımlarının ötesindeki iç mekân sahnelerinde de iyi performans göstermesine yardımcı olmuştur.
Kullanım#
Sözde etiketli ImageNet verileri tek başına kullanılmaz; genel kullanıma açık bir veri kümesi indirmesi yerine dahili/deneysel bir YAML ile tanımlanan birleşik bir derinlik karışımının bileşeni olarak kullanılır. Kavramsal olarak, böyle bir karışımla eğitim aşağıdaki gibi görünür:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Önceden Eğitilmiş Modeller#
Önceden eğitilmiş YOLO26-Depth modelleri, adlarıyla ilk kez başvurulduğunda Ultralytics v8.4.0 varlık sürümünden otomatik olarak indirilir:
Atıflar ve Teşekkürler#
ImageNet veri kümesini araştırma veya geliştirme çalışmalarında kullanıyorsan lütfen aşağıdaki makaleye atıfta bulun:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Veri kümesini oluşturup sürdürdükleri için ImageNet ekibine ve sözde derinlik etiketlerini oluşturmak için kullanılan öğretmen modellerinin yazarlarına, Depth Anything 3'e, teşekkür ederiz.
SSS#
Ölçülen derinliği olmayan 1.281.167 ImageNet-1K eğitim görüntüsünü yeniden kullanır ve her birini bir Depth Anything 3 öğretmeni tarafından tahmin edilen bir derinlik haritasıyla eşleştirir. Yaklaşık 2,19 milyon görüntülük YOLO26-Depth ön eğitim karışımındaki en büyük tek kaynaktır (yaklaşık %58) ve tamamen bilgi damıtımı ile sahne çeşitliliği için kullanılır.
Ayrıntılı göreli yapı için her görüntü
DA3MONO-LARGEüzerinden ve metrik ölçek içinDA3METRIC-LARGEüzerinden geçirilir. Görüntü başına sağlam bir afin uyum, monoküler tahmini metrik olana eşler ve sonuç Ultralytics depth format içinde 16 bitlik bir milimetre PNG olarak kaydedilir. Ayrıntılar için How the pseudo-labels are generated kısmına göz at.Hayır. Bu kaynak, yayınlanan YOLO26-Depth ağırlıklarının arkasındaki dahili karışık eğitim yapılandırmasının bir parçasıdır ve bağımsız bir indirme olarak dağıtılmaz. Benzer bir set oluşturmak için, bir derinlik öğretmeni ile kendi görüntülerine yönelik yalancı etiketler üret ve bunları standart derinlik düzeninde sakla.