ImageNet (Sözde Etiketli) Derinlik Veri Seti#
ImageNet (sahte etiketli derinlik) veri seti, gerçek derinliği olmayan 1.281.167 adet ImageNet-1K eğitim görüntüsünü yeniden kullanır ve her görüntüyü, monoküler ve metrik kontrol noktalarını birleştiren bir Depth Anything 3 öğretmeni tarafından üretilen sahte bir derinlik haritasıyla eşleştirir. Saf bir şekilde bilgi damıtması ve ImageNet'in sağladığı sahneler ile nesne çeşitliliği için kullanılır. Yaklaşık 2,19 milyon görüntülük YOLO26-Depth ön eğitim karışımındaki en büyük tek kaynak (yaklaşık %58) olduğundan, bunu eklemek iç mekanlar arası etki alanı genellemesi için belirleyici olmuştur.
Temel Özellikler#
- Çok geniş bir nesne, sahne ve bağlam yelpazesini kapsayan 1.281.167 ImageNet-1K eğitim görüntüsü.
- Gerçek derinlik yok: Her derinlik hedefi, bir Depth Anything 3 öğretmeni tarafından eşleştirilerek üretilen sahte bir etiketir (
DA3MONO-LARGEsahne yapısı için,DA3METRIC-LARGEmetrik ölçek için). - Bir kıyaslama (benchmark) olarak değil, tamamen bilgi damıtma ve sahne/nesne çeşitliliği için kullanılır.
- ~2,19 milyon görüntülük ön eğitim karışımındaki en büyük tek kaynak (~%58); iç mekan alanlar arası genelleme için belirleyici.
- Doğrulama ayrımı yok — doğrulama yalnızca gerçek temel doğruluk veri setleri üzerinde gerçekleştirilir.
Veri Kümesi Yapısı#
Sözde etiketli ImageNet kaynağı, görüntü başına bir adet makine tarafından oluşturulmuş derinlik haritasına sahip ImageNet-1K eğitim görüntülerinden oluşur:
- Eğitim görüntüleri: ~2,19 milyon görüntülük YOLO26-Depth ön eğitim karışımının en büyük tek bileşeni (~%58) olan 1.281.167 ImageNet-1K eğitim görüntüsü.
- Doğrulama: yok. Bu kaynağın bir doğrulama ayrımı yoktur; YOLO26-Depth doğrulaması yalnızca NYU Depth V2 ve KITTI Eigen gibi gerçek temel doğruluk veri setlerini kullanır.
Sözde etiketlerin oluşturulma yöntemi#
ImageNet derinlik açıklamaları olmadan gönderildiği için, derinlik hedefleri ölçülmek yerine çevrim dışı olarak üretilir. Biri sahne yapısı ve diğeri mutlak ölçek için olmak üzere iki Depth Anything 3 kontrol noktası birleştirilir:
- Her bir ImageNet eğitim görüntüsü, yalnızca bilinmeyen görüntü başına ölçek ve kaydırmaya kadar tanımlanan son derece ayrıntılı bir derinlik haritası tahmin eden
depth-anything/DA3MONO-LARGEüzerinden ve çıktısı daha kaba ancak gerçek birimlerde olandepth-anything/DA3METRIC-LARGEüzerinden geçirilir. - Görüntü başına sağlam bir afin uyum, monoküler tahmini metrik olana eşler,
label = a * mono + b. Bu nedenle her bir piksel ayrıntısı monoküler kontrol noktasından gelirken, metrik kontrol noktası yalnızca haritayı metre eksenine yerleştiren iki skaları belirler. Kamera içsel değerleri söz konusu değildir, bu nedenle kalibrasyon olmayan görüntüler etiketlenebilir. - Sonuç, Ultralytics derinlik veri seti formatına uygun olarak 16 bitlik milimetre cinsinden PNG olarak kaydedilir ve dosya adı gövdesi ile kaynak görseliyle eşleştirilir.
- Sözde etiketli çiftler daha sonra, bir öğrenci YOLO26-Depth modelinin öğretmeni taklit etmeyi öğrendiği ve aynı zamanda gerçek temel doğruluk kaynakları üzerinde eğitildiği daha büyük bir eğitim karışımının bir bileşeni olarak eklenir.
Ölçek bir ölçümden değil bir tahminden geldiğinden, her harita küresel bir ölçek hatası taşıyabilir. YOLO26-Depth, ölçek değişmez günlük (SILog) kaybı ve gradyan eşleştirmesi ile eğitilir ve medyan hizalaması ile doğrulanır, bu nedenle sahte etiketlerdeki görüntü başına ölçek sapması büyük ölçüde bertaraf edilir.
Bu sözde etiketli kaynak, yayınlanan YOLO26-Depth ağırlıklarını önceden eğitmek için kullanılan dahili karma eğitim yapılandırmasının bir bileşenidir ve bağımsız bir indirme olarak dağıtılmaz.
YOLO26-Depth'teki Rolü#
Bu kaynak, YOLO26-Depth ön eğitim verilerinin büyük kısmını ve en geniş sahne ile nesne çeşitliliğini sağlar. Güçlü bir Depth Anything 3 öğretmenini bir milyondan fazla görüntü üzerinde damıtarak, geniş sahne öncellerini öğrenciye aktarır. Uygulamada, bunu eklemek iç mekanlar arası etki alanı genellemesi için belirleyici olmuş ve modelin gerçek gerçek zemin eğitim dağılımlarının ötesindeki iç mekan sahnelerinde iyi performans göstermesine yardımcı olmuştur.
Kullanım#
Sözde etiketli ImageNet verileri tek başına eğitilmez; genel bir derinlik karışımının bir bileşeni olarak kullanılır ve genel bir veri seti indirmesi yerine dahili/deney amaçlı bir YAML dosyası tarafından tanımlanır. Kavramsal olarak, böyle bir karışım üzerinde eğitim aşağıdaki gibi görünür:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Önceden Eğitilmiş Modeller#
Önceden eğitilmiş YOLO26-Depth modelleri, ilk kez ada göre referans verildiğinde Ultralytics v8.4.0 assets release sürümünden otomatik olarak indirilir:
Alıntılar ve Teşekkür#
ImageNet veri setini araştırma veya geliştirme çalışmalarında kullanıyorsan, lütfen şu makaleye atıfta bulun:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}Veri setini oluşturdukları ve sürdürdükleri için ImageNet ekibine ve sahte derinlik etiketlerini oluşturmak için kullanılan öğretmen modelleri sağlayan Depth Anything 3 yazarlarına teşekkür ederiz.