Sicherheit auf Unternehmensebene: ISO 27001 + SOC 2 Typ I konform.

Link to this sectionImageNet (Pseudo-Labeled) Tiefendatensatz#

Der ImageNet-Datensatz (pseudo-label-tiefe) verwendet die 1.281.167 Trainingsbilder von ImageNet-1K wieder, die keine Ground-Truth-Tiefe besitzen, und paart jedes Bild mit einer Pseudo-Tiefenkarte, die von einem Depth Anything V3-Teachermodell (monokular und metrisch) erstellt wurde. Er wird rein für die Wissens-Destillation und für die Szenen- und Objektvielfalt genutzt, die ImageNet bietet. Als größte Einzelquelle im etwa 2,19 Mio. Bilder umfassenden YOLO26-Depth-Pretraining-Mix (etwa 58 %) war seine Hinzufügung entscheidend für die domänenübergreifende Generalisierung in Innenräumen.

Link to this sectionHauptfunktionen#

  • 1.281.167 ImageNet-1K-Trainingsbilder, die ein sehr breites Spektrum an Objekten, Szenen und Kontexten abdecken.
  • Keine Ground-Truth-Tiefe: Jedes Tiefenziel ist ein Pseudo-Label, das von einem Depth Anything V3-Teacher (monokular, metrisch) generiert wurde.
  • Wird rein für Wissensdestillation und Szenen-/Objektvielfalt verwendet, nicht als Benchmark.
  • Die größte Einzelquelle im ~2,19 Mio. Bilder umfassenden Pretraining-Mix (~58 %), entscheidend für die domänenübergreifende Generalisierung in Innenräumen.
  • Kein Validierungs-Split — die Validierung wird nur auf echten Ground-Truth-Datensätzen durchgeführt.

Link to this sectionDatensatzstruktur#

Die pseudo-label-basierte ImageNet-Quelle besteht aus den ImageNet-1K-Trainingsbildern mit einer maschinell generierten Tiefenkarte pro Bild:

  1. Trainingsbilder: 1.281.167 ImageNet-1K-Trainingsbilder, die größte Einzelkomponente (~58 %) des ~2,19 Mio. Bilder umfassenden YOLO26-Depth-Pretraining-Mix.
  2. Validierung: keine. Diese Quelle hat keinen Validierungs-Split; die YOLO26-Depth-Validierung verwendet nur echte Ground-Truth-Datensätze wie NYU Depth V2 und KITTI Eigen.

Link to this sectionWie die Pseudo-Labels generiert werden#

Da ImageNet ohne Tiefenannotationen ausgeliefert wird, werden Tiefenziele offline erzeugt, anstatt sie zu messen:

  1. Jedes ImageNet-Trainingsbild wird durch ein vortrainiertes Depth Anything V3-Teachermodell geleitet, um eine metrische Tiefenkarte pro Pixel vorherzusagen.
  2. Die Teacher-Vorhersage wird als .npy float32-Array in Metern gespeichert, gemäß dem Ultralytics depth dataset format, und per Dateistamm mit dem Quellbild gepaart.
  3. Die pseudo-label-basierten Paare werden dann als Komponente eines größeren Trainings-Mixes hinzugefügt, wobei ein Schüler-YOLO26-Depth-Modell lernt, den Lehrer zu imitieren, während es gleichzeitig an echten Ground-Truth-Quellen trainiert.

Diese pseudo-label-basierte Quelle ist ein Bestandteil der internen Mixed-Training-Konfiguration, die zum Vortrainieren der veröffentlichten YOLO26-Depth-Gewichte verwendet wird, und wird nicht als eigenständiger Download bereitgestellt.

Link to this sectionRolle in YOLO26-Depth#

Diese Quelle liefert den Großteil der YOLO26-Depth-Pretraining-Daten und die größte Vielfalt an Szenen und Objekten. Durch die Destillation eines starken Depth Anything V3-Lehrers über mehr als eine Million Bilder hinweg, überträgt sie breite Szenen-Priors auf den Schüler. In der Praxis war die Hinzufügung entscheidend für die domänenübergreifende Generalisierung in Innenräumen und hilft dem Modell, bei Innenszenen gut abzuschneiden, die über die echten Ground-Truth-Trainingsverteilungen hinausgehen.

Link to this sectionVerwendung#

Die pseudo-label-basierten ImageNet-Daten werden nicht isoliert trainiert; sie werden als eine Komponente eines kombinierten Tiefen-Mixes konsumiert, der durch ein internes/Experiment-YAML definiert ist, nicht durch einen öffentlichen Datensatz-Download. Konzeptionell sieht das Training an einem solchen Mix wie folgt aus:

Trainingsbeispiel
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Link to this sectionVortrainierte Modelle#

Vortrainierte YOLO26-Depth-Modelle werden automatisch von den Ultralytics v8.4.0 assets release heruntergeladen, wenn sie zum ersten Mal beim Namen genannt werden:

Link to this sectionZitate und Danksagungen#

Wenn du den ImageNet-Datensatz in deiner Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte das folgende Papier:

Zitat
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@inproceedings{yang2024depthanything,
      title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
      author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
      booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2024}
}

Wir möchten dem ImageNet-Team für die Erstellung und Pflege des Datensatzes danken sowie den Autoren von Depth Anything für das Teachermodell, das zur Generierung der Pseudo-Tiefen-Labels verwendet wurde.

Mitwirkende

Kommentare