YOLO Vision 2026:

ImageNet (Pseudo-Labeled) Tiefendatensatz#

Das ImageNet (pseudo-luminierte Tiefen-) Datensatz wiederverwendet die 1.281.167 ImageNet-1K-Trainingsbilder, die keine Ground-Truth-Tiefe haben, und paart jedes Bild mit einer von einem Depth Anything 3-Lehrer erzeugten Pseudotiefenkarte, die dessen monokulare und metrische Checkpoints kombiniert. Er wird rein zur Wissensdestillation und wegen der von ImageNet bereitgestellten Szenen- und Objektvielfalt verwendet. Als die mit Abstand größte Quelle im etwa 2,19M Bilder umfassenden YOLO26-Depth-Vortrainingsmix (ca. 58 %) war seine Hinzufügung entscheidend für die domänenübergreifende Verallgemeinerung in Innenräumen.

Hauptfunktionen#

  • 1.281.167 ImageNet-1K-Trainingsbilder, die ein sehr breites Spektrum an Objekten, Szenen und Kontexten abdecken.
  • Keine Ground-Truth-Tiefe: Jedes Tiefenziel ist ein Pseudolabel, das von einem Depth Anything 3-Lehrer generiert wurde, der (DA3MONO-LARGE für die Szenenstruktur, DA3METRIC-LARGE für die metrische Skala) paart.
  • Wird rein für Wissensdestillation und Szenen-/Objektvielfalt verwendet, nicht als Benchmark.
  • Die größte Einzelquelle im ~2,19 Mio. Bilder umfassenden Pretraining-Mix (~58 %), entscheidend für die domänenübergreifende Generalisierung in Innenräumen.
  • Kein Validierungs-Split — die Validierung wird nur auf echten Ground-Truth-Datensätzen durchgeführt.

Datensatzstruktur#

Die pseudo-label-basierte ImageNet-Quelle besteht aus den ImageNet-1K-Trainingsbildern mit einer maschinell generierten Tiefenkarte pro Bild:

  1. Trainingsbilder: 1.281.167 ImageNet-1K-Trainingsbilder, die größte Einzelkomponente (~58 %) des ~2,19 Mio. Bilder umfassenden YOLO26-Depth-Pretraining-Mix.
  2. Validierung: keine. Diese Quelle hat keinen Validierungs-Split; die YOLO26-Depth-Validierung verwendet nur echte Ground-Truth-Datensätze wie NYU Depth V2 und KITTI Eigen.

Wie die Pseudo-Labels generiert werden#

Da ImageNet ohne Tiefenannotationen ausgeliefert wird, werden Tiefenziele offline anstatt gemessen erstellt. Zwei Depth Anything 3-Checkpoints werden kombiniert, einer für die Szenenstruktur und einer für die absolute Skala:

  1. Jedes ImageNet-Trainingsbild wird durch depth-anything/DA3MONO-LARGE geleitet, das eine hochdetaillierte Tiefenkarte vorhersagt, die nur bis zu einem unbekannten bildspezifischen Maßstab und einer Verschiebung definiert ist, sowie durch depth-anything/DA3METRIC-LARGE, dessen Ausgabe grober, aber in realen Einheiten ist.
  2. Ein bildspezifischer robuster affiner Fit bildet die monokulare Vorhersage auf die metrische ab, label = a * mono + b. Jedes Detail pro Pixel stammt daher vom monokularen Checkpoint, während der metrische Checkpoint nur die beiden Skalare festlegt, die die Karte auf die Meterachse setzen. Es sind keine Kameraintrinsiken beteiligt, sodass Bilder ohne Kalibrierung beschriftet werden können.
  3. Das Ergebnis wird als .npy-Array in Metern gemäß dem Ultralytics-Tiefendatensatzformat gespeichert und über den Dateinamen mit dem Quellbild verknüpft. Diese Karten werden als float16 gespeichert, um den Speicherplatzbedarf auf der Festplatte bei 1,28 Millionen Dateien zu halbieren; der Datensatz-Loader konvertiert sie beim Lesen in float32, und float32 bleibt das dokumentierte Format für benutzerdefinierte Tiefendatensätze.
  4. Die pseudo-label-basierten Paare werden dann als Komponente eines größeren Trainings-Mixes hinzugefügt, wobei ein Schüler-YOLO26-Depth-Modell lernt, den Lehrer zu imitieren, während es gleichzeitig an echten Ground-Truth-Quellen trainiert.

Da die Skala von einer Vorhersage statt von einer Messung stammt, kann jede Karte einen globalen Skalenfehler aufweisen. YOLO26-Depth trainiert mit einem skaleninvarianten Protokollverlust (SILog) plus Gradientenabgleich und validiert mit Medianausrichtung, sodass ein bildspezifischer Skalenversatz in den Pseudolabels weitgehend absorbiert wird.

Diese pseudo-label-basierte Quelle ist ein Bestandteil der internen Mixed-Training-Konfiguration, die zum Vortrainieren der veröffentlichten YOLO26-Depth-Gewichte verwendet wird, und wird nicht als eigenständiger Download bereitgestellt.

Rolle bei YOLO26-Depth#

Diese Quelle trägt den Hauptteil der YOLO26-Depth-Vortrainingsdaten und die größte Vielfalt an Szenen und Objekten bei. Durch die Distillation eines starken Depth Anything 3-Lehrers über mehr als eine Million Bilder überträgt sie breite Szenen-Priors in den Schüler. In der Praxis war das Hinzufügen entscheidend für die domänenübergreifende Generalisierung in Innenräumen, wodurch das Modell in Innenraumszenen außerhalb der tatsächlichen Ground-Truth-Trainingsverteilungen gute Leistungen erbringt.

Verwendung#

Die pseudo-label-basierten ImageNet-Daten werden nicht isoliert trainiert; sie werden als eine Komponente eines kombinierten Tiefen-Mixes konsumiert, der durch ein internes/Experiment-YAML definiert ist, nicht durch einen öffentlichen Datensatz-Download. Konzeptionell sieht das Training an einem solchen Mix wie folgt aus:

Trainingsbeispiel
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Vortrainierte Modelle#

Prätrainierte YOLO26-Depth-Modelle werden automatisch von den Ultralytics v8.4.0 assets release heruntergeladen, wenn sie zum ersten Mal namentlich referenziert werden:

Zitate und Danksagungen#

Wenn du den ImageNet-Datensatz in deiner Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte das folgende Papier:

Zitat
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Wir möchten dem ImageNet-Team für die Erstellung und Pflege des Datensatzes und den Autoren von Depth Anything 3 für die Lehrermodelle danken, die zur Generierung der Pseudotiefenlabels verwendet wurden.

Kommentare