Ultralytics YOLO27:

ImageNet-Tiefendatensatz (mit Pseudolabels versehen)#

Der ImageNet-Datensatz (Tiefe mit Pseudolabels) verwendet die 1.281.167 Trainingsbilder von ImageNet-1K ohne Ground-Truth-Tiefe erneut und verknüpft jedes Bild mit einer von einem Depth Anything 3-Lehrermodell erzeugten Pseudotiefenkarte, die dessen monokulare und metrische Checkpoints kombiniert. Er wird ausschließlich zur Wissensdestillation sowie wegen der von ImageNet gebotenen Vielfalt an Szenen und Objekten verwendet. Als größte Einzelquelle im YOLO26-Depth-Vortrainingsmix mit ungefähr 2,19 Millionen Bildern (etwa 58 %) war seine Aufnahme entscheidend für die domänenübergreifende Verallgemeinerung auf Innenräume.

Wichtige Funktionen#

  • 1.281.167 ImageNet-1K-Trainingsbilder mit einer sehr großen Vielfalt an Objekten, Szenen und Kontexten.
  • Keine Ground-Truth-Tiefe: Jedes Tiefenziel ist ein von einem Depth Anything 3-Lehrermodell erzeugtes Pseudolabel, das (DA3MONO-LARGE für die Szenenstruktur, DA3METRIC-LARGE für den metrischen Maßstab) verwendet.
  • Ausschließlich für Wissensdestillation und die Vielfalt von Szenen und Objekten verwendet, nicht als Benchmark.
  • Die größte Einzelquelle im Vortrainingsmix mit ~2,19 Millionen Bildern (~58 %), entscheidend für die domänenübergreifende Verallgemeinerung auf Innenräume.
  • Kein Validierungssplit – die Validierung erfolgt ausschließlich auf realen Datensätzen mit Ground-Truth-Daten.

Datensatzstruktur#

Die mit Pseudolabels versehene ImageNet-Quelle besteht aus den ImageNet-1K-Trainingsbildern mit einer maschinell erzeugten Tiefenkarte pro Bild:

  1. Trainingsbilder: 1.281.167 ImageNet-1K-Trainingsbilder, die größte Einzelkomponente (~58 %) des YOLO26-Depth-Vortrainingsmixes mit ~2,19 Millionen Bildern.
  2. Validierung: keine. Diese Quelle hat keinen Validierungssplit; für die YOLO26-Depth-Validierung werden ausschließlich reale Datensätze mit Ground-Truth-Daten wie NYU Depth V2 und KITTI Eigen verwendet.

Erzeugung der Pseudolabels#

Da ImageNet ohne Tiefenannotationen bereitgestellt wird, werden die Tiefenziele offline erzeugt und nicht gemessen. Zwei Depth Anything 3-Checkpoints werden kombiniert: einer für die Szenenstruktur und einer für den absoluten Maßstab:

  1. Jedes ImageNet-Trainingsbild wird durch depth-anything/DA3MONO-LARGE verarbeitet, das eine sehr detaillierte Tiefenkarte vorhersagt, die nur bis auf einen unbekannten Maßstab und Versatz pro Bild bestimmt ist, sowie durch depth-anything/DA3METRIC-LARGE, dessen Ausgabe gröber ist, aber in realen Einheiten vorliegt.
  2. Eine robuste affine Anpassung pro Bild bildet die monokulare Vorhersage auf die metrische Vorhersage von label = a * mono + b ab. Jedes Detail pro Pixel stammt daher aus dem monokularen Checkpoint, während der metrische Checkpoint lediglich die beiden Skalare festlegt, die die Karte auf der Meterachse positionieren. Kameraintrinsik ist nicht erforderlich, sodass auch Bilder ohne Kalibrierung beschriftet werden können.
  3. Das Ergebnis wird als 16-Bit-Millimeter-PNG gemäß dem Ultralytics-Format für Tiefendatensätze gespeichert und anhand des Dateistamms mit dem Quellbild verknüpft.
  4. Die Paare mit Pseudolabels werden anschließend als eine Komponente eines größeren Trainingsmixes hinzugefügt. Dabei lernt ein YOLO26-Depth-Schülermodell, die Ausgabe des Lehrermodells nachzubilden, und wird gleichzeitig mit realen Quellen mit Ground-Truth-Daten trainiert.

Da der Maßstab aus einer Vorhersage und nicht aus einer Messung stammt, kann jede Karte einen globalen Maßstabsfehler aufweisen. YOLO26-Depth wird mit einem maßstabsinvarianten logarithmischen Verlust (SILog) sowie Gradientenabgleich trainiert und mit Mediananpassung validiert, sodass ein Maßstabsversatz pro Bild in den Pseudolabels weitgehend ausgeglichen wird.

Diese Quelle mit Pseudolabels ist eine Komponente der internen Konfiguration für das gemischte Training, die zum Vortrainieren der veröffentlichten YOLO26-Depth-Gewichte verwendet wird, und wird nicht als eigenständiger Download verteilt.

Rolle in YOLO26-Depth#

Diese Quelle liefert den Großteil der YOLO26-Depth-Vortrainingsdaten sowie die größte Vielfalt an Szenen und Objekten. Durch die Destillation eines leistungsstarken Depth Anything 3-Lehrermodells über mehr als eine Million Bilder überträgt sie umfangreiche Szenenprioren auf das Schülermodell. In der Praxis war ihre Aufnahme entscheidend für die domänenübergreifende Verallgemeinerung auf Innenräume und half dem Modell, auch bei Innenraumszenen außerhalb der realen Ground-Truth-Trainingsverteilungen gute Ergebnisse zu erzielen.

Verwendung#

Die mit Pseudolabels versehenen ImageNet-Daten werden nicht isoliert zum Training verwendet, sondern als eine Komponente eines kombinierten Tiefenmixes, der durch eine interne YAML-Datei für Experimente und nicht durch einen öffentlichen Datensatz-Download definiert wird. Konzeptionell sieht das Training mit einem solchen Mix wie folgt aus:

Trainingsbeispiel
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Vortrainierte Modelle#

Vortrainierte YOLO26-Depth-Modelle werden beim ersten Aufruf über ihren Namen automatisch aus dem Release der v8.4.0-Assets von Ultralytics heruntergeladen:

Zitate und Danksagungen#

Wenn du den ImageNet-Datensatz für deine Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte die folgende Publikation:

Zitat
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

Wir danken dem ImageNet-Team für die Erstellung und Pflege des Datensatzes sowie den Autoren von Depth Anything 3 für die Lehrermodelle, mit denen die Pseudotiefenlabels erzeugt wurden.

FAQ#

  • Er wiederverwendet die 1.281.167 ImageNet-1K-Trainingsbilder, die keine gemessene Tiefe aufweisen, und paart jedes einzelne mit einer Tiefenkarte, die von einem Depth Anything 3-Lehrer vorhergesagt wurde. Er ist die mit Abstand größte Quelle im etwa 2,19 Millionen Bilder umfassenden YOLO26-Depth-Pretraining-Mix (etwa 58 %) und wird rein für Wissensdistillation und Szenenvielfalt genutzt.

  • Jedes Bild wird durch DA3MONO-LARGE für detaillierte relative Struktur und durch DA3METRIC-LARGE für metrische Skalierung geleitet. Eine robuster affiner Fit pro Bild bildet die monokulare Vorhersage auf die metrische ab, und das Ergebnis wird als 16-Bit-Millimeter-PNG im Ultralytics depth format gespeichert. Siehe How the pseudo-labels are generated für Details.

  • Nein. Diese Quelle ist Teil der internen gemischten Trainingskonfiguration hinter den veröffentlichten YOLO26-Depth-Gewichten und wird nicht als eigenständiger Download vertrieben. Um ein ähnliches Set zu erstellen, generiere Pseudolabels für deine eigenen Bilder mit einem Tiefenlehrer und speichere sie im Standard-Tiefenlayout ab.

Kommentare