Link to this sectionImageNet (의사 라벨링된) 깊이 데이터셋#
ImageNet (의사 라벨링된 깊이) 데이터셋은 실제 깊이 정보(ground-truth)가 없는 1,281,167개의 ImageNet-1K 학습 이미지를 재사용하며, 각 이미지를 Depth Anything V3 티처 모델(단안 및 메트릭)로 생성된 의사 깊이 맵과 쌍으로 구성합니다. 이는 순수하게 지식 증류와 ImageNet이 제공하는 장면 및 객체의 다양성을 확보하기 위해 사용됩니다. 약 219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 가장 큰 단일 소스(약 58%)로서, 실내 도메인 간 일반화에 결정적인 역할을 했습니다.
Link to this section주요 특징#
- 매우 광범위한 객체, 장면 및 문맥을 포함하는 1,281,167개의 ImageNet-1K 학습 이미지.
- 실제 깊이 정보 없음: 모든 깊이 타겟은 Depth Anything V3 티처(단안, 메트릭)에 의해 생성된 의사 라벨입니다.
- 벤치마크 용도가 아닌, 순수하게 지식 증류 및 장면/객체의 다양성 확보를 위해 사용됨.
- ~219만 장 규모의 사전 학습 믹스에서 가장 큰 단일 소스(~58%)이며, 실내 도메인 간 일반화에 결정적임.
- 검증 분할 없음 — 검증은 실제 Ground-truth 데이터셋에서만 수행됨.
Link to this section데이터셋 구조#
의사 라벨링된 ImageNet 소스는 ImageNet-1K 학습 이미지로 구성되며 이미지당 하나의 기계 생성 깊이 맵을 포함합니다:
- 학습 이미지: 1,281,167개의 ImageNet-1K 학습 이미지로, ~219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 가장 큰 단일 구성 요소(~58%)입니다.
- 검증: 없음. 이 소스는 검증 분할을 포함하지 않으며, YOLO26-Depth 검증은 NYU Depth V2 및 KITTI Eigen과 같은 실제 Ground-truth 데이터셋만을 사용합니다.
Link to this section의사 라벨 생성 방법#
ImageNet은 깊이 주석 없이 제공되므로, 깊이 타겟은 측정된 것이 아니라 오프라인으로 생성됩니다:
- 각 ImageNet 학습 이미지는 사전 학습된 Depth Anything V3 티처 모델을 통과하여 픽셀별 메트릭 깊이 맵을 예측합니다.
- The teacher prediction is saved as a
.npyfloat32 array in meters, following the Ultralytics depth dataset format, and paired with its source image by file stem. - 이 의사 라벨링된 쌍들은 더 큰 학습 믹스의 한 구성 요소로 추가되며, 여기서 학생 YOLO26-Depth 모델은 실제 Ground-truth 소스로 학습하는 동시에 티처의 결과를 모방하도록 학습합니다.
이 의사 라벨링된 소스는 출시된 YOLO26-Depth 가중치를 사전 학습하기 위해 사용된 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다.
Link to this sectionYOLO26-Depth에서의 역할#
이 소스는 YOLO26-Depth 사전 학습 데이터의 대부분을 차지하며 가장 폭넓은 장면과 객체의 다양성을 제공합니다. 강력한 Depth Anything V3 티처를 백만 장 이상의 이미지에 걸쳐 증류함으로써, 광범위한 장면 사전 정보를 학생 모델로 전달합니다. 실제로 이 데이터를 추가한 것은 실내 도메인 간 일반화에 결정적이었으며, 모델이 실제 Ground-truth 학습 분포를 넘어선 실내 장면에서도 좋은 성능을 내도록 도왔습니다.
Link to this section사용법#
의사 라벨링된 ImageNet 데이터는 단독으로 학습되지 않으며, 공개 데이터셋 다운로드가 아닌 내부/실험용 YAML로 정의된 통합 깊이 믹스의 한 구성 요소로 사용됩니다. 개념적으로 이러한 믹스에 대한 학습 과정은 다음과 같습니다:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)Link to this section사전 학습된 모델#
사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조될 때 Ultralytics v8.4.0 에셋 릴리스에서 자동 다운로드됩니다:
Link to this section인용 및 감사의 글#
연구 또는 개발 작업에 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오.
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@inproceedings{yang2024depthanything,
title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2024}
}데이터셋을 구축하고 유지 관리해 온 ImageNet 팀과 의사 깊이 라벨을 생성하는 데 사용된 티처 모델을 제공한 Depth Anything 저자들에게 감사를 표합니다.