ImageNet (의사 라벨링) 깊이 데이터셋#
ImageNet (의사 라벨링된 깊이) 데이터셋은 정답 깊이 정보가 없는 1,281,167개의 ImageNet-1K 학습 이미지를 재사용하고, 각 이미지에 Depth Anything 3 teacher가 단안 및 metric checkpoint를 결합하여 생성한 의사 깊이 맵을 연결합니다. 이 데이터셋은 전적으로 지식 distillation과 ImageNet이 제공하는 장면 및 객체 다양성을 위해 사용됩니다. 약 2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 혼합 데이터의 단일 최대 출처(약 58%)로서, 이를 추가한 것은 실내 교차 도메인 일반화에 결정적이었습니다.
주요 기능#
- 매우 광범위한 객체, 장면 및 맥락을 포함하는 1,281,167개의 ImageNet-1K 학습 이미지입니다.
- 정답 깊이 정보 없음: 모든 깊이 target은 Depth Anything 3 teacher가 생성한 의사 라벨이며, teacher는 (
DA3MONO-LARGE은 장면 구조용,DA3METRIC-LARGE은 metric scale용) 두 모델을 함께 사용합니다. - 벤치마크가 아니라 전적으로 지식 distillation 및 장면/객체 다양성을 위해 사용됩니다.
- ~2.19M개 이미지로 구성된 사전 학습 혼합 데이터의 단일 최대 출처(~58%)이며, 실내 교차 도메인 일반화에 결정적입니다.
- 검증 split 없음 — 검증은 실제 정답 데이터셋에서만 수행됩니다.
데이터셋 구조#
의사 라벨링된 ImageNet source는 이미지당 하나의 기계 생성 깊이 맵이 포함된 ImageNet-1K 학습 이미지로 구성됩니다:
- 학습 이미지: 1,281,167개의 ImageNet-1K 학습 이미지로, ~2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 혼합 데이터의 단일 최대 구성 요소(~58%)입니다.
- 검증: 없음. 이 source에는 검증 split이 없으며, YOLO26-Depth 검증은 NYU Depth V2 및 KITTI Eigen과 같은 실제 정답 데이터셋만 사용합니다.
의사 라벨 생성 방법#
ImageNet은 깊이 annotation 없이 제공되므로 깊이 target은 측정하는 대신 오프라인으로 생성됩니다. 두 개의 Depth Anything 3 checkpoint를 결합하며, 하나는 장면 구조용이고 다른 하나는 절대 scale용입니다:
- 각 ImageNet 학습 이미지는
depth-anything/DA3MONO-LARGE을 통해 처리되어, 이미지별로 알 수 없는 scale 및 shift까지로만 정의되는 매우 상세한 깊이 맵을 예측합니다. 또한 출력은 더 거칠지만 실제 단위로 표현되는depth-anything/DA3METRIC-LARGE을 통해서도 처리됩니다. - 이미지별 robust affine fit은 단안 예측을 metric 예측인
label = a * mono + b에 매핑합니다. 따라서 픽셀별 세부 정보는 모두 단안 checkpoint에서 나오며, metric checkpoint는 맵을 미터 축에 배치하는 두 개의 scalar만 설정합니다. 카메라 intrinsic은 사용되지 않으므로 calibration이 없는 이미지에도 라벨을 지정할 수 있습니다. - 결과는 Ultralytics 깊이 데이터셋 형식에 따라 16비트 밀리미터 PNG로 저장되며, 파일 stem을 기준으로 source 이미지와 연결됩니다.
- 그런 다음 의사 라벨링된 pair를 더 큰 학습 혼합 데이터의 한 구성 요소로 추가합니다. 이때 student YOLO26-Depth 모델은 실제 정답 source로도 학습하면서 teacher의 출력을 일치시키도록 학습합니다.
scale은 측정값이 아니라 예측값에서 나오므로 각 맵에는 전역 scale 오차가 포함될 수 있습니다. YOLO26-Depth는 scale-invariant log (SILog) loss와 gradient matching을 함께 사용하여 학습하고 median alignment를 사용하여 검증하므로, 의사 라벨의 이미지별 scale offset이 대부분 흡수됩니다.
이 의사 라벨링 source는 공개된 YOLO26-Depth weight를 사전 학습하는 데 사용되는 내부 mixed-training configuration의 구성 요소이며, 독립적인 download로 배포되지 않습니다.
YOLO26-Depth에서의 역할#
이 source는 YOLO26-Depth 사전 학습 데이터의 대부분과 가장 광범위한 장면 및 객체 다양성을 제공합니다. 100만 개가 넘는 이미지에 걸쳐 강력한 Depth Anything 3 teacher의 지식을 distillation함으로써, 광범위한 장면 prior를 student에 전달합니다. 실제로 이를 추가한 것은 실내 교차 도메인 일반화에 결정적이었으며, 실제 정답 학습 분포를 벗어난 실내 장면에서도 모델이 우수하게 작동하도록 지원했습니다.
사용법#
의사 라벨링된 ImageNet 데이터는 단독으로 학습되지 않습니다. 공개 데이터셋 download가 아니라 내부/실험 YAML로 정의된 결합 depth mix의 한 구성 요소로 사용됩니다. 개념적으로 이러한 mix를 사용한 학습은 다음과 같습니다:
from ultralytics import YOLO
# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")
# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)사전 학습 모델#
사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조될 때 Ultralytics v8.4.0 assets release에서 자동으로 download됩니다:
인용 및 감사의 글#
연구 또는 개발 작업에서 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}데이터셋을 생성하고 유지 관리한 ImageNet team과 의사 깊이 라벨을 생성하는 데 사용된 teacher 모델을 개발한 Depth Anything 3 저자들에게 감사의 뜻을 전합니다.
FAQ#
이 데이터셋은 측정된 심도가 없는 1,281,167장의 ImageNet-1K 학습 이미지를 재사용하며, 각 이미지를 Depth Anything 3 교사 모델이 예측한 심도 맵과 쌍으로 구성합니다. 이 데이터셋은 약 219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 단일 최대 소스(약 58%)를 차지하며, 순수하게 지식 증류와 장면 다양성을 위해 사용됩니다.
각 이미지는 세부적인 상대적 구조를 위해
DA3MONO-LARGE을 통과하고 미터법 스케일을 위해DA3METRIC-LARGE을 통과합니다. 이미지별 로버스트 아핀 피팅을 통해 단안 예측을 미터법 예측에 매핑하며, 그 결과는 Ultralytics depth format의 16비트 밀리미터 PNG로 저장됩니다. 자세한 내용은 How the pseudo-labels are generated를 참조하세요.아니요. 이 소스는 공개된 YOLO26-Depth 가중치 이면에 있는 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다. 유사한 세트를 구축하려면 심도 교사 모델을 사용하여 자신의 이미지에 대한 의사 라벨을 생성하고 표준 심도 레이아웃으로 저장하세요.