ImageNet (의사 라벨링) Depth 데이터셋#
ImageNet(의사 라벨링된 depth) 데이터셋은 정답 depth가 없는 ImageNet-1K 학습 이미지 1,281,167장을 재사용하고, 각 이미지에 Depth Anything 3 teacher가 단안 및 metric 체크포인트를 결합해 생성한 의사 depth 맵을 연결합니다. 이 데이터셋은 지식 증류와 ImageNet이 제공하는 장면 및 객체 다양성을 위해서만 사용됩니다. 약 2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 데이터 중 가장 큰 단일 소스(약 58%)이며, 이를 추가한 것은 실내 도메인 간 일반화에 결정적인 역할을 했습니다.
주요 기능#
- 매우 다양한 객체, 장면, 맥락을 포함하는 ImageNet-1K 학습 이미지 1,281,167장입니다.
- 정답 depth가 없습니다. 모든 depth 타깃은 Depth Anything 3 teacher가 생성한 의사 라벨이며,
DA3MONO-LARGE은 장면 구조를,DA3METRIC-LARGE은 metric 스케일을 제공합니다. - 벤치마크가 아닌 지식 증류와 장면/객체 다양성 확보를 위해서만 사용됩니다.
- 약 ~2.19M개 이미지로 구성된 사전 학습 데이터에서 가장 큰 단일 소스(약 ~58%)이며, 실내 도메인 간 일반화에 결정적인 역할을 합니다.
- 검증 분할은 없습니다. 실제 정답 데이터셋에서만 검증을 수행합니다.
데이터셋 구조#
의사 라벨링된 ImageNet 소스는 ImageNet-1K 학습 이미지로 구성되며, 각 이미지에는 기계가 생성한 depth 맵 하나가 포함됩니다:
- 학습 이미지: ImageNet-1K 학습 이미지 1,281,167장으로, 약 ~2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 데이터의 가장 큰 단일 구성 요소(약 ~58%)입니다.
- 검증: 없음. 이 소스에는 검증 분할이 없습니다. YOLO26-Depth 검증에는 NYU Depth V2 및 KITTI Eigen과 같은 실제 정답 데이터셋만 사용합니다.
의사 라벨 생성 방법#
ImageNet에는 depth 어노테이션이 없으므로 depth 타깃은 측정값이 아니라 오프라인에서 생성합니다. 장면 구조와 절대 스케일을 각각 담당하는 Depth Anything 3 체크포인트 두 개를 결합합니다:
- 각 ImageNet 학습 이미지를
depth-anything/DA3MONO-LARGE에 입력하면 이미지별 미지의 스케일과 오프셋에 대해서만 정의되는 매우 상세한 depth 맵을 예측합니다. 또한depth-anything/DA3METRIC-LARGE에도 입력하는데, 이 모델의 출력은 더 거칠지만 실제 단위로 표현됩니다. - 이미지별 강건 아핀 피팅을 통해 단안 예측 결과를 metric 예측 결과인
label = a * mono + b에 매핑합니다. 따라서 픽셀별 세부 정보는 모두 단안 체크포인트에서 나오고, metric 체크포인트는 맵을 미터 축에 배치하는 두 개의 스칼라만 설정합니다. 카메라 내부 파라미터는 사용하지 않으므로 보정되지 않은 이미지에도 라벨을 지정할 수 있습니다. - 결과는 Ultralytics depth dataset format에 따라 16비트 밀리미터 PNG로 저장되며, 파일명 기준으로 원본 이미지와 짝을 이룹니다.
- 그런 다음 의사 라벨링된 쌍을 더 큰 학습 데이터 구성의 한 요소로 추가합니다. 이 구성에서 student YOLO26-Depth 모델은 실제 정답 데이터 소스로 학습하는 동시에 teacher의 출력을 모방하도록 학습됩니다.
스케일은 측정값이 아니라 예측에서 가져오므로 각 맵에 전역 스케일 오차가 포함될 수 있습니다. YOLO26-Depth는 스케일 불변 로그(SILog) 손실과 gradient matching을 사용해 학습하고 중앙값 정렬로 검증하므로, 의사 라벨의 이미지별 스케일 오프셋은 대부분 흡수됩니다.
이 의사 라벨링 소스는 공개된 YOLO26-Depth 가중치를 사전 학습하는 데 사용되는 내부 혼합 학습 구성의 일부이며, 독립된 다운로드 항목으로 배포되지 않습니다.
YOLO26-Depth에서의 역할#
이 소스는 YOLO26-Depth 사전 학습 데이터의 대부분과 가장 폭넓은 장면 및 객체 다양성을 제공합니다. 백만 개가 넘는 이미지에 강력한 Depth Anything 3 teacher의 지식을 증류해 광범위한 장면 사전 정보를 student로 전달합니다. 실제로 이 소스를 추가한 것은 실내 도메인 간 일반화에 결정적이었으며, 실제 정답 데이터의 학습 분포를 벗어난 실내 장면에서도 모델의 성능을 높이는 데 도움이 되었습니다.
사용법#
의사 라벨링된 ImageNet 데이터는 단독으로 학습에 사용되지 않습니다. 공개 데이터셋 다운로드가 아닌 내부/실험 YAML로 정의된 depth 혼합 데이터의 한 요소로 사용됩니다. 이러한 혼합 데이터로 학습하는 방식은 개념적으로 다음과 같습니다:
from ultralytics import YOLO
# 사전 학습된 깊이 모델을 불러옵니다.
model = YOLO("yolo26n-depth.pt")
# 결합된 depth 혼합 데이터(직접 구성한 다중 소스 데이터셋 YAML)로 학습합니다
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)사전 학습 모델#
사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조할 때 Ultralytics v8.4.0 assets release에서 자동으로 다운로드됩니다:
인용 및 감사의 글#
연구 또는 개발 작업에서 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주세요:
@inproceedings{deng2009imagenet,
title={ImageNet: A Large-Scale Hierarchical Image Database},
author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
year={2009},
organization={IEEE}
}
@article{depthanything3,
title={Depth Anything 3: Recovering the visual space from any views},
author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
journal={arXiv preprint arXiv:2511.10647},
year={2025}
}데이터셋을 만들고 유지 관리한 ImageNet 팀과 의사 깊이 레이블 생성에 사용된 teacher 모델을 제공한 Depth Anything 3 저자에게 감사드립니다.
자주 묻는 질문#
측정된 깊이가 없는 ImageNet-1K 학습 이미지 1,281,167개를 재사용하고, 각 이미지에 Depth Anything 3 teacher가 예측한 깊이 맵을 연결합니다. 약 219만 개 이미지로 구성된 YOLO26-Depth 사전 학습 혼합 데이터에서 가장 큰 단일 데이터 소스이며(약 58%), 지식 증류와 장면 다양성 확보에만 사용됩니다.
각 이미지는 상대 구조를 상세히 파악하는
DA3MONO-LARGE과 미터 단위 스케일을 산출하는DA3METRIC-LARGE을 통해 처리됩니다. 이미지별 강건한 아핀 피팅으로 단안 예측값을 미터 단위 예측값에 매핑하고, 결과를 Ultralytics 깊이 형식의 16비트 밀리미터 단위 PNG 파일로 저장합니다. 자세한 내용은 의사 레이블 생성 방법을 참조하세요.아니요. 이 데이터 소스는 공개된 YOLO26-Depth 가중치의 기반이 되는 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다. 비슷한 데이터셋을 만들려면 깊이 teacher를 사용해 자체 이미지의 의사 레이블을 생성하고 표준 깊이 레이아웃에 저장하세요.