YOLO Vision 2026:

ImageNet (의사 라벨링된) 깊이 데이터셋#

ImageNet (의사 라벨링된 깊이) 데이터셋은 실제 정답 깊이 값이 없는 1,281,167장의 ImageNet-1K 학습 이미지를 재사용하며, 단안 및 미터법 체크포인트를 결합한 Depth Anything 3 티처가 생성한 의사 깊이 맵과 각 이미지를 쌍으로 연결합니다. 이 데이터셋은 순전히 지식 증류와 ImageNet이 제공하는 장면 및 객체 다양성을 위해 사용됩니다. 약 219만 장 규모의 YOLO26-Depth 사전 학습 믹스(약 58%)에서 단일 소스로 가장 큰 비중을 차지하므로, 이를 추가한 것은 실내 교차 도메인 일반화에 결정적인 역할을 했습니다.

주요 특징#

  • 매우 광범위한 객체, 장면 및 문맥을 포함하는 1,281,167개의 ImageNet-1K 학습 이미지.
  • 실제 정답 깊이 값 없음: 모든 깊이 타겟은 Depth Anything 3 티처가 페어링하여 생성한 의사 라벨입니다(장면 구조용 DA3MONO-LARGE, 미터법 스케일용 DA3METRIC-LARGE).
  • 벤치마크 용도가 아닌, 순수하게 지식 증류 및 장면/객체의 다양성 확보를 위해 사용됨.
  • ~219만 장 규모의 사전 학습 믹스에서 가장 큰 단일 소스(~58%)이며, 실내 도메인 간 일반화에 결정적임.
  • 검증 분할 없음 — 검증은 실제 Ground-truth 데이터셋에서만 수행됨.

데이터셋 구조#

의사 라벨링된 ImageNet 소스는 ImageNet-1K 학습 이미지로 구성되며 이미지당 하나의 기계 생성 깊이 맵을 포함합니다:

  1. 학습 이미지: 1,281,167개의 ImageNet-1K 학습 이미지로, ~219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 가장 큰 단일 구성 요소(~58%)입니다.
  2. 검증: 없음. 이 소스는 검증 분할을 포함하지 않으며, YOLO26-Depth 검증은 NYU Depth V2 및 KITTI Eigen과 같은 실제 Ground-truth 데이터셋만을 사용합니다.

의사 라벨 생성 방법#

ImageNet은 깊이 주석 없이 배포되므로, 깊이 타겟은 측정 방식이 아니라 오프라인으로 생성됩니다. 장면 구조용과 절대 스케일용의 두 가지 Depth Anything 3 체크포인트가 결합됩니다.

  1. 각 ImageNet 학습 이미지는 알 수 없는 이미지별 스케일 및 시프트 범위 내에서만 정의되는 매우 상세한 깊이 맵을 예측하는 depth-anything/DA3MONO-LARGE과, 더 거칠지만 실제 단위로 출력되는 depth-anything/DA3METRIC-LARGE을 통과합니다.
  2. 이미지별 강건한 아인핀 피팅(affine fit)을 통해 단안 예측을 미터법 예측인 label = a * mono + b에 매핑합니다. 따라서 모든 픽셀 단위 세부 정보는 단안 체크포인트에서 비롯되며, 미터법 체크포인트는 맵을 미터 축에 배치하는 두 개의 스칼라만 설정합니다. 카메라 내부 파라미터가 관여하지 않으므로 캘리브레이션이 없는 이미지도 라벨링할 수 있습니다.
  3. 결과는 Ultralytics depth dataset format에 따라 16비트 밀리미터 PNG로 저장되며, 파일 스템을 통해 원본 이미지와 쌍을 이룹니다.
  4. 이 의사 라벨링된 쌍들은 더 큰 학습 믹스의 한 구성 요소로 추가되며, 여기서 학생 YOLO26-Depth 모델은 실제 Ground-truth 소스로 학습하는 동시에 티처의 결과를 모방하도록 학습합니다.

스케일이 측정값이 아닌 예측에서 비롯되기 때문에, 각 맵은 전역 스케일 오차를 가질 수 있습니다. YOLO26-Depth는 스케일 불변 로그(SILog) 손실과 그래디언트 매칭을 사용하여 학습하고 중앙값 정렬로 검증하므로, 의사 라벨의 이미지별 스케일 오프셋은 대부분 상쇄됩니다.

이 의사 라벨링된 소스는 출시된 YOLO26-Depth 가중치를 사전 학습하기 위해 사용된 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다.

YOLO26-Depth에서의 역할#

이 소스는 YOLO26-Depth 사전 학습 데이터의 대부분을 차지하며 가장 광범위한 장면과 객체 다양성을 제공합니다. 백만 장이 넘는 이미지에 대해 강력한 Depth Anything 3 티처를 증류함으로써, 넓은 장면 사전 지식을 스학생 모델로 전달합니다. 실제로 이를 추가한 것은 실내 교차 도메인 일반화에 결정적인 역할을 하여, 모델이 실제 정답 학습 분포를 넘어선 실내 장면에서도 잘 수행되도록 도왔습니다.

사용법#

의사 라벨링된 ImageNet 데이터는 단독으로 학습되지 않으며, 공개 데이터셋 다운로드가 아닌 내부/실험용 YAML로 정의된 통합 깊이 믹스의 한 구성 요소로 사용됩니다. 개념적으로 이러한 믹스에 대한 학습 과정은 다음과 같습니다:

훈련 예제
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

사전 학습된 모델#

사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조될 때 Ultralytics v8.4.0 assets release에서 자동으로 다운로드됩니다:

인용 및 감사의 글#

연구 또는 개발 작업에 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오.

인용
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

데이터셋을 생성하고 유지 관리해 주신 ImageNet 팀과, 의사 깊이 라벨을 생성하는 데 사용된 티처 모델을 제공해 주신 Depth Anything 3의 저자들에게 감사를 표합니다.

댓글