YOLO Vision 2026:

ImageNet (의사 라벨링된) 깊이 데이터셋#

ImageNet (의사 레이블링된 깊이) 데이터셋은 실제 깊이 값이 없는 1,281,167개의 ImageNet-1K 학습 이미지를 재사용하며, 각 이미지에 Depth Anything V3 교사 모델(단안 및 미터법)을 통해 생성된 의사 깊이 맵을 매칭합니다. 이 데이터셋은 순전히 지식 증류와 ImageNet이 제공하는 장면 및 객체 다양성을 위해 사용됩니다. 약 219만 장 규모의 YOLO26-Depth 사전 학습 믹스(약 58%)에서 단일 최대 소스인 이 데이터셋의 추가는 실내 크로스 도메인 일반화에 결정적인 역할을 했습니다.

주요 특징#

  • 매우 광범위한 객체, 장면 및 문맥을 포함하는 1,281,167개의 ImageNet-1K 학습 이미지.
  • 실제 깊이 정보 없음: 모든 깊이 타겟은 Depth Anything V3 티처(단안, 메트릭)에 의해 생성된 의사 라벨입니다.
  • 벤치마크 용도가 아닌, 순수하게 지식 증류 및 장면/객체의 다양성 확보를 위해 사용됨.
  • ~219만 장 규모의 사전 학습 믹스에서 가장 큰 단일 소스(~58%)이며, 실내 도메인 간 일반화에 결정적임.
  • 검증 분할 없음 — 검증은 실제 Ground-truth 데이터셋에서만 수행됨.

데이터셋 구조#

의사 라벨링된 ImageNet 소스는 ImageNet-1K 학습 이미지로 구성되며 이미지당 하나의 기계 생성 깊이 맵을 포함합니다:

  1. 학습 이미지: 1,281,167개의 ImageNet-1K 학습 이미지로, ~219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 가장 큰 단일 구성 요소(~58%)입니다.
  2. 검증: 없음. 이 소스는 검증 분할을 포함하지 않으며, YOLO26-Depth 검증은 NYU Depth V2 및 KITTI Eigen과 같은 실제 Ground-truth 데이터셋만을 사용합니다.

의사 라벨 생성 방법#

ImageNet은 깊이 주석 없이 제공되므로, 깊이 타겟은 측정된 것이 아니라 오프라인으로 생성됩니다:

  1. 각 ImageNet 학습 이미지는 사전 학습된 Depth Anything V3 티처 모델을 통과하여 픽셀별 메트릭 깊이 맵을 예측합니다.
  2. 티처 예측값은 Ultralytics depth dataset format에 따라 미터(meter) 단위의 .npy float32 배열로 저장되며, 파일 스템을 통해 원본 이미지와 쌍을 이룹니다.
  3. 이 의사 라벨링된 쌍들은 더 큰 학습 믹스의 한 구성 요소로 추가되며, 여기서 학생 YOLO26-Depth 모델은 실제 Ground-truth 소스로 학습하는 동시에 티처의 결과를 모방하도록 학습합니다.

이 의사 라벨링된 소스는 출시된 YOLO26-Depth 가중치를 사전 학습하기 위해 사용된 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다.

YOLO26-Depth에서의 역할#

이 소스는 YOLO26-Depth 사전 학습 데이터의 대부분을 차지하며 가장 폭넓은 장면과 객체의 다양성을 제공합니다. 강력한 Depth Anything V3 티처를 백만 장 이상의 이미지에 걸쳐 증류함으로써, 광범위한 장면 사전 정보를 학생 모델로 전달합니다. 실제로 이 데이터를 추가한 것은 실내 도메인 간 일반화에 결정적이었으며, 모델이 실제 Ground-truth 학습 분포를 넘어선 실내 장면에서도 좋은 성능을 내도록 도왔습니다.

사용법#

의사 라벨링된 ImageNet 데이터는 단독으로 학습되지 않으며, 공개 데이터셋 다운로드가 아닌 내부/실험용 YAML로 정의된 통합 깊이 믹스의 한 구성 요소로 사용됩니다. 개념적으로 이러한 믹스에 대한 학습 과정은 다음과 같습니다:

훈련 예제
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

사전 학습된 모델#

사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조될 때 Ultralytics v8.4.0 assets release에서 자동으로 다운로드됩니다:

인용 및 감사의 글#

연구 또는 개발 작업에 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오.

인용
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@inproceedings{yang2024depthanything,
      title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
      author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
      booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2024}
}

데이터셋을 구축하고 유지 관리해 온 ImageNet 팀과 의사 깊이 라벨을 생성하는 데 사용된 티처 모델을 제공한 Depth Anything 저자들에게 감사를 표합니다.

댓글