엔터프라이즈급 보안: ISO 27001 및 SOC 2 Type I 준수.

Link to this sectionImageNet (의사 라벨링된) 깊이 데이터셋#

ImageNet (의사 라벨링된 깊이) 데이터셋은 실제 깊이 정보(ground-truth)가 없는 1,281,167개의 ImageNet-1K 학습 이미지를 재사용하며, 각 이미지를 Depth Anything V3 티처 모델(단안 및 메트릭)로 생성된 의사 깊이 맵과 쌍으로 구성합니다. 이는 순수하게 지식 증류와 ImageNet이 제공하는 장면 및 객체의 다양성을 확보하기 위해 사용됩니다. 약 219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 가장 큰 단일 소스(약 58%)로서, 실내 도메인 간 일반화에 결정적인 역할을 했습니다.

Link to this section주요 특징#

  • 매우 광범위한 객체, 장면 및 문맥을 포함하는 1,281,167개의 ImageNet-1K 학습 이미지.
  • 실제 깊이 정보 없음: 모든 깊이 타겟은 Depth Anything V3 티처(단안, 메트릭)에 의해 생성된 의사 라벨입니다.
  • 벤치마크 용도가 아닌, 순수하게 지식 증류 및 장면/객체의 다양성 확보를 위해 사용됨.
  • ~219만 장 규모의 사전 학습 믹스에서 가장 큰 단일 소스(~58%)이며, 실내 도메인 간 일반화에 결정적임.
  • 검증 분할 없음 — 검증은 실제 Ground-truth 데이터셋에서만 수행됨.

Link to this section데이터셋 구조#

의사 라벨링된 ImageNet 소스는 ImageNet-1K 학습 이미지로 구성되며 이미지당 하나의 기계 생성 깊이 맵을 포함합니다:

  1. 학습 이미지: 1,281,167개의 ImageNet-1K 학습 이미지로, ~219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 가장 큰 단일 구성 요소(~58%)입니다.
  2. 검증: 없음. 이 소스는 검증 분할을 포함하지 않으며, YOLO26-Depth 검증은 NYU Depth V2 및 KITTI Eigen과 같은 실제 Ground-truth 데이터셋만을 사용합니다.

Link to this section의사 라벨 생성 방법#

ImageNet은 깊이 주석 없이 제공되므로, 깊이 타겟은 측정된 것이 아니라 오프라인으로 생성됩니다:

  1. 각 ImageNet 학습 이미지는 사전 학습된 Depth Anything V3 티처 모델을 통과하여 픽셀별 메트릭 깊이 맵을 예측합니다.
  2. The teacher prediction is saved as a .npy float32 array in meters, following the Ultralytics depth dataset format, and paired with its source image by file stem.
  3. 이 의사 라벨링된 쌍들은 더 큰 학습 믹스의 한 구성 요소로 추가되며, 여기서 학생 YOLO26-Depth 모델은 실제 Ground-truth 소스로 학습하는 동시에 티처의 결과를 모방하도록 학습합니다.

이 의사 라벨링된 소스는 출시된 YOLO26-Depth 가중치를 사전 학습하기 위해 사용된 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다.

Link to this sectionYOLO26-Depth에서의 역할#

이 소스는 YOLO26-Depth 사전 학습 데이터의 대부분을 차지하며 가장 폭넓은 장면과 객체의 다양성을 제공합니다. 강력한 Depth Anything V3 티처를 백만 장 이상의 이미지에 걸쳐 증류함으로써, 광범위한 장면 사전 정보를 학생 모델로 전달합니다. 실제로 이 데이터를 추가한 것은 실내 도메인 간 일반화에 결정적이었으며, 모델이 실제 Ground-truth 학습 분포를 넘어선 실내 장면에서도 좋은 성능을 내도록 도왔습니다.

Link to this section사용법#

의사 라벨링된 ImageNet 데이터는 단독으로 학습되지 않으며, 공개 데이터셋 다운로드가 아닌 내부/실험용 YAML로 정의된 통합 깊이 믹스의 한 구성 요소로 사용됩니다. 개념적으로 이러한 믹스에 대한 학습 과정은 다음과 같습니다:

훈련 예제
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

Link to this section사전 학습된 모델#

사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조될 때 Ultralytics v8.4.0 에셋 릴리스에서 자동 다운로드됩니다:

Link to this section인용 및 감사의 글#

연구 또는 개발 작업에 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오.

인용
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@inproceedings{yang2024depthanything,
      title={Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data},
      author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang},
      booktitle={IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2024}
}

데이터셋을 구축하고 유지 관리해 온 ImageNet 팀과 의사 깊이 라벨을 생성하는 데 사용된 티처 모델을 제공한 Depth Anything 저자들에게 감사를 표합니다.

기여자

댓글