Ultralytics YOLO27:

ImageNet (의사 라벨링) 깊이 데이터셋#

ImageNet (의사 라벨링된 깊이) 데이터셋은 정답 깊이 정보가 없는 1,281,167개의 ImageNet-1K 학습 이미지를 재사용하고, 각 이미지에 Depth Anything 3 teacher가 단안 및 metric checkpoint를 결합하여 생성한 의사 깊이 맵을 연결합니다. 이 데이터셋은 전적으로 지식 distillation과 ImageNet이 제공하는 장면 및 객체 다양성을 위해 사용됩니다. 약 2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 혼합 데이터의 단일 최대 출처(약 58%)로서, 이를 추가한 것은 실내 교차 도메인 일반화에 결정적이었습니다.

주요 기능#

  • 매우 광범위한 객체, 장면 및 맥락을 포함하는 1,281,167개의 ImageNet-1K 학습 이미지입니다.
  • 정답 깊이 정보 없음: 모든 깊이 target은 Depth Anything 3 teacher가 생성한 의사 라벨이며, teacher는 (DA3MONO-LARGE은 장면 구조용, DA3METRIC-LARGE은 metric scale용) 두 모델을 함께 사용합니다.
  • 벤치마크가 아니라 전적으로 지식 distillation 및 장면/객체 다양성을 위해 사용됩니다.
  • ~2.19M개 이미지로 구성된 사전 학습 혼합 데이터의 단일 최대 출처(~58%)이며, 실내 교차 도메인 일반화에 결정적입니다.
  • 검증 split 없음 — 검증은 실제 정답 데이터셋에서만 수행됩니다.

데이터셋 구조#

의사 라벨링된 ImageNet source는 이미지당 하나의 기계 생성 깊이 맵이 포함된 ImageNet-1K 학습 이미지로 구성됩니다:

  1. 학습 이미지: 1,281,167개의 ImageNet-1K 학습 이미지로, ~2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 혼합 데이터의 단일 최대 구성 요소(~58%)입니다.
  2. 검증: 없음. 이 source에는 검증 split이 없으며, YOLO26-Depth 검증은 NYU Depth V2 및 KITTI Eigen과 같은 실제 정답 데이터셋만 사용합니다.

의사 라벨 생성 방법#

ImageNet은 깊이 annotation 없이 제공되므로 깊이 target은 측정하는 대신 오프라인으로 생성됩니다. 두 개의 Depth Anything 3 checkpoint를 결합하며, 하나는 장면 구조용이고 다른 하나는 절대 scale용입니다:

  1. 각 ImageNet 학습 이미지는 depth-anything/DA3MONO-LARGE을 통해 처리되어, 이미지별로 알 수 없는 scale 및 shift까지로만 정의되는 매우 상세한 깊이 맵을 예측합니다. 또한 출력은 더 거칠지만 실제 단위로 표현되는 depth-anything/DA3METRIC-LARGE을 통해서도 처리됩니다.
  2. 이미지별 robust affine fit은 단안 예측을 metric 예측인 label = a * mono + b에 매핑합니다. 따라서 픽셀별 세부 정보는 모두 단안 checkpoint에서 나오며, metric checkpoint는 맵을 미터 축에 배치하는 두 개의 scalar만 설정합니다. 카메라 intrinsic은 사용되지 않으므로 calibration이 없는 이미지에도 라벨을 지정할 수 있습니다.
  3. 결과는 Ultralytics 깊이 데이터셋 형식에 따라 16비트 밀리미터 PNG로 저장되며, 파일 stem을 기준으로 source 이미지와 연결됩니다.
  4. 그런 다음 의사 라벨링된 pair를 더 큰 학습 혼합 데이터의 한 구성 요소로 추가합니다. 이때 student YOLO26-Depth 모델은 실제 정답 source로도 학습하면서 teacher의 출력을 일치시키도록 학습합니다.

scale은 측정값이 아니라 예측값에서 나오므로 각 맵에는 전역 scale 오차가 포함될 수 있습니다. YOLO26-Depth는 scale-invariant log (SILog) loss와 gradient matching을 함께 사용하여 학습하고 median alignment를 사용하여 검증하므로, 의사 라벨의 이미지별 scale offset이 대부분 흡수됩니다.

이 의사 라벨링 source는 공개된 YOLO26-Depth weight를 사전 학습하는 데 사용되는 내부 mixed-training configuration의 구성 요소이며, 독립적인 download로 배포되지 않습니다.

YOLO26-Depth에서의 역할#

이 source는 YOLO26-Depth 사전 학습 데이터의 대부분과 가장 광범위한 장면 및 객체 다양성을 제공합니다. 100만 개가 넘는 이미지에 걸쳐 강력한 Depth Anything 3 teacher의 지식을 distillation함으로써, 광범위한 장면 prior를 student에 전달합니다. 실제로 이를 추가한 것은 실내 교차 도메인 일반화에 결정적이었으며, 실제 정답 학습 분포를 벗어난 실내 장면에서도 모델이 우수하게 작동하도록 지원했습니다.

사용법#

의사 라벨링된 ImageNet 데이터는 단독으로 학습되지 않습니다. 공개 데이터셋 download가 아니라 내부/실험 YAML로 정의된 결합 depth mix의 한 구성 요소로 사용됩니다. 개념적으로 이러한 mix를 사용한 학습은 다음과 같습니다:

학습 예제
from ultralytics import YOLO

# Load a pretrained depth model
model = YOLO("yolo26n-depth.pt")

# Train on a combined depth mix (your own multi-source dataset YAML)
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

사전 학습 모델#

사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조될 때 Ultralytics v8.4.0 assets release에서 자동으로 download됩니다:

인용 및 감사의 글#

연구 또는 개발 작업에서 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주십시오:

인용문
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

데이터셋을 생성하고 유지 관리한 ImageNet team과 의사 깊이 라벨을 생성하는 데 사용된 teacher 모델을 개발한 Depth Anything 3 저자들에게 감사의 뜻을 전합니다.

FAQ#

  • 이 데이터셋은 측정된 심도가 없는 1,281,167장의 ImageNet-1K 학습 이미지를 재사용하며, 각 이미지를 Depth Anything 3 교사 모델이 예측한 심도 맵과 쌍으로 구성합니다. 이 데이터셋은 약 219만 장 규모의 YOLO26-Depth 사전 학습 믹스에서 단일 최대 소스(약 58%)를 차지하며, 순수하게 지식 증류와 장면 다양성을 위해 사용됩니다.

  • 각 이미지는 세부적인 상대적 구조를 위해 DA3MONO-LARGE을 통과하고 미터법 스케일을 위해 DA3METRIC-LARGE을 통과합니다. 이미지별 로버스트 아핀 피팅을 통해 단안 예측을 미터법 예측에 매핑하며, 그 결과는 Ultralytics depth format의 16비트 밀리미터 PNG로 저장됩니다. 자세한 내용은 How the pseudo-labels are generated를 참조하세요.

  • 아니요. 이 소스는 공개된 YOLO26-Depth 가중치 이면에 있는 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다. 유사한 세트를 구축하려면 심도 교사 모델을 사용하여 자신의 이미지에 대한 의사 라벨을 생성하고 표준 심도 레이아웃으로 저장하세요.

댓글