Ultralytics YOLO27:
Get Started

ImageNet (의사 라벨링) Depth 데이터셋#

ImageNet(의사 라벨링된 depth) 데이터셋은 정답 depth가 없는 ImageNet-1K 학습 이미지 1,281,167장을 재사용하고, 각 이미지에 Depth Anything 3 teacher가 단안 및 metric 체크포인트를 결합해 생성한 의사 depth 맵을 연결합니다. 이 데이터셋은 지식 증류와 ImageNet이 제공하는 장면 및 객체 다양성을 위해서만 사용됩니다. 약 2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 데이터 중 가장 큰 단일 소스(약 58%)이며, 이를 추가한 것은 실내 도메인 간 일반화에 결정적인 역할을 했습니다.

주요 기능#

  • 매우 다양한 객체, 장면, 맥락을 포함하는 ImageNet-1K 학습 이미지 1,281,167장입니다.
  • 정답 depth가 없습니다. 모든 depth 타깃은 Depth Anything 3 teacher가 생성한 의사 라벨이며, DA3MONO-LARGE은 장면 구조를, DA3METRIC-LARGE은 metric 스케일을 제공합니다.
  • 벤치마크가 아닌 지식 증류와 장면/객체 다양성 확보를 위해서만 사용됩니다.
  • 약 ~2.19M개 이미지로 구성된 사전 학습 데이터에서 가장 큰 단일 소스(약 ~58%)이며, 실내 도메인 간 일반화에 결정적인 역할을 합니다.
  • 검증 분할은 없습니다. 실제 정답 데이터셋에서만 검증을 수행합니다.

데이터셋 구조#

의사 라벨링된 ImageNet 소스는 ImageNet-1K 학습 이미지로 구성되며, 각 이미지에는 기계가 생성한 depth 맵 하나가 포함됩니다:

  1. 학습 이미지: ImageNet-1K 학습 이미지 1,281,167장으로, 약 ~2.19M개 이미지로 구성된 YOLO26-Depth 사전 학습 데이터의 가장 큰 단일 구성 요소(약 ~58%)입니다.
  2. 검증: 없음. 이 소스에는 검증 분할이 없습니다. YOLO26-Depth 검증에는 NYU Depth V2 및 KITTI Eigen과 같은 실제 정답 데이터셋만 사용합니다.

의사 라벨 생성 방법#

ImageNet에는 depth 어노테이션이 없으므로 depth 타깃은 측정값이 아니라 오프라인에서 생성합니다. 장면 구조와 절대 스케일을 각각 담당하는 Depth Anything 3 체크포인트 두 개를 결합합니다:

  1. 각 ImageNet 학습 이미지를 depth-anything/DA3MONO-LARGE에 입력하면 이미지별 미지의 스케일과 오프셋에 대해서만 정의되는 매우 상세한 depth 맵을 예측합니다. 또한 depth-anything/DA3METRIC-LARGE에도 입력하는데, 이 모델의 출력은 더 거칠지만 실제 단위로 표현됩니다.
  2. 이미지별 강건 아핀 피팅을 통해 단안 예측 결과를 metric 예측 결과인 label = a * mono + b에 매핑합니다. 따라서 픽셀별 세부 정보는 모두 단안 체크포인트에서 나오고, metric 체크포인트는 맵을 미터 축에 배치하는 두 개의 스칼라만 설정합니다. 카메라 내부 파라미터는 사용하지 않으므로 보정되지 않은 이미지에도 라벨을 지정할 수 있습니다.
  3. 결과는 Ultralytics depth dataset format에 따라 16비트 밀리미터 PNG로 저장되며, 파일명 기준으로 원본 이미지와 짝을 이룹니다.
  4. 그런 다음 의사 라벨링된 쌍을 더 큰 학습 데이터 구성의 한 요소로 추가합니다. 이 구성에서 student YOLO26-Depth 모델은 실제 정답 데이터 소스로 학습하는 동시에 teacher의 출력을 모방하도록 학습됩니다.

스케일은 측정값이 아니라 예측에서 가져오므로 각 맵에 전역 스케일 오차가 포함될 수 있습니다. YOLO26-Depth는 스케일 불변 로그(SILog) 손실과 gradient matching을 사용해 학습하고 중앙값 정렬로 검증하므로, 의사 라벨의 이미지별 스케일 오프셋은 대부분 흡수됩니다.

이 의사 라벨링 소스는 공개된 YOLO26-Depth 가중치를 사전 학습하는 데 사용되는 내부 혼합 학습 구성의 일부이며, 독립된 다운로드 항목으로 배포되지 않습니다.

YOLO26-Depth에서의 역할#

이 소스는 YOLO26-Depth 사전 학습 데이터의 대부분과 가장 폭넓은 장면 및 객체 다양성을 제공합니다. 백만 개가 넘는 이미지에 강력한 Depth Anything 3 teacher의 지식을 증류해 광범위한 장면 사전 정보를 student로 전달합니다. 실제로 이 소스를 추가한 것은 실내 도메인 간 일반화에 결정적이었으며, 실제 정답 데이터의 학습 분포를 벗어난 실내 장면에서도 모델의 성능을 높이는 데 도움이 되었습니다.

사용법#

의사 라벨링된 ImageNet 데이터는 단독으로 학습에 사용되지 않습니다. 공개 데이터셋 다운로드가 아닌 내부/실험 YAML로 정의된 depth 혼합 데이터의 한 요소로 사용됩니다. 이러한 혼합 데이터로 학습하는 방식은 개념적으로 다음과 같습니다:

학습 예제
from ultralytics import YOLO

# 사전 학습된 깊이 모델을 불러옵니다.
model = YOLO("yolo26n-depth.pt")

# 결합된 depth 혼합 데이터(직접 구성한 다중 소스 데이터셋 YAML)로 학습합니다
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

사전 학습 모델#

사전 학습된 YOLO26-Depth 모델은 이름으로 처음 참조할 때 Ultralytics v8.4.0 assets release에서 자동으로 다운로드됩니다:

인용 및 감사의 글#

연구 또는 개발 작업에서 ImageNet 데이터셋을 사용하는 경우 다음 논문을 인용해 주세요:

인용
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

데이터셋을 만들고 유지 관리한 ImageNet 팀과 의사 깊이 레이블 생성에 사용된 teacher 모델을 제공한 Depth Anything 3 저자에게 감사드립니다.

자주 묻는 질문#

  • 측정된 깊이가 없는 ImageNet-1K 학습 이미지 1,281,167개를 재사용하고, 각 이미지에 Depth Anything 3 teacher가 예측한 깊이 맵을 연결합니다. 약 219만 개 이미지로 구성된 YOLO26-Depth 사전 학습 혼합 데이터에서 가장 큰 단일 데이터 소스이며(약 58%), 지식 증류와 장면 다양성 확보에만 사용됩니다.

  • 각 이미지는 상대 구조를 상세히 파악하는 DA3MONO-LARGE과 미터 단위 스케일을 산출하는 DA3METRIC-LARGE을 통해 처리됩니다. 이미지별 강건한 아핀 피팅으로 단안 예측값을 미터 단위 예측값에 매핑하고, 결과를 Ultralytics 깊이 형식의 16비트 밀리미터 단위 PNG 파일로 저장합니다. 자세한 내용은 의사 레이블 생성 방법을 참조하세요.

  • 아니요. 이 데이터 소스는 공개된 YOLO26-Depth 가중치의 기반이 되는 내부 혼합 학습 구성의 일부이며, 독립형 다운로드로 배포되지 않습니다. 비슷한 데이터셋을 만들려면 깊이 teacher를 사용해 자체 이미지의 의사 레이블을 생성하고 표준 깊이 레이아웃에 저장하세요.

댓글