Seguridad lista para empresas: Cumplimiento de ISO 27001 + SOC 2 Tipo I.

Link to this sectionConjunto de datos de profundidad SUN RGB-D#

SUN RGB-D es un benchmark de comprensión de escenas de interior del mundo real capturado con cuatro sensores RGB-D distintos: Intel RealSense, Asus Xtion y Microsoft Kinect v1 y v2. Su diseño multisensor lo convierte en una fuente valiosa de diversidad de profundidad interior real para la estimación de profundidad monocular.

Link to this sectionCaracterísticas clave#

  • Capturado con cuatro sensores RGB-D distintos (Intel RealSense, Asus Xtion, Microsoft Kinect v1 y v2), lo que proporciona una variedad multisensor real.
  • Cubre una amplia gama de escenas interiores reales para la investigación de comprensión de escenas.
  • Rango de profundidad de hasta aproximadamente 10 m, típico de la captura RGB-D de interior de consumo.
  • Verdad de terreno (ground truth) de profundidad derivada de sensor alineada con los fotogramas RGB.
  • Aporta diversidad interior multisensor real a la mezcla de preentrenamiento de profundidad de Ultralytics.

Link to this sectionEstructura del dataset#

El conjunto de datos de profundidad SUN RGB-D se divide en dos subconjuntos:

  1. Train: 9245 imágenes con mapas de profundidad emparejados para entrenamiento.
  2. Val: 1090 imágenes con mapas de profundidad emparejados para validación durante el entrenamiento del modelo.

Cada muestra consta de una imagen RGB y un mapa de profundidad .npy de tipo float32 emparejado que almacena las distancias por píxel en metros, siguiendo el formato de conjunto de datos de profundidad de Ultralytics.

Link to this sectionRol en YOLO26-Depth#

SUN RGB-D es una fuente de entrenamiento en la mezcla de preentrenamiento multiconjunto de datos de YOLO26-Depth de Ultralytics, que cuenta con aproximadamente 2,19 millones de pares de imagen-profundidad. Aporta diversidad interior multisensor real, exponiendo el modelo a profundidad capturada a través de varios dispositivos RGB-D de consumo distintos. Los modelos resultantes se evalúan en los benchmarks estándar NYU, KITTI, Make3D, ETH3D e iBims-1.

Link to this sectionYAML del dataset#

Se utiliza un archivo YAML (Yet Another Markup Language) para definir la configuración del conjunto de datos. Contiene información sobre las rutas del conjunto de datos, clases y otra información relevante.

ultralytics/cfg/datasets/depth-sunrgbd.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# SUN RGB-D dataset for monocular depth estimation — real indoor, multi-sensor RGB-D (RealSense/Xtion/Kinect), up to ~10 m
# Documentation: https://docs.ultralytics.com/datasets/depth/sunrgbd
# Example usage: yolo depth train data=depth-sunrgbd.yaml model=yolo26n-depth.pt
# parent
# ├── ultralytics
# └── datasets
#     └── depth-sunrgbd  ← downloads here (6.5 GB archive, ~14 GB converted)
#         ├── images/{train,val}  # RGB images
#         └── depth/{train,val}   # paired *.npy, float32 meters (images/ -> depth/)
# If an interrupted download leaves a partial dataset, delete the depth-sunrgbd dir and re-run to rebuild it.

path: depth-sunrgbd # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 9245 images
val: images/val # val images (relative to 'path') 1090 images

nc: 1
names:
  0: depth

channels: 3

# Download script/URL (optional)
download: |
  import random
  import shutil
  from pathlib import Path

  import cv2
  import numpy as np

  from ultralytics.utils import TQDM
  from ultralytics.utils.downloads import download

  # Download and extract the official archive (~6.5 GB), then convert each of the 10335 scenes:
  # refined depth_bfx PNGs decode via the SUN RGB-D bit-rotation (d>>3 | d<<13) to millimeters,
  # clipped at 10 m; a deterministic random 1090-scene subset (seed 0) forms the val split
  dir = Path(yaml["path"])  # dataset root dir
  download(["https://rgbd.cs.princeton.edu/data/SUNRGBD.zip"], dir=dir / "source", delete=True, exist_ok=True)
  for split in ("train", "val"):
      (dir / "images" / split).mkdir(parents=True, exist_ok=True)
      (dir / "depth" / split).mkdir(parents=True, exist_ok=True)
  scenes = sorted(p.parent for p in (dir / "source" / "SUNRGBD").rglob("depth_bfx"))
  names = ["_".join(s.relative_to(dir / "source" / "SUNRGBD").parts) for s in scenes]
  val = set(random.Random(0).sample(names, k=1090))
  for scene, name in TQDM(zip(scenes, names), total=len(scenes), desc="Converting"):
      split = "val" if name in val else "train"
      d = cv2.imread(str(next((scene / "depth_bfx").glob("*.png"))), cv2.IMREAD_ANYDEPTH)
      d = (((d >> 3) | (d << 13)) / 1000.0).clip(max=10).astype(np.float32)  # bit-rotated mm -> m
      np.save(dir / "depth" / split / f"{name}.npy", d)
      next((scene / "image").glob("*.jpg")).replace(dir / "images" / split / f"{name}.jpg")
  shutil.rmtree(dir / "source")

Link to this sectionUso#

Para entrenar un modelo YOLO26n-depth en el conjunto de datos SUN RGB-D con un tamaño de imagen de 640, puedes usar los siguientes fragmentos de código. Para obtener una lista completa de los argumentos disponibles, consulta la página de entrenamiento del modelo.

Ejemplo de entrenamiento
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load a pretrained depth model (recommended for training)

# Train the model
results = model.train(data="depth-sunrgbd.yaml", epochs=100, imgsz=640)

Link to this sectionModelos preentrenados#

La familia de profundidad YOLO26 se entrena con la amplia mezcla de preentrenamiento de profundidad multiconjunto de datos de la que forma parte SUN RGB-D. Estos modelos se descargan automáticamente desde la última versión de Ultralytics, por ejemplo YOLO26x-depth desde la v8.4.0, y abarcan una gama de tamaños para diferentes requisitos de precisión y recursos.

Link to this sectionCitas y agradecimientos#

Si utilizas el dataset SUN RGB-D en tu trabajo de investigación o desarrollo, por favor cita el siguiente artículo:

Cita
@inproceedings{song2015sunrgbd,
      title={SUN RGB-D: A RGB-D Scene Understanding Benchmark Suite},
      author={Song, Shuran and Lichtenberg, Samuel P. and Xiao, Jianxiong},
      booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2015}
}

Queremos agradecer a los autores por crear y mantener este valioso recurso para la comunidad de visión por computador.

Colaboradores

Comentarios