YOLO Vision 2026:

مجموعة بيانات العمق Hypersim#

Hypersim هو مجموعة بيانات اصطناعية واقعية للغاية للمشاهد الداخلية، مُصممة لفهم المشاهد الداخلية بشكل شامل. يتم تتبع أشعة صورها من تصميمات داخلية ثلاثية الأبعاد احترافية من Evermotion، مما ينتج عنه عروض واقعية للغاية مقترنة بحقيقة أرضية للعمق لكل بكسل دقيقة وكثيفة.

نظرًا لأن Hypersim اصطناعي بالكامل، فإن كل بكسل له قيمة عمق دقيقة بدون ضوضاء المستشعر، أو العودة المفقودة، أو عيوب القياس. هذا يجعله مصدرًا ممتازًا لهندسة داخلية نظيفة وكثيفة لتدريب نماذج تقدير العمق أحادية العين.

الميزات الرئيسية#

  • مشاهد داخلية اصطناعية واقعية، يتم تتبع أشعتها ضوئيًا من تصميمات داخلية احترافية ثلاثية الأبعاد من Evermotion.
  • بيئات داخلية فقط.
  • حقيقة أرضية كثيفة ومثالية لـ العمق لكل بكسل بدون ضوضاء مستشعر أو قيم مفقودة.
  • نطاق العمق غالباً ≤10 أمتار (مع بعض المسافات الأكبر).
  • تساهم بـ 74,619 صورة (68,242 للتدريب / 6,377 للتحقق) في مجموعة تدريب العمق الخاصة بـ Ultralytics.

هيكل مجموعة البيانات#

تم تقسيم مجموعة بيانات العمق Hypersim إلى مجموعتين فرعيتين:

  1. التدريب (Train): 68,242 صورة مع خرائط عمق كثيفة مقترنة للتدريب.
  2. التحقق (Val): 6,377 صورة مع خرائط عمق كثيفة مقترنة للتحقق أثناء التدريب.

يتم إقران كل صورة RGB بخريطة عمق float32 .npy تخزن مسافات لكل بكسل بالأمتار، وفقًا لـ تنسيق مجموعة بيانات عمق Ultralytics.

الحصول على البيانات#

لا يحتوي Hypersim على تنزيل تلقائي — مجموعة البيانات (حوالي 1.9 تيرابايت من ملفات ZIP لكل مشهد) يتم تووزيعها بواسطة Apple بموجب ترخيص CC BY-SA 3.0 وتتم تنزيلها باستخدام البرنامج النصي الرسمي من مستودع ml-hypersim (يتوفر برنامج تنزيل انتقائي في contrib/99991):

git clone https://github.com/apple/ml-hypersim && cd ml-hypersim
python code/python/tools/dataset_download_images.py --downloads_dir ./downloads --decompress_dir ./scenes

إطارات RGB هي معاينات frame.*.tonemap.jpg ويوجد العمق في frame.*.depth_meters.hdf5. القيم المخزنة هي مسافات الأشعة إلى مركز الكاميرا، وليست العمق المستوي — قم بالتحويل قبل الحفظ، وقم بتعيين بكسلات NaN (النوافذ، السماء) إلى 0 (غير صالحة). استخدم تقسيم المشهد الرسمي metadata_images_split_scene_v1.csv لتخصيص التدريب/التحقق. تحويل مرجعي إلى تنسيق مجموعة بيانات عمق Ultralytics:

import shutil
from pathlib import Path

import h5py
import numpy as np

W, H, FOCAL = 1024, 768, 886.81  # Hypersim camera intrinsics
x, y = np.meshgrid(np.linspace(-W / 2, W / 2, W), np.linspace(-H / 2, H / 2, H))
ray2plane = (FOCAL / np.sqrt(x**2 + y**2 + FOCAL**2)).astype(np.float32)  # distance → planar depth

src, dst = Path("scenes"), Path("datasets/depth-hypersim")
out = "train"  # assign per scene from metadata_images_split_scene_v1.csv
(dst / f"images/{out}").mkdir(parents=True, exist_ok=True)
(dst / f"depth/{out}").mkdir(parents=True, exist_ok=True)
for h5 in sorted(src.rglob("*.depth_meters.hdf5")):
    scene, cam, frame = h5.parts[-4], h5.parent.name.split("_geometry")[0], h5.name.split(".")[1]
    rgb = h5.parents[1] / f"{cam}_final_preview" / f"frame.{frame}.tonemap.jpg"
    dist = np.asarray(h5py.File(h5)["dataset"], np.float32)
    depth = np.nan_to_num(dist * ray2plane, nan=0.0)  # NaN (sky, glass) → 0 = invalid
    name = f"{scene}_{cam}_{frame}"
    np.save(dst / f"depth/{out}/{name}.npy", depth)
    shutil.copy(rgb, dst / f"images/{out}/{name}.jpg")

الدور في YOLO26-Depth#

تعد Hypersim واحدة من مصادر التدريب في خليط المجموعات المتعددة الضخم (~2.19 مليون صورة) المستخدم لتدريب نماذج Ultralytics YOLO26-Depth مسبقاً. ضمن هذا المزيج، تساهم Hypersim بهندسة داخلية نظيفة وكثيفة تكمل بيانات العالم الحقيقي الأكثر ضجيجاً.

لا يوجد معيار قياس مستقل لـ Hypersim في هذا الإعداد. بدلاً من ذلك، يتم تقييم النماذج الناتجة وفقاً لمعايير تقدير العمق أحادية العين القياسية: NYU Depth V2 و KITTI و Make3D و ETH3D و iBims-1.

YAML مجموعة البيانات#

يتم استخدام ملف YAML (Yet Another Markup Language) لتحديد تكوين مجموعة البيانات. وهو يحتوي على معلومات حول مسارات مجموعة البيانات، والفئات، وغيرها من المعلومات ذات الصلة. بالنسبة لـ Hypersim، يحدد ملف depth-hypersim.yaml المسارات وفئة depth الواحدة.

ultralytics/cfg/datasets/depth-hypersim.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# Hypersim dataset for monocular depth estimation — photorealistic synthetic indoor (ray-traced), dense depth up to ~10 m
# Documentation: https://docs.ultralytics.com/datasets/depth/hypersim
# Example usage: yolo depth train data=depth-hypersim.yaml model=yolo26n-depth.pt
# No autodownload — obtain the source data (see docs) and arrange it as below.
# parent
# ├── ultralytics
# └── datasets
#     └── depth-hypersim
#         ├── images/{train,val}  # RGB images
#         └── depth/{train,val}   # paired *.npy, float32 meters (images/ -> depth/)

path: depth-hypersim # dataset root dir (relative to Ultralytics settings 'datasets_dir')
train: images/train # train images (relative to 'path') 68242 images
val: images/val # val images (relative to 'path') 6377 images

nc: 1
names:
  0: depth

channels: 3

الاستخدام#

لتدريب نموذج YOLO26n-Depth على مجموعة بيانات Hypersim بحجم صورة 640، يمكنك استخدام مقاطع الكود التالية. للحصول على قائمة شاملة بالوسائط المتاحة، راجع صفحة التدريب الخاصة بالنموذج.

مثال على التدريب
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-depth.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="depth-hypersim.yaml", epochs=100, imgsz=640)

النماذج المدربة مسبقاً#

عائلة عمق YOLO26 (yolo26n-depth.pt، yolo26s-depth.pt، yolo26m-depth.pt، yolo26l-depth.pt، yolo26x-depth.pt) تقوم بالتنزيل التلقائي من إصدارات Ultralytics وتم تدريبها على مزيج مجموعات البيانات المتعددة الواسع الذي يعد Hypersim جزءًا منه. استكشف YOLO26x-depth على منصة Ultralytics.

الاقتباسات والشكر#

إذا كنت تستخدم مجموعة بيانات Hypersim في أبحاثك أو عملك التطويري، يرجى الاستشهاد بالورقة البحثية التالية:

اقتباس
@inproceedings{roberts2021hypersim,
      title={Hypersim: A Photorealistic Synthetic Dataset for Holistic Indoor Scene Understanding},
      author={Mike Roberts and Jason Ramapuram and Anurag Ranjan and Atulit Kumar and Miguel Angel Bautista and Nathan Paczan and Russ Webb and Joshua M. Susskind},
      booktitle={Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)},
      year={2021}
}

نود أن نعرب عن تقديرنا لمبدعي Hypersim لإتاحة مجموعة البيانات الداخلية الاصطناعية الواقعية هذه لمجتمع رؤية الكمبيوتر.

المساهمون

التعليقات