Ultralytics YOLO27:

مجموعة بيانات عمق ImageNet (ذات تسميات زائفة)#

تعيد مجموعة بيانات ImageNet (بعمق ذي تسميات زائفة) استخدام صور التدريب البالغ عددها 1,281,167 من ImageNet-1K، التي لا تتوفر لها بيانات حقيقة أرضية للعمق، وتقرن كل صورة بخريطة عمق زائفة أنتجها نموذج معلّم Depth Anything 3، يجمع بين نقاط التحقق أحادية العين والمترية. وتُستخدم حصريًا في تقطير المعرفة ولما توفره ImageNet من تنوع في المشاهد والكائنات. وباعتبارها أكبر مصدر منفرد في مزيج التدريب المسبق لـ YOLO26-Depth، الذي يضم نحو 2.19M صورة (حوالي 58%)، كان لإضافتها أثر حاسم في التعميم الداخلي عبر المجالات.

الميزات الرئيسية#

  • 1,281,167 صورة تدريب من ImageNet-1K تغطي نطاقًا واسعًا جدًا من الكائنات والمشاهد والسياقات.
  • لا توجد بيانات حقيقة أرضية للعمق: كل هدف عمق هو تسمية زائفة مولّدة آليًا بواسطة نموذج معلّم Depth Anything 3 يجمع بين (DA3MONO-LARGE لبنية المشهد وDA3METRIC-LARGE للمقياس المتري).
  • تُستخدم حصريًا لتقطير المعرفة وتوفير تنوع المشاهد والكائنات، وليس معيارًا للتقييم.
  • أكبر مصدر منفرد في مزيج التدريب المسبق البالغ ~2.19M صورة (~58%)، وله دور حاسم في التعميم الداخلي عبر المجالات.
  • لا يوجد تقسيم للتحقق — إذ يُجرى التحقق فقط على مجموعات بيانات واقعية ذات بيانات حقيقة أرضية.

بنية مجموعة البيانات#

يتكون مصدر ImageNet ذي التسميات الزائفة من صور التدريب في ImageNet-1K، مع خريطة عمق واحدة مولّدة آليًا لكل صورة:

  1. صور التدريب: 1,281,167 صورة تدريب من ImageNet-1K، وهي أكبر مكوّن منفرد (~58%) في مزيج التدريب المسبق لـ YOLO26-Depth البالغ ~2.19M صورة.
  2. التحقق: لا يوجد. لا يتضمن هذا المصدر تقسيمًا للتحقق؛ ويستخدم التحقق من YOLO26-Depth مجموعات بيانات واقعية ذات بيانات حقيقة أرضية فقط، مثل NYU Depth V2 وKITTI Eigen.

كيفية إنشاء التسميات الزائفة#

نظرًا إلى أن ImageNet لا تتضمن تعليقات توضيحية للعمق، تُنتج أهداف العمق دون اتصال بدلًا من قياسها. ويُجمع بين نقطتي تحقق من Depth Anything 3، إحداهما لبنية المشهد والأخرى للمقياس المطلق:

  1. تُمرَّر كل صورة تدريب من ImageNet عبر depth-anything/DA3MONO-LARGE، الذي يتنبأ بخريطة عمق عالية التفاصيل لا تُحدَّد إلا حتى مقياس وإزاحة مجهولين لكل صورة، وكذلك عبر depth-anything/DA3METRIC-LARGE، الذي ينتج خريطة أخشن لكن بوحدات حقيقية.
  2. تُستخدم ملاءمة أفينية متينة لكل صورة لمواءمة التنبؤ أحادي العين مع التنبؤ المتري، label = a * mono + b. لذلك تأتي كل التفاصيل على مستوى البكسل من نقطة التحقق أحادية العين، بينما لا تحدد نقطة التحقق المترية سوى القيمتين اللتين تضعان الخريطة على مقياس الأمتار. ولا تُستخدم معلمات الكاميرا الداخلية، لذا يمكن وضع تسميات للصور غير المعايرة.
  3. تُحفظ النتيجة كصورة PNG بدقة 16 بت وبالمليمترات، وفق تنسيق مجموعة بيانات العمق من Ultralytics، وتُقرن بالصورة المصدر اعتمادًا على اسم الملف الأساسي.
  4. تُضاف بعد ذلك الأزواج ذات التسميات الزائفة باعتبارها مكوّنًا من مزيج تدريب أكبر، حيث يتعلم نموذج YOLO26-Depth طالب مطابقة النموذج المعلّم، ويتدرب أيضًا على مصادر حقيقية ذات بيانات حقيقة أرضية.

بما أن المقياس ناتج عن تنبؤ لا عن قياس، فقد تتضمن كل خريطة خطأً في المقياس العام. ويُدرَّب YOLO26-Depth باستخدام خسارة لوغاريتمية ثابتة المقياس (SILog) إلى جانب مطابقة التدرج، ويُتحقق من أدائه باستخدام المحاذاة بالوسيط؛ لذلك يُمتص إلى حد كبير انحراف المقياس لكل صورة في التسميات الزائفة.

يشكل هذا المصدر ذو التسميات الزائفة مكوّنًا من إعداد التدريب المختلط الداخلي المستخدم للتدريب المسبق لأوزان YOLO26-Depth المنشورة، ولا يُوزع لتنزيله بصورة مستقلة.

دورها في YOLO26-Depth#

يوفر هذا المصدر معظم بيانات التدريب المسبق لـ YOLO26-Depth وأوسع تنوع للمشاهد والكائنات. ومن خلال تقطير معارف نموذج معلّم قوي من Depth Anything 3 على أكثر من مليون صورة، ينقل هذا المصدر معارف عامة عن المشاهد إلى النموذج الطالب. وعمليًا، كان لإضافته أثر حاسم في التعميم الداخلي عبر المجالات، إذ ساعد النموذج على تحقيق أداء جيد في المشاهد الداخلية خارج توزيعات بيانات التدريب الواقعية ذات الحقيقة الأرضية.

الاستخدام#

لا تُستخدم بيانات ImageNet ذات التسميات الزائفة للتدريب بمعزل عن غيرها؛ بل تُستهلك بوصفها مكوّنًا من مزيج عمق موحد، تحدده ملفات YAML داخلية/تجريبية بدلًا من تنزيل مجموعة بيانات عامة. ومن الناحية المفاهيمية، يبدو التدريب على مزيج كهذا كما يلي:

مثال على التدريب
from ultralytics import YOLO

# ⁨تحميل نموذج عمق مُدرّب مسبقًا⁩
model = YOLO("yolo26n-depth.pt")

# ⁨التدريب على مزيج عمق موحد (ملف YAML خاص بك لمجموعة بيانات متعددة المصادر)⁩
results = model.train(data="depth-mix.yaml", epochs=100, imgsz=640)

النماذج المدربة مسبقًا#

تُنزَّل نماذج YOLO26-Depth المُدرَّبة مسبقًا تلقائيًا من إصدار أصول Ultralytics v8.4.0 عند الإشارة إليها بالاسم للمرة الأولى:

الاستشهادات والشكر والتقدير#

إذا استخدمت مجموعة بيانات ImageNet في أبحاثك أو أعمال التطوير، يُرجى الاستشهاد بالورقة التالية:

اقتباس
@inproceedings{deng2009imagenet,
      title={ImageNet: A Large-Scale Hierarchical Image Database},
      author={Deng, Jia and Dong, Wei and Socher, Richard and Li, Li-Jia and Li, Kai and Fei-Fei, Li},
      booktitle={2009 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
      year={2009},
      organization={IEEE}
}

@article{depthanything3,
      title={Depth Anything 3: Recovering the visual space from any views},
      author={Lin, Haotong and Chen, Sili and Liew, Jun Hao and Chen, Donny Y. and Li, Zhenyu and Shi, Guang and Feng, Jiashi and Kang, Bingyi},
      journal={arXiv preprint arXiv:2511.10647},
      year={2025}
}

نود أن نشكر فريق ImageNet على إنشاء مجموعة البيانات وصيانتها، ومؤلفي Depth Anything 3 على توفير النماذج المعلّمة المستخدمة لإنشاء تسميات العمق الزائفة.

الأسئلة الشائعة#

  • تعيد هذه المجموعة استخدام 1,281,167 صورة تدريب من ImageNet-1K، لا تتوفر لها قياسات عمق، وتقرن كل صورة بخريطة عمق تنبأ بها نموذج معلّم من Depth Anything 3. وهي أكبر مصدر منفرد في مزيج التدريب المسبق YOLO26-Depth الذي يضم نحو 2.19 مليون صورة (حوالي 58%)، وتُستخدم حصريًا لتقطير المعرفة وتعزيز تنوع المشاهد.

  • تُمرر كل صورة عبر DA3MONO-LARGE للحصول على بنية نسبية مفصلة، وعبر DA3METRIC-LARGE للحصول على مقياس متري. وتُستخدم ملاءمة أفينية متينة لكل صورة لربط التنبؤ الأحادي بالكاميرا بالتنبؤ المتري، ثم تُحفظ النتيجة بصيغة PNG بدقة 16 بت وبوحدات المليمتر وفق تنسيق العمق من Ultralytics. راجع كيفية إنشاء التسميات الزائفة للاطلاع على التفاصيل.

  • لا. هذا المصدر جزء من إعداد التدريب المختلط الداخلي الذي يستند إليه إصدار أوزان YOLO26-Depth، ولا يُوزّع للتنزيل بشكل مستقل. لإنشاء مجموعة مماثلة، أنشئ تسميات زائفة لصورك باستخدام نموذج معلّم للعمق وخزّنها وفق تخطيط العمق القياسي.

المساهمون

التعليقات