YOLO12: كشف الأجسام المتمحور حول الانتباه#
نظرة عامة#
يقدّم YOLO12، الذي أُطلق في أوائل عام 2025، بنيةً متمحورة حول الانتباه تختلف عن الأساليب التقليدية القائمة على CNN المستخدمة في نماذج YOLO السابقة، مع الحفاظ على سرعة الاستدلال في الوقت الفعلي الضرورية للعديد من التطبيقات. يحقق هذا النموذج دقةً عالية في كشف الأجسام من خلال ابتكارات منهجية جديدة في آليات الانتباه وبنية الشبكة ككل، مع الحفاظ على الأداء في الوقت الفعلي. وعلى الرغم من هذه المزايا، يظل YOLO12 إصدارًا مدفوعًا من المجتمع، وقد يُظهر عدم استقرار في التدريب، واستهلاكًا مرتفعًا للذاكرة، ومعدل نقل أبطأ على CPU بسبب كتل الانتباه الثقيلة؛ لذلك توصي Ultralytics باستخدام YOLO11 أو YOLO26 لمعظم أحمال العمل الإنتاجية.
Watch: How to Use YOLO12 for Object Detection with the Ultralytics Package | Is YOLO12 Fast or Slow? 🚀
الميزات الرئيسية#
- آلية الانتباه المساحي: أسلوب جديد للانتباه الذاتي يعالج الحقول الاستقبالية الكبيرة بكفاءة. يقسّم خرائط الميزات إلى l مناطق متساوية الحجم (تكون 4 افتراضيًا)، أفقيًا أو رأسيًا، متجنبًا العمليات المعقدة ومحافظًا على حقل استقبالي فعّال كبير. ويقلل ذلك تكلفة الحساب بدرجة كبيرة مقارنةً بالانتباه الذاتي القياسي.
- شبكات تجميع الطبقات الفعّالة المتبقية (R-ELAN): وحدة محسّنة لتجميع الميزات تستند إلى ELAN، ومصممة لمعالجة تحديات التحسين، ولا سيما في النماذج الأكبر حجمًا والمتمحورة حول الانتباه. يقدّم R-ELAN ما يلي:
- وصلات متبقية على مستوى الكتلة مع التحجيم (على نحو مشابه لتحجيم الطبقة).
- أسلوبًا معاد تصميمه لتجميع الميزات ينشئ بنية شبيهة بعنق الزجاجة.
- بنية الانتباه المحسّنة: يعمل YOLO12 على تبسيط آلية الانتباه القياسية لتحقيق كفاءة وتوافق أكبر مع إطار YOLO. ويشمل ذلك:
- استخدام FlashAttention لتقليل الحمل الزائد للوصول إلى الذاكرة.
- إزالة الترميز الموضعي لنموذج أبسط وأسرع.
- ضبط نسبة MLP (من القيمة الشائعة 4 إلى 1.2 أو 2) لتحقيق توازن أفضل في العمليات الحسابية بين طبقات الانتباه والطبقات التلقائية التغذية.
- تقليل عمق الكتل المكدسة لتحسين التحسين.
- الاستفادة من عمليات الالتفاف (حيثما كان ذلك مناسبًا) لكفاءتها الحسابية.
- إضافة التفاف قابل للفصل بحجم 7x7 (وهو «مُدرِك الموضع») إلى آلية الانتباه لترميز المعلومات الموضعية ضمنيًا.
- دعم شامل للمهام: يدعم YOLO12 مجموعة من مهام الرؤية الحاسوبية الأساسية: كشف الأجسام، وتجزئة المثيلات، وتصنيف الصور، وتقدير الوضعية، وكشف الأجسام الموجّهة (OBB).
- كفاءة محسّنة: يحقق دقة أعلى باستخدام عدد أقل من المعلمات مقارنةً بالعديد من النماذج السابقة، مما يبرهن على توازن محسّن بين السرعة والدقة.
- نشر مرن: صُمّم للنشر عبر منصات متنوعة، بدءًا من الأجهزة الطرفية ووصولًا إلى البنية التحتية السحابية.

المهام والأوضاع المدعومة#
يدعم YOLO12 مجموعة متنوعة من مهام الرؤية الحاسوبية. يوضّح الجدول أدناه دعم المهام والأوضاع التشغيلية (الاستدلال، والتحقق، والتدريب، والتصدير) المفعّلة لكل منها:
لا تُصدَر سوى أوزان الكشف (yolo12n.pt وyolo12s.pt وyolo12m.pt وyolo12l.pt وyolo12x.pt) على ultralytics/assets. وتُعرَّف بنيات التجزئة والتصنيف والوضعية وOBB في ultralytics/cfg/models/12/، ولذلك تدعم تلك المتغيرات التدريب من الصفر باستخدام إعدادات .yaml، لكن لا تتوفر حاليًا ملفات .pt مدرّبة مسبقًا لها. وبالنسبة إلى نقاط التحقق المدرّبة مسبقًا للتجزئة أو الوضعية أو التصنيف أو OBB، توصي Ultralytics باستخدام YOLO11 أو YOLO26.
| نوع النموذج | المهمة | الأوزان المدرّبة مسبقًا | التدريب | التحقق | الاستدلال | التصدير |
|---|---|---|---|---|---|---|
| YOLO12 | الكشف | ✅ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-seg | التجزئة | ❌ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-cls | التصنيف | ❌ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-pose | الوضعية | ❌ | ✅ | ✅ | ✅ | ✅ |
| YOLO12-obb | OBB | ❌ | ✅ | ✅ | ✅ | ✅ |
تدعم جميع بنيات YOLO12 كل وضع بمجرد توفر نقطة تحقق مدرّبة. يشير العمود Pretrained Weights فقط إلى ما إذا كانت Ultralytics تنشر وزنًا رسميًا مدرّبًا مسبقًا .pt على ultralytics/assets: وبالنسبة إلى التجزئة والوضعية والتصنيف وOBB، يجب تدريب نقطة تحقق خاصة بك من إعدادات .yaml المقابلة قبل تشغيل الاستدلال أو التحقق أو التصدير.
مقاييس الأداء#
يُظهر YOLO12 تحسينات ملحوظة في الدقة عبر جميع أحجام النماذج، مع بعض المفاضلات في السرعة مقارنةً بنماذج YOLO السابقة الأسرع. فيما يلي النتائج الكمية الخاصة بـكشف الأجسام على مجموعة بيانات التحقق COCO:
أداء الكشف (COCO val2017)#
| النموذج | الحجم (بكسل) | mAPval 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT (مللي ثانية) | المعاملات (M) | FLOPs (B) | المقارنة (mAP/السرعة) |
|---|---|---|---|---|---|---|---|
| YOLO12n | 640 | 40.6 | - | 1.64 | 2.6 | 7.5 | +2.1%/-9% (مقابل YOLOv10n) |
| YOLO12s | 640 | 48.0 | - | 2.61 | 9.3 | 23.3 | +0.1%/+42% (مقابل RT-DETRv2) |
| YOLO12m | 640 | 52.5 | - | 4.86 | 20.2 | 70.7 | +1.0%/-3% (مقابل YOLO11m) |
| YOLO12l | 640 | 53.7 | - | 6.77 | 26.4 | 95.4 | +0.4%/-8% (مقابل YOLO11l) |
| YOLO12x | 640 | 55.2 | - | 11.79 | 59.1 | 208.9 | +0.6%/-4% (مقابل YOLO11x) |
- قيسَت سرعة الاستدلال على وحدة معالجة الرسومات NVIDIA T4 باستخدام دقة TensorRT FP16 التنسيق.
- تُظهر المقارنات التحسن النسبي في mAP والتغير النسبي في السرعة (تشير القيمة الموجبة إلى سرعة أعلى؛ والسالبة إلى سرعة أقل). أُجريت المقارنات مقابل النتائج المنشورة لـ YOLOv10 وYOLO11 وRT-DETR حيثما توفرت.
أمثلة على الاستخدام#
يقدّم هذا القسم أمثلةً على التدريب والاستدلال باستخدام YOLO12. للحصول على وثائق أشمل حول هذه الأوضاع وغيرها (بما في ذلك التحقق والتصدير)، راجع صفحتي التنبؤ والتدريب المخصصتين.
تركّز الأمثلة أدناه على نماذج YOLO12 Detect (لكشف الأجسام). وبالنسبة إلى المهام المدعومة الأخرى (التجزئة والتصنيف وتقدير الوضعية وكشف الأجسام الموجّهة)، راجع الوثائق الخاصة بكل مهمة: Segment وClassify وPose وOBB.
يمكن تمرير النماذج المدرّبة مسبقًا *.pt (باستخدام PyTorch) وملفات الإعداد *.yaml إلى الفئة YOLO() لإنشاء مثيل نموذج في Python:
from ultralytics import YOLO
# Load a COCO-pretrained YOLO12n model
model = YOLO("yolo12n.pt")
# Train the model on the COCO8 example dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# Run inference with the YOLO12n model on the 'bus.jpg' image
results = model("path/to/bus.jpg")التحسينات الرئيسية#
-
استخراج الميزات المحسّن:
- الانتباه المساحي: يعالج الحقول الاستقبالية الكبيرة بكفاءة، مما يقلل تكلفة الحساب.
- التوازن المحسّن: تحسين التوازن بين العمليات الحسابية للانتباه والشبكة التلقائية التغذية.
- R-ELAN: يحسّن تجميع الميزات باستخدام بنية R-ELAN.
-
ابتكارات التحسين:
- الوصلات المتبقية: يقدّم وصلات متبقية مع التحجيم لتحقيق استقرار التدريب، ولا سيما في النماذج الأكبر.
- تكامل الميزات المنقّح: يطبّق أسلوبًا محسّنًا لتكامل الميزات ضمن R-ELAN.
- FlashAttention: يدمج FlashAttention لتقليل الحمل الزائد للوصول إلى الذاكرة.
-
الكفاءة المعمارية:
- معلمات أقل: يحقق عددًا أقل من المعلمات مع الحفاظ على الدقة أو تحسينها مقارنةً بالعديد من النماذج السابقة.
- انتباه مبسّط: يستخدم تنفيذًا مبسّطًا للانتباه، مع تجنب الترميز الموضعي.
- نِسَب MLP محسّنة: يضبط نسب MLP لتخصيص الموارد الحسابية بفاعلية أكبر.
المتطلبات#
لا يتطلب تنفيذ Ultralytics لـ YOLO12، افتراضيًا، FlashAttention. ومع ذلك، يمكن تجميع FlashAttention واستخدامه اختياريًا مع YOLO12. ولتجميع FlashAttention، يلزم توفر إحدى وحدات معالجة الرسومات NVIDIA التالية:
- وحدات معالجة الرسومات Turing (مثل T4 وسلسلة Quadro RTX)
- وحدات معالجة الرسومات Ampere (مثل سلسلة RTX30 وA30/40/100)
- وحدات معالجة الرسومات Ada Lovelace (مثل سلسلة RTX40)
- وحدات معالجة الرسومات Hopper (مثل H100/H200)
الاقتباسات والشكر والتقدير#
إذا استخدمت YOLO12 في أبحاثك، يُرجى الاستشهاد بالعمل الأصلي من جامعة بوفالو وجامعة الأكاديمية الصينية للعلوم:
@inproceedings{tian2025yolov12,
title={YOLOv12: Attention-Centric Real-Time Object Detectors},
author={Tian, Yunjie and Ye, Qixiang and Doermann, David},
booktitle={Advances in Neural Information Processing Systems},
volume={38},
pages={78433--78457},
year={2025},
url={https://proceedings.neurips.cc/paper_files/paper/2025/file/7103444259031cc58051f8c9a4868533-Paper-Conference.pdf}
}
@software{yolo12,
author = {Tian, Yunjie and Ye, Qixiang and Doermann, David},
title = {YOLO12: Attention-Centric Real-Time Object Detectors},
year = {2025},
url = {https://github.com/sunsmarterjie/yolov12},
license = {AGPL-3.0}
}نُشرت ورقة YOLO12 في وقائع NeurIPS 2025، مع نسخة أولية على arXiv.
الأسئلة الشائعة#
يدمج YOLO12 عدة ابتكارات رئيسية لتحقيق التوازن بين السرعة والدقة. تعالج آلية الانتباه المساحي الحقول الاستقبالية الكبيرة بكفاءة، مما يقلل تكلفة الحساب مقارنةً بالانتباه الذاتي القياسي. وتحسّن شبكات تجميع الطبقات الفعّالة المتبقية (R-ELAN) تجميع الميزات، وتعالج تحديات التحسين في النماذج الأكبر المتمحورة حول الانتباه. كما تعزز بنية الانتباه المحسّنة، بما في ذلك استخدام FlashAttention وإزالة الترميز الموضعي، الكفاءة بدرجة أكبر. وتتيح هذه الميزات لـ YOLO12 تحقيق دقة على أحدث مستوى مع الحفاظ على سرعة الاستدلال في الوقت الفعلي، وهي سرعة بالغة الأهمية للعديد من التطبيقات.
YOLO12 هو نموذج متعدد الاستخدامات يدعم مجموعة واسعة من مهام الرؤية الحاسوبية الأساسية. ويتفوق في كشف الأجسام، وتقسيم الكائنات، وتصنيف الصور، وتقدير الوضعية، وكشف الأجسام الموجّهة (OBB) (اطّلع على التفاصيل). ويجعل هذا الدعم الشامل للمهام من YOLO12 أداة قوية لتطبيقات متنوعة، بدءًا من الروبوتات والقيادة الذاتية ووصولًا إلى التصوير الطبي والفحص الصناعي. تجدر الإشارة إلى أن أوزان
.ptالمدرّبة مسبقًا منشورة حاليًا للكشف فقط؛ بينما تتوفر بنيات التقسيم والوضعية والتصنيف وOBB على شكل ملفات إعداد.yamlللتدريب من الصفر.يُظهر YOLO12 تحسينات كبيرة في الدقة عبر جميع أحجام النماذج مقارنةً بنماذج YOLO السابقة مثل YOLOv10 وYOLO11، مع بعض المفاضلات في السرعة مقارنةً بأسرع النماذج السابقة. فعلى سبيل المثال، يحقق YOLO12n تحسنًا قدره +2.1% في mAP مقارنةً بـ YOLOv10n، وتحسنًا قدره +1.2% مقارنةً بـ YOLO11n على مجموعة بيانات COCO val2017. وبالمقارنة مع نماذج مثل RT-DETR، يقدم YOLO12s تحسنًا قدره +1.5% في mAP وزيادة كبيرة في السرعة قدرها +42%. وتبرز هذه المقاييس التوازن القوي الذي يحققه YOLO12 بين الدقة والكفاءة. راجع قسم مقاييس الأداء للاطلاع على مقارنات مفصلة.
لا يتطلب تنفيذ Ultralytics لـ YOLO12 استخدام FlashAttention افتراضيًا. ومع ذلك، يمكن تجميع FlashAttention واستخدامه اختياريًا مع YOLO12 لتقليل الحمل الناتج عن الوصول إلى الذاكرة. ولتجميع FlashAttention، يلزم توفر إحدى وحدات معالجة الرسومات NVIDIA التالية: وحدات معالجة الرسومات Turing (مثل T4 وسلسلة Quadro RTX)، ووحدات معالجة الرسومات Ampere (مثل سلسلة RTX30 وA30/40/100)، ووحدات معالجة الرسومات Ada Lovelace (مثل سلسلة RTX40)، أو وحدات معالجة الرسومات Hopper (مثل H100/H200). وتتيح هذه المرونة للمستخدمين الاستفادة من مزايا FlashAttention عندما تسمح موارد الأجهزة بذلك.
تقدم هذه الصفحة أمثلة أساسية للاستخدام في التدريب والاستدلال. وللاطلاع على وثائق شاملة حول هذه الأوضاع وغيرها، بما في ذلك التحقق والتصدير، راجع صفحتي التنبؤ والتدريب المخصصتين. وللحصول على معلومات خاصة بكل مهمة (التقسيم، والتصنيف، وتقدير الوضعية، وكشف الأجسام الموجّهة)، راجع الوثائق ذات الصلة: Segment، وClassify، وPose، وOBB. توفر هذه الموارد إرشادات متعمقة لاستخدام YOLO12 بفعالية في سيناريوهات متنوعة.