DAMO-YOLO مقابل YOLOv9#
يواصل مجال كشف الأجسام في الزمن الحقيقي تطوره بوتيرة متسارعة للغاية. وفي سعي فرق الهندسة والباحثين إلى تحقيق التوازن الأمثل بين الدقة وسرعة الاستدلال والكفاءة الحسابية، برزت بنيتان لافتتان من مجتمع الأبحاث: DAMO-YOLO وYOLOv9. ويقدم كلا النموذجين ابتكارات معمارية مهمة تهدف إلى دفع حدود الإمكانات في الرؤية الحاسوبية.
يقدم هذا الدليل التقني المفصل تحليلًا متعمقًا لهذين النموذجين، ويقارن بين نهجيهما المعماريين المميزين ومنهجيات التدريب وقدرات النشر في العالم الحقيقي. كما نستكشف الدور الحاسم الذي تؤديه منظومة البرمجيات الأوسع في تطوير الذكاء الاصطناعي الحديث، ونسلط الضوء على مزايا المنصات المتكاملة مثل منصة Ultralytics والجيل الأحدث من النماذج مثل YOLO26.
ملخص تنفيذي: اختيار البنية المناسبة#
يمثل كلا النموذجين محطتين مهمتين في أبحاث التعلم العميق، إلا أنهما يلائمان فلسفتين مختلفتين قليلًا للنشر.
يتفوق DAMO-YOLO في البيئات التي يمكن فيها استخدام البحث المكثف عن البنية العصبية (NAS) لتحقيق خصائص أداء محددة، ما يجعله خيارًا جديرًا بالدراسة للنشر الطرفي المخصص. في المقابل، يركز YOLOv9 بدرجة كبيرة على حل اختناقات المعلومات في التعلم العميق، ويحقق كفاءة عالية للغاية في استخدام المعلمات.
لكن فرق الهندسة توصي باستمرار بالاستفادة من منظومة Ultralytics الموحدة عند النشر الجاهز للإنتاج. ويقدم أحدث نموذج YOLO26 للمشاريع الجديدة أفضل ما في كلا النهجين: دقة متطورة إلى جانب تصميم شامل اختياري يلغي الحاجة إلى المعالجة اللاحقة المعقدة.
رغم قوة DAMO-YOLO وYOLOv9 كنموذجين أكاديميين، فإن نشرهما في بيئة الإنتاج يتطلب غالبًا جهودًا هندسية مخصصة وكبيرة. ويوفر استخدام Ultralytics YOLO26 أداءً متطورًا عبر واجهة API مبسطة وسهلة الصيانة.
المواصفات التقنية والجهة المؤلفة#
يوفر فهم أصول هذه النماذج ومحاور تطويرها سياقًا أساسيًا لفهم مكامن قوة كل منها.
DAMO-YOLO#
يركز DAMO-YOLO، الذي طوره باحثون في مجموعة Alibaba، بدرجة كبيرة على التوليد الآلي للبنى ودمج الميزات بكفاءة.
- المؤلفون: Xianzhe Xu وYiqi Jiang وWeihua Chen وYilun Huang وYuan Zhang وXiuyu Sun
- المؤسسة: Alibaba Group
- تاريخ الإصدار: 23 نوفمبر 2022
- ورقة Arxiv: ورقة أبحاث DAMO-YOLO
- GitHub الرسمي: مستودع tinyvision/DAMO-YOLO
- الوثائق: ملف README الخاص بـDAMO-YOLO
تعرّف على المزيد حول DAMO-YOLO
YOLOv9#
طُرح YOLOv9 حلًا لمشكلة فقدان المعلومات في الشبكات الالتفافية العميقة، ودفع الحدود النظرية للحفاظ على التدرج أثناء التدريب.
- المؤلفون: Chien-Yao Wang وHong-Yuan Mark Liao
- المؤسسة: معهد علوم المعلومات، أكاديميا سينيكا، تايوان
- تاريخ الإصدار: 21 فبراير 2024
- ورقة Arxiv: ورقة أبحاث YOLOv9
- GitHub الرسمي: مستودع WongKinYiu/yolov9
- الوثائق: وثائق YOLOv9 من Ultralytics
ابتكارات البنية#
DAMO-YOLO: مدفوع بالبحث عن البنية العصبية#
يتميز DAMO-YOLO بمكونات مخصصة بدرجة كبيرة ومولدة آليًا. ويُنشأ عموده الفقري باستخدام البحث عن البنية العصبية (NAS)، مع استهداف استدلال منخفض الكمون على أجهزة متنوعة.
تتضمن البنية شبكة RepGFPN فعالة لدمج الميزات، وهي شبكة هرمية للميزات معممة معاد تحديد معالمها، تعزز كشف الأجسام متعددة المقاييس دون زيادة العبء الحسابي بشكل مفرط. كما تستخدم تصميم ZeroHead لتبسيط رأس الكشف، وتستعين بـAlignedOTA لإسناد التسميات، إلى جانب عملية تعزيز متطورة بالتقطير أثناء التدريب. وعلى الرغم من أن هذه التقنيات تحقق استدلالًا سريعًا، فإن عملية التقطير متعددة المراحل تتطلب غالبًا قدرًا كبيرًا من VRAM ووقت تدريب طويلًا.
YOLOv9: معالجة اختناق المعلومات#
يعالج YOLOv9 مشكلة أساسية في الشبكات العميقة: الفقدان التدريجي لمعلومات بيانات الإدخال أثناء مرورها عبر طبقات متعاقبة.
لمواجهة ذلك، قدّم المؤلفون معلومات التدرّج القابلة للبرمجة (PGI)، وهو إطار إشراف مساعد مصمم للاحتفاظ بالتفاصيل المهمة في الطبقات العميقة، وتوليد تدرّجات عالية الموثوقية لتحديث الأوزان. ويرافق PGI معمارية GELAN (شبكة تجميع الطبقات الفعّالة المعممة). تعمل GELAN على تحسين كفاءة المعلمات من خلال الجمع بين مزايا CSPNet وELAN، وزيادة تدفق المعلومات إلى أقصى حد مع تقليل عمليات الفاصلة العائمة (FLOPs) إلى أدنى حد.
تحليل الأداء والمقاييس#
عند تقييم الأداء، يحقق كلا النموذجين متوسط دقة (mAP) مرتفعًا على معايير قياسية مثل COCO. ويحقق YOLOv9 دقة أعلى عند أعداد معلمات مماثلة، وأعلى دقة مطلقة إجمالًا، مستفيدًا من معمارية PGI للحفاظ على دقة عالية في مجموعات البيانات الصعبة.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| DAMO-YOLOt | 640 | 42.0 | - | 2.32 | 8.5 | 18.1 |
| DAMO-YOLOs | 640 | 46.0 | - | 3.45 | 16.3 | 37.8 |
| DAMO-YOLOm | 640 | 49.2 | - | 5.09 | 28.2 | 61.8 |
| DAMO-YOLOl | 640 | 50.8 | - | 7.18 | 42.1 | 97.3 |
| YOLOv9t | 640 | 38.3 | - | 2.3 | 2.0 | 7.7 |
| YOLOv9s | 640 | 46.8 | - | 3.54 | 7.2 | 26.7 |
| YOLOv9m | 640 | 51.4 | - | 6.43 | 20.1 | 76.8 |
| YOLOv9c | 640 | 53.0 | - | 7.16 | 25.5 | 102.8 |
| YOLOv9e | 640 | 55.6 | - | 16.77 | 58.1 | 192.5 |
كما هو موضح أعلاه، يحقق YOLOv9-E أعلى دقة، بينما تحافظ إصدارات DAMO-YOLO وYOLOv9 الأصغر حجمًا على سرعات استدلال تنافسية للغاية عبر تحسينات TensorRT.
منهجيات التدريب والمنظومة#
مع أهمية المعمارية الأساسية، تظل قابلية الاستخدام وكفاءة التدريب اللتان تحددهما منظومة النموذج بالغتي الأهمية للتطبيقات الواقعية.
غالبًا ما يتطلب اعتماد DAMO-YOLO على تقطير المعرفة تدريب نموذج «معلّم» مرهق قبل نقل المعرفة إلى النموذج «الطالب» المستهدف. ويزيد هذا النهج البحثي التقليدي متطلبات الذاكرة وأوقات دورات التدريب زيادة كبيرة. وبالمثل، يتطلب مستودع YOLOv9 الأصلي التعامل مع ملفات إعداد معقدة قد تبطئ التطوير السريع.
وعلى النقيض، فإن دمج النماذج في منصة Ultralytics يغيّر تجربة المطور بالكامل. إذ تخفي حزمة Ultralytics Python الشيفرة النمطية، ما يتيح للفرق التعامل بسهولة مع زيادة البيانات وضبط المعلمات الفائقة وتصدير النماذج.
التطبيقات وحالات الاستخدام في العالم الحقيقي#
تتفوق المعماريات المختلفة بطبيعتها في قطاعات محددة، بحسب متطلباتها من الموارد وخصائص دقتها.
- DAMO-YOLO في الذكاء الاصطناعي الطرفي: نظرًا إلى أن بنيات DAMO-YOLO الأساسية محسّنة باستخدام NAS، كثيرًا ما يُستكشف استخدامها في الأنظمة المضمنة التي تتطلب إعادة ضبط المعلمات بحسب العتاد، مثل النشر على دوائر ASIC مخصصة في مراقبة جودة التصنيع الأساسية.
- YOLOv9 في التحليلات الدقيقة: بفضل كفاءة معلماته العالية والاحتفاظ بالتدرّجات المدعوم بـ PGI، يُعد YOLOv9 ممتازًا لسيناريوهات اكتشاف الأجسام الكثيفة، مثل تحليل الصور الجوية أو تتبّع الأجسام الصغيرة في بيئات البيع بالتجزئة المزدحمة.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين DAMO-YOLO وYOLOv9 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار DAMO-YOLO#
يُعد DAMO-YOLO خيارًا قويًا في الحالات التالية:
- تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو ذات معدل إطارات مرتفع على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند batch-1 المقياس الأساسي.
- خطوط التصنيع الصناعي: السيناريوهات ذات قيود زمن استجابة صارمة على GPU ضمن أجهزة مخصصة، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
- أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والعمود الفقري الفعال المعاد تحديد معلماته على أداء الكشف.
متى تختار YOLOv9#
يوصى بـYOLOv9 في الحالات التالية:
- أبحاث عنق زجاجة المعلومات: المشاريع الأكاديمية التي تدرس معلومات التدرج القابلة للبرمجة (PGI) وبنى شبكة تجميع الطبقات الفعالة المعمّمة (GELAN).
- دراسات تحسين تدفق التدرجات: الأبحاث التي تركز على فهم فقدان المعلومات في طبقات الشبكات العميقة أثناء التدريب والحد منه.
- اختبارات معيارية للكشف عالي الدقة: السيناريوهات التي يلزم فيها أداء YOLOv9 القوي في اختبارات COCO المعيارية ليكون مرجعاً للمقارنة بين البنى.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
ميزة Ultralytics: الانتقال إلى YOLO26#
للمستخدمين الذين يقارنون المعماريات القديمة، يوفّر الانتقال إلى منظومة Ultralytics الحديثة، وتحديدًا أحدث نماذج YOLO26، ميزة لا مثيل لها.
يغيّر YOLO26 مشهد النشر جوهريًا بفضل تصميمه الشامل الخالي من NMS. وتلغي رأسه الاختيارية أحادية المطابقة (nms=False) المعالجة اللاحقة لكبح غير الأعظميات (NMS)، ما يتيح معماريات نشر أسرع وأبسط بكثير. وبالاقتران مع إزالة خسارة البؤرة التوزيعية (DFL)، يوفّر YOLO26 توافقًا أفضل مع الأجهزة الطرفية ومنخفضة الطاقة.
علاوة على ذلك، يتضمن YOLO26 محسّن MuSGD الثوري، وهو مزيج من تحسينات الانحدار المتدرّج العشوائي وMuon، مستوحى من ابتكارات تدريب النماذج اللغوية الكبيرة. وينتج عن ذلك تقارب تدريبي مستقر للغاية، مع الحفاظ على استخدام منخفض للذاكرة بصورة لافتة مقارنة بالبدائل المعتمدة بكثافة على Transformer.
بفضل واجهة API سهلة الاستخدام من Ultralytics، يمكنك تدريب نموذج YOLO26 متطور مع تتبّع التجارب المدمج باستخدام بضعة أسطر فقط من Python.
from ultralytics import YOLO
# تحميل أحدث نموذج YOLO26
model = YOLO("yolo26n.pt")
# التدريب بكفاءة على مجموعة بياناتك المخصصة
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# تصدير النموذج المدرّب إلى تنسيق ONNX
model.export(format="onnx")سواء أكنت تحتاج إلى تجزئة المثيلات المتقدمة، أو تقدير الوضعية عالي الدقة، أو اكتشاف مربعات الإحاطة المعتاد، فإن تعدد استخدامات إطار Ultralytics يضمن أن يقضي فريقك وقتًا أقل في إعداد بيئات التعلم العميق ووقتًا أطول في نشر حلول ذكاء اصطناعي موثوقة. وبفضل التحسينات المتخصصة للمهام مثل ProgLoss + STAL لتعزيز التعرّف على الأجسام الصغيرة، يُعد YOLO26 الخيار الأمثل للجيل القادم من تطبيقات الرؤية.