Ultralytics YOLO27:

DAMO-YOLO مقابل YOLOv9#

يواصل مشهد اكتشاف الأجسام في الوقت الفعلي تطوره بوتيرة متسارعة للغاية. وبينما تسعى فرق الهندسة والباحثون إلى تحقيق التوازن المثالي بين الدقة وسرعة الاستدلال والكفاءة الحسابية، برزت بنيتان معماريتان بارزتان من مجتمع البحث: DAMO-YOLO وYOLOv9. ويقدم كلا النموذجين ابتكارات معمارية مهمة تهدف إلى توسيع حدود ما يمكن تحقيقه في مجال الرؤية الحاسوبية.

يقدم هذا الدليل التقني المفصل تحليلًا معمقًا لهذين النموذجين، مع مقارنة أساليبهما المعمارية الفريدة ومنهجيات التدريب وقدرات النشر في العالم الحقيقي. وسنستكشف أيضًا الدور المحوري الذي تؤديه منظومة البرمجيات الأوسع في تطوير الذكاء الاصطناعي الحديث، مع إبراز مزايا المنصات المتكاملة مثل منصة Ultralytics والجيل الأحدث من النماذج مثل YOLO26.

الملخص التنفيذي: اختيار البنية المعمارية المناسبة#

على الرغم من أن كلا النموذجين يمثلان محطتين مهمتين في أبحاث التعلم العميق، فإن لكل منهما فلسفة نشر مختلفة قليلًا.

يتفوق DAMO-YOLO في البيئات التي يمكن فيها استخدام البحث عن البنية المعمارية العصبية (NAS) لاستخراج خصائص أداء محددة، مما يجعله موضوعًا مثيرًا للاهتمام للنشر المخصص على الأجهزة الطرفية. وعلى العكس، يركز YOLOv9 بدرجة كبيرة على حل اختناقات المعلومات في التعلم العميق، مقدمًا كفاءة استثنائية في استخدام المعلمات.

ومع ذلك، توصي فرق الهندسة باستمرار، عند النشر الجاهز للإنتاج، بالاستفادة من منظومة Ultralytics الموحدة. وبالنسبة إلى المشاريع الجديدة، يقدم أحدث نموذج YOLO26 أفضل ما في العالمين: دقة فائقة تجمع بين أحدث ما توصلت إليه التقنيات وتصميم أصلي شامل من البداية إلى النهاية يلغي الحاجة إلى المعالجة اللاحقة المعقدة.

تحصين مسار الرؤية الحاسوبية للمستقبل

على الرغم من قوة DAMO-YOLO وYOLOv9 كنموذجين أكاديميين، فإن نشرهما في بيئة الإنتاج يتطلب غالبًا هندسة مخصصة كبيرة. ويوفر استخدام Ultralytics YOLO26 إمكانية الوصول إلى أداء متطور من خلال API مبسطة وقابلة للصيانة.

المواصفات التقنية والجهة المؤلفة#

يوفر فهم أصول هذه النماذج ومحور تطويرها سياقًا أساسيًا لفهم نقاط قوتها 각각.

DAMO-YOLO#

طوّر باحثون في مجموعة Alibaba نموذج DAMO-YOLO، الذي يركز بدرجة كبيرة على التوليد الآلي للبنية المعمارية ودمج السمات بكفاءة.

تعرف على المزيد حول DAMO-YOLO

YOLOv9#

قُدّم YOLOv9 بوصفه حلًا لمشكلة فقدان المعلومات في الشبكات الالتفافية العميقة، ويدفع الحدود النظرية للحفاظ على التدرجات أثناء التدريب.

تعرف على المزيد حول YOLOv9

الابتكارات المعمارية#

DAMO-YOLO: مدفوع بالبحث عن البنية المعمارية العصبية#

يتميز DAMO-YOLO بمكونات مخصصة بدرجة كبيرة ومولدة آليًا. ويُولَّد جذعه باستخدام البحث عن البنية المعمارية العصبية (NAS)، مع استهداف الاستدلال منخفض زمن الاستجابة على الأجهزة المختلفة تحديدًا.

تتضمن البنية شبكة هرمية فعالة للسمات المعممة وإعادة المعلمات (RepGFPN) لدمج السمات، مما يعزز اكتشاف الأجسام متعدد المقاييس من دون زيادة مفرطة في الحمل الحسابي. علاوة على ذلك، تستخدم تصميم ZeroHead لتبسيط رأس الاكتشاف، وتستفيد من AlignedOTA لإسناد التسميات، إلى جانب عملية متقدمة لتعزيز التقطير أثناء التدريب. وعلى الرغم من أن هذه التقنيات تحقق استدلالًا سريعًا، فإن عملية التقطير متعددة المراحل تتطلب غالبًا قدرًا كبيرًا من VRAM وأوقات تدريب ممتدة.

YOLOv9: حل اختناق المعلومات#

يعالج YOLOv9 مشكلة أساسية في الشبكات العميقة: الفقدان التدريجي لمعلومات بيانات الإدخال أثناء مرورها عبر الطبقات المتعاقبة.

ولمواجهة ذلك، قدم المؤلفون معلومات التدرج القابلة للبرمجة (PGI)، وهو إطار إشراف مساعد مصمم للاحتفاظ بالتفاصيل المهمة للطبقات العميقة، وتوليد تدرجات عالية الموثوقية لتحديث الأوزان. ويرافق PGI بنية GELAN، أي شبكة تجميع الطبقات الفعالة المعممة. وتحسن GELAN كفاءة المعلمات من خلال الجمع بين نقاط قوة CSPNet وELAN، وتعظيم تدفق المعلومات مع تقليل عمليات الفاصلة العائمة (FLOPs) إلى أدنى حد بصرامة.

تحليل الأداء والمقاييس#

عند تقييم الأداء، يبرهن كلا النموذجين على متوسط دقة (mAP) قوي في المعايير القياسية مثل COCO. ويحقق YOLOv9 دقة مطلقة أعلى عبر أحجام النماذج المكافئة، مستفيدًا من بنيته PGI للحفاظ على دقة عالية في مجموعات البيانات الصعبة.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
DAMO-YOLOt64042.0-2.328.518.1
DAMO-YOLOs64046.0-3.4516.337.8
DAMO-YOLOm64049.2-5.0928.261.8
DAMO-YOLOl64050.8-7.1842.197.3
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0

كما هو موضح أعلاه، يحقق YOLOv9-E أعلى دقة، بينما تحافظ نسختا DAMO-YOLO وYOLOv9 الأصغر على سرعات استدلال تنافسية للغاية عبر تحسينات TensorRT.

منهجيات التدريب والمنظومة#

مع أهمية البنية المعمارية الخام، تظل قابلية الاستخدام وكفاءة التدريب، اللتان تحددهما منظومة النموذج، عاملين حاسمين للتطبيق في العالم الحقيقي.

يتطلب اعتماد DAMO-YOLO على تقطير المعرفة غالبًا تدريب نموذج «معلم» مرهق قبل نقل المعرفة إلى نموذج «طالب» مستهدف. ويزيد هذا النهج البحثي التقليدي بدرجة كبيرة من متطلبات الذاكرة وأزمنة دورات التدريب. وبالمثل، يتطلب مستودع YOLOv9 الأصلي التنقل بين ملفات إعداد معقدة، مما قد يبطئ التطوير المرن.

وعلى النقيض من ذلك، يؤدي دمج النماذج في منصة Ultralytics إلى تحويل تجربة المطور بالكامل. إذ تعمل حزمة Ultralytics Python على تجريد التعليمات البرمجية النمطية، مما يتيح للفرق التعامل مع زيادة البيانات وضبط المعلمات الفائقة وتصدير النماذج بسهولة.

التطبيقات وحالات الاستخدام في العالم الحقيقي#

تتفوق البنى المعمارية المختلفة بطبيعتها في صناعات محددة، استنادًا إلى متطلبات مواردها وخصائص دقتها.

  • DAMO-YOLO في الذكاء الاصطناعي الحافاتي (Edge AI): نظراً لهياكلها الأساسية المحسّنة باستخدام البحث المعماري للشبكات (NAS)، غالباً ما تُستكشف DAMO-YOLO في الأنظمة المضمنة حيث تُعد إعادة البارامترات الخاصة بالعتاد ضرورة صارمة، مثل نشر الدارات المتخصصة المخصصة (ASIC) في مراقبة جودة التصنيع الأساسية.
  • YOLOv9 في التحليلات الدقيقة: بفضل كفاءته العالية في استخدام المعلمات والاحتفاظ بالتدرجات المدفوع بواسطة PGI، يُعد YOLOv9 ممتازًا لسيناريوهات اكتشاف الأجسام الكثيفة، مثل تحليل الصور الجوية أو تتبع الأجسام الصغيرة في بيئات البيع بالتجزئة المزدحمة.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين DAMO-YOLO وYOLOv9 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.

متى تختار DAMO-YOLO#

يُعد DAMO-YOLO خيارًا قويًا من أجل:

  • تحليلات الفيديو عالية الإنتاجية: معالجة تدفقات فيديو عالية FPS على بنية تحتية ثابتة من NVIDIA GPU، حيث تكون الإنتاجية عند حجم الدفعة 1 هي المقياس الأساسي.
  • خطوط التصنيع الصناعية: السيناريوهات ذات القيود الصارمة على زمن استجابة GPU ضمن عتاد مخصص، مثل فحص الجودة في الوقت الفعلي على خطوط التجميع.
  • أبحاث البحث عن البنية العصبية: دراسة تأثيرات البحث الآلي عن البنية (MAE-NAS) والشبكات الأساسية المعاد تمثيلها بكفاءة على أداء الاكتشاف.

متى تختار YOLOv9#

يوصى باستخدام YOLOv9 من أجل:

  • أبحاث عنق الزجاجة المعلوماتي: المشاريع الأكاديمية التي تدرس معماريات المعلومات القابلة للبرمجة للتدرجات (PGI) وشبكة تجميع الطبقات الفعّالة المعمّمة (GELAN).
  • دراسات تحسين تدفق التدرجات: الأبحاث التي تركز على فهم فقدان المعلومات في طبقات الشبكات العميقة أثناء التدريب والحد منه.
  • قياس أداء اكتشاف عالي الدقة: السيناريوهات التي تحتاج إلى أداء YOLOv9 القوي في معيار COCO بوصفه نقطة مرجعية للمقارنات المعمارية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

ميزة Ultralytics: الانتقال إلى YOLO26#

بالنسبة إلى المستخدمين الذين يقارنون البنى المعمارية القديمة، فإن الانتقال إلى منظومة Ultralytics الحديثة—وتحديدًا أحدث نماذج YOLO26—يوفر ميزة لا مثيل لها.

يغير YOLO26 مشهد النشر تغييرًا جذريًا من خلال تصميم شامل من البداية إلى النهاية خالٍ من NMS. فمن خلال إلغاء المعالجة اللاحقة لكبت غير الأعظم (NMS) بالكامل، يوفر بنى نشر أسرع وأبسط بكثير. وبالاقتران مع إزالة خسارة البؤرة التوزيعية (DFL)، يقدم YOLO26 توافقًا فائقًا مع الأجهزة الطرفية ومنخفضة الطاقة.

علاوة على ذلك، يدمج YOLO26 مُحسِّن MuSGD الثوري، وهو مزيج من تحسينات الانحدار المتدرج العشوائي وMuon المستوحاة من ابتكارات تدريب LLM. وينتج عن ذلك تقارب مستقر للغاية أثناء التدريب، مع الحفاظ على استخدام منخفض بشكل ملحوظ للذاكرة مقارنة بالبدائل الكثيفة الاستخدام لـ Transformer.

تدريب مبسط باستخدام YOLO26

بفضل API البديهية من Ultralytics، يمكنك تدريب نموذج YOLO26 متطور مع تتبع مدمج للتجارب باستخدام بضعة أسطر فقط من Python.

from ultralytics import YOLO

# Load the latest NMS-free YOLO26 model
model = YOLO("yolo26n.pt")

# Train on your custom dataset efficiently
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export the trained model to ONNX format
model.export(format="onnx")

سواء كنت تحتاج إلى تقسيم المثيلات المتقدم، أو تقدير الوضعيات عالي الدقة، أو اكتشاف الصناديق المحيطة القياسي، فإن تعدد استخدامات إطار Ultralytics يضمن أن يقضي فريقك وقتًا أقل في إعداد بيئات التعلم العميق ووقتًا أطول في نشر حلول ذكاء اصطناعي قوية. ومع التحسينات المتخصصة للمهام، مثل ProgLoss + STAL لتعزيز التعرف على الأجسام الصغيرة، يبرز YOLO26 بوصفه الخيار الرائد للجيل القادم من تطبيقات الرؤية.

التعليقات