Ultralytics YOLO27:

مقارنة YOLOv9 وRTDETRv2#

شهد مجال اكتشاف الأجسام في الوقت الفعلي تحولًا جذريًا خلال السنوات الأخيرة. وقد برزت فلسفتان معماريتان متميزتان للهيمنة على هذا المجال: الشبكات العصبية الالتفافية (CNNs) المحسّنة للغاية، وTransformers اكتشاف الأجسام في الوقت الفعلي (DETRs). ويمثل YOLOv9 وRTDETRv2 ذروة هذين النهجين.

يقارن هذا الدليل الشامل بين هذين النموذجين القويين، ويحلل ابتكاراتهما المعمارية ومقاييس الأداء وسيناريوهات النشر المثالية، لمساعدتك على اختيار النموذج المناسب لمسار عملك في الرؤية الحاسوبية.

الملخص التنفيذي#

يحقق كلا النموذجين نتائج متقدمة على مستوى المجال، لكنهما يلبيان قيودًا مختلفة قليلًا في النشر وبيئات تطوير متباينة.

  • اختر YOLOv9 إذا: كنت تحتاج إلى استخدام عالي الكفاءة للمعلمات واستدلال سريع على الأجهزة الطرفية. يدفع YOLOv9 الحدود النظرية لكفاءة CNN إلى أقصى حد، ما يجعله مثاليًا للبيئات التي تكون فيها الموارد الحاسوبية محدودة للغاية.
  • اختر RTDETRv2 إذا: كنت تحتاج إلى فهم دقيق للسياق توفره نماذج Transformer، ولا سيما في المشاهد التي تتضمن حجبًا شديدًا أو علاقات معقدة بين الأجسام، وكانت لديك أجهزة قادرة على تشغيل بنية أثقل قليلًا.
  • اختر YOLO26 (موصى به) إذا: كنت تريد أفضل ما في العالمين. وبصفته أحدث جيل متاح على منصة Ultralytics، يتميز YOLO26 بـتصميم أصلي شامل من دون NMS (مشابه لنماذج DETR لكنه أسرع بكثير)، ما يلغي اختناقات المعالجة اللاحقة ويوفر استدلالًا على CPU أسرع بنسبة تصل إلى 43% مقارنة بالأجيال السابقة.

المواصفات التقنية والجهة المؤلفة#

يوفر فهم أصول هذه النماذج والهدف من تصميمها سياقًا بالغ الأهمية لخياراتها المعمارية.

YOLOv9#

تعرف على المزيد حول YOLOv9

RTDETRv2#

الابتكارات المعمارية#

YOLOv9: حل اختناق المعلومات#

يقدم Ultralytics YOLOv9 ابتكارين رئيسيين صُمما لمعالجة فقدان المعلومات أثناء مرور البيانات عبر الشبكات العصبية العميقة:

  1. معلومات التدرج القابلة للبرمجة (PGI): يضمن إطار الإشراف المساعد هذا توليد تدرجات موثوقة لتحديث أوزان الشبكة، مع الحفاظ على معلومات السمات المهمة حتى في طبقات الشبكة العميقة جدًا.
  2. شبكة تجميع الطبقات الفعالة المعممة (GELAN): بنية مبتكرة تجمع بين نقاط قوة CSPNet وELAN. تعمل GELAN على تحسين كفاءة المعلمات، ما يتيح لـYOLOv9 تحقيق دقة أعلى باستخدام عدد أقل من FLOPs مقارنةً بشبكات CNN التقليدية.

RTDETRv2: تحسين نماذج Transformer في الوقت الفعلي#

استنادًا إلى نجاح RT-DETR الأصلي، تستخدم RTDETRv2 بنية قائمة على Transformer تتجنب بطبيعتها الحاجة إلى الكبت غير الأقصى (NMS). وتشمل تحسيناتها ما يلي:

  1. استراتيجية مجموعة المزايا المجانية: يدمج الإصدار v2 تقنيات تدريب متقدمة وزيادات للبيانات تعزز الدقة بدرجة كبيرة من دون إضافة أي عبء إلى زمن استجابة الاستدلال.
  2. المشفّر الهجين الفعال: من خلال معالجة السمات متعددة المقاييس عبر آلية انتباه مفصولة داخل المقياس وعبر المقاييس، تدير RTDETRv2 بكفاءة التكلفة الحسابية المرتفعة تقليديًا لنماذج Transformer البصرية.
اكتشاف أصلي شامل من البداية إلى النهاية

بينما يستفيد RTDETRv2 من نماذج Transformer لاكتشاف خالٍ من NMS، تحقق بنية YOLO26 ذلك أصليًا ضمن بنية CNN محسّنة للغاية، ما يوفر النشر المبسط نفسه، ولكن بسرعات استدلال طرفية أعلى بكثير.

مقارنة الأداء#

عند تقييم النماذج للاستخدام الإنتاجي، تكون المفاضلة بين الدقة والمتطلبات الحاسوبية أمرًا بالغ الأهمية. يوضح الجدول أدناه أداء أحجام النماذج المختلفة عبر معايير قياسية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
YOLOv9t64038.3-2.32.07.7
YOLOv9s64046.8-3.547.126.4
YOLOv9m64051.4-6.4320.076.3
YOLOv9c64053.0-7.1625.3102.1
YOLOv9e64055.6-16.7757.3189.0
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

التحليل#

كما تُظهر البيانات، يحافظ YOLOv9 على أفضلية واضحة في كفاءة المعلمات. ويحقق نموذج YOLOv9c قيمة mAP impressive تبلغ 53.0 باستخدام 25.3M معلمة فقط، ما يجعله خفيفًا للغاية.

في المقابل، يوفر RTDETRv2 منافسة قوية في فئات النماذج المتوسطة إلى الكبيرة. إلا أن ذلك يأتي على حساب عدد أكبر من المعلمات وFLOPs أعلى بكثير، وهو أمر معتاد في نماذج Transformer. وينعكس هذا الاختلاف المعماري أيضًا على استخدام الذاكرة: إذ تتطلب نماذج YOLO عادةً ذاكرة CUDA أقل بكثير أثناء التدريب والاستدلال مقارنةً بنظيراتها القائمة على Transformer.

ميزة Ultralytics: المنظومة والمرونة#

رغم أهمية المقاييس المعمارية البحتة، غالبًا ما تحدد منظومة البرمجيات نجاح مشروع الذكاء الاصطناعي. ويوفر الوصول إلى هذه النماذج المتقدمة عبر واجهة Python البرمجية من Ultralytics مزايا لا مثيل لها.

تبسيط التدريب والنشر#

عادةً ما يتطلب تدريب نماذج محولات كشف الأشياء (Detection Transformer) ملفات إعداد معقدة ووحدات معالجة رسومية (GPUs) عالية الأداء. ومن خلال استخدام إطار عمل Ultralytics، يمكن للمطورين تدريب نماذج YOLOv9 وRT-DETR بنهاية بناء جملة بسيطة ومتطابقة، مع الاستفادة من خطوط أنابيب تدريب عالية الكفاءة وأوزان مدربة مسبقاً والمتاحة بسهولة.

from ultralytics import RTDETR, YOLO

# Train a YOLOv9 model
model_yolo = YOLO("yolov9c.pt")
model_yolo.train(data="coco8.yaml", epochs=100, imgsz=640)

# Train an RTDETR model using the exact same API
model_rtdetr = RTDETR("rtdetr-l.pt")
model_rtdetr.train(data="coco8.yaml", epochs=100, imgsz=640)

# Export models to OpenVINO or TensorRT seamlessly
model_yolo.export(format="openvino")

تعدد استخدامات المهام بلا مثيل#

يتمثل أحد القيود الرئيسية للنماذج المتخصصة مثل RTDETRv2 في تركيزها الضيق على اكتشاف مربعات الإحاطة. وعلى النقيض، تدعم منظومة Ultralytics الأوسع، التي تشمل نماذج مثل YOLO11 وYOLOv8، مجموعة واسعة من مهام الرؤية الحاسوبية. ويشمل ذلك تجزئة المثيلات بدقة على مستوى البكسل، وتقدير الوضعية الهيكلية، وتصنيف الصورة بأكملها، واكتشاف مربع الإحاطة الموجّه (OBB) للصور الجوية.

التطبيقات الواقعية#

تحليلات طرفية عالية السرعة#

بالنسبة إلى بيئات البيع بالتجزئة أو خطوط التصنيع التي تتطلب التعرف على المنتجات في الوقت الفعلي على الأجهزة الطرفية، يُعد YOLOv9 الخيار الأفضل. وتضمن بنية GELAN معدل نقل بيانات مرتفعًا على الأجهزة محدودة الموارد مثل سلسلة NVIDIA Jetson، ما يتيح مراقبة الجودة آليًا من دون تأخير ملحوظ.

تحليل المشاهد المعقدة#

في سيناريوهات مثل مراقبة الحشود الكثيفة أو تقاطعات المرور المعقدة، حيث تحجب الأجسام بعضها بعضًا بشكل متكرر، تتألق آليات الانتباه الشاملة في RTDETRv2. وتتيح قدرة النموذج على الاستدلال أصليًا بشأن سياق الصورة بالكامل الحفاظ على تتبع واكتشاف موثوقين حتى عندما تكون الأجسام محجوبة جزئيًا.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv9 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.

متى تختار YOLOv9#

يُعد YOLOv9 خيارًا قويًا لـ:

  • أبحاث عنق الزجاجة المعلوماتي: المشاريع الأكاديمية التي تدرس معماريات المعلومات القابلة للبرمجة للتدرجات (PGI) وشبكة تجميع الطبقات الفعّالة المعمّمة (GELAN).
  • دراسات تحسين تدفق التدرجات: الأبحاث التي تركز على فهم فقدان المعلومات في طبقات الشبكات العميقة أثناء التدريب والحد منه.
  • قياس أداء اكتشاف عالي الدقة: السيناريوهات التي تحتاج إلى أداء YOLOv9 القوي في معيار COCO بوصفه نقطة مرجعية للمقارنات المعمارية.

متى تختار RT-DETR#

يوصى باستخدام RT-DETR في الحالات التالية:

  • أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
  • السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
  • اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

المستقبل: ظهور YOLO26#

رغم أن YOLOv9 وRTDETRv2 يمثلان إنجازين هائلين، فإن مجال الرؤية الحاسوبية يتطور بسرعة. وبالنسبة إلى المطورين الذين يتطلعون إلى بدء مشاريع جديدة، يُعد YOLO26 الحل الموصى به والمتقدم على مستوى المجال.

أُطلق YOLO26 في عام 2026، ويجمع أفضل ميزات كل من CNNs وDETRs. ويتمتع بـتصميم شامل من البداية إلى النهاية وخالٍ من NMS، ما يلغي زمن استجابة المعالجة اللاحقة بالكامل—وهي تقنية ابتُكرت أولًا في YOLOv10. علاوةً على ذلك، يزيل YOLO26 دالة الخسارة البؤرية للتوزيع (DFL) لتحسين التوافق مع الأجهزة الطرفية، ويقدم مُحسِّن MuSGD الثوري. وقد استُلهم هذا المُحسِّن الهجين من تدريب نماذج اللغة الكبيرة (وتحديدًا Kimi K2 من Moonshot AI)، ويضمن استقرارًا غير مسبوق للتدريب وتقاربًا أسرع.

وبالاقتران مع دوال خسارة محسّنة مثل ProgLoss وSTAL لتحقيق تعرف استثنائي على الأجسام الصغيرة، يوفر YOLO26 استدلالًا على CPU أسرع بنسبة تصل إلى 43%، ما يرسخ مكانته بوصفه النموذج الأمثل لعمليات نشر الذكاء الاصطناعي الحديثة.

التعليقات