Ultralytics YOLO27:

مقارنة بين RTDETRv2 وYOLOv6-3.0#

يتطور مجال الرؤية الحاسوبية باستمرار، مما يتيح للمطورين مجموعة واسعة من الخيارات المعمارية لكشف الأجسام. ومن أبرز النموذجين اللذين يمثلان نهجين متباينين RTDETRv2، وهو Transformer للرؤية حديـث ومتطور، وYOLOv6-3.0، وهو شبكة عصبية التفافية (CNN) محسّنة بدرجة عالية ومصممة للتطبيقات الصناعية.

تستكشف هذه المقارنة التقنية الشاملة معماريتهما ومقاييس الأداء وسيناريوهات النشر المثالية لكل منهما. كما سنبحث في كيفية توفير منظومة Ultralytics لتجربة مطورين متفوقة، مع التطلع في نهاية المطاف إلى إمكانات الجيل التالي من Ultralytics YOLO26.

RTDETRv2: نهج Transformer للرؤية#

طوّر باحثون في Baidu نموذج RTDETRv2 بالاعتماد على أساس RT-DETR الأصلي، وهو ما يمثل قفزة مهمة إلى الأمام في كشف الأجسام القائم على Transformer.

أبرز معالم البنية المعمارية#

يستخدم RTDETRv2 بنية هجينة تجمع بين مستخرج سمات قائم على CNN ومفكك ترميز قوي قائم على Transformer. وتتمثل السمة الأبرز لهذا النموذج في تصميمه الأصلي الخالي من NMS. فمن خلال إلغاء الكبت غير الأقصى (NMS) أثناء المعالجة اللاحقة، يتنبأ النموذج بصناديق الإحاطة مباشرةً، مما يبسّط النشر ويحقق استقرارًا في زمن استدلال النموذج.

تُحسّن "حزمة المزايا المجانية" المضمّنة في RTDETRv2 قدرته على التعامل مع المشاهد المعقدة والأجسام المتداخلة، إذ تفهم آليات الانتباه الشامل العلاقات المكانية بطبيعتها بصورة أفضل من الالتفافات المحلية.

استخدام Transformer للذاكرة

رغم تفوق Transformers في فهم المشاهد المعقدة، فإنها تتطلب عادةً ذاكرة CUDA أعلى بكثير أثناء التدريب مقارنةً بشبكات CNN. وقد يحد ذلك من أحجام الدُفعات على وحدات GPU الاستهلاكية القياسية ويزيد إجمالي وقت التدريب.

YOLOv6-3.0: تعظيم الإنتاجية الصناعية#

نشأ YOLOv6-3.0 في قسم Vision AI لدى Meituan، وقد صُمم صراحةً ليكون كاشفًا من الجيل التالي لخطوط الإنتاج الصناعية التي تكون فيها إنتاجية GPU أمرًا بالغ الأهمية.

  • المؤلفون: Chuyi Li، Lulu Li، Yifei Geng، Hongliang Jiang، Meng Cheng، Bo Zhang، Zaidan Ke، Xiaoming Xu، وXiangxiang Chu
  • الجهة: Meituan
  • التاريخ: 2023-01-13
  • Arxiv: 2301.05586
  • GitHub: meituan/YOLOv6

التركيز المعماري#

يعتمد YOLOv6-3.0 على العمود الفقري EfficientRep، المصمم بعناية لتقليل تكاليف الوصول إلى الذاكرة على مسرّعات الأجهزة مثل وحدات NVIDIA GPU. وتتضمن بنية العنق وحدة الدمج ثنائي الاتجاه (BiC) لتحسين دمج السمات عبر المقاييس المختلفة.

أثناء التدريب، يستخدم استراتيجية التدريب المدعوم بالمراسي (AAT) للاستفادة من مناهج التدريب القائمة على المراسي، مع الحفاظ على نمط استدلال خالٍ من المراسي لتنفيذ أسرع. ورغم تحقيقه إنتاجية استثنائية على وحدات GPU المخصصة للخوادم، مثل T4 وA100، فإن بنيته المتخصصة قد تؤدي إلى زمن استجابة غير مثالي عند نشره على أجهزة طرفية تعمل بوحدة CPU فقط.

تعرف على المزيد حول YOLOv6

مقارنة الأداء#

عند تقييم النماذج للإنتاج، من الضروري تحقيق توازن بين الدقة (mAP) وسرعة الاستدلال والتكلفة الحسابية (FLOPs). ويوضح الجدول أدناه كيفية مقارنة أداء هذه النماذج.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7

بينما يتفوق YOLOv6-3.0 في سرعة المعالجة المطلقة على TensorRT، يحقق RTDETRv2 درجات mAP أعلى، ولا سيما مع تحسّن أدائه عند التوسع إلى إصدارات نماذج أكبر. ومع ذلك، يفتقر كلا النموذجين إلى التنوع الواسع المتاح في الأطر الموحدة الحديثة. ويُعد YOLOv6-3.0 متخصصًا أساسًا في الكشف، إذ لا يوفر دعمًا أصليًا لمهام مثل تجزئة المثيلات وتقدير الوضعية مباشرةً.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين RT-DETR وYOLOv6 على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.

متى تختار RT-DETR#

يُعد RT-DETR خيارًا قويًا من أجل:

  • أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
  • السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
  • اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.

متى تختار YOLOv6#

يوصى باستخدام YOLOv6 في الحالات التالية:

  • النشر المراعي للعتاد الصناعي: السيناريوهات التي يوفر فيها تصميم النموذج المراعي للعتاد وإعادة المعلمة الفعالة أداءً محسنًا على عتاد مستهدف محدد.
  • الاكتشاف السريع أحادي المرحلة: التطبيقات التي تعطي الأولوية لسرعة الاستدلال الخام على GPU لمعالجة الفيديو في الوقت الفعلي ضمن بيئات خاضعة للرقابة.
  • التكامل مع منظومة Meituan: الفرق التي تعمل بالفعل ضمن حزمة تقنيات Meituan وبنيتها التحتية للنشر.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

ميزة Ultralytics#

ينطوي اختيار النموذج المناسب على ما هو أكثر من أرقام المعايير الخام؛ فتجربة المطور ومرونة النشر ودعم المنظومة عوامل بالغة الأهمية أيضًا. ومن خلال استخدام النماذج المدمجة في منصة Ultralytics، يحصل المستخدمون على مزايا كبيرة مقارنةً بمستودعات الأبحاث الثابتة.

  • سهولة الاستخدام: توفر حزمة Python المسماة ultralytics واجهة API سلسة. ولا يتطلب تدريب النماذج والتحقق منها وتصديرها سوى بضعة أسطر من التعليمات البرمجية.
  • منظومة جيدة الصيانة: بخلاف المستودعات الأكاديمية المعزولة، تُحدّث منصة Ultralytics بنشاط. كما توفر تكاملات قوية مع أدوات مثل ONNX وOpenVINO وCoreML.
  • كفاءة التدريب: تستهلك نماذج Ultralytics عادةً مقدارًا أقل بكثير من VRAM أثناء التدريب مقارنةً بهياكل Transformer مثل RTDETRv2، مما يتيح استخدام أحجام دفعات أكبر على الأجهزة المخصصة للمستهلكين.
  • المرونة: على عكس النطاق المحدود لـ YOLOv6-3.0، فإن نماذج Ultralytics متعددة المهام، حيث تدعم أصلاً تصنيف الصور، والصناديق المحيطة الموجهة (OBB)، والتجزئة ضمن إطار عمل موحد واحد.
نشر مبسّط

باستخدام CLI الخاص بـ Ultralytics، لا يتطلب تصدير نموذج مُدرّب للنشر الطرفي سوى تشغيل: yolo export model=yolo11n.pt format=tensorrt.

ها هو YOLO26: الحل الأمثل#

رغم أن RTDETRv2 وYOLOv6-3.0 يقدمان فوائد محددة، فإن المجال يتطور بسرعة. وبالنسبة إلى الفرق التي تبدأ مشاريع جديدة في الرؤية الحاسوبية، نوصي بشدة باستخدام YOLO26، الذي أصدرته Ultralytics في يناير 2026.

يجمع YOLO26 بين نقاط قوة شبكات CNN الصناعية وTransformers الحديثة، مع التخلص من نقاط ضعف كل منهما:

  • تصميم شامل خالٍ من NMS: باعتماد الاختراق الذي طُرح لأول مرة في YOLOv10، يلغي YOLO26 المعالجة اللاحقة لـ NMS أصليًا، مما يضمن نشرًا مستقرًا وقابلًا للتنبؤ مشابهًا لـ RTDETRv2 ولكن مع عبء أقل بكثير.
  • مُحسِّن MuSGD: يستلهم هذا المُحسِّن الهجين تقنيات تدريب LLM المتقدمة، مثل Kimi K2 من Moonshot AI، ويضمن تدريبًا مستقرًا وتقاربًا أسرع، متغلبًا على عدم الاستقرار المعروف في Transformers التقليدية للرؤية.
  • مُحسَّن للأجهزة الطرفية: مع استدلال على CPU أسرع بنسبة تصل إلى 43% مقارنةً بالأجيال السابقة، والإزالة الاستراتيجية لـ Distribution Focal Loss (DFL)، يُعد YOLO26 مناسبًا تمامًا للأجهزة المحمولة وأجهزة IoT التي لا يتوفر فيها تسريع GPU.
  • ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسينات ملحوظة في التعرّف على الأجسام الصغيرة، وهو تحدٍ تاريخي لشبكات CNN، مما يجعل YOLO26 مثاليًا للصور الجوية والروبوتات.

مثال على التدريب#

تتيح واجهة API البديهية من Ultralytics تدريب النماذج المتقدمة بسلاسة. فيما يلي مثال قابل للتنفيذ يوضح كيفية تدريب نموذج YOLO26 Nano على مجموعة بيانات COCO8:

from ultralytics import YOLO

# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")

# Export the trained model to ONNX format for production
model.export(format="onnx")

الملخص#

عند مقارنة RTDETRv2 وYOLOv6-3.0، يعتمد القرار إلى حد كبير على أجهزتك المحددة وقيود زمن الاستجابة. يتألق RTDETRv2 في بيئات البحث والمعالجة من جانب الخادم، حيث يُعد التعامل مع الأجسام المتداخلة المعقدة أمرًا بالغ الأهمية. ويظل YOLOv6-3.0 خيارًا قويًا لخطوط التصنيع ذات الإنتاجية العالية والمجهزة بوحدات NVIDIA GPU قوية.

ومع ذلك، بالنسبة إلى المطورين الذين يبحثون عن أفضل ما في العالمين—الجمع بين أناقة Transformers الخالية من NMS والسرعة الفائقة والبصمة المنخفضة للذاكرة في شبكات CNN—يظل YOLO26 متفوقًا بلا منافس. وبفضل الوثائق الشاملة والمجتمع النشط في منظومة Ultralytics، يضمن YOLO26 أن تكون مشاريعك في Vision AI قوية وقابلة للتوسع ومهيأة للمستقبل.

التعليقات