RTDETRv2 مقابل YOLOv6-3.0#
يتطور مجال الرؤية الحاسوبية باستمرار، ويقدم للمطورين خيارات معمارية عديدة لكشف الأجسام. ويمثل نموذجان بارزان نهجين مختلفين: RTDETRv2، وهو Transformer متقدم للرؤية، وYOLOv6-3.0، وهو شبكة عصبية التفافية (CNN) محسّنة بدرجة كبيرة للتطبيقات الصناعية.
تستكشف هذه المقارنة التقنية الشاملة بنية كل نموذج ومقاييس أدائه وسيناريوهات النشر المثالية له. كما نتناول كيف توفر منظومة Ultralytics الأوسع تجربة مطور أفضل، ونتطلع في النهاية إلى إمكانات الجيل التالي في Ultralytics YOLO26.
RTDETRv2: نهج Transformer للرؤية#
طوّره باحثون في Baidu، ويستند RTDETRv2 إلى أسس RT-DETR الأصلي، ويمثل قفزة كبيرة إلى الأمام في اكتشاف الأجسام المعتمد على Transformer.
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: lyuwenyu/RT-DETR
- الوثائق: ملف README على GitHub لـ RTDETRv2
أبرز السمات المعمارية#
يستخدم RTDETRv2 بنية هجينة تجمع مستخرج سمات CNN بمفكك ترميز قوي من نوع Transformer. وأبرز ما يميز هذا النموذج تصميمه الخالي أصليًا من NMS. فبإلغاء الكبت غير الأقصى (NMS) أثناء المعالجة اللاحقة، يتنبأ النموذج بمربعات الإحاطة مباشرةً، ما يبسّط النشر ويجعل زمن استدلاله أكثر استقرارًا.
تعزز «مجموعة المزايا المجانية» المدمجة في RTDETRv2 قدرته على التعامل مع المشاهد المعقدة والأجسام المتداخلة، إذ تفهم آليات الانتباه الشامل العلاقات المكانية بطبيعتها على نحو أفضل من الالتفافات الموضعية.
مع أن نماذج Transformer تتفوق في فهم المشاهد المعقدة، فإنها تتطلب عادةً ذاكرة CUDA أكبر بكثير أثناء التدريب مقارنةً بنماذج CNN. وقد يحد ذلك من أحجام الدفعات على وحدات GPU الاستهلاكية القياسية ويزيد إجمالي وقت التدريب.
YOLOv6-3.0: تعظيم معدل الإنتاج الصناعي#
نشأ YOLOv6-3.0 في قسم الذكاء الاصطناعي للرؤية لدى Meituan، وصُمم صراحةً ليكون كاشفًا من الجيل التالي لخطوط الإنتاج الصناعية التي يكون فيها معدل إنتاجية GPU عاملًا حاسمًا.
- المؤلفون: Chuyi Li وLulu Li وYifei Geng وHongliang Jiang وMeng Cheng وBo Zhang وZaidan Ke وXiaoming Xu وXiangxiang Chu
- الجهة: Meituan
- التاريخ: 2023-01-13
- Arxiv: 2301.05586
- GitHub: meituan/YOLOv6
التركيز المعماري#
يعتمد YOLOv6-3.0 على بنية أساسية EfficientRep، صُممت بعناية لتقليل تكاليف الوصول إلى الذاكرة على مسرّعات الأجهزة مثل وحدات NVIDIA GPU. وتضم بنية العنق وحدة Bi-directional Concatenation (BiC) لتحسين دمج السمات عبر المقاييس المختلفة.
أثناء التدريب، يستخدم النموذج استراتيجية التدريب بمساعدة المراسي (AAT) للاستفادة من النُهج القائمة على المراسي، مع الحفاظ على وضع استدلال خالٍ من المراسي لتنفيذ أسرع. ورغم تحقيقه معدل إنتاجية استثنائيًا على وحدات GPU المخصصة للخوادم (مثل T4 وA100)، قد تؤدي بنيته المتخصصة إلى زمن استجابة دون المستوى الأمثل عند نشره على الأجهزة الطرفية التي تعتمد على CPU فقط.
مقارنة الأداء#
عند تقييم النماذج للاستخدام في بيئات الإنتاج، من الضروري تحقيق التوازن بين الدقة (mAP) وسرعة الاستدلال والتكلفة الحاسوبية (FLOPs). ويوضح الجدول أدناه مقارنة أداء هذه النماذج.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
| YOLOv6-3.0n | 640 | 37.5 | - | 1.17 | 4.7 | 11.4 |
| YOLOv6-3.0s | 640 | 45.0 | - | 2.66 | 18.5 | 45.3 |
| YOLOv6-3.0m | 640 | 50.0 | - | 5.28 | 34.9 | 85.8 |
| YOLOv6-3.0l | 640 | 52.8 | - | 8.95 | 59.6 | 150.7 |
رغم تفوق YOLOv6-3.0 في سرعة المعالجة الصرفة على TensorRT، يحقق RTDETRv2 درجات mAP أعلى، لا سيما مع تحسّن أدائه عند الانتقال إلى إصدارات أكبر من النموذج. ومع ذلك، يفتقر كلا النموذجين إلى التنوع الواسع الذي توفره أطر العمل الموحدة الحديثة. ويركز YOLOv6-3.0 أساسًا على الكشف، ولا يدعم مباشرةً مهام مثل تجزئة الكائنات وتقدير الوضعية.
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين RT-DETR وYOLOv6 على متطلبات مشروعك وقيود النشر وتفضيلاتك للمنظومة البرمجية.
متى تختار RT-DETR#
يُعد RT-DETR خيارًا قويًا في الحالات التالية:
- أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
- سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
- كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.
متى تختار YOLOv6#
يُنصح بـ YOLOv6 في الحالات التالية:
- النشر الملائم لعتاد الصناعة: الحالات التي يوفر فيها التصميم المراعي للعتاد وإعادة المعلمة الفعّالة للنموذج أداءً محسّنًا على عتاد مستهدف محدد.
- الكشف السريع أحادي المرحلة: التطبيقات التي تعطي الأولوية لسرعة الاستدلال الخام على GPU لمعالجة الفيديو في الوقت الفعلي ضمن بيئات خاضعة للتحكم.
- التكامل مع منظومة Meituan: الفرق التي تعمل بالفعل ضمن حزمة تقنيات Meituan وبنية النشر التحتية الخاصة بها.
متى تختار Ultralytics (YOLO26)#
بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
ميزة Ultralytics#
لا يقتصر اختيار النموذج المناسب على أرقام معايير الأداء الخام؛ فتجربة المطور ومرونة النشر ودعم المنظومة البرمجية عوامل لا تقل أهمية. ومن خلال استخدام النماذج المدمجة ضمن منصة Ultralytics، يحصل المستخدمون على مزايا كبيرة مقارنةً بمستودعات الأبحاث الثابتة.
- سهولة الاستخدام: توفر حزمة Python المسماة
ultralyticsواجهة API سلسة. ولا يتطلب تدريب النماذج والتحقق منها وتصديرها سوى بضعة أسطر من التعليمات البرمجية. - منظومة برمجية تحظى بصيانة جيدة: على خلاف مستودعات الأبحاث الأكاديمية المعزولة، يجري تحديث منصة Ultralytics باستمرار. وتضم عمليات تكامل قوية مع أدوات مثل ONNX وOpenVINO وCoreML.
- كفاءة التدريب: تستهلك نماذج Ultralytics عادةً قدرًا أقل بكثير من VRAM أثناء التدريب مقارنةً ببنى Transformer مثل RTDETRv2، ما يتيح استخدام أحجام دفعات أكبر على الأجهزة المخصصة للمستهلكين.
- تعدد الاستخدامات: على خلاف النطاق المحدود لـ YOLOv6-3.0، تدعم نماذج Ultralytics مهامًا متعددة، بما في ذلك التجزئة وتصنيف الصور ومربعات الإحاطة الموجّهة (OBB)، ضمن إطار عمل موحد واحد.
باستخدام CLI الخاص بـ Ultralytics، لا يتطلب تصدير نموذج مدرّب للنشر على الأجهزة الطرفية سوى تشغيل: yolo export model=yolo11n.pt format=tensorrt.
إليكم YOLO26: الحل الأمثل#
على الرغم من المزايا التي يقدمها RTDETRv2 وYOLOv6-3.0، فإن هذا المجال يتطور بسرعة. ونوصي بشدة الفرق التي تبدأ مشاريع جديدة في الرؤية الحاسوبية باستخدام YOLO26، الذي أصدرته Ultralytics في يناير 2026.
يجمع YOLO26 نقاط قوة نماذج CNN الصناعية ونماذج Transformer الحديثة، ويتجنب في الوقت نفسه أوجه قصور كل منها:
- تصميم شامل خالٍ من NMS: اعتمادًا على الابتكار الذي طُرح لأول مرة في YOLOv10، يقدم YOLO26 رأسًا اختياريًا خاليًا من NMS (
nms=False) يلغي المعالجة اللاحقة لـ NMS، ويضمن نشرًا مستقرًا يمكن التنبؤ به، على غرار RTDETRv2 ولكن بأعباء أقل بكثير. - محسّن MuSGD: مستوحى من تقنيات التدريب المتقدمة لنماذج LLM (مثل Kimi K2 من Moonshot AI)، ويضمن هذا المحسّن الهجين تدريبًا مستقرًا وتقاربًا أسرع، متغلبًا على عدم الاستقرار المعروف في نماذج Transformer التقليدية للرؤية.
- تحسين للأجهزة الطرفية: بفضل استدلال CPU الأسرع بنسبة تصل إلى 43% مقارنةً بالأجيال السابقة، والإزالة المدروسة لخسارة البؤرة التوزيعية (DFL)، يلائم YOLO26 تمامًا الأجهزة المحمولة وأجهزة إنترنت الأشياء التي لا يتوفر فيها تسريع GPU.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة هذه تحسنًا ملحوظًا في التعرف على الأجسام الصغيرة، وهو تحدٍ تاريخي لنماذج CNN، ما يجعل YOLO26 مثاليًا للصور الجوية والروبوتات.
مثال على التدريب#
تتيح واجهة API البديهية لـ Ultralytics تدريب النماذج المتطورة بسلاسة. يوضح المثال القابل للتنفيذ أدناه كيفية تدريب نموذج YOLO26 Nano على مجموعة بيانات COCO8:
from ultralytics import YOLO
# Load the newly released YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Train the model on the COCO8 dataset for 50 epochs
# The Ultralytics engine handles data caching and augmentation automatically
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)
# Validate the model's performance
metrics = model.val()
print(f"Validation mAP50-95: {metrics.box.map}")
# Export the trained model to ONNX format for production
model.export(format="onnx")الملخص#
عند المقارنة بين RTDETRv2 وYOLOv6-3.0، يعتمد القرار إلى حد كبير على الأجهزة المستخدمة وقيود زمن الاستجابة. يتألق RTDETRv2 في بيئات الأبحاث والمعالجة على الخوادم، حيث يكون التعامل مع الأجسام المتداخلة المعقدة أمرًا بالغ الأهمية. ويظل YOLOv6-3.0 خيارًا قويًا لخطوط التصنيع عالية الإنتاجية المجهزة بوحدات NVIDIA GPU قوية.
لكن للمطورين الباحثين عن أفضل ما في العالمين—الجمع بين أناقة نماذج Transformer الخالية من NMS والسرعة الفائقة واستهلاك الذاكرة المنخفض لنماذج CNN—لا يضاهى YOLO26. وبفضل الوثائق الشاملة والمجتمع النشط في منظومة Ultralytics، يضمن YOLO26 أن تكون مشاريع الذكاء الاصطناعي للرؤية متينة وقابلة للتوسع ومهيأة للمستقبل.