Ultralytics YOLO27:
Get Started

YOLOv6-3.0 مقابل RTDETRv2#

يتطلب اختيار البنية المثلى لتطبيقات الرؤية الحاسوبية الموازنة بين السرعة والدقة وقيود النشر. في هذا التحليل التقني الشامل، ندرس YOLOv6-3.0، وهو شبكة عصبية التفافية (CNN) بمستوى صناعي صُممت لبيئات GPU عالية الإنتاجية، ونقارنه بـ RTDETRv2، وهو نموذج متطور قائم على Transformer يوظف آليات الانتباه في الكشف الآني عن الأجسام.

مع أن كلا النموذجين يمثلان محطات مهمة في أبحاث الذكاء الاصطناعي، يلجأ المطورون الباحثون عن مسار عمل أكثر تنوعًا وكفاءةً في كثير من الأحيان إلى منصة Ultralytics القوية.

YOLOv6-3.0: إنتاجية صناعية#

طوّره قسم الذكاء الاصطناعي للرؤية في Meituan، ويركز YOLOv6-3.0 بشدة على زيادة سرعات المعالجة الخام على مسرّعات الأجهزة مثل وحدات GPU من NVIDIA، مما رسّخ مكانته في التطبيقات الصناعية القديمة.

  • المؤلفون: Chuyi Li وLulu Li وYifei Geng وآخرون.
  • المؤسسة: Meituan
  • التاريخ: 2023-01-13
  • ArXiv: 2301.05586
  • GitHub: meituan/YOLOv6

أبرز سمات البنية#

يعتمد YOLOv6-3.0 على العمود الفقري EfficientRep الملائم للأجهزة، والمصمم خصيصًا للاستدلال عالي السرعة باستخدام GPU. وتدمج البنية وحدة BiC للوصل ثنائي الاتجاه في عنق النموذج لإثراء دمج السمات عبر دقات مكانية مختلفة. أثناء التدريب، يستفيد النموذج من استراتيجية التدريب بمساعدة المراسي (AAT) لتوظيف مزايا التدريب القائم على المراسي مع الحفاظ على مسار استدلال خالٍ من المراسي.

نقاط القوة والضعف#

نقاط القوة:

  • إنتاجية استثنائية على أجهزة بمستوى الخوادم، مثل وحدات GPU من طرازي T4 وA100.
  • يوفر شروحات متخصصة للتكميم للنشر بدقة INT8 باستخدام RepOpt.
  • نسبة ملائمة بين عدد المعاملات والسرعة لتحليلات الفيديو على نطاق واسع.

نقاط الضعف:

  • كاشف لصناديق الإحاطة بالدرجة الأولى؛ ويفتقر إلى تنوع المهام المتعددة الجاهز للاستخدام (مثل تقدير الوضعية وOBB) المتوفر في نماذج مثل Ultralytics YOLO11.
  • اعتماد أكبر على كبت غير الأعظميات (NMS) المعقد أثناء المعالجة اللاحقة، مما يزيد تباين زمن الاستجابة.
  • منظومة أقل نشاطًا مقارنة بأطر العمل الشائعة، مما يجعل التحديثات ودعم المجتمع أقل قابلية للتنبؤ.

تعرّف على المزيد حول YOLOv6

RTDETRv2: المحولات الآنية#

بقيادة باحثين في Baidu، يبني RTDETRv2 على RT-DETR الأصلي من خلال تحسين إطار عمل محول الكشف باستخدام نهج «مجموعة من المزايا المجانية»، محققًا دقة متطورة دون التضحية بملاءمته للتشغيل الآني.

  • المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
  • الجهة: Baidu
  • التاريخ: 2024-07-24
  • ArXiv: 2407.17140
  • GitHub: lyuwenyu/RT-DETR

أبرز سمات البنية#

على خلاف الشبكات العصبية الالتفافية التقليدية، يعمل RTDETRv2 بأسلوب شامل من البداية إلى النهاية. وبالاستفادة من طبقات انتباه Transformer، تلغي البنية تمامًا الحاجة إلى المعالجة اللاحقة باستخدام NMS. وهذا يتيح مسار استدلال مبسطًا. ويقدم RTDETRv2 دمجًا محسّنًا للغاية للسمات عبر المقاييس ومشفّرًا هجينًا فعالًا، ما يتيح له معالجة مجموعات بيانات COCO القياسية بدقة عالية.

نقاط القوة والضعف#

نقاط القوة:

  • توفر آليات الانتباه القائمة على Transformer متوسط دقة استثنائيًا (mAP)، لا سيما في المشاهد المعقدة أو المكتظة.
  • يُوحّد التصميم الخالي من NMS زمن الاستدلال ويبسط دمج النموذج في بيئات الإنتاج.
  • ممتاز للسيناريوهات التي تتطلب أقصى دقة ممكنة ولا تفرض قيود الأجهزة فيها إلا بقدر ضئيل.

نقاط الضعف:

  • تتطلب طبقات Transformer ذاكرة CUDA كبيرة أثناء التدريب، مما يعزل الباحثين الذين لا يملكون إمكانية الوصول إلى وحدات GPU متطورة.
  • سرعات الاستدلال على CPU أبطأ بوضوح من الشبكات العصبية الالتفافية الطرفية المتخصصة، مما يحد من استخدامه على الأجهزة المحمولة وأجهزة إنترنت الأشياء.
  • قد يكون الإعداد والضبط معقدين للفرق المعتادة على عمليات تعلم الآلة (MLOps) التقليدية.

تعرّف على المزيد حول RTDETRv2

مقارنة مفصلة للأداء#

يقارن الجدول التالي أداء YOLOv6-3.0 وRTDETRv2 عبر مؤشرات الأداء الرئيسية. لاحظ التباين الكبير بين كفاءة YOLOv6 من حيث عدد المعاملات والدقة الخام لـ RTDETRv2.

النموذجالحجم
(بكسل)
mAPالتحقق
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(ms)
المعاملات
(M)
FLOPs
(B)
YOLOv6-3.0n64037.5-1.174.711.4
YOLOv6-3.0s64045.0-2.6618.545.3
YOLOv6-3.0m64050.0-5.2834.985.8
YOLOv6-3.0l64052.8-8.9559.6150.7
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259
نصيحة للنشر

إذا كنت تنشر على أجهزة تعتمد حصريًا على CPU، مثل Raspberry Pi، فإن النماذج القائمة على الشبكات العصبية الالتفافية تتفوق عمومًا بفارق كبير على بنى Transformer من حيث عدد الإطارات في الثانية (FPS). ولتحقيق أفضل أداء على الأجهزة الطرفية، فكّر في استخدام OpenVINO لتسريع الاستدلال.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLOv6 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.

متى تختار YOLOv6#

يُعد YOLOv6 خيارًا قويًا لـ:

  • النشر الملائم لعتاد الصناعة: الحالات التي يوفر فيها التصميم المراعي للعتاد وإعادة المعلمة الفعّالة للنموذج أداءً محسّنًا على عتاد مستهدف محدد.
  • الكشف السريع أحادي المرحلة: التطبيقات التي تعطي الأولوية لسرعة الاستدلال الخام على GPU لمعالجة الفيديو في الوقت الفعلي ضمن بيئات خاضعة للتحكم.
  • التكامل مع منظومة Meituan: الفرق التي تعمل بالفعل ضمن حزمة تقنيات Meituan وبنية النشر التحتية الخاصة بها.

متى تختار RT-DETR#

يوصى بـRT-DETR في الحالات التالية:

  • أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
  • سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
  • كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة إلى معظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطور:

  • النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
  • البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.

ميزة Ultralytics: ظهور YOLO26#

مع أن YOLOv6-3.0 وRTDETRv2 يتفوقان في مجاليهما، فإن مشهد تعلم الآلة الحديث يتطلب نماذج تجمع بين السرعة والدقة وتجربة المطور. تلبي منظومة Ultralytics هذه الاحتياجات على أكمل وجه، لا سيما مع إصدار YOLO26.

صدر Ultralytics YOLO26 في يناير 2026، ويمثل المعيار الحاسم في مجال الرؤية الحاسوبية، متفوقًا بفارق كبير على النماذج الأقدم مثل YOLOv8 والتفرعات المجتمعية مثل YOLO12.

لماذا يتفوق YOLO26 على المنافسين#

  1. تصميم شامل من البداية إلى النهاية وخالٍ من NMS: الذي طُرح لأول مرة في YOLOv10، يوفّر YOLO26 رأسًا أصليًا خاليًا من NMS (nms=False) يلغي المعالجة اللاحقة باستخدام NMS. وهذا يحقق بساطة النشر التي يوفرها RTDETRv2 مع الحفاظ على السرعة الفائقة لشبكة عصبية التفافية محسّنة للغاية.
  2. مُحسِّن MuSGD: مستوحًى من ابتكارات نماذج اللغة الكبيرة (مثل Kimi K2 من Moonshot AI)، يستخدم YOLO26 مزيجًا من SGD وMuon. وهذا يضمن ديناميكيات تدريب مستقرة للغاية وتقاربًا سريعًا، مع تقليل الوقت وموارد الحوسبة اللازمة لمجموعات البيانات المخصصة.
  3. أداء لا يُضاهى على الأجهزة الطرفية: من خلال تطبيق الإزالة الكاملة لخسارة البؤرة التوزيعية (DFL)، يبسط YOLO26 بنى التصدير. ويحقق هذا التحسين استدلالًا على CPU أسرع بنسبة تصل إلى 43% مقارنة بالنماذج القديمة، مما يجعله الخيار الأبرز بلا منازع للذكاء الاصطناعي الطرفي وأجهزة إنترنت الأشياء.
  4. تحسين الكشف عن الأجسام الصغيرة: يؤدي إدخال دوال الخسارة ProgLoss وSTAL إلى قفزة كبيرة في اكتشاف الأجسام الصغيرة، وهو مطلب أساسي لتحليلات الطائرات المسيّرة والصور الجوية، وهما مجالان واجه فيهما YOLOv6 صعوبات تاريخيًا.
  5. تعدد المهام: خلافًا لـ YOLOv6، الذي يركز حصريًا على الكشف، يدعم YOLO26 مسارات عمل متعددة المهام، تشمل تجزئة الكائنات وتقدير الوضعية وتصنيف الصور وصناديق الإحاطة الموجّهة (OBB)، وكل ذلك عبر API موحّد واحد.

كفاءة التدريب وسهولة الاستخدام#

صُممت واجهة Python البرمجية من Ultralytics لتعزيز إنتاجية المطور إلى أقصى حد. يمكنك الانتقال من التدريب إلى النشر باستخدام بضعة أسطر من التعليمات البرمجية فحسب، متجاوزًا تمامًا إعداد البيئة المعقد الذي تتطلبه مستودعات الأبحاث المستقلة.

فيما يلي مثال كامل قابل للتشغيل لتدريب نموذج YOLO26 متطور والتحقق من صحته باستخدام حزمة Ultralytics:

from ultralytics import YOLO

# Load the state-of-the-art YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train the model on a custom dataset (e.g., COCO8) for 50 epochs
# The API automatically handles dataset download and environment config
train_results = model.train(data="coco8.yaml", epochs=50, imgsz=640)

# Validate the model's accuracy on the validation split
val_metrics = model.val()
print(f"Validation mAP50-95: {val_metrics.box.map:.4f}")

# Export the trained model to ONNX for production deployment
model.export(format="onnx")

الخلاصة#

يُعد YOLOv6-3.0 وRTDETRv2 إسهامين مميزين لمجتمع الذكاء الاصطناعي. يظل YOLOv6-3.0 أداة قوية للأتمتة الصناعية المعتمدة على GPU الخام، بينما يثبت RTDETRv2 قدرة بنى Transformer على تحقيق زمن استجابة آني مع زيادة الدقة إلى أقصى حد.

لكن بالنسبة إلى الفرق التي تحتاج إلى إطار عمل موثوق وجاهز للإنتاج، مع دعم مجتمعي نشط، تُعد نماذج Ultralytics YOLO الخيار الأفضل باستمرار. إن التكامل السلس مع منصات مثل Hugging Face وTensorRT، إلى جانب انخفاض استهلاك الذاكرة أثناء التدريب بدرجة كبيرة، يتيح للجميع الاستفادة من الذكاء الاصطناعي المتقدم. وبالترقية إلى YOLO26، يستطيع المطورون الاستفادة من مُحسِّن MuSGD المبتكر والبنية الخالية من NMS لبناء مسارات عمل للرؤية الحاسوبية أسرع وأذكى وأكثر قابلية للتوسع.

التعليقات