YOLO26 مقابل RTDETRv2#
يتطور مجال الرؤية الحاسوبية باستمرار، ما يضع الممارسين أمام خيار مهم: هل يستفيدون من الشبكات العصبية الالتفافية (CNNs) المحسّنة للغاية، أم يعتمدون البنى الأحدث القائمة على Transformer؟ ومن أبرز المنافسين في هذا المجال Ultralytics YOLO26 المتطور وRTDETRv2 من Baidu. ويدفع كلا النموذجين حدود كشف الأجسام في الزمن الفعلي، لكنهما يعتمدان فلسفتين معماريتين مختلفتين جوهريًا.
يقدّم هذا الدليل تعمقًا تقنيًا في كلا النموذجين، ويقارن بين بنيتيهما ومقاييس أدائهما وحالات الاستخدام المثالية، لمساعدتك في اختيار أفضل أساس لمشروعك التالي في الرؤية الحاسوبية.
Ultralytics YOLO26: قمة الذكاء الاصطناعي للرؤية المصمّم للأجهزة الطرفية#
طوّرته Ultralytics، ويمثّل YOLO26 قفزة هائلة بين الأجيال لعائلة YOLO. وقد صدر في يناير 2026، وصُمّم خصيصًا لتحقيق السرعة والدقة وسهولة النشر عبر البيئات السحابية والطرفية.
- المؤلفان: Glenn Jocher وJing Qiu
- الجهة: Ultralytics
- التاريخ: 2026-01-14
- GitHub: مستودع Ultralytics
- الوثائق: الوثائق الرسمية لـ YOLO26
الابتكارات المعمارية ونقاط القوة#
يقدّم YOLO26 عدة ميزات رائدة تميّزه ليس عن نماذج Transformer فحسب، بل عن الإصدارات السابقة مثل YOLO11 أيضًا:
- تصميم شامل خالٍ من NMS: تلغي آلية الرأس الاختيارية أحادية المطابقة في YOLO26 (
nms=False) الكبت التقليدي غير الأقصى (NMS) أثناء المعالجة اللاحقة. وقد ظهرت هذه المقاربة الشاملة أولًا في نماذج مثل YOLOv10، وهي تقلل تفاوت زمن استجابة الاستدلال وتبسّط منطق النشر، لا سيما على الأجهزة الطرفية. - استدلال على CPU أسرع بنسبة تصل إلى 43%: إدراكًا للحاجة المتزايدة إلى الذكاء الاصطناعي اللامركزي، حُسّن YOLO26 بدرجة كبيرة للعمل على الأجهزة التي لا تحتوي على وحدات GPU مخصصة، مثل Raspberry Pi.
- إزالة DFL: من خلال إزالة خسارة البؤرة التوزيعية (DFL)، يوفّر YOLO26 عملية تصدير مبسطة وتوافقًا محسّنًا بدرجة كبيرة مع الأجهزة الطرفية منخفضة الطاقة والمتحكمات الدقيقة.
- محسّن MuSGD: يسد YOLO26 الفجوة بين تدريب النماذج اللغوية الكبيرة (LLM) والرؤية الحاسوبية باستخدام محسّن MuSGD. ويضمن هذا المزيج من SGD وMuon — المستوحى من Kimi K2 من Moonshot AI — استقرارًا قويًا للتدريب وتقاربًا أسرع.
- ProgLoss + STAL: تحقق دوال الخسارة المتقدمة تحسينات ملحوظة في التعرّف على الأجسام الصغيرة. وهذا مهم للصناعات التي تعتمد على تحليل الصور الجوية ومستشعرات إنترنت الأشياء (IoT).
تعدد الاستخدامات عبر مهام الرؤية#
على خلاف النماذج التي تقتصر على مربعات الإحاطة، يُعد YOLO26 نموذجًا قويًا متعدد الاستخدامات. فهو يدمج تحسينات خاصة بكل مهمة، مثل خسارة التقسيم الدلالي والنموذج الأوّلي متعدد المقاييس من أجل تقسيم الكائنات، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) من أجل تقدير الوضعيات، وخسارة زاوية متخصصة لمعالجة مشكلات الحدود في مهام مربعات الإحاطة الموجّهة (OBB).
RTDETRv2: تطوير محوّلات الكشف في الزمن الفعلي#
طوّر باحثون في Baidu نموذج RTDETRv2 استنادًا إلى إطار RT-DETR الأصلي. ويهدف النموذج إلى إثبات أن محوّلات الكشف (DETRs) قادرة على منافسة سرعة ودقة الشبكات العصبية الالتفافية (CNNs) المحسّنة للغاية في سيناريوهات الزمن الفعلي، بل وتجاوزها أحيانًا.
- المؤلفون: Wenyu Lv وYian Zhao وQinyao Chang وKui Huang وGuanzhong Wang وYi Liu
- الجهة: Baidu
- التاريخ: 2024-07-24
- Arxiv: 2407.17140
- GitHub: تطبيق RTDETRv2 باستخدام PyTorch
- الوثائق: ملف README الخاص بـRTDETRv2
البنية والإمكانات#
يستخدم RTDETRv2 بنية قائمة على Transformer، تعالج الصور بطبيعتها بطريقة تختلف عن CNNs، إذ تستفيد من آليات الانتباه الذاتي لفهم السياق العام.
- مجموعة التحسينات المجانية: يقدّم الإصدار v2 سلسلة من تقنيات التدريب المحسّنة (مجموعة التحسينات المجانية) التي تعزّز الأداء الأساسي دون إضافة تكلفة إلى الاستدلال.
- إدراك السياق العام: بفضل طبقات الانتباه في Transformer، يجيد RTDETRv2 بطبيعته فهم المشاهد المعقدة التي تتطلب سياقًا عامًا للتمييز بين الأجسام المتداخلة أو المحجوبة.
قيود نماذج Transformer#
على الرغم من قوة نماذج الكشف القائمة على Transformer مثل RTDETRv2، فإنها غالبًا ما تواجه تحديات في النشر العملي. فهي تتطلب عمومًا ذاكرة CUDA أكبر أثناء التدريب مقارنةً بـCNNs الفعّالة. فضلًا عن ذلك، قد يكون دمجها في بيئات طرفية متنوعة أمرًا شاقًا بسبب العمليات المعقدة التي تتطلبها طبقات الانتباه، ما يجعل نماذج مثل YOLO26 أكثر جاذبية بكثير لعمليات النشر محدودة الموارد.
مقارنة الأداء#
تكشف مقارنة هذه النماذج مباشرةً عن الفوائد الملموسة لأحدث التحسينات في CNN. ويوضح الجدول أدناه أداءها في معايير قياسية.
| النموذج | الحجم (بكسل) | mAPالتحقق 50-95 | السرعة CPU ONNX (مللي ثانية) | السرعة T4 TensorRT10 (ms) | المعاملات (M) | FLOPs (B) |
|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 38.9 | 1.7 | 2.4 | 5.5 |
| YOLO26s | 640 | 48.6 | 87.2 | 2.5 | 9.5 | 20.9 |
| YOLO26m | 640 | 53.1 | 220.0 | 4.7 | 20.4 | 68.4 |
| YOLO26l | 640 | 55.0 | 286.2 | 6.2 | 24.8 | 86.8 |
| YOLO26x | 640 | 57.5 | 525.8 | 11.8 | 55.7 | 194.4 |
| RTDETRv2-s | 640 | 48.1 | - | 5.03 | 20 | 60 |
| RTDETRv2-m | 640 | 51.9 | - | 7.51 | 36 | 100 |
| RTDETRv2-l | 640 | 53.4 | - | 9.76 | 42 | 136 |
| RTDETRv2-x | 640 | 54.3 | - | 15.03 | 76 | 259 |
كما يتضح، يتفوق YOLO26 باستمرار على RTDETRv2 في جميع أحجام المتغيرات. ويحقق YOLO26x متوسط دقة مميزًا يبلغ 57.5، مع زمن استجابة أقل (11.8 ms على TensorRT) وعدد معاملات أقل بكثير (55.7M) من RTDETRv2-x (متوسط دقة 54.3، و15.03 ms، و76M من المعاملات).
حالات الاستخدام والتوصيات#
يعتمد الاختيار بين YOLO26 وRT-DETR على متطلبات مشروعك المحددة وقيود النشر وتفضيلات المنظومة.
متى تختار YOLO26#
يُعد YOLO26 خياراً مناسباً في الحالات التالية:
- النشر الطرفي دون NMS: التطبيقات التي تتطلب استدلالاً ثابتاً بزمن استجابة منخفض، من دون تعقيد المعالجة اللاحقة للكبت غير الأقصى.
- البيئات التي تعتمد على CPU فقط: الأجهزة التي لا تتضمن تسريعاً مخصصاً بواسطة GPU، حيث يمنح الاستدلال الأسرع على CPU بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
- اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل صور الطائرات المسيّرة الجوية أو تحليل مستشعرات إنترنت الأشياء، حيث يعزز ProgLoss وSTAL دقة اكتشاف الأجسام الدقيقة بدرجة كبيرة.
متى تختار RT-DETR#
يوصى بـRT-DETR في الحالات التالية:
- أبحاث الكشف المعتمدة على Transformer: المشروعات التي تستكشف آليات الانتباه وبنى Transformer لكشف الأجسام بأسلوب شامل دون NMS.
- سيناريوهات الدقة العالية مع مرونة زمن الاستجابة: التطبيقات التي تكون فيها دقة الكشف على رأس الأولويات، ويكون فيها تقبّل زمن استجابة أعلى قليلًا للاستدلال أمرًا ممكنًا.
- كشف الأجسام الكبيرة: المشاهد التي تضم أساسًا أجسامًا متوسطة إلى كبيرة، حيث توفر آلية الانتباه العام في Transformer ميزة طبيعية.
ميزة Ultralytics#
اختيار بنية التعلّم الآلي المناسبة ليس سوى جزء من المعادلة؛ فالمنظومة المحيطة تحدد مدى سرعة انتقال الفريق من إنشاء النماذج الأولية إلى الإنتاج.
سهولة الاستخدام وكفاءة التدريب#
توفّر واجهة Ultralytics البرمجية لـPython تجربة مبسطة بشكل ملحوظ. فلم يعد تدريب النماذج المعقدة يتطلب شيفرة تمهيدية مطوّلة. فضلًا عن ذلك، تتسم كفاءة تدريب YOLO26 بتحسن كبير، إذ يستخدم قدرًا أقل بكثير من ذاكرة GPU VRAM مقارنةً بآليات الانتباه كثيفة الذاكرة في RTDETRv2، ما يتيح استخدام أحجام دفعات أكبر حتى على الأجهزة المخصصة للمستهلكين.
from ultralytics import YOLO
# تهيئة نموذج YOLO26 Nano المتطور
model = YOLO("yolo26n.pt")
# التدريب على مجموعة بيانات COCO8 لمدة 100 حقبة
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)
# تنفيذ استدلال عالي السرعة دون NMS
predictions = model("https://ultralytics.com/images/bus.jpg", nms=False)
# التصدير إلى ONNX لنشر سلس
model.export(format="onnx")منظومة تحظى بصيانة جيدة#
باستخدام نماذج Ultralytics، يحصل المطورون على إطار عمل يحظى بصيانة نشطة ويتكامل أصليًا مع أدوات التتبّع الحديثة مثل Weights & Biases وComet ML. ولمن يفضلون نهجًا لا يتطلب كتابة شيفرة، تتيح منصة Ultralytics التدريب السحابي وإدارة مجموعات البيانات والنشر بنقرة واحدة.
توازن الأداء#
يحقق YOLO26 توازنًا لا مثيل له بين سرعة الاستدلال والدقة. ويضمن خيار إزالة NMS، إلى جانب محسّن MuSGD، نشر نموذج عالي الدقة في اكتشاف الأجسام الصغيرة (بفضل ProgLoss + STAL) وشديد السرعة في بيئة الإنتاج، ما يجعله الخيار الأفضل لمعظم تطبيقات الرؤية الحاسوبية الحديثة.
نماذج أخرى في المنظومة#
مع أن YOLO26 وRTDETRv2 يمثلان أحدث ما توصل إليه مجال الكشف في الزمن الفعلي، فقد يفكر المطورون الذين يصونون خطوط أنابيب قديمة أو يستكشفون منحنيات كفاءة مختلفة في استخدام YOLOv8 لبيئات المؤسسات الراسخة، أو استكشاف بنيات أخرى مثل EfficientDet. لكن YOLO26 يظل التوصية الأوضح لأي مبادرة جديدة.