رؤية YOLO 2026:

مقارنة بين YOLO26 و RTDETRv2#

يتطور مشهد الرؤية الحاسوبية باستمرار، مما يضع الممارسين أمام خيار حاسم: هل يجب الاستفادة من الشبكات العصبية التلافيفية (CNNs) المحسنة للغاية أو اعتماد بنيات أحدث تعتمد على Transformer؟ هناك منافسان بارزان في هذا المجال هما Ultralytics YOLO26 المتطور و RTDETRv2 من Baidu. يدفع كلا النموذجين حدود اكتشاف الكائنات في الوقت الفعلي ولكنهما يعتمدان على فلسفات معمارية مختلفة جوهرياً.

يوفر هذا الدليل نظرة فنية متعمقة لكلا النموذجين، مع مقارنة هياكلهما ومقاييس الأداء وحالات الاستخدام المثالية لمساعدتك في اختيار الأساس الأفضل لمشروع الرؤية الحاسوبية القادم الخاص بك.

Ultralytics YOLO26: قمة الذكاء الاصطناعي البصري الموجه للحافة#

تم تطوير YOLO26 بواسطة Ultralytics، ويمثل قفزة جيلية هائلة لعائلة YOLO. تم إصداره في يناير 2026، وهو مصمم خصيصاً للسرعة والدقة والنشر السلس عبر بيئات السحابة والحافة.

الابتكارات المعمارية ونقاط القوة#

يقدم YOLO26 العديد من الميزات الرائدة التي تميزه ليس فقط عن نماذج Transformer بل وأيضاً عن الإصدارات السابقة مثل YOLO11:

  • تصميم من البداية إلى النهاية بدون NMS: يلغي YOLO26 عملية قمع الحد الأقصى غير المرغوب فيه (NMS) التقليدية أثناء المعالجة اللاحقة. يقلل هذا النهج المدمج من البداية إلى النهاية، والذي ريادت فيه نماذج مثل YOLOv10، من التباين في زمن الاستجابة للاستدلال ويبسط منطق التنفيذ، خاصة على الأجهزة الطرفية.
  • استدلال أسرع بنسبة تصل إلى 43% على وحدة المعالجة المركزية: إدراكاً للحاجة المتزايدة للذكاء الاصطناعي اللامركزي، تم تحسين YOLO26 بشكل كبير للأجهزة التي تفتقر إلى وحدات معالجة رسومية مخصصة، مثل Raspberry Pi.
  • إزالة DFL: من خلال إزالة خسارة التوزيع البؤري (DFL)، يوفر YOLO26 عملية تصدير مبسطة وتحسيناً هائلاً في التوافق مع أجهزة الحافة منخفضة الطاقة والمتحكمات الدقيقة.
  • مُحسِّن MuSGD: لسد الفجوة بين تدريب نماذج اللغات الكبيرة (LLM) والرؤية الحاسوبية، يستخدم YOLO26 مُحسِّن MuSGD. يضمن هذا المزيج الهجين من SGD و Muon — المستوحى من Kimi K2 لشركة Moonshot AI — استقراراً قوياً في التدريب وتقارباً أسرع.
  • ProgLoss + STAL: تجلب وظائف الخسارة المتقدمة تحسينات ملحوظة في التعرف على الكائنات الصغيرة. هذا أمر بالغ الأهمية للصناعات التي تعتمد على تحليل الصور الجوية ومستشعرات إنترنت الأشياء (IoT).

تعرف على المزيد حول YOLO26

تعدد الاستخدامات عبر مهام الرؤية#

على عكس النماذج المقتصرة بصرامة على مربعات الإحاطة، يعد YOLO26 قوة متعددة الاستخدامات. فهو يدمج تحسينات خاصّة بالمهمة، مثل خسارة التجزئة الدلالية وبروتو متعدد المقاييس لـ التجزئة المثيلية، وتقدير اللوغاريتم المتبقي (RLE) لـ تقدير الوضعية، وخسارة الزاوية المتخصصة لحل مشاكل الحدود في مهام مربع الإحاطة الموجه (OBB).

استراتيجية نشر الحافة

عند النشر على الأجهزة الطرفية، استخدم متغيرات YOLO26n (Nano) أو YOLO26s (Small). يعد تصدير هذه النماذج إلى CoreML أو TFLite أمراً سلساً بفضل إزالة DFL والبنية الخالية من NMS، مما يضمن أداء سلساً في الوقت الفعلي على نظامي iOS و Android.

RTDETRv2: تعزيز محولات الاكتشاف في الوقت الفعلي#

يعتمد RTDETRv2، الذي طوره باحثون في Baidu، على إطار عمل RT-DETR الأصلي. ويهدف إلى إثبات أن محولات الاكتشاف (DETRs) يمكنها منافسة، وأحياناً تجاوز، سرعة ودقة الشبكات العصبية التلافيفية (CNNs) المحسنة للغاية في سيناريوهات الوقت الفعلي.

الهيكلية والقدرات#

يستخدم RTDETRv2 بنية تعتمد على المحولات (Transformer)، والتي تعالج الصور بطبيعتها بشكل مختلف عن الشبكات العصبية التلافيفية (CNNs) من خلال الاستفادة من آليات الانتباه الذاتي لفهم السياق العالمي.

  • مجموعة الهدايا (Bag-of-Freebies): يقدم إصدار v2 سلسلة من تقنيات التدريب المحسنة (bag-of-freebies) التي تعمل على تحسين أداء الخط الأساسي دون إضافة تكلفة استدلال.
  • الوعي بالسياق العالمي: بسبب طبقات انتباه المحولات (Transformer)، فإن RTDETRv2 بارع بشكل طبيعي في فهم المشاهد المعقدة حيث يكون السياق العالمي ضرورياً للتمييز بين الأشياء المتداخلة أو المحجوبة.

تعرف على المزيد حول RTDETR

قيود نماذج المحولات#

على الرغم من قوتها، غالباً ما تواجه نماذج الاكتشاف القائمة على المحولات مثل RTDETRv2 تحديات في النشر العملي. فهي تظهر عموماً متطلبات ذاكرة CUDA أعلى أثناء التدريب مقارنة بـ CNNs الفعالة. علاوة على ذلك، يمكن أن يكون دمجها في بيئات الحافة المتنوعة أمراً مرهقاً بسبب العمليات المعقدة التي تتطلبها طبقات الانتباه، مما يجعل نماذج مثل YOLO26 أكثر جاذبية بكثير لعمليات النشر ذات الموارد المحدودة.

مقارنة الأداء#

يكشف تقييم هذه النماذج وجهاً لوجه عن الفوائد الملموسة لأحدث تحسينات CNN. يوضح الجدول أدناه أداءها في المعايير القياسية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

كما هو موضح، يتفوق YOLO26 باستمرار على RTDETRv2 عبر جميع متغيرات الحجم. يحقق YOLO26x معدل mAP رائعاً قدره 57.5 مع زمن انتقال أقل (11.8 مللي ثانية على TensorRT) وعدد أقل بكثير من المعلمات (55.7 مليون) مقارنة بـ RTDETRv2-x (54.3 mAP، 15.03 مللي ثانية، 76 مليون معلمة).

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLO26 و RT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.

متى تختار YOLO26#

YOLO26 هو خيار قوي لـ:

  • نشر الحافة الخالي من NMS: التطبيقات التي تتطلب استنتاجاً متسقاً ومنخفض زمن الانتقال دون تعقيدات معالجة ما بعد المعالجة باستخدام كبت غير الأقصى.
  • بيئات وحدة المعالجة المركزية (CPU) فقط: الأجهزة التي لا تحتوي على تسريع مخصص بوحدة معالجة الرسوميات (GPU)، حيث توفر سرعة استنتاج CPU أسرع بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • الكشف عن الأشياء الصغيرة: السيناريوهات الصعبة مثل صور الطائرات بدون طيار الجوية أو تحليل مستشعرات إنترنت الأشياء (IoT) حيث تعمل ProgLoss و STAL على تعزيز الدقة بشكل كبير على الأشياء الدقيقة.

متى تختار RT-DETR#

يوصى بـ RT-DETR لـ:

  • أبحاث الاكتشاف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وهياكل transformer لاكتشاف الكائنات بنهاية واحدة دون NMS.
  • سيناريوهات الدقة العالية مع زمن انتقال مرن: التطبيقات التي تكون فيها دقة الاكتشاف هي الأولوية القصوى ويكون زمن انتقال الاستنتاج الأعلى قليلاً مقبولاً.
  • اكتشاف الكائنات الكبيرة: المشاهد التي تحتوي بشكل أساسي على كائنات متوسطة إلى كبيرة حيث توفر آلية الانتباه العالمي للمحولات ميزة طبيعية.

ميزة Ultralytics#

اختيار بنية تعلم الآلة الصحيحة هو مجرد جزء من المعادلة؛ فالنظام البيئي المحيط يحدد مدى سرعة انتقال الفريق من النموذج الأولي إلى الإنتاج.

سهولة الاستخدام وكفاءة التدريب#

توفر Ultralytics Python API تجربة مبسطة بشكل ملحوظ. لم يعد تدريب النماذج المعقدة يتطلب شفرة نمطية مطولة. علاوة على ذلك، تعد كفاءة التدريب لـ YOLO26 أفضل بكثير، حيث تستخدم ذاكرة VRAM أقل بكثير لوحدة المعالجة الرسومية مقارنة بآليات الانتباه كثيفة الاستهلاك للذاكرة في RTDETRv2، مما يسمح بأحجام دفعات أكبر حتى على الأجهزة الاستهلاكية.

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

نظام بيئي مُدار جيداً#

من خلال استخدام نماذج Ultralytics، يكتسب المطورون إمكانية الوصول إلى إطار عمل مُدار بنشاط يتكامل بشكل أصلي مع أدوات التتبع الحديثة مثل Weights & Biases و Comet ML. بالنسبة لأولئك الذين يفضلون نهجاً بدون رمز، تسهل Ultralytics Platform التدريب السحابي وإدارة مجموعات البيانات والنشر بنقرة واحدة.

توازن الأداء#

يحقق YOLO26 توازناً لا مثيل له بين سرعة الاستدلال والدقة. تضمن إزالة NMS جنباً إلى جنب مع مُحسن MuSGD أنك تقوم بنشر نموذج دقيق للغاية على الكائنات الصغيرة (بفضل ProgLoss + STAL) وسريع بشكل مذهل في الإنتاج، مما يجعله الخيار الأفضل تقريباً لجميع تطبيقات الرؤية الحاسوبية الحديثة.

نماذج أخرى في النظام البيئي#

بينما يغطي YOLO26 و RTDETRv2 أحدث ما توصلت إليه التكنولوجيا في الكشف في الوقت الفعلي، قد يفكر المطورون الذين يديرون خطوط الأنابيب القديمة أو يستكشفون منحنيات كفاءة مختلفة في YOLOv8 لبيئات المؤسسات الراسخة، أو استكشاف بنيات أخرى مثل EfficientDet. ومع ذلك، لأي مبادرة جديدة، يظل YOLO26 هو التوصية النهائية.

التعليقات