Ultralytics YOLO27:

YOLO26 مقابل RTDETRv2#

يشهد مجال الرؤية الحاسوبية تطورًا مستمرًا، مما يطرح أمام الممارسين خيارًا حاسمًا: هل ينبغي الاستفادة من الشبكات العصبية الالتفافية (CNN) المحسّنة بدرجة عالية، أم اعتماد البنى الأحدث القائمة على Transformer؟ ومن أبرز المتنافسين في هذا المجال Ultralytics YOLO26 وBaidu's RTDETRv2. يدفع كلا النموذجين حدود اكتشاف الأجسام في الوقت الفعلي، لكنهما يعتمدان على فلسفات معمارية مختلفة جذريًا.

يقدّم هذا الدليل تحليلًا تقنيًا معمقًا لكلا النموذجين، مع مقارنة بنيتهما ومقاييس أدائهما وحالات الاستخدام المثالية، لمساعدتك في اختيار أفضل أساس لمشروعك التالي في مجال الرؤية الحاسوبية.

Ultralytics YOLO26: ذروة الذكاء الاصطناعي للرؤية المُصمَّم أولًا للأجهزة الطرفية#

طوّرته Ultralytics، ويمثل YOLO26 قفزة هائلة على مستوى الأجيال لعائلة YOLO. أُطلق في يناير 2026، وصُمّم خصيصًا لتحقيق السرعة والدقة والنشر السلس عبر البيئات السحابية والطرفية.

الابتكارات المعمارية ونقاط القوة#

يقدّم YOLO26 عدة ميزات رائدة تميّزه ليس عن نماذج Transformer فحسب، بل أيضًا عن الإصدارات السابقة مثل YOLO11:

  • تصميم شامل من البداية إلى النهاية وخالٍ من NMS: يلغي YOLO26 القمع التقليدي للصناديق غير القصوى (NMS) أثناء المعالجة اللاحقة. وقد ظهر هذا النهج الأصلي الشامل من البداية إلى النهاية في نماذج مثل YOLOv10، إذ يقلل تفاوت زمن استدلال النموذج ويبسط منطق النشر، ولا سيما على الأجهزة الطرفية.
  • استدلال أسرع على CPU بنسبة تصل إلى 43%: إدراكًا للحاجة المتزايدة إلى الذكاء الاصطناعي اللامركزي، حُسّن YOLO26 بدرجة كبيرة للعمل على الأجهزة التي تفتقر إلى GPU مخصص، مثل Raspberry Pi.
  • إزالة DFL: من خلال إزالة خسارة التركيز التوزيعية (DFL)، يوفّر YOLO26 عملية تصدير مبسطة وتوافقًا محسّنًا بدرجة كبيرة مع الأجهزة الطرفية منخفضة الاستهلاك ووحدات التحكم الدقيقة.
  • مُحسِّن MuSGD: لسد الفجوة بين تدريب نماذج اللغة الكبيرة (LLM) والرؤية الحاسوبية، يستخدم YOLO26 مُحسِّن MuSGD. ويضمن هذا المزيج من SGD وMuon، المستوحى من Kimi K2 من Moonshot AI، استقرارًا متينًا للتدريب وتقاربًا أسرع.
  • ProgLoss + STAL: تُحدث دوال الخسارة المتقدمة تحسينات ملحوظة في التعرّف على الأجسام الصغيرة. ويكتسب ذلك أهمية حاسمة للصناعات التي تعتمد على تحليل الصور الجوية ومستشعرات إنترنت الأشياء (IoT).

تعدد الاستخدامات عبر مهام الرؤية#

على خلاف النماذج التي تقتصر بصرامة على الصناديق المحيطة، يُعد YOLO26 منظومة قوية متعددة الاستخدامات. فهو يدمج تحسينات خاصة بالمهام، مثل خسارة التجزئة الدلالية وproto متعدد المقاييس من أجل تجزئة المثيلات، وتقدير الاحتمالية اللوغاريتمية المتبقية (RLE) من أجل تقدير الوضعيات، وخسارة زاوية متخصصة لمعالجة مشكلات الحدود في مهام الصندوق المحيط الموجّه (OBB).

استراتيجية النشر على الأجهزة الطرفية

عند النشر على الأجهزة الطرفية، استخدم المتغيرين YOLO26n (Nano) أو YOLO26s (Small). ويجري تصدير هذه النماذج إلى CoreML أو TFLite بسلاسة بفضل إزالة DFL والبنية الخالية من NMS، مما يضمن أداءً سلسًا في الوقت الفعلي على iOS وAndroid.

RTDETRv2: تحسين محولات الاكتشاف في الوقت الفعلي#

طوّر RTDETRv2 باحثون في Baidu، وهو يبني على إطار RT-DETR الأصلي. ويهدف إلى إثبات قدرة محولات الاكتشاف (DETRs) على منافسة سرعة ودقة الشبكات العصبية الالتفافية (CNN) المحسّنة بدرجة عالية في سيناريوهات الوقت الفعلي، بل وتجاوزهما أحيانًا.

البنية والقدرات#

يستخدم RTDETRv2 بنية قائمة على Transformer، تعالج الصور بطبيعتها بطريقة مختلفة عن CNN من خلال الاستفادة من آليات الانتباه الذاتي لفهم السياق العالمي.

  • حزمة المزايا المجانية: يقدّم الإصدار v2 سلسلة من تقنيات التدريب المحسّنة (حزمة المزايا المجانية) التي تحسّن الأداء الأساسي دون إضافة تكلفة على الاستدلال.
  • الوعي بالسياق العالمي: بفضل طبقات انتباه Transformer، يتمتع RTDETRv2 بطبيعة الحال بقدرة عالية على فهم المشاهد المعقدة التي يكون فيها السياق العالمي ضروريًا للتمييز بين الأجسام المتداخلة أو المحجوبة.

قيود نماذج Transformer#

رغم قوتها، غالبًا ما تواجه نماذج الكشف القائمة على Transformer مثل RTDETRv2 تحديات في النشر العملي. فهي تتطلب عمومًا قدرًا أكبر من ذاكرة CUDA أثناء التدريب مقارنةً بشبكات CNN الفعّالة. علاوة على ذلك، قد يكون دمجها في بيئات طرفية متنوعة مرهقًا بسبب العمليات المعقدة التي تتطلبها طبقات الانتباه، مما يجعل نماذج مثل YOLO26 أكثر جاذبية بكثير لعمليات النشر المقيّدة بالموارد.

مقارنة الأداء#

يكشف تقييم هذه النماذج جنبًا إلى جنب عن الفوائد الملموسة لأحدث تحسينات CNN. ويوضح الجدول أدناه أداءها على المعايير القياسية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(مللي ثانية)
السرعة
T4 TensorRT10
(مللي ثانية)
المعاملات
(M)
FLOPs
(B)
YOLO26n64040.938.91.72.45.4
YOLO26s64048.687.22.59.520.7
YOLO26m64053.1220.04.720.468.2
YOLO26l64055.0286.26.224.886.4
YOLO26x64057.5525.811.855.7193.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

كما يتضح، يتفوق YOLO26 باستمرار على RTDETRv2 عبر جميع متغيرات الحجم. ويحقق YOLO26x قيمة mAP لافتة تبلغ 57.5، مع زمن استجابة أقل (11.8 مللي ثانية على TensorRT) وعدد معلمات أقل بكثير (55.7M) مقارنةً بـ RTDETRv2-x (قيمة mAP تبلغ 54.3، وزمن قدره 15.03 مللي ثانية، و76M معلمة).

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLO26 وRT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات المنظومة البرمجية.

متى تختار YOLO26#

يُعد YOLO26 خيارًا قويًا من أجل:

  • النشر الطرفي الخالي من NMS: التطبيقات التي تتطلب استدلالًا متسقًا منخفض زمن الانتقال دون تعقيد المعالجة اللاحقة لكبت القيم غير العظمى.
  • البيئات المعتمدة على CPU فقط: الأجهزة التي لا تتضمن تسريع GPU مخصصًا، حيث يوفر استدلال YOLO26 الأسرع على CPU بنسبة تصل إلى 43% ميزة حاسمة.
  • اكتشاف الأجسام الصغيرة: السيناريوهات الصعبة مثل الصور الجوية الملتقطة بالطائرات المسيّرة أو تحليل مستشعرات إنترنت الأشياء، حيث يعزّز ProgLoss وSTAL الدقة بدرجة كبيرة عند التعامل مع الأجسام الصغيرة جدًا.

متى تختار RT-DETR#

يوصى باستخدام RT-DETR في الحالات التالية:

  • أبحاث الكشف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وبنى Transformer لاكتشاف الأجسام من البداية إلى النهاية دون NMS.
  • السيناريوهات عالية الدقة ذات زمن الاستجابة المرن: التطبيقات التي تمثل فيها دقة الكشف الأولوية القصوى، ويكون فيها قبول زمن استدلال أعلى قليلًا أمرًا ممكنًا.
  • اكتشاف الأجسام الكبيرة: المشاهد التي تتكون أساسًا من أجسام متوسطة إلى كبيرة، حيث توفر آلية الانتباه العالمي في Transformer ميزة طبيعية.

ميزة Ultralytics#

لا يمثل اختيار بنية التعلم الآلي المناسبة سوى جزء من المعادلة؛ إذ تحدد المنظومة المحيطة مدى سرعة انتقال الفريق من وضع النمذجة الأولية إلى الإنتاج.

سهولة الاستخدام وكفاءة التدريب#

توفّر واجهة Ultralytics البرمجية لـ Python تجربة مبسطة بدرجة لافتة. فلم يعد تدريب النماذج المعقدة يتطلب شيفرة تمهيدية مطوّلة. علاوة على ذلك، تتميز كفاءة تدريب YOLO26 بتحسن كبير، إذ تستخدم قدرًا أقل بكثير من ذاكرة GPU VRAM مقارنةً بآليات الانتباه كثيفة الذاكرة في RTDETRv2، مما يتيح أحجام دفعات أكبر حتى على الأجهزة المخصصة للمستهلكين.

from ultralytics import YOLO

# Initialize the cutting-edge YOLO26 Nano model
model = YOLO("yolo26n.pt")

# Train on the COCO8 dataset for 100 epochs
results = model.train(data="coco8.yaml", epochs=100, imgsz=640)

# Execute high-speed, NMS-free inference
predictions = model("https://ultralytics.com/images/bus.jpg")

# Export to ONNX for seamless deployment
model.export(format="onnx")

منظومة تتم صيانتها جيدًا#

باستخدام نماذج Ultralytics، يحصل المطورون على إطار عمل تتم صيانته بنشاط، ويتكامل أصليًا مع أدوات التتبع الحديثة مثل Weights & Biases وComet ML. أما من يفضلون نهجًا دون شيفرة، فتتيح منصة Ultralytics التدريب السحابي وإدارة مجموعات البيانات والنشر بنقرة واحدة.

موازنة الأداء#

يحقق YOLO26 توازنًا لا مثيل له بين سرعة الاستدلال والدقة. وتضمن إزالة NMS إلى جانب مُحسِّن MuSGD نشر نموذج يتمتع بدقة عالية في الأجسام الصغيرة (بفضل ProgLoss + STAL) وبسرعة فائقة في الإنتاج، مما يجعله الخيار الأفضل تقريبًا لجميع تطبيقات الرؤية الحاسوبية الحديثة.

نماذج أخرى في المنظومة#

في حين يغطي YOLO26 وRTDETRv2 أحدث ما توصل إليه اكتشاف الأجسام في الوقت الفعلي، قد يفكر المطورون الذين يديرون مسارات عمل قديمة أو يستكشفون منحنيات كفاءة مختلفة في استخدام YOLOv8 للبيئات المؤسسية الراسخة، أو استكشاف بُنى أخرى مثل EfficientDet. ومع ذلك، يظل YOLO26 التوصية الحاسمة لأي مبادرة جديدة.

التعليقات