رؤية YOLO 2026:

مقارنة بين YOLO11 و RTDETRv2#

توسع مشهد رؤية الحاسوب بسرعة، مما وفر للمطورين عدداً لا يحصى من الخيارات لبناء تطبيقات قوية تعتمد على الرؤية. وفي مجال اكتشاف الكائنات في الوقت الفعلي، أصبحت المناقشة بين الشبكات العصبية التلافيفية (CNNs) ومحولات الرؤية (ViTs) أكثر بروزاً من أي وقت مضى. تتعمق هذه المقارنة التقنية في بنيتين رائدتين: YOLO11، التي تمثل ذروة أطر عمل CNN المحسنة للغاية، و RTDETRv2، وهي إصدار قوي من عائلة Detection Transformer.

من خلال تحليل بنياتها، ومقاييس أَدائها، وسيناريوهات نشرها المثالية، يهدف هذا الدليل إلى مساعدة مهندسي التعلم الآلي في اتخاذ قرارات مستنيرة. وفي حين يدفع كلا النموذجين حدود الدقة، فإن نماذج Ultralytics YOLO توفر عادةً توازناً فائقاً بين السرعة، ودعم النظام البيئي، وسهولة الاستخدام للإنتاج في العالم الحقيقي.

YOLO11: المعيار القياسي لتعدد الاستخدامات في العالم الحقيقي#

تم تقديم YOLO11 بواسطة Ultralytics، وهو يرتكز على سنوات من البحث الأساسي لتقديم نموذج يتسم بالسرعة، والدقة، والتنوع الهائل. وهو مصمم هندسياً للتعامل بسلاسة مع object detection، وinstance segmentation، وimage classification، وpose estimation، واستخراج oriented bounding box (OBB) بشكل أصلي.

تعرف على المزيد حول YOLO11

المعمارية ونقاط القوة#

يتميز YOLO11 بهيكل CNN محسّن وأهرامات ميزات مكانية متقدمة، مما يجعله فعالاً بشكل استثنائي في استهلاك الموارد. وهو يزدهر في البيئات ذات القيود الصارمة على الأجهزة، مما يوفر بصمة ذاكرة ضئيلة أثناء التدريب والاستدلال. توفر Ultralytics Platform دعماً أصلياً لـ YOLO11، مما يتيح مراقبة مبسطة للنماذج، وتعليق البيانات، والتدريب السحابي دون الحاجة إلى دمج أدوات MLOps متباينة.

بالنسبة للمطورين الذين يستهدفون edge computing، يتميز YOLO11 بزمن انتقال منخفض للغاية. تتيح له طبيعته خفيفة الوزن العمل بكفاءة على أجهزة تتراوح من Raspberry Pis إلى الهواتف المحمولة الاستهلاكية، مما يجعله معياراً للتجارة الذكية، وmanufacturing quality control، وإدارة المرور الآلية.

RTDETRv2: محولات الوقت الفعلي من Baidu#

يمثل RTDETRv2 (محول اكتشاف الوقت الفعلي الإصدار 2) جهود Baidu لجعل البنى القائمة على المحولات قابلة للتطبيق في مهام الوقت الفعلي. وهو يعتمد على RT-DETR الأصلي من خلال دمج نهج "bag-of-freebies" لتحسين دقة خط الأساس دون زيادة زمن استجابة الاستدلال.

تعرف على المزيد حول RTDETR

المعمارية ونقاط القوة#

على عكس شبكات CNN التقليدية، يستخدم RTDETRv2 بنية مشفر-فك تشفير (encoder-decoder) مع آليات الانتباه الذاتي، مما يسمح له بالتقاط السياق العالمي عبر الصورة. وهذا مفيد بشكل خاص في المشاهد المزدحمة حيث تتكرر عمليات الانسداد. يلغي RTDETRv2 الحاجة إلى كبح غير الحد الأقصى (NMS) في المعالجة اللاحقة، ويعتمد بدلاً من ذلك على مطابقة المجرية (Hungarian matching) أثناء التدريب للمطابقة الثنائية الفردية.

ومع ذلك، تشتهر نماذج المحولات بشراهتها لـ VRAM and CUDA memory. غالباً ما يتطلب تدريب RTDETRv2 من الصفر أو الضبط الدقيق على مجموعات بيانات مخصصة مجموعات وحدة معالجة رسومية (GPU) متطورة وعالية المستوى، وهو ما يمكن أن يمثل عائقاً للفرق المرنة الأصغر مقارنة ببصمة التدريب خفيفة الوزن لنماذج Ultralytics.

تحليل الأداء والمقاييس#

عند تقييم هذه النماذج على COCO dataset القياسي، نلاحظ مقايضات واضحة بين المعلمات، وFLOPs، والدقة الأولية.

النموذجالحجم
(بكسل)
mAPval
50-95
السرعة
CPU ONNX
(ms)
السرعة
T4 TensorRT10
(ms)
المعلمات
(M)
FLOPs
(B)
YOLO11n64039.556.11.52.66.5
YOLO11s64047.090.02.59.421.5
YOLO11m64051.5183.24.720.168.0
YOLO11l64053.4238.66.225.386.9
YOLO11x64054.7462.811.356.9194.9
RTDETRv2-s64048.1-5.032060
RTDETRv2-m64051.9-7.5136100
RTDETRv2-l64053.4-9.7642136
RTDETRv2-x64054.3-15.0376259

تحليل النتائج#

كما يظهر في الجدول، يوفر YOLO11 نسبة أداء إلى حجم مذهلة. يحقق YOLO11x قيمة mAPval أعلى (54.7) مقارنة بـ RTDETRv2-x (54.3)، بينما يستخدم عدداً أقل بكثير من المعلمات (56.9 مليون مقابل 76 مليون) وعدد أقل بكثير من عمليات FLOPs الحسابية (194.9 مليار مقابل 259 مليار).

علاوة على ذلك، فإن سرعات الاستدلال لـ YOLO11 على T4 TensorRT سريعة بشكل استثنائي. يكمل YOLO11s الاستدلال في 2.5 مللي ثانية فقط، بينما يستغرق أصغر نموذج RTDETRv2-s ما مقداره 5.03 مللي ثانية. هذا يجعل YOLO11 الخيار القاطع لتدفقات تحليل الفيديو عالية السرعة وفي الوقت الفعلي حيث يكون وقت معالجة الإطارات هو الاختناق الأساسي.

تكلفة المحولات

بينما يحقق RTDETRv2 دقة ممتازة من خلال طبقات الانتباه الخاصة به، فإن هذه الآليات تتوسع تربيعياً مع دقة الصورة، مما يؤدي إلى زيادة استهلاك VRAM أثناء التدريب والاستدلال. يتجاوز YOLO11 هذا من خلال كتله التلافيفية فائقة الكفاءة.

نظام التدريب البيئي وسهولة الاستخدام#

تكمن الميزة الأساسية لتبني نموذج Ultralytics في النظام البيئي المحيط. غالباً ما يتضمن تدريب RTDETRv2 التنقل في مستودعات معقدة على مستوى البحث، وتعديل أوزان فقدان المطابقة الثنائية المعقدة، وإدارة حمل ذاكرة كبير.

على العكس من ذلك، تركز Ultralytics بشكل كبير على تجربة المطورين. تعمل واجهة برمجة التطبيقات Python الموحدة على تجريد تعليمة النمط المتكرر، والتكامل بسلاسة مع أدوات مثل Weights & Biases لـ experiment tracking، والتعامل مع تحسينات البيانات تلقائياً.

إليك مدى بساطة تدريب وتصدير نموذج باستخدام حزمة ultralytics:

from ultralytics import YOLO

# Initialize YOLO11 model with pre-trained weights
model = YOLO("yolo11n.pt")

# Train the model efficiently on a local GPU or cloud instance
train_results = model.train(
    data="coco8.yaml",
    epochs=100,
    imgsz=640,
    device=0,  # Utilize CUDA GPU
)

# Export the trained model to ONNX for widespread deployment
export_path = model.export(format="onnx")

بمجرد التدريب، يتطلب تصدير نموذج YOLO11 إلى تنسيقات مثل ONNX، أو OpenVINO، أو CoreML أمراً واحداً فقط، مما يضمن قدرة خط أنابيب الرؤية لديك على التوسع بسلاسة عبر خلفيات الأجهزة المختلفة.

القدرات متعددة المهام

تذكر أنه بينما يركز RTDETRv2 حصرياً على اكتشاف صندوق الإحاطة، فإن بنية YOLO11 تدعم أصلاً pose estimation وinstance segmentation، مما يسمح لك بدمج مهام رؤية متعددة في عائلة نموذج واحدة.

حالات الاستخدام والتوصيات#

يعتمد الاختيار بين YOLO11 و RT-DETR على متطلبات مشروعك المحددة، وقيود النشر، وتفضيلات النظام البيئي.

متى تختار YOLO11#

يعد YOLO11 خياراً قوياً لـ:

  • نشر الحافة الإنتاجية: التطبيقات التجارية على أجهزة مثل Raspberry Pi أو NVIDIA Jetson حيث تكون موثوقية الصيانة النشطة أمراً بالغ الأهمية.
  • تطبيقات الرؤية متعددة المهام: المشاريع التي تتطلب الكشف، والتجزئة، وتقدير الوضعية، وOBB ضمن إطار عمل واحد موحد.
  • النماذج الأولية والنشر السريع: الفرق التي تحتاج إلى الانتقال بسرعة من جمع البيانات إلى الإنتاج باستخدام Ultralytics Python API المبسط.

متى تختار RT-DETR#

يوصى بـ RT-DETR لـ:

  • أبحاث الاكتشاف القائمة على Transformer: المشاريع التي تستكشف آليات الانتباه وهياكل transformer لاكتشاف الكائنات بنهاية واحدة دون NMS.
  • سيناريوهات الدقة العالية مع زمن انتقال مرن: التطبيقات التي تكون فيها دقة الاكتشاف هي الأولوية القصوى ويكون زمن انتقال الاستنتاج الأعلى قليلاً مقبولاً.
  • اكتشاف الكائنات الكبيرة: المشاهد التي تحتوي بشكل أساسي على كائنات متوسطة إلى كبيرة حيث توفر آلية الانتباه العالمي للمحولات ميزة طبيعية.

متى تختار Ultralytics (YOLO26)#

بالنسبة لمعظم المشاريع الجديدة، يقدم Ultralytics YOLO26 أفضل مزيج من الأداء وتجربة المطورين:

  • نشر الحافة الخالي من NMS: التطبيقات التي تتطلب استنتاجاً متسقاً ومنخفض زمن الانتقال دون تعقيدات معالجة ما بعد المعالجة باستخدام كبت غير الأقصى.
  • بيئات وحدة المعالجة المركزية (CPU) فقط: الأجهزة التي لا تحتوي على تسريع مخصص بوحدة معالجة الرسوميات (GPU)، حيث توفر سرعة استنتاج CPU أسرع بنسبة تصل إلى 43% في YOLO26 ميزة حاسمة.
  • الكشف عن الأشياء الصغيرة: السيناريوهات الصعبة مثل صور الطائرات بدون طيار الجوية أو تحليل مستشعرات إنترنت الأشياء (IoT) حيث تعمل ProgLoss و STAL على تعزيز الدقة بشكل كبير على الأشياء الدقيقة.

نظرة إلى المستقبل: قوة YOLO26#

بينما يمثل YOLO11 خيار إنتاج ممتازاً، يجب على الفرق التي تبحث عن أحدث ما توصلت إليه التكنولوجيا اعتبار YOLO26 بقوة. تم إطلاق YOLO26 في يناير 2026، وهو يسد الفجوة المعمارية من خلال دمج تصميم End-to-End NMS-Free Design (الذي تم ابتكاره لأول مرة في YOLOv10) مباشرة في جوهره، مما يؤدي إلى القضاء تماماً على زمن انتقال المعالجة اللاحقة وتعقيد منطق النشر.

يقدم YOLO26 أيضاً العديد من الميزات الثورية:

  • محسن MuSGD: مستوحى من تقنيات تدريب نماذج اللغة الكبيرة (LLM) الخاصة بـ Moonshot AI's Kimi K2، يضمن هذا الهجين من SGD و Muon تدريباً مستقراً بشكل لا يصدق وتقارباً أسرع بشكل كبير.
  • إزالة DFL: تم إزالة Distribution Focal Loss لعملية تصدير أنظف وأبسط، مما يحسن بشكل كبير من توافق أجهزة الحافة منخفضة الطاقة.
  • ProgLoss + STAL: تحقق وظائف الخسارة المتقدمة هذه تحسينات ملحوظة في التعرف على الكائنات الصغيرة، وهو متطلب حاسم لمراقبة الطائرات بدون طيار، وagricultural monitoring، وأجهزة استشعار إنترنت الأشياء الطرفية.
  • أسرع بنسبة تصل إلى 43% في استدلال CPU: بالنسبة لعمليات النشر التي تفتقر إلى وحدات GPU مخصصة، تم تحسين YOLO26 خصيصاً لتنفيذ CPU، مما يتفوق بشكل كبير على الأجيال السابقة.

تعرف على المزيد حول YOLO26

بالنسبة لأولئك المهتمين باكتشاف نطاق أوسع من البنيات، توفر وثائق Ultralytics أيضاً رؤى حول YOLOv8، وYOLOv5 المستخدم على نطاق واسع، والنماذج المتخصصة مثل YOLO-World لتطبيقات الكشف عن المفردات المفتوحة. في النهاية، وسواء أكان ذلك إعطاء الأولوية للاستقرار المثبت لـ YOLO11 أم ابتكارات YOLO26 الخارقة، فإن النظام البيئي Ultralytics يقدم أدوات لا مثيل لها لإحياء حلول الرؤية الحاسوبية الخاصة بك.

التعليقات