Ultralytics YOLO27:
Get Started

SAM 3: تقسيم أي شيء باستخدام المفاهيم#

نظرة عامة على تقسيم المفاهيم القابل للتوجيه في SAM 3

SAM 3 (نموذج تقسيم أي شيء 3) هو النموذج الأساسي الذي أطلقته Meta لـ تقسيم المفاهيم القابل للتوجيه (PCS). وبالاستناد إلى SAM 2، يقدّم SAM 3 قدرة جديدة جوهريًا: اكتشاف جميع الحالات لمفهوم مرئي تحدده المطالبات النصية أو أمثلة الصور أو كليهما، وتقسيمها وتتبعها. وعلى خلاف إصدارات SAM السابقة التي تقسّم كائنًا واحدًا لكل مطالبة، يستطيع SAM 3 العثور على كل ظهور لمفهوم في الصور أو مقاطع الفيديو وتقسيمه، بما يتماشى مع أهداف المفردات المفتوحة في تقسيم الحالات الحديث.



شاهد: كيفية استخدام Meta Segment Anything 3 مع Ultralytics | التقسيم بتوجيه نصي على الصور ومقاطع الفيديو

تم دمج SAM 3 بالكامل في الحزمة ultralytics، مع توفير دعم أصلي لتقسيم المفاهيم باستخدام المطالبات النصية ومطالبات أمثلة الصور وتتبع الفيديو. ويدعم النموذج نقطة التحقق الأحدث SAM 3.1 للتنبؤ بالصور.

نظرة عامة#

يحقق SAM 3 تحسنًا في الأداء بمقدار 2× مقارنةً بالأنظمة الحالية في تقسيم المفاهيم القابل للتوجيه، مع الحفاظ على قدرات SAM 2 في التقسيم المرئي التفاعلي وتحسينها. ويتفوق النموذج في التقسيم ذي المفردات المفتوحة، إذ يتيح للمستخدمين تحديد المفاهيم باستخدام عبارات اسمية بسيطة (مثل «حافلة مدرسية صفراء» و«قطة مخططة») أو تقديم صور نموذجية للكائن المستهدف. وتتكامل هذه الإمكانات مع مسارات العمل الجاهزة للإنتاج التي تعتمد على إجراءات التنبؤ والتتبع المبسطة.

أمثلة على تقسيم SAM 3 باستخدام المطالبات النصية

ما تقسيم المفاهيم القابل للتوجيه (PCS)؟#

تستقبل مهمة PCS مطالبة بمفهوم كمدخل، وتُخرج أقنعة تقسيم ذات هويات فريدة لكل حالات الكائنات المطابقة. ويمكن أن تكون مطالبات المفاهيم:

  • نصية: عبارات اسمية بسيطة مثل «تفاحة حمراء» أو «شخص يرتدي قبعة»، على غرار التعلّم دون أمثلة
  • أمثلة صور: مربعات إحاطة حول كائنات نموذجية (إيجابية أو سلبية) للتعميم السريع
  • مجتمعة: النص وأمثلة الصور معًا للتحكم الدقيق

يختلف ذلك عن المطالبات المرئية التقليدية (النقاط والمربعات والأقنعة)، التي تقسّم حالة كائن محددة واحدة فقط، كما اشتهرت بها عائلة SAM الأصلية.

مقاييس الأداء الرئيسية#

المقياسإنجاز SAM 3
AP للأقنعة دون أمثلة على LVIS47.0 (مقابل أفضل نتيجة سابقة 38.5، وتحسن بنسبة +22%)
معيار SA-Coأفضل بمقدار 2× من الأنظمة الحالية
سرعة الاستدلال (GPU من طراز H200)30 ms لكل صورة مع اكتشاف أكثر من 100 كائن
أداء الفيديوشبه آني لنحو ~5 كائنات متزامنة
معيار MOSEv2 VOS60.1 J&F (+25.5% مقارنةً بـ SAM 2.1، و+17% مقارنةً بأفضل نتيجة سابقة)
التحسين التفاعليتحسن +18.6 CGF1 بعد 3 مطالبات بأمثلة
الفجوة عن أداء البشريحقق 88% من الحد الأدنى المقدّر على SA-Co/Gold

للاطلاع على سياق مقاييس النماذج والمفاضلات في بيئات الإنتاج، راجع رؤى تقييم النماذج ومقاييس أداء YOLO.

SAM 3.1#

SAM 3.1، الذي أطلقته Meta في 27 مارس 2026، هو نقطة تحقق جديدة لـ SAM 3 تضيف تعدد الكائنات، وهو نهج للذاكرة المشتركة لتتبع كائنات متعددة في الفيديو. وبدلًا من معالجة كل كائن متتبَّع على حدة، يجمع SAM 3.1 الكائنات في مجموعات ذات سعة ثابتة ويعالجها معًا؛ وتفيد Meta بأن ذلك يحقق تسريعًا بنحو ~7× عند تتبع 128 كائنًا على GPU واحد من طراز H100. ويظل كل من كاشف الصور ورأس المطالبات التفاعلية بالنقاط محافظًا على بنية SAM 3.

قياس الأداءالمقياسSAM 3SAM 3.1
SA-Co/VEval SA-V (الاختبار)cgF130.330.5
SA-Co/VEval YT-Temporal-1B (الاختبار)cgF150.852.9
SA-Co/VEval SmartGlasses (الاختبار)cgF136.436.3
MOSEv1 (التحقق)J&F78.479.6
DAVIS17 (التحقق)J&F92.292.7
SA-V (الاختبار)J&F84.485.1
YTVOS19 (التحقق)G89.789.3
MOSEv2 (التحقق)J&Ḟ60.362.3

تحمّل Ultralytics نقطة التحقق SAM 3.1 (sam3.1_multiplex.pt) في متنبئات الصور SAM 3: SAM("sam3.1_multiplex.pt") لمطالبات النقاط والمربعات، وSAM3SemanticPredictor للمطالبات النصية ومطالبات الأمثلة. ولا يُدعم تتبع الفيديو باستخدام تعدد الكائنات بعد، لذا واصل استخدام sam3.pt مع SAM3VideoPredictor وSAM3VideoSemanticPredictor.

البنية#

يتألف SAM 3 من كاشف ومتعقّب يشتركان في العمود الفقري المرئي لمشفّر الإدراك (PE). ويتجنب هذا التصميم المفصول تعارض المهام، مع إتاحة الكشف على مستوى الصور والتتبع على مستوى الفيديو، عبر واجهة متوافقة مع استخدام Python واستخدام CLI في Ultralytics.

المكونات الأساسية#

  • الكاشف: بنية قائمة على DETR لكشف المفاهيم على مستوى الصور

    • مشفّر نصي لمطالبات العبارات الاسمية
    • مشفّر أمثلة لمطالبات الصور
    • مشفّر دمج لتكييف ميزات الصور وفقًا للمطالبات
    • رأس حضور مبتكر يفصل التعرّف («ما هو؟») عن تحديد الموقع («أين هو؟»)
    • رأس أقنعة لإنشاء أقنعة تقسيم الحالات
  • المتعقّب: تقسيم فيديو قائم على الذاكرة، موروث من SAM 2

    • مشفّر المطالبات، ومفكّك ترميز الأقنعة، ومشفّر الذاكرة
    • بنك ذاكرة لتخزين مظهر الكائن عبر الإطارات
    • إزالة الالتباس الزمني بمساعدة تقنيات مثل مرشح كالمان في إعدادات تعدد الكائنات
  • رمز الحضور: رمز عالمي متعلّم يتنبأ بوجود المفهوم المستهدف في الصورة/الإطار، ما يحسّن الكشف عبر فصل التعرّف عن تحديد الموقع.

مخطط بنية نموذج SAM 3

الابتكارات الرئيسية#

  1. فصل التعرّف عن تحديد الموقع: تتنبأ وحدة رأس الحضور بوجود المفهوم على مستوى الصورة، بينما تركز استعلامات المقترحات على تحديد الموقع فقط، مما يجنب الأهداف المتضاربة.
  2. توحيد مطالبات المفاهيم والمطالبات البصرية: يدعم كلًا من PCS (مطالبات المفاهيم) وPVS (المطالبات البصرية مثل النقرات/المربعات في SAM 2) في نموذج واحد.
  3. تحسين الأمثلة التفاعلي: يمكن للمستخدمين إضافة أمثلة صور إيجابية أو سلبية لتحسين النتائج تدريجيًا، مع تعميم النموذج على الكائنات المشابهة بدلًا من تصحيح الحالات الفردية فحسب.
  4. إزالة الالتباس الزمني: يستخدم درجات اكتشاف masklet وإعادة المطالبة دوريًا للتعامل مع حالات الاحتجاب والمشاهد المزدحمة وإخفاقات التتبع في الفيديو، بما يتماشى مع أفضل ممارسات تقسيم الكائنات الفردية وتتبعها.

مجموعة بيانات SA-Co#

دُرّب SAM 3 على Segment Anything with Concepts (SA-Co)، وهي أكبر مجموعة بيانات للتقسيم وأكثرها تنوعًا لدى Meta حتى الآن، وتتجاوز المعايير الشائعة مثل COCO وLVIS.

بيانات التدريب#

مكوّن مجموعة البياناتالوصفالحجم
SA-Co/HQبيانات صور عالية الجودة مشروحة بشريًا، أُنتجت بواسطة محرك بيانات ذي 4 مراحل5.2M صورة، و4M عبارات اسمية فريدة
SA-Co/SYNمجموعة بيانات اصطناعية وسمها الذكاء الاصطناعي دون تدخل بشري38M عبارة اسمية، و1.4B قناع
SA-Co/EXT15 مجموعة بيانات خارجية أُثرِيت بأمثلة سلبية صعبةيختلف باختلاف المصدر
SA-Co/VIDEOتعليقات توضيحية لمقاطع الفيديو مع تتبع زمني52.5K فيديو، و24.8K عبارة اسمية فريدة

بيانات المعايير#

يحتوي معيار تقييم SA-Co على 214K عبارة فريدة عبر 126K صورة ومقطع فيديو، موفرًا مفاهيم تزيد بأكثر من 50× على المعايير الحالية. ويشمل:

  • SA-Co/Gold: 7 مجالات، مع تعليقات توضيحية ثلاثية لقياس حدود الأداء البشري
  • SA-Co/Silver: 10 مجالات، مع تعليق توضيحي بشري واحد
  • SA-Co/Bronze وSA-Co/Bio: 9 مجموعات بيانات حالية جرى تكييفها لتقسيم المفاهيم
  • SA-Co/VEval: معيار لمقاطع الفيديو يضم 3 مجالات (SA-V وYT-Temporal-1B وSmartGlasses)

ابتكارات محرك البيانات#

يحقق محرك بيانات SAM 3 القابل للتوسع، الذي يدمج الإنسان والنموذج في حلقة العمل، زيادة بمقدار 2× في معدل إنجاز التعليقات التوضيحية عبر:

  1. أدوات شرح مدعومة بالذكاء الاصطناعي: تقترح النماذج القائمة على Llama عبارات اسمية متنوعة، بما فيها أمثلة سلبية صعبة
  2. أدوات تحقق مدعومة بالذكاء الاصطناعي: تتحقق نماذج اللغة الكبيرة متعددة الوسائط، المضبوطة ضبطًا دقيقًا، من جودة الأقنعة واكتمالها بأداء يقارب أداء البشر
  3. التنقيب النشط: يركز الجهد البشري على حالات الإخفاق الصعبة التي يواجه فيها الذكاء الاصطناعي صعوبة
  4. مدفوع بالأنطولوجيا: يستفيد من أنطولوجيا كبيرة تستند إلى Wikidata لتغطية المفاهيم

التثبيت#

ثبّت حزمة ultralytics أو حدّثها:

pip install -U ultralytics
أوزان نموذج SAM 3 مطلوبة

على خلاف نماذج Ultralytics الأخرى، لا تُنزَّل أوزان SAM 3 (sam3.pt) تلقائيًا. يجب أولًا طلب الوصول إلى أوزان النموذج من صفحة نموذج SAM 3 على Hugging Face، ثم تنزيل sam3.pt من تلك الصفحة بعد الموافقة. ضع ملف sam3.pt الذي نزّلته في دليل العمل، أو حدّد المسار الكامل عند تحميل النموذج.

تخضع أوزان SAM 3.1 (sam3.1_multiplex.pt) لنظام الوصول المقيّد نفسه في صفحة نموذج SAM 3.1. مرّر sam3.1_multiplex.pt في أي موضع تستخدم فيه أمثلة الصور أدناه sam3.pt.

`TypeError: 'SimpleTokenizer' object is not callable`

إذا ظهر لك الخطأ أعلاه أثناء التنبؤ، فهذا يعني أن حزمة clip المثبّتة لديك غير صحيحة. ثبّت حزمة clip الصحيحة بتشغيل ما يلي:

pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.git

كيفية استخدام SAM 3: تعدد الاستخدامات في تقسيم المفاهيم#

يدعم SAM 3 مهام تقسيم المفاهيم القابل للمطالبة (PCS) وتقسيم العناصر المرئية القابل للمطالبة (PVS) عبر واجهات مختلفة للمُتنبئ:

المهام والنماذج المدعومة#

نوع المهمةأنواع المطالباتالمخرجات
تقسيم المفاهيم (PCS)النص (عبارات اسمية)، وأمثلة الصوركل الحالات المطابقة للمفهوم
تقسيم العناصر المرئية (PVS)النقاط والمربعات والأقنعةحالة كائن واحدة (بنمط SAM 2)
التحسين التفاعليإضافة الأمثلة أو النقرات أو إزالتها بصورة تكراريةتقسيم محسّن بدقة أعلى

أمثلة على تقسيم المفاهيم#

التقسيم باستخدام المطالبات النصية#

تقسيم المفاهيم باستخدام النص

اعثر على جميع حالات المفهوم وقسّمها باستخدام وصف نصي. تتطلب المطالبات النصية واجهة SAM3SemanticPredictor.

from ultralytics.models.sam import SAM3SemanticPredictor

# ⁨تهيئة المُتنبئ باستخدام الإعدادات⁩
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "model": "sam3.pt",
    "quantize": 16,  # ⁨استخدام FP16 لتسريع الاستدلال⁩
    "save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)

# ⁨تعيين الصورة مرة واحدة لعدة استعلامات⁩
predictor.set_image("path/to/image.jpg")

# ⁨إجراء استعلامات باستخدام مطالبات نصية متعددة⁩
results = predictor(text=["person", "bus", "glasses"])

# ⁨يعمل مع العبارات الوصفية⁩
results = predictor(text=["person with red cloth", "person with blue cloth"])

# ⁨إجراء استعلام باستخدام مفهوم واحد⁩
results = predictor(text=["a person"])

التقسيم باستخدام أمثلة الصور#

التقسيم بالاستناد إلى أمثلة الصور

استخدم المربعات المحيطة كمطالبات بصرية للعثور على جميع الحالات المشابهة. يتطلب ذلك أيضًا SAM3SemanticPredictor لمطابقة المفاهيم.

from ultralytics.models.sam import SAM3SemanticPredictor

# ⁨تهيئة المُتنبئ⁩
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)

# ⁨تعيين الصورة⁩
predictor.set_image("path/to/image.jpg")

# ⁨تقديم أمثلة بمربعات محيطة لتقسيم الكائنات المشابهة⁩
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])

# ⁨استخدام مربعات محيطة متعددة كأمثلة للمفهوم البصري نفسه⁩
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])

الاستدلال المستند إلى الميزات لتحقيق الكفاءة#

إعادة استخدام ميزات الصورة لعدة استعلامات

استخرج ميزات الصورة مرة واحدة وأعِد استخدامها في استعلامات تقسيم متعددة لتحسين الكفاءة.

import cv2

from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors

# ⁨تهيئة المُتنبئات⁩
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)

# ⁨استخراج الميزات من المُتنبئ الأول⁩
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]

# ⁨إعداد المُتنبئ الثاني وإعادة استخدام الميزات⁩
predictor2.setup_model()

# ⁨إجراء الاستدلال باستخدام الميزات المشتركة مع مطالبة نصية⁩
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])

# ⁨إجراء الاستدلال باستخدام الميزات المشتركة مع مطالبة بمربع محيط⁩
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])

# ⁨عرض النتائج بصريًا⁩
if masks is not None:
    masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
    im = cv2.imread(source)
    annotator = Annotator(im, pil=False)
    annotator.masks(masks, [colors(x, True) for x in range(len(masks))])

    cv2.imshow("result", annotator.result())
    cv2.waitKey(0)

تقسيم المفاهيم في الفيديو#

تتبّع المفاهيم عبر الفيديو باستخدام المربعات المحيطة#

تتبّع الفيديو باستخدام المطالبات البصرية

اكتشف حالات الكائنات وتتبّعها عبر إطارات الفيديو باستخدام مطالبات المربعات المحيطة.

from ultralytics.models.sam import SAM3VideoPredictor

# ⁨إنشاء مُتنبئ الفيديو⁩
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)

# ⁨تتبّع الكائنات باستخدام مطالبات المربعات المحيطة⁩
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)

# ⁨معالجة النتائج وعرضها⁩
for r in results:
    r.show()  # ⁨عرض الإطار مع أقنعة التقسيم⁩

تتبّع المفاهيم باستخدام المطالبات النصية#

تتبّع الفيديو باستخدام الاستعلامات الدلالية

تتبّع جميع حالات المفاهيم المحددة بالنص عبر إطارات الفيديو.

from ultralytics.models.sam import SAM3VideoSemanticPredictor

# ⁨تهيئة مُتنبئ الفيديو الدلالي⁩
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "imgsz": 640,
    "model": "sam3.pt",
    "quantize": 16,
    "save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)

# ⁨تتبّع المفاهيم باستخدام المطالبات النصية⁩
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)

# ⁨معالجة النتائج⁩
for r in results:
    r.show()  # ⁨عرض الإطار مع الكائنات المتعقبة⁩

# ⁨بديل: التتبّع باستخدام مطالبات المربعات المحيطة⁩
results = predictor(
    source="path/to/video.mp4",
    bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
    labels=[1, 1],  # ⁨التسميات الإيجابية⁩
    stream=True,
)

المطالبات البصرية (التوافق مع SAM 2)#

يحافظ SAM 3 على توافق كامل مع الإصدارات السابقة فيما يتعلق بالمطالبات البصرية في SAM 2 لتقسيم كائن واحد:

المطالبات البصرية بنمط SAM 2

تعمل واجهة SAM الأساسية تمامًا مثل SAM 2، إذ تقسم المنطقة المحددة بالمطالبات البصرية (النقاط أو المربعات أو الأقنعة) فقط.

from ultralytics import SAM

model = SAM("sam3.pt")

# ⁨مطالبة بنقطة واحدة - تقسّم الكائن عند موقع محدد⁩
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()

# ⁨مطالبة بنقاط متعددة - تقسّم كائنًا واحدًا باستخدام تلميحات نقاط متعددة⁩
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])

# ⁨مطالبة بمربع - تقسّم الكائن داخل مربع إحاطة⁩
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()
المطالبات المرئية مقابل تقسيم المفاهيم

يؤدي استخدام SAM("sam3.pt") مع المطالبات المرئية (النقاط/المربعات/الأقنعة) إلى تقسيم الكائن المحدد فقط في ذلك الموقع، تمامًا كما في SAM 2. لتقسيم جميع حالات المفهوم، استخدم SAM3SemanticPredictor مع مطالبات نصية أو مطالبات بأمثلة ممثلة كما هو موضح أعلاه.

معايير الأداء#

تقسيم الصور#

يحقق SAM 3 نتائج متطورة عبر معايير متعددة، بما في ذلك مجموعات البيانات الواقعية مثل LVIS وCOCO للتقسيم:

قياس الأداءالمقياسSAM 3أفضل نتيجة سابقةالتحسن
LVIS (دون تدريب مسبق)AP للأقنعة47.038.5+22.1%
SA-Co/GoldCGF165.034.3 (OWLv2)+89.5%
COCO (دون تدريب مسبق)AP للمربعات53.552.2 (T-Rex2)+2.5%
ADE-847 (التقسيم الدلالي)mIoU14.79.2 (APE-D)+59.8%
PascalConcept-59mIoU59.458.5 (APE-D)+1.5%
Cityscapes (التقسيم الدلالي)mIoU65.144.2 (APE-D)+47.3%

استكشف خيارات مجموعات البيانات لإجراء تجارب سريعة في مجموعات بيانات Ultralytics.

أداء تقسيم الفيديو#

يُظهر SAM 3 تحسينات كبيرة مقارنةً بـ SAM 2 وبأفضل النماذج السابقة عبر معايير الفيديو مثل DAVIS 2017 وYouTube-VOS:

قياس الأداءالمقياسSAM 3SAM 2.1 Lالتحسن
MOSEv2J&F60.147.9+25.5%
DAVIS 2017J&F92.090.7+1.4%
LVOSv2J&F88.279.6+10.8%
SA-VJ&F84.678.4+7.9%
YTVOS19J&F89.689.3+0.3%

التكيّف باستخدام أمثلة قليلة#

يتفوق SAM 3 في التكيّف مع المجالات الجديدة باستخدام أمثلة قليلة، وهو أمر مهم لسير عمل الذكاء الاصطناعي المرتكز على البيانات:

قياس الأداءAP دون أمثلةAP باستخدام 10 أمثلةأفضل نتيجة سابقة (باستخدام 10 أمثلة)
ODinW1359.971.667.9 (gDino1.5-Pro)
RF100-VL14.335.733.7 (gDino-T)

فعالية التحسين التفاعلي#

يتقارب التلقين القائم على المفاهيم في SAM 3 باستخدام الأمثلة الممثلة بوتيرة أسرع بكثير من التلقين المرئي:

المطالبات المضافةنتيجة CGF1الزيادة مقارنةً باستخدام النص فقطالزيادة مقارنةً بخط الأساس PVS
النص فقط46.4خط الأساسخط الأساس
+مثال ممثل واحد57.6+11.2+6.7
+مثالان ممثلان62.2+15.8+9.7
+3 أمثلة ممثلة65.0+18.6+11.2
+4 أمثلة ممثلة65.7+19.3+11.5 (استقرار الأداء)

دقة عدّ الكائنات#

يوفر SAM 3 عدًّا دقيقًا من خلال تقسيم جميع الحالات، وهو مطلب شائع في عدّ الكائنات:

قياس الأداءالدقةMAEمقارنةً بأفضل نموذج لغوي كبير متعدد الوسائط
CountBench95.6%0.1192.4% (Gemini 2.5)
PixMo-Count87.3%0.2288.8% (Molmo-72B)

مقارنة SAM 3 وSAM 2 وYOLO#

نقارن هنا قدرات SAM 3 مع نماذج SAM 2 وYOLO26. وللكشف والتقسيم في الوقت الفعلي باستخدام مفردات مفتوحة ومن أنواع المطالبات نفسها، راجع YOLOE:

القدرةSAM 3SAM 2YOLO26n-seg
تقسيم المفاهيم✅ جميع الحالات باستخدام النص/الأمثلة الممثلة❌ غير مدعوم❌ غير مدعوم
التقسيم المرئي✅ حالة واحدة (متوافق مع SAM 2)✅ حالة واحدة✅ جميع الحالات
القدرة على التعميم دون تدريب مسبق✅ مفردات مفتوحة✅ مطالبات هندسية❌ مجموعة مغلقة
التحسين التفاعلي✅ أمثلة ممثلة + نقرات✅ نقرات فقط❌ غير مدعوم
تتبّع الفيديو✅ كائنات متعددة مع هوياتها✅ كائنات متعددة✅ كائنات متعددة
AP لأقنعة LVIS (دون تدريب مسبق)47.0غير متاحغير متاح
MOSEv2 J&F60.147.9غير متاح
السرعة (GPU، مللي ثانية/صورة)29218578.4
حجم النموذج3.45 GB162 MB (الأساسي)6.4 MB

قِيست السرعة على NVIDIA RTX PRO 6000 باستخدام torch==2.9.1 وultralytics==8.4.19.

أبرز النقاط:

  • SAM 3: الأفضل لتقسيم المفاهيم باستخدام مفردات مفتوحة، والعثور على جميع حالات مفهوم ما باستخدام مطالبات نصية أو مطالبات بأمثلة ممثلة
  • SAM 2: الأفضل للتقسيم التفاعلي لكائن واحد في الصور ومقاطع الفيديو باستخدام مطالبات هندسية
  • YOLO26: الأفضل للتقسيم عالي السرعة في الوقت الفعلي، مع إمكانية اختيار الاستدلال الشامل دون NMS، وتصديره إلى تنسيقات عديدة لنشره على GPU ووحدات CPU والأجهزة الطرفية

مقارنة SAM بنماذج YOLO#

مقارنة SAM 3 وSAM 2 وSAM وMobileSAM وFastSAM بنماذج تقسيم YOLO من Ultralytics (YOLOv8 وYOLO11 وYOLO26) من حيث الحجم وعدد المعلمات وسرعة الاستدلال على GPU:

النموذجالحجم
(MB)
المعلمات
(M)
السرعة (GPU)
(ms/im)
Meta SAM-b37593.71306
Meta SAM2-b16280.8857
Meta SAM2-t78.138.9668
Meta SAM33450473.62921
MobileSAM40.710.1605
FastSAM-s مع البنية الأساسية لـ YOLOv823.711.855.9
Ultralytics YOLOv8n-seg6.7 (أصغر بـ 515 مرة)3.4 (أقل بـ 139.1 مرة)17.4 (أسرع بـ 167 مرة)
Ultralytics YOLO11n-seg5.9 (أصغر بـ 585 مرة)2.9 (أقل بـ 163.1 مرة)12.6 (أسرع بـ 231 مرة)
Ultralytics YOLO26n-seg6.4 (أصغر بـ 539 مرة)2.7 (أقل بـ 175.2 مرة)8.4 (أسرع بـ 347 مرة)

تُظهر هذه المقارنة الفروق الكبيرة في أحجام النماذج وسرعاتها بين إصدارات SAM ونماذج تقسيم YOLO. وعلى الرغم من أن SAM يوفر إمكانات فريدة للتقسيم التلقائي، فإن نماذج YOLO، ولا سيما YOLOv8n-seg وYOLO11n-seg وYOLO26n-seg، أصغر وأسرع وأكثر كفاءة حسابيًا بدرجة كبيرة.

أُجريت الاختبارات على NVIDIA RTX PRO 6000 بذاكرة VRAM سعتها 96GB باستخدام torch==2.9.1 وultralytics==8.4.19. لإعادة تنفيذ هذا الاختبار:

مثال
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# ⁨أنشئ ملفًا تعريفيًا لـ SAM3 وSAM2-t وSAM2-b وSAM-b وMobileSAM⁩
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# ⁨أنشئ ملفًا تعريفيًا لـ FastSAM-s⁩
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# ⁨أنشئ ملفات تعريف لنماذج YOLO⁩
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    model(ASSETS, nms=False)  # ⁨رأس NMS-free في YOLO26؛ لا إجراء لـ YOLOv8/YOLO11⁩

مقاييس التقييم#

يقدم SAM 3 مقاييس جديدة مصممة لمهمة PCS، تكمل المقاييس المعروفة مثل درجة F1 والإحكام والاستدعاء.

درجة F1 المقيّدة بالتصنيف (CGF1)#

المقياس الأساسي الذي يجمع بين تحديد الموقع والتصنيف:

CGF1 = 100 × pmF1 × IL_MCC

حيث:

  • pmF1 (متوسط F1 الإيجابي): يقيس جودة تحديد الموقع في الأمثلة الإيجابية
  • IL_MCC (معامل ارتباط ماثيوز على مستوى الصورة): يقيس دقة التصنيف الثنائي ("هل المفهوم موجود؟")

لماذا هذه المقاييس؟#

لا تأخذ مقاييس AP التقليدية معايرة الثقة في الحسبان، ما يجعل استخدام النماذج صعبًا عمليًا. ومن خلال تقييم التنبؤات التي تتجاوز ثقتها 0.5 فقط، تفرض مقاييس SAM 3 معايرة جيدة وتحاكي أنماط الاستخدام الواقعية في حلقات التنبؤ والتعقب التفاعلية.

أهم دراسات الاستئصال والاستنتاجات#

تأثير رأس الوجود#

يفصل رأس الوجود التعرّف عن تحديد الموقع، ما يحقق تحسينات كبيرة:

التهيئةCGF1IL_MCCpmF1
من دون الوجود57.60.7774.7
مع الوجود63.30.8277.1

يحقق رأس الوجود زيادة قدرها +5.7 في CGF1 (+9.9%)، ويحسن بالدرجة الأولى قدرة التعرّف (IL_MCC بمقدار +6.5%).

تأثير الأمثلة السلبية الصعبة#

الأمثلة السلبية الصعبة/الصورةCGF1IL_MCCpmF1
031.80.4470.2
544.80.6271.9
3049.20.6872.3

تُعد الأمثلة السلبية الصعبة ضرورية للتعرّف على المفردات المفتوحة، إذ تحسن IL_MCC بنسبة 54.5% (من 0.44 إلى 0.68).

توسيع نطاق بيانات التدريب#

مصادر البياناتCGF1IL_MCCpmF1
خارجية فقط30.90.4666.3
خارجية + اصطناعية39.70.5770.6
خارجية + عالية الجودة51.80.7173.2
المصادر الثلاثة كلها54.30.7473.5

توفر التعليقات التوضيحية البشرية عالية الجودة مكاسب كبيرة مقارنة بالبيانات الاصطناعية أو الخارجية وحدها. للاطلاع على معلومات أساسية حول ممارسات جودة البيانات، راجع جمع البيانات والتعليق التوضيحي.

التطبيقات#

تتيح قدرة SAM 3 على تقسيم المفاهيم حالات استخدام جديدة:

  • إدارة المحتوى: العثور على جميع حالات أنواع محتوى محددة عبر مكتبات الوسائط
  • التجارة الإلكترونية: تقسيم جميع المنتجات من نوع معين في صور الكتالوج، مع دعم التعليق التوضيحي التلقائي
  • التصوير الطبي: تحديد جميع مواضع أنواع أنسجة أو حالات شذوذ محددة
  • الأنظمة الذاتية: تعقّب جميع حالات إشارات المرور أو المشاة أو المركبات حسب الفئة
  • تحليلات الفيديو: إحصاء جميع الأشخاص الذين يرتدون ملابس محددة أو يؤدون أفعالًا معينة وتعقّبهم
  • التعليق التوضيحي لمجموعات البيانات: وضع تعليقات توضيحية بسرعة على جميع حالات فئات الكائنات النادرة
  • البحث العلمي: قياس جميع العينات التي تستوفي معايير محددة وتحليلها

وكيل SAM 3: استدلال لغوي موسّع#

يمكن دمج SAM 3 مع نماذج اللغة الكبيرة متعددة الوسائط (MLLMs) لمعالجة الاستعلامات المعقدة التي تتطلب الاستدلال، على غرار أنظمة المفردات المفتوحة مثل OWLv2 وT-Rex.

الأداء في مهام الاستدلال#

قياس الأداءالمقياسوكيل SAM 3 (Gemini 2.5 Pro)أفضل نتيجة سابقة
ReasonSeg (التحقق)gIoU76.065.0 (أحدث النتائج)
ReasonSeg (الاختبار)gIoU73.861.3 (أحدث النتائج)
OmniLabel (التحقق)AP46.736.5 (REAL)
RefCOCO+Acc91.289.3 (LISA)

أمثلة على الاستعلامات المعقدة#

يمكن لوكيل SAM 3 معالجة الاستعلامات التي تتطلب الاستدلال:

  • "أشخاص يجلسون لكنهم لا يمسكون علبة هدايا بأيديهم"
  • "الكلب الأقرب إلى الكاميرا الذي لا يرتدي طوقًا"
  • "أجسام حمراء أكبر من يد الشخص"

يقترح نموذج MLLM على SAM 3 استعلامات بسيطة بصيغ اسمية، ويحلل الأقنعة المُعادة، ويكرر العملية حتى يصل إلى النتيجة المطلوبة.

القيود#

على الرغم من أن SAM 3 يمثل تقدمًا كبيرًا، فإنه ينطوي على بعض القيود:

  • تعقيد العبارات: يناسب العبارات الاسمية البسيطة على أفضل وجه؛ وقد تتطلب العبارات الإحالية الطويلة أو الاستدلال المعقد دمج نموذج MLLM
  • التعامل مع الالتباس: تظل بعض المفاهيم ملتبسة بطبيعتها (مثل "نافذة صغيرة" و"غرفة مريحة")
  • المتطلبات الحسابية: أكبر حجمًا وأبطأ من نماذج الكشف المتخصصة مثل YOLO
  • نطاق المفردات: يركز على المفاهيم المرئية الأولية؛ ويظل الاستدلال التركيبي محدودًا دون مساعدة نموذج MLLM
  • المفاهيم النادرة: قد يتراجع الأداء في المفاهيم النادرة للغاية أو الدقيقة التي لا تمثلها بيانات التدريب تمثيلًا جيدًا

الاستشهاد#

اقتباس
@misc{carion2025sam3,
  title         = {SAM 3: Segment Anything with Concepts},
  author        = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  year          = {2025},
  eprint        = {2511.16719},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2511.16719}
}

الأسئلة الشائعة#

  • أطلقت Meta نموذج SAM 3 في 19 نوفمبر 2025، وأُدمج بالكامل في حزمة ultralytics، مع دعم وضع التنبؤ ووضع التعقب.

  • نعم! دُمج SAM 3 بالكامل في حزمة Ultralytics Python، بما يشمل تقسيم المفاهيم والمطالبات المرئية بأسلوب SAM 2 وتتبع كائنات متعددة في الفيديو. كما يدعم SAM 3 وSAM 3.1 ميزة التعليق التوضيحي الذكي على منصة Ultralytics، حيث يكون SAM 3.1 هو النموذج الافتراضي، ويمكنك إضافة تعليقات توضيحية إلى الصور ببضع نقرات فقط.

  • نعم، للتنبؤ بالصور. حمّل sam3.1_multiplex.pt أينما تستخدم أمثلة الصور في هذه الصفحة sam3.pt: استخدم SAM("sam3.1_multiplex.pt") لمطالبات النقاط والمربعات، وSAM3SemanticPredictor لمطالبات النصوص والأمثلة النموذجية. لا يُدعم تتبع الفيديو باستخدام Object Multiplex بعد، لذا واصل استخدام sam3.pt مع متنبئات الفيديو. راجع SAM 3.1 للاطلاع على معايير Meta.

  • PCS مهمة جديدة قدمها SAM 3، وهي تقسّم جميع الحالات لمفهوم مرئي في صورة أو فيديو. وعلى خلاف التقسيم التقليدي الذي يستهدف حالة كائن محددة، يعثر PCS على كل ظهور لفئة ما. على سبيل المثال:

    • مطالبة نصية: "حافلة مدرسية صفراء" ← تقسّم جميع الحافلات المدرسية الصفراء في المشهد
    • مثال صوري: مربع حول كلب واحد → تقسيم جميع الكلاب في الصورة
    • مجتمعة: «قط مخطط» + مربع المثال → تقسيم جميع القطط المخططة المطابقة للمثال

    اطّلع على معلومات أساسية ذات صلة حول اكتشاف الكائنات وتقسيم الكائنات الفردية.

  • الميزةSAM 2SAM 3
    المهمةكائن واحد لكل مطالبةجميع حالات المفهوم
    أنواع المطالباتالنقاط والمربعات والأقنعة+ عبارات نصية، أمثلة صورية
    قدرات الكشفيتطلب كاشفًا خارجيًاكاشف مدمج بمفردات مفتوحة
    التعرّفيعتمد على الهندسة فقطالتعرّف النصي والبصري
    البنيةمتعقّب فقطكاشف + متعقّب مع رأس للحضور
    الأداء دون تدريب مسبقلا ينطبق (يتطلب مطالبات بصرية)47.0 AP على LVIS، وأداء أفضل بمرتين على SA-Co
    التحسين التفاعليالنقرات فقطالنقرات + التعميم انطلاقًا من المثال

    يحافظ SAM 3 على التوافق العكسي مع المطالبات البصرية في SAM 2، مع إضافة قدرات قائمة على المفاهيم.

  • يُدرَّب SAM 3 على مجموعة بيانات Segment Anything with Concepts (SA-Co):

    بيانات التدريب:

    • 5.2M صورة تضم 4M عبارة اسمية فريدة (SA-Co/HQ) - تعليقات توضيحية بشرية عالية الجودة
    • 52.5K مقطع فيديو تضم 24.8K عبارة اسمية فريدة (SA-Co/VIDEO)
    • 1.4B قناعًا اصطناعيًا عبر 38M عبارة اسمية (SA-Co/SYN)
    • 15 مجموعة بيانات خارجية مُثرَاة بأمثلة سلبية صعبة (SA-Co/EXT)

    بيانات المعايير:

    • 214K مفهومًا فريدًا عبر 126K صورة/مقطع فيديو
    • مفاهيم أكثر بـ50× من المعايير الحالية (مثلًا، يضم LVIS نحو ~4K مفهوم)
    • تعليقات توضيحية ثلاثية على SA-Co/Gold لقياس حدود الأداء البشري

    يتيح هذا الحجم الهائل والتنوع الواسع لـSAM 3 تعميمًا صفريًا فائقًا على المفاهيم ذات المفردات المفتوحة.

  • يخدم SAM 3 وYOLO26 حالات استخدام مختلفة:

    مزايا SAM 3:

    • مفردات مفتوحة: يقسّم أي مفهوم باستخدام مطالبات نصية دون تدريب
    • دون تدريب مسبق: يعمل فورًا على الفئات الجديدة
    • تفاعلي: يُحسّن التنقيح القائم على الأمثلة التعميم على الكائنات المشابهة
    • قائم على المفاهيم: يعثر تلقائيًا على جميع حالات الفئة
    • الدقة: 47.0 AP في تقسيم الكائنات الفردية دون تدريب مسبق على LVIS

    مزايا YOLO26:

    • السرعة: استدلال أسرع بفوارق كبيرة، مع رأس شامل اختياري لا يستخدم NMS
    • الكفاءة: نماذج أصغر بـ539× (6.4MB مقابل 3.45GB)
    • ملائم للموارد المحدودة: يعمل على الأجهزة الطرفية والهواتف المحمولة
    • آني: مُحسَّن للنشر في بيئات الإنتاج

    التوصية:

    • استخدم SAM 3 للتقسيم المرن ذي المفردات المفتوحة عندما تحتاج إلى العثور على جميع حالات المفاهيم الموصوفة بالنص أو الأمثلة
    • استخدم YOLO26 للنشر الإنتاجي عالي السرعة عندما تكون الفئات معروفة مسبقًا
    • استخدم SAM 2 لتقسيم كائن واحد تفاعليًا باستخدام مطالبات هندسية
  • صُمم SAM 3 للتعامل مع العبارات الاسمية البسيطة (مثل «تفاحة حمراء» و«شخص يرتدي قبعة»). أما الاستعلامات المعقدة التي تتطلب استدلالًا، فيمكن التعامل معها بدمج SAM 3 مع نموذج لغوي كبير متعدد الوسائط (MLLM) ضمن SAM 3 Agent:

    استعلامات بسيطة (SAM 3 الأصلي):

    • «حافلة مدرسية صفراء»
    • «قط مخطط»
    • «شخص يرتدي قبعة حمراء»

    استعلامات معقدة (SAM 3 Agent مع MLLM):

    • «أشخاص جالسون لكنهم لا يحملون صندوق هدايا»
    • «الكلب الأقرب إلى الكاميرا من دون طوق»
    • "أجسام حمراء أكبر من يد الشخص"

    يحقق SAM 3 Agent 76.0 gIoU على مجموعة التحقق من ReasonSeg (مقابل أفضل نتيجة سابقة بلغت 65.0، بتحسن قدره +16.9%)، وذلك بدمج قدرات التقسيم في SAM 3 مع قدرات الاستدلال في MLLM.

  • على معيار SA-Co/Gold الذي يتضمن تعليقات توضيحية بشرية ثلاثية:

    • الحد الأدنى البشري: 74.2 CGF1 (المعلّق الأكثر تحفظًا)
    • أداء SAM 3: 65.0 CGF1
    • الإنجاز: 88% من الحد الأدنى البشري المقدّر
    • الحد الأعلى البشري: 81.4 CGF1 (المعلّق الأكثر تساهلًا)

    يحقق SAM 3 أداءً قويًا يقترب من دقة البشر في تقسيم المفاهيم ذات المفردات المفتوحة، وتتركز الفجوة أساسًا في المفاهيم الملتبسة أو الذاتية (مثل «نافذة صغيرة» و«غرفة مريحة»).

التعليقات