SAM 3: تقسيم أي شيء باستخدام المفاهيم#

SAM 3 (نموذج تقسيم أي شيء 3) هو نموذج Meta الأساسي المُطلَق لـتقسيم المفاهيم القابل للمطالبة (PCS). واستنادًا إلى SAM 2، يقدّم SAM 3 قدرة جديدة جوهريًا: اكتشاف جميع مثيلات مفهوم مرئي تحدده مطالبات نصية أو أمثلة مصوّرة أو كليهما، وتقسيمها وتتبعها. وعلى خلاف إصدارات SAM السابقة التي تقسّم كائنًا واحدًا لكل مطالبة، يستطيع SAM 3 العثور على كل ظهور لمفهوم وتقسيمه أينما ظهر في الصور أو مقاطع الفيديو، بما يتوافق مع أهداف المفردات المفتوحة في تقسيم المثيلات الحديث.
Watch: How to Use Meta Segment Anything 3 with Ultralytics | Text-Prompt Segmentation on Images & Videos
يقنت نموذج SAM 3 بشكل كامل في حزمة ultralytics، مما يوفّر دعمًا أصليًا لتجزئة المفاهيم باستخدام موجهات النصوص، وموجهات أمثلة الصور، وتتبع الفيديو. يُعد الإصدار الأحدث SAM 3.1 مدعومًا للتنبؤ بالصور.
نظرة عامة#
يحقق SAM 3 تحسنًا بمقدار الضعف مقارنةً بالأنظمة الحالية في تقسيم المفاهيم القابل للمطالبة، مع الحفاظ على إمكانات SAM 2 للتقسيم البصري التفاعلي وتحسينها. ويتفوق النموذج في التقسيم ذي المفردات المفتوحة، ما يتيح للمستخدمين تحديد المفاهيم باستخدام عبارات اسمية بسيطة (مثل "حافلة مدرسية صفراء" و"قطة مخططة") أو تقديم صور أمثلة للكائن المستهدف. وتكمّل هذه الإمكانات مسارات العمل الجاهزة للإنتاج التي تعتمد على سيرَي التنبؤ والتتبع المبسّطين.

ما تقسيم المفاهيم القابل للمطالبة (PCS)؟#
تأخذ مهمة PCS مطالبة مفهوم كمدخل، وتعيد أقنعة تقسيم ذات هويات فريدة لجميع مثيلات الكائنات المطابقة. ويمكن أن تكون مطالبات المفاهيم:
- النص: عبارات اسمية بسيطة مثل "تفاحة حمراء" أو "شخص يرتدي قبعة"، على غرار التعلّم من دون أمثلة
- الأمثلة المصوّرة: مربعات إحاطة حول كائنات نموذجية (إيجابية أو سلبية) للتعميم السريع
- مُجمّعة: النص والأمثلة المصوّرة معًا لتحقيق تحكم دقيق
يختلف هذا عن المطالبات البصرية التقليدية (النقاط والمربعات والأقنعة) التي تقسّم مثيل كائن محددًا واحدًا فقط، كما اشتهرت به عائلة SAM الأصلية.
مقاييس الأداء الرئيسية#
| المقياس | إنجاز SAM 3 |
|---|---|
| Mask AP الصفري اللقطات على LVIS | 47.0 (مقابل أفضل نتيجة سابقة 38.5، بتحسن قدره +22%) |
| المعيار SA-Co | أفضل بمقدار الضعف من الأنظمة الحالية |
| سرعة الاستدلال (وحدة معالجة الرسومات H200) | 30 مللي ثانية لكل صورة مع اكتشاف أكثر من 100 كائن |
| أداء الفيديو | قريب من الزمن الحقيقي لنحو ~5 كائنات متزامنة |
| معيار MOSEv2 VOS | 60.1 J&F (بزيادة +25.5% على SAM 2.1 و+17% على أفضل نتيجة سابقة) |
| التحسين التفاعلي | تحسن قدره +18.6 CGF1 بعد 3 مطالبات بأمثلة |
| الفجوة عن أداء البشر | يحقق 88% من الحد الأدنى المقدّر على SA-Co/Gold |
للاطلاع على سياق مقاييس النماذج والمفاضلات في بيئات الإنتاج، راجع رؤى تقييم النماذج ومقاييس أداء YOLO.
SAM 3.1#
يُعد نموذج SAM 3.1، الذي أُصدر بواسطة شركة Meta في 27 مارس 2026، نقطة تحقق جديدة لنموذج SAM 3 تضيف ميزة Object Multiplex، وهي نهج ذاكرة مشترك لتتبع الكائنات المتعددة في الفيديو. فبدلاً من معالجة كل كيفية أو كائن متتبع بشكل مستقل، يقوم نموذج SAM 3.1 بتجميع الكائنات في حاويات ذات سعة ثابتة ومعالجتها بشكل مشترَك، وهو ما تقريره شركة Meta على أنه تسريع بمقدار ~7 أضعاف عند 128 كائنًا على وحدة معالجة رسومية H100 واحدة. يحافظ كاشف الصور ورأس موجه النقطة التفاعلي على بنية نموذج SAM 3.
| المعيار | المقياس | SAM 3 | SAM 3.1 |
|---|---|---|---|
| SA-Co/VEval SA-V (test) | cgF1 | 30.3 | 30.5 |
| SA-Co/VEval YT-Temporal-1B (test) | cgF1 | 50.8 | 52.9 |
| SA-Co/VEval SmartGlasses (test) | cgF1 | 36.4 | 36.3 |
| MOSEv1 (val) | J&F | 78.4 | 79.6 |
| DAVIS17 (val) | J&F | 92.2 | 92.7 |
| SA-V (test) | J&F | 84.4 | 85.1 |
| YTVOS19 (val) | G | 89.7 | 89.3 |
| MOSEv2 (val) | J&Ḟ | 60.3 | 62.3 |
تقوم Ultralytics بتحميل نقطة تحقق نموذج SAM 3.1 (sam3.1_multiplex.pt) في مُتنبئات صور SAM 3: SAM("sam3.1_multiplex.pt") لموجهات النقاط والصناديق، وSAM3SemanticPredictor لموجهات النصوص والأمثلة. لا يُدعم تتبع فيديو Object Multiplex حتى الآن، لذا استمر في استخدام sam3.pt مع SAM3VideoPredictor وSAM3VideoSemanticPredictor.
البنية#
يتكوّن SAM 3 من كاشف ومتتبّع يشتركان في العمود الفقري للرؤية الخاص بمشفّر الإدراك (PE). ويتجنب هذا التصميم المفصول تعارضات المهام، مع تمكين كل من الاكتشاف على مستوى الصورة والتتبع على مستوى الفيديو، وبواجهة متوافقة مع استخدام Python واستخدام CLI في Ultralytics.
المكوّنات الأساسية#
-
الكاشف: بنية قائمة على DETR لاكتشاف المفاهيم على مستوى الصورة
- مشفّر نصي لمطالبات العبارات الاسمية
- مشفّر أمثلة للمطالبات المستندة إلى الصور
- مشفّر دمج لتهيئة ميزات الصورة وفقًا للمطالبات
- رأس حضور جديد يفصل بين التعرّف ("ماذا") وتحديد الموقع ("أين")
- رأس أقنعة لتوليد أقنعة تقسيم المثيلات
-
المتتبّع: تقسيم فيديو قائم على الذاكرة، موروث من SAM 2
- مشفّر المطالبة، وفكّ ترميز القناع، ومشفّر الذاكرة
- بنك ذاكرة لتخزين مظهر الكائن عبر الإطارات
- إزالة الالتباس الزمني بمساعدة تقنيات مثل مرشح Kalman في إعدادات متعددة الكائنات
-
رمز الحضور: رمز عام متعلَّم يتنبأ بما إذا كان المفهوم المستهدف موجودًا في الصورة/الإطار، ما يحسن الاكتشاف عبر فصل التعرّف عن تحديد الموقع.

الابتكارات الرئيسية#
- فصل التعرّف عن تحديد الموقع: يتنبأ رأس الحضور بوجود المفهوم على نحو عام، بينما تركز استعلامات المقترحات على تحديد الموقع فقط، ما يتجنب الأهداف المتعارضة.
- توحيد مطالبات المفاهيم والمطالبات البصرية: يدعم كلًا من PCS (مطالبات المفاهيم) وPVS (المطالبات البصرية مثل النقرات/المربعات في SAM 2) في نموذج واحد.
- التحسين التفاعلي باستخدام الأمثلة: يمكن للمستخدمين إضافة أمثلة مصوّرة إيجابية أو سلبية لتحسين النتائج تكراريًا، مع تعميم النموذج على كائنات مماثلة بدلًا من تصحيح المثيلات الفردية فحسب.
- إزالة الالتباس الزمني: يستخدم درجات اكتشاف masklet وإعادة المطالبة دوريًا للتعامل مع الحجب والمشاهد المزدحمة وفشل التتبع في الفيديو، بما يتوافق مع أفضل ممارسات تقسيم المثيلات وتتبعها.
مجموعة بيانات SA-Co#
يُدرَّب SAM 3 على Segment Anything with Concepts (SA-Co)، وهي أكبر مجموعة بيانات لتقسيم الصور وأكثرها تنوعًا لدى Meta حتى الآن، وتتجاوز المعايير الشائعة مثل COCO وLVIS.
بيانات التدريب#
| مكوّن مجموعة البيانات | الوصف | الحجم |
|---|---|---|
| SA-Co/HQ | بيانات صور عالية الجودة مشروحة بشريًا من محرك بيانات ذي 4 مراحل | 5.2 مليون صورة، و4 ملايين عبارة اسمية فريدة |
| SA-Co/SYN | مجموعة بيانات اصطناعية وُسِمت بالذكاء الاصطناعي دون تدخل بشري | 38 مليون عبارة اسمية، و1.4 مليار قناع |
| SA-Co/EXT | 15 مجموعة بيانات خارجية مُثرَاة بأمثلة سلبية صعبة | يختلف حسب المصدر |
| SA-Co/VIDEO | شروح فيديو مع تتبع زمني | 52.5 ألف فيديو، و24.8 ألف عبارة اسمية فريدة |
بيانات المعيار#
يحتوي معيار تقييم SA-Co على 214 ألف عبارة فريدة موزعة على 126 ألف صورة وفيديو، ما يوفر أكثر من 50 ضعفًا من المفاهيم مقارنةً بالمعايير الحالية. ويشمل:
- SA-Co/Gold: 7 مجالات، مع شرح ثلاثي لقياس حدود الأداء البشري
- SA-Co/Silver: 10 مجالات، مع شرح بشري واحد
- SA-Co/Bronze وSA-Co/Bio: 9 مجموعات بيانات موجودة مكيّفة لتقسيم المفاهيم
- SA-Co/VEval: معيار فيديو بثلاثة مجالات (SA-V وYT-Temporal-1B وSmartGlasses)
ابتكارات محرك البيانات#
يحقق محرك بيانات SAM 3 القابل للتوسع، الذي يضع الإنسان والنموذج ضمن الحلقة، ضعف إنتاجية الوسم من خلال:
- الموسِمون بالذكاء الاصطناعي: تقترح النماذج القائمة على Llama عبارات اسمية متنوعة، بما في ذلك الأمثلة السلبية الصعبة
- المدقّقون بالذكاء الاصطناعي: تتحقق نماذج اللغات متعددة الوسائط المضبوطة دقيقًا من جودة الأقنعة وشموليتها بأداء قريب من أداء البشر
- التنقيب النشط: يركز الجهد البشري على حالات الفشل الصعبة التي يواجه فيها الذكاء الاصطناعي صعوبة
- مدفوع بالأنطولوجيا: يستفيد من أنطولوجيا كبيرة تستند إلى Wikidata لتغطية المفاهيم
التثبيت#
قم بتثبيت حزمة ultralytics أو ترقيتها:
pip install -U ultralyticsعلى خلاف نماذج Ultralytics الأخرى، لا تُنزَّل أوزان SAM 3 (sam3.pt) تلقائيًا. يجب أولًا طلب الوصول إلى أوزان النموذج من صفحة نموذج SAM 3 على Hugging Face، ثم تنزيل sam3.pt من تلك الصفحة بعد الموافقة على الطلب. ضع ملف sam3.pt الذي نزّلته في دليل العمل أو حدّد المسار الكامل عند تحميل النموذج.
أوزان SAM 3.1 (sam3.1_multiplex.pt) مقيدة بالطريقة نفسها على صفحة نموذج SAM 3.1. قم تمرير sam3.1_multiplex.pt في أي مكان تستخدم فيه أمثلة الصور أدناه sam3.pt.
إذا ظهر لك الخطأ أعلاه أثناء التنبؤ، فهذا يعني أن حزمة clip المثبّتة غير صحيحة. ثبّت حزمة clip الصحيحة بتشغيل ما يلي:
pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.gitكيفية استخدام SAM 3: تعدد الاستخدامات في تقسيم المفاهيم#
يدعم SAM 3 مهام تقسيم المفاهيم القابل للمطالبة (PCS) وتقسيم العناصر البصرية القابل للمطالبة (PVS) من خلال واجهات متنبئات مختلفة:
المهام والنماذج المدعومة#
| نوع المهمة | أنواع المطالبات | المخرجات |
|---|---|---|
| تقسيم المفاهيم (PCS) | النص (العبارات الاسمية)، والأمثلة المصوّرة | جميع المثيلات المطابقة للمفهوم |
| التقسيم البصري (PVS) | النقاط، والمربعات، والأقنعة | مثيل كائن واحد (بنمط SAM 2) |
| التحسين التفاعلي | إضافة/إزالة الأمثلة أو النقرات تكراريًا | تقسيم محسّن بدقة أفضل |
أمثلة على تقسيم المفاهيم#
التقسيم باستخدام المطالبات النصية#
اعثر على جميع مثيلات مفهوم ما وقسّمها باستخدام وصف نصي. تتطلب المطالبات النصية الواجهة SAM3SemanticPredictor.
from ultralytics.models.sam import SAM3SemanticPredictor
# Initialize predictor with configuration
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"model": "sam3.pt",
"quantize": 16, # Use FP16 for faster inference
"save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Set image once for multiple queries
predictor.set_image("path/to/image.jpg")
# Query with multiple text prompts
results = predictor(text=["person", "bus", "glasses"])
# Works with descriptive phrases
results = predictor(text=["person with red cloth", "person with blue cloth"])
# Query with a single concept
results = predictor(text=["a person"])التقسيم باستخدام أمثلة الصور#
استخدم مربعات الإحاطة كمطالبات مرئية للعثور على جميع المثيلات المتشابهة. يتطلب هذا أيضًا SAM3SemanticPredictor للمطابقة المستندة إلى المفاهيم.
from ultralytics.models.sam import SAM3SemanticPredictor
# Initialize predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Set image
predictor.set_image("path/to/image.jpg")
# Provide bounding box examples to segment similar objects
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])
# Multiple bounding boxes as exemplars of the same visual concept
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])الاستدلال المستند إلى الميزات لتحقيق الكفاءة#
استخرج ميزات الصورة مرة واحدة وأعد استخدامها لاستعلامات تقسيم متعددة لتحسين الكفاءة.
import cv2
from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors
# Initialize predictors
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)
# Extract features from the first predictor
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]
# Setup second predictor and reuse features
predictor2.setup_model()
# Perform inference using shared features with text prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])
# Perform inference using shared features with bounding box prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])
# Visualize results
if masks is not None:
masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
im = cv2.imread(source)
annotator = Annotator(im, pil=False)
annotator.masks(masks, [colors(x, True) for x in range(len(masks))])
cv2.imshow("result", annotator.result())
cv2.waitKey(0)تقسيم المفاهيم في الفيديو#
تتبّع المفاهيم عبر الفيديو باستخدام مربعات الإحاطة#
اكتشف مثيلات الكائنات وتتبّعها عبر إطارات الفيديو باستخدام مطالبات مربعات الإحاطة.
from ultralytics.models.sam import SAM3VideoPredictor
# Create video predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)
# Track objects using bounding box prompts
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)
# Process and display results
for r in results:
r.show() # Display frame with segmentation masksتتبّع المفاهيم باستخدام المطالبات النصية#
تتبّع جميع مثيلات المفاهيم المحددة بالنص عبر إطارات الفيديو.
from ultralytics.models.sam import SAM3VideoSemanticPredictor
# Initialize semantic video predictor
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"imgsz": 640,
"model": "sam3.pt",
"quantize": 16,
"save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)
# Track concepts using text prompts
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)
# Process results
for r in results:
r.show() # Display frame with tracked objects
# Alternative: Track with bounding box prompts
results = predictor(
source="path/to/video.mp4",
bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
labels=[1, 1], # Positive labels
stream=True,
)المطالبات المرئية (التوافق مع SAM 2)#
يحافظ SAM 3 على التوافق الكامل مع الإصدارات السابقة مع المطالبات المرئية في SAM 2 لتقسيم كائن واحد:
تعمل الواجهة الأساسية SAM تمامًا مثل SAM 2، إذ تقسّم المنطقة المحددة فقط بواسطة المطالبات المرئية (النقاط أو المربعات أو الأقنعة).
from ultralytics import SAM
model = SAM("sam3.pt")
# Single point prompt - segments object at specific location
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()
# Multiple points - segments single object with multiple point hints
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])
# Box prompt - segments object within bounding box
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()سيؤدي استخدام SAM("sam3.pt") مع المطالبات المرئية (النقاط/المربعات/الأقنعة) إلى تقسيم الكائن المحدد فقط في ذلك الموضع، تمامًا مثل SAM 2. ولتقسيم جميع مثيلات مفهوم ما، استخدم SAM3SemanticPredictor مع المطالبات النصية أو مطالبات الأمثلة كما هو موضح أعلاه.
معايير الأداء#
تقسيم الصور#
يحقق SAM 3 نتائج متقدمة على مستوى أحدث التقنيات عبر معايير متعددة، بما في ذلك مجموعات البيانات الواقعية مثل LVIS وCOCO للتقسيم:
| المعيار | المقياس | SAM 3 | أفضل نتيجة سابقة | التحسّن |
|---|---|---|---|---|
| LVIS (دون تدريب مسبق) | Mask AP | 47.0 | 38.5 | +22.1% |
| SA-Co/Gold | CGF1 | 65.0 | 34.3 (OWLv2) | +89.5% |
| COCO (دون تدريب مسبق) | Box AP | 53.5 | 52.2 (T-Rex2) | +2.5% |
| ADE-847 (التقسيم الدلالي) | mIoU | 14.7 | 9.2 (APE-D) | +59.8% |
| PascalConcept-59 | mIoU | 59.4 | 58.5 (APE-D) | +1.5% |
| Cityscapes (التقسيم الدلالي) | mIoU | 65.1 | 44.2 (APE-D) | +47.3% |
استكشف خيارات مجموعات البيانات لإجراء تجارب سريعة في مجموعات بيانات Ultralytics.
أداء تقسيم الفيديو#
يُظهر SAM 3 تحسينات كبيرة مقارنةً بـ SAM 2 وبأحدث التقنيات السابقة عبر معايير الفيديو مثل DAVIS 2017 وYouTube-VOS:
| المعيار | المقياس | SAM 3 | SAM 2.1 L | التحسّن |
|---|---|---|---|---|
| MOSEv2 | J&F | 60.1 | 47.9 | +25.5% |
| DAVIS 2017 | J&F | 92.0 | 90.7 | +1.4% |
| LVOSv2 | J&F | 88.2 | 79.6 | +10.8% |
| SA-V | J&F | 84.6 | 78.4 | +7.9% |
| YTVOS19 | J&F | 89.6 | 89.3 | +0.3% |
التكيّف مع عدد قليل من الأمثلة#
يتفوق SAM 3 في التكيّف مع المجالات الجديدة باستخدام أمثلة قليلة، وهو أمر مهم لسير عمل الذكاء الاصطناعي المتمحور حول البيانات:
| المعيار | AP من دون أمثلة | AP مع 10 أمثلة | أفضل نتيجة سابقة (مع 10 أمثلة) |
|---|---|---|---|
| ODinW13 | 59.9 | 71.6 | 67.9 (gDino1.5-Pro) |
| RF100-VL | 14.3 | 35.7 | 33.7 (gDino-T) |
فعالية التحسين التفاعلي#
يتقارب التوجيه المستند إلى المفاهيم في SAM 3 باستخدام الأمثلة بسرعة أكبر بكثير من التوجيه المرئي:
| المطالبات المُضافة | درجة CGF1 | المكسب مقارنةً بالنص فقط | المكسب مقارنةً بخط أساس PVS |
|---|---|---|---|
| النص فقط | 46.4 | خط الأساس | خط الأساس |
| +مثال واحد | 57.6 | +11.2 | +6.7 |
| +مثالان | 62.2 | +15.8 | +9.7 |
| +3 أمثلة | 65.0 | +18.6 | +11.2 |
| +4 أمثلة | 65.7 | +19.3 | +11.5 (منصة) |
دقة عدّ الكائنات#
يوفر SAM 3 عدًّا دقيقًا من خلال تقسيم جميع المثيلات، وهو متطلب شائع في عدّ الكائنات:
| المعيار | الدقة | MAE | مقارنةً بأفضل MLLM |
|---|---|---|---|
| CountBench | 95.6% | 0.11 | 92.4% (Gemini 2.5) |
| PixMo-Count | 87.3% | 0.22 | 88.8% (Molmo-72B) |
مقارنة SAM 3 وSAM 2 وYOLO#
نقارن هنا إمكانات SAM 3 مع نماذج SAM 2 وYOLO26. وللكشف والتقسيم في الوقت الفعلي للمفردات المفتوحة باستخدام النوع نفسه من المطالبات، راجع YOLOE:
| الإمكانية | SAM 3 | SAM 2 | YOLO26n-seg |
|---|---|---|---|
| تقسيم المفاهيم | ✅ جميع المثيلات من النص/الأمثلة | ❌ غير مدعوم | ❌ غير مدعوم |
| التقسيم المرئي | ✅ مثيل واحد (متوافق مع SAM 2) | ✅ مثيل واحد | ✅ جميع المثيلات |
| إمكانية العمل دون تدريب مسبق | ✅ مفردات مفتوحة | ✅ مطالبات هندسية | ❌ مجموعة مغلقة |
| التحسين التفاعلي | ✅ أمثلة + نقرات | ✅ النقرات فقط | ❌ غير مدعوم |
| تتبّع الفيديو | ✅ كائنات متعددة مع هويات | ✅ كائنات متعددة | ✅ كائنات متعددة |
| متوسط دقة الأقنعة في LVIS (دون تدريب مسبق) | 47.0 | غير متاح | غير متاح |
| MOSEv2 J&F | 60.1 | 47.9 | غير متاح |
| السرعة (GPU، مللي ثانية/صورة) | 2921 | 857 | 8.4 |
| حجم النموذج | 3.45 GB | 162 ميجابايت (الأساسي) | 6.4 ميجابايت |
تم قياس السرعة على NVIDIA RTX PRO 6000 باستخدام torch==2.9.1 وultralytics==8.4.19.
أهم الاستنتاجات:
- SAM 3: الأفضل لتجزئة المفاهيم ذات المفردات المفتوحة، والعثور على جميع مثيلات مفهوم ما باستخدام مطالبات نصية أو أمثلة
- SAM 2: الأفضل لتجزئة كائن واحد تفاعليًا في الصور ومقاطع الفيديو باستخدام مطالبات هندسية
- YOLO26: الأفضل للتجزئة عالية السرعة في الوقت الفعلي مع استدلال اختياري شامل بدون NMS، قابل للتصدير إلى العديد من التنسيق للنشر على وحدات معالجة الرسومات، وحدات المعالجة المركزية، وأجهزة الحافة
مقارنة SAM مع YOLO#
مقارنة SAM 3 وSAM 2 وSAM وMobileSAM وFastSAM مع نماذج تجزئة Ultralytics YOLO (YOLOv8 وYOLO11 وYOLO26) من حيث الحجم وعدد المعلمات وسرعة الاستدلال على GPU:
| النموذج | الحجم (ميغابايت) | المعلمات (مليون) | السرعة (GPU) (مللي ثانية/صورة) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 1306 |
| Meta SAM2-b | 162 | 80.8 | 857 |
| Meta SAM2-t | 78.1 | 38.9 | 668 |
| Meta SAM3 | 3450 | 473.6 | 2921 |
| MobileSAM | 40.7 | 10.1 | 605 |
| FastSAM-s مع النموذج الأساسي لـ YOLOv8 | 23.7 | 11.8 | 55.9 |
| YOLOv8n-seg من Ultralytics | 6.7 (أصغر بـ 515 مرة) | 3.4 (أقل بـ 139.1 مرة) | 17.4 (أسرع بـ 167 مرة) |
| YOLO11n-seg من Ultralytics | 5.9 (أصغر بـ 585 مرة) | 2.9 (أقل بـ 163.1 مرة) | 12.6 (أسرع بـ 231 مرة) |
| YOLO26n-seg من Ultralytics | 6.4 (أصغر بـ 539 مرة) | 2.7 (أقل بـ 175.2 مرة) | 8.4 (أسرع بـ 347 مرة) |
توضح هذه المقارنة الفروق الكبيرة في أحجام النماذج وسرعاتها بين متغيرات SAM ونماذج تقسيم YOLO. وعلى الرغم من أن SAM يوفر إمكانات فريدة للتقسيم التلقائي، فإن نماذج YOLO، ولا سيما YOLOv8n-seg وYOLO11n-seg وYOLO26n-seg، أصغر وأسرع وأكثر كفاءة حسابية بدرجة كبيرة.
أُجريت الاختبارات على NVIDIA RTX PRO 6000 بسعة 96 جيجابايت من VRAM باستخدام torch==2.9.1 وultralytics==8.4.19. لإعادة إجراء هذا الاختبار:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# Profile SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# Profile YOLO models
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
model(ASSETS, nms=False) # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11مقاييس التقييم#
يقدم SAM 3 مقاييس جديدة مصممة لمهمة PCS، تكمل المقاييس المألوفة مثل درجة F1 والدقة والاستدعاء.
درجة F1 المُقيدة بالتصنيف (CGF1)#
المقياس الأساسي الذي يجمع بين تحديد الموقع والتصنيف:
CGF1 = 100 × pmF1 × IL_MCC
حيث:
- pmF1 (درجة F1 الماكرو الإيجابية): تقيس جودة تحديد الموقع في الأمثلة الإيجابية
- IL_MCC (معامل ارتباط ماثيوز على مستوى الصورة): يقيس دقة التصنيف الثنائي ("هل المفهوم موجود؟")
لماذا هذه المقاييس؟#
لا تراعي مقاييس AP التقليدية المعايرة، مما يجعل استخدام النماذج صعبًا عمليًا. ومن خلال تقييم التنبؤات التي تتجاوز ثقتها 0.5 فقط، تفرض مقاييس SAM 3 معايرة جيدة وتحاكي أنماط الاستخدام في العالم الحقيقي ضمن حلقات التنبؤ والتتبّع التفاعلية.
أهم تجارب الإزالة والاستنتاجات#
تأثير رأس الحضور#
يفصل رأس الحضور بين التعرّف وتحديد الموقع، مما يوفر تحسينات كبيرة:
| التهيئة | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| من دون الحضور | 57.6 | 0.77 | 74.7 |
| مع الحضور | 63.3 | 0.82 | 77.1 |
يوفر رأس الحضور زيادة قدرها +5.7 في CGF1 (+9.9%)، مع تحسين القدرة على التعرّف بالدرجة الأولى (زيادة IL_MCC بمقدار 6.5%).
تأثير الأمثلة السلبية الصعبة#
| الأمثلة السلبية الصعبة/الصورة | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| 0 | 31.8 | 0.44 | 70.2 |
| 5 | 44.8 | 0.62 | 71.9 |
| 30 | 49.2 | 0.68 | 72.3 |
تُعد الأمثلة السلبية الصعبة ضرورية للتعرّف ذي المفردات المفتوحة، إذ تحسن IL_MCC بنسبة 54.5% (من 0.44 إلى 0.68).
توسيع نطاق بيانات التدريب#
| مصادر البيانات | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| خارجية فقط | 30.9 | 0.46 | 66.3 |
| خارجية + اصطناعية | 39.7 | 0.57 | 70.6 |
| خارجية + عالية الجودة | 51.8 | 0.71 | 73.2 |
| المصادر الثلاثة | 54.3 | 0.74 | 73.5 |
توفر التعليقات التوضيحية البشرية عالية الجودة مكاسب كبيرة مقارنة بالبيانات الاصطناعية أو الخارجية وحدها. للاطلاع على خلفية حول ممارسات جودة البيانات، راجع جمع البيانات والتعليق التوضيحي.
التطبيقات#
تتيح قدرة SAM 3 على تجزئة المفاهيم حالات استخدام جديدة:
- الإشراف على المحتوى: العثور على جميع مثيلات أنواع محتوى محددة عبر مكتبات الوسائط
- التجارة الإلكترونية: تجزئة جميع المنتجات من نوع معين في صور الكتالوج، بما يدعم التعليق التوضيحي التلقائي
- التصوير الطبي: تحديد جميع مواضع ظهور أنواع معينة من الأنسجة أو التشوهات
- الأنظمة الذاتية: تتبّع جميع مثيلات إشارات المرور أو المشاة أو المركبات حسب الفئة
- تحليلات الفيديو: عدّ جميع الأشخاص الذين يرتدون ملابس محددة أو يتتبعهم أثناء تنفيذهم أفعالًا معينة
- التعليق التوضيحي لمجموعات البيانات: إضافة تعليقات توضيحية بسرعة إلى جميع مثيلات فئات الكائنات النادرة
- البحث العلمي: قياس جميع العينات المطابقة لمعايير محددة وتحليلها
وكيل SAM 3: استدلال لغوي موسّع#
يمكن دمج SAM 3 مع نماذج اللغة الكبيرة متعددة الوسائط (MLLMs) للتعامل مع الاستعلامات المعقدة التي تتطلب الاستدلال، على نحو مماثل في جوهره لأنظمة المفردات المفتوحة مثل OWLv2 وT-Rex.
الأداء في مهام الاستدلال#
| المعيار | المقياس | وكيل SAM 3 (Gemini 2.5 Pro) | أفضل نتيجة سابقة |
|---|---|---|---|
| ReasonSeg (التحقق) | gIoU | 76.0 | 65.0 (SoTA) |
| ReasonSeg (الاختبار) | gIoU | 73.8 | 61.3 (SoTA) |
| OmniLabel (التحقق) | AP | 46.7 | 36.5 (REAL) |
| RefCOCO+ | Acc | 91.2 | 89.3 (LISA) |
أمثلة على الاستعلامات المعقدة#
يمكن لوكيل SAM 3 التعامل مع الاستعلامات التي تتطلب الاستدلال:
- "أشخاص جالسون لكنهم لا يمسكون علبة هدايا بأيديهم"
- "الكلب الأقرب إلى الكاميرا الذي لا يرتدي طوقًا"
- "الأجسام الحمراء الأكبر من كفّ الشخص"
يقترح MLLM استعلامات بسيطة على شكل عبارات اسمية لـ SAM 3، ويحلّل الأقنعة المُعادة، ويكرّر العملية حتى يرضى عن النتيجة.
القيود#
مع أن SAM 3 يمثّل تقدّمًا كبيرًا، فإنه يواجه بعض القيود:
- تعقيد العبارات: يناسب العبارات الاسمية البسيطة على أفضل وجه؛ وقد تتطلب العبارات الإشارية الطويلة أو الاستدلال المعقّد دمج MLLM
- التعامل مع الغموض: تظل بعض المفاهيم غامضة بطبيعتها (مثل "نافذة صغيرة" و"غرفة مريحة")
- المتطلبات الحاسوبية: أكبر حجمًا وأبطأ من نماذج الكشف المتخصصة مثل YOLO
- نطاق المفردات: يركّز على المفاهيم البصرية الذرية؛ ويظل الاستدلال التركيبي محدودًا من دون مساعدة MLLM
- المفاهيم النادرة: قد يتراجع الأداء على المفاهيم النادرة للغاية أو الدقيقة التي لا تمثّلها بيانات التدريب تمثيلًا جيدًا
الاقتباس#
@misc{carion2025sam3,
title = {SAM 3: Segment Anything with Concepts},
author = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
year = {2025},
eprint = {2511.16719},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2511.16719}
}الأسئلة الشائعة#
تم إطلاق SAM 3 بواسطة Meta في 19 نوفمبر 2025 وهو مدمج بالكامل في حزمة
ultralytics، مع دعم لـ وضع التنبؤ ووضع التتبع.نعم! نموذج SAM 3 مدمج بالكامل في حزمة Python الخاصة بـ Ultralytics، بما في ذلك تجزئة المفاهيم، والموجهات المرئية بأسلوب SAM 2، وتتبع الفيديو متعدد الكائنات. كما يدعم نموذج SAM 3 ونموذج SAM 3.1 ميزة التسمية الذكية على منصة Ultralytics، حيث يُعد نموذج SAM 3.1 النموذج الافتراضي ويمكنك تسمية الصور ببضع نقرات فقط.
نعم، لتنبؤ الصور. قم بتحميل
sam3.1_multiplex.ptأينما تستخدم أمثلة الصور على هذه الصفحةsam3.pt:SAM("sam3.1_multiplex.pt")لموجهات النقاط والصناديق، وSAM3SemanticPredictorلموجهات النصوص والأمثلة. تتبع الفيديو عبر Object Multiplex غير مدعوم حتى الآن، لذا استمر في استخدامsam3.ptمع محددات تتبع الفيديو. راجع SAM 3.1 للاطلاع على معايير Meta المقارنة.PCS هي مهمة جديدة قُدّمت في SAM 3، وتجزّئ جميع مثيلات مفهوم بصري في صورة أو فيديو. وعلى خلاف التجزئة التقليدية التي تستهدف مثيلًا محددًا من كائن، تعثر PCS على كل ظهور لفئة ما. على سبيل المثال:
- المطالبة النصية: "حافلة مدرسية صفراء" ← تجزّئ جميع الحافلات المدرسية الصفراء في المشهد
- النموذج المرئي في الصورة: مربع حول كلب واحد ← تجزّئ جميع الكلاب في الصورة
- مُدمج: "قطة مخططة" + مربع النموذج المرئي ← تجزّئ جميع القطط المخططة المطابقة للمثال
راجع الخلفية ذات الصلة حول كشف الكائنات وتجزئة المثيلات.
الميزة SAM 2 SAM 3 المهمة كائن واحد لكل مطالبة جميع مثيلات مفهوم ما أنواع المطالبات النقاط، والمربعات، والأقنعة + عبارات نصية، ونماذج مرئية في الصور قدرة الكشف يتطلب كاشفًا خارجيًا كاشف مدمج ذي مفردات مفتوحة التعرّف قائم على الهندسة فقط تعرّف نصي وبصري البنية متتبّع فقط كاشف + متتبّع مع رأس الحضور أداء دون تدريب مسبق N/A (يتطلب مطالبات بصرية) 47.0 AP على LVIS، وأفضل بمرتين على SA-Co التحسين التفاعلي النقرات فقط النقرات + تعميم النموذج المرئي يحافظ SAM 3 على التوافق العكسي مع المطالبة البصرية في SAM 2، مع إضافة إمكانات قائمة على المفاهيم.
دُرّب SAM 3 على مجموعة بيانات Segment Anything with Concepts (SA-Co):
بيانات التدريب:
- 5.2M صورة مع 4M عبارة اسمية فريدة (SA-Co/HQ) - توسيعات بشرية عالية الجودة
- 52.5K فيديو مع 24.8K عبارة اسمية فريدة (SA-Co/VIDEO)
- 1.4B قناع اصطناعي عبر 38M عبارة اسمية (SA-Co/SYN)
- 15 مجموعة بيانات خارجية مُثرَاة بأمثلة سلبية صعبة (SA-Co/EXT)
بيانات التقييم المعياري:
- 214K مفهومًا فريدًا عبر 126K صورة/فيديو
- مفاهيم أكثر بـ50 مرة من التقييمات المعيارية الحالية (مثلًا، يحتوي LVIS على ~4K مفهوم)
- توسيم ثلاثي على SA-Co/Gold لقياس حدود الأداء البشري
يتيح هذا الحجم الهائل والتنوع الكبير لـ SAM 3 تعميمًا فائقًا دون تدريب مسبق عبر المفاهيم ذات المفردات المفتوحة.
يخدم SAM 3 وYOLO26 حالتي استخدام مختلفتين:
مزايا SAM 3:
- مفردات مفتوحة: يجزّئ أي مفهوم عبر المطالبات النصية من دون تدريب
- دون تدريب مسبق: يعمل على الفئات الجديدة فورًا
- تفاعلي: يعمّم التحسين القائم على النماذج المرئية على الكائنات المماثلة
- قائم على المفاهيم: يعثر تلقائيًا على جميع مثيلات الفئة
- الدقة: 47.0 AP في تجزئة المثيلات دون تدريب مسبق على LVIS
مزايا YOLO26:
- السرعة: استدلال أسرع بعدة أضعاف، مع رأس اختياري شامل بدون NMS
- الكفاءة: نماذج أصغر بـ539 مرة (6.4MB مقابل 3.45GB)
- موفّر للموارد: يعمل على الأجهزة الطرفية والأجهزة المحمولة
- الوقت الفعلي: محسّن لعمليات النشر الإنتاجية
التوصية:
- استخدم SAM 3 للتجزئة المرنة ذات المفردات المفتوحة عندما تحتاج إلى العثور على جميع مثيلات المفاهيم الموصوفة بالنص أو الأمثلة
- استخدم YOLO26 لعمليات النشر الإنتاجية عالية السرعة عندما تكون الفئات معروفة مسبقًا
- استخدم SAM 2 لتجزئة كائن واحد تفاعلية باستخدام المطالبات الهندسية
صُمّم SAM 3 للعبارات الاسمية البسيطة (مثل "تفاحة حمراء" و"شخص يرتدي قبعة"). أما الاستعلامات المعقّدة التي تتطلب استدلالًا، فاجمع بين SAM 3 وMLLM بوصفه SAM 3 Agent:
الاستعلامات البسيطة (SAM 3 الأصلي):
- "حافلة مدرسية صفراء"
- "قطة مخططة"
- "شخص يرتدي قبعة حمراء"
الاستعلامات المعقّدة (SAM 3 Agent مع MLLM):
- "أشخاص جالسون لكنهم لا يحملون صندوق هدايا"
- "الكلب الأقرب إلى الكاميرا من دون طوق"
- "الأجسام الحمراء الأكبر من كفّ الشخص"
يحقق SAM 3 Agent قيمة 76.0 gIoU على مجموعة التحقق ReasonSeg (مقابل 65.0 لأفضل نتيجة سابقة، أي تحسّن بنسبة +16.9%) من خلال الجمع بين تجزئة SAM 3 وقدرات الاستدلال في MLLM.
في التقييم المعياري SA-Co/Gold ذي التوسيم البشري الثلاثي:
- الحد الأدنى البشري: 74.2 CGF1 (الموسِم الأكثر تحفظًا)
- أداء SAM 3: 65.0 CGF1
- الإنجاز: 88% من الحد الأدنى البشري المقدّر
- الحد الأعلى البشري: 81.4 CGF1 (الموسِم الأكثر تساهلًا)
يحقق SAM 3 أداءً قويًا يقترب من دقة المستوى البشري في تجزئة المفاهيم ذات المفردات المفتوحة، وتتركز الفجوة أساسًا في المفاهيم الغامضة أو الذاتية (مثل "نافذة صغيرة" و"غرفة مريحة").