Ultralytics YOLO27:

SAM 3: сегментация чего угодно по концептам#

Обзор сегментации концептов SAM 3 по запросу

SAM 3 (Модель сегментации чего угодно 3) — выпущенная Meta базовая модель для сегментации концептов по запросу (PCS). Развивая SAM 2, SAM 3 представляет принципиально новую возможность: обнаруживать, сегментировать и отслеживать все экземпляры визуального концепта, заданного текстовыми запросами, эталонными изображениями или и тем и другим. В отличие от предыдущих версий SAM, которые сегментируют по одному объекту на запрос, SAM 3 может находить и сегментировать каждое вхождение концепта в любых местах изображений или видео, что соответствует целям открытого словаря в современной сегментации экземпляров.



Watch: How to Use Meta Segment Anything 3 with Ultralytics | Text-Prompt Segmentation on Images & Videos

SAM 3 полностью интегрирован в пакет ultralytics, обеспечивая нативную поддержку сегментации концептов с помощью текстовых подсказок, подсказок по примерам изображений и трекинга видео. Более новая контрольная точка SAM 3.1 поддерживается для предсказания на изображениях.

Обзор#

SAM 3 обеспечивает двукратный прирост производительности по сравнению с существующими системами в задаче сегментации концептов по запросу, сохраняя и улучшая возможности SAM 2 для интерактивной визуальной сегментации. Модель отлично справляется с сегментацией в режиме открытого словаря, позволяя задавать концепты с помощью простых именных фраз (например, "yellow school bus", "striped cat") или предоставлять примеры изображений целевого объекта. Эти возможности дополняют готовые к использованию в production пайплайны, основанные на оптимизированных процессах predict и track.

Примеры сегментации SAM 3 по текстовым запросам

Что такое сегментация концептов по запросу (PCS)?#

Задача PCS принимает на вход запрос концепта и возвращает маски сегментации с уникальными идентификаторами для всех соответствующих экземпляров объектов. Запросы концептов могут быть следующими:

  • Текст: простые именные фразы, например "red apple" или "person wearing a hat", аналогично обучению без примеров
  • Эталонные изображения: ограничивающие рамки вокруг объектов-примеров (положительных или отрицательных) для быстрой генерализации
  • Комбинированные: текст и эталонные изображения вместе для точного управления

Это отличается от традиционных визуальных подсказок (точек, рамок и масок), которые сегментируют только один конкретный экземпляр объекта, как стало популярно благодаря оригинальному семейству SAM.

Основные метрики производительности#

МетрикаРезультат SAM 3
Mask AP в режиме zero-shot на LVIS47.0 (по сравнению с предыдущим лучшим результатом 38.5, улучшение на +22%)
Бенчмарк SA-CoВ 2 раза лучше, чем существующие системы
Скорость инференса (GPU H200)30 мс на изображение при обнаружении более 100 объектов
Производительность на видеоПочти в реальном времени для ~5 одновременно отслеживаемых объектов
Бенчмарк MOSEv2 VOS60.1 J&F (+25.5% по сравнению с SAM 2.1, +17% по сравнению с предыдущим SOTA)
Интерактивное уточнениеУлучшение +18.6 CGF1 после 3 подсказок с эталонными изображениями
Отставание от человеческих результатовДостигает 88% оценочной нижней границы на SA-Co/Gold

Подробнее о метриках моделей и компромиссах в production см. в материалах об оценке моделей и метриках производительности YOLO.

SAM 3.1#

SAM 3.1, выпущенная Meta 27 марта 2026 года, представляет собой новую контрольную точку SAM 3, в которой реализован Object Multiplex, подход с разделяемой памятью для трекинга нескольких объектов в видео. Вместо обработки каждого отслеживаемого объекта независимо, SAM 3.1 объединяет объекты в бакеты фиксированной емкости и обрабатывает их совместно, что, по данным Meta, обеспечивает ускорение в ~7 раз для 128 объектов на одном графическом процессоре H100. Детектор изображений и голова интерактивных подсказок по точкам сохраняют архитектуру SAM 3.

БенчмаркМетрикаSAM 3SAM 3.1
SA-Co/VEval SA-V (тест)cgF130.330.5
SA-Co/VEval YT-Temporal-1B (тест)cgF150.852.9
SA-Co/VEval SmartGlasses (тест)cgF136.436.3
MOSEv1 (валидация)J&F78.479.6
DAVIS17 (валидация)J&F92.292.7
SA-V (тест)J&F84.485.1
YTVOS19 (валидация)G89.789.3
MOSEv2 (валидация)J&Ḟ60.362.3

Ultralytics загружает контрольную точку SAM 3.1 (sam3.1_multiplex.pt) в предикторы изображений SAM 3: SAM("sam3.1_multiplex.pt") для подсказок по точкам и боксам, и SAM3SemanticPredictor для текстовых подсказок и подсказок по примерам. Трекинг видео Object Multiplex пока не поддерживается, поэтому продолжай использовать sam3.pt с SAM3VideoPredictor и SAM3VideoSemanticPredictor.

Архитектура#

SAM 3 состоит из детектора и трекера, использующих общий визуальный бэкбон Perception Encoder (PE). Такая разделённая архитектура позволяет избежать конфликтов между задачами и одновременно поддерживает обнаружение на уровне изображений и трекинг на уровне видео, с интерфейсом, совместимым с использованием Python и использованием CLI в Ultralytics.

Основные компоненты#

  • Детектор: архитектура на основе DETR для обнаружения концептов на уровне изображения

    • Текстовый энкодер для подсказок в виде именных фраз
    • Энкодер эталонных изображений для подсказок на основе изображений
    • Энкодер слияния для обусловливания признаков изображения подсказками
    • Новая голова присутствия, отделяющая распознавание ("что") от локализации ("где")
    • Голова масок для создания масок сегментации экземпляров
  • Трекер: основанная на памяти сегментация видео, унаследованная от SAM 2

    • Энкодер подсказок, декодер масок, энкодер памяти
    • Банк памяти для хранения внешнего вида объектов между кадрами
    • Временная дизамбигация с использованием таких методов, как фильтр Калмана, в сценариях с несколькими объектами
  • Токен присутствия: обучаемый глобальный токен, который предсказывает наличие целевого концепта на изображении или кадре, повышая качество обнаружения за счёт разделения распознавания и локализации.

Схема архитектуры модели SAM 3

Ключевые инновации#

  1. Разделение распознавания и локализации: голова присутствия глобально предсказывает наличие концепта, а запросы предложений сосредоточены только на локализации, что позволяет избежать конфликтующих целей.
  2. Унифицированные концептуальные и визуальные подсказки: одна модель поддерживает как PCS (концептуальные подсказки), так и PVS (визуальные подсказки, например клики и рамки из SAM 2).
  3. Интерактивное уточнение по эталонным изображениям: ты можешь добавлять положительные или отрицательные эталонные изображения для итеративного уточнения результатов; модель обобщает результат на похожие объекты, а не просто исправляет отдельные экземпляры.
  4. Временная дизамбигация: для обработки перекрытий, перегруженных сцен и сбоев трекинга в видео используются оценки обнаружения masklet и периодическая повторная подача запросов, что соответствует лучшим практикам сегментации и трекинга экземпляров.

Датасет SA-Co#

SAM 3 обучена на Segment Anything with Concepts (SA-Co) — крупнейшем и наиболее разнообразном на сегодняшний день датасете сегментации Meta, выходящем за рамки распространённых бенчмарков, таких как COCO и LVIS.

Данные обучения#

Компонент датасетаОписаниеМасштаб
SA-Co/HQВысококачественные изображения с аннотациями людей, полученные с помощью 4-фазного механизма подготовки данных5,2 млн изображений, 4 млн уникальных именных фраз
SA-Co/SYNСинтетический датасет с разметкой, созданной ИИ без участия людей38 млн именных фраз, 1,4 млрд масок
SA-Co/EXT15 внешних датасетов, дополненных сложными отрицательными примерамиЗависит от источника
SA-Co/VIDEOВидеоаннотации с временным трекингом52,5 тыс. видео, 24,8 тыс. уникальных именных фраз

Данные бенчмарка#

Оценочный бенчмарк SA-Co содержит 214 тыс. уникальных фраз в 126 тыс. изображений и видео, предоставляя более чем в 50 раз больше концептов, чем существующие бенчмарки. Он включает:

  • SA-Co/Gold: 7 доменов с тройной разметкой для измерения границ человеческих возможностей
  • SA-Co/Silver: 10 доменов с одной аннотацией, созданной человеком
  • SA-Co/Bronze и SA-Co/Bio: 9 существующих датасетов, адаптированных для сегментации концептов
  • SA-Co/VEval: бенчмарк видео с 3 доменами (SA-V, YT-Temporal-1B, SmartGlasses)

Инновации механизма подготовки данных#

Масштабируемый механизм подготовки данных SAM 3 с участием людей и моделей обеспечивает двукратное увеличение пропускной способности аннотации благодаря следующим компонентам:

  1. Аннотаторы на базе ИИ: модели на базе Llama предлагают разнообразные именные фразы, включая сложные отрицательные примеры
  2. Верификаторы на базе ИИ: дообученные мультимодальные LLM проверяют качество и полноту масок почти на уровне человека
  3. Активный поиск: направляет усилия людей на сложные случаи с ошибками, где ИИ испытывает трудности
  4. На основе онтологии: использует крупную онтологию, связанную с Wikidata, для охвата концептов

Установка#

Установи или обнови пакет ultralytics:

pip install -U ultralytics
Требуются веса модели SAM 3

В отличие от других моделей Ultralytics, веса SAM 3 (sam3.pt) не скачиваются автоматически. Сначала запроси доступ к весам модели на странице модели SAM 3 на Hugging Face, а после одобрения скачай sam3.pt с этой страницы. Помести скачанный файл sam3.pt в рабочий каталог или укажи полный путь при загрузке модели.

Веса SAM 3.1 (sam3.1_multiplex.pt) защищены ограничениями доступа аналогичным образом на странице модели SAM 3.1. Передавай sam3.1_multiplex.pt везде, где в примерах изображений ниже используется sam3.pt.

`TypeError: 'SimpleTokenizer' object is not callable`

Если во время предсказания ты получаешь указанную выше ошибку, значит установлен неправильный пакет clip. Установи правильный пакет clip, выполнив следующую команду:

pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.git

Как использовать SAM 3: универсальность сегментации концептов#

SAM 3 поддерживает задачи сегментации концептов по запросу (PCS) и визуальной сегментации по запросу (PVS) через разные интерфейсы предикторов:

Поддерживаемые задачи и модели#

Тип задачиТипы подсказокРезультат
Сегментация концептов (PCS)Текст (именные фразы), эталонные изображенияВсе экземпляры, соответствующие концепту
Визуальная сегментация (PVS)Точки, рамки, маскиОдин экземпляр объекта (в стиле SAM 2)
Интерактивное уточнениеИтеративное добавление или удаление эталонных изображений и кликовУточнённая сегментация с повышенной точностью

Примеры сегментации концепций#

Сегментация с текстовыми подсказками#

Сегментация концепций на основе текста

Находи и сегментируй все экземпляры концепции с помощью текстового описания. Для текстовых подсказок требуется интерфейс SAM3SemanticPredictor.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor with configuration
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "model": "sam3.pt",
    "quantize": 16,  # Use FP16 for faster inference
    "save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image once for multiple queries
predictor.set_image("path/to/image.jpg")

# Query with multiple text prompts
results = predictor(text=["person", "bus", "glasses"])

# Works with descriptive phrases
results = predictor(text=["person with red cloth", "person with blue cloth"])

# Query with a single concept
results = predictor(text=["a person"])

Сегментация с визуальными примерами#

Сегментация на основе визуальных примеров

Используй ограничивающие рамки как визуальные подсказки, чтобы находить все похожие экземпляры. Для сопоставления на основе концепций также требуется SAM3SemanticPredictor.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image
predictor.set_image("path/to/image.jpg")

# Provide bounding box examples to segment similar objects
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])

# Multiple bounding boxes as exemplars of the same visual concept
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])

Вывод на основе признаков для повышения эффективности#

Повторное использование признаков изображения для нескольких запросов

Извлеки признаки изображения один раз и повторно используй их для нескольких запросов сегментации, чтобы повысить эффективность.

import cv2

from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors

# Initialize predictors
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)

# Extract features from the first predictor
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]

# Setup second predictor and reuse features
predictor2.setup_model()

# Perform inference using shared features with text prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])

# Perform inference using shared features with bounding box prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])

# Visualize results
if masks is not None:
    masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
    im = cv2.imread(source)
    annotator = Annotator(im, pil=False)
    annotator.masks(masks, [colors(x, True) for x in range(len(masks))])

    cv2.imshow("result", annotator.result())
    cv2.waitKey(0)

Сегментация концепций на видео#

Отслеживание концепций на видео с помощью ограничивающих рамок#

Отслеживание объектов на видео с визуальными подсказками

Обнаруживай и отслеживай экземпляры объектов между кадрами видео с помощью подсказок в виде ограничивающих рамок.

from ultralytics.models.sam import SAM3VideoPredictor

# Create video predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)

# Track objects using bounding box prompts
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)

# Process and display results
for r in results:
    r.show()  # Display frame with segmentation masks

Отслеживание концепций с текстовыми подсказками#

Отслеживание на видео с помощью семантических запросов

Отслеживай все экземпляры концепций, заданных текстом, между кадрами видео.

from ultralytics.models.sam import SAM3VideoSemanticPredictor

# Initialize semantic video predictor
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "imgsz": 640,
    "model": "sam3.pt",
    "quantize": 16,
    "save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)

# Track concepts using text prompts
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)

# Process results
for r in results:
    r.show()  # Display frame with tracked objects

# Alternative: Track with bounding box prompts
results = predictor(
    source="path/to/video.mp4",
    bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
    labels=[1, 1],  # Positive labels
    stream=True,
)

Визуальные подсказки (совместимость с SAM 2)#

SAM 3 полностью сохраняет обратную совместимость с визуальными подсказками SAM 2 для сегментации отдельных объектов:

Визуальные подсказки в стиле SAM 2

Базовый интерфейс SAM работает точно так же, как SAM 2, сегментируя только конкретную область, указанную визуальными подсказками (точками, рамками или масками).

from ultralytics import SAM

model = SAM("sam3.pt")

# Single point prompt - segments object at specific location
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()

# Multiple points - segments single object with multiple point hints
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])

# Box prompt - segments object within bounding box
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()
Визуальные подсказки и сегментация концепций

Использование SAM("sam3.pt") с визуальными подсказками (точками/рамками/масками) сегментирует только конкретный объект в указанном месте, как и SAM 2. Чтобы сегментировать все экземпляры концепции, используй SAM3SemanticPredictor с текстовыми подсказками или подсказками-примерами, как показано выше.

Сравнительные тесты производительности#

Сегментация изображений#

SAM 3 демонстрирует лучшие в отрасли результаты на нескольких наборах тестов, включая реальные наборы данных, такие как LVIS и COCO для сегментации:

БенчмаркМетрикаSAM 3Предыдущий лучший результатУлучшение
LVIS (zero-shot)AP масок47.038.5+22.1%
SA-Co/GoldCGF165.034.3 (OWLv2)+89.5%
COCO (zero-shot)AP рамок53.552.2 (T-Rex2)+2.5%
ADE-847 (семантическая сегментация)mIoU14.79.2 (APE-D)+59.8%
PascalConcept-59mIoU59.458.5 (APE-D)+1.5%
Cityscapes (семантическая сегментация)mIoU65.144.2 (APE-D)+47.3%

Изучи варианты наборов данных для быстрых экспериментов в наборах данных Ultralytics.

Производительность сегментации видео#

SAM 3 демонстрирует значительные улучшения по сравнению с SAM 2 и предыдущими лучшими в отрасли результатами на таких тестах для видео, как DAVIS 2017 и YouTube-VOS:

БенчмаркМетрикаSAM 3SAM 2.1 LУлучшение
MOSEv2J&F60.147.9+25.5%
DAVIS 2017J&F92.090.7+1.4%
LVOSv2J&F88.279.6+10.8%
SA-VJ&F84.678.4+7.9%
YTVOS19J&F89.689.3+0.3%

Адаптация по небольшому числу примеров#

SAM 3 отлично адаптируется к новым областям с минимальным количеством примеров, что актуально для рабочих процессов data-centric AI:

БенчмаркAP при 0 примерахAP при 10 примерахПредыдущий лучший результат (10 примеров)
ODinW1359.971.667.9 (gDino1.5-Pro)
RF100-VL14.335.733.7 (gDino-T)

Эффективность интерактивного уточнения#

Подсказки на основе концепций в SAM 3 с примерами сходятся к результату значительно быстрее, чем визуальные подсказки:

Добавленные подсказкиОценка CGF1Прирост по сравнению только с текстомПрирост по сравнению с базовым уровнем PVS
Только текст46.4базовый уровеньбазовый уровень
+1 пример57.6+11.2+6.7
+2 примера62.2+15.8+9.7
+3 примера65.0+18.6+11.2
+4 примера65.7+19.3+11.5 (плато)

Точность подсчёта объектов#

SAM 3 обеспечивает точный подсчёт, сегментируя все экземпляры, что часто требуется в задачах подсчёта объектов:

БенчмаркТочностьMAEПо сравнению с лучшей MLLM
CountBench95.6%0.1192.4% (Gemini 2.5)
PixMo-Count87.3%0.2288.8% (Molmo-72B)

Сравнение SAM 3, SAM 2 и YOLO#

Здесь мы сравниваем возможности SAM 3 с моделями SAM 2 и YOLO26. Для обнаружения и сегментации в реальном времени с открытым словарём по подсказкам тех же типов см. YOLOE:

ВозможностьSAM 3SAM 2YOLO26n-seg
Сегментация концепций✅ Все экземпляры по тексту/примерам❌ Не поддерживается❌ Не поддерживается
Визуальная сегментация✅ Один экземпляр (совместимо с SAM 2)✅ Один экземпляр✅ Все экземпляры
Возможности zero-shot✅ Открытый словарь✅ Геометрические подсказки❌ Замкнутый набор
Интерактивное уточнение✅ Примеры + клики✅ Только клики❌ Не поддерживается
Отслеживание объектов на видео✅ Несколько объектов с идентификаторами✅ Несколько объектов✅ Несколько объектов
Mask AP на LVIS (zero-shot)47.0Н/ДН/Д
MOSEv2 J&F60.147.9Н/Д
Скорость (GPU, мс/изображение)29218578.4
Размер модели3.45 GB162 МБ (базовая)6,4 МБ

Скорость измерена на NVIDIA RTX PRO 6000 с использованием torch==2.9.1 и ultralytics==8.4.19.

Ключевые выводы:

  • SAM 3: лучше всего подходит для сегментации концепций с открытым словарём и поиска всех экземпляров концепции по текстовым запросам или примерам
  • SAM 2: лучше всего подходит для интерактивной сегментации одного объекта на изображениях и видео с геометрическими запросами
  • YOLO26: Лучший выбор для быстрого сегментирования в реальном времени с опциональным выводом «end-to-end» без NMS, который можно экспортировать во множество форматов для развертывания на графических процессорах (GPU), центральных процессорах (CPU) и периферийных устройствах

Сравнение SAM с YOLO#

Сравнение SAM 3, SAM 2, SAM, MobileSAM и FastSAM с моделями сегментации Ultralytics YOLO (YOLOv8, YOLO11, YOLO26) по размеру, количеству параметров и скорости вывода на GPU:

МодельРазмер
(МБ)
Параметры
(млн)
Скорость (GPU)
(мс/изображение)
Meta SAM-b37593.71306
Meta SAM2-b16280.8857
Meta SAM2-t78.138.9668
Meta SAM33450473.62921
MobileSAM40.710.1605
FastSAM-s с бэкбоном YOLOv823.711.855.9
Ultralytics YOLOv8n-seg6.7 (в 515 раз меньше)3.4 (в 139.1 раза меньше)17.4 (в 167 раз быстрее)
Ultralytics YOLO11n-seg5,9 (в 585 раз меньше)2.9 (в 163.1 раза меньше)12.6 (в 231 раз быстрее)
Ultralytics YOLO26n-seg6.4 (в 539 раз меньше)2,7 (в 175,2 раза меньше)8,4 (в 347 раз быстрее)

Это сравнение демонстрирует существенные различия в размере и скорости моделей между вариантами SAM и моделями сегментации YOLO. Хотя SAM предоставляет уникальные возможности автоматической сегментации, модели YOLO, особенно YOLOv8n-seg, YOLO11n-seg и YOLO26n-seg, значительно меньше, быстрее и эффективнее с точки зрения вычислений.

Тесты выполнены на NVIDIA RTX PRO 6000 с 96 ГБ видеопамяти с использованием torch==2.9.1 и ultralytics==8.4.19. Чтобы воспроизвести этот тест:

Пример
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Profile SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Profile YOLO models
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    model(ASSETS, nms=False)  # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11

Метрики оценки#

SAM 3 вводит новые метрики, разработанные для задачи PCS, дополняющие знакомые показатели, такие как F1 score, точность и полнота.

F1 с учётом классификации (CGF1)#

Основная метрика, объединяющая локализацию и классификацию:

CGF1 = 100 × pmF1 × IL_MCC

Где:

  • pmF1 (положительная макроусреднённая F1): измеряет качество локализации на положительных примерах
  • IL_MCC (коэффициент корреляции Мэтьюса на уровне изображения): измеряет точность бинарной классификации («присутствует ли концепция?»)

Зачем нужны эти метрики?#

Традиционные метрики AP не учитывают калибровку, из-за чего модели сложно использовать на практике. Оценивая только предсказания с уверенностью выше 0,5, метрики SAM 3 обеспечивают хорошую калибровку и имитируют реальные сценарии использования в интерактивных циклах predict и track.

Ключевые абляции и выводы#

Влияние модуля наличия объекта#

Модуль наличия объекта отделяет распознавание от локализации, обеспечивая значительные улучшения:

КонфигурацияCGF1IL_MCCpmF1
Без модуля наличия объекта57.60.7774.7
С модулем наличия объекта63.30.8277.1

Модуль наличия объекта обеспечивает прирост CGF1 на +5,7 (+9,9%), главным образом улучшая способность к распознаванию (IL_MCC +6,5%).

Влияние сложных негативных примеров#

Сложные негативные примеры/изображениеCGF1IL_MCCpmF1
031.80.4470.2
544.80.6271.9
3049.20.6872.3

Сложные негативные примеры крайне важны для распознавания с открытым словарём, повышая IL_MCC на 54,5% (с 0,44 до 0,68).

Масштабирование обучающих данных#

Источники данныхCGF1IL_MCCpmF1
Только внешние30.90.4666.3
Внешние + синтетические39.70.5770.6
Внешние + высокого качества51.80.7173.2
Все три54.30.7473.5

Высококачественные аннотации, выполненные людьми, дают значительный прирост по сравнению с одними лишь синтетическими или внешними данными. Общие сведения о методах обеспечения качества данных см. в разделе сбор и аннотирование данных.

Применения#

Возможность сегментации концепций в SAM 3 открывает новые варианты использования:

  • Модерация контента: поиск всех экземпляров определённых типов контента в медиатеках
  • Электронная коммерция: сегментация всех товаров определённого типа на изображениях каталога с поддержкой автоматической аннотации
  • Медицинская визуализация: выявление всех случаев присутствия определённых типов тканей или патологий
  • Автономные системы: отслеживание всех дорожных знаков, пешеходов или транспортных средств определённой категории
  • Анализ видео: подсчёт и отслеживание всех людей, одетых в определённую одежду или выполняющих определённые действия
  • Аннотирование датасетов: быстрая аннотация всех экземпляров редких категорий объектов
  • Научные исследования: количественная оценка и анализ всех образцов, соответствующих определённым критериям

Агент SAM 3: расширенное языковое рассуждение#

SAM 3 можно объединить с мультимодальными большими языковыми моделями (MLLM), чтобы обрабатывать сложные запросы, требующие рассуждений, подобно системам с открытым словарём, таким как OWLv2 и T-Rex.

Производительность на задачах, требующих рассуждений#

БенчмаркМетрикаАгент SAM 3 (Gemini 2.5 Pro)Предыдущий лучший результат
ReasonSeg (валидация)gIoU76.065,0 (SoTA)
ReasonSeg (тестирование)gIoU73.861,3 (SoTA)
OmniLabel (валидация)AP46.736,5 (REAL)
RefCOCO+Acc91.289,3 (LISA)

Примеры сложных запросов#

Агент SAM 3 может обрабатывать запросы, требующие рассуждений:

  • «Люди, которые сидят, но не держат в руках подарочную коробку»
  • «Собака, ближайшая к камере, на которой нет ошейника»
  • «Красные объекты, размер которых больше ладони человека»

MLLM предлагает SAM 3 простые запросы в виде именных групп, анализирует возвращённые маски и повторяет процесс, пока результат его не удовлетворит.

Ограничения#

Несмотря на то что SAM 3 представляет собой значительный шаг вперёд, у него есть определённые ограничения:

  • Сложность фраз: лучше всего подходит для простых именных групп; длинные описательные выражения или сложные рассуждения могут потребовать интеграции с MLLM
  • Обработка неоднозначности: некоторые концепции по своей природе остаются неоднозначными (например, «маленькое окно», «уютная комната»)
  • Вычислительные требования: больше и медленнее специализированных моделей обнаружения, таких как YOLO
  • Охват словаря: ориентирован на атомарные визуальные концепции; без помощи MLLM возможности композиционного рассуждения ограничены
  • Редкие концепции: производительность может снижаться для чрезвычайно редких или детализированных концепций, которые недостаточно представлены в обучающих данных

Цитирование#

Цитата
@misc{carion2025sam3,
  title         = {SAM 3: Segment Anything with Concepts},
  author        = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  year          = {2025},
  eprint        = {2511.16719},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2511.16719}
}

Часто задаваемые вопросы#

  • SAM 3 был выпущен компанией Meta 19 ноября 2025 года и полностью интегрирован в пакет ultralytics с поддержкой режима предсказания и режима трекинга.

  • Да! SAM 3 полностью интегрирован в пакет Ultralytics Python, включая сегментацию по понятиям, визуальные подсказки в стиле SAM 2 и многообъектное отслеживание видео. SAM 3 и SAM 3.1 также обеспечивают работу функции умной разметки на Ultralytics Platform, где SAM 3.1 является моделью по умолчанию, а размечать изображения можно всего в несколько кликов.

  • Да, для предсказания на изображениях. Загружай sam3.1_multiplex.pt везде, где в примерах изображений на этой странице используются sam3.pt: SAM("sam3.1_multiplex.pt") для подсказок по точкам и боксам, а SAM3SemanticPredictor для текстовых подсказок и примеров. Отслеживание видео Object Multiplex пока не поддерживается, поэтому продолжай использовать sam3.pt с видеопредикторами. Смотри бенчмарки Meta на странице SAM 3.1.

  • PCS — это новая задача, представленная в SAM 3, которая сегментирует все экземпляры визуальной концепции на изображении или видео. В отличие от традиционной сегментации, нацеленной на конкретный экземпляр объекта, PCS находит каждое вхождение категории. Например:

    • Текстовый запрос: «жёлтый школьный автобус» → сегментирует все жёлтые школьные автобусы в сцене
    • Эталонное изображение: рамка вокруг одной собаки → сегментирует всех собак на изображении
    • Комбинация: «полосатая кошка» + эталонная рамка → сегментирует всех полосатых кошек, соответствующих примеру

    См. дополнительную информацию о детектировании объектов и сегментации экземпляров.

  • ХарактеристикаSAM 2SAM 3
    ЗадачаОдин объект на запросВсе экземпляры концепции
    Типы запросовТочки, рамки, маски+ Текстовые фразы, эталонные изображения
    Возможность обнаруженияТребуется внешний детекторВстроенный детектор с открытым словарём
    РаспознаваниеТолько на основе геометрииТекстовое и визуальное распознавание
    АрхитектураТолько трекерДетектор + трекер с головой присутствия
    Производительность в режиме zero-shotН/Д (требуются визуальные подсказки)47.0 AP на LVIS, в 2 раза лучше на SA-Co
    Интерактивное уточнениеТолько щелчкиЩелчки + обобщение по эталонному изображению

    SAM 3 сохраняет обратную совместимость с визуальными подсказками SAM 2, добавляя возможности на основе концепций.

  • SAM 3 обучается на наборе данных Сегментация чего угодно с концепциями (SA-Co):

    Обучающие данные:

    • 5.2M изображений с 4M уникальных именных групп (SA-Co/HQ) — высококачественные аннотации, созданные людьми
    • 52.5K видео с 24.8K уникальных именных групп (SA-Co/VIDEO)
    • 1.4B синтетических масок для 38M именных групп (SA-Co/SYN)
    • 15 внешних наборов данных, дополненных сложными отрицательными примерами (SA-Co/EXT)

    Данные для бенчмарка:

    • 214K уникальных концепций на 126K изображений и видео
    • В 50 раз больше концепций, чем в существующих бенчмарках (например, LVIS содержит ~4K концепций)
    • Тройная разметка SA-Co/Gold для измерения верхней границы эффективности людей

    Такой масштаб и разнообразие обеспечивают превосходное обобщение SAM 3 в режиме zero-shot для концепций с открытым словарём.

  • SAM 3 и YOLO26 предназначены для разных сценариев использования:

    Преимущества SAM 3:

    • Открытый словарь: сегментирует любую концепцию по текстовым запросам без дополнительного обучения
    • Zero-shot: сразу работает с новыми категориями
    • Интерактивность: уточнение на основе эталонного изображения обобщается на похожие объекты
    • На основе концепций: автоматически находит все экземпляры категории
    • Точность: 47.0 AP в режиме zero-shot для сегментации экземпляров на LVIS

    Преимущества YOLO26:

    • Скорость: на порядки более быстрое выведение результатов с опциональной «end-to-end» головой без NMS
    • Эффективность: модели в 539 раз меньше (6.4MB против 3.45GB)
    • Нетребовательность к ресурсам: работает на периферийных устройствах и мобильных устройствах
    • Работа в реальном времени: оптимизирован для развёртывания в продуктивной среде

    Рекомендация:

    • Используй SAM 3 для гибкой сегментации с открытым словарём, когда нужно находить все экземпляры концепций, описанных текстом или примерами
    • Используй YOLO26 для высокоскоростных развёртываний в продуктивной среде, когда категории известны заранее
    • Используй SAM 2 для интерактивной сегментации одного объекта с геометрическими подсказками
  • SAM 3 разработан для простых именных групп (например, «красное яблоко», «человек в шляпе»). Для сложных запросов, требующих рассуждений, объедини SAM 3 с MLLM в составе SAM 3 Agent:

    Простые запросы (нативные для SAM 3):

    • «жёлтый школьный автобус»
    • «полосатая кошка»
    • «человек в красной шляпе»

    Сложные запросы (SAM 3 Agent с MLLM):

    • «Люди, сидящие, но не держащие подарочную коробку»
    • «Собака, ближайшая к камере и без ошейника»
    • «Красные объекты, размер которых больше ладони человека»

    SAM 3 Agent достигает 76.0 gIoU на валидационной выборке ReasonSeg (против 65.0 у предыдущего лучшего результата, улучшение на +16.9%), объединяя сегментацию SAM 3 со способностями MLLM к рассуждениям.

  • На бенчмарке SA-Co/Gold с тройной разметкой людьми:

    • Нижняя граница результатов людей: 74.2 CGF1 (наиболее консервативный аннотатор)
    • Результат SAM 3: 65.0 CGF1
    • Достижение: 88% от расчётной нижней границы результатов людей
    • Верхняя граница результатов людей: 81.4 CGF1 (наиболее либеральный аннотатор)

    SAM 3 демонстрирует высокую производительность, приближаясь к человеческой точности в сегментации концепций с открытым словарём; разрыв в основном наблюдается для неоднозначных или субъективных концепций (например, «маленькое окно», «уютная комната»).

Комментарии