SAM 3: сегментация любых объектов по концепциям#

SAM 3 (модель сегментации всего 3) — выпущенная Meta базовая модель для сегментации концепций по запросам (PCS). Созданная на основе SAM 2, SAM 3 представляет принципиально новую возможность: обнаруживать, сегментировать и отслеживать все экземпляры визуальной концепции, заданной текстовым запросом, примером изображения или обоими способами. В отличие от предыдущих версий SAM, сегментирующих один объект на запрос, SAM 3 может находить и сегментировать все вхождения концепции в изображениях и видео, что соответствует целям открытого словаря в современной сегментации экземпляров.
Смотри: Как использовать Meta Segment Anything 3 с Ultralytics | Сегментация изображений и видео по текстовому запросу
SAM 3 полностью интегрирована в пакет ultralytics, который изначально поддерживает сегментацию концепций по текстовым запросам, запросам с примерами изображений и отслеживание в видео. Для предсказаний на изображениях поддерживается более новая контрольная точка SAM 3.1.
Обзор#
SAM 3 обеспечивает двукратный прирост производительности по сравнению с существующими системами в задаче сегментации концепций по запросам, сохраняя и улучшая возможности SAM 2 для интерактивной визуальной сегментации. Модель особенно эффективна при сегментации с открытым словарём: пользователи могут задавать концепции простыми именными фразами (например, «жёлтый школьный автобус», «полосатая кошка») или передавать примеры изображений целевого объекта. Эти возможности дополняют готовые к промышленной эксплуатации конвейеры, использующие оптимизированные процессы предсказания и отслеживания.

Что такое сегментация концепций по запросам (PCS)?#
На вход задачи PCS подаётся запрос с концепцией, а на выходе возвращаются маски сегментации с уникальными идентификаторами для всех соответствующих экземпляров объектов. Запросы с концепциями могут быть такими:
- Текст: простые именные фразы, например «красное яблоко» или «человек в шляпе», как в обучении с нулевым числом примеров
- Примеры изображений: ограничивающие прямоугольники вокруг примеров объектов (положительных или отрицательных), позволяющие быстро обобщать знания
- Комбинированный запрос: одновременно текст и примеры изображений для точного управления
Это отличается от традиционных визуальных запросов (точек, прямоугольников и масок), которые сегментируют только один конкретный экземпляр объекта, как стало принято благодаря исходному семейству SAM.
Основные показатели производительности#
| Показатель | Результат SAM 3 |
|---|---|
| Mask AP на LVIS без дообучения | 47.0 (против предыдущего лучшего результата 38.5, улучшение на +22%) |
| Бенчмарк SA-Co | В 2 раза лучше существующих систем |
| Скорость инференса (GPU H200) | 30 мс на изображение с более чем 100 обнаруженными объектами |
| Производительность на видео | Почти в реальном времени при отслеживании ~5 объектов одновременно |
| Бенчмарк MOSEv2 VOS | 60.1 J&F (+25.5% по сравнению с SAM 2.1, +17% по сравнению с предыдущим лучшим результатом) |
| Интерактивное уточнение | Улучшение CGF1 на +18.6 после 3 запросов с примерами |
| Отставание от человеческих показателей | Достигает 88% от расчётной нижней границы на SA-Co/Gold |
Контекст о показателях моделей и компромиссах при внедрении см. в материалах об оценке моделей и показателях производительности YOLO.
SAM 3.1#
Выпущенная Meta 27 марта 2026 года SAM 3.1 — новая контрольная точка SAM 3, в которой появилась функция Object Multiplex — подход к отслеживанию нескольких объектов в видео с общей памятью. Вместо независимой обработки каждого отслеживаемого объекта SAM 3.1 группирует объекты в корзины фиксированной ёмкости и обрабатывает их совместно. По данным Meta, это обеспечивает ускорение примерно в 7 раз при обработке 128 объектов на одном GPU H100. Детектор изображений и голова интерактивных запросов с точками сохраняют архитектуру SAM 3.
| Бенчмарк | Показатель | SAM 3 | SAM 3.1 |
|---|---|---|---|
| SA-Co/VEval SA-V (тестовая выборка) | cgF1 | 30.3 | 30.5 |
| SA-Co/VEval YT-Temporal-1B (тестовая выборка) | cgF1 | 50.8 | 52.9 |
| SA-Co/VEval SmartGlasses (тестовая выборка) | cgF1 | 36.4 | 36.3 |
| MOSEv1 (валидационная выборка) | J&F | 78.4 | 79.6 |
| DAVIS17 (валидационная выборка) | J&F | 92.2 | 92.7 |
| SA-V (тестовая выборка) | J&F | 84.4 | 85.1 |
| YTVOS19 (валидационная выборка) | G | 89.7 | 89.3 |
| MOSEv2 (валидационная выборка) | J&Ḟ | 60.3 | 62.3 |
Ultralytics загружает контрольную точку SAM 3.1 (sam3.1_multiplex.pt) в предикторы изображений SAM 3: SAM("sam3.1_multiplex.pt") для запросов с точками и прямоугольниками, а также SAM3SemanticPredictor для текстовых запросов и запросов с примерами. Отслеживание видео с помощью Object Multiplex пока не поддерживается, поэтому продолжай использовать sam3.pt вместе с SAM3VideoPredictor и SAM3VideoSemanticPredictor.
Архитектура#
SAM 3 состоит из детектора и трекера, использующих общую зрительную основу Perception Encoder (PE). Такая разделённая конструкция исключает конфликты между задачами и позволяет обнаруживать объекты на изображениях и отслеживать их в видео. Интерфейс совместим с использованием Ultralytics через Python и CLI.
Основные компоненты#
-
Детектор: архитектура на основе DETR для обнаружения концепций на изображениях
- Текстовый кодировщик для запросов в виде именных фраз
- Кодировщик примеров для запросов на основе изображений
- Кодировщик слияния, который настраивает признаки изображения с учётом запросов
- Новая голова присутствия, которая разделяет распознавание («что») и локализацию («где»)
- Голова масок для создания масок сегментации экземпляров
-
Трекер: сегментация видео на основе памяти, унаследованная от SAM 2
- Кодировщик запросов, декодер масок, кодировщик памяти
- Банк памяти для хранения внешнего вида объектов между кадрами
- В мног объектных сценариях неоднозначность по времени устраняется с помощью таких методов, как фильтр Калмана
-
Токен присутствия: обучаемый глобальный токен, предсказывающий, присутствует ли целевая концепция на изображении или кадре; он повышает точность обнаружения, отделяя распознавание от локализации.

Ключевые инновации#
- Разделение распознавания и локализации: голова наличия предсказывает присутствие концепта в целом, а запросы предложений отвечают только за локализацию, что позволяет избежать конфликтующих целей.
- Единые концептуальные и визуальные подсказки: одна модель поддерживает PCS (подсказки-концепты) и PVS (визуальные подсказки, например клики и рамки, как в SAM 2).
- Интерактивное уточнение по примерам: пользователи могут добавлять положительные или отрицательные примеры изображений, чтобы постепенно уточнять результаты; модель обобщает их на похожие объекты, а не просто исправляет отдельные экземпляры.
- Временное устранение неоднозначности: для обработки окклюзий, перегруженных сцен и сбоев трекинга в видео используются оценки обнаружения masklet и периодическая повторная подача подсказок — в соответствии с лучшими практиками сегментации экземпляров и трекинга.
Датасет SA-Co#
SAM 3 обучается на датасете Segment Anything with Concepts (SA-Co) — самом крупном и разнообразном датасете сегментации Meta на сегодняшний день, который выходит за рамки распространённых бенчмарков, таких как COCO и LVIS.
Данные для обучения#
| Компонент датасета | Описание | Масштаб |
|---|---|---|
| SA-Co/HQ | Высококачественные изображения с аннотациями, созданными людьми с помощью четырёхэтапного конвейера обработки данных | 5,2 млн изображений, 4 млн уникальных именных фраз |
| SA-Co/SYN | Синтетический датасет с разметкой, созданной ИИ без участия людей | 38 млн именных фраз, 1,4 млрд масок |
| SA-Co/EXT | 15 внешних датасетов, дополненных сложными отрицательными примерами | Зависит от источника |
| SA-Co/VIDEO | Видеоаннотации с временным трекингом | 52,5 тыс. видео, 24,8 тыс. уникальных именных фраз |
Данные бенчмарка#
Оценочный бенчмарк SA-Co содержит 214 тыс. уникальных фраз для 126 тыс. изображений и видео — это более чем в 50 раз больше концептов, чем в существующих бенчмарках. В него входят:
- SA-Co/Gold: 7 предметных областей с тройной разметкой для определения границ производительности человека
- SA-Co/Silver: 10 предметных областей с одиночной разметкой, выполненной человеком
- SA-Co/Bronze и SA-Co/Bio: 9 существующих датасетов, адаптированных для сегментации концептов
- SA-Co/VEval: бенчмарк для видео с 3 предметными областями (SA-V, YT-Temporal-1B, SmartGlasses)
Инновации в конвейере обработки данных#
Масштабируемый конвейер обработки данных SAM 3 с участием людей и модели обеспечивает вдвое большую пропускную способность разметки благодаря следующим решениям:
- ИИ-аннотаторы: модели на основе Llama предлагают разнообразные именные фразы, включая сложные отрицательные примеры
- ИИ-верификаторы: дообученные мультимодальные большие языковые модели проверяют качество масок и полноту разметки почти на уровне человека
- Активный поиск: направляет усилия людей на сложные случаи сбоев, с которыми ИИ не справляется
- На основе онтологии: использует обширную онтологию, основанную на данных Wikidata, для охвата концептов
Установка#
Установи пакет ultralytics или обнови его до последней версии:
pip install -U ultralyticsВ отличие от других моделей Ultralytics, веса SAM 3 (sam3.pt) не скачиваются автоматически. Сначала запроси доступ к весам модели на странице модели SAM 3 на Hugging Face, а после одобрения скачай с этой страницы sam3.pt. Помести скачанный файл sam3.pt в рабочую директорию или укажи полный путь при загрузке модели.
Доступ к весам SAM 3.1 (sam3.1_multiplex.pt) предоставляется таким же образом на странице модели SAM 3.1. Везде, где в приведённых ниже примерах для изображений используется sam3.pt, укажи sam3.1_multiplex.pt.
Если при предсказании возникает указанная выше ошибка, значит, у тебя установлена неправильная версия пакета clip. Установи правильный пакет clip, выполнив следующую команду:
pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.gitКак использовать SAM 3: универсальность сегментации концептов#
SAM 3 поддерживает задачи сегментации концептов с подсказками (PCS) и сегментации визуальных объектов с подсказками (PVS) с помощью разных интерфейсов предиктора:
Поддерживаемые задачи и модели#
| Тип задачи | Типы подсказок | Результат |
|---|---|---|
| Сегментация концептов (PCS) | Текст (именные фразы), примеры изображений | Все экземпляры, соответствующие концепту |
| Визуальная сегментация (PVS) | Точки, рамки, маски | Отдельный экземпляр объекта (в стиле SAM 2) |
| Интерактивное уточнение | Постепенно добавляй или удаляй примеры и клики | Уточнённая сегментация с повышенной точностью |
Примеры сегментации концептов#
Сегментация с помощью текстовых подсказок#
Находи и сегментируй все экземпляры концепта по его текстовому описанию. Для текстовых подсказок нужен интерфейс SAM3SemanticPredictor.
from ultralytics.models.sam import SAM3SemanticPredictor
# Инициализация предиктора с конфигурацией
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"model": "sam3.pt",
"quantize": 16, # Использование FP16 для ускорения инференса
"save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Однократная настройка изображения для нескольких запросов
predictor.set_image("path/to/image.jpg")
# Запрос с несколькими текстовыми подсказками
results = predictor(text=["person", "bus", "glasses"])
# Поддерживаются описательные фразы
results = predictor(text=["person with red cloth", "person with blue cloth"])
# Запрос с одним концептом
results = predictor(text=["a person"])Сегментация с помощью примеров изображений#
Используй ограничивающие рамки как визуальные подсказки, чтобы находить все похожие экземпляры. Для сопоставления по концептам также нужен SAM3SemanticPredictor.
from ultralytics.models.sam import SAM3SemanticPredictor
# Инициализация предиктора
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)
# Настройка изображения
predictor.set_image("path/to/image.jpg")
# Передача примеров с ограничивающими рамками для сегментации похожих объектов
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])
# Несколько ограничивающих рамок в качестве примеров одного визуального концепта
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])Инференс на основе признаков для повышения эффективности#
Извлеки признаки изображения один раз и используй их повторно для нескольких запросов сегментации — это повысит эффективность.
import cv2
from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors
# Инициализация предикторов
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)
# Извлечение признаков с помощью первого предиктора
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]
# Настройка второго предиктора и повторное использование признаков
predictor2.setup_model()
# Инференс с текстовой подсказкой и общими признаками
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])
# Инференс с подсказкой в виде ограничивающей рамки и общими признаками
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])
# Визуализация результатов
if masks is not None:
masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
im = cv2.imread(source)
annotator = Annotator(im, pil=False)
annotator.masks(masks, [colors(x, True) for x in range(len(masks))])
cv2.imshow("result", annotator.result())
cv2.waitKey(0)Сегментация концептов в видео#
Трекинг концептов в видео с помощью ограничивающих рамок#
Обнаруживай экземпляры объектов и отслеживай их между кадрами видео с помощью подсказок в виде ограничивающих рамок.
from ultralytics.models.sam import SAM3VideoPredictor
# Создание предиктора для видео
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)
# Трекинг объектов с помощью подсказок в виде ограничивающих рамок
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)
# Обработка и отображение результатов
for r in results:
r.show() # Отображение кадра с масками сегментацииТрекинг концептов с помощью текстовых подсказок#
Отслеживай все экземпляры концептов, заданных текстом, между кадрами видео.
from ultralytics.models.sam import SAM3VideoSemanticPredictor
# Инициализация семантического предиктора для видео
overrides = {
"conf": 0.25,
"task": "segment",
"mode": "predict",
"imgsz": 640,
"model": "sam3.pt",
"quantize": 16,
"save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)
# Трекинг концептов с помощью текстовых подсказок
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)
# Обработать результаты
for r in results:
r.show() # Отображение кадра с отслеживаемыми объектами
# Альтернатива: трекинг с помощью подсказок в виде ограничивающих рамок
results = predictor(
source="path/to/video.mp4",
bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
labels=[1, 1], # Положительные метки
stream=True,
)Визуальные подсказки (совместимость с SAM 2)#
SAM 3 полностью обратно совместима с визуальными подсказками SAM 2 для сегментации отдельных объектов:
Базовый интерфейс SAM работает точно так же, как SAM 2: он сегментирует только конкретную область, указанную визуальными подсказками (точками, рамками или масками).
from ultralytics import SAM
model = SAM("sam3.pt")
# Подсказка с одной точкой — сегментирует объект в указанном месте
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()
# Подсказка с несколькими точками — сегментирует один объект с несколькими точечными подсказками
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])
# Подсказка с рамкой — сегментирует объект внутри ограничивающей рамки
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()Использование SAM("sam3.pt") с визуальными подсказками (точками/рамками/масками) позволит сегментировать только конкретный объект в указанном месте, как и в SAM 2. Чтобы сегментировать все экземпляры концепции, используй SAM3SemanticPredictor с текстовыми подсказками или подсказками с примерами, как показано выше.
Тесты производительности#
Сегментация изображений#
SAM 3 показывает результаты на уровне лучших современных моделей на нескольких бенчмарках, включая реальные наборы данных, такие как LVIS и COCO для сегментации:
| Бенчмарк | Показатель | SAM 3 | Предыдущий лучший результат | Улучшение |
|---|---|---|---|---|
| LVIS (zero-shot) | AP масок | 47.0 | 38.5 | +22.1% |
| SA-Co/Gold | CGF1 | 65.0 | 34.3 (OWLv2) | +89.5% |
| COCO (zero-shot) | AP рамок | 53.5 | 52.2 (T-Rex2) | +2.5% |
| ADE-847 (семантическая сегментация) | mIoU | 14.7 | 9.2 (APE-D) | +59.8% |
| PascalConcept-59 | mIoU | 59.4 | 58.5 (APE-D) | +1.5% |
| Cityscapes (семантическая сегментация) | mIoU | 65.1 | 44.2 (APE-D) | +47.3% |
Изучи доступные наборы данных Ultralytics для быстрых экспериментов: наборы данных Ultralytics.
Производительность сегментации видео#
SAM 3 значительно превосходит SAM 2 и предыдущие лучшие модели на видеобенчмарках, таких как DAVIS 2017 и YouTube-VOS:
| Бенчмарк | Показатель | SAM 3 | SAM 2.1 L | Улучшение |
|---|---|---|---|---|
| MOSEv2 | J&F | 60.1 | 47.9 | +25.5% |
| DAVIS 2017 | J&F | 92.0 | 90.7 | +1.4% |
| LVOSv2 | J&F | 88.2 | 79.6 | +10.8% |
| SA-V | J&F | 84.6 | 78.4 | +7.9% |
| YTVOS19 | J&F | 89.6 | 89.3 | +0.3% |
Адаптация по нескольким примерам#
SAM 3 эффективно адаптируется к новым доменам по минимальному числу примеров, что полезно в рабочих процессах ИИ с фокусом на данные:
| Бенчмарк | AP с 0 примерами | AP с 10 примерами | Предыдущий лучший результат (10 примеров) |
|---|---|---|---|
| ODinW13 | 59.9 | 71.6 | 67.9 (gDino1.5-Pro) |
| RF100-VL | 14.3 | 35.7 | 33.7 (gDino-T) |
Эффективность интерактивного уточнения#
Подсказки SAM 3 на основе концепций с примерами сходятся к результату гораздо быстрее, чем визуальные подсказки:
| Добавленные подсказки | Оценка CGF1 | Прирост относительно только текста | Прирост относительно базового уровня PVS |
|---|---|---|---|
| Только текст | 46.4 | базовый уровень | базовый уровень |
| +1 пример | 57.6 | +11.2 | +6.7 |
| +2 примера | 62.2 | +15.8 | +9.7 |
| +3 примера | 65.0 | +18.6 | +11.2 |
| +4 примера | 65.7 | +19.3 | +11.5 (плато) |
Точность подсчёта объектов#
SAM 3 точно считает объекты, сегментируя все их экземпляры; такая возможность часто требуется для подсчёта объектов:
| Бенчмарк | Точность | MAE | относительно лучшей MLLM |
|---|---|---|---|
| CountBench | 95.6% | 0.11 | 92.4% (Gemini 2.5) |
| PixMo-Count | 87.3% | 0.22 | 88.8% (Molmo-72B) |
Сравнение SAM 3, SAM 2 и YOLO#
Здесь мы сравниваем возможности SAM 3 с SAM 2 и моделями YOLO26. Чтобы узнать о детекции и сегментации с открытым словарём в реальном времени с использованием тех же типов подсказок, смотри YOLOE:
| Возможность | SAM 3 | SAM 2 | YOLO26n-seg |
|---|---|---|---|
| Сегментация концепций | ✅ Все экземпляры по текстовым подсказкам/примерам | ❌ Не поддерживается | ❌ Не поддерживается |
| Визуальная сегментация | ✅ Один экземпляр (совместим с SAM 2) | ✅ Один экземпляр | ✅ Все экземпляры |
| Возможность работы без примеров | ✅ Открытый словарь | ✅ Геометрические подсказки | ❌ Закрытый набор классов |
| Интерактивное уточнение | ✅ Примеры и щелчки | ✅ Только щелчки | ❌ Не поддерживается |
| Отслеживание видео | ✅ Несколько объектов с идентификаторами | ✅ Несколько объектов | ✅ Несколько объектов |
| AP масок LVIS (zero-shot) | 47.0 | Н/Д | Н/Д |
| MOSEv2 J&F | 60.1 | 47.9 | Н/Д |
| Скорость (GPU, мс/изобр.) | 2921 | 857 | 8.4 |
| Размер модели | 3.45 GB | 162 MB (базовая) | 6.4 MB |
Скорость измерена на NVIDIA RTX PRO 6000 с torch==2.9.1 и ultralytics==8.4.19.
Основные выводы:
- SAM 3: лучше всего подходит для сегментации концепций с открытым словарём и поиска всех экземпляров концепции по текстовым подсказкам или подсказкам с примерами
- SAM 2: лучше всего подходит для интерактивной сегментации одного объекта на изображениях и видео с геометрическими подсказками
- YOLO26: лучше всего подходит для высокоскоростной сегментации в реальном времени с возможностью сквозного инференса без NMS; экспортируется во множество форматов для развёртывания на GPU, CPU и периферийных устройствах
Сравнение SAM и YOLO#
Сравнение SAM 3, SAM 2, SAM, MobileSAM и FastSAM с моделями сегментации Ultralytics YOLO (YOLOv8, YOLO11, YOLO26) по размеру, количеству параметров и скорости инференса на GPU:
| Модель | Размер (МБ) | Параметры (M) | Скорость (GPU) (мс/изобр.) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 1306 |
| Meta SAM2-b | 162 | 80.8 | 857 |
| Meta SAM2-t | 78.1 | 38.9 | 668 |
| Meta SAM3 | 3450 | 473.6 | 2921 |
| MobileSAM | 40.7 | 10.1 | 605 |
| FastSAM-s с бэкбоном YOLOv8 | 23.7 | 11.8 | 55.9 |
| Ultralytics YOLOv8n-seg | 6.7 (в 515 раз меньше) | 3.4 (в 139.1 раза меньше) | 17.4 (в 167 раз быстрее) |
| Ultralytics YOLO11n-seg | 5.9 (в 585 раз меньше) | 2.9 (в 163.1 раза меньше) | 12.6 (в 231 раз быстрее) |
| Ultralytics YOLO26n-seg | 6.4 (в 539 раз меньше) | 2.7 (в 175.2 раза меньше) | 8.4 (в 347 раз быстрее) |
Это сравнение показывает существенные различия в размере и скорости моделей вариантов SAM и моделей сегментации YOLO. Хотя SAM предоставляет уникальные возможности автоматической сегментации, модели YOLO, особенно YOLOv8n-seg, YOLO11n-seg и YOLO26n-seg, значительно компактнее, быстрее и эффективнее используют вычислительные ресурсы.
Тесты проводились на NVIDIA RTX PRO 6000 с 96 ГБ видеопамяти с использованием torch==2.9.1 и ultralytics==8.4.19. Чтобы повторить этот тест:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# Профилирование SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# Профилирование FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# Профилирование моделей YOLO
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
model(ASSETS, nms=False) # Голова YOLO26 без NMS; ничего не делает для YOLOv8/YOLO11Метрики оценки#
В SAM 3 добавлены новые метрики для задачи PCS, дополняющие привычные показатели, такие как F1-мера, точность и полнота.
F1-мера с учетом классификации (CGF1)#
Основная метрика, объединяющая локализацию и классификацию:
CGF1 = 100 × pmF1 × IL_MCC
Где:
- pmF1 (макроусредненная F1-мера для положительных примеров): измеряет качество локализации на положительных примерах
- IL_MCC (коэффициент корреляции Мэттьюса на уровне изображения): измеряет точность бинарной классификации («присутствует ли концепт?»)
Зачем нужны эти метрики?#
Традиционные метрики AP не учитывают калибровку, поэтому такие модели трудно применять на практике. Оценивая только предсказания с уверенностью выше 0.5, метрики SAM 3 обеспечивают хорошую калибровку и имитируют реальные сценарии использования в циклах интерактивного предсказания и отслеживания.
Ключевые абляционные исследования и выводы#
Влияние головы присутствия#
Голова присутствия отделяет распознавание от локализации, что дает существенное улучшение:
| Конфигурация | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Без учета присутствия | 57.6 | 0.77 | 74.7 |
| С учетом присутствия | 63.3 | 0.82 | 77.1 |
Голова присутствия повышает CGF1 на 5.7 (+9.9%), в первую очередь улучшая способность к распознаванию (IL_MCC +6.5%).
Влияние сложных отрицательных примеров#
| Сложных отрицательных примеров на изображение | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| 0 | 31.8 | 0.44 | 70.2 |
| 5 | 44.8 | 0.62 | 71.9 |
| 30 | 49.2 | 0.68 | 72.3 |
Сложные отрицательные примеры крайне важны для распознавания объектов с открытым словарем и повышают IL_MCC на 54.5% (0.44 → 0.68).
Масштабирование обучающих данных#
| Источники данных | CGF1 | IL_MCC | pmF1 |
|---|---|---|---|
| Только внешние | 30.9 | 0.46 | 66.3 |
| Внешние + синтетические | 39.7 | 0.57 | 70.6 |
| Внешние + высококачественные | 51.8 | 0.71 | 73.2 |
| Все три | 54.3 | 0.74 | 73.5 |
Высококачественная разметка, выполненная людьми, дает значительный прирост по сравнению с использованием только синтетических или внешних данных. О практиках обеспечения качества данных читай в разделе сбор и аннотация данных.
Применение#
Возможность SAM 3 сегментировать концепты открывает новые варианты применения:
- Модерация контента: поиск всех вхождений контента определенных типов в медиатеках
- Электронная коммерция: сегментация всех товаров определенного типа на изображениях каталога с поддержкой автоматической аннотации
- Медицинская визуализация: выявление всех случаев наличия определенных типов тканей или патологий
- Автономные системы: отслеживание всех дорожных знаков, пешеходов или транспортных средств по категориям
- Видеоаналитика: подсчет и отслеживание всех людей в одежде определенного типа или выполняющих заданные действия
- Аннотирование датасетов: быстрая разметка всех объектов редких категорий
- Научные исследования: количественная оценка и анализ всех образцов, соответствующих заданным критериям
Агент SAM 3: расширенные языковые рассуждения#
SAM 3 можно объединить с мультимодальными большими языковыми моделями (MLLM), чтобы обрабатывать сложные запросы, требующие рассуждений, подобно системам с открытым словарем, таким как OWLv2 и T-Rex.
Результаты на задачах, требующих рассуждений#
| Бенчмарк | Показатель | Агент SAM 3 (Gemini 2.5 Pro) | Предыдущий лучший результат |
|---|---|---|---|
| ReasonSeg (валидация) | gIoU | 76.0 | 65.0 (SoTA) |
| ReasonSeg (тест) | gIoU | 73.8 | 61.3 (SoTA) |
| OmniLabel (валидация) | AP | 46.7 | 36.5 (REAL) |
| RefCOCO+ | Acc | 91.2 | 89.3 (LISA) |
Примеры сложных запросов#
Агент SAM 3 может обрабатывать запросы, требующие рассуждений:
- «Люди, которые садятся, но не держат в руках подарочную коробку»
- «Собака, которая ближе всего к камере и не носит ошейник»
- «Красные объекты, размером больше руки человека»
MLLM предлагает SAM 3 простые запросы в виде именных фраз, анализирует возвращенные маски и повторяет процесс до получения нужного результата.
Ограничения#
Несмотря на то что SAM 3 — значительный шаг вперед, у модели есть некоторые ограничения:
- Сложность фраз: лучше всего подходит для простых именных фраз; для длинных референциальных выражений или сложных рассуждений может потребоваться интеграция с MLLM
- Работа с неоднозначностью: некоторые концепты по своей природе остаются неоднозначными (например, «маленькое окно», «уютная комната»)
- Вычислительные требования: модель крупнее и медленнее специализированных моделей обнаружения, таких как YOLO
- Охват словаря: модель ориентирована на атомарные визуальные концепты; без помощи MLLM возможности композиционных рассуждений ограничены
- Редкие концепты: качество работы может снижаться для крайне редких или детализированных концептов, которые недостаточно представлены в обучающих данных
Цитирование#
@misc{carion2025sam3,
title = {SAM 3: Segment Anything with Concepts},
author = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
year = {2025},
eprint = {2511.16719},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2511.16719}
}Часто задаваемые вопросы#
Meta выпустила SAM 3 19 ноября 2025 года; модель полностью интегрирована в пакет
ultralyticsи поддерживает режим предсказания и режим отслеживания.Да! SAM 3 полностью интегрирована в пакет Ultralytics для Python: доступны сегментация концептов, визуальные промпты в стиле SAM 2 и отслеживание нескольких объектов в видео. SAM 3 и SAM 3.1 также лежат в основе функции умной разметки на платформе Ultralytics: по умолчанию используется SAM 3.1, а изображения можно аннотировать всего за несколько щелчков.
Да, для предсказания на изображениях. Загружай
sam3.1_multiplex.ptвезде, где в примерах работы с изображениями на этой странице используетсяsam3.pt:SAM("sam3.1_multiplex.pt")для промптов с точками и рамками иSAM3SemanticPredictorдля текстовых промптов и промптов с примерами. Отслеживание видео с Object Multiplex пока не поддерживается, поэтому для предсказания на видео продолжай использоватьsam3.pt. Бенчмарки Meta смотри в разделе SAM 3.1.PCS — новая задача, появившаяся в SAM 3. Она позволяет сегментировать все экземпляры визуального концепта на изображении или видео. В отличие от традиционной сегментации, нацеленной на конкретный экземпляр объекта, PCS находит все вхождения категории. Например:
- Текстовый промпт: «желтый школьный автобус» → сегментирует все желтые школьные автобусы в кадре
- Изображение-пример: обведи одну собаку → модель выделит всех собак на изображении
- Комбинация: «полосатая кошка» + рамка-пример → модель выделит всех полосатых кошек, похожих на пример
См. также материалы о детекции объектов и сегментации экземпляров.
Характеристика SAM 2 SAM 3 Задача Один объект на запрос Все экземпляры понятия Типы запросов Точки, рамки, маски + Текстовые фразы, изображения-примеры Возможности детекции Требуется внешний детектор Встроенный детектор с открытым словарём Распознавание Только на основе геометрии Распознавание текста и изображений Архитектура Только трекер Детектор + трекер с головой определения присутствия Эффективность в режиме zero-shot Н/Д (требуются визуальные запросы) 47,0 AP на LVIS, в 2 раза лучше на SA-Co Интерактивное уточнение Только клики Клики + обобщение по изображению-примеру SAM 3 сохраняет обратную совместимость с визуальными запросами SAM 2 и добавляет возможности на основе понятий.
SAM 3 обучают на наборе данных Segment Anything with Concepts (SA-Co):
Данные для обучения:
- 5,2 млн изображений с 4 млн уникальных именных фраз (SA-Co/HQ) — высококачественная разметка, созданная людьми
- 52,5 тыс. видео с 24,8 тыс. уникальных именных фраз (SA-Co/VIDEO)
- 1,4 млрд синтетических масок для 38 млн именных фраз (SA-Co/SYN)
- 15 внешних наборов данных, дополненных сложными отрицательными примерами (SA-Co/EXT)
Данные для бенчмарка:
- 214 тыс. уникальных понятий на 126 тыс. изображений и видео
- В 50 раз больше понятий, чем в существующих бенчмарках (например, в LVIS около ~4 тыс. понятий)
- Тройная разметка SA-Co/Gold позволяет оценить границы производительности человека
Такой масштаб и разнообразие обеспечивают SAM 3 превосходную zero-shot генерализацию для понятий с открытым словарём.
SAM 3 и YOLO26 предназначены для разных задач:
Преимущества SAM 3:
- Открытый словарь: сегментирует любые понятия по текстовым запросам без дополнительного обучения
- Zero-shot: сразу работает с новыми категориями
- Интерактивность: уточнение по примеру распространяется на похожие объекты
- На основе понятий: автоматически находит все экземпляры категории
- Точность: 47,0 AP в задаче zero-shot-сегментации экземпляров на LVIS
Преимущества YOLO26:
- Скорость: инференс на порядки быстрее; при необходимости можно использовать сквозную голову без NMS
- Эффективность: модели в 539 раз меньше (6,4 МБ против 3,45 ГБ)
- Работа на устройствах с ограниченными ресурсами: запускается на периферийных и мобильных устройствах
- Работа в реальном времени: оптимизирована для развертывания в production
Рекомендация:
- Используй SAM 3 для гибкой сегментации с открытым словарём, когда нужно найти все экземпляры понятий, описанных текстом или примерами
- Используй YOLO26 для высокоскоростного развертывания в production, когда категории известны заранее
- Используй SAM 2 для интерактивной сегментации одного объекта с геометрическими запросами
SAM 3 рассчитана на простые именные фразы (например, «красное яблоко», «человек в шляпе»). Для сложных запросов, требующих рассуждений, объедини SAM 3 с MLLM и используй SAM 3 Agent:
Простые запросы (встроенные возможности SAM 3):
- «жёлтый школьный автобус»
- «полосатая кошка»
- «человек в красной шляпе»
Сложные запросы (SAM 3 Agent с MLLM):
- «Люди, которые сидят, но не держат подарочную коробку»
- «Собака, которая ближе всего к камере и без ошейника»
- «Красные объекты, размером больше руки человека»
SAM 3 Agent показывает 76,0 gIoU на валидационной выборке ReasonSeg (против 65,0 у предыдущего лучшего результата; улучшение на 16,9%), объединяя сегментацию SAM 3 со способностями MLLM к рассуждению.
На бенчмарке SA-Co/Gold с тройной разметкой людьми:
- Нижняя граница человеческой производительности: 74,2 CGF1 (самый строгий разметчик)
- Результат SAM 3: 65,0 CGF1
- Достижение: 88% от оценочной нижней границы человеческой производительности
- Верхняя граница человеческой производительности: 81,4 CGF1 (самый либеральный разметчик)
SAM 3 демонстрирует высокие результаты, приближаясь к человеческой точности в сегментации понятий с открытым словарём; разрыв в основном связан с неоднозначными или субъективными понятиями (например, «маленькое окно», «уютная комната»).