Ultralytics YOLO27:
Get Started

SAM 3: segmenta tudo com conceitos#

Visão geral da segmentação de conceitos com prompts do SAM 3

SAM 3 (Modelo de Segmentação de Tudo 3) é o modelo fundacional da Meta para Segmentação de Conceitos com Prompts (PCS). Baseado no SAM 2, o SAM 3 introduz uma capacidade fundamentalmente nova: detetar, segmentar e acompanhar todas as instâncias de um conceito visual especificado por prompts de texto, exemplos de imagem ou ambos. Ao contrário das versões anteriores do SAM, que segmentam um único objeto por prompt, o SAM 3 consegue encontrar e segmentar todas as ocorrências de um conceito em qualquer parte de imagens ou vídeos, em consonância com os objetivos de vocabulário aberto da moderna segmentação de instâncias.



Assista: Como usar o Meta Segment Anything 3 com Ultralytics | Segmentação por prompt de texto em imagens e vídeos

O SAM 3 está totalmente integrado no pacote ultralytics, que oferece suporte nativo à segmentação de conceitos com prompts de texto, prompts de exemplos de imagem e acompanhamento de vídeo. O checkpoint mais recente SAM 3.1 é suportado para a previsão de imagens.

Visão geral#

O SAM 3 alcança um ganho de desempenho de 2× em relação aos sistemas existentes em Segmentação de Conceitos com Prompts, mantendo e melhorando as capacidades do SAM 2 para a segmentação visual interativa. O modelo destaca-se na segmentação de vocabulário aberto, permitindo que os utilizadores especifiquem conceitos através de frases nominais simples (por exemplo, "autocarro escolar amarelo", "gato às riscas") ou forneçam imagens de exemplo do objeto-alvo. Estas capacidades complementam os fluxos de trabalho prontos para produção que dependem de processos simplificados de previsão e acompanhamento.

Exemplos de segmentação com prompts de texto do SAM 3

O que é a Segmentação de Conceitos com Prompts (PCS)?#

A tarefa PCS recebe um prompt de conceito como entrada e devolve máscaras de segmentação com identidades únicas para todas as instâncias de objetos correspondentes. Os prompts de conceito podem ser:

  • Texto: frases nominais simples, como "maçã vermelha" ou "pessoa com chapéu", semelhantes à aprendizagem zero-shot
  • Exemplos de imagem: caixas delimitadoras à volta de objetos de exemplo (positivas ou negativas) para uma generalização rápida
  • Combinados: texto e exemplos de imagem em conjunto, para um controlo preciso

Isto difere dos prompts visuais tradicionais (pontos, caixas, máscaras), que segmentam apenas uma instância específica de um único objeto, como popularizado pela família SAM original.

Principais métricas de desempenho#

MétricaResultado do SAM 3
AP de máscara zero-shot no LVIS47.0 (face ao melhor resultado anterior de 38.5, melhoria de +22%)
Referência SA-Co2× melhor do que os sistemas existentes
Velocidade de inferência (GPU H200)30 ms por imagem com mais de 100 objetos detetados
Desempenho em vídeoQuase em tempo real para ~5 objetos simultâneos
Referência MOSEv2 VOS60.1 J&F (+25.5% em relação ao SAM 2.1, +17% em relação ao anterior SOTA)
Refinamento interativoMelhoria de +18.6 CGF1 após 3 prompts de exemplo
Diferença em relação ao desempenho humanoAlcança 88% do limite inferior estimado no SA-Co/Gold

Para contextualizar as métricas dos modelos e os compromissos envolvidos na produção, consulta as análises de avaliação de modelos e as métricas de desempenho do YOLO.

SAM 3.1#

O SAM 3.1, lançado pela Meta a 27 de março de 2026, é um novo checkpoint do SAM 3 que adiciona Object Multiplex, uma abordagem de memória partilhada para o acompanhamento de vários objetos em vídeo. Em vez de processar cada objeto acompanhado de forma independente, o SAM 3.1 agrupa os objetos em conjuntos de capacidade fixa e processa-os em conjunto; segundo a Meta, isto permite uma aceleração de ~7× com 128 objetos numa única GPU H100. O detetor de imagens e a cabeça interativa de prompts de pontos mantêm a arquitetura do SAM 3.

BenchmarkMétricaSAM 3SAM 3.1
SA-Co/VEval SA-V (teste)cgF130.330.5
SA-Co/VEval YT-Temporal-1B (teste)cgF150.852.9
SA-Co/VEval SmartGlasses (teste)cgF136.436.3
MOSEv1 (validação)J&F78.479.6
DAVIS17 (validação)J&F92.292.7
SA-V (teste)J&F84.485.1
YTVOS19 (validação)G89.789.3
MOSEv2 (validação)J&Ḟ60.362.3

A Ultralytics carrega o checkpoint SAM 3.1 (sam3.1_multiplex.pt) nos preditores de imagem do SAM 3: SAM("sam3.1_multiplex.pt") para prompts de pontos e caixas, e SAM3SemanticPredictor para prompts de texto e exemplos. O acompanhamento de vídeo Object Multiplex ainda não é suportado, por isso continua a utilizar sam3.pt com SAM3VideoPredictor e SAM3VideoSemanticPredictor.

Arquitetura#

O SAM 3 é composto por um detetor e um rastreador que partilham um backbone de visão Perception Encoder (PE). Este design desacoplado evita conflitos entre tarefas e permite a deteção ao nível da imagem e o acompanhamento ao nível do vídeo, através de uma interface compatível com a utilização de Python e a utilização de CLI da Ultralytics.

Componentes principais#

  • Detetor: Arquitetura baseada em DETR para deteção de conceitos ao nível da imagem

    • Codificador de texto para prompts de frases nominais
    • Codificador de exemplos para prompts baseados em imagens
    • Codificador de fusão para condicionar as características da imagem aos prompts
    • Cabeça de presença inovadora, que separa o reconhecimento ("o quê") da localização ("onde")
    • Cabeça de máscaras para gerar máscaras de segmentação de instâncias
  • Rastreador: Segmentação de vídeo baseada em memória herdada do SAM 2

    • Codificador de prompts, descodificador de máscaras, codificador de memória
    • Banco de memória para armazenar a aparência dos objetos entre fotogramas
    • Desambiguação temporal auxiliada por técnicas como o filtro de Kalman em cenários com vários objetos
  • Token de presença: token global aprendido que prevê se o conceito-alvo está presente na imagem/fotograma, melhorando a deteção ao separar o reconhecimento da localização.

Diagrama da arquitetura do modelo SAM 3

Principais inovações#

  1. Reconhecimento e localização desacoplados: O cabeçalho de presença prevê globalmente a presença do conceito, enquanto as consultas de proposta se concentram apenas na localização, evitando objetivos conflitantes.
  2. Prompts de conceito e visuais unificados: Oferece suporte a PCS (prompts de conceito) e PVS (prompts visuais, como cliques/caixas do SAM 2) em um único modelo.
  3. Refinamento interativo com exemplares: Os usuários podem adicionar exemplares positivos ou negativos de imagens para refinar os resultados iterativamente, e o modelo generaliza para objetos semelhantes em vez de apenas corrigir instâncias individuais.
  4. Desambiguação temporal: Usa pontuações de detecção de masklets e novos prompts periódicos para lidar com oclusões, cenas lotadas e falhas de rastreamento em vídeos, seguindo as práticas recomendadas de segmentação e rastreamento de instâncias.

Conjunto de dados SA-Co#

O SAM 3 é treinado com o Segment Anything with Concepts (SA-Co), o maior e mais diversificado conjunto de dados de segmentação da Meta até hoje, que vai além de benchmarks comuns como COCO e LVIS.

Dados de treinamento#

Componente do conjunto de dadosDescriçãoEscala
SA-Co/HQDados de imagens de alta qualidade anotados por humanos, provenientes de um mecanismo de dados de 4 fases5,2 milhões de imagens, 4 milhões de frases nominais exclusivas
SA-Co/SYNConjunto de dados sintético rotulado por IA sem envolvimento humano38 milhões de frases nominais, 1,4 bilhão de máscaras
SA-Co/EXT15 conjuntos de dados externos enriquecidos com negativos difíceisVaria conforme a origem
SA-Co/VIDEOAnotações de vídeo com rastreamento temporal52,5 mil vídeos, 24,8 mil frases nominais exclusivas

Dados de benchmark#

O benchmark de avaliação SA-Co contém 214 mil frases exclusivas em 126 mil imagens e vídeos, oferecendo mais de 50× mais conceitos do que os benchmarks existentes. Ele inclui:

  • SA-Co/Gold: 7 domínios, com três anotações para medir os limites do desempenho humano
  • SA-Co/Silver: 10 domínios, com uma anotação humana
  • SA-Co/Bronze e SA-Co/Bio: 9 conjuntos de dados existentes adaptados para segmentação de conceitos
  • SA-Co/VEval: Benchmark de vídeo com 3 domínios (SA-V, YT-Temporal-1B, SmartGlasses)

Inovações no mecanismo de dados#

O mecanismo de dados escalável com humanos e modelos no ciclo do SAM 3 alcança 2× mais produtividade de anotação por meio de:

  1. Anotadores de IA: Modelos baseados em Llama propõem diversas frases nominais, incluindo negativos difíceis
  2. Verificadores de IA: LLMs multimodais ajustados verificam a qualidade das máscaras e a exaustividade com desempenho quase humano
  3. Mineração ativa: Concentra o esforço humano em casos difíceis de falha nos quais a IA tem dificuldades
  4. Orientado por ontologia: Usa uma ontologia abrangente fundamentada no Wikidata para cobrir conceitos

Instalação#

Instala ou atualiza o pacote ultralytics:

pip install -U ultralytics
Pesos do modelo SAM 3 necessários

Ao contrário de outros modelos Ultralytics, os pesos do SAM 3 (sam3.pt) não são baixados automaticamente. Primeiro, solicita acesso aos pesos do modelo na página do modelo SAM 3 no Hugging Face e, depois que o acesso for aprovado, baixa sam3.pt nessa página. Coloca o arquivo sam3.pt baixado no diretório de trabalho ou especifica o caminho completo ao carregar o modelo.

Os pesos do SAM 3.1 (sam3.1_multiplex.pt) têm o mesmo controle de acesso na página do modelo SAM 3.1. Passa sam3.1_multiplex.pt em qualquer lugar onde os exemplos de imagem abaixo usem sam3.pt.

`TypeError: 'SimpleTokenizer' object is not callable`

Se ocorrer o erro acima durante a predição, isso significa que tens instalado o pacote clip incorreto. Instala o pacote clip correto executando:

pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.git

Como usar o SAM 3: versatilidade na segmentação de conceitos#

O SAM 3 oferece suporte às tarefas de segmentação de conceitos com prompts (PCS) e segmentação visual com prompts (PVS) por meio de diferentes interfaces de preditor:

Tarefas e modelos compatíveis#

Tipo de tarefaTipos de promptSaída
Segmentação de conceitos (PCS)Texto (frases nominais), exemplares de imagemTodas as instâncias que correspondem ao conceito
Segmentação visual (PVS)Pontos, caixas, máscarasInstância de objeto única (estilo SAM 2)
Refinamento interativoAdicionar/remover exemplares ou cliques iterativamenteSegmentação refinada com maior precisão

Exemplos de segmentação de conceitos#

Segmentar com prompts de texto#

Segmentação de conceitos baseada em texto

Encontra e segmenta todas as instâncias de um conceito usando uma descrição em texto. Os prompts de texto exigem a interface SAM3SemanticPredictor.

from ultralytics.models.sam import SAM3SemanticPredictor

# Inicializa o preditor com a configuração
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "model": "sam3.pt",
    "quantize": 16,  # Usa FP16 para inferência mais rápida
    "save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Define a imagem uma vez para várias consultas
predictor.set_image("path/to/image.jpg")

# Consulta com vários prompts de texto
results = predictor(text=["person", "bus", "glasses"])

# Funciona com frases descritivas
results = predictor(text=["person with red cloth", "person with blue cloth"])

# Consulta com um único conceito
results = predictor(text=["a person"])

Segmentar com exemplares de imagem#

Segmentação baseada em exemplares de imagem

Usa caixas delimitadoras como prompts visuais para encontrar todas as instâncias semelhantes. Isso também exige SAM3SemanticPredictor para a correspondência baseada em conceitos.

from ultralytics.models.sam import SAM3SemanticPredictor

# Inicializa o preditor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Define a imagem
predictor.set_image("path/to/image.jpg")

# Fornece exemplos de caixas delimitadoras para segmentar objetos semelhantes
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])

# Várias caixas delimitadoras como exemplares do mesmo conceito visual
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])

Inferência baseada em recursos para maior eficiência#

Reutilizar recursos de imagem para várias consultas

Extrai os recursos da imagem uma vez e reutiliza-os em várias consultas de segmentação para melhorar a eficiência.

import cv2

from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors

# Inicializa os preditores
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)

# Extrai recursos do primeiro preditor
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]

# Configura o segundo preditor e reutiliza os recursos
predictor2.setup_model()

# Executa a inferência usando recursos compartilhados com um prompt de texto
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])

# Executa a inferência usando recursos compartilhados com um prompt de caixa delimitadora
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])

# Visualiza os resultados
if masks is not None:
    masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
    im = cv2.imread(source)
    annotator = Annotator(im, pil=False)
    annotator.masks(masks, [colors(x, True) for x in range(len(masks))])

    cv2.imshow("result", annotator.result())
    cv2.waitKey(0)

Segmentação de conceitos em vídeo#

Rastrear conceitos em um vídeo com caixas delimitadoras#

Rastreamento de vídeo com prompts visuais

Deteta e rastreia instâncias de objetos em quadros de vídeo usando prompts de caixa delimitadora.

from ultralytics.models.sam import SAM3VideoPredictor

# Cria o preditor de vídeo
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)

# Rastreia objetos usando prompts de caixa delimitadora
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)

# Processa e apresenta os resultados
for r in results:
    r.show()  # Apresenta o quadro com máscaras de segmentação

Rastrear conceitos com prompts de texto#

Rastreamento de vídeo com consultas semânticas

Rastreia todas as instâncias dos conceitos especificados por texto em quadros de vídeo.

from ultralytics.models.sam import SAM3VideoSemanticPredictor

# Inicializa o preditor semântico de vídeo
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "imgsz": 640,
    "model": "sam3.pt",
    "quantize": 16,
    "save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)

# Rastreia conceitos usando prompts de texto
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)

# Processa os resultados
for r in results:
    r.show()  # Apresenta o quadro com objetos rastreados

# Alternativa: rastrear com prompts de caixa delimitadora
results = predictor(
    source="path/to/video.mp4",
    bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
    labels=[1, 1],  # Rótulos positivos
    stream=True,
)

Prompts visuais (compatibilidade com SAM 2)#

O SAM 3 mantém compatibilidade retroativa total com os prompts visuais do SAM 2 para segmentação de objetos individuais:

Prompts visuais no estilo SAM 2

A interface básica SAM funciona exatamente como o SAM 2, segmentando apenas a área específica indicada pelos prompts visuais (pontos, caixas ou máscaras).

from ultralytics import SAM

model = SAM("sam3.pt")

# Prompt de ponto único - segmenta o objeto num local específico
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()

# Vários pontos - segmenta um único objeto com várias indicações de pontos
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])

# Prompt de caixa - segmenta o objeto dentro de uma caixa delimitadora
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()
Prompts visuais vs. segmentação de conceitos

Usar SAM("sam3.pt") com prompts visuais (pontos/caixas/máscaras) segmenta apenas o objeto específico nesse local, tal como o SAM 2. Para segmentar todas as instâncias de um conceito, usa SAM3SemanticPredictor com prompts de texto ou de exemplos, como mostrado acima.

Testes de desempenho#

Segmentação de imagens#

O SAM 3 alcança resultados de última geração em vários benchmarks, incluindo conjuntos de dados do mundo real, como LVIS e COCO para segmentação:

BenchmarkMétricaSAM 3Melhor resultado anteriorMelhoria
LVIS (zero-shot)AP de máscara47.038.5+22.1%
SA-Co/GoldCGF165.034.3 (OWLv2)+89.5%
COCO (zero-shot)AP de caixa53.552.2 (T-Rex2)+2.5%
ADE-847 (segmentação semântica)mIoU14.79.2 (APE-D)+59.8%
PascalConcept-59mIoU59.458.5 (APE-D)+1.5%
Cityscapes (segmentação semântica)mIoU65.144.2 (APE-D)+47.3%

Explora opções de conjuntos de dados para experimentação rápida em conjuntos de dados Ultralytics.

Desempenho da segmentação de vídeo#

O SAM 3 apresenta melhorias significativas em relação ao SAM 2 e aos modelos anteriores de última geração em benchmarks de vídeo, como DAVIS 2017 e YouTube-VOS:

BenchmarkMétricaSAM 3SAM 2.1 LMelhoria
MOSEv2J&F60.147.9+25.5%
DAVIS 2017J&F92.090.7+1.4%
LVOSv2J&F88.279.6+10.8%
SA-VJ&F84.678.4+7.9%
YTVOS19J&F89.689.3+0.3%

Adaptação com poucos exemplos#

O SAM 3 é excelente na adaptação a novos domínios com poucos exemplos, algo relevante para os fluxos de trabalho de IA centrada em dados:

BenchmarkAP com 0 exemplosAP com 10 exemplosMelhor resultado anterior (10 exemplos)
ODinW1359.971.667.9 (gDino1.5-Pro)
RF100-VL14.335.733.7 (gDino-T)

Eficácia do refinamento interativo#

A solicitação baseada em conceitos do SAM 3, com exemplos, converge muito mais rapidamente do que a solicitação visual:

Prompts adicionadosPontuação CGF1Ganho em relação a apenas textoGanho em relação à referência PVS
Apenas texto46.4referênciareferência
+1 exemplo57.6+11.2+6.7
+2 exemplos62.2+15.8+9.7
+3 exemplos65.0+18.6+11.2
+4 exemplos65.7+19.3+11.5 (estabilização)

Precisão da contagem de objetos#

O SAM 3 fornece contagens precisas ao segmentar todas as instâncias, um requisito comum na contagem de objetos:

BenchmarkPrecisãoMAEem relação ao melhor MLLM
CountBench95.6%0.1192.4% (Gemini 2.5)
PixMo-Count87.3%0.2288.8% (Molmo-72B)

Comparação entre SAM 3, SAM 2 e YOLO#

Aqui comparamos as capacidades do SAM 3 com as dos modelos SAM 2 e YOLO26. Para deteção e segmentação em tempo real com vocabulário aberto usando os mesmos tipos de prompts, consulta YOLOE:

CapacidadeSAM 3SAM 2YOLO26n-seg
Segmentação de conceitos✅ Todas as instâncias a partir de texto/exemplos❌ Não suportado❌ Não suportado
Segmentação visual✅ Instância única (compatível com SAM 2)✅ Instância única✅ Todas as instâncias
Capacidade zero-shot✅ Vocabulário aberto✅ Prompts geométricos❌ Conjunto fechado
Refinamento interativo✅ Exemplos + cliques✅ Apenas cliques❌ Não suportado
Rastreamento de vídeo✅ Vários objetos com identidades✅ Vários objetos✅ Vários objetos
AP de máscara LVIS (zero-shot)47.0N/DN/D
MOSEv2 J&F60.147.9N/D
Velocidade (GPU, ms/im)29218578.4
Tamanho do modelo3.45 GB162 MB (base)6.4 MB

Velocidade medida numa NVIDIA RTX PRO 6000 com torch==2.9.1 e ultralytics==8.4.19.

Principais conclusões:

  • SAM 3: Ideal para segmentação de conceitos com vocabulário aberto, encontrando todas as instâncias de um conceito com prompts de texto ou de exemplos
  • SAM 2: Ideal para a segmentação interativa de um único objeto em imagens e vídeos com prompts geométricos
  • YOLO26: Ideal para segmentação em tempo real e alta velocidade, com inferência de ponta a ponta opcional sem NMS, exportável para muitos formatos para implementação em GPUs, CPUs e dispositivos de borda

Comparação entre SAM e YOLO#

Compara o SAM 3, o SAM 2, o SAM, o MobileSAM e o FastSAM com os modelos de segmentação Ultralytics YOLO (YOLOv8, YOLO11, YOLO26) em tamanho, parâmetros e velocidade de inferência na GPU:

ModeloTamanho
(MB)
Parâmetros
(M)
Velocidade (GPU)
(ms/im)
Meta SAM-b37593.71306
Meta SAM2-b16280.8857
Meta SAM2-t78.138.9668
Meta SAM33450473.62921
MobileSAM40.710.1605
FastSAM-s com backbone YOLOv823.711.855.9
Ultralytics YOLOv8n-seg6.7 (515x menor)3.4 (139.1x menos)17.4 (167x mais rápido)
Ultralytics YOLO11n-seg5.9 (585x menor)2.9 (163.1x menos)12.6 (231x mais rápido)
Ultralytics YOLO26n-seg6.4 (539x menor)2.7 (175.2x menos)8.4 (347x mais rápido)

Esta comparação demonstra as diferenças substanciais entre os tamanhos e as velocidades dos modelos das variantes SAM e dos modelos de segmentação YOLO. Embora o SAM ofereça recursos exclusivos de segmentação automática, os modelos YOLO, especialmente YOLOv8n-seg, YOLO11n-seg e YOLO26n-seg, são significativamente menores, mais rápidos e mais eficientes em termos computacionais.

Os testes foram executados em uma NVIDIA RTX PRO 6000 com 96 GB de VRAM usando torch==2.9.1 e ultralytics==8.4.19. Para reproduzir este teste:

Exemplo
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Perfilar SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Perfilar FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Perfilar modelos YOLO
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    model(ASSETS, nms=False)  # Cabeça sem NMS do YOLO26; sem efeito para YOLOv8/YOLO11

Métricas de avaliação#

O SAM 3 introduz novas métricas desenvolvidas para a tarefa PCS, complementando medidas conhecidas, como pontuação F1, precisão e revocação.

F1 condicionado à classificação (CGF1)#

A métrica principal, que combina localização e classificação:

CGF1 = 100 × pmF1 × IL_MCC

Onde:

  • pmF1 (F1 macro positivo): mede a qualidade da localização em exemplos positivos
  • IL_MCC (coeficiente de correlação de Matthews no nível da imagem): mede a precisão da classificação binária ("o conceito está presente?")

Por que estas métricas?#

As métricas AP tradicionais não levam em conta a calibração, o que dificulta o uso dos modelos na prática. Ao avaliar apenas as previsões com confiança acima de 0.5, as métricas do SAM 3 exigem uma boa calibração e reproduzem padrões de uso do mundo real em ciclos interativos de predição e rastreamento.

Principais ablações e conclusões#

Impacto da cabeça de presença#

A cabeça de presença separa o reconhecimento da localização, proporcionando melhorias significativas:

ConfiguraçãoCGF1IL_MCCpmF1
Sem presença57.60.7774.7
Com presença63.30.8277.1

A cabeça de presença proporciona um aumento de 5.7 no CGF1 (+9.9%), melhorando principalmente a capacidade de reconhecimento (IL_MCC +6.5%).

Efeito dos exemplos negativos difíceis#

Exemplos negativos difíceis/imagemCGF1IL_MCCpmF1
031.80.4470.2
544.80.6271.9
3049.20.6872.3

Os exemplos negativos difíceis são essenciais para o reconhecimento de vocabulário aberto, melhorando o IL_MCC em 54.5% (0.44 → 0.68).

Escalonamento dos dados de treinamento#

Fontes de dadosCGF1IL_MCCpmF1
Somente externos30.90.4666.3
Externos + sintéticos39.70.5770.6
Externos + HQ51.80.7173.2
Os três54.30.7473.5

Anotações humanas de alta qualidade proporcionam grandes ganhos em relação a dados sintéticos ou externos usados isoladamente. Para saber mais sobre práticas de qualidade de dados, consulta coleta e anotação de dados.

Aplicações#

O recurso de segmentação de conceitos do SAM 3 possibilita novos casos de uso:

  • Moderação de conteúdo: encontrar todas as ocorrências de tipos específicos de conteúdo em bibliotecas de mídia
  • Comércio eletrônico: segmentar todos os produtos de um determinado tipo em imagens de catálogo, permitindo a anotação automática
  • Imagens médicas: identificar todas as ocorrências de tipos específicos de tecidos ou anomalias
  • Sistemas autônomos: rastrear todas as ocorrências de sinais de trânsito, pedestres ou veículos por categoria
  • Análise de vídeo: contar e rastrear todas as pessoas que usam roupas específicas ou realizam determinadas ações
  • Anotação de conjuntos de dados: anotar rapidamente todas as ocorrências de categorias raras de objetos
  • Pesquisa científica: quantificar e analisar todos os espécimes que correspondem a critérios específicos

Agente SAM 3: raciocínio linguístico ampliado#

O SAM 3 pode ser combinado com modelos de linguagem grandes multimodais (MLLMs) para lidar com consultas complexas que exigem raciocínio, de forma semelhante a sistemas de vocabulário aberto como OWLv2 e T-Rex.

Desempenho em tarefas de raciocínio#

BenchmarkMétricaAgente SAM 3 (Gemini 2.5 Pro)Melhor resultado anterior
ReasonSeg (validação)gIoU76.065.0 (estado da arte)
ReasonSeg (teste)gIoU73.861.3 (estado da arte)
OmniLabel (validação)AP46.736.5 (REAL)
RefCOCO+Acc91.289.3 (LISA)

Exemplos de consultas complexas#

O agente SAM 3 consegue lidar com consultas que exigem raciocínio:

  • "Pessoas sentadas, mas sem segurar uma caixa de presente nas mãos"
  • "O cachorro mais perto da câmera que não está usando coleira"
  • "Objetos vermelhos maiores que a mão da pessoa"

O MLLM propõe consultas com sintagmas nominais simples ao SAM 3, analisa as máscaras retornadas e repete o processo até ficar satisfeito.

Limitações#

Embora o SAM 3 represente um grande avanço, ele tem algumas limitações:

  • Complexidade das frases: é mais adequado para sintagmas nominais simples; expressões referenciais longas ou raciocínios complexos podem exigir integração com MLLM
  • Como lida com ambiguidades: alguns conceitos continuam sendo inerentemente ambíguos (por exemplo, "janela pequena", "quarto aconchegante")
  • Requisitos computacionais: é maior e mais lento que modelos de detecção especializados, como YOLO
  • Escopo do vocabulário: concentra-se em conceitos visuais atômicos; o raciocínio composicional é limitado sem a assistência de MLLM
  • Conceitos raros: o desempenho pode cair em conceitos extremamente raros ou específicos que não estejam bem representados nos dados de treinamento

Citação#

Citação
@misc{carion2025sam3,
  title         = {SAM 3: Segment Anything with Concepts},
  author        = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  year          = {2025},
  eprint        = {2511.16719},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2511.16719}
}

Perguntas frequentes#

  • O SAM 3 foi lançado pela Meta em 19 de novembro de 2025 e está totalmente integrado ao pacote ultralytics, com suporte ao modo de predição e ao modo de rastreamento.

  • Sim! O SAM 3 está totalmente integrado ao pacote Python da Ultralytics, incluindo segmentação de conceitos, prompts visuais no estilo do SAM 2 e rastreamento de vários objetos em vídeo. O SAM 3 e o SAM 3.1 também alimentam o recurso de anotação inteligente na Plataforma Ultralytics, onde o SAM 3.1 é o modelo padrão e podes anotar imagens com apenas alguns cliques.

  • Sim, para predição de imagens. Carrega sam3.1_multiplex.pt onde os exemplos de imagem nesta página usam sam3.pt: SAM("sam3.1_multiplex.pt") para prompts de pontos e caixas, e SAM3SemanticPredictor para prompts de texto e exemplos. O rastreamento de vídeo Object Multiplex ainda não é compatível, por isso continua a usar sam3.pt com os preditores de vídeo. Consulta SAM 3.1 para ver os benchmarks da Meta.

  • PCS é uma nova tarefa introduzida no SAM 3 que segmenta todas as ocorrências de um conceito visual em uma imagem ou vídeo. Ao contrário da segmentação tradicional, que tem como alvo uma ocorrência específica de um objeto, PCS encontra todas as ocorrências de uma categoria. Por exemplo:

    • Prompt de texto: "ônibus escolar amarelo" → segmenta todos os ônibus escolares amarelos na cena
    • Exemplo de imagem: caixa à volta de um cão → segmenta todos os cães na imagem
    • Combinado: «gato às riscas» + caixa de exemplo → segmenta todos os gatos às riscas que correspondem ao exemplo

    Consulta informações relacionadas sobre deteção de objetos e segmentação de instâncias.

  • FuncionalidadeSAM 2SAM 3
    TarefaUm objeto por promptTodas as instâncias de um conceito
    Tipos de promptPontos, caixas, máscaras+ Frases de texto, exemplos de imagem
    Capacidade de deteçãoRequer um detetor externoDetetor de vocabulário aberto integrado
    ReconhecimentoApenas com base na geometriaReconhecimento textual e visual
    ArquiteturaApenas rastreadorDetetor + rastreador com uma cabeça de presença
    Desempenho zero-shotN/D (requer prompts visuais)47,0 AP no LVIS, 2× melhor no SA-Co
    Refinamento interativoApenas cliquesCliques + generalização a partir de exemplos

    O SAM 3 mantém a compatibilidade com versões anteriores dos prompts visuais do SAM 2, acrescentando capacidades baseadas em conceitos.

  • O SAM 3 é treinado no conjunto de dados Segment Anything with Concepts (SA-Co):

    Dados de treino:

    • 5,2 milhões de imagens com 4 milhões de frases nominais únicas (SA-Co/HQ) — anotações humanas de alta qualidade
    • 52,5 mil vídeos com 24,8 mil frases nominais únicas (SA-Co/VIDEO)
    • 1,4 mil milhões de máscaras sintéticas em 38 milhões de frases nominais (SA-Co/SYN)
    • 15 conjuntos de dados externos enriquecidos com negativos difíceis (SA-Co/EXT)

    Dados de benchmark:

    • 214 mil conceitos únicos em 126 mil imagens/vídeos
    • 50× mais conceitos do que os benchmarks existentes (por exemplo, o LVIS tem ~4 mil conceitos)
    • Anotação tripla no SA-Co/Gold para medir os limites do desempenho humano

    Esta escala e diversidade extraordinárias permitem ao SAM 3 uma generalização zero-shot superior a conceitos de vocabulário aberto.

  • O SAM 3 e o YOLO26 destinam-se a casos de utilização diferentes:

    Vantagens do SAM 3:

    • Vocabulário aberto: segmenta qualquer conceito através de prompts de texto, sem treino
    • Zero-shot: funciona imediatamente com novas categorias
    • Interativo: o refinamento baseado em exemplos generaliza-se a objetos semelhantes
    • Baseado em conceitos: encontra automaticamente todas as instâncias de uma categoria
    • Precisão: 47,0 AP na segmentação zero-shot de instâncias no LVIS

    Vantagens do YOLO26:

    • Velocidade: inferência muitas ordens de grandeza mais rápida, com uma cabeça ponta a ponta opcional sem NMS
    • Eficiência: modelos 539× mais pequenos (6,4 MB vs. 3,45 GB)
    • Eficiente em recursos: funciona em dispositivos de edge e telemóveis
    • Tempo real: otimizado para implementações em produção

    Recomendação:

    • Usa o SAM 3 para segmentação flexível de vocabulário aberto, quando precisas de encontrar todas as instâncias de conceitos descritos por texto ou exemplos
    • Usa o YOLO26 para implementações de alta velocidade em produção, quando as categorias são conhecidas antecipadamente
    • Usa o SAM 2 para segmentação interativa de um único objeto com prompts geométricos
  • O SAM 3 foi concebido para frases nominais simples (por exemplo, «maçã vermelha», «pessoa com chapéu»). Para consultas complexas que exigem raciocínio, combina o SAM 3 com um MLLM como SAM 3 Agent:

    Consultas simples (SAM 3 nativo):

    • «autocarro escolar amarelo»
    • «gato às riscas»
    • «pessoa com chapéu vermelho»

    Consultas complexas (SAM 3 Agent com MLLM):

    • «Pessoas sentadas, mas sem segurar uma caixa de presente»
    • «O cão mais próximo da câmara sem coleira»
    • "Objetos vermelhos maiores que a mão da pessoa"

    O SAM 3 Agent alcança 76,0 gIoU na validação do ReasonSeg (contra 65,0 do melhor resultado anterior, uma melhoria de +16,9%) ao combinar a segmentação do SAM 3 com as capacidades de raciocínio do MLLM.

  • No benchmark SA-Co/Gold com anotação humana tripla:

    • Limite inferior humano: 74,2 CGF1 (anotador mais conservador)
    • Desempenho do SAM 3: 65,0 CGF1
    • Resultado: 88% do limite inferior humano estimado
    • Limite superior humano: 81,4 CGF1 (anotador mais permissivo)

    O SAM 3 alcança um desempenho elevado, aproximando-se da precisão humana na segmentação de conceitos de vocabulário aberto, com a diferença a verificar-se sobretudo em conceitos ambíguos ou subjetivos (por exemplo, «janela pequena», «sala acolhedora»).

Comentários