SAM 2: Segment Anything Model 2#
O SAM 2, o sucessor do Segment Anything Model (SAM) da Meta, é uma ferramenta de ponta concebida para a segmentação abrangente de objetos em imagens e vídeos. Destaca-se no tratamento de dados visuais complexos através de uma arquitetura de modelo unificada e orientada por prompts que suporta processamento em tempo real e generalização zero-shot.
Os modelos SAM 2.1 alimentam o recurso de anotação inteligente na Ultralytics Platform, permitindo a segmentação baseada em cliques para uma rotulagem rápida de conjuntos de dados. Consulta o guia de anotação para obteres detalhes.

Principais recursos#
Watch: How to Run Inference with Meta's SAM2 using Ultralytics | Step-by-Step Guide 🎉
Arquitetura de Modelo Unificada#
O SAM 2 combina as capacidades de segmentação de imagem e vídeo num único modelo. Esta unificação simplifica a implementação e permite um desempenho consistente em diferentes tipos de média. Utiliza uma interface flexível baseada em prompts, permitindo aos utilizadores especificar objetos de interesse através de vários tipos de prompts, tais como pontos, caixas delimitadoras ou máscaras.
Desempenho em Tempo Real#
O modelo atinge velocidades de inferência em tempo real, processando aproximadamente 44 fotogramas por segundo. Isto torna o SAM 2 adequado para aplicações que requerem feedback imediato, como a edição de vídeo e a realidade aumentada.
Generalização Zero-Shot#
O SAM 2 consegue segmentar objetos que nunca encontrou antes, demonstrando uma forte generalização zero-shot. Isto é particularmente útil em domínios visuais diversos ou em evolução, onde as categorias pré-definidas podem não abranger todos os objetos possíveis.
Refinamento Interativo#
Podes refinar iterativamente os resultados da segmentação fornecendo prompts adicionais, permitindo um controlo preciso sobre a saída. Esta interatividade é essencial para afinar os resultados em aplicações como a anotação de vídeo ou a imagem médica.
Tratamento Avançado de Desafios Visuais#
O SAM 2 inclui mecanismos para gerir desafios comuns de segmentação de vídeo, tais como a oclusão e o reaparecimento de objetos. Utiliza um mecanismo de memória sofisticado para monitorizar objetos ao longo dos fotogramas, garantindo a continuidade mesmo quando os objetos estão temporariamente obscurecidos ou saem e entram novamente na cena.
Para uma compreensão mais profunda da arquitetura e das capacidades do SAM 2, explora o artigo de investigação do SAM 2.
Desempenho e Detalhes Técnicos#
O SAM 2 estabelece uma nova referência na área, superando os modelos anteriores em várias métricas:
| Métrica | SAM 2 | SOTA Anterior |
|---|---|---|
| Segmentação de Vídeo Interativa | Melhor | - |
| Interações Humanas Necessárias | 3x menos | Base |
| Precisão de Segmentação de Imagem | Melhorada | SAM |
| Velocidade de Inferência | 6x mais rápido | SAM |
Arquitetura do Modelo#
Componentes Principais#
- Codificador de Imagem e Vídeo: Utiliza uma arquitetura baseada em transformer para extrair caraterísticas de alto nível de imagens e fotogramas de vídeo. Este componente é responsável por compreender o conteúdo visual em cada passo temporal.
- Codificador de Prompts: Processa os prompts fornecidos pelo utilizador (pontos, caixas, máscaras) para guiar a tarefa de segmentação. Isto permite que o SAM 2 se adapte à entrada do utilizador e vise objetos específicos dentro de uma cena.
- Mecanismo de Memória: Inclui um codificador de memória, um banco de memória e um módulo de atenção à memória. Estes componentes armazenam e utilizam coletivamente informações de fotogramas anteriores, permitindo que o modelo mantenha um rastreio de objetos consistente ao longo do tempo.
- Descodificador de Máscaras: Gera as máscaras de segmentação finais com base nas caraterísticas de imagem codificadas e nos prompts. Em vídeo, também utiliza o contexto de memória para garantir um rastreio preciso entre fotogramas.

Mecanismo de Memória e Gestão de Oclusões#
O mecanismo de memória permite que o SAM 2 lidem com dependências temporais e oclusões em dados de vídeo. À medida que os objetos se movimentam e interagem, o SAM 2 grava as suas caraterísticas num banco de memória. Quando um objeto fica ocluído, o modelo pode contar com esta memória para prever a sua posição e aspeto quando este reaparecer. O cabeçalho de oclusão lida especificamente com cenários onde os objetos não estão visíveis, prevendo a probabilidade de um objeto estar ocluído.
Resolução de Ambiguidade de Várias Máscaras#
Em situações com ambiguidade (por exemplo, objetos sobrepostos), o SAM 2 pode gerar várias previsões de máscaras. Este recurso é crucial para representar com precisão cenas complexas onde uma única máscara pode não descrever suficientemente as nuances da cena.
Conjunto de Dados SA-V#
O conjunto de dados SA-V, desenvolvido para o treino do SAM 2, é um dos maiores e mais diversos conjuntos de dados de segmentação de vídeo disponíveis. Inclui:
- Mais de 51.000 Vídeos: Capturados em 47 países, proporcionando uma ampla gama de cenários do mundo real.
- Mais de 600.000 Anotações de Máscaras: Anotações de máscaras espaço-temporais detalhadas, designadas por "masklets", que cobrem objetos inteiros e partes.
- Escala do Conjunto de Dados: Apresenta 4,5 vezes mais vídeos e 53 vezes mais anotações do que os maiores conjuntos de dados anteriores, oferecendo uma diversidade e complexidade sem precedentes.
Benchmarks#
Segmentação de Objetos em Vídeo#
O SAM 2 demonstrou um desempenho superior em principais benchmarks de segmentação de vídeo:
| Conjunto de dados | J&F | J | F |
|---|---|---|---|
| DAVIS 2017 | 82.5 | 79.8 | 85.2 |
| YouTube-VOS | 81.2 | 78.9 | 83.5 |
Segmentação Interativa#
Em tarefas de segmentação interativa, o SAM 2 mostra uma eficiência e precisão significativas:
| Conjunto de dados | NoC@90 | AUC |
|---|---|---|
| DAVIS Interactive | 1.54 | 0.872 |
Instalação#
Para instalares o SAM 2, utiliza o seguinte comando. Todos os modelos SAM 2 serão descarregados automaticamente na primeira utilização.
pip install ultralyticsComo Usar o SAM 2: Versatilidade na Segmentação de Imagem e Vídeo#
A tabela seguinte detalha os modelos SAM 2 disponíveis, os respetivos pesos pré-treinados, as tarefas suportadas e a compatibilidade com diferentes modos de operação como Inference, Validation, Training e Export.
| Tipo de Modelo | Pesos Pré-treinados | Tarefas Suportadas | Treinamento | Validação | Inferência | Exportar |
|---|---|---|---|---|---|---|
| SAM 2 tiny | sam2_t.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
| SAM 2 small | sam2_s.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
| SAM 2 base | sam2_b.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
| SAM 2 large | sam2_l.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 tiny | sam2.1_t.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 small | sam2.1_s.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 base | sam2.1_b.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 large | sam2.1_l.pt | Segmentação de instâncias | ❌ | ❌ | ✅ | ❌ |
Exemplos de Previsão do SAM 2#
O SAM 2 pode ser utilizado numa ampla gama de tarefas, incluindo edição de vídeo em tempo real, imagem médica e sistemas autónomos. A sua capacidade de segmentar dados visuais estáticos e dinâmicos torna-o uma ferramenta versátil para investigadores e programadores.
Segmentar com Prompts#
Usa prompts para segmentar objetos específicos em imagens ou vídeos.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference with bboxes prompt
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
# Run inference with single point
results = model(points=[900, 370], labels=[1])
# Run inference with multiple points
results = model(points=[[400, 370], [900, 370]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 0]])Segmentar Tudo#
Segmenta todo o conteúdo de imagem ou vídeo sem prompts específicos.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference
model("path/to/video.mp4")Segmentar Vídeo e Rastrear objetos#
Segmenta todo o conteúdo do vídeo com prompts específicos e rastreia objetos.
from ultralytics.models.sam import SAM2VideoPredictor
# Create SAM2VideoPredictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_b.pt"}
predictor = SAM2VideoPredictor(overrides=overrides)
# Run inference with single point
results = predictor(source="test.mp4", points=[920, 470], labels=[1])
# Run inference with multiple points
results = predictor(source="test.mp4", points=[[920, 470], [909, 138]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 0]])- Este exemplo demonstra como o SAM 2 pode ser utilizado para segmentar todo o conteúdo de uma imagem ou vídeo se não forem fornecidos nenhuns prompts (bboxes/pontos/máscaras).
Segmentação e Rastreio Interativos Dinâmicos#
O SAM2DynamicInteractivePredictor é uma extensão avançada do SAM2 que não requer treino e permite a interação dinâmica com múltiplos fotogramas e capacidades de aprendizagem contínua. Este preditor suporta atualizações de prompts em tempo real e gestão de memória para um melhor desempenho de rastreio ao longo de uma sequência de imagens. Em comparação com o SAM2 original, o SAM2DynamicInteractivePredictor reconstrói o fluxo de inferência para tirar o máximo partido dos modelos SAM2 pré-treinados sem exigir treino adicional.

Principais recursos#
Oferece três melhorias significativas:
- Interativo Dinâmico: Adiciona novos prompts para fundir/não rastrear novas instâncias nos fotogramas seguintes a qualquer momento durante o processamento de vídeo
- Aprendizagem Contínua: Adiciona novos prompts para instâncias existentes para melhorar o desempenho do modelo ao longo do tempo
- Suporte a Várias Imagens Independentes: Processa múltiplas imagens independentes (não necessariamente de uma sequência de vídeo) com partilha de memória e rastreio de objetos entre imagens
Capacidades Principais#
- Flexibilidade de Prompts: Aceita caixas delimitadoras, pontos e máscaras como prompts
- Gestão do Banco de Memória: Mantém um banco de memória dinâmico para armazenar os estados dos objetos entre fotogramas
- Rastreio de Múltiplos Objetos: Suporta o rastreio de vários objetos em simultâneo com IDs de objeto individuais
- Atualizações em Tempo Real: Permite adicionar novos prompts durante a inferência sem reprocessar os quadros anteriores
- Processamento de Imagem Independente: Processa imagens isoladas com contexto de memória compartilhado para consistência de objetos entre imagens
from ultralytics.models.sam import SAM2DynamicInteractivePredictor
# Create SAM2DynamicInteractivePredictor
overrides = {"conf": 0.01, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_t.pt", "save": False}
predictor = SAM2DynamicInteractivePredictor(overrides=overrides, max_obj_num=10)
# Define a category by box prompt
predictor(source="image1.jpg", bboxes=[[100, 100, 200, 200]], obj_ids=[0], update_memory=True)
# Detect this particular object in a new image
results = predictor(source="image2.jpg")
# Add new category with a new object ID
results = predictor(
source="image4.jpg",
bboxes=[[300, 300, 400, 400]], # New object
obj_ids=[1], # New object ID
update_memory=True, # Add to memory
)
# Perform inference
results = predictor(source="image5.jpg")
# Add refinement prompts to the same category to boost performance
# This helps when object appearance changes significantly
results = predictor(
source="image6.jpg",
points=[[150, 150]], # Refinement point
labels=[1], # Positive point
obj_ids=[1], # Same object ID
update_memory=True, # Update memory with new information
)
# Perform inference on new image
results = predictor(source="image7.jpg")O SAM2DynamicInteractivePredictor foi projetado para funcionar com modelos SAM2 e suporta adicionar/refinar categorias nativamente por todos os prompts de caixa/ponto/máscara que o SAM2 suporta. Ele é particularmente útil para cenários onde objetos aparecem ou mudam ao longo do tempo, como em tarefas de anotação de vídeo ou edição interativa.
Argumentos#
| Nome | Valor Padrão | Tipo de dados | Descrição |
|---|---|---|---|
max_obj_num | 3 | int | O número máximo predefinido de categorias |
update_memory | False | bool | Se deve atualizar a memória com novos prompts |
obj_ids | None | List[int] | Lista de IDs de objetos correspondentes aos prompts |
Casos de Uso#
O SAM2DynamicInteractivePredictor é ideal para:
- Fluxos de trabalho de anotação de vídeo onde novos objetos aparecem durante a sequência
- Edição de vídeo interativa que requer adição e refinamento de objetos em tempo real
- Aplicações de vigilância com necessidades de rastreamento dinâmico de objetos
- Imagem médica para rastrear estruturas anatômicas ao longo de séries temporais
- Sistemas autônomos que exigem detecção e rastreamento adaptativos de objetos
- Conjuntos de dados de múltiplas imagens para segmentação consistente de objetos em imagens independentes
- Análise de coleções de imagens onde os objetos precisam ser rastreados em diferentes cenas
- Segmentação entre domínios aproveitando a memória de diversos contextos de imagem
- Anotação semiautomática para criação eficiente de conjuntos de dados com intervenção manual mínima
Comparação SAM vs YOLO#
Aqui comparamos os modelos SAM 2 da Meta, incluindo a variante menor SAM2-t, com os modelos de segmentação Ultralytics, incluindo o YOLO26n-seg:
| Modelo | Tamanho (MB) | Parâmetros (M) | Velocidade (CPU) (ms/im) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 41703 |
| Meta SAM2-b | 162 | 80.8 | 28867 |
| Meta SAM2-t | 78.1 | 38.9 | 23430 |
| MobileSAM | 40.7 | 10.1 | 23802 |
| FastSAM-s com backbone YOLOv8 | 23.9 | 11.8 | 58.0 |
| YOLOv8n-seg da Ultralytics | 7.1 (11.0x menor) | 3.4 (11.4x menos) | 24.8 (945x mais rápido) |
| YOLO11n-seg da Ultralytics | 6.2 (12.6x menor) | 2.9 (13.4x menos) | 24.3 (964x mais rápido) |
| YOLO26n-seg da Ultralytics | 6.7 (11.7x menor) | 2.7 (14.4x menos) | 25.2 (930x mais rápido) |
Esta comparação demonstra as diferenças substanciais nos tamanhos e velocidades dos modelos entre as variantes do SAM e os modelos de segmentação YOLO. Enquanto o SAM fornece capacidades de segmentação automática únicas, os modelos YOLO, particularmente YOLOv8n-seg, YOLO11n-seg e YOLO26n-seg, são significativamente menores, mais rápidos e computacionalmente mais eficientes.
Velocidades do SAM medidas com PyTorch, velocidades YOLO medidas com ONNX Runtime. Testes realizados num Apple M4 Air de 2025 com 16GB de RAM usando torch==2.10.0, ultralytics==8.4.31 e onnxruntime==1.24.4. Para reproduzir este teste:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# Profile SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# Profile YOLO models (ONNX)
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
onnx_path = model.export(format="onnx", dynamic=True)
model = YOLO(onnx_path)
model(ASSETS)Auto-anotação: Criação Eficiente de Conjuntos de Dados#
A auto-anotação é um recurso poderoso do SAM 2, permitindo que os usuários gerem conjuntos de dados de segmentação de forma rápida e precisa, aproveitando modelos pré-treinados. Essa capacidade é particularmente útil para criar conjuntos de dados grandes e de alta qualidade sem esforço manual extensivo.
Como Fazer Auto-Anotação com o SAM 2#
Watch: Auto Annotation with Meta's Segment Anything 2 Model using Ultralytics | Data Labeling
Para auto-anotar seu conjunto de dados usando o SAM 2, siga este exemplo:
from ultralytics.data.annotator import auto_annotate
auto_annotate(data="path/to/images", det_model="yolo26x.pt", sam_model="sam2_b.pt")| Argumento | Tipo | Predefinição | Descrição |
|---|---|---|---|
data | str | obrigatório | Caminho para o diretório contendo as imagens alvo para anotação ou segmentação. |
det_model | str | 'yolo26x.pt' | Caminho do modelo de deteção YOLO para a deteção inicial de objetos. |
sam_model | str | 'sam_b.pt' | Caminho do modelo SAM para segmentação (suporta pesos SAM, SAM 2, MobileSAM e SAM 3). |
device | str | '' | Dispositivo de computação (ex: 'cuda:0', 'cpu', ou '' para deteção automática de dispositivo). |
conf | float | 0.25 | Limiar de confiança de deteção YOLO para filtrar deteções fracas. |
iou | float | 0.45 | Limiar de IoU para Non-Maximum Suppression para filtrar caixas sobrepostas. |
imgsz | int | 640 | Tamanho de entrada para redimensionar imagens (deve ser múltiplo de 32). |
max_det | int | 300 | Número máximo de deteções por imagem para eficiência de memória. |
classes | list[int] | None | Lista de índices de classe para detetar (ex: [0, 1] para pessoa e bicicleta). |
output_dir | str | None | Diretório de salvamento para anotações (padrão: <data>_auto_annotate_labels irmão). |
Esta função facilita a criação rápida de conjuntos de dados de segmentação de alta qualidade, ideal para pesquisadores e desenvolvedores que visam acelerar seus projetos.
Limitações#
Apesar de seus pontos fortes, o SAM 2 tem certas limitações:
- Estabilidade de Rastreamento: O SAM 2 pode perder o rastro de objetos durante sequências estendidas ou mudanças significativas de ponto de vista.
- Confusão de Objetos: O modelo às vezes pode confundir objetos de aparência semelhante, particularmente em cenas lotadas.
- Eficiência com Múltiplos Objetos: A eficiência da segmentação diminui ao processar vários objetos simultaneamente devido à falta de comunicação entre objetos.
- Precisão dos Detalhes: Pode perder detalhes finos, especialmente com objetos em movimento rápido. Prompts adicionais podem resolver parcialmente esse problema, mas a suavidade temporal não é garantida.
Citações e Agradecimentos#
Se o SAM 2 for uma parte crucial do seu trabalho de pesquisa ou desenvolvimento, cite-o usando a seguinte referência:
@article{ravi2024sam2,
title={SAM 2: Segment Anything in Images and Videos},
author={Ravi, Nikhila and Gabeur, Valentin and Hu, Yuan-Ting and Hu, Ronghang and Ryali, Chaitanya and Ma, Tengyu and Khedr, Haitham and R{\"a}dle, Roman and Rolland, Chloe and Gustafson, Laura and Mintun, Eric and Pan, Junting and Alwala, Kalyan Vasudev and Carion, Nicolas and Wu, Chao-Yuan and Girshick, Ross and Doll{\'a}r, Piotr and Feichtenhofer, Christoph},
journal={arXiv preprint},
year={2024}
}Estendemos nossa gratidão à Meta AI por suas contribuições para a comunidade de IA com este modelo e conjunto de dados inovadores.
FAQ#
O que é o SAM 2 e como ele melhora o Segment Anything Model (SAM) original?#
O SAM 2, o sucessor do Segment Anything Model (SAM) da Meta, é uma ferramenta de ponta projetada para segmentação abrangente de objetos em imagens e vídeos. Ele se destaca no tratamento de dados visuais complexos por meio de uma arquitetura de modelo unificada e com suporte a prompts que permite processamento em tempo real e generalização zero-shot. O SAM 2 oferece várias melhorias em relação ao SAM original, incluindo:
- Arquitetura de Modelo Unificada: Combina recursos de segmentação de imagem e vídeo em um único modelo.
- Desempenho em Tempo Real: Processa aproximadamente 44 quadros por segundo, tornando-o adequado para aplicações que exigem feedback imediato.
- Generalização Zero-Shot: Segmenta objetos que ele nunca encontrou antes, sendo útil em diversos domínios visuais.
- Refinamento Interativo: Permite aos usuários refinar iterativamente os resultados da segmentação fornecendo prompts adicionais.
- Tratamento Avançado de Desafios Visuais: Gerencia desafios comuns de segmentação de vídeo, como oclusão e reaparecimento de objetos.
Para mais detalhes sobre a arquitetura e os recursos do SAM 2, explore o artigo de pesquisa do SAM 2.
Como posso usar o SAM 2 para segmentação de vídeo em tempo real?#
O SAM 2 pode ser utilizado para segmentação de vídeo em tempo real aproveitando sua interface baseada em prompts e recursos de inferência em tempo real. Aqui está um exemplo básico:
Usa prompts para segmentar objetos específicos em imagens ou vídeos.
from ultralytics import SAM
# Load a model
model = SAM("sam2_b.pt")
# Display model information (optional)
model.info()
# Segment with bounding box prompt
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
# Segment with point prompt
results = model("path/to/image.jpg", points=[150, 150], labels=[1])Para um uso mais abrangente, consulte a seção Como Usar o SAM 2.
Quais conjuntos de dados são usados para treinar o SAM 2 e como eles melhoram seu desempenho?#
O SAM 2 é treinado no conjunto de dados SA-V, um dos maiores e mais diversos conjuntos de dados de segmentação de vídeo disponíveis. O conjunto de dados SA-V inclui:
- Mais de 51.000 Vídeos: Capturados em 47 países, proporcionando uma ampla gama de cenários do mundo real.
- Mais de 600.000 Anotações de Máscaras: Anotações de máscaras espaço-temporais detalhadas, designadas por "masklets", que cobrem objetos inteiros e partes.
- Escala do Conjunto de Dados: Apresenta 4,5 vezes mais vídeos e 53 vezes mais anotações do que os maiores conjuntos de dados anteriores, oferecendo diversidade e complexidade sem precedentes.
Este extenso conjunto de dados permite que o SAM 2 alcance desempenho superior nos principais benchmarks de segmentação de vídeo e aprimora seus recursos de generalização zero-shot. Para mais informações, consulte a seção Conjunto de Dados SA-V.
Como o SAM 2 lida com oclusões e reaparecimentos de objetos na segmentação de vídeo?#
O SAM 2 inclui um mecanismo de memória sofisticado para gerenciar dependências temporais e oclusões em dados de vídeo. O mecanismo de memória consiste em:
- Codificador de Memória e Banco de Memória: Armazena recursos de quadros anteriores.
- Módulo de Atenção de Memória: Utiliza informações armazenadas para manter o rastreamento consistente de objetos ao longo do tempo.
- Cabeça de Oclusão: Lida especificamente com cenários em que os objetos não estão visíveis, prevendo a probabilidade de um objeto estar ocluído.
Esse mecanismo garante continuidade mesmo quando os objetos ficam temporariamente ocultos ou saem e entram novamente na cena. Para mais detalhes, consulte a seção Mecanismo de Memória e Tratamento de Oclusões.
Como o SAM 2 se compara a outros modelos de segmentação como o YOLO26?#
Os modelos SAM 2, como o SAM2-t e o SAM2-b da Meta, oferecem poderosos recursos de segmentação zero-shot, mas são significativamente maiores e mais lentos em comparação com os modelos YOLO. Por exemplo, o YOLO26n-seg é aproximadamente 24 vezes menor e mais de 1145 vezes mais rápido do que o SAM2-b na CPU. Embora o SAM 2 se destaque em cenários de segmentação versáteis, baseados em prompts e zero-shot, o YOLO26 é otimizado para velocidade, eficiência e aplicações em tempo real com inferência de ponta a ponta sem NMS, tornando-o mais adequado para implantação em ambientes com restrição de recursos.