Ultralytics YOLO27:
Get Started

SAM 2: Modelo que Segmenta Tudo 2#

Evolução do SAM

O SAM 2 desenvolve o SAM original com capacidades de segmentação de vídeo. Para segmentação de conceitos guiada por prompts de texto e exemplos de imagem, consulta o SAM 3.

Inference with Segment Anything 2 In Colab

O SAM 2, sucessor do Modelo que Segmenta Tudo (SAM) da Meta, é uma ferramenta de ponta concebida para a segmentação abrangente de objetos em imagens e vídeos. Destaca-se no processamento de dados visuais complexos através de uma arquitetura de modelo unificada, guiada por prompts, que suporta processamento em tempo real e generalização zero-shot.

SAM 2 na plataforma Ultralytics

Os modelos SAM 2.1 alimentam a funcionalidade de anotação inteligente na plataforma Ultralytics, permitindo a segmentação baseada em cliques para uma rotulagem rápida de conjuntos de dados. Consulta o guia de anotação para mais detalhes.

Resultados de exemplo do SAM 2

Principais funcionalidades#



Assista: Como executar inferência com SAM2 da Meta usando Ultralytics | Guia passo a passo 🎉

Arquitetura de modelo unificada#

O SAM 2 combina as capacidades de segmentação de imagens e vídeos num único modelo. Esta unificação simplifica a implementação e permite um desempenho consistente em diferentes tipos de suporte. O modelo utiliza uma interface flexível baseada em prompts, que permite aos utilizadores especificar os objetos de interesse através de vários tipos de prompts, como pontos, caixas delimitadoras ou máscaras.

Desempenho em tempo real#

O modelo alcança velocidades de inferência em tempo real, processando aproximadamente 44 fotogramas por segundo. Isto torna o SAM 2 adequado para aplicações que exigem resposta imediata, como edição de vídeo e realidade aumentada.

Generalização zero-shot#

O SAM 2 consegue segmentar objetos que nunca encontrou antes, demonstrando forte capacidade de generalização zero-shot. Isso é particularmente útil em domínios visuais diversos ou em evolução, nos quais categorias predefinidas podem não abranger todos os objetos possíveis.

Refinamento interativo#

Os usuários podem refinar os resultados da segmentação iterativamente, fornecendo prompts adicionais e permitindo um controle preciso da saída. Essa interatividade é essencial para ajustar os resultados em aplicações como anotação de vídeos ou imagens médicas.

Tratamento avançado de desafios visuais#

O SAM 2 inclui mecanismos para lidar com desafios comuns da segmentação de vídeos, como oclusão e reaparecimento de objetos. Ele usa um mecanismo sofisticado de memória para acompanhar objetos entre os frames, garantindo a continuidade mesmo quando os objetos ficam temporariamente ocultos ou saem e voltam à cena.

Para entender melhor a arquitetura e os recursos do SAM 2, consulta o artigo de pesquisa do SAM 2.

Desempenho e detalhes técnicos#

O SAM 2 estabelece um novo padrão no campo, superando os modelos anteriores em várias métricas:

MétricaSAM 2Melhor desempenho de ponta anterior
Segmentação interativa de vídeosMelhor-
Interações humanas necessárias3x menosReferência
Precisão da segmentação de imagensMelhoradoSAM
Velocidade de inferência6x mais rápidoSAM

Arquitetura do modelo#

Componentes principais#

  • Codificador de imagens e vídeos: utiliza uma arquitetura baseada em transformer para extrair características de alto nível de imagens e frames de vídeo. Esse componente é responsável por compreender o conteúdo visual em cada instante.
  • Codificador de prompts: processa os prompts fornecidos pelo usuário (pontos, caixas, máscaras) para orientar a tarefa de segmentação. Isso permite que o SAM 2 se adapte à entrada do usuário e direcione a segmentação para objetos específicos da cena.
  • Mecanismo de memória: inclui um codificador de memória, um banco de memória e um módulo de atenção à memória. Em conjunto, esses componentes armazenam e utilizam informações de frames anteriores, permitindo que o modelo mantenha o rastreamento de objetos de forma consistente ao longo do tempo.
  • Decodificador de máscaras: gera as máscaras de segmentação finais com base nas características codificadas da imagem e nos prompts. Em vídeos, também usa o contexto da memória para garantir o rastreamento preciso entre os frames.

Diagrama da arquitetura do SAM 2

Mecanismo de memória e tratamento de oclusões#

O mecanismo de memória permite que o SAM 2 lide com dependências temporais e oclusões em dados de vídeo. À medida que os objetos se movem e interagem, o SAM 2 registra suas características em um banco de memória. Quando um objeto fica ocluso, o modelo pode recorrer a essa memória para prever sua posição e aparência quando ele reaparecer. O cabeçalho de oclusão trata especificamente de situações em que os objetos não estão visíveis, prevendo a probabilidade de um objeto estar ocluso.

Resolução de ambiguidades com múltiplas máscaras#

Em situações ambíguas (por exemplo, com objetos sobrepostos), o SAM 2 pode gerar várias previsões de máscaras. Esse recurso é fundamental para representar cenas complexas com precisão, quando uma única máscara talvez não descreva suficientemente suas nuances.

Conjunto de dados SA-V#

O conjunto de dados SA-V, desenvolvido para o treinamento do SAM 2, é um dos maiores e mais diversos conjuntos de dados de segmentação de vídeos disponíveis. Ele inclui:

  • Mais de 51.000 vídeos: capturados em 47 países, abrangendo uma ampla variedade de cenários do mundo real.
  • Mais de 600.000 anotações de máscaras: anotações detalhadas de máscaras espaço-temporais, chamadas de "masklets", que abrangem objetos inteiros e partes deles.
  • Escala do conjunto de dados: contém 4,5 vezes mais vídeos e 53 vezes mais anotações do que os maiores conjuntos de dados anteriores, oferecendo diversidade e complexidade sem precedentes.

Benchmarks#

Segmentação de objetos em vídeos#

O SAM 2 demonstrou desempenho superior nos principais benchmarks de segmentação de vídeos:

Conjunto de dadosJ&FJF
DAVIS 201782.579.885.2
YouTube-VOS81.278.983.5

Segmentação interativa#

Em tarefas de segmentação interativa, o SAM 2 demonstra ganhos significativos de eficiência e precisão:

Conjunto de dadosNoC@90AUC
DAVIS Interativo1.540.872

Instalação#

Para instalar o SAM 2, usa o seguinte comando. Todos os modelos SAM 2 serão baixados automaticamente na primeira utilização.

pip install ultralytics

Como usar o SAM 2: versatilidade na segmentação de imagens e vídeos#

A tabela a seguir detalha os modelos SAM 2 disponíveis, seus pesos pré-treinados, as tarefas compatíveis e a compatibilidade com diferentes modos de operação, como inferência, validação, treinamento e exportação.

Tipo de modeloPesos pré-treinadosTarefas suportadasTreinamentoValidaçãoInferênciaExportar
SAM 2 tinysam2_t.ptSegmentação de instâncias❌❌✅❌
SAM 2 smallsam2_s.ptSegmentação de instâncias❌❌✅❌
SAM 2 basesam2_b.ptSegmentação de instâncias❌❌✅❌
SAM 2 largesam2_l.ptSegmentação de instâncias❌❌✅❌
SAM 2.1 tinysam2.1_t.ptSegmentação de instâncias❌❌✅❌
SAM 2.1 smallsam2.1_s.ptSegmentação de instâncias❌❌✅❌
SAM 2.1 basesam2.1_b.ptSegmentação de instâncias❌❌✅❌
SAM 2.1 largesam2.1_l.ptSegmentação de instâncias❌❌✅❌

Exemplos de predição do SAM 2#

O SAM 2 pode ser usado em diversas tarefas, incluindo edição de vídeo em tempo real, imagens médicas e sistemas autônomos. A capacidade de segmentar dados visuais estáticos e dinâmicos faz dele uma ferramenta versátil para pesquisadores e desenvolvedores.

Segmentar com prompts#

Segmentar com prompts

Usa prompts para segmentar objetos específicos em imagens ou vídeos.

from ultralytics import SAM

# Carregar um modelo
model = SAM("sam2.1_b.pt")

# Exibir informações do modelo (opcional)
model.info()

# Executar inferência com prompt de bboxes
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])

# Executar inferência com um único ponto
results = model(points=[900, 370], labels=[1])

# Executar inferência com vários pontos
results = model(points=[[400, 370], [900, 370]], labels=[1, 1])

# Executar inferência com prompt de vários pontos por objeto
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 1]])

# Executar inferência com prompt de pontos negativos
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 0]])

Segmentar tudo#

Segmentar tudo

Segmenta todo o conteúdo da imagem ou do vídeo sem prompts específicos.

from ultralytics import SAM

# Carregar um modelo
model = SAM("sam2.1_b.pt")

# Exibir informações do modelo (opcional)
model.info()

# Executar inferência
model("path/to/video.mp4")
  • Este exemplo demonstra como o SAM 2 pode ser usado para segmentar todo o conteúdo de uma imagem ou vídeo quando nenhum prompt (bboxes/pontos/máscaras) é fornecido.

Segmentar vídeo e rastrear objetos#

Segmentar vídeo

Segmenta todo o conteúdo do vídeo com prompts específicos e rastreia objetos.

from ultralytics.models.sam import SAM2VideoPredictor

# Create SAM2VideoPredictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_b.pt"}
predictor = SAM2VideoPredictor(overrides=overrides)

# Executar inferência com um único ponto
results = predictor(source="test.mp4", points=[920, 470], labels=[1])

# Executar inferência com vários pontos
results = predictor(source="test.mp4", points=[[920, 470], [909, 138]], labels=[1, 1])

# Executar inferência com prompt de vários pontos por objeto
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 1]])

# Executar inferência com prompt de pontos negativos
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 0]])

Segmentação e rastreamento interativos dinâmicos#

SAM2DynamicInteractivePredictor é uma extensão avançada do SAM 2, que não requer treinamento e permite interação dinâmica com vários frames e recursos de aprendizado contínuo. Esse preditor é compatível com atualizações de prompts em tempo real e gerenciamento de memória para melhorar o desempenho do rastreamento em uma sequência de imagens. Em comparação com o SAM 2 original, SAM2DynamicInteractivePredictor reformula o fluxo de inferência para aproveitar ao máximo os modelos SAM 2 pré-treinados sem exigir treinamento adicional.

Resultados de exemplo do SAM 2

Principais funcionalidades#

Ele oferece três melhorias significativas:

  1. Interação dinâmica: adiciona novos prompts para mesclar novas instâncias ou rastrear instâncias ainda não rastreadas nos frames seguintes, a qualquer momento durante o processamento do vídeo
  2. Aprendizado contínuo: adiciona novos prompts para instâncias existentes a fim de melhorar o desempenho do modelo ao longo do tempo
  3. Suporte independente a várias imagens: processa várias imagens independentes (não necessariamente de uma sequência de vídeo) com compartilhamento de memória e rastreamento de objetos entre imagens

Principais recursos#

  • Flexibilidade dos prompts: aceita caixas delimitadoras, pontos e máscaras como prompts
  • Gerenciamento do banco de memória: mantém um banco de memória dinâmico para armazenar os estados dos objetos entre os frames
  • Rastreamento de vários objetos: permite rastrear vários objetos simultaneamente, cada um com seu próprio ID
  • Atualizações em tempo real: permite adicionar novos prompts durante a inferência sem reprocessar frames anteriores
  • Processamento independente de imagens: processa imagens avulsas com contexto de memória compartilhado para manter a consistência dos objetos entre imagens
Adição dinâmica de objetos
from ultralytics.models.sam import SAM2DynamicInteractivePredictor

# Create SAM2DynamicInteractivePredictor
overrides = {"conf": 0.01, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_t.pt", "save": False}
predictor = SAM2DynamicInteractivePredictor(overrides=overrides, max_obj_num=10)

# Define uma categoria com um prompt de caixa
predictor(source="image1.jpg", bboxes=[[100, 100, 200, 200]], obj_ids=[0], update_memory=True)

# Detecta este objeto específico em uma nova imagem
results = predictor(source="image2.jpg")

# Adiciona uma nova categoria com um novo ID de objeto
results = predictor(
    source="image4.jpg",
    bboxes=[[300, 300, 400, 400]],  # Novo objeto
    obj_ids=[1],  # Novo ID de objeto
    update_memory=True,  # Adicionar à memória
)
# Executar inferência
results = predictor(source="image5.jpg")

# Adicionar prompts de refinamento à mesma categoria para melhorar o desempenho
# Isso ajuda quando a aparência dos objetos muda significativamente
results = predictor(
    source="image6.jpg",
    points=[[150, 150]],  # Ponto de refinamento
    labels=[1],  # Ponto positivo
    obj_ids=[1],  # Mesmo ID de objeto
    update_memory=True,  # Atualizar a memória com novas informações
)
# Executar inferência na nova imagem
results = predictor(source="image7.jpg")
Nota

O SAM2DynamicInteractivePredictor foi projetado para funcionar com modelos SAM 2 e oferece suporte à adição e ao refinamento de categorias usando todos os prompts de caixa, ponto e máscara compatíveis nativamente com SAM 2. Ele é particularmente útil em cenários nos quais os objetos aparecem ou mudam ao longo do tempo, como na anotação de vídeos ou em tarefas de edição interativa.

Argumentos#

NomeValor padrãoTipo de dadosDescrição
max_obj_num3intNúmero máximo predefinido de categorias
update_memoryFalseboolIndica se a memória deve ser atualizada com novos prompts
obj_idsNoneList[int]Lista de IDs de objetos correspondentes aos prompts

Casos de uso#

SAM2DynamicInteractivePredictor é ideal para:

  • Fluxos de trabalho de anotação de vídeos em que novos objetos aparecem durante a sequência
  • Edição interativa de vídeos que exige a adição e o refinamento de objetos em tempo real
  • Aplicações de vigilância que precisam de rastreamento dinâmico de objetos
  • Imagens médicas para rastrear estruturas anatômicas ao longo de séries temporais
  • Sistemas autônomos que exigem detecção e rastreamento adaptativos de objetos
  • Conjuntos de dados com várias imagens para segmentação consistente de objetos em imagens independentes
  • Análise de coleções de imagens em que os objetos precisam ser rastreados em diferentes cenas
  • Segmentação entre domínios que aproveita a memória de diversos contextos de imagem
  • Anotação semiautomática para criar conjuntos de dados com eficiência e o mínimo de intervenção manual

Comparação entre SAM e YOLO#

Aqui comparamos os modelos SAM 2 da Meta, incluindo a variante SAM2-t, a menor, com os modelos de segmentação da Ultralytics, incluindo YOLO26n-seg:

ModeloTamanho
(MB)
Parâmetros
(M)
Velocidade (CPU)
(ms/im)
Meta SAM-b37593.741703
Meta SAM2-b16280.828867
Meta SAM2-t78.138.923430
MobileSAM40.710.123802
FastSAM-s com backbone YOLOv823.911.858.0
Ultralytics YOLOv8n-seg7.1 (11.0x menor)3.4 (11.4x menos)24.8 (945x mais rápido)
Ultralytics YOLO11n-seg6.2 (12.6x menor)2.9 (13.4x menos)24.3 (964x mais rápido)
Ultralytics YOLO26n-seg6.7 (11.7x menor)2.7 (14.4x menos)25.2 (930x mais rápido)

Esta comparação demonstra as diferenças substanciais entre os tamanhos e as velocidades dos modelos das variantes SAM e dos modelos de segmentação YOLO. Embora o SAM ofereça recursos exclusivos de segmentação automática, os modelos YOLO, especialmente YOLOv8n-seg, YOLO11n-seg e YOLO26n-seg, são significativamente menores, mais rápidos e mais eficientes em termos computacionais.

As velocidades do SAM foram medidas com PyTorch; as velocidades do YOLO, com ONNX Runtime. Os testes foram executados em um Apple M4 Air de 2025 com 16 GB de RAM, usando torch==2.10.0, ultralytics==8.4.31 e onnxruntime==1.24.4. Para reproduzir este teste:

Exemplo
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Avalie o desempenho de SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Perfilar FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Avalie o desempenho dos modelos YOLO (ONNX)
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    onnx_path = model.export(format="onnx", dynamic=True, nms=False)  # Cabeça sem NMS do YOLO26; sem efeito para YOLOv8/YOLO11
    model = YOLO(onnx_path)
    model(ASSETS)

Anotação automática: criação eficiente de conjuntos de dados#

A anotação automática é um recurso poderoso do SAM 2 que permite aos usuários gerar conjuntos de dados de segmentação com rapidez e precisão usando modelos pré-treinados. Esse recurso é especialmente útil para criar conjuntos de dados grandes e de alta qualidade sem muito trabalho manual.

Como fazer anotações automáticas com SAM 2#



Assista: Anotação automática com o modelo Segment Anything 2 da Meta usando Ultralytics | Rotulagem de dados

Para fazer anotações automáticas no seu conjunto de dados usando SAM 2, siga este exemplo:

Exemplo de anotação automática
from ultralytics.data.annotator import auto_annotate

auto_annotate(data="path/to/images", det_model="yolo26x.pt", sam_model="sam2_b.pt")
ArgumentoTipoPadrãoDescrição
datastrobrigatórioCaminho para o diretório que contém as imagens de destino para anotação ou segmentação.
det_modelstr'yolo26x.pt'Caminho para o modelo de detecção YOLO usado na detecção inicial de objetos.
sam_modelstr'sam_b.pt'Caminho para o modelo SAM usado na segmentação (compatível com pesos de SAM, SAM 2, MobileSAM e SAM 3).
devicestr''Dispositivo de computação (por exemplo, 'cuda:0', 'cpu' ou '' para detecção automática do dispositivo).
conffloat0.25Limite de confiança para a detecção YOLO, usado para filtrar detecções fracas.
ioufloat0.45Limite de IoU para a supressão não máxima, usada para filtrar caixas sobrepostas.
imgszint640Tamanho de entrada para redimensionar as imagens (arredondado para cima até um múltiplo de 32, se necessário).
max_detint300Número máximo de detecções por imagem para economizar memória.
classeslist[int]NoneLista de índices de classes a detectar (por exemplo, [0, 1] para pessoa e bicicleta).
output_dirstrNoneDiretório para salvar as anotações (por padrão: diretório irmão de <data>_auto_annotate_labels).

Esta função facilita a criação rápida de conjuntos de dados de segmentação de alta qualidade, ideal para pesquisadores e desenvolvedores que buscam acelerar seus projetos.

Limitações#

Apesar de seus pontos fortes, SAM 2 tem algumas limitações:

  • Estabilidade do rastreamento: SAM 2 pode perder o rastro dos objetos durante sequências longas ou mudanças significativas de ponto de vista.
  • Confusão entre objetos: às vezes, o modelo pode confundir objetos de aparência semelhante, principalmente em cenas com muitos elementos.
  • Eficiência com vários objetos: a eficiência da segmentação diminui ao processar vários objetos simultaneamente, devido à falta de comunicação entre eles.
  • Precisão dos detalhes: pode deixar passar detalhes finos, especialmente em objetos que se movem rapidamente. Prompts adicionais podem ajudar parcialmente a resolver esse problema, mas não garantem suavidade temporal.

Citações e agradecimentos#

Se SAM 2 for essencial para seu trabalho de pesquisa ou desenvolvimento, cite-o usando a seguinte referência:

Citação
@article{ravi2024sam2,
  title={SAM 2: Segment Anything in Images and Videos},
  author={Ravi, Nikhila and Gabeur, Valentin and Hu, Yuan-Ting and Hu, Ronghang and Ryali, Chaitanya and Ma, Tengyu and Khedr, Haitham and R{\"a}dle, Roman and Rolland, Chloe and Gustafson, Laura and Mintun, Eric and Pan, Junting and Alwala, Kalyan Vasudev and Carion, Nicolas and Wu, Chao-Yuan and Girshick, Ross and Doll{\'a}r, Piotr and Feichtenhofer, Christoph},
  journal={arXiv preprint},
  year={2024}
}

Agradecemos à Meta AI por suas contribuições à comunidade de IA com este modelo e conjunto de dados inovadores.

Perguntas frequentes#

  • SAM 2, sucessor do Modelo Segment Anything (SAM) da Meta, é uma ferramenta de ponta projetada para segmentar objetos de forma abrangente em imagens e vídeos. Ele se destaca no processamento de dados visuais complexos por meio de uma arquitetura unificada de modelo que aceita prompts e oferece processamento em tempo real e generalização de disparo zero. SAM 2 traz várias melhorias em relação ao SAM original, incluindo:

    • Arquitetura unificada de modelo: combina recursos de segmentação de imagens e vídeos em um único modelo.
    • Desempenho em tempo real: processa aproximadamente 44 quadros por segundo, sendo adequado para aplicações que exigem resposta imediata.
    • Generalização de disparo zero: segmenta objetos que nunca encontrou antes, algo útil em diversos domínios visuais.
    • Refinamento interativo: permite que os usuários refinem os resultados da segmentação de forma iterativa, fornecendo prompts adicionais.
    • Tratamento avançado de desafios visuais: lida com desafios comuns da segmentação de vídeos, como oclusão e reaparecimento de objetos.

    Para saber mais sobre a arquitetura e os recursos do SAM 2, consulte o artigo de pesquisa do SAM 2.

  • SAM 2 pode ser usado para segmentação de vídeos em tempo real aproveitando sua interface que aceita prompts e seus recursos de inferência em tempo real. Veja um exemplo básico:

    Segmentar com prompts

    Usa prompts para segmentar objetos específicos em imagens ou vídeos.

    from ultralytics import SAM
    
    # Carregar um modelo
    model = SAM("sam2_b.pt")
    
    # Exibir informações do modelo (opcional)
    model.info()
    
    # Segmente usando um prompt de caixa delimitadora
    results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
    
    # Segmente usando um prompt de ponto
    results = model("path/to/image.jpg", points=[150, 150], labels=[1])

    Para instruções de uso mais completas, consulte a seção Como usar SAM 2.

  • SAM 2 é treinado com o conjunto de dados SA-V, um dos maiores e mais diversificados conjuntos de dados de segmentação de vídeos disponíveis. O conjunto de dados SA-V inclui:

    • Mais de 51.000 vídeos: capturados em 47 países, abrangendo uma ampla variedade de cenários do mundo real.
    • Mais de 600.000 anotações de máscaras: anotações detalhadas de máscaras espaço-temporais, chamadas de "masklets", que abrangem objetos inteiros e partes deles.
    • Escala do conjunto de dados: contém 4,5 vezes mais vídeos e 53 vezes mais anotações do que os maiores conjuntos de dados anteriores, oferecendo diversidade e complexidade sem precedentes.

    Esse conjunto de dados abrangente permite que SAM 2 alcance um desempenho superior nos principais benchmarks de segmentação de vídeos e aprimora seus recursos de generalização de disparo zero. Para saber mais, consulte a seção Conjunto de dados SA-V.

  • SAM 2 inclui um mecanismo de memória sofisticado para gerenciar dependências temporais e oclusões em dados de vídeo. O mecanismo de memória consiste em:

    • Codificador de memória e banco de memória: armazenam recursos de quadros anteriores.
    • Módulo de atenção à memória: usa as informações armazenadas para manter o rastreamento consistente dos objetos ao longo do tempo.
    • Cabeça de oclusão: lida especificamente com cenários em que os objetos não estão visíveis, prevendo a probabilidade de um objeto estar ocluído.

    Esse mecanismo garante a continuidade mesmo quando os objetos ficam temporariamente ocultos ou saem e voltam à cena. Para saber mais, consulte a seção Mecanismo de memória e tratamento de oclusões.

  • Os modelos SAM 2, como SAM2-t e SAM2-b da Meta, oferecem recursos poderosos de segmentação de disparo zero, mas são significativamente maiores e mais lentos do que os modelos YOLO. Por exemplo, YOLO26n-seg é aproximadamente 24 vezes menor e mais de 1145 vezes mais rápido do que SAM2-b em CPU. Embora SAM 2 se destaque em cenários versáteis de segmentação baseada em prompts e de disparo zero, YOLO26 é otimizado para velocidade, eficiência e aplicações em tempo real com inferência completa sem NMS, sendo mais adequado para implantação em ambientes com recursos limitados.

Comentários