SAM 2: Modelo Segment Anything 2#
SAM 2, sucesor del Modelo Segment Anything (SAM) de Meta, es una herramienta de vanguardia diseñada para la segmentación integral de objetos tanto en imágenes como en vídeos. Destaca en el procesamiento de datos visuales complejos mediante una arquitectura de modelo unificada y guiada por indicaciones, compatible con el procesamiento en tiempo real y la generalización zero-shot.
Los modelos SAM 2.1 impulsan la función de anotación inteligente de Ultralytics Platform, que permite segmentar mediante clics para etiquetar conjuntos de datos rápidamente. Consulta la guía de anotación para obtener más información.

Características principales#
Watch: How to Run Inference with Meta's SAM2 using Ultralytics | Step-by-Step Guide 🎉
Arquitectura de modelo unificada#
SAM 2 combina las capacidades de segmentación de imágenes y vídeos en un único modelo. Esta unificación simplifica la implementación y permite mantener un rendimiento uniforme en distintos tipos de contenido multimedia. Utiliza una interfaz flexible basada en indicaciones, que permite especificar los objetos de interés mediante distintos tipos de indicaciones, como puntos, cuadros delimitadores o máscaras.
Rendimiento en tiempo real#
El modelo alcanza velocidades de inferencia en tiempo real y procesa aproximadamente 44 fotogramas por segundo. Esto hace que SAM 2 sea adecuado para aplicaciones que requieren una respuesta inmediata, como la edición de vídeo y la realidad aumentada.
Generalización zero-shot#
SAM 2 puede segmentar objetos que nunca había encontrado, lo que demuestra una sólida generalización zero-shot. Esto resulta especialmente útil en dominios visuales diversos o en evolución, donde las categorías predefinidas pueden no abarcar todos los objetos posibles.
Refinamiento interactivo#
Puedes refinar iterativamente los resultados de segmentación proporcionando indicaciones adicionales, lo que permite controlar con precisión la salida. Esta interactividad es esencial para ajustar los resultados en aplicaciones como la anotación de vídeos o el análisis de imágenes médicas.
Gestión avanzada de desafíos visuales#
SAM 2 incluye mecanismos para gestionar desafíos habituales de la segmentación de vídeo, como la oclusión y la reaparición de objetos. Utiliza un sofisticado mecanismo de memoria para realizar un seguimiento de los objetos entre fotogramas, garantizando la continuidad incluso cuando los objetos quedan temporalmente ocultos o salen de la escena y vuelven a entrar.
Para comprender mejor la arquitectura y las capacidades de SAM 2, consulta el artículo de investigación sobre SAM 2.
Rendimiento y detalles técnicos#
SAM 2 establece un nuevo referente en el campo y supera a los modelos anteriores en diversas métricas:
| Métrica | SAM 2 | SOTA anterior |
|---|---|---|
| Segmentación de vídeo interactiva | Mejor | - |
| Interacciones humanas necesarias | 3 veces menos | Referencia |
| Precisión de la segmentación de imágenes | Mejorada | SAM |
| Velocidad de inferencia | 6 veces más rápido | SAM |
Arquitectura del modelo#
Componentes principales#
- Codificador de imágenes y vídeo: utiliza una arquitectura basada en Transformer para extraer características de alto nivel de imágenes y fotogramas de vídeo. Este componente se encarga de comprender el contenido visual en cada instante.
- Codificador de indicaciones: procesa las indicaciones proporcionadas por el usuario (puntos, cuadros y máscaras) para guiar la tarea de segmentación. Esto permite que SAM 2 se adapte a la entrada del usuario y se dirija a objetos específicos dentro de una escena.
- Mecanismo de memoria: incluye un codificador de memoria, un banco de memoria y un módulo de atención de memoria. En conjunto, estos componentes almacenan y utilizan información de fotogramas anteriores, lo que permite al modelo mantener un seguimiento de objetos uniforme a lo largo del tiempo.
- Decodificador de máscaras: genera las máscaras de segmentación finales a partir de las características de imagen codificadas y las indicaciones. En vídeo, también utiliza el contexto de memoria para garantizar un seguimiento preciso entre fotogramas.

Mecanismo de memoria y gestión de oclusiones#
El mecanismo de memoria permite a SAM 2 gestionar dependencias temporales y oclusiones en datos de vídeo. A medida que los objetos se mueven e interactúan, SAM 2 registra sus características en un banco de memoria. Cuando un objeto queda ocluido, el modelo puede basarse en esta memoria para predecir su posición y apariencia cuando reaparezca. El módulo de oclusión gestiona específicamente las situaciones en las que los objetos no son visibles y predice la probabilidad de que un objeto esté ocluido.
Resolución de ambigüedades entre varias máscaras#
En situaciones ambiguas (p. ej., con objetos superpuestos), SAM 2 puede generar varias predicciones de máscaras. Esta función es crucial para representar con precisión escenas complejas en las que una sola máscara podría no describir adecuadamente sus matices.
Conjunto de datos SA-V#
El conjunto de datos SA-V, desarrollado para entrenar SAM 2, es uno de los conjuntos de datos de segmentación de vídeo más grandes y diversos disponibles. Incluye:
- Más de 51 000 vídeos: capturados en 47 países, proporcionan una amplia variedad de escenarios del mundo real.
- Más de 600 000 anotaciones de máscaras: anotaciones detalladas de máscaras espaciotemporales, denominadas «masklets», que abarcan objetos completos y partes de objetos.
- Escala del conjunto de datos: contiene 4,5 veces más vídeos y 53 veces más anotaciones que los conjuntos de datos anteriores más grandes, lo que ofrece una diversidad y complejidad sin precedentes.
Evaluaciones comparativas#
Segmentación de objetos en vídeo#
SAM 2 ha demostrado un rendimiento superior en las principales evaluaciones comparativas de segmentación de vídeo:
| Conjunto de datos | J&F | J | F |
|---|---|---|---|
| DAVIS 2017 | 82.5 | 79.8 | 85.2 |
| YouTube-VOS | 81.2 | 78.9 | 83.5 |
Segmentación interactiva#
En las tareas de segmentación interactiva, SAM 2 muestra una eficiencia y precisión significativas:
| Conjunto de datos | NoC@90 | AUC |
|---|---|---|
| DAVIS Interactive | 1.54 | 0.872 |
Instalación#
Para instalar SAM 2, utiliza el siguiente comando. Todos los modelos de SAM 2 se descargarán automáticamente la primera vez que los uses.
pip install ultralyticsCómo usar SAM 2: versatilidad en la segmentación de imágenes y vídeos#
La siguiente tabla detalla los modelos SAM 2 disponibles, sus pesos preentrenados, las tareas compatibles y la compatibilidad con distintos modos de funcionamiento, como inferencia, validación, entrenamiento y exportación.
| Tipo de modelo | Pesos preentrenados | Tareas compatibles | Entrenamiento | Validación | Inferencia | Exportar |
|---|---|---|---|---|---|---|
| SAM 2 pequeño | sam2_t.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
| SAM 2 pequeño | sam2_s.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
| SAM 2 base | sam2_b.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
| SAM 2 grande | sam2_l.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 pequeño | sam2.1_t.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 pequeño | sam2.1_s.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 base | sam2.1_b.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
| SAM 2.1 grande | sam2.1_l.pt | Segmentación de instancias | ❌ | ❌ | ✅ | ❌ |
Ejemplos de predicción con SAM 2#
SAM 2 puede utilizarse en una amplia variedad de tareas, como la edición de vídeo en tiempo real, el análisis de imágenes médicas y los sistemas autónomos. Su capacidad para segmentar datos visuales estáticos y dinámicos lo convierte en una herramienta versátil para investigadores y desarrolladores.
Segmentar con indicaciones#
Utiliza indicaciones para segmentar objetos específicos en imágenes o vídeos.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference with bboxes prompt
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
# Run inference with single point
results = model(points=[900, 370], labels=[1])
# Run inference with multiple points
results = model(points=[[400, 370], [900, 370]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 0]])Segmentarlo todo#
Segmenta todo el contenido de la imagen o el vídeo sin indicaciones específicas.
from ultralytics import SAM
# Load a model
model = SAM("sam2.1_b.pt")
# Display model information (optional)
model.info()
# Run inference
model("path/to/video.mp4")Segmentar vídeo y realizar el seguimiento de objetos#
Segmenta todo el contenido del vídeo con indicaciones específicas y realiza el seguimiento de los objetos.
from ultralytics.models.sam import SAM2VideoPredictor
# Create SAM2VideoPredictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_b.pt"}
predictor = SAM2VideoPredictor(overrides=overrides)
# Run inference with single point
results = predictor(source="test.mp4", points=[920, 470], labels=[1])
# Run inference with multiple points
results = predictor(source="test.mp4", points=[[920, 470], [909, 138]], labels=[1, 1])
# Run inference with multiple points prompt per object
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 1]])
# Run inference with negative points prompt
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 0]])- Este ejemplo muestra cómo se puede utilizar SAM 2 para segmentar todo el contenido de una imagen o un vídeo si no se proporcionan indicaciones (bboxes/puntos/máscaras).
Segmentación y seguimiento interactivos dinámicos#
SAM2DynamicInteractivePredictor es una extensión avanzada sin entrenamiento de SAM 2 que permite la interacción dinámica con múltiples fotogramas y capacidades de aprendizaje continuo. Este predictor admite actualizaciones de indicaciones en tiempo real y gestión de memoria para mejorar el rendimiento de seguimiento en una secuencia de imágenes. En comparación con el SAM 2 original, SAM2DynamicInteractivePredictor reestructura el flujo de inferencia para aprovechar al máximo los modelos de SAM 2 preentrenados sin necesidad de entrenamiento adicional.

Características principales#
Ofrece tres mejoras significativas:
- Interacción dinámica: añade nuevas indicaciones para fusionar instancias nuevas o no seguidas en fotogramas posteriores en cualquier momento durante el procesamiento del vídeo.
- Aprendizaje continuo: añade nuevas indicaciones para instancias existentes con el fin de mejorar el rendimiento del modelo con el tiempo.
- Compatibilidad independiente con varias imágenes: procesa varias imágenes independientes (no necesariamente de una secuencia de vídeo) con uso compartido de memoria y seguimiento de objetos entre imágenes.
Capacidades principales#
- Flexibilidad de las indicaciones: acepta cuadros delimitadores, puntos y máscaras como indicaciones.
- Gestión del banco de memoria: mantiene un banco de memoria dinámico para almacenar los estados de los objetos entre fotogramas.
- Seguimiento de varios objetos: permite realizar el seguimiento de varios objetos simultáneamente con identificadores de objeto individuales.
- Actualizaciones en tiempo real: Permite añadir nuevos prompts durante la inferencia sin volver a procesar los fotogramas anteriores
- Procesamiento independiente de imágenes: Procesa imágenes independientes con un contexto de memoria compartida para mantener la coherencia de los objetos entre imágenes
from ultralytics.models.sam import SAM2DynamicInteractivePredictor
# Create SAM2DynamicInteractivePredictor
overrides = {"conf": 0.01, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_t.pt", "save": False}
predictor = SAM2DynamicInteractivePredictor(overrides=overrides, max_obj_num=10)
# Define a category by box prompt
predictor(source="image1.jpg", bboxes=[[100, 100, 200, 200]], obj_ids=[0], update_memory=True)
# Detect this particular object in a new image
results = predictor(source="image2.jpg")
# Add new category with a new object ID
results = predictor(
source="image4.jpg",
bboxes=[[300, 300, 400, 400]], # New object
obj_ids=[1], # New object ID
update_memory=True, # Add to memory
)
# Perform inference
results = predictor(source="image5.jpg")
# Add refinement prompts to the same category to boost performance
# This helps when object appearance changes significantly
results = predictor(
source="image6.jpg",
points=[[150, 150]], # Refinement point
labels=[1], # Positive point
obj_ids=[1], # Same object ID
update_memory=True, # Update memory with new information
)
# Perform inference on new image
results = predictor(source="image7.jpg")El SAM2DynamicInteractivePredictor está diseñado para funcionar con modelos de SAM 2, y permite añadir y perfeccionar categorías con todas las indicaciones de caja, punto y máscara que SAM 2 admite de forma nativa. Es especialmente útil para escenarios en los que los objetos aparecen o cambian con el tiempo, como en tareas de anotación de vídeo o edición interactiva.
Argumentos#
| Nombre | Valor predeterminado | Tipo de datos | Descripción |
|---|---|---|---|
max_obj_num | 3 | int | Número máximo preestablecido de categorías |
update_memory | False | bool | Indica si se debe actualizar la memoria con nuevos prompts |
obj_ids | None | List[int] | Lista de ID de objetos correspondientes a los prompts |
Casos de uso#
SAM2DynamicInteractivePredictor es ideal para:
- Flujos de trabajo de anotación de vídeo en los que aparecen nuevos objetos durante la secuencia
- Edición interactiva de vídeo que requiere añadir y perfeccionar objetos en tiempo real
- Aplicaciones de vigilancia que necesitan realizar un seguimiento dinámico de objetos
- Imágenes médicas para realizar el seguimiento de estructuras anatómicas a lo largo de series temporales
- Sistemas autónomos que requieren detección y seguimiento adaptativos de objetos
- Conjuntos de datos de múltiples imágenes para lograr una segmentación coherente de objetos en imágenes independientes
- Análisis de colecciones de imágenes en los que es necesario realizar un seguimiento de los objetos en distintas escenas
- Segmentación entre dominios que aprovecha la memoria de diversos contextos de imagen
- Anotación semiautomática para crear conjuntos de datos de forma eficiente con una intervención manual mínima
Comparación entre SAM y YOLO#
Aquí comparamos los modelos SAM 2 de Meta, incluida la variante SAM2-t, la más pequeña, con los modelos de segmentación de Ultralytics, incluido YOLO26n-seg:
| Modelo | Tamaño (MB) | Parámetros (M) | Velocidad (CPU) (ms/im) |
|---|---|---|---|
| Meta SAM-b | 375 | 93.7 | 41703 |
| Meta SAM2-b | 162 | 80.8 | 28867 |
| Meta SAM2-t | 78.1 | 38.9 | 23430 |
| MobileSAM | 40.7 | 10.1 | 23802 |
| FastSAM-s con backbone de YOLOv8 | 23.9 | 11.8 | 58.0 |
| Ultralytics YOLOv8n-seg | 7.1 (11.0 veces más pequeño) | 3.4 (11.4 veces menos) | 24.8 (945 veces más rápido) |
| Ultralytics YOLO11n-seg | 6.2 (12.6x más pequeño) | 2.9 (13.4 veces menos) | 24.3 (964x más rápido) |
| Ultralytics YOLO26n-seg | 6.7 (11.7 veces más pequeño) | 2.7 (14.4x menos) | 25.2 (930 veces más rápido) |
Esta comparación demuestra las diferencias sustanciales de tamaño y velocidad entre las variantes de SAM y los modelos de segmentación YOLO. Aunque SAM ofrece capacidades únicas de segmentación automática, los modelos YOLO, especialmente YOLOv8n-seg, YOLO11n-seg y YOLO26n-seg, son considerablemente más pequeños, rápidos y eficientes desde el punto de vista computacional.
Las velocidades de SAM se han medido con PyTorch y las de YOLO, con ONNX Runtime. Las pruebas se han realizado en un Apple M4 Air de 2025 con 16 GB de RAM utilizando torch==2.10.0, ultralytics==8.4.31 y onnxruntime==1.24.4. Para reproducir esta prueba:
from ultralytics import ASSETS, SAM, YOLO, FastSAM
# Profile SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt"]:
model = SAM(file)
model.info()
model(ASSETS)
# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)
# Profile YOLO models (ONNX)
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
model = YOLO(file_name)
model.info()
onnx_path = model.export(format="onnx", dynamic=True, nms=False) # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11
model = YOLO(onnx_path)
model(ASSETS)Anotación automática: creación eficiente de conjuntos de datos#
La anotación automática es una potente función de SAM 2 que permite generar conjuntos de datos de segmentación de forma rápida y precisa mediante el uso de modelos preentrenados. Esta capacidad resulta especialmente útil para crear conjuntos de datos grandes y de alta calidad sin un esfuerzo manual considerable.
Cómo realizar anotaciones automáticas con SAM 2#
Watch: Auto Annotation with Meta's Segment Anything 2 Model using Ultralytics | Data Labeling
Para realizar anotaciones automáticas en tu conjunto de datos mediante SAM 2, sigue este ejemplo:
from ultralytics.data.annotator import auto_annotate
auto_annotate(data="path/to/images", det_model="yolo26x.pt", sam_model="sam2_b.pt")| Argumento | Tipo | Predeterminado | Descripción |
|---|---|---|---|
data | str | obligatorio | Ruta al directorio que contiene las imágenes de destino para la anotación o segmentación. |
det_model | str | 'yolo26x.pt' | Ruta al modelo de detección YOLO para la detección inicial de objetos. |
sam_model | str | 'sam_b.pt' | Ruta al modelo SAM para la segmentación (admite los pesos de SAM, SAM 2, MobileSAM y SAM 3). |
device | str | '' | Dispositivo de cálculo (por ejemplo, 'cuda:0', 'cpu' o '' para la detección automática del dispositivo). |
conf | float | 0.25 | Umbral de confianza de la detección YOLO para filtrar las detecciones débiles. |
iou | float | 0.45 | Umbral de IoU para la supresión no máxima, que permite filtrar las cajas superpuestas. |
imgsz | int | 640 | Tamaño de entrada para cambiar el tamaño de las imágenes (debe ser múltiplo de 32). |
max_det | int | 300 | Número máximo de detecciones por imagen para optimizar el uso de memoria. |
classes | list[int] | None | Lista de índices de clase que se detectarán (por ejemplo, [0, 1] para persona y bicicleta). |
output_dir | str | None | Directorio donde se guardarán las anotaciones (de forma predeterminada: directorio hermano de <data>_auto_annotate_labels). |
Esta función facilita la creación rápida de conjuntos de datos de segmentación de alta calidad, ideal para investigadores y desarrolladores que buscan acelerar sus proyectos.
Limitaciones#
A pesar de sus puntos fuertes, SAM 2 presenta ciertas limitaciones:
- Estabilidad del seguimiento: SAM 2 puede perder el seguimiento de los objetos durante secuencias prolongadas o cambios significativos del punto de vista.
- Confusión entre objetos: En ocasiones, el modelo puede confundir objetos de apariencia similar, especialmente en escenas concurridas.
- Eficiencia con varios objetos: La eficiencia de la segmentación disminuye al procesar varios objetos simultáneamente debido a la falta de comunicación entre objetos.
- Precisión de los detalles: Puede pasar por alto detalles pequeños, especialmente en objetos que se mueven rápidamente. Los prompts adicionales pueden solucionar parcialmente este problema, pero no se garantiza la suavidad temporal.
Citas y agradecimientos#
Si SAM 2 es una parte fundamental de tu trabajo de investigación o desarrollo, cita el modelo utilizando la siguiente referencia:
@article{ravi2024sam2,
title={SAM 2: Segment Anything in Images and Videos},
author={Ravi, Nikhila and Gabeur, Valentin and Hu, Yuan-Ting and Hu, Ronghang and Ryali, Chaitanya and Ma, Tengyu and Khedr, Haitham and R{\"a}dle, Roman and Rolland, Chloe and Gustafson, Laura and Mintun, Eric and Pan, Junting and Alwala, Kalyan Vasudev and Carion, Nicolas and Wu, Chao-Yuan and Girshick, Ross and Doll{\'a}r, Piotr and Feichtenhofer, Christoph},
journal={arXiv preprint},
year={2024}
}Agradecemos enormemente a Meta AI sus contribuciones a la comunidad de IA con este innovador modelo y conjunto de datos.
Preguntas frecuentes#
SAM 2, sucesor del modelo Segment Anything (SAM) de Meta, es una herramienta vanguardista diseñada para la segmentación integral de objetos tanto en imágenes como en vídeos. Destaca en el procesamiento de datos visuales complejos mediante una arquitectura de modelo unificada y guiada por prompts que admite procesamiento en tiempo real y generalización de tipo zero-shot. SAM 2 ofrece varias mejoras respecto al SAM original, entre ellas:
- Arquitectura de modelo unificada: Combina las capacidades de segmentación de imágenes y vídeos en un único modelo.
- Rendimiento en tiempo real: Procesa aproximadamente 44 fotogramas por segundo, por lo que resulta adecuado para aplicaciones que requieren una respuesta inmediata.
- Generalización de tipo zero-shot: Segmenta objetos con los que nunca se ha encontrado, lo que resulta útil en diversos dominios visuales.
- Perfeccionamiento interactivo: Permite perfeccionar iterativamente los resultados de segmentación proporcionando prompts adicionales.
- Gestión avanzada de desafíos visuales: Gestiona desafíos habituales de la segmentación de vídeo, como la oclusión y la reaparición de objetos.
Para obtener más información sobre la arquitectura y las capacidades de SAM 2, consulta el artículo de investigación sobre SAM 2.
SAM 2 se puede utilizar para la segmentación de vídeo en tiempo real gracias a su interfaz guiada por prompts y sus capacidades de inferencia en tiempo real. Este es un ejemplo básico:
Segmentar con indicacionesUtiliza indicaciones para segmentar objetos específicos en imágenes o vídeos.
from ultralytics import SAM # Load a model model = SAM("sam2_b.pt") # Display model information (optional) model.info() # Segment with bounding box prompt results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200]) # Segment with point prompt results = model("path/to/image.jpg", points=[150, 150], labels=[1])Para obtener información más completa sobre su uso, consulta la sección Cómo utilizar SAM 2.
SAM 2 se entrena con el conjunto de datos SA-V, uno de los conjuntos de datos de segmentación de vídeo más grandes y diversos disponibles. El conjunto de datos SA-V incluye:
- Más de 51 000 vídeos: capturados en 47 países, proporcionan una amplia variedad de escenarios del mundo real.
- Más de 600 000 anotaciones de máscaras: anotaciones detalladas de máscaras espaciotemporales, denominadas «masklets», que abarcan objetos completos y partes de objetos.
- Escala del conjunto de datos: Cuenta con 4,5 veces más vídeos y 53 veces más anotaciones que los conjuntos de datos más grandes anteriores, lo que ofrece una diversidad y complejidad sin precedentes.
Este amplio conjunto de datos permite a SAM 2 lograr un rendimiento superior en los principales benchmarks de segmentación de vídeo y mejora sus capacidades de generalización de tipo zero-shot. Para obtener más información, consulta la sección Conjunto de datos SA-V.
SAM 2 incluye un sofisticado mecanismo de memoria para gestionar las dependencias temporales y las oclusiones en los datos de vídeo. El mecanismo de memoria consta de:
- Codificador de memoria y banco de memoria: Almacena las características de los fotogramas anteriores.
- Módulo de atención de memoria: Utiliza la información almacenada para mantener un seguimiento coherente de los objetos a lo largo del tiempo.
- Cabezal de oclusión: Gestiona específicamente las situaciones en las que los objetos no son visibles y predice la probabilidad de que un objeto esté oculto.
Este mecanismo garantiza la continuidad incluso cuando los objetos quedan ocultos temporalmente o salen de la escena y vuelven a entrar en ella. Para obtener más información, consulta la sección Mecanismo de memoria y gestión de oclusiones.
Los modelos SAM 2, como SAM2-t y SAM2-b de Meta, ofrecen potentes capacidades de segmentación zero-shot, pero son considerablemente más grandes y lentos que los modelos YOLO. Por ejemplo, YOLO26n-seg es aproximadamente 24 veces más pequeño y más de 1145 veces más rápido que SAM2-b en CPU. Aunque SAM 2 destaca en situaciones de segmentación versátil, basada en prompts y zero-shot, YOLO26 está optimizado para la velocidad, la eficiencia y las aplicaciones en tiempo real mediante inferencia integral sin NMS, por lo que resulta más adecuado para su implementación en entornos con recursos limitados.