Ultralytics YOLO27:
Get Started

SAM 2: Segment Anything Model 2#

Evolución de SAM

SAM 2 amplía el SAM original SAM con capacidades de segmentación de vídeo. Para la segmentación de conceptos mediante indicaciones de texto y ejemplos de imágenes, consulta SAM 3.

Inference with Segment Anything 2 In Colab

SAM 2, sucesor del Segment Anything Model (SAM) de Meta, es una herramienta de vanguardia diseñada para segmentar objetos de forma exhaustiva tanto en imágenes como en vídeos. Destaca en el procesamiento de datos visuales complejos gracias a una arquitectura de modelo unificada que admite indicaciones, procesamiento en tiempo real y generalización sin ejemplos.

SAM 2 en la plataforma Ultralytics

Los modelos SAM 2.1 impulsan la función de anotación inteligente de la plataforma Ultralytics, que permite segmentar mediante clics para etiquetar conjuntos de datos rápidamente. Consulta la guía de anotación para obtener más información.

Resultados de ejemplo de SAM 2

Características principales#



Ver: Cómo ejecutar inferencias con SAM2 de Meta mediante Ultralytics | Guía paso a paso 🎉

Arquitectura de modelo unificada#

SAM 2 combina las capacidades de segmentación de imágenes y vídeos en un único modelo. Esta unificación simplifica la implementación y permite obtener un rendimiento uniforme en distintos tipos de contenido. Utiliza una interfaz flexible basada en indicaciones que permite especificar los objetos de interés mediante distintos tipos de indicaciones, como puntos, cuadros delimitadores o máscaras.

Rendimiento en tiempo real#

El modelo alcanza velocidades de inferencia en tiempo real y procesa aproximadamente 44 fotogramas por segundo. Esto hace que SAM 2 sea adecuado para aplicaciones que requieren una respuesta inmediata, como la edición de vídeo y la realidad aumentada.

Generalización sin ejemplos#

SAM 2 puede segmentar objetos que nunca ha encontrado, lo que demuestra una gran capacidad de generalización sin ejemplos. Esto resulta especialmente útil en dominios visuales diversos o cambiantes, donde las categorías predefinidas pueden no abarcar todos los objetos posibles.

Refinamiento interactivo#

Puedes refinar los resultados de segmentación de forma iterativa proporcionando indicaciones adicionales, lo que te permite controlar con precisión el resultado. Esta interactividad es esencial para ajustar los resultados en aplicaciones como la anotación de vídeo o el diagnóstico por imagen.

Gestión avanzada de los retos visuales#

SAM 2 incluye mecanismos para gestionar retos habituales de la segmentación de vídeo, como la oclusión y reaparición de objetos. Utiliza un mecanismo de memoria sofisticado para realizar un seguimiento de los objetos a lo largo de los fotogramas, lo que garantiza la continuidad incluso cuando los objetos quedan ocultos temporalmente o salen y vuelven a entrar en escena.

Para comprender mejor la arquitectura y las capacidades de SAM 2, consulta el artículo de investigación de SAM 2.

Rendimiento y detalles técnicos#

SAM 2 establece un nuevo referente en este campo y supera a modelos anteriores en diversas métricas:

MétricaSAM 2Mejor resultado anterior
Segmentación interactiva de vídeoEl mejor-
Interacciones humanas necesarias3 veces menosReferencia
Precisión de la segmentación de imágenesMejoradaSAM
Velocidad de inferencia6 veces más rápidoSAM

Arquitectura del modelo#

Componentes principales#

  • Codificador de imágenes y vídeo: utiliza una arquitectura basada en Transformer para extraer características de alto nivel tanto de imágenes como de fotogramas de vídeo. Este componente se encarga de comprender el contenido visual en cada instante.
  • Codificador de indicaciones: procesa las indicaciones que proporciona el usuario (puntos, cuadros y máscaras) para orientar la tarea de segmentación. Esto permite que SAM 2 se adapte a las entradas del usuario y se centre en objetos específicos de una escena.
  • Mecanismo de memoria: incluye un codificador de memoria, un banco de memoria y un módulo de atención de memoria. En conjunto, estos componentes almacenan y utilizan información de fotogramas anteriores, lo que permite al modelo mantener un seguimiento de objetos coherente a lo largo del tiempo.
  • Decodificador de máscaras: genera las máscaras de segmentación finales a partir de las características de imagen codificadas y de las indicaciones. En vídeo, también utiliza el contexto de memoria para garantizar un seguimiento preciso entre fotogramas.

Diagrama de la arquitectura de SAM 2

Mecanismo de memoria y gestión de oclusiones#

El mecanismo de memoria permite que SAM 2 gestione las dependencias temporales y las oclusiones en los datos de vídeo. A medida que los objetos se mueven e interactúan, SAM 2 registra sus características en un banco de memoria. Cuando un objeto queda ocluido, el modelo puede recurrir a esta memoria para predecir su posición y apariencia cuando reaparezca. El cabezal de oclusión gestiona específicamente las situaciones en las que los objetos no están visibles y predice la probabilidad de que un objeto esté ocluido.

Resolución de la ambigüedad con varias máscaras#

En situaciones ambiguas (por ejemplo, con objetos superpuestos), SAM 2 puede generar varias predicciones de máscaras. Esta función es esencial para representar con precisión escenas complejas en las que una sola máscara podría no describir suficientemente sus matices.

Conjunto de datos SA-V#

El conjunto de datos SA-V, desarrollado para entrenar SAM 2, es uno de los conjuntos de datos de segmentación de vídeo más grandes y diversos disponibles. Incluye:

  • Más de 51 000 vídeos: capturados en 47 países, ofrecen una amplia variedad de situaciones del mundo real.
  • Más de 600 000 anotaciones de máscaras: anotaciones espaciotemporales detalladas de máscaras, denominadas «masklets», que abarcan objetos completos y partes de estos.
  • Escala del conjunto de datos: incluye 4,5 veces más vídeos y 53 veces más anotaciones que los conjuntos de datos más grandes anteriores, lo que ofrece una diversidad y complejidad sin precedentes.

Pruebas de rendimiento#

Segmentación de objetos en vídeo#

SAM 2 ha demostrado un rendimiento superior en los principales bancos de pruebas de segmentación de vídeo:

Conjunto de datosJ&FJF
DAVIS 201782.579.885.2
YouTube-VOS81.278.983.5

Segmentación interactiva#

En tareas de segmentación interactiva, SAM 2 ofrece una eficiencia y precisión notables:

Conjunto de datosNoC@90AUC
DAVIS interactivo1.540.872

Instalación#

Para instalar SAM 2, ejecuta el siguiente comando. Todos los modelos de SAM 2 se descargarán automáticamente la primera vez que los uses.

pip install ultralytics

Cómo usar SAM 2: versatilidad en la segmentación de imágenes y vídeo#

En la siguiente tabla se detallan los modelos SAM 2 disponibles, sus pesos preentrenados, las tareas compatibles y la compatibilidad con distintos modos de funcionamiento, como inferencia, validación, entrenamiento y exportación.

Tipo de modeloPesos preentrenadosTareas compatiblesEntrenamientoValidaciónInferenciaExportar
SAM 2 pequeñosam2_t.ptSegmentación de instancias❌❌✅❌
SAM 2 pequeñosam2_s.ptSegmentación de instancias❌❌✅❌
SAM 2 basesam2_b.ptSegmentación de instancias❌❌✅❌
SAM 2 grandesam2_l.ptSegmentación de instancias❌❌✅❌
SAM 2.1 pequeñosam2.1_t.ptSegmentación de instancias❌❌✅❌
SAM 2.1 pequeñosam2.1_s.ptSegmentación de instancias❌❌✅❌
SAM 2.1 basesam2.1_b.ptSegmentación de instancias❌❌✅❌
SAM 2.1 grandesam2.1_l.ptSegmentación de instancias❌❌✅❌

Ejemplos de predicción de SAM 2#

SAM 2 puede utilizarse en una amplia variedad de tareas, como la edición de vídeo en tiempo real, el diagnóstico por imagen y los sistemas autónomos. Su capacidad para segmentar datos visuales estáticos y dinámicos lo convierte en una herramienta versátil para investigadores y desarrolladores.

Segmentar con indicaciones#

Segmentar con indicaciones

Utiliza indicaciones para segmentar objetos específicos en imágenes o vídeos.

from ultralytics import SAM

# Cargar un modelo
model = SAM("sam2.1_b.pt")

# Mostrar información del modelo (opcional)
model.info()

# Ejecutar inferencia con una indicación de cuadros delimitadores
results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])

# Ejecutar inferencia con un único punto
results = model(points=[900, 370], labels=[1])

# Ejecutar inferencia con varios puntos
results = model(points=[[400, 370], [900, 370]], labels=[1, 1])

# Ejecutar inferencia con una indicación de varios puntos por objeto
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 1]])

# Ejecutar inferencia con una indicación de puntos negativos
results = model(points=[[[400, 370], [900, 370]]], labels=[[1, 0]])

Segmentar todo#

Segmentar todo

Segmenta todo el contenido de la imagen o el vídeo sin indicaciones específicas.

from ultralytics import SAM

# Cargar un modelo
model = SAM("sam2.1_b.pt")

# Mostrar información del modelo (opcional)
model.info()

# Ejecutar inferencia
model("path/to/video.mp4")
  • Este ejemplo muestra cómo puede utilizarse SAM 2 para segmentar todo el contenido de una imagen o un vídeo si no se proporcionan indicaciones (cuadros delimitadores, puntos o máscaras).

Segmentar vídeo y realizar un seguimiento de objetos#

Segmentar vídeo

Segmenta todo el contenido del vídeo con indicaciones específicas y realiza un seguimiento de los objetos.

from ultralytics.models.sam import SAM2VideoPredictor

# Create SAM2VideoPredictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_b.pt"}
predictor = SAM2VideoPredictor(overrides=overrides)

# Ejecutar inferencia con un único punto
results = predictor(source="test.mp4", points=[920, 470], labels=[1])

# Ejecutar inferencia con varios puntos
results = predictor(source="test.mp4", points=[[920, 470], [909, 138]], labels=[1, 1])

# Ejecutar inferencia con una indicación de varios puntos por objeto
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 1]])

# Ejecutar inferencia con una indicación de puntos negativos
results = predictor(source="test.mp4", points=[[[920, 470], [909, 138]]], labels=[[1, 0]])

Segmentación interactiva dinámica y seguimiento#

SAM2DynamicInteractivePredictor es una extensión avanzada de SAM 2 que no requiere entrenamiento y permite la interacción dinámica con varios fotogramas y el aprendizaje continuo. Este predictor admite actualizaciones de indicaciones en tiempo real y la gestión de memoria para mejorar el rendimiento del seguimiento a lo largo de una secuencia de imágenes. En comparación con SAM 2 original, SAM2DynamicInteractivePredictor reconstruye el flujo de inferencia para aprovechar al máximo los modelos SAM 2 preentrenados sin necesidad de entrenamiento adicional.

Resultados de ejemplo de SAM 2

Características principales#

Ofrece tres mejoras importantes:

  1. Interacción dinámica: añade indicaciones para fusionar instancias o incorporar nuevas instancias sin seguimiento en fotogramas posteriores, en cualquier momento durante el procesamiento del vídeo.
  2. Aprendizaje continuo: añade indicaciones para las instancias existentes y mejora el rendimiento del modelo con el tiempo.
  3. Compatibilidad con varias imágenes independientes: procesa varias imágenes independientes (que no tienen por qué proceder de una secuencia de vídeo) compartiendo la memoria y realizando un seguimiento de objetos entre imágenes.

Funciones principales#

  • Flexibilidad de las indicaciones: admite cuadros delimitadores, puntos y máscaras como indicaciones.
  • Gestión del banco de memoria: mantiene un banco de memoria dinámico para almacenar los estados de los objetos entre fotogramas.
  • Seguimiento de varios objetos: permite realizar el seguimiento simultáneo de varios objetos con identificadores individuales.
  • Actualizaciones en tiempo real: permite añadir nuevas indicaciones durante la inferencia sin volver a procesar los fotogramas anteriores.
  • Procesamiento de imágenes independientes: procesa imágenes independientes con un contexto de memoria compartido para mantener la coherencia de los objetos entre imágenes.
Añadir objetos dinámicamente
from ultralytics.models.sam import SAM2DynamicInteractivePredictor

# Create SAM2DynamicInteractivePredictor
overrides = {"conf": 0.01, "task": "segment", "mode": "predict", "imgsz": 1024, "model": "sam2_t.pt", "save": False}
predictor = SAM2DynamicInteractivePredictor(overrides=overrides, max_obj_num=10)

# Definir una categoría mediante una indicación de cuadro delimitador
predictor(source="image1.jpg", bboxes=[[100, 100, 200, 200]], obj_ids=[0], update_memory=True)

# Detectar este objeto concreto en una imagen nueva
results = predictor(source="image2.jpg")

# Añadir una categoría nueva con un ID de objeto nuevo
results = predictor(
    source="image4.jpg",
    bboxes=[[300, 300, 400, 400]],  # Objeto nuevo
    obj_ids=[1],  # ID de objeto nuevo
    update_memory=True,  # Añadir a la memoria
)
# Realizar inferencia
results = predictor(source="image5.jpg")

# Añade prompts de refinamiento a la misma categoría para mejorar el rendimiento
# Esto resulta útil cuando la apariencia de los objetos cambia significativamente
results = predictor(
    source="image6.jpg",
    points=[[150, 150]],  # Punto de refinamiento
    labels=[1],  # Punto positivo
    obj_ids=[1],  # Mismo ID de objeto
    update_memory=True,  # Actualizar la memoria con información nueva
)
# Realizar inferencia sobre una imagen nueva
results = predictor(source="image7.jpg")
Nota

SAM2DynamicInteractivePredictor está diseñado para funcionar con modelos SAM 2 y admite añadir y refinar categorías con todos los prompts de caja, punto y máscara que SAM 2 admite de forma nativa. Resulta especialmente útil en situaciones en las que los objetos aparecen o cambian con el tiempo, como la anotación de vídeo o las tareas de edición interactiva.

Argumentos#

NombreValor predeterminadoTipo de datosDescripción
max_obj_num3intNúmero máximo de categorías preestablecido
update_memoryFalseboolIndica si se debe actualizar la memoria con prompts nuevos
obj_idsNoneList[int]Lista de ID de objeto correspondientes a los prompts

Casos de uso#

SAM2DynamicInteractivePredictor es ideal para:

  • Flujos de trabajo de anotación de vídeo en los que aparecen objetos nuevos durante la secuencia
  • Edición interactiva de vídeo que requiere añadir y refinar objetos en tiempo real
  • Aplicaciones de vigilancia que necesitan un seguimiento dinámico de objetos
  • Diagnóstico por imagen para seguir estructuras anatómicas a lo largo de series temporales
  • Sistemas autónomos que requieren detección y seguimiento adaptativos de objetos
  • Conjuntos de datos con varias imágenes para segmentar objetos de forma coherente en imágenes independientes
  • Análisis de colecciones de imágenes en el que es necesario seguir objetos en distintas escenas
  • Segmentación entre dominios que aprovecha la memoria de diversos contextos de imagen
  • Anotación semiautomática para crear conjuntos de datos de forma eficiente con una intervención manual mínima

Comparación de SAM frente a YOLO#

Aquí comparamos los modelos SAM 2 de Meta, incluida la variante más pequeña SAM2-t, con los modelos de segmentación de Ultralytics, incluido YOLO26n-seg:

ModeloTamaño
(MB)
Parámetros
(M)
Velocidad (CPU)
(ms/im)
Meta SAM-b37593.741703
Meta SAM2-b16280.828867
Meta SAM2-t78.138.923430
MobileSAM40.710.123802
FastSAM-s con backbone YOLOv823.911.858.0
Ultralytics YOLOv8n-seg7.1 (11.0x más pequeño)3.4 (11.4x menos)24.8 (945x más rápido)
Ultralytics YOLO11n-seg6.2 (12.6x más pequeño)2.9 (13.4x menos)24.3 (964x más rápido)
Ultralytics YOLO26n-seg6.7 (11.7x más pequeño)2.7 (14.4x menos)25.2 (930x más rápido)

Esta comparación muestra las diferencias considerables de tamaño y velocidad entre las variantes de SAM y los modelos de segmentación YOLO. Aunque SAM ofrece capacidades únicas de segmentación automática, los modelos YOLO, en particular YOLOv8n-seg, YOLO11n-seg y YOLO26n-seg, son mucho más pequeños, rápidos y eficientes desde el punto de vista computacional.

Las velocidades de SAM se han medido con PyTorch y las de YOLO, con ONNX Runtime. Las pruebas se han realizado en un Apple M4 Air de 2025 con 16 GB de RAM usando torch==2.10.0, ultralytics==8.4.31 y onnxruntime==1.24.4. Para reproducir esta prueba:

Ejemplo
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Perfilar SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Perfilar FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Perfilar modelos YOLO (ONNX)
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    onnx_path = model.export(format="onnx", dynamic=True, nms=False)  # Cabezal sin NMS de YOLO26; no hace nada con YOLOv8/YOLO11
    model = YOLO(onnx_path)
    model(ASSETS)

Anotación automática: creación eficiente de conjuntos de datos#

La anotación automática es una potente función de SAM 2 que permite generar conjuntos de datos de segmentación de forma rápida y precisa mediante modelos preentrenados. Esta capacidad resulta especialmente útil para crear conjuntos de datos grandes y de alta calidad sin un gran esfuerzo manual.

Cómo anotar automáticamente con SAM 2#



Ver: Anotación automática con Segment Anything 2 de Meta mediante Ultralytics | Etiquetado de datos

Para anotar automáticamente tu conjunto de datos con SAM 2, sigue este ejemplo:

Ejemplo de anotación automática
from ultralytics.data.annotator import auto_annotate

auto_annotate(data="path/to/images", det_model="yolo26x.pt", sam_model="sam2_b.pt")
ArgumentoTipoPredeterminadoDescripción
datastrobligatorioRuta al directorio que contiene las imágenes de destino que se van a anotar o segmentar.
det_modelstr'yolo26x.pt'Ruta al modelo de detección YOLO para la detección inicial de objetos.
sam_modelstr'sam_b.pt'Ruta al modelo SAM para la segmentación (admite los pesos de SAM, SAM 2, MobileSAM y SAM 3).
devicestr''Dispositivo de cálculo (p. ej., 'cuda:0', 'cpu' o '' para detectar automáticamente el dispositivo).
conffloat0.25Umbral de confianza de detección YOLO para filtrar las detecciones poco fiables.
ioufloat0.45Umbral de IoU para la supresión no máxima (NMS) y el filtrado de cajas superpuestas.
imgszint640Tamaño de entrada para cambiar el tamaño de las imágenes (se redondea al múltiplo de 32 más cercano por exceso si es necesario).
max_detint300Número máximo de detecciones por imagen para optimizar el uso de memoria.
classeslist[int]NoneLista de índices de clase que se van a detectar (p. ej., [0, 1] para persona y bicicleta).
output_dirstrNoneDirectorio donde se guardan las anotaciones (por defecto: directorio hermano de <data>_auto_annotate_labels).

Esta función facilita la creación rápida de conjuntos de datos de segmentación de alta calidad, ideales para investigadores y desarrolladores que quieran acelerar sus proyectos.

Limitaciones#

A pesar de sus puntos fuertes, SAM 2 tiene ciertas limitaciones:

  • Estabilidad del seguimiento: SAM 2 puede perder el rastro de los objetos durante secuencias largas o ante cambios importantes del punto de vista.
  • Confusión entre objetos: A veces, el modelo puede confundir objetos de aspecto similar, especialmente en escenas concurridas.
  • Eficiencia con varios objetos: La eficiencia de la segmentación disminuye al procesar varios objetos a la vez debido a la falta de comunicación entre ellos.
  • Precisión de los detalles de precisión: Puede pasar por alto detalles pequeños, sobre todo con objetos que se mueven rápido. Los prompts adicionales pueden ayudar a resolver parcialmente este problema, pero no se garantiza la suavidad temporal.

Citas y agradecimientos#

Si SAM 2 es una parte esencial de tu trabajo de investigación o desarrollo, cita el modelo con la siguiente referencia:

Cita
@article{ravi2024sam2,
  title={SAM 2: Segment Anything in Images and Videos},
  author={Ravi, Nikhila and Gabeur, Valentin and Hu, Yuan-Ting and Hu, Ronghang and Ryali, Chaitanya and Ma, Tengyu and Khedr, Haitham and R{\"a}dle, Roman and Rolland, Chloe and Gustafson, Laura and Mintun, Eric and Pan, Junting and Alwala, Kalyan Vasudev and Carion, Nicolas and Wu, Chao-Yuan and Girshick, Ross and Doll{\'a}r, Piotr and Feichtenhofer, Christoph},
  journal={arXiv preprint},
  year={2024}
}

Agradecemos a Meta AI sus contribuciones a la comunidad de IA con este innovador modelo y conjunto de datos.

Preguntas frecuentes#

  • SAM 2, sucesor del Modelo Segment Anything (SAM) de Meta, es una herramienta de vanguardia diseñada para segmentar objetos de forma exhaustiva tanto en imágenes como en vídeos. Destaca en el procesamiento de datos visuales complejos gracias a una arquitectura de modelo unificada y basada en prompts, que admite el procesamiento en tiempo real y la generalización de cero disparos. SAM 2 ofrece varias mejoras respecto al SAM original, entre ellas:

    • Arquitectura de modelo unificada: Combina las capacidades de segmentación de imágenes y vídeos en un solo modelo.
    • Rendimiento en tiempo real: Procesa aproximadamente 44 fotogramas por segundo, por lo que resulta adecuado para aplicaciones que requieren respuesta inmediata.
    • Generalización de cero disparos: Segmenta objetos que nunca ha encontrado, algo útil en diversos dominios visuales.
    • Refinamiento interactivo: Permite refinar los resultados de segmentación de forma iterativa mediante prompts adicionales.
    • Gestión avanzada de desafíos visuales: Gestiona desafíos habituales de la segmentación de vídeo, como la oclusión y la reaparición de objetos.

    Para obtener más información sobre la arquitectura y las capacidades de SAM 2, consulta el artículo de investigación de SAM 2.

  • Puedes utilizar SAM 2 para segmentar vídeo en tiempo real aprovechando su interfaz basada en prompts y sus capacidades de inferencia en tiempo real. Aquí tienes un ejemplo básico:

    Segmentar con indicaciones

    Utiliza indicaciones para segmentar objetos específicos en imágenes o vídeos.

    from ultralytics import SAM
    
    # Cargar un modelo
    model = SAM("sam2_b.pt")
    
    # Mostrar información del modelo (opcional)
    model.info()
    
    # Segmentar con un prompt de caja delimitadora
    results = model("path/to/image.jpg", bboxes=[100, 100, 200, 200])
    
    # Segmentar con un prompt de punto
    results = model("path/to/image.jpg", points=[150, 150], labels=[1])

    Para obtener instrucciones más completas, consulta la sección Cómo usar SAM 2.

  • SAM 2 se entrena con el conjunto de datos SA-V, uno de los conjuntos de datos de segmentación de vídeo más grandes y diversos disponibles. El conjunto de datos SA-V incluye:

    • Más de 51 000 vídeos: capturados en 47 países, ofrecen una amplia variedad de situaciones del mundo real.
    • Más de 600 000 anotaciones de máscaras: anotaciones espaciotemporales detalladas de máscaras, denominadas «masklets», que abarcan objetos completos y partes de estos.
    • Escala del conjunto de datos: Incluye 4.5 veces más vídeos y 53 veces más anotaciones que los conjuntos de datos más grandes anteriores, lo que ofrece una diversidad y complejidad sin precedentes.

    Este amplio conjunto de datos permite a SAM 2 lograr un rendimiento superior en los principales benchmarks de segmentación de vídeo y mejora sus capacidades de generalización de cero disparos. Para obtener más información, consulta la sección Conjunto de datos SA-V.

  • SAM 2 incluye un sofisticado mecanismo de memoria para gestionar las dependencias temporales y las oclusiones en datos de vídeo. El mecanismo de memoria consta de:

    • Codificador de memoria y banco de memoria: Almacena características de fotogramas anteriores.
    • Módulo de atención de memoria: Utiliza la información almacenada para mantener un seguimiento coherente de los objetos a lo largo del tiempo.
    • Cabezal de oclusión: Gestiona específicamente las situaciones en las que los objetos no son visibles y predice la probabilidad de que un objeto esté ocluido.

    Este mecanismo garantiza la continuidad incluso cuando los objetos quedan ocultos temporalmente o salen de la escena y vuelven a entrar en ella. Para obtener más información, consulta la sección Mecanismo de memoria y gestión de oclusiones.

  • Los modelos SAM 2, como SAM2-t y SAM2-b de Meta, ofrecen potentes capacidades de segmentación de cero disparos, pero son considerablemente más grandes y lentos que los modelos YOLO. Por ejemplo, YOLO26n-seg es aproximadamente 24 veces más pequeño y más de 1145 veces más rápido que SAM2-b en CPU. Aunque SAM 2 destaca en situaciones de segmentación versátil, basada en prompts y de cero disparos, YOLO26 está optimizado para la velocidad, la eficiencia y las aplicaciones en tiempo real gracias a la inferencia integral sin NMS, por lo que resulta más adecuado para implementarse en entornos con recursos limitados.

Comentarios