Ultralytics YOLO27:

SAM 3: Segmenta cualquier cosa con conceptos#

Descripción general de la segmentación de conceptos mediante prompts de SAM 3

SAM 3 (Modelo de Segmentación de Cualquier Cosa 3) es el modelo fundacional publicado por Meta para la segmentación de conceptos mediante prompts (PCS). Basándose en SAM 2, SAM 3 introduce una capacidad completamente nueva: detectar, segmentar y seguir todas las instancias de un concepto visual especificado mediante prompts de texto, imágenes de ejemplo o ambos. A diferencia de las versiones anteriores de SAM, que segmentan un solo objeto por prompt, SAM 3 puede encontrar y segmentar cada aparición de un concepto en cualquier parte de imágenes o vídeos, en línea con los objetivos de vocabulario abierto de la segmentación de instancias moderna.



Watch: How to Use Meta Segment Anything 3 with Ultralytics | Text-Prompt Segmentation on Images & Videos

SAM 3 está plenamente integrado en el paquete ultralytics, proporcionando soporte nativo para la segmentación de conceptos con indicaciones de texto, indicaciones de ejemplos de imágenes y seguimiento de vídeo. El punto de control más nuevo SAM 3.1 es compatible con la predicción de imágenes.

Descripción general#

SAM 3 logra una mejora del rendimiento de 2× respecto a los sistemas existentes en la segmentación de conceptos mediante prompts, al tiempo que mantiene y mejora las capacidades de SAM 2 para la segmentación visual interactiva. El modelo destaca en la segmentación de vocabulario abierto, ya que permite especificar conceptos mediante frases nominales sencillas (p. ej., "autobús escolar amarillo", "gato atigrado") o proporcionando imágenes de ejemplo del objeto objetivo. Estas capacidades complementan los pipelines listos para producción que se basan en flujos de trabajo optimizados de predicción y seguimiento.

Ejemplos de segmentación de SAM 3 mediante prompts de texto

¿Qué es la segmentación de conceptos mediante prompts (PCS)?#

La tarea PCS recibe como entrada un prompt de concepto y devuelve máscaras de segmentación con identidades únicas para todas las instancias de objetos coincidentes. Los prompts de concepto pueden ser:

  • Texto: Frases nominales sencillas como "manzana roja" o "persona con sombrero", similares al aprendizaje zero-shot
  • Imágenes de ejemplo: BBoxes alrededor de objetos de ejemplo (positivos o negativos) para una generalización rápida
  • Combinados: Texto e imágenes de ejemplo juntos para un control preciso

Esto difiere de los prompts visuales tradicionales (puntos, cajas y máscaras), que segmentan únicamente una instancia de objeto específica, como popularizó la familia SAM original.

Métricas de rendimiento clave#

MétricaLogro de SAM 3
AP de máscara zero-shot en LVIS47,0 (frente al mejor resultado anterior de 38,5, una mejora del +22 %)
Benchmark SA-Co2× mejor que los sistemas existentes
Velocidad de inferencia (GPU H200)30 ms por imagen con más de 100 objetos detectados
Rendimiento en vídeoCasi en tiempo real para ~5 objetos simultáneos
Benchmark VOS MOSEv260,1 J&F (+25,5 % respecto a SAM 2.1, +17 % respecto al SOTA anterior)
Refinamiento interactivo+18,6 CGF1 de mejora tras 3 prompts con imágenes de ejemplo
Diferencia respecto al rendimiento humanoAlcanza el 88 % del límite inferior estimado en SA-Co/Gold

Para obtener contexto sobre las métricas de los modelos y las compensaciones en producción, consulta información sobre la evaluación de modelos y métricas de rendimiento de YOLO.

SAM 3.1#

SAM 3.1, publicado por Meta el 27 de marzo de 2026, es un nuevo punto de control de SAM 3 que añade Object Multiplex, un enfoque de memoria compartida para el seguimiento de vídeo multiobjeto. En lugar de procesar cada objeto rastreado de forma independiente, SAM 3.1 agrupa los objetos en contenedores de capacidad fija y los procesa conjuntamente, lo que Meta reporta como una ~7× aceleración con 128 objetos en una sola GPU H100. El detector de imágenes y el cabezal de indicación de puntos interactivos conservan la arquitectura de SAM 3.

BenchmarkMétricaSAM 3SAM 3.1
SA-Co/VEval SA-V (test)cgF130.330.5
SA-Co/VEval YT-Temporal-1B (test)cgF150.852.9
SA-Co/VEval SmartGlasses (test)cgF136.436.3
MOSEv1 (val)J&F78.479.6
DAVIS17 (val)J&F92.292.7
SA-V (test)J&F84.485.1
YTVOS19 (val)G89.789.3
MOSEv2 (val)J&Ḟ60.362.3

Ultralytics carga el punto de control de SAM 3.1 (sam3.1_multiplex.pt) en los predictores de imágenes de SAM 3: SAM("sam3.1_multiplex.pt") para solicitudes de puntos y cuadros, y SAM3SemanticPredictor para solicitudes de texto y ejemplares. El seguimiento de vídeo de multiplexación de objetos todavía no es compatible, así que sigue usando sam3.pt con SAM3VideoPredictor y SAM3VideoSemanticPredictor.

Arquitectura#

SAM 3 consta de un detector y un tracker que comparten un backbone de visión Perception Encoder (PE). Este diseño desacoplado evita conflictos entre tareas y permite tanto la detección a nivel de imagen como el seguimiento a nivel de vídeo, con una interfaz compatible con el uso de Python y el uso de la CLI de Ultralytics.

Componentes principales#

  • Detector: Arquitectura basada en DETR para la detección de conceptos a nivel de imagen

    • Codificador de texto para prompts de frases nominales
    • Codificador de ejemplos para prompts basados en imágenes
    • Codificador de fusión para condicionar las características de la imagen según los prompts
    • Nuevo presence head que desacopla el reconocimiento ("qué") de la localización ("dónde")
    • Mask head para generar máscaras de segmentación de instancias
  • Tracker: Segmentación de vídeo basada en memoria heredada de SAM 2

    • Codificador de prompts, decodificador de máscaras y codificador de memoria
    • Banco de memoria para almacenar la apariencia de los objetos entre fotogramas
    • Desambiguación temporal facilitada por técnicas como un filtro de Kalman en configuraciones con múltiples objetos
  • Presence Token: Token global aprendido que predice si el concepto objetivo está presente en la imagen o el fotograma, lo que mejora la detección al separar el reconocimiento de la localización.

Diagrama de la arquitectura del modelo SAM 3

Innovaciones principales#

  1. Reconocimiento y localización desacoplados: El presence head predice globalmente la presencia del concepto, mientras que las consultas de propuestas se centran únicamente en la localización, evitando objetivos contradictorios.
  2. Prompts de conceptos y visuales unificados: Admite tanto PCS (prompts de conceptos) como PVS (prompts visuales, como los clics y las cajas de SAM 2) en un único modelo.
  3. Refinamiento interactivo mediante ejemplos: Puedes añadir imágenes de ejemplo positivas o negativas para refinar los resultados de forma iterativa; el modelo generaliza a objetos similares en lugar de limitarse a corregir instancias individuales.
  4. Desambiguación temporal: Utiliza puntuaciones de detección de masklets y nuevos prompts periódicos para gestionar oclusiones, escenas multitudinarias y fallos de seguimiento en vídeo, en línea con las prácticas recomendadas de segmentación y seguimiento de instancias.

Conjunto de datos SA-Co#

SAM 3 se entrena con Segment Anything with Concepts (SA-Co), el conjunto de datos de segmentación más grande y diverso publicado hasta la fecha por Meta, que amplía el alcance más allá de benchmarks habituales como COCO y LVIS.

Datos de entrenamiento#

Componente del conjunto de datosDescripciónEscala
SA-Co/HQDatos de imágenes de alta calidad anotados por personas mediante un motor de datos de 4 fases5,2 M de imágenes, 4 M de frases nominales únicas
SA-Co/SYNConjunto de datos sintético etiquetado por IA sin intervención humana38 M de frases nominales, 1,4 mil millones de máscaras
SA-Co/EXT15 conjuntos de datos externos enriquecidos con negativos difícilesVaría según la fuente
SA-Co/VIDEOAnotaciones de vídeo con seguimiento temporal52,5 mil vídeos, 24,8 mil frases nominales únicas

Datos de benchmark#

El benchmark de evaluación SA-Co contiene 214 mil frases únicas en 126 mil imágenes y vídeos, lo que proporciona más de 50× más conceptos que los benchmarks existentes. Incluye:

  • SA-Co/Gold: 7 dominios, con triple anotación para medir los límites del rendimiento humano
  • SA-Co/Silver: 10 dominios, con una única anotación humana
  • SA-Co/Bronze y SA-Co/Bio: 9 conjuntos de datos existentes adaptados para la segmentación de conceptos
  • SA-Co/VEval: Benchmark de vídeo con 3 dominios (SA-V, YT-Temporal-1B y SmartGlasses)

Innovaciones del motor de datos#

El motor de datos escalable con participación humana y del modelo de SAM 3 logra un rendimiento de anotación 2× superior mediante:

  1. Anotadores de IA: Los modelos basados en Llama proponen diversas frases nominales, incluidos negativos difíciles
  2. Verificadores de IA: Los LLM multimodales ajustados verifican la calidad y exhaustividad de las máscaras con un rendimiento casi humano
  3. Minería activa: Centra el esfuerzo humano en casos de fallo complejos en los que la IA tiene dificultades
  4. Basado en ontologías: Aprovecha una ontología amplia fundamentada en Wikidata para cubrir conceptos

Instalación#

Instala o actualiza el paquete ultralytics:

pip install -U ultralytics
Pesos del modelo SAM 3 necesarios

A diferencia de otros modelos de Ultralytics, los pesos de SAM 3 (sam3.pt) no se descargan automáticamente. Primero debes solicitar acceso a los pesos del modelo en la página del modelo SAM 3 en Hugging Face y, una vez aprobado, descargar sam3.pt desde esa página. Coloca el archivo sam3.pt descargado en tu directorio de trabajo o especifica la ruta completa al cargar el modelo.

Los pesos de SAM 3.1 (sam3.1_multiplex.pt) están restringidos de la misma manera en la página del modelo de SAM 3.1. Pasa sam3.1_multiplex.pt en cualquier lugar donde los ejemplos de imágenes de abajo usen sam3.pt.

`TypeError: 'SimpleTokenizer' object is not callable`

Si aparece el error anterior durante la predicción, significa que tienes instalado el paquete clip incorrecto. Instala el paquete clip correcto ejecutando lo siguiente:

pip uninstall clip -y
pip install git+https://github.com/ultralytics/CLIP.git

Cómo usar SAM 3: versatilidad en la segmentación de conceptos#

SAM 3 admite las tareas de segmentación de conceptos mediante prompts (PCS) y segmentación visual mediante prompts (PVS) a través de distintas interfaces de predictor:

Tareas y modelos compatibles#

Tipo de tareaTipos de promptsSalida
Segmentación de conceptos (PCS)Texto (frases nominales), imágenes de ejemploTodas las instancias que coinciden con el concepto
Segmentación visual (PVS)Puntos, cajas y máscarasUna sola instancia de objeto (estilo SAM 2)
Refinamiento interactivoAñade o elimina imágenes de ejemplo o clics de forma iterativaSegmentación refinada con mayor precisión

Ejemplos de segmentación de conceptos#

Segmentación con indicaciones de texto#

Segmentación de conceptos basada en texto

Encuentra y segmenta todas las instancias de un concepto mediante una descripción de texto. Las indicaciones de texto requieren la interfaz SAM3SemanticPredictor.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor with configuration
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "model": "sam3.pt",
    "quantize": 16,  # Use FP16 for faster inference
    "save": True,
}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image once for multiple queries
predictor.set_image("path/to/image.jpg")

# Query with multiple text prompts
results = predictor(text=["person", "bus", "glasses"])

# Works with descriptive phrases
results = predictor(text=["person with red cloth", "person with blue cloth"])

# Query with a single concept
results = predictor(text=["a person"])

Segmentación con ejemplares de imagen#

Segmentación basada en ejemplares de imagen

Usa cuadros delimitadores como indicaciones visuales para encontrar todas las instancias similares. Esto también requiere SAM3SemanticPredictor para la coincidencia basada en conceptos.

from ultralytics.models.sam import SAM3SemanticPredictor

# Initialize predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16, "save": True}
predictor = SAM3SemanticPredictor(overrides=overrides)

# Set image
predictor.set_image("path/to/image.jpg")

# Provide bounding box examples to segment similar objects
results = predictor(bboxes=[[480.0, 290.0, 590.0, 650.0]])

# Multiple bounding boxes as exemplars of the same visual concept
results = predictor(bboxes=[[539, 599, 589, 639], [343, 267, 499, 662]])

Inferencia basada en características para una mayor eficiencia#

Reutilización de características de imagen para varias consultas

Extrae las características de la imagen una vez y reutilízalas para varias consultas de segmentación con el fin de mejorar la eficiencia.

import cv2

from ultralytics.models.sam import SAM3SemanticPredictor
from ultralytics.utils.plotting import Annotator, colors

# Initialize predictors
overrides = {"conf": 0.50, "task": "segment", "mode": "predict", "model": "sam3.pt", "verbose": False}
predictor = SAM3SemanticPredictor(overrides=overrides)
predictor2 = SAM3SemanticPredictor(overrides=overrides)

# Extract features from the first predictor
source = "path/to/image.jpg"
predictor.set_image(source)
src_shape = cv2.imread(source).shape[:2]

# Setup second predictor and reuse features
predictor2.setup_model()

# Perform inference using shared features with text prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, text=["person"])

# Perform inference using shared features with bounding box prompt
masks, boxes = predictor2.inference_features(predictor.features, src_shape=src_shape, bboxes=[[439, 437, 524, 709]])

# Visualize results
if masks is not None:
    masks, boxes = masks.cpu().numpy(), boxes.cpu().numpy()
    im = cv2.imread(source)
    annotator = Annotator(im, pil=False)
    annotator.masks(masks, [colors(x, True) for x in range(len(masks))])

    cv2.imshow("result", annotator.result())
    cv2.waitKey(0)

Segmentación de conceptos en vídeo#

Rastrea conceptos en un vídeo con cuadros delimitadores#

Seguimiento de vídeo con indicaciones visuales

Detecta y rastrea instancias de objetos en los fotogramas de un vídeo mediante indicaciones de cuadros delimitadores.

from ultralytics.models.sam import SAM3VideoPredictor

# Create video predictor
overrides = {"conf": 0.25, "task": "segment", "mode": "predict", "model": "sam3.pt", "quantize": 16}
predictor = SAM3VideoPredictor(overrides=overrides)

# Track objects using bounding box prompts
results = predictor(source="path/to/video.mp4", bboxes=[[706.5, 442.5, 905.25, 555], [598, 635, 725, 750]], stream=True)

# Process and display results
for r in results:
    r.show()  # Display frame with segmentation masks

Rastrea conceptos con indicaciones de texto#

Seguimiento de vídeo con consultas semánticas

Rastrea todas las instancias de los conceptos especificados mediante texto a lo largo de los fotogramas de un vídeo.

from ultralytics.models.sam import SAM3VideoSemanticPredictor

# Initialize semantic video predictor
overrides = {
    "conf": 0.25,
    "task": "segment",
    "mode": "predict",
    "imgsz": 640,
    "model": "sam3.pt",
    "quantize": 16,
    "save": True,
}
predictor = SAM3VideoSemanticPredictor(overrides=overrides)

# Track concepts using text prompts
results = predictor(source="path/to/video.mp4", text=["person", "bicycle"], stream=True)

# Process results
for r in results:
    r.show()  # Display frame with tracked objects

# Alternative: Track with bounding box prompts
results = predictor(
    source="path/to/video.mp4",
    bboxes=[[864, 383, 975, 620], [705, 229, 782, 402]],
    labels=[1, 1],  # Positive labels
    stream=True,
)

Indicaciones visuales (compatibilidad con SAM 2)#

SAM 3 mantiene la compatibilidad total con las indicaciones visuales de SAM 2 para la segmentación de un solo objeto:

Indicaciones visuales al estilo de SAM 2

La interfaz básica SAM funciona exactamente como SAM 2 y segmenta únicamente el área específica indicada por las indicaciones visuales (puntos, cuadros o máscaras).

from ultralytics import SAM

model = SAM("sam3.pt")

# Single point prompt - segments object at specific location
results = model.predict(source="path/to/image.jpg", points=[900, 370], labels=[1])
results[0].show()

# Multiple points - segments single object with multiple point hints
results = model.predict(source="path/to/image.jpg", points=[[400, 370], [900, 370]], labels=[1, 1])

# Box prompt - segments object within bounding box
results = model.predict(source="path/to/image.jpg", bboxes=[100, 150, 300, 400])
results[0].show()
Indicaciones visuales frente a segmentación de conceptos

El uso de SAM("sam3.pt") con indicaciones visuales (puntos/cuadros/máscaras) segmentará únicamente el objeto específico situado en esa ubicación, igual que SAM 2. Para segmentar todas las instancias de un concepto, usa SAM3SemanticPredictor con indicaciones de texto o de ejemplares, como se muestra arriba.

Pruebas de rendimiento#

Segmentación de imágenes#

SAM 3 logra resultados de vanguardia en múltiples pruebas, incluidos conjuntos de datos del mundo real como LVIS y COCO para segmentación:

BenchmarkMétricaSAM 3Mejor resultado anteriorMejora
LVIS (sin entrenamiento)AP de máscara47.038.5+22.1%
SA-Co/GoldCGF165.034.3 (OWLv2)+89.5%
COCO (sin entrenamiento)AP de cuadro53.552.2 (T-Rex2)+2.5%
ADE-847 (segmentación semántica)mIoU14.79.2 (APE-D)+59.8%
PascalConcept-59mIoU59.458.5 (APE-D)+1.5%
Cityscapes (segmentación semántica)mIoU65.144.2 (APE-D)+47.3%

Explora las opciones de conjuntos de datos para realizar experimentos rápidos en conjuntos de datos de Ultralytics.

Rendimiento de la segmentación de vídeo#

SAM 3 muestra mejoras significativas frente a SAM 2 y a los modelos de vanguardia anteriores en pruebas de vídeo como DAVIS 2017 y YouTube-VOS:

BenchmarkMétricaSAM 3SAM 2.1 LMejora
MOSEv2J&F60.147.9+25.5%
DAVIS 2017J&F92.090.7+1.4%
LVOSv2J&F88.279.6+10.8%
SA-VJ&F84.678.4+7.9%
YTVOS19J&F89.689.3+0.3%

Adaptación con pocos ejemplos#

SAM 3 destaca en la adaptación a nuevos dominios con un número mínimo de ejemplos, algo relevante para los flujos de trabajo de IA centrada en los datos:

BenchmarkAP con 0 ejemplosAP con 10 ejemplosMejor resultado anterior (10 ejemplos)
ODinW1359.971.667.9 (gDino1.5-Pro)
RF100-VL14.335.733.7 (gDino-T)

Eficacia del refinamiento interactivo#

Las indicaciones basadas en conceptos de SAM 3 con ejemplares convergen mucho más rápido que las indicaciones visuales:

Indicaciones añadidasPuntuación CGF1Mejora frente a solo textoMejora frente a la referencia PVS
Solo texto46.4referenciareferencia
+1 ejemplar57.6+11.2+6.7
+2 ejemplares62.2+15.8+9.7
+3 ejemplares65.0+18.6+11.2
+4 ejemplares65.7+19.3+11.5 (meseta)

Precisión del recuento de objetos#

SAM 3 proporciona un recuento preciso al segmentar todas las instancias, un requisito habitual en el recuento de objetos:

BenchmarkPrecisiónMAEfrente al mejor MLLM
CountBench95.6%0.1192.4 % (Gemini 2.5)
PixMo-Count87.3%0.2288,8 % (Molmo-72B)

Comparación entre SAM 3, SAM 2 y YOLO#

Aquí comparamos las capacidades de SAM 3 con los modelos SAM 2 y YOLO26. Para la detección y segmentación en tiempo real con vocabulario abierto a partir del mismo tipo de indicación, consulta YOLOE:

CapacidadSAM 3SAM 2YOLO26n-seg
Segmentación de conceptos✅ Todas las instancias a partir de texto/ejemplares❌ No compatible❌ No compatible
Segmentación visual✅ Una sola instancia (compatible con SAM 2)✅ Una sola instancia✅ Todas las instancias
Capacidad sin entrenamiento✅ Vocabulario abierto✅ Indicaciones geométricas❌ Conjunto cerrado
Refinamiento interactivo✅ Ejemplares + clics✅ Solo clics❌ No compatible
Seguimiento de vídeo✅ Varios objetos con identidades✅ Varios objetos✅ Varios objetos
AP de máscaras de LVIS (zero-shot)47.0N/AN/A
J&F de MOSEv260.147.9N/A
Velocidad (GPU, ms/imagen)29218578.4
Tamaño del modelo3.45 GB162 MB (base)6.4 MB

Velocidad evaluada en una NVIDIA RTX PRO 6000 con torch==2.9.1 y ultralytics==8.4.19.

Conclusiones clave:

  • SAM 3: ideal para la segmentación de conceptos con vocabulario abierto y para encontrar todas las instancias de un concepto mediante texto o indicaciones con ejemplares
  • SAM 2: ideal para la segmentación interactiva de un solo objeto en imágenes y vídeos mediante indicaciones geométricas
  • YOLO26: Ideal para la segmentación en tiempo real y de alta velocidad con inferencia de extremo a extremo opcional sin NMS, exportable a muchos formatos para su despliegue en GPUs, CPUs y dispositivos de borde

Comparación entre SAM y YOLO#

Comparación de SAM 3, SAM 2, SAM, MobileSAM y FastSAM con los modelos de segmentación YOLO de Ultralytics (YOLOv8, YOLO11, YOLO26) en cuanto a tamaño, parámetros y velocidad de inferencia en GPU:

ModeloTamaño
(MB)
Parámetros
(M)
Velocidad (GPU)
(ms/imagen)
Meta SAM-b37593.71306
Meta SAM2-b16280.8857
Meta SAM2-t78.138.9668
Meta SAM33450473.62921
MobileSAM40.710.1605
FastSAM-s con backbone de YOLOv823.711.855.9
Ultralytics YOLOv8n-seg6,7 (515 veces más pequeño)3,4 (139,1 veces menos)17,4 (167 veces más rápido)
Ultralytics YOLO11n-seg5.9 (585 veces más pequeño)2,9 (163,1 veces menos)12,6 (231 veces más rápido)
Ultralytics YOLO26n-seg6,4 (539 veces más pequeño)2.7 (175.2 veces menos)8.4 (347 veces más rápido)

Esta comparación demuestra las diferencias sustanciales de tamaño y velocidad entre las variantes de SAM y los modelos de segmentación YOLO. Aunque SAM ofrece capacidades únicas de segmentación automática, los modelos YOLO, especialmente YOLOv8n-seg, YOLO11n-seg y YOLO26n-seg, son considerablemente más pequeños, rápidos y eficientes desde el punto de vista computacional.

Las pruebas se realizaron en una NVIDIA RTX PRO 6000 con 96 GB de VRAM usando torch==2.9.1 y ultralytics==8.4.19. Para reproducir esta prueba:

Ejemplo
from ultralytics import ASSETS, SAM, YOLO, FastSAM

# Profile SAM3, SAM2-t, SAM2-b, SAM-b, MobileSAM
for file in ["sam_b.pt", "sam2_b.pt", "sam2_t.pt", "mobile_sam.pt", "sam3.pt"]:
    model = SAM(file)
    model.info()
    model(ASSETS)

# Profile FastSAM-s
model = FastSAM("FastSAM-s.pt")
model.info()
model(ASSETS)

# Profile YOLO models
for file_name in ["yolov8n-seg.pt", "yolo11n-seg.pt", "yolo26n-seg.pt"]:
    model = YOLO(file_name)
    model.info()
    model(ASSETS, nms=False)  # YOLO26 NMS-free head; no-op for YOLOv8/YOLO11

Métricas de evaluación#

SAM 3 introduce nuevas métricas diseñadas para la tarea PCS, que complementan medidas conocidas como la puntuación F1, la precisión y la exhaustividad.

F1 con clasificación condicionada (CGF1)#

La métrica principal que combina localización y clasificación:

CGF1 = 100 × pmF1 × IL_MCC

Donde:

  • pmF1 (F1 macro positivo): mide la calidad de la localización en ejemplos positivos
  • IL_MCC (coeficiente de correlación de Matthews a nivel de imagen): mide la precisión de la clasificación binaria ("¿está presente el concepto?")

¿Por qué estas métricas?#

Las métricas AP tradicionales no tienen en cuenta la calibración, lo que dificulta el uso práctico de los modelos. Al evaluar únicamente las predicciones con una confianza superior a 0.5, las métricas de SAM 3 exigen una buena calibración e imitan los patrones de uso del mundo real en los bucles interactivos de predicción y seguimiento.

Principales ablaciones y conclusiones#

Impacto del cabezal de presencia#

El cabezal de presencia desacopla el reconocimiento de la localización, lo que proporciona mejoras significativas:

ConfiguraciónCGF1IL_MCCpmF1
Sin presencia57.60.7774.7
Con presencia63.30.8277.1

El cabezal de presencia proporciona una mejora de +5.7 en CGF1 (+9.9%), principalmente al mejorar la capacidad de reconocimiento (IL_MCC +6.5%).

Efecto de los negativos difíciles#

Negativos difíciles/imagenCGF1IL_MCCpmF1
031.80.4470.2
544.80.6271.9
3049.20.6872.3

Los negativos difíciles son cruciales para el reconocimiento con vocabulario abierto y mejoran IL_MCC en un 54.5% (0.44 → 0.68).

Escalado de los datos de entrenamiento#

Fuentes de datosCGF1IL_MCCpmF1
Solo externas30.90.4666.3
Externas + sintéticas39.70.5770.6
Externas + de alta calidad51.80.7173.2
Las tres54.30.7473.5

Las anotaciones humanas de alta calidad ofrecen grandes mejoras frente al uso exclusivo de datos sintéticos o externos. Para obtener información de fondo sobre las prácticas de calidad de los datos, consulta recopilación y anotación de datos.

Aplicaciones#

La capacidad de segmentación de conceptos de SAM 3 permite nuevos casos de uso:

  • Moderación de contenido: encuentra todas las instancias de tipos de contenido específicos en bibliotecas multimedia
  • Comercio electrónico: segmenta todos los productos de un tipo determinado en imágenes de catálogo, con compatibilidad para la autoanotación
  • Imágenes médicas: identifica todas las apariciones de tipos de tejido o anomalías específicos
  • Sistemas autónomos: sigue todas las instancias de señales de tráfico, peatones o vehículos por categoría
  • Análisis de vídeo: cuenta y sigue a todas las personas que llevan prendas específicas o realizan determinadas acciones
  • Anotación de conjuntos de datos: anota rápidamente todas las instancias de categorías de objetos poco frecuentes
  • Investigación científica: cuantifica y analiza todas las muestras que cumplen criterios específicos

Agente SAM 3: razonamiento lingüístico ampliado#

SAM 3 se puede combinar con modelos grandes de lenguaje multimodales (MLLM) para gestionar consultas complejas que requieren razonamiento, de forma similar a sistemas de vocabulario abierto como OWLv2 y T-Rex.

Rendimiento en tareas de razonamiento#

BenchmarkMétricaAgente SAM 3 (Gemini 2.5 Pro)Mejor resultado anterior
ReasonSeg (validación)gIoU76.065.0 (SoTA)
ReasonSeg (prueba)gIoU73.861.3 (SoTA)
OmniLabel (validación)AP46.736.5 (REAL)
RefCOCO+Acc91.289.3 (LISA)

Ejemplos de consultas complejas#

El agente SAM 3 puede gestionar consultas que requieren razonamiento:

  • "Personas sentadas, pero que no sostienen una caja de regalo en las manos"
  • "El perro más cercano a la cámara que no lleva collar"
  • «Objetos rojos más grandes que la mano de la persona»

El MLLM propone consultas sencillas en forma de sintagmas nominales a SAM 3, analiza las máscaras devueltas y repite el proceso hasta quedar satisfecho.

Limitaciones#

Aunque SAM 3 supone un avance importante, presenta ciertas limitaciones:

  • Complejidad de las frases: Es más adecuado para sintagmas nominales sencillos; las expresiones referenciales largas o el razonamiento complejo pueden requerir la integración de un MLLM
  • Gestión de la ambigüedad: Algunos conceptos siguen siendo intrínsecamente ambiguos (por ejemplo, «ventana pequeña» o «habitación acogedora»)
  • Requisitos computacionales: Es más grande y lento que los modelos de detección especializados, como YOLO
  • Alcance del vocabulario: Se centra en conceptos visuales atómicos; el razonamiento composicional es limitado sin la ayuda de un MLLM
  • Conceptos poco frecuentes: El rendimiento puede degradarse con conceptos extremadamente raros o detallados que no estén bien representados en los datos de entrenamiento

Citación#

Cita
@misc{carion2025sam3,
  title         = {SAM 3: Segment Anything with Concepts},
  author        = {Nicolas Carion and Laura Gustafson and Yuan-Ting Hu and Shoubhik Debnath and Ronghang Hu and Didac Suris and Chaitanya Ryali and Kalyan Vasudev Alwala and Haitham Khedr and Andrew Huang and Jie Lei and Tengyu Ma and Baishan Guo and Arpit Kalla and Markus Marks and Joseph Greer and Meng Wang and Peize Sun and Roman R{\"a}dle and Triantafyllos Afouras and Effrosyni Mavroudi and Katherine Xu and Tsung-Han Wu and Yu Zhou and Liliane Momeni and Rishi Hazra and Shuangrui Ding and Sagar Vaze and Francois Porcher and Feng Li and Siyuan Li and Aishwarya Kamath and Ho Kei Cheng and Piotr Doll{\'a}r and Nikhila Ravi and Kate Saenko and Pengchuan Zhang and Christoph Feichtenhofer},
  year          = {2025},
  eprint        = {2511.16719},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2511.16719}
}

Preguntas frecuentes#

  • SAM 3 fue lanzado por Meta el 19 de noviembre de 2025 y está totalmente integrado en el paquete ultralytics, con compatibilidad para el modo de predicción y el modo de seguimiento.

  • ¡Sí! SAM 3 está totalmente integrado en el paquete de Python de Ultralytics, incluyendo la segmentación de conceptos, indicaciones visuales al estilo de SAM 2 y el seguimiento de vídeo de múltiples objetos. SAM 3 y SAM 3.1 también impulsan la función de anotación inteligente en Plataforma Ultralytics, donde SAM 3.1 es el modelo predeterminado y puedes anotar imágenes con solo unos clics.

  • Sí, para la predicción de imágenes. Carga sam3.1_multiplex.pt donde los ejemplos de imágenes de esta página usen sam3.pt: SAM("sam3.1_multiplex.pt") para indicaciones de puntos y cajas, y SAM3SemanticPredictor para indicaciones de texto y de ejemplo. El seguimiento de vídeo Object Multiplex aún no es compatible, así que sigue usando sam3.pt con los predictores de vídeo. Consulta SAM 3.1 para ver las pruebas de rendimiento de Meta.

  • PCS es una nueva tarea introducida en SAM 3 que segmenta todas las instancias de un concepto visual en una imagen o un vídeo. A diferencia de la segmentación tradicional, que se centra en una instancia de objeto específica, PCS encuentra todas las apariciones de una categoría. Por ejemplo:

    • Indicación de texto: «autobús escolar amarillo» → segmenta todos los autobuses escolares amarillos de la escena
    • Ejemplo de imagen: Recuadro alrededor de un perro → segmenta todos los perros de la imagen
    • Combinada: «gato atigrado» + recuadro de ejemplo → segmenta todos los gatos atigrados que coincidan con el ejemplo

    Consulta información relacionada sobre la detección de objetos y la segmentación de instancias.

  • CaracterísticaSAM 2SAM 3
    TareaUn solo objeto por indicaciónTodas las instancias de un concepto
    Tipos de indicacionesPuntos, cajas y máscaras+ Frases de texto, ejemplos de imágenes
    Capacidad de detecciónRequiere un detector externoDetector de vocabulario abierto integrado
    ReconocimientoSolo basado en la geometríaReconocimiento textual y visual
    ArquitecturaSolo rastreadorDetector + rastreador con cabeza de presencia
    Rendimiento con datos no vistosN/A (requiere indicaciones visuales)47.0 AP en LVIS, 2× mejor en SA-Co
    Refinamiento interactivoSolo clicsClics + generalización a partir de ejemplos

    SAM 3 mantiene la compatibilidad con versiones anteriores de las indicaciones visuales de SAM 2 y añade capacidades basadas en conceptos.

  • SAM 3 se entrena con el conjunto de datos Segment Anything con conceptos (SA-Co):

    Datos de entrenamiento:

    • 5.2M imágenes con 4M de sintagmas nominales únicos (SA-Co/HQ): anotaciones humanas de alta calidad
    • 52.5K vídeos con 24.8K sintagmas nominales únicos (SA-Co/VIDEO)
    • 1.4B máscaras sintéticas en 38M de sintagmas nominales (SA-Co/SYN)
    • 15 conjuntos de datos externos enriquecidos con negativos difíciles (SA-Co/EXT)

    Datos de referencia:

    • 214K conceptos únicos en 126K imágenes/vídeos
    • 50× más conceptos que los conjuntos de referencia existentes (por ejemplo, LVIS tiene ~4K conceptos)
    • Anotación triple en SA-Co/Gold para medir los límites del rendimiento humano

    Esta enorme escala y diversidad permiten que SAM 3 logre una generalización superior con datos no vistos en conceptos de vocabulario abierto.

  • SAM 3 y YOLO26 están orientados a casos de uso diferentes:

    Ventajas de SAM 3:

    • Vocabulario abierto: Segmenta cualquier concepto mediante indicaciones de texto sin necesidad de entrenamiento
    • Sin datos vistos: Funciona inmediatamente con categorías nuevas
    • Interactivo: El refinamiento basado en ejemplos se generaliza a objetos similares
    • Basado en conceptos: Encuentra automáticamente todas las instancias de una categoría
    • Precisión: 47.0 AP en segmentación de instancias con datos no vistos en LVIS

    Ventajas de YOLO26:

    • Velocidad: Inferencia órdenes de magnitud más rápida, con un cabezal de extremo a extremo opcional sin NMS
    • Eficiencia: Modelos 539× más pequeños (6.4MB frente a 3.45GB)
    • Uso eficiente de recursos: Funciona en dispositivos periféricos y móviles
    • Tiempo real: Optimizado para implementaciones en producción

    Recomendación:

    • Usa SAM 3 para una segmentación flexible de vocabulario abierto cuando necesites encontrar todas las instancias de conceptos descritos mediante texto o ejemplos
    • Usa YOLO26 para implementaciones de producción de alta velocidad cuando las categorías se conozcan de antemano
    • Usa SAM 2 para la segmentación interactiva de un solo objeto con indicaciones geométricas
  • SAM 3 está diseñado para sintagmas nominales sencillos (por ejemplo, «manzana roja» o «persona con sombrero»). Para consultas complejas que requieran razonamiento, combina SAM 3 con un MLLM como SAM 3 Agent:

    Consultas sencillas (SAM 3 nativo):

    • «autobús escolar amarillo»
    • «gato atigrado»
    • «persona con sombrero rojo»

    Consultas complejas (SAM 3 Agent con MLLM):

    • «Personas sentadas que no sostienen una caja de regalo»
    • «El perro más cercano a la cámara sin collar»
    • «Objetos rojos más grandes que la mano de la persona»

    SAM 3 Agent logra un 76.0 gIoU en la validación de ReasonSeg (frente al mejor resultado anterior de 65.0, una mejora del +16.9 %) al combinar la segmentación de SAM 3 con las capacidades de razonamiento de los MLLM.

  • En el conjunto de referencia SA-Co/Gold con anotación humana triple:

    • Límite inferior humano: 74.2 CGF1 (anotador más conservador)
    • Rendimiento de SAM 3: 65.0 CGF1
    • Logro: 88 % del límite inferior humano estimado
    • Límite superior humano: 81.4 CGF1 (anotador más liberal)

    SAM 3 logra un rendimiento sólido, cercano a la precisión humana, en la segmentación de conceptos de vocabulario abierto; la brecha se concentra principalmente en conceptos ambiguos o subjetivos (por ejemplo, «ventana pequeña» o «habitación acogedora»).

Comentarios