YOLO Vision 2026:

Integración con Google Cloud Storage#

La integración con Google Cloud Storage conecta tus buckets de GCS con Ultralytics Platform. Tus imágenes permanecen en tus buckets: Platform las indexa en su ubicación, para que puedas explorarlas, anotarlas y entrenar modelos YOLO sin subir una copia.

Función Pro

Los datasets de Google Cloud Storage requieren un plan Pro o Enterprise. Los espacios de trabajo gratuitos pueden ver la integración y reciben un aviso para actualizar el plan al conectarse. Los datasets de Google Cloud Storage existentes siguen siendo totalmente accesibles si finaliza una suscripción; solo las conexiones e importaciones nuevas requieren Pro.

Crea una cuenta de servicio de solo lectura#

Platform solo lee de tu almacenamiento; nunca escribe, modifica ni elimina tus objetos. Crea una cuenta de servicio específica con acceso únicamente de lectura:

  1. En la consola de Google Cloud, ve a IAM y administración > Cuentas de servicio y crea una cuenta de servicio.
  2. Asígnale el rol Visualizador de objetos de Storage (roles/storage.objectViewer) en los buckets que quieras conectar.
  3. Abre la cuenta de servicio, selecciona Claves > Añadir clave > Crear clave nueva, elige JSON y descarga el archivo de clave.
Para descubrir buckets se necesita un permiso más

roles/storage.objectViewer cubre todo lo que Platform hace con tus datos, pero no permite enumerar los buckets de un proyecto. Añade un rol que incluya storage.buckets.list si quieres que Platform encuentre tus buckets; de lo contrario, escribe manualmente el nombre de cada bucket al conectarlo.

Conéctate a Platform#

  1. Ve a Ajustes > Integraciones y selecciona Google Cloud Storage en la lista de integraciones.
  2. Pega el contenido de la clave JSON de la cuenta de servicio.
  3. Haz clic en Buscar buckets disponibles y selecciona los buckets que quieras conectar. Si la cuenta de servicio no puede enumerar los buckets, escribe manualmente el nombre de un bucket conocido.
  4. Haz clic en Conectar. Platform verifica que puede enumerar y leer cada bucket seleccionado antes de guardar nada.

Ajustes de la integración de Google Cloud Storage de Ultralytics Platform

Necesitas el rol de administrador o propietario del espacio de trabajo para conectar el almacenamiento en la nube. Una conexión admite hasta 50 buckets y el descubrimiento enumera hasta 300 de los buckets que la cuenta de servicio puede ver.

Tu navegador lee el archivo de clave pegado y envía únicamente los tres campos que Platform necesita: client_email, private_key y project_id. El resto del JSON nunca sale de la página.

Si vuelves a conectar la misma cuenta de servicio más adelante, se añaden nuevos buckets a la integración existente. Una credencial guardada solo se sustituye cuando su reemplazo puede seguir leyendo todos los buckets que ya has conectado.

Seguridad de las credenciales

Las credenciales se cifran en reposo con AES-256-GCM, nunca se devuelven al navegador y nunca se exponen a las cargas de trabajo de entrenamiento. Para revocar el acceso, elimina la clave de la cuenta de servicio en Google Cloud.

Crea un dataset desde un bucket de GCS#

  1. Haz clic en Nuevo dataset y abre la pestaña Cloud.
  2. Elige un bucket conectado y busca la carpeta que contiene tus datos.
  3. Confirma la carpeta, ajusta el nombre del dataset y créalo.

Platform enumera la carpeta una vez e indexa lo que encuentra:

  • Imágenes: los objetos .jpg, .jpeg, .png, .webp y .avif se indexan con las dimensiones leídas mediante solicitudes limitadas. Platform no conserva una segunda copia de la imagen de origen.
  • Etiquetas: los archivos auxiliares .txt de YOLO se analizan como anotaciones de Platform, asociadas mediante la disposición estándar images/labels/ o como archivos hermanos de la misma carpeta.
  • Metadatos: un archivo YAML proporciona los nombres de las clases y la forma de los puntos clave de pose, exactamente igual que una carga de archivo. Se prefieren data.yaml y data.yml cuando la carpeta contiene varios.
  • Tarea: una muestra de los archivos de etiquetas determina la tarea, por lo que las carpetas de segmentación, pose y OBB se reconocen por la forma de sus etiquetas, no por la tarea que elegiste en el diálogo.
  • Divisiones: los nombres de carpeta train, val y test en la ruta del objeto asignan las divisiones automáticamente.

Después, el dataset funciona como cualquier otro: explóralo y anótalo, configúralo como público o privado, compártelo con tu equipo y entrena con él mediante el entrenamiento gestionado. Los originales se transmiten bajo demanda y las imágenes indexadas no consumen tu cuota de almacenamiento de Platform.

Límites

Una sola importación indexa hasta 50.000 objetos y archivos de etiquetas o YAML de hasta 1 MB cada uno. Los buckets más grandes deben dividirse entre varios datasets.

Mantén inmutables los objetos indexados

Cada imagen indexada queda vinculada a la generación de su objeto de GCS y Platform rechaza la operación si un objeto cambia. Añade objetos nuevos en lugar de sobrescribir los existentes.

Importaciones fallidas#

Si una importación falla —por una carpeta vacía, un error tipográfico en la ruta o permisos revocados—, el dataset muestra el error en su página. Los editores pueden hacer clic en Reintentar importación para reiniciarla con el bucket y la carpeta almacenados, o crear un dataset nuevo que apunte a la ruta corregida.

Un reintento vuelve a enumerar la carpeta en lugar de reanudar la operación: se incorporan los objetos añadidos desde el primer intento y se eliminan del dataset los objetos que ya no están allí.

Entrenamiento#

El entrenamiento gestionado funciona mediante el flujo de entrenamiento habitual. Durante la ejecución, el entrenamiento utiliza las copias propias de Platform de las imágenes vinculadas, y tus credenciales de Google Cloud nunca se exponen a las cargas de trabajo de entrenamiento.

Desconecta una conexión#

Al desconectar se eliminan las credenciales almacenadas sin modificar nada en Google Cloud. Los datasets creados a partir de esos buckets permanecen en tu espacio de trabajo con sus clases, etiquetas y anotaciones, pero sus imágenes no se pueden cargar, previsualizar ni utilizar para entrenar hasta que vuelvas a conectar la misma cuenta de servicio.

Usa la REST API con el ID de integración devuelto por GET /api/integrations/buckets:

curl -X DELETE \
  -H "Authorization: Bearer YOUR_API_KEY" \
  https://platform.ultralytics.com/api/integrations/buckets/INTEGRATION_ID
from ultralytics_platform import Platform

client = Platform()  # reads ULTRALYTICS_API_KEY
integrations = client.storage_integrations.list()
client.storage_integrations.delete("INTEGRATION_ID")

Para revocar el acceso desde el origen, elimina la clave de la cuenta de servicio en Google Cloud.

Limitaciones actuales#

Los datasets respaldados por GCS excluyen actualmente las funciones que requieren copias de tus imágenes propiedad de Platform: anotación automática, análisis de agrupamiento, clonación de datasets y instantáneas de versiones inmutables.

Al eliminar un dataset respaldado por GCS, o imágenes individuales de este, solo se eliminan las referencias de Platform; tus objetos nunca se modifican.

Consulta también las integraciones de Amazon S3 y Azure Blob Storage.

Preguntas frecuentes#

  • No. Platform enumera el bucket una sola vez e indexa las dimensiones y las etiquetas de las imágenes que encuentra. Las originales se transmiten bajo demanda para la exploración y la anotación, y el entrenamiento gestionado funciona a partir de las copias propias de Platform de las imágenes fijadas únicamente durante la duración de la ejecución. Las imágenes indexadas no computan en tu cuota de almacenamiento.

  • Un conjunto de datos se indexa una sola vez cuando se crea. Los objetos nuevos no se detectan hasta que creas un conjunto de datos nuevo o reintentas una importación fallida, y cada imagen indexada está fijada a su versión, por lo que sobrescribir un objeto hace que Platform falle de forma segura en esa imagen. Añade objetos nuevos en lugar de reemplazar los existentes.

  • Las funciones que necesitan copias de tus imágenes propiedad de Platform se excluyen en los conjuntos de datos conectados: la anotación automática, el análisis de agrupamiento, la clonación de conjuntos de datos y las instantáneas de versión inmutables. La anotación manual, el uso compartido y el entrenamiento funcionan con total normalidad.

  • Desconecta la integración en Settings > Integrations para eliminar las credenciales almacenadas, o elimina la clave de la cuenta de servicio en Google Cloud. Ninguna de las dos acciones afecta a los datos de tus buckets.

Comentarios