Ultralytics YOLO27:

Integración con Amazon S3#

La integración con Amazon S3 conecta tus buckets de S3 con Ultralytics Platform. Tus imágenes permanecen en tus buckets: Platform las indexa allí mismo, para que puedas explorarlas, anotarlas y entrenar modelos YOLO sin subir una copia.

Función Pro

Los conjuntos de datos de Amazon S3 requieren un plan Pro o Enterprise. Los espacios de trabajo gratuitos pueden ver la integración y reciben un aviso para cambiar de plan al conectarse. Los conjuntos de datos de Amazon S3 existentes siguen siendo totalmente accesibles si termina una suscripción; solo las conexiones e importaciones nuevas requieren Pro.

Crear un usuario de IAM de solo lectura#

Platform solo lee de tu almacenamiento: nunca escribe, modifica ni elimina tus objetos. Usa un usuario de IAM específico con permisos de lectura y listado únicamente; no uses nunca las credenciales de root:

  1. En la consola de AWS, ve a IAM > Users y crea un usuario sin acceso a la consola.

  2. Asigna una política que conceda únicamente permisos de lectura y listado para los buckets que quieras conectar:

    {
        "Version": "2012-10-17",
        "Statement": [
            { "Effect": "Allow", "Action": "s3:ListAllMyBuckets", "Resource": "*" },
            {
                "Effect": "Allow",
                "Action": ["s3:ListBucket", "s3:GetObject"],
                "Resource": ["arn:aws:s3:::my-bucket", "arn:aws:s3:::my-bucket/*"]
            }
        ]
    }

    s3:ListAllMyBuckets es opcional: permite que Platform detecte tus buckets para que no tengas que escribir sus nombres.

  3. Abre la pestaña Security credentials del usuario, crea una access key y copia el ID de la clave de acceso y la clave de acceso secreta.

Solo se admiten claves de usuario de IAM de larga duración

Platform rechaza las credenciales temporales de AWS. Las claves emitidas por AWS STS —incluidas las que empiezan por ASIA, las credenciales de sesión de roles y las claves de IAM Identity Center— caducan mientras un conjunto de datos sigue conectado, por lo que se necesita una clave de acceso de larga duración de un usuario de IAM específico.

Conéctate a Platform#

  1. Ve a Settings > Integrations y selecciona Amazon S3 en la lista de integraciones.
  2. Introduce el ID de la clave de acceso, la clave de acceso secreta y la región del bucket (por ejemplo, us-east-1).
  3. Haz clic en Find available buckets y, a continuación, selecciona los buckets que quieras conectar. Si la política no permite detectarlos, introduce manualmente el nombre de un bucket que conozcas.
  4. Haz clic en Connect. Platform comprueba que puede enumerar y leer cada bucket seleccionado antes de guardar nada.

Configuración de la integración de Amazon S3 de Ultralytics Platform

Necesitas el rol de administrador o propietario del espacio de trabajo para conectar el almacenamiento en la nube. Cada conexión admite hasta 50 buckets y la detección muestra hasta 300 de los buckets a los que puede acceder la clave.

Si vuelves a conectar el mismo usuario de IAM más adelante, se añadirán nuevos buckets a la integración existente. Una credencial guardada solo se sustituye cuando la nueva también puede leer todos los buckets que ya has conectado.

Una región por conexión

Una conexión lee los buckets de la región que indiques. Si tus buckets están en varias regiones, crea una conexión por cada región.

Seguridad de las credenciales

Las credenciales se cifran en reposo con AES-256-GCM, nunca se devuelven al navegador ni se exponen a las cargas de trabajo de entrenamiento. Para revocar el acceso, desactiva la clave de acceso en AWS IAM.

Crear un conjunto de datos a partir de un bucket de S3#

  1. Haz clic en New Dataset y abre la pestaña Cloud.
  2. Elige un bucket conectado y busca la carpeta que contiene tus datos.
  3. Confirma la carpeta, ajusta el nombre del conjunto de datos y créalo.

Platform enumera la carpeta una vez e indexa lo que encuentra:

  • Imágenes — Los objetos .jpg, .jpeg, .png, .webp y .avif se indexan con las dimensiones obtenidas mediante solicitudes acotadas. Platform no guarda una segunda copia de la imagen de origen.
  • Etiquetas — Los archivos asociados .txt de YOLO se analizan y se convierten en anotaciones de Platform, que se emparejan mediante la estructura estándar images/ → labels/ o como archivos hermanos en la misma carpeta.
  • Metadatos — Un archivo YAML proporciona los nombres de las clases y la forma de los puntos clave de pose, igual que al subir un archivo. Se da preferencia a data.yaml y data.yml si la carpeta contiene varios.
  • Tarea — Una muestra de los archivos de etiquetas determina la tarea, por lo que las carpetas de segmentación, pose y OBB se reconocen por la forma de sus etiquetas, no por la tarea que hayas elegido en el cuadro de diálogo.
  • Divisiones — Los nombres de carpeta train, val y test en la clave del objeto asignan las divisiones automáticamente.

Después, el conjunto de datos funciona como cualquier otro: puedes explorarlo y anotarlo, establecerlo como público o privado, compartirlo con tu equipo y entrenar con él mediante el entrenamiento gestionado. Los originales se transmiten bajo demanda y las imágenes indexadas no consumen tu cuota de almacenamiento de Platform.

Límites

Una sola importación indexa hasta 500 000 objetos, y archivos de etiquetas o YAML de hasta 1 MB cada uno. Los buckets más grandes deben dividirse en varios conjuntos de datos.

Mantén inmutables los objetos indexados

Cada imagen indexada queda vinculada al ETag de su objeto de S3, y Platform falla de forma segura si un objeto cambia. Añade objetos nuevos en lugar de sobrescribir los existentes.

Importaciones fallidas#

Si falla una importación —por una carpeta vacía, un error tipográfico en la ruta o permisos revocados—, el conjunto de datos muestra el error en su página. Los editores pueden hacer clic en Retry import para reiniciarla con el bucket y la carpeta guardados, o crear un nuevo conjunto de datos que apunte a la ruta corregida.

Al reintentar, se vuelve a enumerar la carpeta en lugar de reanudar la importación: se incorporan los objetos añadidos desde el primer intento y se descartan los que ya no están.

Entrenamiento#

El entrenamiento gestionado funciona mediante el flujo de entrenamiento habitual. Durante la ejecución, el entrenamiento usa las propias copias de Platform de las imágenes vinculadas, y tus credenciales de AWS nunca se exponen a las cargas de trabajo de entrenamiento.

Desconecta una conexión#

Al desconectar, se eliminan las credenciales guardadas sin modificar nada en AWS. Los conjuntos de datos creados a partir de esos buckets permanecen en tu espacio de trabajo con sus clases, etiquetas y anotaciones, pero no se pueden cargar, previsualizar ni usar para entrenar con sus imágenes hasta que vuelvas a conectar el mismo usuario de IAM.

Usa la REST API con el ID de integración devuelto por GET /api/integrations/buckets:

curl -X DELETE \
  -H "Authorization: Bearer YOUR_API_KEY" \
  https://platform.ultralytics.com/api/integrations/buckets/INTEGRATION_ID
from ultralytics_platform import Platform

client = Platform()  # reads ULTRALYTICS_API_KEY
integrations = client.storage_integrations.list()
client.storage_integrations.delete("INTEGRATION_ID")

Para revocar el acceso desde el propio origen, desactiva o elimina la clave de acceso en AWS IAM.

Limitaciones actuales#

Los conjuntos de datos vinculados a S3 no incluyen actualmente funciones que requieren copias de tus imágenes gestionadas por Platform: anotación automática, análisis de agrupamiento, clonación de conjuntos de datos y instantáneas de versiones inmutables.

Al eliminar un conjunto de datos vinculado a S3, o imágenes concretas de ese conjunto, solo se eliminan las referencias de Platform: tus objetos no se modifican.

Consulta también las integraciones de Google Cloud Storage y Azure Blob Storage.

Preguntas frecuentes#

  • No. Platform enumera el bucket una vez e indexa las dimensiones de las imágenes y las etiquetas que encuentra. Los originales se transmiten bajo demanda para explorarlos y anotarlos, y el entrenamiento gestionado utiliza copias propias de Platform de las imágenes fijadas solo durante la ejecución. Las imágenes indexadas no cuentan para tu cuota de almacenamiento.

  • Un conjunto de datos se indexa una sola vez, al crearlo. Los objetos nuevos no se incorporan hasta que crees un conjunto de datos nuevo o reintentes una importación fallida, y cada imagen indexada queda vinculada a su versión, por lo que, si sobrescribes un objeto, Platform falla de forma segura al acceder a esa imagen. Añade objetos nuevos en lugar de sustituir los existentes.

  • Los conjuntos de datos conectados no incluyen las funciones que necesitan copias de tus imágenes gestionadas por Platform: anotación automática, análisis de agrupamiento, clonación de conjuntos de datos e instantáneas de versiones inmutables. La anotación manual, el uso compartido y el entrenamiento funcionan con normalidad.

  • Desconecta la integración en Settings > Integrations para eliminar las credenciales guardadas, o desactiva o elimina la clave de acceso en AWS IAM. Ninguna de estas acciones modifica los datos de tus buckets.

Comentarios