Datasets#
Los conjuntos de datos de Ultralytics Platform ofrecen una solución optimizada para gestionar tus datos de entrenamiento. Tras la carga, la plataforma procesa las imágenes, etiquetas y estadísticas automáticamente. Un conjunto de datos está listo para entrenar una vez que el procesamiento ha finalizado y cuenta con al menos una imagen en la división train, al menos una imagen en la división val o test, al menos una imagen etiquetada y un total de al menos dos imágenes.
Subir dataset#
Ultralytics Platform acepta múltiples formatos de carga para una mayor flexibilidad.
Si ya tienes conjuntos de datos en Roboflow, utiliza Integrations para importarlos directamente; no se necesita exportación manual ni volver a cargarlos. Los datos en Google Cloud Storage, Amazon S3 o Azure Blob Storage se pueden usar directamente a través de Cloud storage. Los espacios de trabajo Enterprise pueden utilizar On Premise para indexar y entrenar con datos locales sin enviar píxeles a Platform.
Formatos admitidos#
| Formato | Extensiones | Notas | Tamaño máximo |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Más común, recomendado | 50 MB |
| PNG | .png | Soporta transparencia | 50 MB |
| WebP | .webp | Moderno, buena compresión | 50 MB |
| BMP | .bmp | Sin compresión | 50 MB |
| TIFF | .tiff, .tif | Alta calidad | 50 MB |
| HEIC | .heic | Fotos de iPhone | 50 MB |
| AVIF | .avif | Formato de nueva generación | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Cámara Raw | 50 MB |
| MPO | .mpo | Objeto multi-imagen | 50 MB |
Compatibilidad de códecs de vídeo#
La extensión del archivo por sí sola no es suficiente: un vídeo puede fallar si su códec no puede ser decodificado por el trabajador de ingesta de la plataforma.
El video H.264 en un contenedor MP4 ofrece la compatibilidad más amplia en los principales navegadores y es la opción más segura. Si un video no se carga, vuélvelo a codificar con FFmpeg:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4Preparación de tu dataset#
Platform es compatible con Ultralytics YOLO, COCO, Ultralytics NDJSON y cargas sin procesar (sin anotar):
Usa la estructura de directorios estándar de YOLO con un archivo data.yaml:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlEl archivo YAML define la configuración de tu dataset:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogRaw: Sube imágenes sin anotar (sin etiquetas). Es útil cuando planeas anotar directamente en la plataforma utilizando el annotation editor.
También puedes subir imágenes sin carpetas de partición explícitas. La plataforma respeta el objetivo de partición activo durante la carga y, para datasets que no sean de clasificación, puede crear automáticamente una partición de validación a partir de una parte del conjunto de entrenamiento cuando no se proporcione información de partición. Siempre puedes reasignar imágenes más tarde con la función de mover a partición en bloque o la redistribución de particiones.
El formato se detecta automáticamente: los conjuntos de datos con un data.yaml que contiene claves names, train o val se tratan como YOLO. Los conjuntos de datos con archivos JSON de COCO (que contienen matrices images, annotations y categories) se tratan como COCO. Las exportaciones de .ndjson se importan como Ultralytics NDJSON. Los conjuntos de datos que solo contienen imágenes y ninguna anotación se tratan como raw.
Para obtener detalles sobre formatos específicos de tareas, consulta supported tasks y Datasets Overview.
Proceso de carga#
Para crear un conjunto de datos:
- Navega a
Annotateen la barra lateral - Haz clic en
New Dataset - Selecciona el tipo de tarea (consulta supported tasks)
- Añade un nombre y una descripción opcional
- Configura la visibilidad (pública o privada) y una licencia opcional (consulta available licenses)
- Agrega archivos y haz clic en
Create & Upload, o haz clic enCreate Datasetpara comenzar con un conjunto de datos vacío
Para agregar archivos a un conjunto de datos existente, abre su página de conjuntos de datos y arrastra los archivos a la galería o haz clic en el icono de carga en el encabezado de la página. El icono de carga abre directamente el selector de archivos nativo de tu navegador porque la tarea del conjunto de datos ya está definida.
Tras la carga, la plataforma procesa tus datos a través de una canalización de varias etapas:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Validación: Comprobaciones de formato y tamaño
- Normalización: Las imágenes grandes se redimensionan (máx. 4096px, dimensión mínima 28px)
- Miniaturas: Se generan vistas previas en WebP de 256px
- Label Parsing: Se extrajeron las etiquetas en formato YOLO y COCO
- Estadísticas: Se calculan las distribuciones de clases y las dimensiones de las imágenes

Validar antes de subir
Puedes validar tu dataset localmente antes de subirlo:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")Las imágenes deben tener al menos 28px en su lado más corto. Las imágenes más pequeñas se rechazan durante el procesamiento. Las imágenes de más de 4096px en su lado más largo se redimensionan automáticamente manteniendo la relación de aspecto.
Explorar imágenes#
Visualiza las imágenes de tu dataset en múltiples diseños.
Abre el panel Clustering desde la barra de herramientas de la galería para explorar tu conjunto de datos como un diagrama de dispersión 2D interactivo.
| Vista | Descripción |
|---|---|
| Cuadrícula | Cuadrícula de miniaturas con superposición de anotaciones (predeterminado) |
| Compacto | Miniaturas más pequeñas para un escaneo rápido |
| Tabla | Lista con miniatura, nombre de archivo, dimensiones, tamaño, partición, clases y recuento de etiquetas |

Ordenación y filtrado#
Las imágenes se pueden ordenar y filtrar para una exploración eficiente:
| Ordenar | Descripción |
|---|---|
| Más recientes / Más antiguas | Orden de carga / creación |
| Nombre A-Z / Z-A | Nombre de archivo alfabético |
| Altura ↑/↓ | Altura de la imagen en píxeles |
| Anchura ↑/↓ | Anchura de la imagen en píxeles |
| Tamaño ↑/↓ | Tamaño del archivo en disco |
| Anotaciones ↑/↓ | Recuento de anotaciones por imagen |
Para datasets de más de 100.000 imágenes, las ordenaciones por nombre / tamaño / anchura / altura se desactivan para mantener la galería receptiva. Las ordenaciones por más reciente, más antiguo y recuento de anotaciones permanecen disponibles.
Usa el conjunto de filtros Annotations establecido en Unannotated para encontrar rápidamente las imágenes que aún necesitan anotación. Esto es especialmente útil para conjuntos de datos grandes donde deseas realizar un seguimiento del progreso del etiquetado.
La barra de búsqueda se encuentra a la derecha de la barra de herramientas de la galería y filtra todos los modos de vista: tarjetas, compacto y tabla. Coincide con el nombre de archivo de la imagen (la extensión de archivo es opcional), así como con las claves de metadatos personalizados, valores escalares y entradas de matrices, de modo que una imagen llamada img_0042 que contenga {"ship_type": "yacht"} se encuentra buscando tanto img_0042 como yacht.
Los valores anidados dentro de subobjetos no coinciden. Al pegar una cadena hexadecimal de 32 caracteres, se busca exactamente ese hash de contenido de la imagen.
Visor en pantalla completa#
Haz clic en cualquier imagen para abrir el visor en pantalla completa con:
- Navegación: Teclas de flecha o vistas previas de miniaturas para navegar
- Image information: Revisa las propiedades generadas por Platform, los metadatos personalizados y los metadatos de archivos incrustados como EXIF
- Metadatos personalizados: Los propietarios y editores pueden añadir o reemplazar un objeto JSON, incluidos valores anidados de hasta 500.000 caracteres serializados y claves de nivel superior de hasta 128 caracteres
- Anotaciones: Alternar la visibilidad de la superposición de anotaciones
- Desglose por clase: Recuentos de etiquetas por clase con indicadores de color
- Annotate: Cuando tienes acceso de edición, los controles de anotación se activan inmediatamente cuando el visor en pantalla completa se abre en el escritorio
- Descargar: Descarga el archivo de imagen original
- Eliminar: Elimina la imagen del dataset
- Zoom:
Cmd/Ctrl+Scroll,Cmd/Ctrl++oCmd/Ctrl+=para acercar, yCmd/Ctrl+-para alejar - Reset view:
Cmd/Ctrl + 0o el botón de restablecer para ajustar la imagen al visor - Pan: Mantén presionado
Spacey arrastra para desplazar el lienzo al hacer zoom - Vista de píxeles: Alternar la renderización pixelada para una inspección detallada

Filtrar por división (Split)#
Filtrar imágenes por su división (split) del dataset:
| Split | Propósito |
|---|---|
| Entrenar | Utilizado para el entrenamiento del modelo |
| Val | Utilizado para la validación durante el entrenamiento |
| Probar | Utilizado para la evaluación final |
Agrupamiento (Clustering)#
El panel Clustering proyecta tu conjunto de datos en un diagrama de dispersión 2D interactivo donde las imágenes visualmente similares se sitúan muy cerca unas de otras. Úsalo para revelar conglomerados, detectar duplicados y valores atípicos, y examinar cómo se distribuyen las divisiones o clases en tus datos, todo sin salir de la galería. Ábrelo desde el icono del gráfico de dispersión en la barra de herramientas de la galería en cualquier página de conjunto de datos.

Ejecución del análisis#
Iniciar un análisis:
- Abre un dataset y haz clic en el icono de gráfico de dispersión en la barra de herramientas de la galería
- Haz clic en
Analyze Dataset - Espera a que finalice la barra de progreso: los resultados aparecen en el mismo panel
El análisis se ejecuta en segundo plano y puede tardar unos minutos dependiendo del tamaño de tu dataset. Puedes cerrar el panel o salir de la página y volver más tarde.
Visualización#
Una vez completado el análisis, el panel muestra una dispersión 2D de todas las imágenes analizadas. Los filtros de la galería (división, clase, etiquetado/sin etiquetar) atenúan los puntos fuera del filtro para que puedas centrarte en el subconjunto que te interesa.

Colorear por#
Cambia cómo se sombrean los puntos de datos con el menú desplegable Color by en la barra de herramientas del panel. Cambia los modos de vista en cualquier momento; el gráfico cambia de color al instante para que puedas ver cómo se distribuyen las divisiones, clases o propiedades de las imágenes en tus conglomerados:
| Opción | Sombreado |
|---|---|
| Splits | Train / Val / Test |
| Clases | Primera clase de anotación en cada imagen |
| Anchura | Anchura de la imagen |
| Altura | Altura de la imagen |
| Tamaño | Tamaño del archivo |
| Anotaciones | Número de anotaciones por imagen |

Selección de lazo#
Dibuja una selección de forma libre alrededor de una región para resaltar puntos en el gráfico. La galería filtra las imágenes coincidentes para que puedas inspeccionarlas, volver a etiquetarlas, moverlas o eliminarlas utilizando las image operations habituales.
Una etiqueta sobre el gráfico muestra cuántos puntos están seleccionados; haz clic en × para borrar el lazo y volver a la vista completa de la galería.
Desplazamiento y Zoom#
Navega por grandes dispersiones directamente desde tu ratón y teclado:
| Entrada | Acción |
|---|---|
| Scroll | Desplazar el gráfico en 2D |
| Cmd/Ctrl+Scroll | Acercar o alejar, anclado en el cursor |
| Mantener Espacio | Cambiar al modo de arrastrar para desplazar (drag-to-pan) |
Re-análisis#
Si tu conjunto de datos cambia después del análisis, aparece un botón Re-analyze en la parte superior del panel para los propietarios y editores.
Haz clic en Re-analyze para volver a calcular las incrustaciones y la proyección 2D desde cero.
Pestañas de Dataset#
Cada página de dataset puede mostrar hasta seis pestañas, dependiendo del estado del dataset y tus permisos:
Pestaña Imágenes#
La vista predeterminada que muestra la galería de imágenes con superposiciones de anotaciones. Admite modos de vista de cuadrícula, compacta y de tabla. Arrastra y suelta archivos aquí para añadir más imágenes.
Pestaña Clases#
Esta pestaña aparece cuando el dataset tiene imágenes.
Gestiona las clases de anotación de tu dataset:
- Histograma de clases: Gráfico de barras que muestra el recuento de anotaciones por clase con alternancia de escala lineal/logarítmica
- Tabla de clases: tabla ordenable y con búsqueda que incluye el nombre de la clase, el recuento de etiquetas y el recuento de imágenes
- Editar nombres de clases: haz clic en cualquier nombre de clase para cambiarlo directamente
- Editar colores de clases: haz clic en una muestra de color para cambiar el color de la clase
- Añadir nueva clase: utiliza la entrada en la parte inferior para añadir clases

Si tu conjunto de datos tiene desequilibrio de clases (por ejemplo, 10,000 anotaciones de "person" pero solo 50 de "bicycle"), usa el botón de alternancia Log Scale en el histograma de clases para visualizar todas las clases con claridad.
Pestaña de gráficos#
Esta pestaña aparece cuando el dataset tiene imágenes.
Estadísticas automáticas calculadas a partir de tu dataset:
| Gráfico | Descripción |
|---|---|
| Distribución de las particiones | Gráfico de anillo con el recuento de imágenes de entrenamiento/validación/prueba y el porcentaje etiquetado |
| Clases principales | Gráfico de anillo de las 10 clases de anotación más frecuentes |
| Dimensiones de la imagen | Histograma de la distribución de la anchura y altura de la imagen (superpuesto) con la media |
| Puntos por instancia | Recuento de vértices de polígono o puntos clave por anotación (segmento/pose) |
| Ubicaciones de las anotaciones | Mapa de calor 2D de las posiciones centrales de los BBox |
| Tamaño del archivo de imagen | Histograma de la distribución del tamaño de los archivos de imagen |
| Formatos de imagen | Distribución de los formatos de imagen de origen (JPG, PNG, etc.) |
| Dimensiones del BBox | Histograma de la anchura y altura del BBox (superpuesto) |
| Objetos por imagen | Histograma del recuento de anotaciones por imagen |
| Dimensiones de imagen 2D | Mapa de calor 2D de anchura frente a altura con líneas guía de relación de aspecto |

La plataforma almacena en caché las estadísticas calculadas y las invalida cuando cambian las imágenes, las anotaciones, las clases o las divisiones.
Haz clic en el botón de expandir en cualquier mapa de calor para verlo en modo de pantalla completa. Esto proporciona una vista más grande y detallada, útil para comprender patrones espaciales en datasets grandes.
Pestaña de modelos#
Consulta todos los modelos entrenados en este dataset en una tabla con función de búsqueda:
| Columna | Descripción |
|---|---|
| Nombre | Nombre del modelo con enlace |
| Proyecto | Proyecto principal con icono |
| Versión | Versión de dataset inmutable utilizada para el entrenamiento, si la hay |
| Estado | Insignia de estado de entrenamiento |
| Tarea | Tipo de tarea YOLO |
| Épocas | Mejor época / épocas totales |
| mAP50-95 | Precisión media |
| mAP50 | mAP con IoU 0.50 |
| Creado | Fecha de creación |

Pestaña de errores#
Esta pestaña solo aparece cuando uno o más archivos no se procesan correctamente.
Las imágenes que fallaron al procesarse se enumeran aquí con:
- Banner de error: recuento total de imágenes fallidas y orientación
- Tabla de errores: nombre del archivo, descripción del error fácil de entender, sugerencias de solución y miniatura de vista previa
- Los errores comunes incluyen archivos corruptos, formatos no admitidos, imágenes demasiado pequeñas (mín. 28px) y modos de color no admitidos

Errores de procesamiento comunes
| Error | Causa | Solución |
|---|---|---|
| No se puede leer el archivo de imagen | Formato corrupto o no admitido | Vuelve a exportar desde el editor de imágenes |
| Incompleto o corrupto | El archivo se truncó durante la transferencia | Vuelve a descargar el archivo original |
| Imagen demasiado pequeña | Dimensión mínima inferior a 28px | Utiliza imágenes de origen con mayor resolución |
| Modo de color no admitido | Modo de color CMYK o indexado | Convierte al modo RGB |
Pestaña de versiones#
Crea instantáneas NDJSON inmutables de tu dataset para un entrenamiento reproducible. Cada versión captura los recuentos de imágenes, clases, anotaciones y el tamaño del archivo en el momento de la creación.
| Columna | Descripción |
|---|---|
| Versión | Número de versión (v1, v2, ...) |
| Descripción | Descripción proporcionada por el usuario (editable) |
| Imágenes | Recuento de imágenes en el momento de la instantánea |
| Clases | Recuento de clases en el momento de la instantánea |
| Anotaciones | Recuento de anotaciones en el momento de la instantánea |
| Tamaño | Tamaño del archivo de exportación NDJSON |
| Creado | Cuando se creó la versión |
| Acciones | Descargar, restaurar o eliminar |
Para crear una versión:
- Abre la pestaña Versiones
- Opcionalmente introduce una descripción (por ejemplo, "Se añadieron 500 imágenes de entrenamiento" o "Se corrigieron clases mal etiquetadas")
- Haz clic en + Nueva versión
- La nueva versión aparece en la tabla
- Usa las acciones de fila para descargar, restaurar o eliminar la versión
Cada versión está numerada secuencialmente (v1, v2, v3...). Puedes descargar una versión guardada mientras permanezca en la tabla de versiones.
Restaurar reemplaza permanentemente las imágenes, divisiones, clases y anotaciones actuales del conjunto de datos con la instantánea seleccionada. La reconstrucción puede tardar varios minutos y no se puede deshacer a menos que guardes primero el estado actual como otra versión.
Habilita Save Dataset Version en el Cloud Training dialog para vincular un modelo al conjunto de datos exacto utilizado para el entrenamiento. La plataforma reutiliza una versión coincidente cuando los contenidos del conjunto de datos no han cambiado y crea una nueva versión solo cuando lo han hecho.
La creación de versiones está disponible después de que el conjunto de datos alcance el estado ready.
Crea una versión antes y después de cambios importantes en tu dataset: añadir imágenes, corregir anotaciones o reequilibrar particiones. Esto te permite comparar el rendimiento del modelo en diferentes estados del dataset.
El tamaño que se muestra es el tamaño del archivo de exportación NDJSON, que contiene URL de imágenes y anotaciones, no las imágenes en sí. Los datos reales de la imagen se almacenan por separado y se accede a ellos a través de URL firmadas.
Exportar dataset#
Exporta tu dataset para su uso sin conexión con una descarga NDJSON desde el encabezado del dataset o la pestaña Versiones.
Para exportar:
- Haz clic en el botón Descargar (icono de descarga) en el encabezado del dataset
- Descarga directamente la instantánea NDJSON actual
- Usa la pestaña Versiones cuando quieras una instantánea numerada inmutable que puedas volver a descargar más tarde
El formato NDJSON almacena un objeto JSON por línea. La primera línea contiene los metadatos del conjunto de datos, seguida de una línea por imagen:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}El objeto metadata opcional a nivel de imagen se conserva cuando se importa un archivo NDJSON a Platform. Puedes inspeccionarlo o editarlo desde el panel de información de pantalla completa de la imagen. Para cargas de archivos por lotes mediante programación, el Dataset Ingest API acepta el mapa de rutas imageMetadata equivalente.
Las URLs de las imágenes en el NDJSON exportado están firmadas y son válidas durante 7 días. Si necesitas URLs nuevas, vuelve a exportar el conjunto de datos o crea una nueva versión.
Consulta la Ultralytics NDJSON format documentation para ver la especificación completa.
Operaciones con imágenes#
Acciones rápidas#
Haz clic derecho en cualquier imagen en la vista Cuadrícula o Compacta para acceder a acciones rápidas:
| Acción | Descripción |
|---|---|
| Mover a división | Reasigna la imagen a la división de entrenamiento (Train), validación (Val) o prueba (Test) |
| Descarga | Descarga el archivo de imagen original |
| Eliminar | Elimina la imagen del conjunto de datos |

El menú contextual de la imagen opera sobre una única imagen. Para operaciones en masa sobre varias imágenes, utiliza la vista Tabla con selección mediante casillas de verificación.
Mover a división en masa#
Reasigna las imágenes seleccionadas a una división diferente dentro del mismo conjunto de datos:
- Cambia a la vista Tabla
- Selecciona las imágenes usando las casillas de verificación
- Haz clic derecho para abrir el menú contextual
- Elige
Move to split> Train, Validation o Test
También puedes arrastrar y soltar imágenes sobre las pestañas de filtro de división en la vista de cuadrícula.
Sube todas las imágenes a un conjunto de datos y luego usa el movimiento en masa a división para organizar los subconjuntos en divisiones de entrenamiento, validación y prueba.
Redistribución de divisiones#
Redistribuye todas las imágenes entre las divisiones de entrenamiento, validación y prueba usando proporciones personalizadas:
- Haz clic en la barra de división en la barra de herramientas del conjunto de datos para abrir el cuadro de diálogo Redistribuir divisiones
- Ajusta los porcentajes de división usando cualquiera de los métodos siguientes
- Revisa la vista previa del conteo de imágenes en directo para confirmar la distribución
- Haz clic en Aplicar para reasignar aleatoriamente todas las imágenes según tus porcentajes
El cuadro de diálogo ofrece tres formas de establecer tus proporciones de división objetivo:
| Método | Descripción |
|---|---|
| Arrastrar | Arrastra los controles entre los segmentos de color para ajustar visualmente los límites de las divisiones |
| Escribir | Edita el porcentaje introducido para cualquier división (las otras dos divisiones se reequilibran automáticamente de forma proporcional) |
| Auto | Un clic para establecer instantáneamente una división 80/20 de entrenamiento/validación con la división de prueba establecida en 0% |
Una vista previa en directo muestra exactamente cuántas imágenes terminarán en cada división antes de que apliques los cambios.
Haz clic en el botón Auto para establecer instantáneamente la división recomendada 80/20 de entrenamiento/validación. Esta es la proporción más común para el entrenamiento.
Eliminación en masa#
Elimina varias imágenes a la vez:
- Selecciona las imágenes en la vista de tabla
- Haz clic derecho y selecciona
Delete - Confirma la eliminación
URI del conjunto de datos#
Haz referencia a los conjuntos de datos de Platform utilizando el formato de URI ul:// (consulta Using Platform Datasets):
ul://username/datasets/dataset-slugTambién puedes pegar directamente la URL web de un conjunto de datos o modelo (por ejemplo, https://platform.ultralytics.com/username/datasets/dataset-slug); se reescribe automáticamente a la URI de ul://. Pasar una lista de conjuntos de datos afina un modelo base en cada uno de ellos en serie, por ejemplo, model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Usa este URI para entrenar modelos desde cualquier lugar:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100La URI de ul:// funciona desde cualquier entorno:
- Máquina local: Entrena en tu hardware, los datos se descargan automáticamente
- Google Colab: Accede a tus conjuntos de datos de la Platform en notebooks
- Servidores remotos: Entrena en máquinas virtuales en la nube con acceso total al conjunto de datos
Licencias disponibles#
La Platform admite las siguientes licencias para conjuntos de datos:
| Licencia | Tipo |
|---|---|
| Ninguna | No se ha seleccionado ninguna licencia |
| CC0-1.0 | Dominio público |
| CC-BY-2.5 | Permisiva |
| CC-BY-4.0 | Permisiva |
| CC-BY-SA-4.0 | Copyleft |
| CC-BY-NC-4.0 | No comercial |
| CC-BY-NC-SA-4.0 | Copyleft |
| CC-BY-ND-4.0 | Sin derivados |
| CC-BY-NC-ND-4.0 | No comercial |
| Apache-2.0 | Permisiva |
| MIT | Permisiva |
| AGPL-3.0 | Copyleft |
| GPL-3.0 | Copyleft |
| Solo investigación | Restringida |
| Otro | Personalizada |
Al clonar un conjunto de datos con una licencia copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-4.0), el clon hereda la licencia y el selector de licencias queda bloqueado.
Configuración de visibilidad#
Controla quién puede ver tu conjunto de datos:
| Configuración | Descripción |
|---|---|
| Privado | Tú y los miembros del espacio de trabajo autorizados podéis acceder |
| Público | Cualquier persona puede ver el contenido, incluso desde la página Explorar |
La visibilidad se configura al crear un conjunto de datos en el diálogo New Dataset utilizando un interruptor de alternancia. Los conjuntos de datos públicos son visibles en la página Explore.
Editar conjunto de datos#
Los metadatos del conjunto de datos se editan en línea directamente en la página del conjunto de datos; no hace falta cuadro de diálogo:
- Name: Haz clic en el nombre del conjunto de datos para editarlo. Los cambios se guardan automáticamente al perder el foco o en
Enter. - Descripción: Haz clic en la descripción (o en el marcador de posición "Añadir una descripción...") para editar. Los cambios se guardan automáticamente.
- Tipo de tarea: Haz clic en la insignia de tarea para seleccionar un tipo de tarea diferente.
- Licencia: Haz clic en el selector de licencia para cambiar la licencia del conjunto de datos.
Cada imagen almacena anotaciones para todos los tipos de tarea juntos. Cambiar el tipo de tarea del conjunto de datos controla qué anotaciones son visibles en el editor e incluidas en las exportaciones y el entrenamiento. Las anotaciones para otros tipos de tarea se conservan en la base de datos y vuelven a aparecer cuando cambias de nuevo.
Metadatos personalizados#
Abre Más acciones y selecciona Información para revisar dos secciones:
- Ultralytics Metadata: Detalles de Platform de solo lectura como el ID del conjunto de datos, propietario, tarea, recuento de imágenes y anotaciones, región de almacenamiento y marcas de tiempo
- Metadatos personalizados: Tu propio objeto JSON para procedencia, condiciones de captura, IDs de clientes, gobernanza u otros datos contextuales
Los espectadores del espacio de trabajo pueden inspeccionar los metadatos, mientras que los miembros con acceso de edición pueden reemplazar el objeto de metadatos personalizados. El objeto de metadatos serializado está limitado a 500.000 caracteres, y cada clave de nivel superior está limitada a 128 caracteres. Guarda un objeto vacío ({}) para borrar los metadatos personalizados.
Clonar dataset#
Al visualizar un conjunto de datos público que no te pertenece, haz clic en Clone Dataset para abrir el cuadro de diálogo de clonación. Revisa el espacio de trabajo de destino, el nombre, la visibilidad y la licencia, y luego confirma la clonación. La copia incluye todas las imágenes, anotaciones y definiciones de clases. Los conjuntos de datos de origen públicos siguen siendo públicos de forma predeterminada en los espacios de trabajo cuya visibilidad predeterminada es pública; los clones de espacios de trabajo Enterprise se establecen como privados de forma predeterminada. Si el conjunto de datos original tiene una licencia copyleft, el clon la hereda y el selector de licencias queda bloqueado.
Marcar como favorito y compartir#
- Marcar como favorito: Haz clic en el botón de estrella para marcar un conjunto de datos. El recuento de favoritos es visible para todos los usuarios.
- Compartir: Para conjuntos de datos públicos, haz clic en el botón de compartir para copiar un enlace o compartirlo en plataformas sociales.
Eliminar dataset#
Eliminar un conjunto de datos que ya no necesites:
- Haz clic en el icono de la papelera Delete dataset en la cabecera del conjunto de datos
- Confirma en el cuadro de diálogo: "Esto moverá [name] a la papelera. Puedes restaurarlo en un plazo de 30 días."
Los conjuntos de datos eliminados se mueven a la Papelera, no se eliminan permanentemente. Puedes restaurarlos dentro de los 30 días desde Settings > Trash.
Entrenar con un conjunto de datos#
Empieza el entrenamiento directamente desde tu conjunto de datos:
- Haz clic en
New Modelen la página del conjunto de datos - Selecciona un proyecto o crea uno nuevo
- Configura los parámetros de entrenamiento
- Inicia el entrenamiento
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffConsulta Cloud Training para obtener más detalles.
FAQ#
¿Qué ocurre con mis datos después de subirlos?#
Tus datos se procesan y almacenan en la región que hayas seleccionado (EE. UU., UE o AP). Las imágenes son:
- Validadas por formato y tamaño
- Rechazadas si la dimensión mínima es inferior a 28px
- Normalizadas si son mayores de 4096px (preservando la relación de aspecto; codificadas para un almacenamiento optimizado)
- Almacenadas utilizando Almacenamiento Direccionable por Contenido (CAS) con hashing XXH3-128
- Miniaturas generadas en formato WebP de 256px para una navegación rápida
¿Cómo funciona el almacenamiento?#
La plataforma Ultralytics utiliza Almacenamiento Direccionable por Contenido (CAS) para un almacenamiento eficiente:
- Deduplicación: Los bytes de imagen idénticos en la misma región de datos reutilizan el mismo objeto subyacente
- Integridad: El hashing XXH3-128 garantiza la integridad de los datos
- Eficiencia: Los clones reutilizan objetos CAS en lugar de copiar los bytes de las imágenes, aunque siguen contando para la cuota de almacenamiento del espacio de trabajo de destino
- Regional: Los datos permanecen en la región que hayas seleccionado (EE. UU., UE o AP)
¿Puedo añadir imágenes a un conjunto de datos existente?#
Sí. Arrastra archivos a la galería del conjunto de datos o haz clic en el icono de carga en la cabecera de la página, que abre directamente el selector de archivos nativo de tu navegador. Las nuevas estadísticas se calculan automáticamente después del procesamiento.
¿Cómo muevo imágenes entre divisiones?#
Utiliza la función de mover a división en bloque:
- Selecciona las imágenes en la vista de tabla
- Haz clic derecho y selecciona
Move to split - Selecciona la división de destino (Train, Validation o Test)
¿Qué formatos de etiqueta son compatibles?#
La plataforma Ultralytics admite etiquetas YOLO, COCO JSON, Ultralytics NDJSON y subidas de imágenes en bruto:
Un archivo .txt por imagen con coordenadas normalizadas (rango de 0 a 1):
| Tarea | Formato | Ejemplo |
|---|---|---|
| Detectar | class cx cy w h | 0 0.5 0.5 0.2 0.3 |
| Segmentar | class x1 y1 x2 y2 ... | 0 0.1 0.1 0.9 0.1 0.9 0.9 |
| Pose | class cx cy w h kx1 ky1 v1 ... | 0 0.5 0.5 0.2 0.3 0.6 0.7 2 |
| OBB | class x1 y1 x2 y2 x3 y3 x4 y4 | 0 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9 |
| Clasificar | Estructura de directorios | train/cats/, train/dogs/ |
Flags de visibilidad de pose: 0=no etiquetado, 1=etiquetado pero ocluido, 2=etiquetado y visible.
¿Puedo anotar el mismo conjunto de datos para varios tipos de tareas?#
Sí. Cada imagen almacena juntas las anotaciones para los 6 tipos de tareas (detect, segment, semantic, classify, pose, OBB). Puedes cambiar el tipo de tarea activa del dataset en cualquier momento sin perder las anotaciones existentes. Solo las anotaciones que coinciden con el tipo de tarea activa se muestran en el editor y se incluyen en las exportaciones y el entrenamiento; las anotaciones para otras tareas se conservan y reaparecen cuando vuelves a cambiar.