YOLO Vision 2026:

Datasets#

Los conjuntos de datos de Ultralytics Platform ofrecen una solución optimizada para gestionar tus datos de entrenamiento. Tras la carga, la plataforma procesa las imágenes, etiquetas y estadísticas automáticamente. Un conjunto de datos está listo para entrenar una vez que el procesamiento ha finalizado y cuenta con al menos una imagen en la división train, al menos una imagen en la división val o test, al menos una imagen etiquetada y un total de al menos dos imágenes.

Subir dataset#

Ultralytics Platform acepta múltiples formatos de carga para una mayor flexibilidad.

¿Ya tienes datos en otro lugar?

Si ya tienes conjuntos de datos en Roboflow, utiliza Integrations para importarlos directamente; no se necesita exportación manual ni volver a cargarlos. Los datos en Google Cloud Storage, Amazon S3 o Azure Blob Storage se pueden usar directamente a través de Cloud storage. Los espacios de trabajo Enterprise pueden utilizar On Premise para indexar y entrenar con datos locales sin enviar píxeles a Platform.

Formatos admitidos#

FormatoExtensionesNotasTamaño máximo
JPEG.jpg, .jpegMás común, recomendado50 MB
PNG.pngSoporta transparencia50 MB
WebP.webpModerno, buena compresión50 MB
BMP.bmpSin compresión50 MB
TIFF.tiff, .tifAlta calidad50 MB
HEIC.heicFotos de iPhone50 MB
AVIF.avifFormato de nueva generación50 MB
JP2.jp2JPEG 200050 MB
DNG.dngCámara Raw50 MB
MPO.mpoObjeto multi-imagen50 MB

Compatibilidad de códecs de vídeo#

La extensión del archivo por sí sola no es suficiente: un vídeo puede fallar si su códec no puede ser decodificado por el trabajador de ingesta de la plataforma.

Usa H.264 MP4

El video H.264 en un contenedor MP4 ofrece la compatibilidad más amplia en los principales navegadores y es la opción más segura. Si un video no se carga, vuélvelo a codificar con FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Preparación de tu dataset#

Platform es compatible con Ultralytics YOLO, COCO, Ultralytics NDJSON y cargas sin procesar (sin anotar):

Usa la estructura de directorios estándar de YOLO con un archivo data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

El archivo YAML define la configuración de tu dataset:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Cargas en bruto

Raw: Sube imágenes sin anotar (sin etiquetas). Es útil cuando planeas anotar directamente en la plataforma utilizando el annotation editor.

Estructura de directorio plana

También puedes subir imágenes sin carpetas de partición explícitas. La plataforma respeta el objetivo de partición activo durante la carga y, para datasets que no sean de clasificación, puede crear automáticamente una partición de validación a partir de una parte del conjunto de entrenamiento cuando no se proporcione información de partición. Siempre puedes reasignar imágenes más tarde con la función de mover a partición en bloque o la redistribución de particiones.

Detección automática de formato

El formato se detecta automáticamente: los conjuntos de datos con un data.yaml que contiene claves names, train o val se tratan como YOLO. Los conjuntos de datos con archivos JSON de COCO (que contienen matrices images, annotations y categories) se tratan como COCO. Las exportaciones de .ndjson se importan como Ultralytics NDJSON. Los conjuntos de datos que solo contienen imágenes y ninguna anotación se tratan como raw.

Para obtener detalles sobre formatos específicos de tareas, consulta supported tasks y Datasets Overview.

Proceso de carga#

Para crear un conjunto de datos:

  1. Navega a Annotate en la barra lateral
  2. Haz clic en New Dataset
  3. Selecciona el tipo de tarea (consulta supported tasks)
  4. Añade un nombre y una descripción opcional
  5. Configura la visibilidad (pública o privada) y una licencia opcional (consulta available licenses)
  6. Agrega archivos y haz clic en Create & Upload, o haz clic en Create Dataset para comenzar con un conjunto de datos vacío

Ultralytics Platform Datasets Upload Dialog Task Selector Para agregar archivos a un conjunto de datos existente, abre su página de conjuntos de datos y arrastra los archivos a la galería o haz clic en el icono de carga en el encabezado de la página. El icono de carga abre directamente el selector de archivos nativo de tu navegador porque la tarea del conjunto de datos ya está definida.

Tras la carga, la plataforma procesa tus datos a través de una canalización de varias etapas:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Validación: Comprobaciones de formato y tamaño
  2. Normalización: Las imágenes grandes se redimensionan (máx. 4096px, dimensión mínima 28px)
  3. Miniaturas: Se generan vistas previas en WebP de 256px
  4. Label Parsing: Se extrajeron las etiquetas en formato YOLO y COCO
  5. Estadísticas: Se calculan las distribuciones de clases y las dimensiones de las imágenes

Ultralytics Platform Datasets Upload Progress Bar

Validar antes de subir

Puedes validar tu dataset localmente antes de subirlo:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Requisitos de tamaño de imagen

Las imágenes deben tener al menos 28px en su lado más corto. Las imágenes más pequeñas se rechazan durante el procesamiento. Las imágenes de más de 4096px en su lado más largo se redimensionan automáticamente manteniendo la relación de aspecto.

Explorar imágenes#

Visualiza las imágenes de tu dataset en múltiples diseños.

Abre el panel Clustering desde la barra de herramientas de la galería para explorar tu conjunto de datos como un diagrama de dispersión 2D interactivo.

VistaDescripción
CuadrículaCuadrícula de miniaturas con superposición de anotaciones (predeterminado)
CompactoMiniaturas más pequeñas para un escaneo rápido
TablaLista con miniatura, nombre de archivo, dimensiones, tamaño, partición, clases y recuento de etiquetas

Ultralytics Platform Datasets Gallery Grid View With Annotations

Ordenación y filtrado#

Las imágenes se pueden ordenar y filtrar para una exploración eficiente:

OrdenarDescripción
Más recientes / Más antiguasOrden de carga / creación
Nombre A-Z / Z-ANombre de archivo alfabético
Altura ↑/↓Altura de la imagen en píxeles
Anchura ↑/↓Anchura de la imagen en píxeles
Tamaño ↑/↓Tamaño del archivo en disco
Anotaciones ↑/↓Recuento de anotaciones por imagen
Datasets grandes

Para datasets de más de 100.000 imágenes, las ordenaciones por nombre / tamaño / anchura / altura se desactivan para mantener la galería receptiva. Las ordenaciones por más reciente, más antiguo y recuento de anotaciones permanecen disponibles.

Búsqueda de imágenes sin etiquetar

Usa el conjunto de filtros Annotations establecido en Unannotated para encontrar rápidamente las imágenes que aún necesitan anotación. Esto es especialmente útil para conjuntos de datos grandes donde deseas realizar un seguimiento del progreso del etiquetado.

Búsqueda de metadatos personalizados

La barra de búsqueda se encuentra a la derecha de la barra de herramientas de la galería y filtra todos los modos de vista: tarjetas, compacto y tabla. Coincide con el nombre de archivo de la imagen (la extensión de archivo es opcional), así como con las claves de metadatos personalizados, valores escalares y entradas de matrices, de modo que una imagen llamada img_0042 que contenga {"ship_type": "yacht"} se encuentra buscando tanto img_0042 como yacht.

Los valores anidados dentro de subobjetos no coinciden. Al pegar una cadena hexadecimal de 32 caracteres, se busca exactamente ese hash de contenido de la imagen.

Visor en pantalla completa#

Haz clic en cualquier imagen para abrir el visor en pantalla completa con:

  • Navegación: Teclas de flecha o vistas previas de miniaturas para navegar
  • Image information: Revisa las propiedades generadas por Platform, los metadatos personalizados y los metadatos de archivos incrustados como EXIF
  • Metadatos personalizados: Los propietarios y editores pueden añadir o reemplazar un objeto JSON, incluidos valores anidados de hasta 500.000 caracteres serializados y claves de nivel superior de hasta 128 caracteres
  • Anotaciones: Alternar la visibilidad de la superposición de anotaciones
  • Desglose por clase: Recuentos de etiquetas por clase con indicadores de color
  • Annotate: Cuando tienes acceso de edición, los controles de anotación se activan inmediatamente cuando el visor en pantalla completa se abre en el escritorio
  • Descargar: Descarga el archivo de imagen original
  • Eliminar: Elimina la imagen del dataset
  • Zoom: Cmd/Ctrl+Scroll, Cmd/Ctrl++ o Cmd/Ctrl+= para acercar, y Cmd/Ctrl+- para alejar
  • Reset view: Cmd/Ctrl + 0 o el botón de restablecer para ajustar la imagen al visor
  • Pan: Mantén presionado Space y arrastra para desplazar el lienzo al hacer zoom
  • Vista de píxeles: Alternar la renderización pixelada para una inspección detallada

Ultralytics Platform Datasets Fullscreen Viewer With Metadata Panel

Filtrar por división (Split)#

Filtrar imágenes por su división (split) del dataset:

SplitPropósito
EntrenarUtilizado para el entrenamiento del modelo
ValUtilizado para la validación durante el entrenamiento
ProbarUtilizado para la evaluación final

Agrupamiento (Clustering)#

El panel Clustering proyecta tu conjunto de datos en un diagrama de dispersión 2D interactivo donde las imágenes visualmente similares se sitúan muy cerca unas de otras. Úsalo para revelar conglomerados, detectar duplicados y valores atípicos, y examinar cómo se distribuyen las divisiones o clases en tus datos, todo sin salir de la galería. Ábrelo desde el icono del gráfico de dispersión en la barra de herramientas de la galería en cualquier página de conjunto de datos.

Ultralytics Platform Datasets Clustering Empty State

Ejecución del análisis#

Iniciar un análisis:

  1. Abre un dataset y haz clic en el icono de gráfico de dispersión en la barra de herramientas de la galería
  2. Haz clic en Analyze Dataset
  3. Espera a que finalice la barra de progreso: los resultados aparecen en el mismo panel

El análisis se ejecuta en segundo plano y puede tardar unos minutos dependiendo del tamaño de tu dataset. Puedes cerrar el panel o salir de la página y volver más tarde.

Visualización#

Una vez completado el análisis, el panel muestra una dispersión 2D de todas las imágenes analizadas. Los filtros de la galería (división, clase, etiquetado/sin etiquetar) atenúan los puntos fuera del filtro para que puedas centrarte en el subconjunto que te interesa.

Ultralytics Platform Datasets Clustering Scatter Plot

Colorear por#

Cambia cómo se sombrean los puntos de datos con el menú desplegable Color by en la barra de herramientas del panel. Cambia los modos de vista en cualquier momento; el gráfico cambia de color al instante para que puedas ver cómo se distribuyen las divisiones, clases o propiedades de las imágenes en tus conglomerados:

OpciónSombreado
SplitsTrain / Val / Test
ClasesPrimera clase de anotación en cada imagen
AnchuraAnchura de la imagen
AlturaAltura de la imagen
TamañoTamaño del archivo
AnotacionesNúmero de anotaciones por imagen

Ultralytics Platform Datasets Clustering Color Modes

Selección de lazo#

Dibuja una selección de forma libre alrededor de una región para resaltar puntos en el gráfico. La galería filtra las imágenes coincidentes para que puedas inspeccionarlas, volver a etiquetarlas, moverlas o eliminarlas utilizando las image operations habituales.

Borrar selección

Una etiqueta sobre el gráfico muestra cuántos puntos están seleccionados; haz clic en × para borrar el lazo y volver a la vista completa de la galería.

Desplazamiento y Zoom#

Navega por grandes dispersiones directamente desde tu ratón y teclado:

EntradaAcción
ScrollDesplazar el gráfico en 2D
Cmd/Ctrl+ScrollAcercar o alejar, anclado en el cursor
Mantener EspacioCambiar al modo de arrastrar para desplazar (drag-to-pan)

Re-análisis#

Si tu conjunto de datos cambia después del análisis, aparece un botón Re-analyze en la parte superior del panel para los propietarios y editores.

Haz clic en Re-analyze para volver a calcular las incrustaciones y la proyección 2D desde cero.

Pestañas de Dataset#

Cada página de dataset puede mostrar hasta seis pestañas, dependiendo del estado del dataset y tus permisos:

Pestaña Imágenes#

La vista predeterminada que muestra la galería de imágenes con superposiciones de anotaciones. Admite modos de vista de cuadrícula, compacta y de tabla. Arrastra y suelta archivos aquí para añadir más imágenes.

Pestaña Clases#

Esta pestaña aparece cuando el dataset tiene imágenes.

Gestiona las clases de anotación de tu dataset:

  • Histograma de clases: Gráfico de barras que muestra el recuento de anotaciones por clase con alternancia de escala lineal/logarítmica
  • Tabla de clases: tabla ordenable y con búsqueda que incluye el nombre de la clase, el recuento de etiquetas y el recuento de imágenes
  • Editar nombres de clases: haz clic en cualquier nombre de clase para cambiarlo directamente
  • Editar colores de clases: haz clic en una muestra de color para cambiar el color de la clase
  • Añadir nueva clase: utiliza la entrada en la parte inferior para añadir clases

Ultralytics Platform Datasets Classes Tab Histogram And Table

Escala logarítmica para datasets desequilibrados

Si tu conjunto de datos tiene desequilibrio de clases (por ejemplo, 10,000 anotaciones de "person" pero solo 50 de "bicycle"), usa el botón de alternancia Log Scale en el histograma de clases para visualizar todas las clases con claridad.

Pestaña de gráficos#

Esta pestaña aparece cuando el dataset tiene imágenes.

Estadísticas automáticas calculadas a partir de tu dataset:

GráficoDescripción
Distribución de las particionesGráfico de anillo con el recuento de imágenes de entrenamiento/validación/prueba y el porcentaje etiquetado
Clases principalesGráfico de anillo de las 10 clases de anotación más frecuentes
Dimensiones de la imagenHistograma de la distribución de la anchura y altura de la imagen (superpuesto) con la media
Puntos por instanciaRecuento de vértices de polígono o puntos clave por anotación (segmento/pose)
Ubicaciones de las anotacionesMapa de calor 2D de las posiciones centrales de los BBox
Tamaño del archivo de imagenHistograma de la distribución del tamaño de los archivos de imagen
Formatos de imagenDistribución de los formatos de imagen de origen (JPG, PNG, etc.)
Dimensiones del BBoxHistograma de la anchura y altura del BBox (superpuesto)
Objetos por imagenHistograma del recuento de anotaciones por imagen
Dimensiones de imagen 2DMapa de calor 2D de anchura frente a altura con líneas guía de relación de aspecto

Ultralytics Platform Datasets Charts Tab Statistics Grid

Almacenamiento en caché de estadísticas

La plataforma almacena en caché las estadísticas calculadas y las invalida cuando cambian las imágenes, las anotaciones, las clases o las divisiones.

Mapas de calor a pantalla completa

Haz clic en el botón de expandir en cualquier mapa de calor para verlo en modo de pantalla completa. Esto proporciona una vista más grande y detallada, útil para comprender patrones espaciales en datasets grandes.

Pestaña de modelos#

Consulta todos los modelos entrenados en este dataset en una tabla con función de búsqueda:

ColumnaDescripción
NombreNombre del modelo con enlace
ProyectoProyecto principal con icono
VersiónVersión de dataset inmutable utilizada para el entrenamiento, si la hay
EstadoInsignia de estado de entrenamiento
TareaTipo de tarea YOLO
ÉpocasMejor época / épocas totales
mAP50-95Precisión media
mAP50mAP con IoU 0.50
CreadoFecha de creación

Ultralytics Platform Datasets Models Tab Trained Models Table

Pestaña de errores#

Esta pestaña solo aparece cuando uno o más archivos no se procesan correctamente.

Las imágenes que fallaron al procesarse se enumeran aquí con:

  • Banner de error: recuento total de imágenes fallidas y orientación
  • Tabla de errores: nombre del archivo, descripción del error fácil de entender, sugerencias de solución y miniatura de vista previa
  • Los errores comunes incluyen archivos corruptos, formatos no admitidos, imágenes demasiado pequeñas (mín. 28px) y modos de color no admitidos

Ultralytics Platform Datasets Errors Tab Processing Failures

Errores de procesamiento comunes
ErrorCausaSolución
No se puede leer el archivo de imagenFormato corrupto o no admitidoVuelve a exportar desde el editor de imágenes
Incompleto o corruptoEl archivo se truncó durante la transferenciaVuelve a descargar el archivo original
Imagen demasiado pequeñaDimensión mínima inferior a 28pxUtiliza imágenes de origen con mayor resolución
Modo de color no admitidoModo de color CMYK o indexadoConvierte al modo RGB

Pestaña de versiones#

Crea instantáneas NDJSON inmutables de tu dataset para un entrenamiento reproducible. Cada versión captura los recuentos de imágenes, clases, anotaciones y el tamaño del archivo en el momento de la creación.

ColumnaDescripción
VersiónNúmero de versión (v1, v2, ...)
DescripciónDescripción proporcionada por el usuario (editable)
ImágenesRecuento de imágenes en el momento de la instantánea
ClasesRecuento de clases en el momento de la instantánea
AnotacionesRecuento de anotaciones en el momento de la instantánea
TamañoTamaño del archivo de exportación NDJSON
CreadoCuando se creó la versión
AccionesDescargar, restaurar o eliminar

Para crear una versión:

  1. Abre la pestaña Versiones
  2. Opcionalmente introduce una descripción (por ejemplo, "Se añadieron 500 imágenes de entrenamiento" o "Se corrigieron clases mal etiquetadas")
  3. Haz clic en + Nueva versión
  4. La nueva versión aparece en la tabla
  5. Usa las acciones de fila para descargar, restaurar o eliminar la versión

Cada versión está numerada secuencialmente (v1, v2, v3...). Puedes descargar una versión guardada mientras permanezca en la tabla de versiones.

Restauración de una versión

Restaurar reemplaza permanentemente las imágenes, divisiones, clases y anotaciones actuales del conjunto de datos con la instantánea seleccionada. La reconstrucción puede tardar varios minutos y no se puede deshacer a menos que guardes primero el estado actual como otra versión.

Guarda una versión mientras entrenas

Habilita Save Dataset Version en el Cloud Training dialog para vincular un modelo al conjunto de datos exacto utilizado para el entrenamiento. La plataforma reutiliza una versión coincidente cuando los contenidos del conjunto de datos no han cambiado y crea una nueva versión solo cuando lo han hecho.

Solo datasets preparados

La creación de versiones está disponible después de que el conjunto de datos alcance el estado ready.

Cuándo crear versiones

Crea una versión antes y después de cambios importantes en tu dataset: añadir imágenes, corregir anotaciones o reequilibrar particiones. Esto te permite comparar el rendimiento del modelo en diferentes estados del dataset.

Tamaño del archivo NDJSON

El tamaño que se muestra es el tamaño del archivo de exportación NDJSON, que contiene URL de imágenes y anotaciones, no las imágenes en sí. Los datos reales de la imagen se almacenan por separado y se accede a ellos a través de URL firmadas.

Exportar dataset#

Exporta tu dataset para su uso sin conexión con una descarga NDJSON desde el encabezado del dataset o la pestaña Versiones.

Para exportar:

  1. Haz clic en el botón Descargar (icono de descarga) en el encabezado del dataset
  2. Descarga directamente la instantánea NDJSON actual
  3. Usa la pestaña Versiones cuando quieras una instantánea numerada inmutable que puedas volver a descargar más tarde

Ultralytics Platform Datasets Export Ndjson Download El formato NDJSON almacena un objeto JSON por línea. La primera línea contiene los metadatos del conjunto de datos, seguida de una línea por imagen:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

El objeto metadata opcional a nivel de imagen se conserva cuando se importa un archivo NDJSON a Platform. Puedes inspeccionarlo o editarlo desde el panel de información de pantalla completa de la imagen. Para cargas de archivos por lotes mediante programación, el Dataset Ingest API acepta el mapa de rutas imageMetadata equivalente.

URLs firmadas

Las URLs de las imágenes en el NDJSON exportado están firmadas y son válidas durante 7 días. Si necesitas URLs nuevas, vuelve a exportar el conjunto de datos o crea una nueva versión.

Consulta la Ultralytics NDJSON format documentation para ver la especificación completa.

Operaciones con imágenes#

Acciones rápidas#

Haz clic derecho en cualquier imagen en la vista Cuadrícula o Compacta para acceder a acciones rápidas:

AcciónDescripción
Mover a divisiónReasigna la imagen a la división de entrenamiento (Train), validación (Val) o prueba (Test)
DescargaDescarga el archivo de imagen original
EliminarElimina la imagen del conjunto de datos

Ultralytics Platform Datasets Image Card Context Menu

Individual vs. en masa

El menú contextual de la imagen opera sobre una única imagen. Para operaciones en masa sobre varias imágenes, utiliza la vista Tabla con selección mediante casillas de verificación.

Mover a división en masa#

Reasigna las imágenes seleccionadas a una división diferente dentro del mismo conjunto de datos:

  1. Cambia a la vista Tabla
  2. Selecciona las imágenes usando las casillas de verificación
  3. Haz clic derecho para abrir el menú contextual
  4. Elige Move to split > Train, Validation o Test

También puedes arrastrar y soltar imágenes sobre las pestañas de filtro de división en la vista de cuadrícula.

Organización de divisiones de entrenamiento/validación

Sube todas las imágenes a un conjunto de datos y luego usa el movimiento en masa a división para organizar los subconjuntos en divisiones de entrenamiento, validación y prueba.

Redistribución de divisiones#

Redistribuye todas las imágenes entre las divisiones de entrenamiento, validación y prueba usando proporciones personalizadas:

  1. Haz clic en la barra de división en la barra de herramientas del conjunto de datos para abrir el cuadro de diálogo Redistribuir divisiones
  2. Ajusta los porcentajes de división usando cualquiera de los métodos siguientes
  3. Revisa la vista previa del conteo de imágenes en directo para confirmar la distribución
  4. Haz clic en Aplicar para reasignar aleatoriamente todas las imágenes según tus porcentajes

Ultralytics Platform Datasets Split Redistribution Dialog El cuadro de diálogo ofrece tres formas de establecer tus proporciones de división objetivo:

MétodoDescripción
ArrastrarArrastra los controles entre los segmentos de color para ajustar visualmente los límites de las divisiones
EscribirEdita el porcentaje introducido para cualquier división (las otras dos divisiones se reequilibran automáticamente de forma proporcional)
AutoUn clic para establecer instantáneamente una división 80/20 de entrenamiento/validación con la división de prueba establecida en 0%

Una vista previa en directo muestra exactamente cuántas imágenes terminarán en cada división antes de que apliques los cambios.

División rápida 80/20

Haz clic en el botón Auto para establecer instantáneamente la división recomendada 80/20 de entrenamiento/validación. Esta es la proporción más común para el entrenamiento.

Eliminación en masa#

Elimina varias imágenes a la vez:

  1. Selecciona las imágenes en la vista de tabla
  2. Haz clic derecho y selecciona Delete
  3. Confirma la eliminación

URI del conjunto de datos#

Haz referencia a los conjuntos de datos de Platform utilizando el formato de URI ul:// (consulta Using Platform Datasets):

ul://username/datasets/dataset-slug

También puedes pegar directamente la URL web de un conjunto de datos o modelo (por ejemplo, https://platform.ultralytics.com/username/datasets/dataset-slug); se reescribe automáticamente a la URI de ul://. Pasar una lista de conjuntos de datos afina un modelo base en cada uno de ellos en serie, por ejemplo, model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Usa este URI para entrenar modelos desde cualquier lugar:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Entrena en cualquier lugar con datos de la Platform

La URI de ul:// funciona desde cualquier entorno:

  • Máquina local: Entrena en tu hardware, los datos se descargan automáticamente
  • Google Colab: Accede a tus conjuntos de datos de la Platform en notebooks
  • Servidores remotos: Entrena en máquinas virtuales en la nube con acceso total al conjunto de datos

Licencias disponibles#

La Platform admite las siguientes licencias para conjuntos de datos:

LicenciaTipo
NingunaNo se ha seleccionado ninguna licencia
CC0-1.0Dominio público
CC-BY-2.5Permisiva
CC-BY-4.0Permisiva
CC-BY-SA-4.0Copyleft
CC-BY-NC-4.0No comercial
CC-BY-NC-SA-4.0Copyleft
CC-BY-ND-4.0Sin derivados
CC-BY-NC-ND-4.0No comercial
Apache-2.0Permisiva
MITPermisiva
AGPL-3.0Copyleft
GPL-3.0Copyleft
Solo investigaciónRestringida
OtroPersonalizada
Licencias Copyleft

Al clonar un conjunto de datos con una licencia copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-4.0), el clon hereda la licencia y el selector de licencias queda bloqueado.

Configuración de visibilidad#

Controla quién puede ver tu conjunto de datos:

ConfiguraciónDescripción
PrivadoTú y los miembros del espacio de trabajo autorizados podéis acceder
PúblicoCualquier persona puede ver el contenido, incluso desde la página Explorar

La visibilidad se configura al crear un conjunto de datos en el diálogo New Dataset utilizando un interruptor de alternancia. Los conjuntos de datos públicos son visibles en la página Explore.

Editar conjunto de datos#

Los metadatos del conjunto de datos se editan en línea directamente en la página del conjunto de datos; no hace falta cuadro de diálogo:

  • Name: Haz clic en el nombre del conjunto de datos para editarlo. Los cambios se guardan automáticamente al perder el foco o en Enter.
  • Descripción: Haz clic en la descripción (o en el marcador de posición "Añadir una descripción...") para editar. Los cambios se guardan automáticamente.
  • Tipo de tarea: Haz clic en la insignia de tarea para seleccionar un tipo de tarea diferente.
  • Licencia: Haz clic en el selector de licencia para cambiar la licencia del conjunto de datos.
Cambiar tipo de tarea

Cada imagen almacena anotaciones para todos los tipos de tarea juntos. Cambiar el tipo de tarea del conjunto de datos controla qué anotaciones son visibles en el editor e incluidas en las exportaciones y el entrenamiento. Las anotaciones para otros tipos de tarea se conservan en la base de datos y vuelven a aparecer cuando cambias de nuevo.

Metadatos personalizados#

Abre Más acciones y selecciona Información para revisar dos secciones:

  • Ultralytics Metadata: Detalles de Platform de solo lectura como el ID del conjunto de datos, propietario, tarea, recuento de imágenes y anotaciones, región de almacenamiento y marcas de tiempo
  • Metadatos personalizados: Tu propio objeto JSON para procedencia, condiciones de captura, IDs de clientes, gobernanza u otros datos contextuales

Los espectadores del espacio de trabajo pueden inspeccionar los metadatos, mientras que los miembros con acceso de edición pueden reemplazar el objeto de metadatos personalizados. El objeto de metadatos serializado está limitado a 500.000 caracteres, y cada clave de nivel superior está limitada a 128 caracteres. Guarda un objeto vacío ({}) para borrar los metadatos personalizados.

Clonar dataset#

Al visualizar un conjunto de datos público que no te pertenece, haz clic en Clone Dataset para abrir el cuadro de diálogo de clonación. Revisa el espacio de trabajo de destino, el nombre, la visibilidad y la licencia, y luego confirma la clonación. La copia incluye todas las imágenes, anotaciones y definiciones de clases. Los conjuntos de datos de origen públicos siguen siendo públicos de forma predeterminada en los espacios de trabajo cuya visibilidad predeterminada es pública; los clones de espacios de trabajo Enterprise se establecen como privados de forma predeterminada. Si el conjunto de datos original tiene una licencia copyleft, el clon la hereda y el selector de licencias queda bloqueado.

Marcar como favorito y compartir#

  • Marcar como favorito: Haz clic en el botón de estrella para marcar un conjunto de datos. El recuento de favoritos es visible para todos los usuarios.
  • Compartir: Para conjuntos de datos públicos, haz clic en el botón de compartir para copiar un enlace o compartirlo en plataformas sociales.

Eliminar dataset#

Eliminar un conjunto de datos que ya no necesites:

  1. Haz clic en el icono de la papelera Delete dataset en la cabecera del conjunto de datos
  2. Confirma en el cuadro de diálogo: "Esto moverá [name] a la papelera. Puedes restaurarlo en un plazo de 30 días."
Papelera y restauración

Los conjuntos de datos eliminados se mueven a la Papelera, no se eliminan permanentemente. Puedes restaurarlos dentro de los 30 días desde Settings > Trash.

Entrenar con un conjunto de datos#

Empieza el entrenamiento directamente desde tu conjunto de datos:

  1. Haz clic en New Model en la página del conjunto de datos
  2. Selecciona un proyecto o crea uno nuevo
  3. Configura los parámetros de entrenamiento
  4. Inicia el entrenamiento
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Consulta Cloud Training para obtener más detalles.

FAQ#

¿Qué ocurre con mis datos después de subirlos?#

Tus datos se procesan y almacenan en la región que hayas seleccionado (EE. UU., UE o AP). Las imágenes son:

  1. Validadas por formato y tamaño
  2. Rechazadas si la dimensión mínima es inferior a 28px
  3. Normalizadas si son mayores de 4096px (preservando la relación de aspecto; codificadas para un almacenamiento optimizado)
  4. Almacenadas utilizando Almacenamiento Direccionable por Contenido (CAS) con hashing XXH3-128
  5. Miniaturas generadas en formato WebP de 256px para una navegación rápida

¿Cómo funciona el almacenamiento?#

La plataforma Ultralytics utiliza Almacenamiento Direccionable por Contenido (CAS) para un almacenamiento eficiente:

  • Deduplicación: Los bytes de imagen idénticos en la misma región de datos reutilizan el mismo objeto subyacente
  • Integridad: El hashing XXH3-128 garantiza la integridad de los datos
  • Eficiencia: Los clones reutilizan objetos CAS en lugar de copiar los bytes de las imágenes, aunque siguen contando para la cuota de almacenamiento del espacio de trabajo de destino
  • Regional: Los datos permanecen en la región que hayas seleccionado (EE. UU., UE o AP)

¿Puedo añadir imágenes a un conjunto de datos existente?#

Sí. Arrastra archivos a la galería del conjunto de datos o haz clic en el icono de carga en la cabecera de la página, que abre directamente el selector de archivos nativo de tu navegador. Las nuevas estadísticas se calculan automáticamente después del procesamiento.

¿Cómo muevo imágenes entre divisiones?#

Utiliza la función de mover a división en bloque:

  1. Selecciona las imágenes en la vista de tabla
  2. Haz clic derecho y selecciona Move to split
  3. Selecciona la división de destino (Train, Validation o Test)

¿Qué formatos de etiqueta son compatibles?#

La plataforma Ultralytics admite etiquetas YOLO, COCO JSON, Ultralytics NDJSON y subidas de imágenes en bruto:

Un archivo .txt por imagen con coordenadas normalizadas (rango de 0 a 1):

TareaFormatoEjemplo
Detectarclass cx cy w h0 0.5 0.5 0.2 0.3
Segmentarclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
Poseclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
ClasificarEstructura de directoriostrain/cats/, train/dogs/

Flags de visibilidad de pose: 0=no etiquetado, 1=etiquetado pero ocluido, 2=etiquetado y visible.

¿Puedo anotar el mismo conjunto de datos para varios tipos de tareas?#

Sí. Cada imagen almacena juntas las anotaciones para los 6 tipos de tareas (detect, segment, semantic, classify, pose, OBB). Puedes cambiar el tipo de tarea activa del dataset en cualquier momento sin perder las anotaciones existentes. Solo las anotaciones que coinciden con el tipo de tarea activa se muestran en el editor y se incluyen en las exportaciones y el entrenamiento; las anotaciones para otras tareas se conservan y reaparecen cuando vuelves a cambiar.

Comentarios