YOLO Vision 2026:

Datasets#

Los conjuntos de datos de Ultralytics Platform ofrecen una solución optimizada para gestionar tus datos de entrenamiento. Tras la subida, la plataforma procesa automáticamente las imágenes, etiquetas y estadísticas.

Un conjunto de datos está listo para entrenar una vez que finaliza el procesamiento y cuenta con al menos una imagen en la división train, al menos una imagen en la división val o test, y al menos una imagen etiquetada. El encabezado del conjunto de datos muestra una insignia de Ready cuando se cumplen las tres condiciones, y una insignia de Not Ready en caso contrario; haz clic en la insignia para ver exactamente qué condición falta.

Subir dataset#

Ultralytics Platform acepta múltiples formatos de carga para una mayor flexibilidad.

¿Ya tienes datos en otro lugar?

Si ya tienes conjuntos de datos en Roboflow, utiliza Integrations para importarlos directamente; no se necesita exportación manual ni volver a cargarlos. Los datos en Google Cloud Storage, Amazon S3 o Azure Blob Storage se pueden usar directamente a través de Cloud storage. Los espacios de trabajo Enterprise pueden utilizar On Premise para indexar y entrenar con datos locales sin enviar píxeles a Platform.

Formatos admitidos#

FormatoExtensionesNotasTamaño máximo
JPEG.jpg, .jpegMás común, recomendado50 MB
PNG.pngSoporta transparencia50 MB
WebP.webpModerno, buena compresión50 MB
BMP.bmpSin compresión50 MB
TIFF.tiff, .tifAlta calidad50 MB
HEIC.heicFotos de iPhone50 MB
AVIF.avifFormato de nueva generación50 MB
JP2.jp2JPEG 200050 MB
DNG.dngCámara Raw50 MB
MPO.mpoObjeto multi-imagen50 MB

Compatibilidad de códecs de vídeo#

La extensión del archivo por sí sola no es suficiente: un vídeo aún puede fallar si su códec no se puede descodificar durante el procesamiento.

Usa H.264 MP4

El vídeo H.264 en un contenedor MP4 tiene la compatibilidad de descodificación más amplia y es la opción más segura. Si un vídeo no se procesa, vuelve a codificarlo con FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Preparación de tu dataset#

La plataforma admite Ultralytics YOLO, COCO, depth datasets, Ultralytics NDJSON y cargas de datos en bruto (sin anotar):

Usa la estructura de directorios estándar de YOLO con un archivo data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

El archivo YAML define la configuración de tu dataset:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Cargas en bruto

Raw: Sube imágenes sin anotar (sin etiquetas). Es útil cuando planeas anotar directamente en la plataforma utilizando el annotation editor.

Estructura de directorio plana

También puedes subir imágenes sin carpetas de división explícitas. La plataforma respeta el objetivo de división activo durante la subida. Si no se establece ningún objetivo de división y la subida deja val vacío —o con menos de dos mapas emparejados para profundidad—, los conjuntos de datos que no sean de clasificación mueven automáticamente las imágenes de entrenamiento a val para que el conjunto de datos se pueda entrenar de inmediato. Los conjuntos de datos de clasificación se omiten porque utilizan divisiones basadas en directorios. Siempre puedes reasignar imágenes más tarde con bulk move-to-split o split redistribution.

Detección automática de formato

El formato se detecta automáticamente: los conjuntos de datos con un data.yaml que contiene claves names, train o val se tratan como YOLO. Los conjuntos de datos con archivos JSON de COCO (que contienen matrices images, annotations y categories) se tratan como COCO. Las exportaciones de .ndjson se importan como Ultralytics NDJSON. Los conjuntos de datos que solo contienen imágenes y ninguna anotación se tratan como raw.

Cuando un archivo comprimido contiene varios archivos YAML, Platform prefiere los nombres estándar (data.yaml, data.yml, dataset.yaml, dataset.yml) más cercanos a la raíz del archivo. Mantén un archivo YAML con un nombre claro por archivo comprimido para evitar ambigüedades.

El formato Pascal VOC XML no se importa

Los archivos de etiquetas en formato Pascal VOC XML se detectan, pero sus anotaciones no se importan; las imágenes se suben sin anotar. Platform te avisa antes de que comience la subida ("Etiquetas de Pascal VOC detectadas"). Convierte primero las etiquetas VOC XML a YOLO o COCO; consulta las herramientas de conversión de formatos.

Si las etiquetas hacen referencia a IDs de clase pero no se proporcionan nombres de clase, Platform genera nombres de posición densos (class0, class1, …) que puedes cambiar de nombre más tarde en la pestaña Clases.

Para obtener detalles sobre formatos específicos de tareas, consulta supported tasks y Datasets Overview.

Proceso de carga#

Para crear un conjunto de datos:

  1. Navega a Annotate en la barra lateral
  2. Haz clic en New Dataset
  3. Elige una pestaña de origen de datos (consulta Orígenes de datos más abajo)
  4. Añade un nombre (el slug de la URL se deriva automáticamente y se puede editar) y una descripción opcional
  5. Selecciona el tipo de tarea (consulta las tareas compatibles), una licencia opcional (consulta las licencias disponibles) y la visibilidad (pública o privada)
  6. Haz clic en Create & Upload para archivos locales, en Create & Import para una URL o origen conectado, o en Create Dataset para empezar desde cero

Ultralytics Platform Datasets Upload Dialog Task Selector Para agregar archivos a un conjunto de datos existente, abre su página de conjuntos de datos y arrastra los archivos a la galería o haz clic en el icono de carga en el encabezado de la página. El icono de carga abre directamente el selector de archivos nativo de tu navegador porque la tarea del conjunto de datos ya está definida.

Fuentes de datos#

El cuadro de diálogo New Dataset ofrece cuatro fuentes:

FuenteDescripción
SubidaArrastra los archivos o búscalos: imágenes, vídeos, archivos comprimidos o NDJSON
URLPega un enlace directo a un archivo .zip, .tar, .tar.gz, .tgz o .ndjson; Platform lo descarga e ingiere en el servidor
NubeUsa datos en el mismo lugar desde Google Cloud Storage, Amazon S3 o Azure Blob Storage (Pro y Enterprise)
On PremiseIndexa y entrena con datos que nunca abandonan tus propias máquinas mediante trabajadores de On Premise (Enterprise)
Límites de importación por URL

Una importación por URL está limitada tanto por el límite por subida de tu plan (10 GB en Free / 20 GB en Pro / 50 GB en Enterprise) como por tu cuota de almacenamiento restante (la cantidad que sea menor). El enlace debe ser públicamente accesible a través de HTTP o HTTPS y terminar en una extensión compatible.

Antes de que comience la subida#

Platform valida tus archivos en el navegador antes de subir nada, por lo que los problemas comunes surgen de inmediato y no después de una larga transferencia. Se comprueba si los archivos comprimidos están corruptos, vacíos, protegidos con contraseña o contienen errores de sintaxis YAML, y los archivos de gran tamaño se enumeran por su nombre.

Es posible que aparezcan entonces dos cuadros de diálogo:

Cuando el archivo comprimido declara nombres de clase y tu conjunto de datos ya tiene clases, el cuadro de diálogo Map imported classes enumera una fila por clase entrante. Para cada una, elige una clase existente en la que fusionarla, crea una nueva clase u omítela. Las coincidencias exactas de nombres vienen preseleccionadas, y las clases omitidas junto con sus anotaciones no se importan.

Después de la subida, la plataforma procesa tus datos automáticamente:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Validación: Comprobaciones de formato y tamaño
  2. Normalización: Las imágenes grandes se redimensionan (máximo 4096 px, dimensión mínima de 28 px), las escalas de grises se expanden a RGB, la transparencia se aplana sobre un fondo blanco y se aplica la orientación EXIF
  3. Miniaturas: Se generan vistas previas en WebP de 256px
  4. Análisis de etiquetas: Se extraen las etiquetas de YOLO, COCO y NDJSON
  5. Estadísticas: Se calculan las distribuciones de clases y las dimensiones de las imágenes
Codificación de imágenes almacenadas

Los originales en AVIF y WebP se almacenan bit a bit cuando no es necesario cambiar el tamaño ni el color. Todo lo demás se vuelve a codificar: las fuentes WebP siguen siendo WebP, y todos los demás formatos (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) pasan a ser JPEG con una calidad de 92. Tu nombre de archivo original y la extensión de origen se conservan como metadatos.

Ultralytics Platform Datasets Upload Progress Bar

Validar antes de subir

Puedes validar tu dataset localmente antes de subirlo:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Requisitos de tamaño de imagen

Las imágenes deben tener al menos 28px en su lado más corto. Las imágenes más pequeñas se rechazan durante el procesamiento. Las imágenes de más de 4096px en su lado más largo se redimensionan automáticamente manteniendo la relación de aspecto.

Explorar imágenes#

Visualiza las imágenes de tu dataset en múltiples diseños.

Abre el panel Clustering desde la barra de herramientas de la galería para explorar tu conjunto de datos como un diagrama de dispersión 2D interactivo.

VistaDescripción
CuadrículaCuadrícula de miniaturas con superposición de anotaciones (predeterminado)
CompactoMiniaturas más pequeñas para un escaneo rápido
TablaLista con miniatura, nombre de archivo, dimensiones, tamaño, partición, clases y recuento de etiquetas

Ultralytics Platform Datasets Gallery Grid View With Annotations

Ordenación y filtrado#

Las imágenes se pueden ordenar y filtrar para una exploración eficiente:

Cada opción alterna entre ascendente (↑) y descendente (↓):

OrdenarDescripción
Creadas ↑/↓Orden de subida (predeterminado ↓)
Nombre ↑/↓Nombre de archivo alfabético
Altura ↑/↓Altura de la imagen en píxeles
Anchura ↑/↓Anchura de la imagen en píxeles
Tamaño ↑/↓Tamaño del archivo en disco
Anotaciones ↑/↓Recuento de anotaciones por imagen
Datasets grandes

Para conjuntos de datos de más de 100 000 imágenes, las opciones de ordenación por nombre, anchura, altura y tamaño se ocultan para mantener la galería fluida. Las opciones de ordenación por fecha de creación y recuento de anotaciones siguen estando disponibles.

Búsqueda de imágenes sin etiquetar

Usa el conjunto de filtros Annotations establecido en Unannotated para encontrar rápidamente las imágenes que aún necesitan anotación. Esto es especialmente útil para conjuntos de datos grandes donde deseas realizar un seguimiento del progreso del etiquetado.

Búsqueda de metadatos personalizados

El cuadro de búsqueda se encuentra a la derecha de la barra de herramientas de la galería y filtra todos los modos de vista: cuadrícula, compacto y tabla. Coincide con el nombre de archivo de la imagen (la extensión de archivo es opcional), así como con las claves de metadatos personalizados, los valores escalares y las entradas de matriz, de modo que una imagen llamada img_0042 que contenga {"ship_type": "yacht"} se encuentra buscando img_0042 o yacht.

Los valores anidados dentro de subobjetos no coinciden. Al pegar un ID de imagen de 24 caracteres, se busca esa imagen exacta directamente, omitiendo la búsqueda de texto.

Visor en pantalla completa#

Haz clic en cualquier imagen para abrir el visor en pantalla completa con:

  • Navegación: Teclas de flecha o vistas previas de miniaturas para navegar
  • Image information: Revisa las propiedades generadas por Platform, los metadatos personalizados y los metadatos de archivos incrustados como EXIF
  • Metadatos personalizados: Los propietarios y editores pueden añadir o reemplazar un objeto JSON, incluidos valores anidados de hasta 500.000 caracteres serializados y claves de nivel superior de hasta 128 caracteres
  • Anotaciones: Alternar la visibilidad de la superposición de anotaciones
  • Desglose por clase: Recuentos de etiquetas por clase con indicadores de color
  • Annotate: Cuando tienes acceso de edición, los controles de anotación se activan inmediatamente cuando el visor en pantalla completa se abre en el escritorio
  • Descargar: Descarga el archivo de imagen original
  • Eliminar: Elimina la imagen del dataset
  • Zoom: Cmd/Ctrl+Scroll, Cmd/Ctrl++ o Cmd/Ctrl+= para acercar, y Cmd/Ctrl+- para alejar
  • Reset view: Cmd/Ctrl + 0 o el botón de restablecer para ajustar la imagen al visor
  • Pan: Mantén presionado Space y arrastra para desplazar el lienzo al hacer zoom
  • Vista de píxeles: Alternar la renderización pixelada para una inspección detallada
  • Cortina de profundidad: En los conjuntos de datos de profundidad, un divisor deslizante permite alternar entre la imagen RGB y su mapa de profundidad colorizado.

Ultralytics Platform Datasets Fullscreen Viewer With Metadata Panel

Filtrar por división (Split)#

Filtrar imágenes por su división (split) del dataset:

SplitPropósito
EntrenarUtilizado para el entrenamiento del modelo
ValUtilizado para la validación durante el entrenamiento
ProbarUtilizado para la evaluación final

Agrupamiento (Clustering)#

El panel Clustering proyecta tu conjunto de datos en un diagrama de dispersión 2D interactivo donde las imágenes visualmente similares se sitúan muy cerca unas de otras. Úsalo para revelar conglomerados, detectar duplicados y valores atípicos, y examinar cómo se distribuyen las divisiones o clases en tus datos, todo sin salir de la galería. Ábrelo desde el icono del gráfico de dispersión en la barra de herramientas de la galería en cualquier página de conjunto de datos.

Ultralytics Platform Datasets Clustering Empty State

Ejecución del análisis#

Iniciar un análisis:

  1. Abre un dataset y haz clic en el icono de gráfico de dispersión en la barra de herramientas de la galería
  2. Haz clic en Analyze Dataset
  3. Espera a que finalice la barra de progreso: los resultados aparecen en el mismo panel

El análisis se ejecuta en segundo plano en dos etapas, Computing embeddings y Clustering, y puede tardar unos minutos dependiendo del tamaño de tu conjunto de datos. Puedes cerrar el panel o abandonar la página y volver más tarde.

Requisitos de análisis

Un conjunto de datos necesita al menos 20 y como máximo 200 000 imágenes sin errores para poder analizarse. Los conjuntos de datos conectados respaldados por almacenamiento en la nube o On Premise aún no son compatibles.

Visualización#

Una vez que se completa el análisis, el panel muestra una dispersión 2D de todas las imágenes analizadas con una leyenda y un contador de puntos. Los filtros de la galería (división, clase, etiquetadas/sin etiquetar) atenuan los puntos fuera del filtro para que puedas centrarte en el subconjunto que te interesa; el contador muestra entonces visible / total points.

Ultralytics Platform Datasets Clustering Scatter Plot

Colorear por#

Cambia cómo se sombrean los puntos de datos con el menú desplegable Color by en la barra de herramientas del panel. Cambia los modos de vista en cualquier momento; el gráfico cambia de color al instante para que puedas ver cómo se distribuyen las divisiones, clases o propiedades de las imágenes en tus conglomerados:

OpciónSombreado
SplitsTrain / Val / Test
ClasesPrimera clase de anotación en cada imagen
AnchuraAnchura de la imagen
AlturaAltura de la imagen
TamañoTamaño del archivo
AnotacionesNúmero de anotaciones por imagen

Ultralytics Platform Datasets Clustering Color Modes

Selección de lazo#

Dibuja una selección de forma libre alrededor de una región para resaltar puntos en el gráfico. La galería filtra las imágenes coincidentes para que puedas inspeccionarlas, volver a etiquetarlas, moverlas o eliminarlas utilizando las image operations habituales.

Borrar selección

Una etiqueta sobre el gráfico muestra cuántos puntos están seleccionados; haz clic en × para borrar el lazo y volver a la vista completa de la galería.

Tamaño de la selección

Un lazo selecciona como máximo 1000 imágenes. Si tu selección coincide con más, Platform muestra una muestra de 1000 y sugiere dibujar una región más pequeña.

Desplazamiento y Zoom#

Navega por gráficos de dispersión grandes directamente con el ratón y el teclado, o con los botones de zoom situados en la parte inferior izquierda del gráfico:

EntradaAcción
ScrollDesplazar el gráfico en 2D
Cmd/Ctrl+ScrollAcercar o alejar, anclado en el cursor
Mantener EspacioCambiar al modo de arrastrar para desplazar (drag-to-pan)
Botón de restablecimientoVolver a la extensión completa del gráfico

Re-análisis#

Si tu conjunto de datos cambia después del análisis (llegan nuevas imágenes o el recuento analizado ya no coincide con el conjunto de datos), aparece un botón Re-analyze en la parte superior del panel para los propietarios y editores.

Haz clic en Re-analyze para volver a calcular las incrustaciones y la proyección 2D desde cero.

Pestañas de Dataset#

Cada página de dataset puede mostrar hasta seis pestañas, dependiendo del estado del dataset y tus permisos:

Pestaña Imágenes#

La vista predeterminada que muestra la galería de imágenes con superposiciones de anotaciones. Admite modos de vista de cuadrícula, compacta y de tabla. Arrastra y suelta archivos aquí para añadir más imágenes.

Pestaña Clases#

Esta pestaña aparece cuando el conjunto de datos tiene imágenes y su tarea tiene clases.

Gestiona las clases de anotación de tu dataset:

  • Histograma de clases: Gráfico de barras que muestra el recuento de anotaciones por clase, ordenado por frecuencia, con un selector de escala lineal/logarítmica
  • Tabla de clases: Tabla ordenada y con función de búsqueda que incluye índice, nombre, recuento de anotaciones y recuento de imágenes
  • Editar nombres de clases: haz clic en cualquier nombre de clase para cambiarlo directamente
  • Editar colores de clases: haz clic en una muestra de color para cambiar el color de la clase
  • Añadir nueva clase: utiliza la entrada en la parte inferior para añadir clases
  • Fusionar clases: Selecciona dos o más filas y haz clic en Merge into one
  • Eliminar clases: Selecciona una o más filas y haz clic en Delete

Ultralytics Platform Datasets Classes Tab Histogram And Table

Escala logarítmica para datasets desequilibrados

Si tu conjunto de datos tiene desequilibrio de clases (por ejemplo, 10,000 anotaciones de "person" pero solo 50 de "bicycle"), usa el botón de alternancia Log Scale en el histograma de clases para visualizar todas las clases con claridad.

Fusionar clases#

La fusión consolida etiquetas duplicadas o superpuestas; por ejemplo, agrupa car, automobile y vehicle en una sola clase:

  1. Selecciona dos o más clases usando las casillas de verificación de las filas
  2. Haz clic en Merge into one en el encabezado de la tabla, o haz clic con el botón derecho en la selección
  3. Elige cuál de las clases seleccionadas es el destino en el que se fusionan las demás
  4. Confirmar

Cada anotación perteneciente a las clases de origen se reasigna a la clase de destino, y las clases de origen se eliminan. No se elimina ninguna anotación, por lo que el recuento total de anotaciones del conjunto de datos no cambia.

Eliminar clases#

  1. Selecciona una o más clases usando las casillas de verificación de las filas
  2. Haz clic en Delete en el encabezado de la tabla, o haz clic con el botón derecho en la selección
  3. Confirmar

Eliminar una clase borra dicha clase junto con todas sus anotaciones. En el caso de los conjuntos de datos de clasificación, las etiquetas se eliminan pero las imágenes permanecen y pasan a estar sin anotar.

Desplazamiento de los índices de clase

Los IDs de clase son posicionales. Fusionar o eliminar una clase desplaza todos los índices de clases superiores hacia abajo para cerrar el hueco, de modo que las exportaciones y los archivos de etiquetas escritos antes del cambio ya no coinciden con los nuevos índices. Crea una versión primero si necesitas la numeración anterior.

Muestreo de estadísticas

Los recuentos de clases se calculan a partir de un máximo de 100 000 imágenes. En conjuntos de datos más grandes, aparece una nota encima del histograma que dice "Basado en un subconjunto de 100 000 imágenes de este conjunto de datos."

Pestaña de gráficos#

Esta pestaña aparece cuando el dataset tiene imágenes.

Estadísticas automáticas calculadas a partir de tu dataset:

Los gráficos aparecen en este orden, y cada uno se omite cuando el conjunto de datos no tiene datos para él: un conjunto de datos de imágenes sin procesar no muestra gráficos de anotaciones, y Points per Instance solo aparece para datos de segmentación y postura:

GráficoDescripción
Distribución de las particionesGráfico de anillo con el recuento de imágenes de entrenamiento/validación/prueba y el porcentaje etiquetado
Clases principalesGráfico de rosca de las 10 clases de anotación más frecuentes, con el resto agrupadas como "Otros"
Dimensiones de la imagenHistograma de la distribución de la anchura y altura de la imagen (superpuesto) con la media
Tamaño del archivo de imagenHistograma de la distribución del tamaño de los archivos de imagen
Dimensiones de imagen 2DMapa de calor 2D de anchura frente a altura con líneas guía de relación de aspecto
Ubicaciones de las anotacionesMapa de calor 2D de las posiciones centrales de los BBox
Formatos de imagenDistribución de los formatos de imagen de origen (JPG, PNG, etc.)
Dimensiones del BBoxHistograma de la anchura y altura del BBox (superpuesto)
Objetos por imagenHistograma del recuento de anotaciones por imagen
Puntos por instanciaRecuento de vértices de polígono o puntos clave por anotación (segmento/pose)

Ultralytics Platform Datasets Charts Tab Statistics Grid

Almacenamiento en caché de estadísticas

La plataforma almacena en caché las estadísticas calculadas y las invalida cuando cambian las imágenes, las anotaciones, las clases o las divisiones. En conjuntos de datos de más de 100 000 imágenes, los gráficos se calculan a partir de un subconjunto de 100 000 imágenes, tal como se indica encima de la cuadrícula.

Mapas de calor a pantalla completa

Haz clic en el botón de expandir en cualquier mapa de calor para verlo en modo de pantalla completa. Esto proporciona una vista más grande y detallada, útil para comprender patrones espaciales en datasets grandes.

Pestaña de modelos#

Consulta todos los modelos entrenados en este dataset en una tabla con función de búsqueda:

ColumnaDescripción
NombreNombre del modelo con enlace
ProyectoProyecto principal con icono
VersiónVersión de dataset inmutable utilizada para el entrenamiento, si la hay
EstadoInsignia de estado de entrenamiento
TareaTipo de tarea YOLO
ÉpocasMejor época / épocas totales
mAP50-95Precisión media
mAP50mAP con IoU 0.50
CreadoFecha de creación

Ultralytics Platform Datasets Models Tab Trained Models Table

Pestaña de errores#

Esta pestaña solo aparece cuando uno o más archivos no se procesan correctamente.

Las imágenes que fallaron al procesarse se enumeran aquí con:

  • Banner de error: recuento total de imágenes fallidas y orientación
  • Tabla de errores: nombre del archivo, descripción del error fácil de entender, sugerencias de solución y miniatura de vista previa
  • Los errores comunes incluyen archivos corruptos, formatos no admitidos, imágenes demasiado pequeñas (mín. 28px) y modos de color no admitidos

Ultralytics Platform Datasets Errors Tab Processing Failures

Errores de procesamiento comunes
ErrorCausaSolución
No se puede leer el archivo de imagenFormato corrupto o no admitidoVuelve a exportar desde el editor de imágenes
Incompleto o corruptoEl archivo se truncó durante la transferenciaVuelve a descargar el archivo original
Formato de imagen no compatibleFormato que Platform no puede descodificarConvertir a JPG, PNG o WebP
Error de permisos de archivoEl archivo está bloqueado o protegido contra lecturaDesbloquear el archivo y volver a subirlo
Imagen demasiado pequeñaDimensión mínima inferior a 28pxUtiliza imágenes de origen con mayor resolución
Modo de color no admitidoModo de color CMYK o indexadoConvierte al modo RGB

Pestaña de versiones#

Crea instantáneas NDJSON inmutables de tu dataset para un entrenamiento reproducible. Cada versión captura los recuentos de imágenes, clases, anotaciones y el tamaño del archivo en el momento de la creación.

ColumnaDescripción
VersiónNúmero de versión (v1, v2, ...)
DescripciónDescripción proporcionada por el usuario (editable)
ImágenesRecuento de imágenes en el momento de la instantánea
ClasesRecuento de clases en el momento de la instantánea
AnotacionesRecuento de anotaciones en el momento de la instantánea
TamañoTamaño del archivo de exportación NDJSON
CreadoCuando se creó la versión
AccionesDescargar o restaurar

Para crear una versión:

  1. Abre la pestaña Versiones
  2. Opcionalmente introduce una descripción (por ejemplo, "Se añadieron 500 imágenes de entrenamiento" o "Se corrigieron clases mal etiquetadas")
  3. Haz clic en Nueva versión
  4. La nueva versión aparece en la tabla

Cada versión se numera secuencialmente (v1, v2, v3...) y es inmutable: las versiones no se pueden editar ni eliminar, solo se puede cambiar su descripción. Utiliza las acciones de fila para descargar o restaurar cualquier versión en cualquier momento.

Restauración de una versión

La restauración reemplaza las imágenes, divisiones, clases y anotaciones actuales del conjunto de datos con la instantánea seleccionada y no se puede deshacer a menos que guardes primero el estado actual como otra versión. El conjunto de datos se bloquea en el estado processing mientras se reconstruye. No se vuelve a subir nada durante una restauración, por lo que estas suelen ser rápidas incluso en conjuntos de datos grandes.

Guarda una versión mientras entrenas

Habilita Save Dataset Version en el Cloud Training dialog para vincular un modelo al conjunto de datos exacto utilizado para el entrenamiento. La plataforma reutiliza una versión coincidente cuando los contenidos del conjunto de datos no han cambiado y crea una nueva versión solo cuando lo han hecho.

Solo datasets preparados

La creación de versiones y la restauración están disponibles una vez que el conjunto de datos alcanza el estado ready. Las versiones no están disponibles para conjuntos de datos conectados en la nube o On Premise.

Cuándo crear versiones

Crea una versión antes y después de cambios importantes en tu dataset: añadir imágenes, corregir anotaciones o reequilibrar particiones. Esto te permite comparar el rendimiento del modelo en diferentes estados del dataset.

Tamaño del archivo NDJSON

El tamaño mostrado es el tamaño del archivo de exportación NDJSON, que contiene las URL de las imágenes y las anotaciones, no las imágenes en sí. Los datos de las imágenes reales se almacenan por separado y se accede a ellos mediante URL firmadas. El archivo de instantáneas sigue contando para tu cuota de almacenamiento del espacio de trabajo, por lo que la creación de versiones fallará si no te queda margen disponible.

Exportar dataset#

Exporta tu dataset para su uso sin conexión con una descarga NDJSON desde el encabezado del dataset o la pestaña Versiones.

Para exportar:

  1. Haz clic en el botón Descargar (icono de descarga) en el encabezado del dataset
  2. Descarga directamente la instantánea NDJSON actual
  3. Usa la pestaña Versiones cuando quieras una instantánea numerada inmutable que puedas volver a descargar más tarde

Ultralytics Platform Datasets Export Ndjson Download El formato NDJSON almacena un objeto JSON por línea. La primera línea contiene los metadatos del conjunto de datos, seguida de una línea por imagen:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

El objeto opcional a nivel de imagen metadata se conserva cuando se importa un archivo NDJSON a Platform. Puedes inspeccionarlo o editarlo desde el panel de información de pantalla completa de la imagen. Para cargas de archivos comprimidos mediante programación, la API de ingesta de datos de conjuntos de datos acepta el mapa de rutas equivalente imageMetadata.

Los conjuntos de datos de posturas también incluyen un campo kpt_shape en la línea de cabecera del conjunto de datos, deducido de las anotaciones cuando no está ya establecido.

Las exportaciones de profundidad declaran "task": "depth" y "depth_scale": 1000 en la línea del dataset. Cada línea de imagen incluye un depth.url para su PNG uint16 asociado. Ultralytics descarga las URLs de imagen y profundidad de manera concurrente y escribe un archivo YAML de entrenamiento con la misma escala, por lo que el archivo NDJSON se puede pasar directamente a model.train(data=...).

URLs firmadas

Las URL de las imágenes en el archivo NDJSON exportado están firmadas y son válidas durante 7 días. Platform reutiliza una exportación en caché durante un máximo de 6 días cuando el conjunto de datos no ha cambiado, por lo que una descarga reciente siempre tiene al menos un día de validez restante. Si necesitas nuevas URL antes, modifica el conjunto de datos o crea una nueva versión.

Conjuntos de datos On Premise

La exportación no está disponible para los conjuntos de datos On Premise, cuyos bytes de imagen nunca llegan a Platform.

Consulta la Ultralytics NDJSON format documentation para ver la especificación completa.

Operaciones con imágenes#

Acciones rápidas#

Haz clic derecho en cualquier imagen en la vista Cuadrícula o Compacta para acceder a acciones rápidas:

AcciónDescripción
Mover a divisiónReasigna la imagen a la división de entrenamiento (Train), validación (Val) o prueba (Test)
DescargaDescarga el archivo de imagen original
EliminarElimina la imagen del conjunto de datos

Ultralytics Platform Datasets Image Card Context Menu

Individual vs. en masa

El menú contextual de la imagen opera sobre una única imagen. Para operaciones en masa sobre varias imágenes, utiliza la vista Tabla con selección mediante casillas de verificación.

Mover a división en masa#

Reasigna las imágenes seleccionadas a una división diferente dentro del mismo conjunto de datos:

  1. Cambia a la vista Tabla
  2. Selecciona las imágenes usando las casillas de verificación
  3. Haz clic derecho para abrir el menú contextual
  4. Elige Move to split > Train, Validation o Test

También puedes arrastrar y soltar imágenes en las pestañas del filtro de división en la vista de cuadrícula. Si mover una imagen entrara en conflicto con una imagen idéntica que ya está en la división de destino, Platform preguntará si deseas omitir, conservar ambas o reemplazar.

Organización de divisiones de entrenamiento/validación

Sube todas las imágenes a un conjunto de datos y luego usa el movimiento en masa a división para organizar los subconjuntos en divisiones de entrenamiento, validación y prueba.

Redistribución de divisiones#

Redistribuye todas las imágenes entre las divisiones de entrenamiento, validación y prueba usando proporciones personalizadas:

  1. Haz clic en la barra de división en la barra de herramientas del conjunto de datos para abrir el cuadro de diálogo Redistribuir divisiones
  2. Ajusta los porcentajes de división usando cualquiera de los métodos siguientes
  3. Revisa la vista previa del conteo de imágenes en directo para confirmar la distribución
  4. Haz clic en Aplicar para reasignar aleatoriamente todas las imágenes según tus porcentajes

Ultralytics Platform Datasets Split Redistribution Dialog El cuadro de diálogo ofrece tres formas de establecer tus proporciones de división objetivo:

MétodoDescripción
ArrastrarArrastra los controles entre los segmentos de color para ajustar visualmente los límites de las divisiones
EscribirEdita el porcentaje introducido para cualquier división (las otras dos divisiones se reequilibran automáticamente de forma proporcional)
AutoUn clic para establecer instantáneamente una división 80/20 de entrenamiento/validación con la división de prueba establecida en 0%

Una vista previa en directo muestra exactamente cuántas imágenes terminarán en cada división antes de que apliques los cambios.

División rápida 80/20

Haz clic en el botón Auto para establecer instantáneamente la división recomendada 80/20 de entrenamiento/validación. Esta es la proporción más común para el entrenamiento.

Eliminación en masa#

Elimina varias imágenes a la vez:

  1. Selecciona las imágenes en la vista de tabla
  2. Haz clic con el botón derecho y elige Delete, o pulsa Cmd/Ctrl+Delete
  3. Confirma la eliminación

URI del conjunto de datos#

Haz referencia a los conjuntos de datos de Platform utilizando el formato de URI ul:// (consulta Using Platform Datasets):

ul://username/datasets/dataset-slug

También puedes pegar directamente la URL web de un conjunto de datos o modelo (por ejemplo, https://platform.ultralytics.com/username/datasets/dataset-slug); se reescribe automáticamente a la URI de ul://. Pasar una lista de conjuntos de datos afina un modelo base en cada uno de ellos en serie, por ejemplo, model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Usa este URI para entrenar modelos desde cualquier lugar:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Entrena en cualquier lugar con datos de la Platform

La URI de ul:// funciona desde cualquier entorno:

  • Máquina local: Entrena en tu hardware, los datos se descargan automáticamente
  • Google Colab: Accede a tus conjuntos de datos de la Platform en notebooks
  • Servidores remotos: Entrena en máquinas virtuales en la nube con acceso total al conjunto de datos

Licencias disponibles#

La Platform admite las siguientes licencias para conjuntos de datos:

LicenciaTipo
NingunaNo se ha seleccionado ninguna licencia
CC0-1.0Dominio público
PDM-1.0Dominio público
CC-BY-2.5Permisiva
CC-BY-4.0Permisiva
CC-BY-NC-2.0No comercial
CC-BY-SA-4.0Copyleft
CC-BY-NC-4.0No comercial
CC-BY-NC-SA-3.0Copyleft
CC-BY-NC-SA-4.0Copyleft
CC-BY-ND-4.0Sin derivados
CC-BY-NC-ND-4.0No comercial
Apache-2.0Permisiva
MITPermisiva
AGPL-3.0Copyleft
GPL-3.0Copyleft
Solo investigaciónRestringida
OtroPersonalizada
Licencias Copyleft

Al clonar un conjunto de datos con una licencia copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), el clon hereda la licencia y el selector de licencias queda bloqueado.

Configuración de visibilidad#

Controla quién puede ver tu conjunto de datos:

ConfiguraciónDescripción
PrivadoTú y los miembros del espacio de trabajo autorizados podéis acceder
PúblicoCualquier persona puede ver el contenido, incluso desde la página Explorar

La visibilidad se configura al crear un conjunto de datos en el diálogo New Dataset utilizando un interruptor de alternancia. Los conjuntos de datos públicos son visibles en la página Explore.

Editar conjunto de datos#

Los metadatos del conjunto de datos se editan en línea directamente en la página del conjunto de datos; no hace falta cuadro de diálogo:

  • Nombre: Haz clic en el nombre del conjunto de datos para editarlo. Los cambios se guardan automáticamente al perder el foco o pulsar Enter. Los nombres tienen un límite de 100 caracteres.
  • Descripción: Haz clic en la descripción (o en el texto provisional "Añade una descripción...") para editarla. Los cambios se guardan automáticamente. Las descripciones tienen un límite de 1.000 caracteres.
  • Tipo de tarea: Haz clic en la insignia de tarea para seleccionar un tipo de tarea diferente.
  • Licencia: Haz clic en el selector de licencia para cambiar la licencia del conjunto de datos.
  • Icono: Haz clic en el icono del conjunto de datos para subir tu propia imagen, promover una de las imágenes del propio conjunto de datos como icono, o elegir una letra y un color.
Cambiar tipo de tarea

Cada imagen almacena juntas las anotaciones de todos los tipos de tarea. Cambiar el tipo de tarea del conjunto de datos controla qué anotaciones son visibles en el editor y se incluyen en las exportaciones y el entrenamiento. Las anotaciones para otros tipos de tarea se conservan en la base de datos y reaparecen cuando vuelves a cambiar. Depth es la excepción: su verdad de terreno es un archivo emparejado en lugar de una anotación, por lo que un conjunto de datos solo puede cambiar a profundidad o desde ella mientras no contenga imágenes; en su lugar, vuelve a importarlo.

Metadatos personalizados#

Abre Más acciones y selecciona Información para revisar dos secciones:

  • Ultralytics Metadata: Detalles de Platform de solo lectura como el ID del conjunto de datos, propietario, tarea, recuento de imágenes y anotaciones, región de almacenamiento y marcas de tiempo
  • Metadatos personalizados: Tu propio objeto JSON para procedencia, condiciones de captura, IDs de clientes, gobernanza u otros datos contextuales

Los espectadores del espacio de trabajo pueden inspeccionar los metadatos, mientras que los miembros con acceso de edición pueden reemplazar el objeto de metadatos personalizados. El objeto de metadatos serializado está limitado a 500.000 caracteres, y cada clave de nivel superior está limitada a 128 caracteres. Guarda un objeto vacío ({}) para borrar los metadatos personalizados.

Clonar dataset#

Al visualizar un conjunto de datos público que no te pertenece, haz clic en Clone Dataset para abrir el cuadro de diálogo de clonación. Revisa el espacio de trabajo de destino, el nombre, la visibilidad y la licencia, y luego confirma la clonación. La copia incluye todas las imágenes, anotaciones y definiciones de clases. Los conjuntos de datos de origen públicos siguen siendo públicos de forma predeterminada en los espacios de trabajo cuya visibilidad predeterminada es pública; los clones de espacios de trabajo Enterprise se establecen como privados de forma predeterminada. Si el conjunto de datos original tiene una licencia copyleft, el clon la hereda y el selector de licencias queda bloqueado.

El identificador de destino se renombra automáticamente si ya está en uso, y la clonación requiere suficiente cuota de almacenamiento restante para albergar la copia.

Conjuntos de datos conectados

Los conjuntos de datos respaldados por fuentes de almacenamiento en la nube u On Premise no se pueden clonar, porque Platform no almacena sus bytes de imagen.

Marcar como favorito y compartir#

  • Marcar como favorito: Haz clic en el botón de estrella para marcar un conjunto de datos. El recuento de favoritos es visible para todos los usuarios.
  • Compartir: Para los conjuntos de datos públicos, haz clic en el botón de compartir para copiar un enlace, obtener un fragmento para insertar o compartir en plataformas sociales.

Eliminar dataset#

Eliminar un conjunto de datos que ya no necesites:

  1. Abre Más acciones (el botón ) en la cabecera del conjunto de datos
  2. Elige Eliminar conjunto de datos
  3. Confirma en el cuadro de diálogo: "Esto moverá [name] a la papelera. Puedes restaurarlo en un plazo de 30 días."

El mismo menú contiene Información, que abre el cuadro de diálogo de metadatos descrito en Metadatos personalizados, y Actualizar, que vuelve a leer el conjunto de datos desde el servidor.

Papelera y restauración

Los conjuntos de datos eliminados se mueven a la Papelera, no se eliminan permanentemente. Puedes restaurarlos dentro de los 30 días desde Settings > Trash.

Entrenar con un conjunto de datos#

Empieza el entrenamiento directamente desde tu conjunto de datos:

  1. Haz clic en New Model en la página del conjunto de datos
  2. Selecciona un proyecto o crea uno nuevo
  3. Configura los parámetros de entrenamiento
  4. Inicia el entrenamiento
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Consulta Cloud Training para obtener más detalles.

FAQ#

  • Tus datos se procesan y almacenan en la región que hayas seleccionado (EE. UU., UE o AP). Las imágenes son:

    1. Validadas por formato y tamaño
    2. Rechazadas si la dimensión mínima es inferior a 28px
    3. Normalizadas si son mayores de 4096px (preservando la relación de aspecto; codificadas para un almacenamiento optimizado)
    4. Se almacena con deduplicación, por lo que las imágenes idénticas se conservan una sola vez
    5. Miniaturas generadas en formato WebP de 256px para una navegación rápida
  • Ultralytics Platform gestiona el almacenamiento de forma eficiente:

    • Deduplicación: Las imágenes idénticas en la misma región de datos se almacenan una sola vez
    • Integridad: Las subidas se verifican para garantizar la integridad de los datos
    • Eficiencia: Los clones reutilizan las imágenes almacenadas en lugar de copiarlas, a la vez que siguen descontando de la cuota de almacenamiento del espacio de trabajo de destino
    • Regional: Los datos permanecen en la región que hayas seleccionado (EE. UU., UE o AP)
  • Sí. Arrastra archivos a la galería del conjunto de datos o haz clic en el icono de carga en la cabecera de la página, que abre directamente el selector de archivos nativo de tu navegador. Las nuevas estadísticas se calculan automáticamente después del procesamiento.

  • Utiliza la función de mover a división en bloque:

    1. Selecciona las imágenes en la vista de tabla
    2. Haz clic derecho y selecciona Move to split
    3. Selecciona la división de destino (Train, Validation o Test)
  • Ultralytics Platform admite etiquetas YOLO, COCO JSON, Ultralytics NDJSON y subidas de imágenes sin procesar. Las etiquetas XML de Pascal VOC se detectan pero no se importan:

    Un archivo .txt por imagen con coordenadas normalizadas (rango de 0 a 1):

    TareaFormatoEjemplo
    Detectarclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentarclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Poseclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    ClasificarEstructura de directoriostrain/cats/, train/dogs/

    Flags de visibilidad de pose: 0=no etiquetado, 1=etiquetado pero ocluido, 2=etiquetado y visible.

  • Sí. Cada imagen almacena juntas las anotaciones de los 6 tipos de tareas de anotación (detect, segment, semantic, classify, pose, OBB). Puedes cambiar el tipo de tarea activo del conjunto de datos en cualquier momento sin perder las anotaciones existentes. Solo se muestran en el editor y se incluyen en las exportaciones y el entrenamiento las anotaciones que coinciden con el tipo de tarea activo; las anotaciones para otras tareas se conservan y reaparecen cuando vuelves a cambiar.

  • Sí:

    LímiteValor
    Clases por conjunto de datos25,000
    Anotaciones por imagen10,000
    Coordenadas por anotación10,000
    Nombre del conjunto de datos100 caracteres
    Descripción del conjunto de datos1.000 caracteres
    Metadatos personalizados500.000 caracteres serializados
    Clave de nivel superior de metadatos128 caracteres
  • Los conjuntos de datos que leen desde fuentes de almacenamiento en la nube u On Premise mantienen sus píxeles fuera de Platform, por lo que las funciones que necesitan copias de los bytes de imagen propiedad de Platform no están disponibles:

    CaracterísticaConectado a la nubeOn Premise
    Anotación inteligenteNo disponibleNo disponible
    Análisis de agrupamientoNo disponibleNo disponible
    ClonaciónNo disponibleNo disponible
    Instantáneas de versionesNo disponibleNo disponible
    Exportación NDJSONDisponibleNo disponible

    La exploración, la anotación manual, la gestión de clases, las divisiones, las estadísticas y el entrenamiento funcionan con normalidad.

Comentarios