Ultralytics YOLO27:

Conjuntos de datos#

Los conjuntos de datos de Ultralytics Platform ofrecen una solución optimizada para gestionar tus datos de entrenamiento. Tras la carga, la plataforma procesa automáticamente las imágenes, las etiquetas y las estadísticas.

Un conjunto de datos está listo para entrenar cuando el procesamiento ha terminado, contiene al menos una imagen en la partición train, al menos una imagen en una de las particiones val o test, y al menos una imagen etiquetada. El encabezado del conjunto de datos muestra una insignia Ready cuando se cumplen las tres condiciones, y una insignia Not Ready en caso contrario; haz clic en la insignia para ver exactamente qué condición falta.

Recopila imágenes con agentes#

Utiliza Agents para añadir imágenes a un conjunto de datos cuando la detección de un modelo cumple una condición, como una confianza dentro de un intervalo elegido. Conecta la condición a un bloque Dataset y selecciona un destino que puedas editar. Las imágenes llegan sin etiquetar en la división train; las copias existentes se omiten. Revisa y etiqueta las imágenes con el editor de anotaciones existente.

Cargar conjunto de datos#

Ultralytics Platform admite varios formatos de carga para ofrecer flexibilidad.

¿Ya tienes datos en otro sitio?

Si ya tienes conjuntos de datos en Roboflow, usa Integrations para importarlos directamente, sin necesidad de exportarlos ni volver a cargarlos manualmente. Los datos de Google Cloud Storage, Amazon S3 o Azure Blob Storage se pueden usar directamente mediante Cloud storage. Los espacios de trabajo Enterprise pueden usar On Premise para indexar y entrenar con datos locales sin enviar píxeles a Platform.

Formatos compatibles#

FormatoExtensionesNotasTamaño máximo
JPEG.jpg, .jpegEl más común y recomendado50 MB
PNG.pngAdmite transparencia50 MB
WebP.webpModerno, con buena compresión50 MB
BMP.bmpSin compresión50 MB
TIFF.tiff, .tifAlta calidad50 MB
HEIC.heicFotos de iPhone50 MB
AVIF.avifFormato de nueva generación50 MB
JP2.jp2JPEG 200050 MB
DNG.dngCámara en bruto50 MB
MPO.mpoObjeto con varias imágenes50 MB

Compatibilidad con códecs de vídeo#

La extensión del archivo por sí sola no basta: un vídeo puede seguir fallando si su códec no se puede decodificar durante el procesamiento.

Usa H.264 MP4

El vídeo H.264 en un contenedor MP4 ofrece la compatibilidad más amplia con decodificadores y es la opción más segura. Si un vídeo no se procesa, vuelve a codificarlo con FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Preparar tu conjunto de datos#

La plataforma es compatible con Ultralytics YOLO, COCO, máscaras PNG semánticas, conjuntos de datos de profundidad, Ultralytics NDJSON y cargas sin procesar (sin anotar):

Usa la estructura de directorios estándar de YOLO con un archivo data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

El archivo YAML define la configuración de tu conjunto de datos:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Cargas en bruto

En bruto: carga imágenes sin anotaciones (sin etiquetas). Resulta útil si tienes previsto anotarlas directamente en la plataforma mediante el editor de anotaciones.

Estructura de directorio plana

También puedes cargar imágenes sin carpetas de partición explícitas. Platform respeta el destino de partición activo durante la carga. Si no se establece ningún destino de partición y la carga deja val vacío, o con menos de dos mapas emparejados en el caso de profundidad, los conjuntos de datos que no son de clasificación mueven automáticamente las imágenes de entrenamiento a val para que el conjunto de datos se pueda entrenar de inmediato. Los conjuntos de datos de clasificación se omiten porque utilizan particiones basadas en directorios. Siempre puedes reasignar las imágenes más adelante con bulk move-to-split o split redistribution.

Detección automática del formato

El formato se detecta automáticamente: los conjuntos de datos con un data.yaml que contenga las claves names, train o val se tratan como YOLO. Los conjuntos de datos con archivos JSON de COCO (que contengan las matrices images, annotations y categories) se tratan como COCO. Las exportaciones .ndjson se importan como Ultralytics NDJSON. Los conjuntos de datos que solo contienen imágenes y ninguna anotación se tratan como datos en bruto.

Cuando un archivo comprimido contiene varios archivos YAML, Platform da preferencia a los nombres estándar (data.yaml, data.yml, dataset.yaml, dataset.yml) que estén más cerca de la raíz del archivo. Mantén un único YAML con un nombre claro por archivo comprimido para evitar ambigüedades.

Pascal VOC XML no se importa

Los archivos de etiquetas en formato Pascal VOC XML se detectan, pero sus anotaciones no se importan; las imágenes se cargan sin anotaciones. Platform te avisa antes de que comience la carga ("Pascal VOC labels detected"). Convierte primero el XML de VOC a YOLO o COCO; consulta las herramientas de conversión de formatos.

Si las etiquetas hacen referencia a ID de clase, pero no se proporcionan nombres de clase, Platform genera nombres de marcador de posición densos (class0, class1, …) que puedes cambiar más adelante en la pestaña Classes.

Para obtener información específica de cada tarea sobre los formatos, consulta las tareas compatibles y la descripción general de los conjuntos de datos.

Proceso de carga#

Para crear un conjunto de datos:

  1. Ve a Annotate en la barra lateral
  2. Haz clic en New Dataset
  3. Elige una pestaña de origen de datos (consulta Data Sources más abajo)
  4. Añade un nombre; el slug de URL se obtiene automáticamente y se puede editar; y, opcionalmente, una descripción
  5. Selecciona el tipo de tarea (consulta las tareas compatibles), una licencia opcional (consulta las licencias disponibles) y la visibilidad (público o privado)
  6. Haz clic en Create & Upload para archivos locales, en Create & Import para una URL o un origen conectado, o en Create Dataset para empezar desde cero

Ultralytics Platform Datasets Upload Dialog Task Selector

Para añadir archivos a un conjunto de datos existente, abre la página del conjunto de datos y arrastra los archivos a la galería o haz clic en el icono de carga en la cabecera de la página. El icono de carga abre el selector de archivos nativo de tu navegador directamente porque la tarea del conjunto de datos ya está definida.

Fuentes de datos#

El cuadro de diálogo New Dataset ofrece cuatro orígenes:

OrigenDescripción
CargarArrastra archivos o búscalos; se admiten imágenes, vídeos, archivos comprimidos o NDJSON
URLPega un enlace directo a un archivo .zip, .tar, .tar.gz, .tgz o .ndjson; Platform lo descarga y lo incorpora en el servidor
NubeUsa datos directamente desde Google Cloud Storage, Amazon S3 o Azure Blob Storage (Pro y Enterprise)
On PremiseIndexa y entrena con datos que nunca salen de tus propios equipos mediante trabajadores de On Premise (Enterprise)
Límites de importación mediante URL

La importación mediante URL está limitada tanto por el límite de tu plan por carga (10 GB Free / 20 GB Pro / 50 GB Enterprise) como por la cuota de almacenamiento restante, aplicándose el menor de los dos. El enlace debe ser accesible públicamente mediante HTTP o HTTPS y terminar en una extensión compatible.

Antes de que empiece la carga#

Platform valida tus archivos en el navegador antes de cargar nada, por lo que los problemas habituales aparecen de inmediato en lugar de hacerlo después de una transferencia larga. Los archivos comprimidos se comprueban para detectar corrupción, estar vacíos, tener protección mediante contraseña y contener errores de sintaxis YAML; además, los archivos demasiado grandes se muestran por nombre.

A continuación pueden aparecer dos cuadros de diálogo:

Cuando el archivo comprimido declara nombres de clase y tu conjunto de datos ya tiene clases, el cuadro de diálogo Map imported classes muestra una fila por cada clase entrante. Para cada una, elige una clase existente con la que fusionarla, crea una clase nueva u omítela. Las coincidencias exactas de nombres se seleccionan previamente, y las clases omitidas y sus anotaciones no se importan.

Después de subir los datos, la plataforma los procesa automáticamente:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Validación: Comprobaciones de formato y tamaño
  2. Normalización: Las imágenes grandes se redimensionan (máx. 4096 px, dimensión mínima de 28 px), la escala de grises se amplía a RGB, la transparencia se aplana sobre blanco y se aplica la orientación EXIF
  3. Miniaturas: Se generan previsualizaciones WebP de 256 px
  4. Análisis de etiquetas: Se extraen las etiquetas de YOLO, COCO y NDJSON
  5. Estadísticas: Se calculan las distribuciones de clases y las dimensiones de las imágenes
Codificación de imágenes almacenadas

Los originales AVIF y WebP se almacenan byte a byte cuando no es necesario redimensionarlos ni cambiarles el color. Todo lo demás se vuelve a codificar: las fuentes WebP siguen siendo WebP y todos los demás formatos (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) se convierten a JPEG con calidad 92. El nombre de archivo original y la extensión de origen se conservan como metadatos.

Barra de progreso de carga de conjuntos de datos de Ultralytics Platform

Validar antes de cargar

Puedes validar tu conjunto de datos localmente antes de cargarlo:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Requisitos de tamaño de las imágenes

Las imágenes deben tener al menos 28 px en su lado más corto. Las imágenes más pequeñas se rechazan durante el procesamiento. Las imágenes de más de 4096 px en su lado más largo se redimensionan automáticamente conservando la relación de aspecto.

Explorar imágenes#

Visualiza las imágenes de tu conjunto de datos en varios diseños.

Abre el panel de Clustering desde la barra de herramientas de la galería para explorar tu conjunto de datos como un diagrama de dispersión 2D interactivo.

VistaDescripción
CuadrículaCuadrícula de miniaturas con superposiciones de anotaciones (predeterminada)
CompactaMiniaturas más pequeñas para realizar un escaneo rápido
TablaLista con miniatura, nombre de archivo, dimensiones, tamaño, división, clases y recuentos de etiquetas

Vista de cuadrícula de la galería de conjuntos de datos de Ultralytics Platform con anotaciones

Ordenación y filtrado#

Las imágenes se pueden ordenar y filtrar para explorarlas de forma eficiente:

Cada opción alterna entre orden ascendente (↑) y descendente (↓):

OrdenarDescripción
Creación ↑/↓Orden de carga (predeterminado ↓)
Nombre ↑/↓Nombre de archivo alfabético
Altura ↑/↓Altura de la imagen en píxeles
Anchura ↑/↓Anchura de la imagen en píxeles
Tamaño ↑/↓Tamaño del archivo en disco
Anotaciones ↑/↓Recuento de anotaciones por imagen
Conjuntos de datos grandes

Para conjuntos de datos de más de 100 000 imágenes, las ordenaciones por nombre, anchura, altura y tamaño se ocultan para mantener la capacidad de respuesta de la galería. Las ordenaciones por fecha de creación y recuento de anotaciones siguen disponibles.

Buscar imágenes sin etiquetar

Usa el filtro Annotations establecido en Unannotated para encontrar rápidamente las imágenes que aún necesitan anotaciones. Esto resulta especialmente útil para conjuntos de datos grandes en los que quieres controlar el progreso del etiquetado.

Buscar metadatos personalizados

El cuadro de búsqueda se encuentra a la derecha de la barra de herramientas de la galería y filtra todos los modos de vista: cuadrícula, compacta y tabla. Coincide con el nombre de archivo de la imagen (la extensión del archivo es opcional), así como con las claves de metadatos personalizados, los valores escalares y las entradas de matrices, por lo que una imagen llamada img_0042 que contenga {"ship_type": "yacht"} se encuentra buscando img_0042 o yacht.

Los valores anidados dentro de subobjetos no coinciden. Si pegas un ID de imagen de 24 caracteres, se busca directamente esa imagen exacta, sin pasar por la búsqueda de texto.

Visor a pantalla completa#

Haz clic en cualquier imagen para abrir el visor a pantalla completa, que ofrece:

  • Navegación: Usa las teclas de dirección o las previsualizaciones de miniaturas para explorar
  • Información de la imagen: Revisa las propiedades generadas por Platform, los metadatos personalizados y los metadatos incrustados en el archivo, como EXIF
  • Metadatos personalizados: Los propietarios y editores pueden añadir o sustituir un objeto JSON, incluidos valores anidados de hasta 500 000 caracteres serializados y claves de nivel superior de hasta 128 caracteres
  • Anotaciones: Activa o desactiva la visibilidad de la superposición de anotaciones
  • Desglose por clases: Recuentos de etiquetas por clase con indicadores de color
  • Anotar: Cuando tienes acceso de edición, los controles de anotación se activan inmediatamente al abrir el visor a pantalla completa en el escritorio
  • Descargar: Descarga el archivo de imagen original
  • Eliminar: Elimina la imagen del conjunto de datos
  • Zoom: Usa Cmd/Ctrl+Scroll, Cmd/Ctrl++ o Cmd/Ctrl+= para ampliar y Cmd/Ctrl+- para reducir
  • Restablecer vista: Usa Cmd/Ctrl + 0 o el botón de restablecimiento para ajustar la imagen al visor
  • Desplazar: Mantén pulsado Space y arrastra para desplazar el lienzo cuando hayas ampliado la imagen
  • Vista de píxeles: Activa o desactiva el renderizado pixelado para una inspección detallada
  • Cortina de profundidad: En los conjuntos de datos de profundidad, un divisor arrastrable alterna entre la imagen RGB y su mapa de profundidad coloreado

Visor a pantalla completa de conjuntos de datos de Ultralytics Platform con panel de metadatos

Filtrar por división#

Filtra las imágenes por su división del conjunto de datos:

SubconjuntoFinalidad
EntrenarSe utiliza para entrenar el modelo
ValSe utiliza para la validación durante el entrenamiento
TestSe utiliza para la evaluación final

Clustering#

El panel Clustering proyecta tu conjunto de datos en un diagrama de dispersión 2D interactivo donde las imágenes visualmente similares aparecen próximas entre sí. Úsalo para descubrir grupos, detectar duplicados y valores atípicos, y analizar cómo se distribuyen las divisiones o las clases en tus datos, sin salir de la galería. Ábrelo desde el icono del gráfico de dispersión de la barra de herramientas de la galería en cualquier página de conjunto de datos.

Estado vacío del clustering de conjuntos de datos de Ultralytics Platform

Ejecutar análisis#

Inicia un análisis:

  1. Abre un conjunto de datos y haz clic en el icono del gráfico de dispersión de la barra de herramientas de la galería
  2. Haz clic en Analyze Dataset
  3. Espera a que termine la barra de progreso: los resultados aparecen en el mismo panel

El análisis se ejecuta en segundo plano en dos fases, Computing embeddings y Clustering, y puede tardar unos minutos según el tamaño de tu conjunto de datos. Puedes cerrar el panel o abandonar la página y volver más tarde.

Requisitos del análisis

Un conjunto de datos necesita al menos 20 y como máximo 200 000 imágenes sin errores para poder analizarse. Los conjuntos de datos conectados respaldados por almacenamiento en la nube o On Premise todavía no son compatibles.

Visualización#

Cuando termina el análisis, el panel muestra un diagrama de dispersión 2D de todas las imágenes analizadas, con una leyenda y un contador de puntos. Los filtros de la galería (división, clase, etiquetadas/sin etiquetar) atenuan los puntos que quedan fuera del filtro para que puedas centrarte en el subconjunto que te interesa; el contador muestra entonces visible / total points.

Diagrama de dispersión de agrupación de conjuntos de datos de Ultralytics Platform

Colorear por#

Cambia cómo se sombrean los puntos de datos con el desplegable Color by de la barra de herramientas del panel. Cambia de modo de visualización en cualquier momento: el gráfico cambia de color al instante para que puedas ver cómo se distribuyen las particiones, las clases o las propiedades de las imágenes entre tus clústeres:

OpciónSombreado
ParticionesEntrenamiento / Validación / Prueba
ClasesPrimera clase de anotación de cada imagen
AnchuraAnchura de la imagen
AlturaAltura de la imagen
TamañoTamaño del archivo
AnotacionesNúmero de anotaciones por imagen

Modos de color de agrupación de conjuntos de datos de Ultralytics Platform

Selección con lazo#

Dibuja una selección de forma libre alrededor de una región para resaltar puntos en el gráfico. La galería se filtra para mostrar las imágenes coincidentes, de modo que puedas inspeccionarlas, volver a etiquetarlas, moverlas o eliminarlas mediante las operaciones habituales con imágenes.

Borrar selección

Un indicador situado sobre el gráfico muestra cuántos puntos están seleccionados; haz clic en × para borrar el lazo y volver a la vista completa de la galería.

Tamaño de la selección

Un lazo resuelve como máximo 1.000 imágenes. Si tu selección coincide con más imágenes, Platform muestra una muestra de 1.000 y sugiere dibujar una región más pequeña.

Desplazamiento y zoom#

Navega por gráficos de dispersión grandes directamente con el ratón y el teclado, o con los botones de zoom situados en la esquina inferior izquierda del gráfico:

EntradaAcción
DesplazamientoDesplaza el gráfico en 2D
Cmd/Ctrl+DesplazamientoAcerca o aleja la vista tomando el cursor como anclaje
Mantener pulsada la barra espaciadoraCambia al modo de desplazamiento mediante arrastre
Botón RestablecerVuelve a la extensión completa del gráfico

Volver a analizar#

Si tu conjunto de datos cambia después del análisis —llegan imágenes nuevas o el número analizado ya no coincide con el conjunto de datos—, aparece un botón Re-analyze en la parte superior del panel para propietarios y editores.

Haz clic en Re-analyze para volver a calcular las incrustaciones y la proyección 2D desde cero.

Buscar imágenes similares#

Los mismos incrustados impulsan la búsqueda de similitud en conjuntos de datos públicos. En un conjunto de datos que puedas editar, haz clic con el botón derecho en una imagen en la vista Cuadrícula o Compacta (o en una sola fila seleccionada en la vista de Tabla) y elige Buscar imágenes similares. El cuadro de diálogo muestra hasta 24 de las imágenes públicas más cercanas con su conjunto de datos de origen, licencia y puntuación de similitud, excluyendo las imágenes que tu conjunto de datos ya contiene y copias de la imagen seleccionada en otros conjuntos de datos. Selecciona las que quieras y haz clic en Añadir al conjunto de datos: se añaden a la partición train como imágenes sin etiquetar, se contabilizan en tu almacenamiento y están listas para la anotación.

Una imagen sin un incrustado —en un conjunto de datos aún no analizado, o añadido desde el último análisis— muestra Analyze this dataset in Clustering to find similar images. El cuadro de diálogo no está disponible en conjuntos de datos conectados. Los diagnósticos de validación por imagen de un modelo ejecutan la misma búsqueda a partir de sus imágenes con peor rendimiento.

Pestañas del conjunto de datos#

Cada página de conjunto de datos puede mostrar hasta seis pestañas, en función del estado del conjunto de datos y de tus permisos:

Pestaña Imágenes#

Vista predeterminada que muestra la galería de imágenes con superposiciones de anotaciones. Admite los modos de vista de cuadrícula, compacta y tabla. Arrastra y suelta archivos aquí para añadir más imágenes.

Pestaña Clases#

Esta pestaña aparece cuando el conjunto de datos contiene imágenes y su tarea tiene clases.

Gestiona las clases de anotación de tu conjunto de datos:

  • Histograma de clases: gráfico de barras que muestra el número de anotaciones por clase, ordenado por frecuencia, con un selector de escala lineal/logarítmica
  • Tabla de clases: tabla ordenable y con búsqueda que incluye el índice, el nombre, el número de anotaciones y el número de imágenes
  • Editar nombres de clase: haz clic en cualquier nombre de clase para cambiarlo directamente
  • Editar colores de clase: haz clic en una muestra de color para cambiar el color de la clase
  • Añadir una clase nueva: utiliza el campo de entrada de la parte inferior para añadir clases
  • Fusionar clases: selecciona dos o más filas y haz clic en Merge into one
  • Eliminar clases: selecciona una o más filas y haz clic en Delete

Histograma y tabla de la pestaña Clases de conjuntos de datos de Ultralytics Platform

Escala logarítmica para conjuntos de datos desequilibrados

Si tu conjunto de datos presenta un desequilibrio entre clases (por ejemplo, 10.000 anotaciones de «person» y solo 50 de «bicycle»), utiliza el selector Log Scale del histograma de clases para visualizar todas las clases con claridad.

Fusionar clases#

La fusión consolida etiquetas duplicadas o superpuestas; por ejemplo, combina car, automobile y vehicle en una sola clase:

  1. Selecciona dos o más clases mediante las casillas de verificación de las filas
  2. Haz clic en Merge into one en el encabezado de la tabla o haz clic con el botón derecho en la selección
  3. Elige cuál de las clases seleccionadas será la clase de destino en la que se fusionarán las demás
  4. Confirma

Cada anotación perteneciente a las clases de origen se reasigna a la clase de destino y las clases de origen se eliminan. No se elimina ninguna anotación, por lo que el número total de anotaciones del conjunto de datos no cambia.

Eliminar clases#

  1. Selecciona una o más clases mediante las casillas de verificación de las filas
  2. Haz clic en Delete en el encabezado de la tabla o haz clic con el botón derecho en la selección
  3. Confirma

Eliminar una clase elimina la clase y todas sus anotaciones. En los conjuntos de datos de clasificación se eliminan las etiquetas, pero las imágenes permanecen y pasan a estar sin anotar.

Cambio de los índices de clase

Los ID de clase son posicionales. Al fusionar o eliminar una clase, todos los índices de clase superiores se desplazan hacia abajo para cerrar el hueco, por lo que las exportaciones y los archivos de etiquetas escritos antes del cambio dejan de corresponderse con los nuevos índices. Crea primero una versión si necesitas conservar la numeración anterior.

Muestreo de estadísticas

Los recuentos de clases se calculan a partir de un máximo de 100.000 imágenes. En conjuntos de datos más grandes, encima del histograma aparece la nota «Basado en un subconjunto de 100.000 imágenes de este conjunto de datos.»

Pestaña Gráficos#

Esta pestaña aparece cuando el conjunto de datos contiene imágenes.

Estadísticas automáticas calculadas a partir de tu conjunto de datos:

Los gráficos aparecen en este orden y cada uno se omite cuando el conjunto de datos no contiene datos para él: un conjunto de datos de imágenes sin procesar no muestra gráficos de anotaciones, y Points per Instance solo aparece para datos de segmentación y pose:

GráficaDescripción
Distribución de particionesGráfico de anillo con el número de imágenes de entrenamiento/validación/prueba y el porcentaje etiquetado
Clases principalesGráfico de anillo con las 10 clases de anotación más frecuentes; el resto se muestra como «Otras»
Dimensiones de imagenHistograma de la distribución de la anchura y la altura de las imágenes (superpuestas), con la media
Tamaño de los archivos de imagenHistograma de la distribución del tamaño de los archivos de imagen
Dimensiones 2D de las imágenesMapa de calor 2D de anchura frente a altura con líneas guía de la relación de aspecto
Ubicaciones de las anotacionesMapa de calor 2D de las posiciones centrales de los cuadros delimitadores
Formatos de imagenDistribución de los formatos de las imágenes de origen (JPG, PNG, etc.)
Dimensiones de los cuadros delimitadoresHistograma de la anchura y la altura de los cuadros delimitadores (superpuestas)
Objetos por imagenHistograma del número de anotaciones por imagen
Puntos por instanciaNúmero de vértices del polígono o de puntos clave por anotación (segmentación/pose)

Cuadrícula de estadísticas de la pestaña Gráficos de conjuntos de datos de Ultralytics Platform

Almacenamiento en caché de estadísticas

Platform almacena en caché las estadísticas calculadas y las invalida cuando cambian las imágenes, las anotaciones, las clases o las particiones. En conjuntos de datos de más de 100.000 imágenes, los gráficos se calculan a partir de un subconjunto de 100.000 imágenes, como se indica encima de la cuadrícula.

Mapas de calor a pantalla completa

Haz clic en el botón de expandir de cualquier mapa de calor para verlo en modo de pantalla completa. Esto proporciona una vista más grande y detallada, útil para comprender los patrones espaciales en conjuntos de datos grandes.

Pestaña Modelos#

Consulta todos los modelos entrenados con este dataset en una tabla con búsqueda:

ColumnaDescripción
NombreNombre del modelo con enlace
ProyectoProyecto principal con icono
VersiónVersión inmutable del dataset utilizada para el entrenamiento, si existe
EstadoInsignia del estado del entrenamiento
TareaTipo de tarea de YOLO
ÉpocasMejor época / total de épocas
mAP50-95Precisión media promedio
mAP50mAP con IoU 0.50
CreadoFecha de creación

Pestaña Datasets de Ultralytics Platform: tabla de modelos entrenados

Pestaña Errores#

Esta pestaña solo aparece cuando uno o más archivos no se pueden procesar.

Aquí se muestran las imágenes cuyo procesamiento ha fallado, junto con:

  • Banner de error: número total de imágenes fallidas e indicaciones
  • Tabla de errores: nombre de archivo, descripción del error fácil de entender, sugerencias para solucionarlo y miniatura de vista previa
  • Entre los errores habituales se incluyen archivos dañados, formatos no compatibles, imágenes demasiado pequeñas (mín. 28px) y modos de color no compatibles

Pestaña Errores de Datasets de Ultralytics Platform: fallos de procesamiento

Errores habituales de procesamiento
ErrorCausaSolución
No se puede leer el archivo de imagenFormato dañado o no compatibleVuelve a exportarlo desde el editor de imágenes
Incompleto o dañadoEl archivo se truncó durante la transferenciaVuelve a descargar el archivo original
Formato de imagen no compatibleFormato que Platform no puede descodificarConviértelo a JPG, PNG o WebP
Error de permisos del archivoEl archivo está bloqueado o protegido contra lecturaDesbloquea el archivo y vuelve a subirlo
La imagen es demasiado pequeñaLa dimensión mínima es inferior a 28pxUsa imágenes de origen con mayor resolución
Modo de color no compatibleModo de color CMYK o indexadoConvierte la imagen al modo RGB

Pestaña Versiones#

Crea instantáneas NDJSON inmutables de tu dataset para realizar entrenamientos reproducibles. Cada versión captura el número de imágenes, clases y anotaciones, así como el tamaño de los archivos en el momento de su creación.

ColumnaDescripción
VersiónNúmero de versión (v1, v2, ...)
DescripciónDescripción proporcionada por el usuario (editable)
ImágenesNúmero de imágenes en el momento de la instantánea
ClasesNúmero de clases en el momento de la instantánea
AnotacionesNúmero de anotaciones en el momento de la instantánea
TamañoTamaño del archivo de exportación NDJSON
CreadoCuándo se creó la versión
AccionesDescargar o restaurar

Para crear una versión:

  1. Abre la pestaña Versions
  2. Opcionalmente, introduce una descripción (p. ej., "Se han añadido 500 imágenes de entrenamiento" o "Se han corregido clases mal etiquetadas")
  3. Haz clic en New Version
  4. La nueva versión aparece en la tabla

Cada versión se numera secuencialmente (v1, v2, v3...) y es inmutable: las versiones no se pueden editar ni eliminar, solo se pueden cambiar sus descripciones. Usa las acciones de la fila para descargar o restaurar cualquier versión en cualquier momento.

Restaurar una versión

La restauración sustituye las imágenes, divisiones, clases y anotaciones actuales del dataset por las de la instantánea seleccionada y no se puede deshacer, a menos que guardes primero el estado actual como otra versión. El dataset queda bloqueado con el estado processing mientras se reconstruye. Durante la restauración no se vuelve a subir nada, por lo que normalmente es rápida incluso con datasets grandes.

Guardar una versión durante el entrenamiento

Activa Save Dataset Version en el diálogo de entrenamiento en la nube para vincular un modelo con el dataset exacto utilizado durante el entrenamiento. Platform reutiliza una versión coincidente cuando el contenido del dataset no ha cambiado y crea una nueva versión solo cuando ha cambiado.

Solo datasets listos

La creación y restauración de versiones están disponibles cuando el dataset alcanza el estado ready. Las versiones no están disponibles para datasets en la nube conectados ni On Premise.

Cuándo crear versiones

Crea una versión antes y después de realizar cambios importantes en tu dataset, como añadir imágenes, corregir anotaciones o reequilibrar las divisiones. Así podrás comparar el rendimiento del modelo en distintos estados del dataset.

Tamaño del archivo NDJSON

El tamaño mostrado corresponde al del archivo de exportación NDJSON, que contiene las URL de las imágenes y las anotaciones, no las imágenes en sí. Los datos reales de las imágenes se almacenan por separado y se accede a ellos mediante URL firmadas. El archivo de la instantánea sigue contando para la cuota de almacenamiento de tu espacio de trabajo, por lo que la creación de versiones falla si ya no tienes espacio disponible.

Exportar dataset#

Exporta tu dataset para usarlo sin conexión descargándolo en formato NDJSON desde la cabecera del dataset o la pestaña Versiones.

Para exportarlo:

  1. Haz clic en el botón Download (icono de descarga) de la cabecera del dataset
  2. Descarga directamente la instantánea NDJSON actual
  3. Usa la pestaña Versions cuando quieras una instantánea numerada e inmutable que puedas volver a descargar más adelante

Ultralytics Platform Datasets Export Ndjson Download

El formato NDJSON almacena un objeto JSON por línea. La primera línea contiene los metadatos del conjunto de datos, seguida de una línea por imagen:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

El objeto opcional metadata a nivel de imagen se conserva cuando se importa un archivo NDJSON en Platform. Puedes inspeccionarlo o editarlo desde el panel de información de pantalla completa de la imagen. Para cargar archivos de archivo mediante programación, la API de datos de Ingest Dataset acepta el mapa de rutas equivalente imageMetadata.

Los datasets de pose también incluyen un campo kpt_shape en la línea de cabecera del dataset, inferido a partir de las anotaciones cuando aún no se ha establecido.

Las exportaciones de profundidad declaran "task": "depth" y "depth_scale": 1000 en la línea del dataset. Cada línea de imagen incluye un depth.url para su archivo PNG uint16 sin formato asociado. Ultralytics descarga las URL de imagen y profundidad simultáneamente y escribe un archivo YAML de entrenamiento con la misma escala, por lo que el archivo NDJSON se puede pasar directamente a model.train(data=...).

URL firmadas

Las URL de imágenes del NDJSON exportado están firmadas y son válidas durante 7 días. Platform reutiliza una exportación en caché durante un máximo de 6 días cuando el dataset no ha cambiado, por lo que una descarga nueva siempre conserva al menos un día de validez. Si necesitas URL nuevas antes, cambia el dataset o crea una versión nueva.

Datasets On Premise

La exportación no está disponible para los datasets On Premise, cuyos bytes de imagen nunca llegan a Platform.

Consulta la documentación del formato NDJSON de Ultralytics para ver la especificación completa.

Operaciones con imágenes#

Acciones rápidas#

Haz clic con el botón derecho en cualquier imagen de la vista Grid o Compact para acceder a las acciones rápidas:

AcciónDescripción
Move to SplitReasigna la imagen a la división Train, Val o Test
Buscar imágenes similaresBusca imágenes similares en conjuntos de datos públicos y añádelas (consulta Buscar imágenes similares)
Generar imágenes similaresCrea hasta 16 variaciones generadas por IA de la imagen (cuatro por defecto) y añade las que conserves como imágenes sin etiquetar
DownloadDescarga el archivo de imagen original
DeleteElimina la imagen del dataset

Menú contextual de la tarjeta de imagen de Datasets de Ultralytics Platform

Individual frente a masivo

El menú contextual de la imagen funciona con una sola imagen. Para realizar operaciones masivas en varias imágenes, usa la vista Table con la selección mediante casillas.

Mover masivamente a una división#

Reasigna las imágenes seleccionadas a otra partición dentro del mismo conjunto de datos:

  1. Cambia a la vista Tabla
  2. Selecciona las imágenes mediante las casillas de verificación
  3. Haz clic con el botón derecho para abrir el menú contextual
  4. Elige Move to split > Entrenamiento, Validación o Prueba

También puedes arrastrar y soltar imágenes sobre las pestañas de filtro de partición en la vista de cuadrícula. Si mover una imagen provoca un conflicto con una imagen idéntica que ya existe en la partición de destino, Platform te pregunta si quieres omitirla, conservar ambas o reemplazarla.

Organizar las particiones de entrenamiento y validación

Sube todas las imágenes a un conjunto de datos y, después, usa la opción de mover en bloque a una partición para organizar los subconjuntos en particiones de entrenamiento, validación y prueba.

Redistribución de particiones#

Redistribuye todas las imágenes entre las particiones de entrenamiento, validación y prueba mediante proporciones personalizadas:

  1. Haz clic en la barra de particiones de la barra de herramientas del conjunto de datos para abrir el cuadro de diálogo Redistribuir particiones
  2. Ajusta los porcentajes de las particiones mediante cualquiera de los métodos siguientes
  3. Revisa la vista previa en directo del número de imágenes para confirmar la distribución
  4. Haz clic en Aplicar para reasignar aleatoriamente todas las imágenes según tus porcentajes

Ultralytics Platform Datasets Split Redistribution Dialog

El cuadro de diálogo ofrece tres formas de establecer tus proporciones de división objetivo:

MétodoDescripción
ArrastrarArrastra los controles entre los segmentos de colores para ajustar visualmente los límites de las particiones
EscribirEdita la entrada de porcentaje de cualquier partición (las otras dos particiones se reequilibran proporcionalmente de forma automática)
AutomáticoHaz clic una vez para establecer al instante una partición de entrenamiento/validación 80/20, con la partición de prueba configurada al 0 %

Una vista previa en directo muestra exactamente cuántas imágenes acabarán en cada partición antes de aplicar los cambios.

Partición rápida 80/20

Haz clic en el botón Automático para establecer al instante la partición recomendada de entrenamiento/validación 80/20. Es la proporción más habitual para el entrenamiento.

Eliminación en bloque#

Elimina varias imágenes a la vez:

  1. Selecciona las imágenes en la vista de tabla
  2. Haz clic con el botón derecho y elige Delete, o pulsa Cmd/Ctrl+Delete
  3. Confirma la eliminación

URI del conjunto de datos#

Haz referencia a los conjuntos de datos de Platform mediante el formato de URI ul:// (consulta Usar conjuntos de datos de Platform):

ul://username/datasets/dataset-slug

También puedes pegar directamente una URL web de un conjunto de datos o modelo (por ejemplo, https://platform.ultralytics.com/username/datasets/dataset-slug); se reescribe automáticamente como la URI ul://. Pasar una lista de conjuntos de datos ajusta un modelo base en cada uno de ellos de forma secuencial, por ejemplo, model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Usa esta URI para entrenar modelos desde cualquier lugar:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Entrena desde cualquier lugar con datos de Platform

La URI ul:// funciona desde cualquier entorno:

  • Equipo local: entrena en tu propio hardware y descarga los datos automáticamente
  • Google Colab: accede a tus conjuntos de datos de Platform desde notebooks
  • Servidores remotos: entrena en máquinas virtuales en la nube con acceso completo al conjunto de datos

Licencias disponibles#

Platform admite las siguientes licencias para conjuntos de datos:

LicenciaTipo
NingunoNo se ha seleccionado ninguna licencia
CC0-1.0Dominio público
PDM-1.0Dominio público
CC-BY-2.5Permisiva
CC-BY-3.0Permisiva
CC-BY-4.0Permisiva
CC-BY-NC-2.0No comercial
CC-BY-NC-3.0No comercial
CC-BY-NC-4.0No comercial
CC-BY-SA-3.0Copyleft
CC-BY-SA-4.0Copyleft
CC-BY-NC-SA-3.0Copyleft
CC-BY-NC-SA-4.0Copyleft
CC-BY-ND-4.0Sin obras derivadas
CC-BY-NC-ND-2.0No comercial
CC-BY-NC-ND-4.0No comercial
Apache-2.0Permisiva
MITPermisiva
BSD-3-ClausePermisiva
AGPL-3.0Copyleft
GPL-2.0Copyleft
GPL-3.0Copyleft
LGPL-3.0Copyleft
ODbL-1.0Copyleft
DbCL-1.0Requiere ODbL
Solo para investigaciónRestringida
OtraPersonalizada
Licencias Copyleft

Al clonar un conjunto de datos con una licencia copyleft (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), el conjunto de datos clonado hereda la licencia y el selector de licencias se bloquea.

Configuración de visibilidad#

Controla quién puede ver tu conjunto de datos:

ConfiguraciónDescripción
PrivadoTú y los miembros autorizados del espacio de trabajo podéis acceder
PúblicoCualquiera puede verlo, incluso desde la página Explorar

La visibilidad se establece al crear un conjunto de datos en el cuadro de diálogo New Dataset mediante un interruptor. Los conjuntos de datos públicos son visibles en la página Explorar.

Editar conjunto de datos#

Los metadatos del conjunto de datos se editan directamente en línea desde la página del conjunto de datos, sin necesidad de ningún cuadro de diálogo:

  • Nombre: haz clic en el nombre del conjunto de datos para editarlo. Los cambios se guardan automáticamente al perder el foco o al pulsar Enter. Los nombres están limitados a 100 caracteres.
  • Descripción: haz clic en la descripción (o en el marcador de posición «Añade una descripción...» ) para editarla. Los cambios se guardan automáticamente. Las descripciones están limitadas a 1.000 caracteres.
  • Tipo de tarea: haz clic en la etiqueta de la tarea para seleccionar otro tipo de tarea.
  • Licencia: haz clic en el selector de licencia para cambiar la licencia del conjunto de datos.
  • Icono: haz clic en el icono del conjunto de datos para subir tu propia imagen, convertir una de las imágenes del conjunto de datos en el icono o elegir una letra y un color.
Cambiar el tipo de tarea

Cada imagen almacena las anotaciones de todos los tipos de tarea conjuntamente. Cambiar el tipo de tarea del conjunto de datos controla qué anotaciones son visibles en el editor y cuáles se incluyen en las exportaciones y el entrenamiento. Las anotaciones de otros tipos de tarea se conservan en la base de datos y vuelven a aparecer cuando cambias de nuevo. Profundidad es la excepción: su verdad fundamental es un archivo emparejado, no una anotación, por lo que un conjunto de datos solo puede cambiar a profundidad o desde profundidad cuando no contiene imágenes; en su lugar, vuelve a importarlo.

Metadatos personalizados#

Abre Más acciones y selecciona Información para revisar dos secciones:

  • Metadatos de Ultralytics: detalles de Platform de solo lectura, como el ID del conjunto de datos, el propietario, la tarea, el número de imágenes y anotaciones, la región de almacenamiento y las marcas de tiempo
  • Metadatos personalizados: tu propio objeto JSON para la procedencia, las condiciones de captura, los ID de cliente, la gobernanza u otros datos contextuales

Los usuarios con permiso de visualización del espacio de trabajo pueden inspeccionar los metadatos, mientras que los miembros con acceso de edición pueden sustituir el objeto de metadatos personalizados. El objeto de metadatos serializado está limitado a 500.000 caracteres y cada clave de nivel superior está limitada a 128 caracteres. Guarda un objeto vacío ({}) para borrar los metadatos personalizados.

Clonar conjunto de datos#

Al ver un conjunto de datos público que no te pertenece, haz clic en Clone Dataset para abrir el cuadro de diálogo de clonación. Revisa el espacio de trabajo de destino, el nombre, la visibilidad y la licencia y, después, confirma la clonación. La copia incluye todas las imágenes, anotaciones y definiciones de clases. Los conjuntos de datos públicos de origen siguen siendo públicos de forma predeterminada en los espacios de trabajo cuya visibilidad predeterminada es pública; los clones de espacios de trabajo Enterprise son privados de forma predeterminada. Si el conjunto de datos original tiene una licencia Copyleft, el clon la hereda y el selector de licencia queda bloqueado.

El slug de destino cambia de nombre automáticamente si ya está ocupado, y la clonación requiere suficiente cuota de almacenamiento disponible para albergar la copia.

Conjuntos de datos conectados

Los conjuntos de datos respaldados por fuentes de almacenamiento en la nube o locales no se pueden clonar porque Platform no almacena sus bytes de imagen.

Marcar con estrella y compartir#

  • Estrella: haz clic en el botón de estrella para guardar un conjunto de datos en marcadores. El recuento de estrellas es visible para todos los usuarios.
  • Compartir: en los conjuntos de datos públicos, haz clic en el botón de compartir para copiar un enlace, obtener un fragmento de inserción o compartirlo en plataformas sociales.

Eliminar conjunto de datos#

Elimina un conjunto de datos que ya no necesites:

  1. Abre Más acciones (el botón ) en la cabecera del conjunto de datos
  2. Elige Delete Dataset
  3. Confirma en el cuadro de diálogo: «Esto moverá [name] a la papelera. Puedes restaurarlo en un plazo de 30 días.»

El mismo menú incluye Información, que abre el cuadro de diálogo de metadatos descrito en Metadatos personalizados, y Actualizar, que vuelve a leer el dataset del servidor.

Papelera y restauración

Los datasets eliminados se mueven a la papelera, no se eliminan permanentemente. Puedes restaurarlos en un plazo de 30 días desde Settings > Trash.

Entrenar con un dataset#

Inicia el entrenamiento directamente desde tu dataset:

  1. Haz clic en New Model en la página del dataset
  2. Selecciona un proyecto o crea uno nuevo
  3. Configura los parámetros de entrenamiento
  4. Inicia el entrenamiento
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Consulta Entrenamiento en la nube para obtener más información.

Preguntas frecuentes#

  • Tus datos se procesan y almacenan en la región que hayas seleccionado (US, EU o AP). Las imágenes se:

    1. Validan para comprobar su formato y tamaño
    2. Rechazan si la dimensión mínima es inferior a 28 px
    3. Normalizan si superan los 4096 px (conservando la relación de aspecto y codificándose para optimizar el almacenamiento)
    4. Almacenan con deduplicación, de modo que las imágenes idénticas solo se conservan una vez
    5. Generan como miniaturas WebP de 256 px para agilizar la exploración
  • Ultralytics Platform gestiona el almacenamiento de forma eficiente:

    • Deduplicación: las imágenes idénticas de una misma región de datos se almacenan una sola vez
    • Integridad: se verifica la integridad de los datos cargados
    • Eficiencia: los clones reutilizan las imágenes almacenadas en lugar de copiarlas, aunque siguen contando para la cuota de almacenamiento del espacio de trabajo de destino
    • Regional: los datos permanecen en la región que hayas seleccionado (US, EU o AP)
  • Sí. Arrastra los archivos a la galería del dataset o haz clic en el icono de carga de la cabecera de la página para abrir directamente el selector de archivos nativo de tu navegador. Las nuevas estadísticas se calculan automáticamente después del procesamiento.

  • Usa la función de movimiento masivo a una partición:

    1. Selecciona las imágenes en la vista de tabla
    2. Haz clic con el botón derecho y elige Move to split
    3. Selecciona la partición de destino (Train, Validation o Test)
  • Ultralytics Platform admite etiquetas YOLO, COCO JSON, Ultralytics NDJSON y cargas de imágenes sin procesar. Las etiquetas XML de Pascal VOC se detectan, pero no se importan:

    Un archivo .txt por imagen con coordenadas normalizadas (intervalo 0-1):

    TareaFormatoEjemplo
    Detectclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Semánticaclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Poseclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    ClasificaciónEstructura de directoriostrain/cats/, train/dogs/

    Marcadores de visibilidad de postura: 0=no etiquetado, 1=etiquetado pero ocluido, 2=etiquetado y visible. Los conjuntos de datos semánticos también aceptan máscaras PNG en lugar de archivos de polígonos (consulta Máscaras semánticas).

  • Sí. Cada imagen almacena conjuntamente anotaciones para los 6 tipos de tareas de anotación (detect, segment, semantic, classify, pose, OBB). Puedes cambiar el tipo de tarea activo del dataset en cualquier momento sin perder las anotaciones existentes. En el editor solo se muestran las anotaciones que coinciden con el tipo de tarea activo y solo estas se incluyen en las exportaciones y el entrenamiento; las anotaciones de otras tareas se conservan y vuelven a aparecer cuando cambias de nuevo al tipo correspondiente.

  • Sí:

    LímiteValor
    Clases por dataset25,000
    Anotaciones por imagen10,000
    Coordenadas por anotación10,000
    Nombre del dataset100 caracteres
    Descripción del dataset1000 caracteres
    Metadatos personalizados500 000 caracteres serializados
    Clave de nivel superior de los metadatos128 caracteres
  • Los datasets que leen datos de almacenamiento en la nube o de fuentes locales mantienen sus píxeles fuera de Platform, por lo que las funciones que necesitan copias de los bytes de imagen propiedad de Platform no están disponibles:

    CaracterísticaConectado a la nubeLocal
    Anotación inteligente y por lotesNo disponibleNo disponible
    Análisis de agrupaciónNo disponibleNo disponible
    ClonaciónNo disponibleNo disponible
    Instantáneas de versionesNo disponibleNo disponible
    Exportación NDJSONDisponibleNo disponible
    Importación de máscara PNG semánticaNo disponibleDisponible

    La exploración, la anotación manual, la gestión de clases, las particiones, las estadísticas y el entrenamiento funcionan con normalidad.

Comentarios