Ultralytics YOLO27:

Preparación de datos#

La preparación de datos es la base de unos modelos de visión por computador satisfactorios. Ultralytics Platform proporciona herramientas completas para gestionar tus datos de entrenamiento, desde la carga hasta la anotación y el análisis.



Watch: Get Started with Ultralytics Platform - Data

Descripción general#

La sección Datos de Ultralytics Platform te ayuda a:

  • Cargar imágenes, vídeos y archivos de datasets (ZIP, TAR incluidos .tar.gz/.tgz, NDJSON)
  • Importar desde una URL pegando un enlace directo a un archivo comprimido o una exportación NDJSON, o desde Roboflow
  • Conectar Google Cloud Storage, Amazon S3 o Azure Blob Storage y utilizar tus datos en su ubicación sin cargar una copia
  • Mantener los píxeles en tus instalaciones con workers de CPU/GPU Enterprise En las instalaciones
  • Etiqueta con herramientas de dibujo manual y etiquetado inteligente impulsado por SAM: elige entre SAM 2.1, SAM 3 o el SAM 3.1 predeterminado
  • Gestionar clases cambiándoles el nombre, el color, fusionándolas y eliminándolas en todo el dataset
  • Analizar tus datos con estadísticas, visualizaciones y clustering basado en embeddings
  • Exportar en formato NDJSON para el entrenamiento local

Barra lateral de datasets de la vista general de datos de Ultralytics Platform

Flujo de trabajo#

graph LR
    A[Upload]:::start --> B[Annotate]:::proc
    B --> D[Train]:::out
    B --> C[Analyze]:::proc

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
EtapaDescripción
CargarImporta imágenes, vídeos o archivos comprimidos con procesamiento automático
AnotarEtiqueta datos con herramientas manuales o utiliza la anotación de SAM para detect, segment, semantic y OBB
AnalizarConsulta las distribuciones de clases, los mapas de calor espaciales, las estadísticas de dimensiones y los clusters de embeddings
ExportarDescarga en formato NDJSON para usarlo sin conexión

Tareas compatibles#

Los datasets de Ultralytics Platform admiten los 7 tipos de tareas de YOLO:

TareaDescripciónHerramienta de anotación
DetectDetección de objetos con cuadros delimitadoresHerramienta de rectángulos
SegmentSegmentación de instancias con máscaras de píxelesHerramienta de polígonos
SemanticSegmentación semántica con regiones de píxeles por claseHerramienta de polígonos
DepthMapas de profundidad métrica por píxelObjetivos importados
ClassifyClasificación a nivel de imagenSelector de clases
PoseEstimación de puntos clave con plantillas de esqueletos integradas y personalizadasHerramienta de puntos clave
OBBCuadros delimitadores orientados para objetos rotadosHerramienta de cuadros orientados
Selección del tipo de tarea

El tipo de tarea se establece al crear un dataset y determina qué herramientas de anotación están disponibles. Puedes cambiarlo más adelante desde el selector de tareas de la cabecera del dataset, pero las anotaciones incompatibles no se mostrarán después del cambio. El cambio a profundidad o desde profundidad solo está permitido mientras el dataset esté vacío; consulta Editar dataset.

Características principales#

Almacenamiento inteligente#

Ultralytics Platform gestiona el almacenamiento de forma eficiente:

  • Deduplicación: las imágenes idénticas de una misma región de datos se almacenan una sola vez
  • Integridad: se verifica la integridad de los datos cargados
  • Eficiencia: Almacenamiento optimizado y procesamiento rápido

URI de datasets#

Referencia datasets utilizando el formato de URI ul:// (consulta Usar datasets de Platform):

yolo train data=ul://username/datasets/my-dataset

Esto permite entrenar con los datasets de la plataforma desde cualquier máquina con tu clave de API configurada.

Usar datos de Platform desde Python
from ultralytics import YOLO

model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)

Versionado de datasets#

Crea instantáneas NDJSON inmutables de tu dataset para un entrenamiento reproducible. Cada versión captura el número de imágenes, clases y anotaciones en el momento de su creación. Consulta Pestaña Versiones para obtener más información.

Pestañas del conjunto de datos#

Las páginas de los datasets pueden mostrar hasta seis pestañas, según el estado del dataset y tus permisos:

PestañaDescripción
ImágenesExplora imágenes en vista de cuadrícula, compacta o de tabla, con superposiciones de anotaciones
ClasesConsulta, cambia el nombre, cambia el color, fusiona y elimina clases con el número de etiquetas de cada clase
GráficosEstadísticas automáticas: distribución de divisiones, número de clases y mapas de calor
ModelosModelos entrenados con este dataset, con métricas y estado
VersionesCrea, descarga y restaura instantáneas NDJSON inmutables para garantizar la reproducibilidad
ErroresImágenes cuyo procesamiento ha fallado, con detalles del error e indicaciones para solucionarlo

Classes aparece cuando el dataset tiene imágenes y su tarea tiene clases, mientras que Charts aparece siempre que tiene imágenes. Errors aparece únicamente cuando existen errores de procesamiento. Versions aparece cuando tienes acceso de edición o, en modo de solo lectura, cuando ya existen versiones.

Clustering#

Explora tu conjunto de datos como un diagrama de dispersión 2D interactivo donde las imágenes visualmente similares se sitúan cerca unas de otras; esto es útil para revelar cúmulos, duplicados y valores atípicos, y para inspeccionar cómo se distribuyen las divisiones o clases en tus datos. Selecciona con el lazo una región del diagrama para filtrar la galería de imágenes y mostrar solo esas imágenes. El análisis requiere entre 20 y 200 000 imágenes sin errores. Los mismos embeddings te permiten buscar imágenes similares en conjuntos de datos públicos y añadirlas a tus conjuntos de datos. Consulta Clustering para obtener más detalles.

Estadísticas y visualización#

La pestaña Charts proporciona análisis automáticos, entre ellos:

  • Distribución de divisiones: Gráfico de anillo con el número de imágenes de entrenamiento, validación y prueba
  • Clases principales: Gráfico de anillo con las 10 clases de anotación más frecuentes
  • Dimensiones de imagen: Histograma de la distribución de la anchura y la altura de las imágenes (en píxeles)
  • Dimensiones de imagen 2D: Mapa de calor 2D de la anchura frente a la altura, con líneas guía de la relación de aspecto
  • Ubicaciones de las anotaciones: Mapa de calor 2D de las posiciones centrales de los cuadros delimitadores
  • Puntos por instancia: Distribución del número de vértices de polígonos o puntos clave (datasets de segmentación/pose)

Consulta la pestaña Gráficos para ver la lista completa.

Enlaces rápidos#

Preguntas frecuentes#

  • Ultralytics Platform admite:

    Imágenes: JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (máx. 50 MB cada una)

    Vídeos: MP4, WebM, MOV, MKV, M4V (máx. 1 GB, fotogramas extraídos a 1 FPS, máx. 100 fotogramas)

    Archivos del conjunto de datos: archivos ZIP o TAR que incluyen .tar.gz y .tgz (máximo 10 GB en Free, 20 GB en Pro, 50 GB en Enterprise) que contienen imágenes con etiquetas opcionales en formato YOLO o etiquetas COCO JSON, o máscaras PNG semánticas, además de exportaciones en NDJSON

    Cualquiera de estos formatos de archivo comprimido o NDJSON también se puede importar pegando un enlace HTTP(S) directo en la pestaña URL del diálogo New Dataset. Las etiquetas XML de Pascal VOC se detectan, pero no se importan.

  • Los límites de almacenamiento dependen de tu plan:

    PlanLímite de almacenamiento
    Free100 GB
    Pro500 GB
    EnterpriseIlimitado

    Límites de archivos individuales: imágenes, 50 MB; vídeos, 1 GB; datasets, 10 GB en Free / 20 GB en Pro / 50 GB en Enterprise

  • ¡Sí! Utiliza el formato de URI del dataset para entrenar localmente:

    export ULTRALYTICS_API_KEY="YOUR_API_KEY"
    yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100

    O exporta tu conjunto de datos en formato NDJSON para transferir sus metadatos, divisiones, anotaciones y URL de imágenes firmadas.

Comentarios