Conjuntos de Dados#
Os conjuntos de dados do Ultralytics Platform fornecem uma solução otimizada para gerenciar os seus dados de treino. Após o envio, a plataforma processa imagens, rótulos e estatísticas automaticamente.
Um conjunto de dados está pronto para treino assim que o processamento for concluído e contiver pelo menos uma imagem na divisão train, pelo menos uma imagem na divisão val ou test, e pelo menos uma imagem rotulada. O cabeçalho do conjunto de dados exibe um selo Ready quando todas as três condições são atendidas, e um selo Not Ready caso contrário — clica no selo para ver exatamente qual condição está em falta.
Carregar conjunto de dados#
A Ultralytics Platform aceita múltiplos formatos de carregamento para maior flexibilidade.
Se já tens conjuntos de dados no Roboflow, usa as Integrations para importá-los diretamente — sem necessidade de exportação manual ou novo envio. Dados no Google Cloud Storage, Amazon S3 ou Azure Blob Storage podem ser usados diretamente através do Cloud storage. Os espaços de trabalho Enterprise podem usar On Premise para indexar e treinar com dados locais sem enviar pixels para a Platform.
Formatos Suportados#
| Formato | Extensões | Notas | Tamanho máximo |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Mais comum, recomendado | 50 MB |
| PNG | .png | Suporta transparência | 50 MB |
| WebP | .webp | Moderno, boa compressão | 50 MB |
| BMP | .bmp | Sem compressão | 50 MB |
| TIFF | .tiff, .tif | Alta qualidade | 50 MB |
| HEIC | .heic | Fotos de iPhone | 50 MB |
| AVIF | .avif | Formato de nova geração | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Raw de câmara | 50 MB |
| MPO | .mpo | Objeto de múltiplas imagens | 50 MB |
Suporte a Codecs de Vídeo#
A extensão de ficheiro por si só não é suficiente: um vídeo ainda pode falhar se o seu codec não puder ser descodificado durante o processamento.
Vídeo H.264 num contentor MP4 tem o suporte de descodificador mais abrangente e é a escolha mais segura. Se um vídeo não for processado, recodifica-o com o FFmpeg:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4A preparar o teu conjunto de dados#
A plataforma suporta Ultralytics YOLO, COCO, conjuntos de dados de profundidade, Ultralytics NDJSON e carregamentos brutos (não anotados):
Usa a estrutura de diretórios padrão do YOLO com um ficheiro data.yaml:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlO ficheiro YAML define a configuração do teu conjunto de dados:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogRaw: Envia imagens não anotadas (sem rótulos). Útil quando planeias anotar diretamente na plataforma usando o editor de anotações.
Também podes carregar imagens sem pastas de divisão explícitas. A plataforma respeita o destino de divisão ativo durante o carregamento. Se nenhum destino de divisão estiver definido e o carregamento deixar val vazio — ou com menos de dois mapas emparelhados para profundidade —, os conjuntos de dados de não classificação movem automaticamente as imagens de treino para val para que o conjunto de dados possa ser treinado imediatamente. Os conjuntos de dados de classificação são ignorados porque utilizam divisões baseadas em diretórios. Podes sempre reatribuir imagens mais tarde com bulk move-to-split ou split redistribution.
O formato é detetado automaticamente: os conjuntos de dados com um data.yaml contendo as chaves names, train ou val são tratados como YOLO. Os conjuntos de dados com ficheiros JSON COCO (contendo as matrizes images, annotations e categories) são tratados como COCO. As exportações .ndjson são importadas como Ultralytics NDJSON. Os conjuntos de dados apenas com imagens e sem anotações são tratados como brutos.
Quando um arquivo contém vários ficheiros YAML, o Platform prefere os nomes padrão (data.yaml, data.yml, dataset.yaml, dataset.yml) mais próximos da raiz do arquivo. Mantém um ficheiro YAML com um nome claro por arquivo para evitar ambiguidades.
Ficheiros de rótulos no formato Pascal VOC XML são detetados, mas as suas anotações não são importadas — as imagens são enviadas sem anotações. O Platform avisa-te antes de o envio começar ("Pascal VOC labels detected"). Converte primeiro o VOC XML para YOLO ou COCO; consulta format conversion tools.
Se os rótulos fizerem referência a IDs de classe, mas nenhum nome de classe for fornecido, o Platform gera nomes de espaços reservados densos (class0, class1, …) que podes mudar de nome mais tarde no Classes tab.
Para obter detalhes de formatos específicos de tarefas, consulta as tarefas suportadas e a Visão geral dos conjuntos de dados.
Processo de carregamento#
Para criar um conjunto de dados:
- Navega até
Annotatena barra lateral - Clique em
New Dataset - Seleciona um separador de origem de dados (consulta Data Sources abaixo)
- Adiciona um nome — o URL slug é derivado automaticamente e pode ser editado — além de uma descrição opcional
- Seleciona o tipo de tarefa (consulta supported tasks), uma licença opcional (consulta available licenses) e a visibilidade (pública ou privada)
- Clica em
Create & Uploadpara ficheiros locais,Create & Importpara um URL ou origem ligada, ouCreate Datasetpara começar vazio
Para adicionar ficheiros a um conjunto de dados existente, abre a respetiva página do conjunto de dados e arrasta os ficheiros para a galeria ou clica no ícone de envio no cabeçalho da página. O ícone de envio abre diretamente o seletor de ficheiros nativo do teu navegador, pois a tarefa do conjunto de dados já está definida.
Fontes de dados#
O diálogo New Dataset oferece quatro origens:
| Origem | Descrição |
|---|---|
| Upload | Arrasta ficheiros para a área ou procura por eles — imagens, vídeos, arquivos ou NDJSON |
| URL | Copia um link direto para um ficheiro .zip, .tar, .tar.gz, .tgz ou .ndjson; o Platform descarrega-o e ingere-o no lado do servidor |
| Cloud | Utiliza dados no local a partir do Google Cloud Storage, Amazon S3 ou Azure Blob Storage (Pro e Enterprise) |
| On Premise | Indexa e treina com dados que nunca saem das tuas próprias máquinas através de trabalhadores On Premise (Enterprise) |
A importação por URL é limitada tanto pelo limite por envio do teu plano (10 GB Gratuito / 20 GB Pro / 50 GB Enterprise) quanto pela tua quota de armazenamento restante, o que for menor. O link deve estar publicamente acessível via HTTP ou HTTPS e terminar com uma extensão suportada.
Antes de o envio começar#
O Platform valida os teus ficheiros no navegador antes de enviar qualquer coisa, para que os problemas comuns apareçam imediatamente em vez de após uma longa transferência. Os arquivos são verificados quanto a corrupção, tamanho vazio, proteção por senha e erros de sintaxe YAML, e os ficheiros excessivamente grandes são listados pelo nome.
Dois diálogos podem aparecer em seguida:
Quando o arquivo declara nomes de classes e o teu conjunto de dados já tem classes, o diálogo Map imported classes lista uma linha por classe recebida. Para cada uma, escolhe uma classe existente para mesclar, cria uma nova classe ou ignora-a. Correspondências exatas de nomes vêm pré-selecionadas, e as classes ignoradas e as suas anotações não são importadas.
Após o envio, a plataforma processa os teus dados automaticamente:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Validação: Verificações de formato e tamanho
- Normalização: Imagens grandes redimensionadas (máx. 4096px, dimensão mín. 28px), escala de cinzentos expandida para RGB, transparência achatada sobre fundo branco e orientação EXIF aplicada
- Miniaturas: Pré-visualizações WebP de 256px geradas
- Análise de rótulos: Rótulos do YOLO, COCO e NDJSON extraídos
- Estatísticas: Distribuições de classes e dimensões das imagens calculadas
Os originais AVIF e WebP são armazenados byte a byte quando não é necessário redimensionamento ou alteração de cor. Tudo o resto é recodificado — fontes WebP continuam WebP, e todos os outros formatos (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) tornam-se JPEG com qualidade 92. O teu nome de ficheiro original e a extensão de origem são mantidos como metadados.

Validar antes de carregar
Podes validar o teu conjunto de dados localmente antes de o carregares:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")As imagens devem ter pelo menos 28px no seu lado mais curto. Imagens menores do que isto são rejeitadas durante o processamento. Imagens maiores do que 4096px no seu lado mais longo são redimensionadas automaticamente com a proporção preservada.
Navegar pelas imagens#
Vê as imagens do teu conjunto de dados em múltiplos layouts.
Abre o painel Clustering a partir da barra de ferramentas da galeria para explorar o teu conjunto de dados como um gráfico de dispersão 2D interativo.
| Ver | Descrição |
|---|---|
| Grelha | Grelha de miniaturas com sobreposições de anotação (padrão) |
| Compacto | Miniaturas menores para leitura rápida |
| Tabela | Lista com miniatura, nome do ficheiro, dimensões, tamanho, divisão, classes e contagens de rótulos |

Ordenação e filtragem#
As imagens podem ser ordenadas e filtradas para uma navegação eficiente:
Cada opção alterna entre ascendente (↑) e descendente (↓):
| Ordenar | Descrição |
|---|---|
| Criado ↑/↓ | Ordem de envio (padrão ↓) |
| Nome ↑/↓ | Nome do arquivo alfabético |
| Altura ↑/↓ | Altura da imagem em pixels |
| Largura ↑/↓ | Largura da imagem em pixels |
| Tamanho ↑/↓ | Tamanho do arquivo em disco |
| Anotações ↑/↓ | Contagem de anotações por imagem |
Para conjuntos de dados com mais de 100.000 imagens, as ordenações por nome, largura, altura e tamanho são ocultadas para manter a galeria responsiva. As ordenações por data de criação e contagem de anotações permanecem disponíveis.
Usa o conjunto de filtros Annotations definido como Unannotated para encontrar rapidamente imagens que ainda precisam de anotação. Isto é especialmente útil para grandes conjuntos de dados onde queres monitorizar o progresso da rotulagem.
A caixa de pesquisa fica à direita da barra de ferramentas da galeria e filtra todos os modos de visualização — grelha, compacto e tabela. Ela corresponde ao nome do ficheiro da imagem (a extensão do ficheiro é opcional), bem como a chaves de metadados personalizados, valores escalares e entradas de matriz, de modo que uma imagem chamada img_0042 que contenha {"ship_type": "yacht"} é encontrada pesquisando por img_0042 ou yacht.
Valores aninhados dentro de subobjetos não são correspondidos. Colar um ID de imagem de 24 caracteres procura essa imagem exata diretamente, ignorando a pesquisa de texto.
Visualizador em Tela Cheia#
Clique em qualquer imagem para abrir o visualizador em tela cheia com:
- Navegação: Teclas de seta ou visualizações em miniatura para navegar
- Informações da imagem: Reveem as propriedades geradas pela Platform, metadados personalizados e metadados de ficheiro incorporados, como EXIF
- Metadados personalizados: Os proprietários e editores podem adicionar ou substituir um objeto JSON, incluindo valores aninhados até 500.000 caracteres serializados e chaves de nível superior até 128 caracteres
- Anotações: Alternar a visibilidade da sobreposição de anotações
- Detalhamento de Classe: Contagem de rótulos por classe com indicadores de cor
- Annotate: Quando tens acesso de edição, os controlos de anotação ficam ativos imediatamente quando o visualizador em tela cheia é aberto no desktop
- Download: Baixe o arquivo da imagem original
- Excluir: Exclua a imagem do dataset
- Zoom:
Cmd/Ctrl+Scroll,Cmd/Ctrl++ouCmd/Ctrl+=para aproximar eCmd/Ctrl+-para afastar - Repor vista:
Cmd/Ctrl + 0ou o botão de reposição para ajustar a imagem ao visualizador - Deslocamento (Pan): Mantém pressionado
Spacee arrasta para deslocar a tela quando estiver com zoom - Visualização de pixel: Alternar a renderização pixelada para inspeção detalhada
- Cortina de profundidade: Em conjuntos de dados de profundidade, um divisor arrastável limpa e alterna entre a imagem RGB e o seu mapa de profundidade colorizado

Filtrar por Divisão#
Filtrar imagens por sua divisão de dataset:
| Divisão | Objetivo |
|---|---|
| Treinar | Usado para treinamento de modelo |
| Val | Usado para validação durante o treinamento |
| Teste | Usado para avaliação final |
Clustering#
O painel Clustering projeta o teu conjunto de dados num gráfico de dispersão 2D interativo, onde imagens visualmente semelhantes ficam próximas umas das outras. Usa-o para detetar aglomerados, identificar duplicados e valores atípicos, e inspecionar como as divisões ou classes estão distribuídas pelos teus dados — sem sair da galeria. Abre-o a partir do ícone de gráfico de dispersão na barra de ferramentas da galeria em qualquer página de conjunto de dados.

Executando Análise#
Inicie uma análise:
- Abra um dataset e clique no ícone de gráfico de dispersão na barra de ferramentas da galeria
- Clique em
Analyze Dataset - Aguarde a barra de progresso terminar — os resultados aparecem no mesmo painel
A análise é executada em segundo plano em duas etapas, Computing embeddings e Clustering, podendo demorar alguns minutos dependendo do tamanho do teu conjunto de dados. Podes fechar o painel ou sair da página e voltar mais tarde.
Um conjunto de dados precisa de pelo menos 20 e no máximo 200.000 imagens sem erros para ser analisado. Connected datasets suportados por armazenamento em nuvem ou On Premise ainda não são suportados.
Visualização#
Assim que a análise for concluída, o painel exibe um gráfico de dispersão 2D de todas as imagens analisadas com uma legenda e um contador de pontos. Os filtros da galeria (divisão, classe, rotulado/não rotulado) esmaecem os pontos fora do filtro para que possas focar-te no subconjunto que te interessa — o contador exibe então visible / total points.

Colorir Por#
Altera a forma como os pontos de dados são coloridos com o menu suspensivo Color by na barra de ferramentas do painel. Alterna entre os modos de visualização a qualquer momento — o gráfico é recolorido instantaneamente para que possas ver como as divisões, classes ou propriedades de imagem estão distribuídas pelos teus aglomerados:
| Opção | Sombreamento |
|---|---|
| Divisões | Treino / Val / Teste |
| Classes | Primeira classe de anotação em cada imagem |
| Largura | Largura da imagem |
| Altura | Altura da imagem |
| Tamanho | Tamanho do arquivo |
| Anotações | Número de anotações por imagem |

Seleção de Laço (Lasso)#
Desenha uma seleção de forma livre em torno de uma região para destacar pontos no gráfico. A galeria filtra as imagens correspondentes para que possas inspecioná-las, rotulá-las novamente, movê-las ou eliminá-las usando as operações de imagem habituais.
Um chip acima do gráfico mostra quantos pontos estão selecionados — clica em × para limpar o laço e voltar à vista de galeria completa.
Uma seleção em laço (lasso) resulta num máximo de 1.000 imagens. Se a tua seleção corresponder a mais, o Platform mostra uma amostra de 1.000 e sugere desenhar uma região menor.
Pan e Zoom#
Navega por dispersões grandes diretamente com o rato e o teclado, ou com os botões de zoom no canto inferior esquerdo do gráfico:
| Entrada | Ação |
|---|---|
| Scroll | Mover o gráfico em 2D |
| Cmd/Ctrl+Scroll | Aumentar ou diminuir zoom, ancorado no cursor |
| Manter Espaço | Alternar para o modo arrastar para mover |
| Botão Redefinir | Retornar à extensão total do gráfico |
Reanalisando#
Se o teu conjunto de dados mudar após a análise — novas imagens chegam ou a contagem analisada deixa de corresponder ao conjunto de dados — um botão Re-analyze aparece na parte superior do painel para proprietários e editores.
Clica em Re-analyze para recalcular as incorporações (embeddings) e a projeção 2D de raiz.
Abas do Dataset#
Cada página de dataset pode exibir até seis abas, dependendo do estado do dataset e das suas permissões:
Aba de Imagens#
A visualização padrão mostrando a galeria de imagens com sobreposições de anotação. Suporta modos de visualização em grade, compacto e tabela. Arraste e solte arquivos aqui para adicionar mais imagens.
Aba de Classes#
Este separador aparece quando o conjunto de dados tem imagens e a respetiva tarefa tem classes.
Gerencie as classes de anotação para seu dataset:
- Histograma de classes: Gráfico de barras que mostra a contagem de anotações por classe, ordenadas por frequência, com um alternador de escala linear/logarítmica
- Tabela de classes: Tabela classificável e pesquisável com índice, nome, contagem de anotações e contagem de imagens
- Editar nomes de classes: Clique em qualquer nome de classe para renomeá-lo diretamente
- Editar cores de classes: Clique em uma amostra de cor para alterar a cor da classe
- Adicionar nova classe: Use a entrada na parte inferior para adicionar classes
- Mesclar classes: Seleciona duas ou mais linhas e clica em
Merge into one - Eliminar classes: Seleciona uma ou mais linhas e clica em
Delete

Se o teu conjunto de dados tiver desequilíbrio de classes (por exemplo, 10.000 anotações de "pessoa", mas apenas 50 de "bicicleta"), usa o botão de alternância Log Scale no histograma de classes para visualizar todas as classes com clareza.
Mesclar classes#
A mesclagem consolida rótulos duplicados ou sobrepostos — por exemplo, combinando car, automobile e vehicle numa única classe:
- Seleciona duas ou mais classes usando as caixas de seleção de linha
- Clica em
Merge into oneno cabeçalho da tabela ou clica com o botão direito na seleção - Escolhe qual das classes selecionadas é o destino para o qual as outras serão mescladas
- Confirma
Cada anotação pertencente às classes de origem é reatribuída à classe de destino, e as classes de origem são removidas. Nenhuma anotação é eliminada, portanto a contagem total de anotações do conjunto de dados permanece inalterada.
Eliminar classes#
- Seleciona uma ou mais classes usando as caixas de seleção de linha
- Clica em
Deleteno cabeçalho da tabela ou clica com o botão direito na seleção - Confirma
Eliminar uma classe remove a classe e todas as suas anotações. Para conjuntos de dados de classificação, os rótulos são removidos, mas as imagens permanecem, tornando-se não rotuladas.
Os IDs de classe são posicionais. Mesclar ou eliminar uma classe desloca cada índice de classe superior para baixo para preencher a lacuna, de modo que exportações e ficheiros de rótulos escritos antes da alteração deixam de coincidir com os novos índices. Cria primeiro uma version se precisares da numeração antiga.
As contagens de classes são calculadas a partir de no máximo 100.000 imagens. Em conjuntos de dados maiores, uma nota acima do histograma diz "Com base num subconjunto de 100.000 imagens deste conjunto de dados."
Aba de Gráficos#
Esta aba aparece quando o dataset possui imagens.
Estatísticas automáticas calculadas a partir do seu conjunto de dados:
Os gráficos aparecem nesta ordem, e cada um é omitido quando o conjunto de dados não possui dados para ele — um conjunto de dados de imagens puras não mostra gráficos de anotações, e Points per Instance aparece apenas para dados de segmentação e pose:
| Gráfico | Descrição |
|---|---|
| Distribuição de Divisão (Split Distribution) | Gráfico de rosca com contagens de imagens de treino/validação/teste e porcentagem rotulada |
| Principais Classes | Gráfico de rosca das 10 classes de anotação mais frequentes, com o restante como "Outros" |
| Dimensões da Imagem | Histograma da distribuição de largura e altura da imagem (sobreposto) com média |
| Tamanho do Arquivo de Imagem | Histograma da distribuição do tamanho dos arquivos de imagem |
| Dimensões da Imagem 2D | Mapa de calor 2D de largura vs altura com linhas guia de proporção |
| Localizações de Anotação | Mapa de calor 2D das posições centrais das BBox |
| Formatos de Imagem | Distribuição dos formatos de imagem de origem (JPG, PNG, etc.) |
| Dimensões da Bounding Box | Histograma da largura e altura das bounding boxes (sobreposto) |
| Objetos por Imagem | Histograma da contagem de anotações por imagem |
| Pontos por Instância | Contagem de vértices de polígono ou keypoints por anotação (segmentação/pose) |

O Platform armazena em cache as estatísticas calculadas e invalida-as quando imagens, anotações, classes ou divisões são alteradas. Em conjuntos de dados maiores que 100.000 imagens, os gráficos são calculados a partir de um subconjunto de 100.000 imagens, indicado acima da grelha.
Clique no botão de expandir em qualquer mapa de calor para visualizá-lo em modo de tela cheia. Isso oferece uma visualização maior e mais detalhada — útil para entender padrões espaciais em grandes conjuntos de dados.
Aba de Modelos#
Veja todos os modelos treinados neste conjunto de dados em uma tabela pesquisável:
| Coluna | Descrição |
|---|---|
| Nome | Nome do modelo com link |
| Projeto | Projeto pai com ícone |
| Versão | Versão de dataset imutável usada para treinamento, se houver |
| Status | Badge de status de treinamento |
| Tarefa | Tipo de tarefa YOLO |
| Épocas | Melhor época / total de épocas |
| mAP50-95 | Precisão média (mean average precision) |
| mAP50 | mAP com IoU 0.50 |
| Criado | Data de criação |

Aba de Erros#
Esta aba aparece apenas quando um ou mais arquivos falham no processamento.
Imagens que falharam no processamento são listadas aqui com:
- Banner de erro: Contagem total de imagens com falha e orientação
- Tabela de erros: Nome do arquivo, descrição amigável do erro, dicas de correção e miniatura de visualização
- Erros comuns incluem arquivos corrompidos, formatos não suportados, imagens muito pequenas (mínimo 28px) e modos de cor não suportados

Erros Comuns de Processamento
| Erro | Causa | Correção |
|---|---|---|
| Incapaz de ler o arquivo de imagem | Formato corrompido ou não suportado | Exporte novamente a partir do editor de imagens |
| Incompleto ou corrompido | O arquivo foi truncado durante a transferência | Baixe novamente o arquivo original |
| Formato de imagem não suportado | Formato que o Platform não consegue descodificar | Converte para JPG, PNG ou WebP |
| Erro de permissão de ficheiro | O ficheiro está bloqueado ou protegido contra leitura | Desbloqueia o ficheiro e envia-o novamente |
| Imagem muito pequena | Dimensão mínima abaixo de 28px | Use imagens de origem com resolução maior |
| Modo de cor não suportado | Modo de cor CMYK ou indexado | Converta para o modo RGB |
Aba de Versões#
Crie snapshots NDJSON imutáveis do seu conjunto de dados para treinamento reprodutível. Cada versão captura contagens de imagens, contagens de classes, contagens de anotações e tamanho do arquivo no momento da criação.
| Coluna | Descrição |
|---|---|
| Versão | Número da versão (v1, v2, ...) |
| Descrição | Descrição fornecida pelo usuário (editável) |
| Imagens | Contagem de imagens no momento do snapshot |
| Classes | Contagem de classes no momento do snapshot |
| Anotações | Contagem de anotações no momento do snapshot |
| Tamanho | Tamanho do arquivo de exportação NDJSON |
| Criado | Quando a versão foi criada |
| Ações | Descarregar ou restaurar |
Para criar uma versão:
- Abra a aba Versões
- Opcionalmente, insira uma descrição (por exemplo, "Adicionadas 500 imagens de treino" ou "Corrigidas classes com rótulos errados")
- Clica em New Version
- A nova versão aparece na tabela
Cada versão é numerada sequencialmente (v1, v2, v3...) e é imutável — as versões não podem ser editadas ou removidas, apenas as suas descrições podem ser alteradas. Utiliza as ações de linha para descarregar ou restaurar qualquer versão a qualquer momento.
A restauração substitui as imagens, divisões, classes e anotações atuais do conjunto de dados pelo instantâneo selecionado e não pode ser desfeita, a menos que guardes primeiro o estado atual como outra versão. O conjunto de dados fica bloqueado no estado processing enquanto é reconstruído. Nada é reenviado durante uma restauração, portanto as restaurações são normalmente rápidas mesmo em conjuntos de dados grandes.
Ativa Save Dataset Version no diálogo de Treino na Nuvem para associar um modelo ao conjunto de dados exato utilizado no treino. A Platform reutiliza uma versão correspondente quando o conteúdo do conjunto de dados não foi alterado e cria uma nova versão apenas quando este sofre alterações.
A criação e a restauração de versões estão disponíveis após o conjunto de dados atingir o estado ready. As versões não estão disponíveis para conjuntos de dados connected na nuvem ou On Premise.
Crie uma versão antes e depois de grandes alterações no seu conjunto de dados — adicionar imagens, corrigir anotações ou rebalancear divisões. Isso permite comparar o desempenho do modelo entre diferentes estados do conjunto de dados.
O tamanho exibido é o tamanho do ficheiro de exportação NDJSON, que contém URLs de imagens e anotações — e não as imagens em si. Os dados reais das imagens são armazenados separadamente e acedidos através de URLs assinados. O ficheiro de instantâneo ainda conta para a tua storage quota do espaço de trabalho, pelo que a criação de versões falha se não tiveres margem de manobra restante.
Exportar Dataset#
Exporte seu conjunto de dados para uso offline com um download NDJSON a partir do cabeçalho do conjunto de dados ou da aba Versões.
Para exportar:
- Clique no botão Download (ícone de download) no cabeçalho do conjunto de dados
- Baixe o snapshot NDJSON atual diretamente
- Use a aba Versions quando quiser um snapshot numerado e imutável que você possa baixar novamente mais tarde
O formato NDJSON armazena um objeto JSON por linha. A primeira linha contém os metadados do conjunto de dados, seguida por uma linha por imagem:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}O objeto opcional a nível de imagem metadata é preservado quando um ficheiro NDJSON é importado para o Platform. Podes inspecioná-lo ou editá-lo no painel de informações em ecrã inteiro da imagem. Para envios programáticos de arquivos, a Ingest Dataset Data API aceita o mapa de caminhos equivalente imageMetadata.
Os conjuntos de dados de pose também contêm um campo kpt_shape na linha de cabeçalho do conjunto de dados, inferido a partir das anotações quando ainda não estiver definido.
As exportações de profundidade declaram "task": "depth" e "depth_scale": 1000 na linha do conjunto de dados. Cada linha de imagem inclui um depth.url para o seu PNG uint16 simples emparelhado. O Ultralytics descarrega URLs de imagem e profundidade simultaneamente e grava um YAML de treino com a mesma escala, para que o arquivo NDJSON possa ser passado diretamente para model.train(data=...).
Os URLs de imagem no NDJSON exportado são assinados e válidos por 7 dias. O Platform reutiliza uma exportação em cache por até 6 dias quando o conjunto de dados não foi alterado, de modo que uma transferência recente tem sempre pelo menos um dia de validade restante. Se precisares de novos URLs mais cedo, altera o conjunto de dados ou cria uma nova versão.
A exportação não está disponível para conjuntos de dados On Premise, cujos bytes de imagem nunca chegam ao Platform.
Consulta a documentação do formato Ultralytics NDJSON para obteres a especificação completa.
Operações de imagem#
Ações rápidas#
Clique com o botão direito em qualquer imagem na visualização Grid ou Compact para acessar ações rápidas:
| Ação | Descrição |
|---|---|
| Move to Split | Reatribua a imagem para a divisão de Treino, Validação ou Teste |
| Download | Baixe o arquivo de imagem original |
| Delete | Exclua a imagem do conjunto de dados |

O menu de contexto da imagem opera em uma única imagem. Para operações em lote com várias imagens, use a visualização Table com seleção por checkbox.
Mover divisão em lote#
Reatribua imagens selecionadas para uma divisão diferente dentro do mesmo conjunto de dados:
- Mude para a visualização Table
- Selecione as imagens usando os checkboxes
- Clique com o botão direito para abrir o menu de contexto
- Escolhe
Move to split> Train, Validation ou Test
Também podes arrastar e largar imagens nos separadores de filtros de divisão na vista de grelha. Se mover uma imagem entrar em conflito com uma imagem idêntica já presente na divisão de destino, o Platform perguntará se pretendes ignorar, manter ambas ou substituir.
Envie todas as imagens para um conjunto de dados e, em seguida, use a movimentação em lote para organizar subconjuntos em divisões de treino, validação e teste.
Redistribuição de divisão#
Redistribua todas as imagens entre as divisões de treino, validação e teste usando proporções personalizadas:
- Clique na barra de divisão na barra de ferramentas do conjunto de dados para abrir a caixa de diálogo Redistribute Splits
- Ajuste as porcentagens da divisão usando qualquer um dos métodos abaixo
- Revise a prévia da contagem de imagens ao vivo para confirmar a distribuição
- Clique em Apply para reatribuir aleatoriamente todas as imagens de acordo com suas porcentagens
O diálogo disponibiliza três formas de definir os teus rácios de divisão alvo:
| Método | Descrição |
|---|---|
| Drag | Arraste as alças entre os segmentos coloridos para ajustar visualmente os limites da divisão |
| Type | Edite a entrada de porcentagem para qualquer divisão (as outras duas divisões são rebalanceadas automaticamente de forma proporcional) |
| Auto | Um clique para definir instantaneamente uma divisão 80/20 de treino/validação com a divisão de teste definida como 0% |
Uma prévia ao vivo mostra exatamente quantas imagens ficarão em cada divisão antes de aplicar.
Clique no botão Auto para definir instantaneamente a divisão 80/20 recomendada de treino/validação. Esta é a proporção mais comum para treinamento.
Exclusão em lote#
Exclua várias imagens de uma vez:
- Selecione imagens na visualização de tabela
- Clica com o botão direito e escolhe
Delete, ou primeCmd/Ctrl+Delete - Confirme a exclusão
URI do conjunto de dados#
Faz referência a conjuntos de dados da Platform utilizando o formato de URI ul:// (consulta Utilizar conjuntos de dados da Platform):
ul://username/datasets/dataset-slugTambém podes colar diretamente um URL web de um conjunto de dados ou modelo (por exemplo, https://platform.ultralytics.com/username/datasets/dataset-slug); este é reescrito automaticamente para o URI ul://. Passar uma lista de conjuntos de dados ajusta finamente um modelo base em cada um deles em série, por exemplo, model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Use esta URI para treinar modelos de qualquer lugar:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100O URI ul:// funciona a partir de qualquer ambiente:
- Máquina local: Treine no seu hardware, dados baixados automaticamente
- Google Colab: Acesse seus conjuntos de dados da plataforma em notebooks
- Servidores remotos: Treine em VMs em nuvem com acesso total ao conjunto de dados
Licenças disponíveis#
A plataforma suporta as seguintes licenças para conjuntos de dados:
| Licença | Tipo |
|---|---|
| Nenhuma | Nenhuma licença selecionada |
| CC0-1.0 | Domínio público |
| PDM-1.0 | Domínio público |
| CC-BY-2.5 | Permissiva |
| CC-BY-4.0 | Permissiva |
| CC-BY-NC-2.0 | Não comercial |
| CC-BY-SA-4.0 | Copyleft |
| CC-BY-NC-4.0 | Não comercial |
| CC-BY-NC-SA-3.0 | Copyleft |
| CC-BY-NC-SA-4.0 | Copyleft |
| CC-BY-ND-4.0 | Sem derivados |
| CC-BY-NC-ND-4.0 | Não comercial |
| Apache-2.0 | Permissiva |
| MIT | Permissiva |
| AGPL-3.0 | Copyleft |
| GPL-3.0 | Copyleft |
| Apenas pesquisa | Restrita |
| Outra | Personalizada |
Ao clonar um conjunto de dados com uma licença copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), o clone herda a licença e o seletor de licenças fica bloqueado.
Configurações de visibilidade#
Controle quem pode ver seu conjunto de dados:
| Configuração | Descrição |
|---|---|
| Privado | Tu e os membros autorizados do espaço de trabalho podem aceder |
| Público | Qualquer pessoa pode ver, inclusive a partir da página Explore |
A visibilidade é definida ao criar um conjunto de dados no diálogo New Dataset através de um botão de alternância. Os conjuntos de dados públicos ficam visíveis na página Explore.
Editar conjunto de dados#
Os metadados do conjunto de dados são editados em linha diretamente na página — nenhuma caixa de diálogo é necessária:
- Nome: Clica no nome do conjunto de dados para o editares. As alterações são guardadas automaticamente ao perder o foco ou em
Enter. Os nomes estão limitados a 100 caracteres. - Descrição: Clica na descrição (ou no marcador "Adicionar uma descrição...") para editar. As alterações são guardadas automaticamente. As descrições estão limitadas a 1.000 caracteres.
- Tipo de tarefa: Clique no selo da tarefa para selecionar um tipo de tarefa diferente.
- Licença: Clique no seletor de licença para alterar a licença do conjunto de dados.
- Ícone: Clica no ícone do conjunto de dados para carregar a tua própria imagem, promover uma das imagens do próprio conjunto de dados para ícone, ou escolher uma letra e cor.
Cada imagem armazena anotações para todos os tipos de tarefas em conjunto. Mudar o tipo de tarefa do conjunto de dados controla quais anotações ficam visíveis no editor e incluídas em exportações e treinamentos. As anotações para outros tipos de tarefas são preservadas na base de dados e reaparecem quando voltas a mudar. Depth é a exceção: a sua verdade fundamental (ground truth) é um ficheiro emparelhado em vez de uma anotação, pelo que um conjunto de dados só pode mudar para ou de profundidade enquanto não tiver imagens — deves reimportá-lo em vez disso.
Metadados Personalizados#
Abre Mais ações e seleciona Informação para rever duas secções:
- Metadados do Ultralytics: Detalhes da Platform apenas de leitura, tais como o ID do conjunto de dados, proprietário, tarefa, contagens de imagens e anotações, região de armazenamento e carimbos de data/hora
- Metadados Personalizados: O teu próprio objeto JSON para proveniência, condições de captura, IDs de clientes, governação ou outros dados contextuais
Os visualizadores do Workspace podem inspecionar metadados, enquanto os membros com acesso de edição podem substituir o objeto de metadados personalizados. O objeto de metadados serializado está limitado a 500.000 caracteres e cada chave de nível superior está limitada a 128 caracteres. Guarda um objeto vazio ({}) para limpar os metadados personalizados.
Clonar Dataset#
Ao visualizar um conjunto de dados público que não te pertence, clica em Clone Dataset para abrir o diálogo de clonagem. Revisa o espaço de trabalho de destino, o nome, a visibilidade e a licença, e depois confirma a clonagem. A cópia inclui todas as imagens, anotações e definições de classe. Os conjuntos de dados de origem pública permanecem públicos por predefinição em espaços de trabalho cuja visibilidade padrão seja pública; os clones em espaços de trabalho Enterprise têm como predefinição o formato privado. Se o conjunto de dados original tiver uma licença copyleft, o clone herda-a e o seletor de licença fica bloqueado.
O slug de destino é renomeado automaticamente se já estiver a ser utilizado, e a clonagem requer quota de armazenamento restante suficiente para conter a cópia.
Os conjuntos de dados suportados por fontes de armazenamento em nuvem ou On Premise não podem ser clonados, porque a Platform não retém os bytes das suas imagens.
Marcar com Estrela e Partilhar#
- Marcar com Estrela: Clica no botão de estrela para marcar um dataset como favorito. O número de estrelas é visível para todos os utilizadores.
- Partilhar: Para conjuntos de dados públicos, clica no botão de partilha para copiar uma ligação, obter um fragmento de incorporação ou partilhar em redes sociais.
Eliminar Dataset#
Apaga um dataset de que já não precises:
- Abre Mais ações (o botão
…) no cabeçalho do conjunto de dados - Escolhe Eliminar Conjunto de Dados
- Confirma na caixa de diálogo: "Isto moverá [name] para o lixo. Podes restaurá-lo no prazo de 30 dias."
O mesmo menu contém Informação, que abre a caixa de diálogo de metadados descrita em Metadados Personalizados, e Atualizar, que relê o conjunto de dados a partir do servidor.
Os conjuntos de dados eliminados são movidos para o Lixo — não são eliminados permanentemente. Podes restaurá-los no prazo de 30 dias a partir de Settings > Trash.
Treinar num Dataset#
Começa o treino diretamente a partir do teu dataset:
- Clica em
New Modelna página do conjunto de dados - Seleciona um projeto ou cria um novo
- Configura os parâmetros de treino
- Começa o treino
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffConsulta Cloud Training para obteres mais detalhes.
FAQ#
Os teus dados são processados e armazenados na região selecionada (US, EU ou AP). As imagens são:
- Validadas quanto ao formato e tamanho
- Rejeitadas se a dimensão mínima for inferior a 28px
- Normalizadas se forem maiores que 4096px (preservando a proporção; codificadas para armazenamento otimizado)
- Armazenado com desduplicação, para que as imagens idênticas sejam guardadas apenas uma vez
- Miniaturas geradas em WebP de 256px para uma navegação rápida
A Ultralytics Platform gere o armazenamento de forma eficiente:
- Deduplicação: Imagens idênticas na mesma região de dados são armazenadas uma única vez
- Integridade: Os uploads são verificados quanto à integridade dos dados
- Eficiência: Os clones reutilizam imagens armazenadas em vez de as copiar, contando ainda assim para a quota de armazenamento do espaço de trabalho de destino
- Regional: Os dados permanecem na região selecionada (US, EU ou AP)
Sim. Arrasta arquivos para a galeria do conjunto de dados ou clica no ícone de upload no cabeçalho da página, que abre o seletor de arquivos nativo do navegador diretamente. Novas estatísticas são computadas automaticamente após o processamento.
Usa a funcionalidade de mover em massa para divisão:
- Selecione imagens na visualização de tabela
- Clica com o botão direito e escolhe
Move to split - Seleciona a divisão de destino (Train, Validation ou Test)
A Ultralytics Platform suporta rótulos YOLO, COCO JSON, Ultralytics NDJSON e carregamentos de imagens em bruto. Os rótulos Pascal VOC XML são detetados mas não importados:
Um ficheiro
.txtpor imagem com coordenadas normalizadas (intervalo 0-1):Tarefa Formato Exemplo Detectar class cx cy w h0 0.5 0.5 0.2 0.3Segmentar class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Pose class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9Classificar Estrutura de diretórios train/cats/,train/dogs/Sinalizadores de visibilidade de pose: 0=não rotulado, 1=rotulado mas ocluído, 2=rotulado e visível.
Sim. Cada imagem armazena anotações para todos os 6 tipos de tarefas de anotação (detect, segment, semantic, classify, pose, OBB) em conjunto. Podes mudar o tipo de tarefa ativo do conjunto de dados a qualquer momento sem perder as anotações existentes. Apenas as anotações correspondentes ao tipo de tarefa ativo são mostradas no editor e incluídas em exportações e treinamentos — as anotações para outras tarefas são preservadas e reaparecem quando voltas a mudar.
Sim:
Limite Valor Classes por conjunto de dados 25,000 Anotações por imagem 10,000 Coordenadas por anotação 10,000 Nome do conjunto de dados 100 caracteres Descrição do conjunto de dados 1.000 caracteres Metadados personalizados 500.000 caracteres serializados Chave de nível superior de metadados 128 caracteres Os conjuntos de dados que lêem a partir de fontes de armazenamento em nuvem ou On Premise mantêm os seus píxeis fora da Platform, pelo que as funcionalidades que necessitam de cópias dos bytes de imagem pertencentes à Platform não estão disponíveis:
Funcionalidade Ligado à nuvem On Premise Anotação inteligente Indisponível Indisponível Análise de agrupamento Indisponível Indisponível Clonagem Indisponível Indisponível Instantâneos de versão Indisponível Indisponível Exportação NDJSON Disponível Indisponível A navegação, anotação manual, gestão de classes, divisões, estatísticas e treino funcionam normalmente.