YOLO Vision 2026:

Conjuntos de Dados#

Os conjuntos de dados do Ultralytics Platform fornecem uma solução otimizada para gerenciar os seus dados de treino. Após o envio, a plataforma processa imagens, rótulos e estatísticas automaticamente.

Um conjunto de dados está pronto para treino assim que o processamento for concluído e contiver pelo menos uma imagem na divisão train, pelo menos uma imagem na divisão val ou test, e pelo menos uma imagem rotulada. O cabeçalho do conjunto de dados exibe um selo Ready quando todas as três condições são atendidas, e um selo Not Ready caso contrário — clica no selo para ver exatamente qual condição está em falta.

Carregar conjunto de dados#

A Ultralytics Platform aceita múltiplos formatos de carregamento para maior flexibilidade.

Já tens dados noutro local?

Se já tens conjuntos de dados no Roboflow, usa as Integrations para importá-los diretamente — sem necessidade de exportação manual ou novo envio. Dados no Google Cloud Storage, Amazon S3 ou Azure Blob Storage podem ser usados diretamente através do Cloud storage. Os espaços de trabalho Enterprise podem usar On Premise para indexar e treinar com dados locais sem enviar pixels para a Platform.

Formatos Suportados#

FormatoExtensõesNotasTamanho máximo
JPEG.jpg, .jpegMais comum, recomendado50 MB
PNG.pngSuporta transparência50 MB
WebP.webpModerno, boa compressão50 MB
BMP.bmpSem compressão50 MB
TIFF.tiff, .tifAlta qualidade50 MB
HEIC.heicFotos de iPhone50 MB
AVIF.avifFormato de nova geração50 MB
JP2.jp2JPEG 200050 MB
DNG.dngRaw de câmara50 MB
MPO.mpoObjeto de múltiplas imagens50 MB

Suporte a Codecs de Vídeo#

A extensão de ficheiro por si só não é suficiente: um vídeo ainda pode falhar se o seu codec não puder ser descodificado durante o processamento.

Usa H.264 MP4

Vídeo H.264 num contentor MP4 tem o suporte de descodificador mais abrangente e é a escolha mais segura. Se um vídeo não for processado, recodifica-o com o FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

A preparar o teu conjunto de dados#

A plataforma suporta Ultralytics YOLO, COCO, conjuntos de dados de profundidade, Ultralytics NDJSON e carregamentos brutos (não anotados):

Usa a estrutura de diretórios padrão do YOLO com um ficheiro data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

O ficheiro YAML define a configuração do teu conjunto de dados:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Carregamentos brutos

Raw: Envia imagens não anotadas (sem rótulos). Útil quando planeias anotar diretamente na plataforma usando o editor de anotações.

Estrutura de diretórios plana

Também podes carregar imagens sem pastas de divisão explícitas. A plataforma respeita o destino de divisão ativo durante o carregamento. Se nenhum destino de divisão estiver definido e o carregamento deixar val vazio — ou com menos de dois mapas emparelhados para profundidade —, os conjuntos de dados de não classificação movem automaticamente as imagens de treino para val para que o conjunto de dados possa ser treinado imediatamente. Os conjuntos de dados de classificação são ignorados porque utilizam divisões baseadas em diretórios. Podes sempre reatribuir imagens mais tarde com bulk move-to-split ou split redistribution.

Deteção automática de formato

O formato é detetado automaticamente: os conjuntos de dados com um data.yaml contendo as chaves names, train ou val são tratados como YOLO. Os conjuntos de dados com ficheiros JSON COCO (contendo as matrizes images, annotations e categories) são tratados como COCO. As exportações .ndjson são importadas como Ultralytics NDJSON. Os conjuntos de dados apenas com imagens e sem anotações são tratados como brutos.

Quando um arquivo contém vários ficheiros YAML, o Platform prefere os nomes padrão (data.yaml, data.yml, dataset.yaml, dataset.yml) mais próximos da raiz do arquivo. Mantém um ficheiro YAML com um nome claro por arquivo para evitar ambiguidades.

O XML do Pascal VOC não é importado

Ficheiros de rótulos no formato Pascal VOC XML são detetados, mas as suas anotações não são importadas — as imagens são enviadas sem anotações. O Platform avisa-te antes de o envio começar ("Pascal VOC labels detected"). Converte primeiro o VOC XML para YOLO ou COCO; consulta format conversion tools.

Se os rótulos fizerem referência a IDs de classe, mas nenhum nome de classe for fornecido, o Platform gera nomes de espaços reservados densos (class0, class1, …) que podes mudar de nome mais tarde no Classes tab.

Para obter detalhes de formatos específicos de tarefas, consulta as tarefas suportadas e a Visão geral dos conjuntos de dados.

Processo de carregamento#

Para criar um conjunto de dados:

  1. Navega até Annotate na barra lateral
  2. Clique em New Dataset
  3. Seleciona um separador de origem de dados (consulta Data Sources abaixo)
  4. Adiciona um nome — o URL slug é derivado automaticamente e pode ser editado — além de uma descrição opcional
  5. Seleciona o tipo de tarefa (consulta supported tasks), uma licença opcional (consulta available licenses) e a visibilidade (pública ou privada)
  6. Clica em Create & Upload para ficheiros locais, Create & Import para um URL ou origem ligada, ou Create Dataset para começar vazio

Ultralytics Platform Datasets Upload Dialog Task Selector Para adicionar ficheiros a um conjunto de dados existente, abre a respetiva página do conjunto de dados e arrasta os ficheiros para a galeria ou clica no ícone de envio no cabeçalho da página. O ícone de envio abre diretamente o seletor de ficheiros nativo do teu navegador, pois a tarefa do conjunto de dados já está definida.

Fontes de dados#

O diálogo New Dataset oferece quatro origens:

OrigemDescrição
UploadArrasta ficheiros para a área ou procura por eles — imagens, vídeos, arquivos ou NDJSON
URLCopia um link direto para um ficheiro .zip, .tar, .tar.gz, .tgz ou .ndjson; o Platform descarrega-o e ingere-o no lado do servidor
CloudUtiliza dados no local a partir do Google Cloud Storage, Amazon S3 ou Azure Blob Storage (Pro e Enterprise)
On PremiseIndexa e treina com dados que nunca saem das tuas próprias máquinas através de trabalhadores On Premise (Enterprise)
Limites de importação de URL

A importação por URL é limitada tanto pelo limite por envio do teu plano (10 GB Gratuito / 20 GB Pro / 50 GB Enterprise) quanto pela tua quota de armazenamento restante, o que for menor. O link deve estar publicamente acessível via HTTP ou HTTPS e terminar com uma extensão suportada.

Antes de o envio começar#

O Platform valida os teus ficheiros no navegador antes de enviar qualquer coisa, para que os problemas comuns apareçam imediatamente em vez de após uma longa transferência. Os arquivos são verificados quanto a corrupção, tamanho vazio, proteção por senha e erros de sintaxe YAML, e os ficheiros excessivamente grandes são listados pelo nome.

Dois diálogos podem aparecer em seguida:

Quando o arquivo declara nomes de classes e o teu conjunto de dados já tem classes, o diálogo Map imported classes lista uma linha por classe recebida. Para cada uma, escolhe uma classe existente para mesclar, cria uma nova classe ou ignora-a. Correspondências exatas de nomes vêm pré-selecionadas, e as classes ignoradas e as suas anotações não são importadas.

Após o envio, a plataforma processa os teus dados automaticamente:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Validação: Verificações de formato e tamanho
  2. Normalização: Imagens grandes redimensionadas (máx. 4096px, dimensão mín. 28px), escala de cinzentos expandida para RGB, transparência achatada sobre fundo branco e orientação EXIF aplicada
  3. Miniaturas: Pré-visualizações WebP de 256px geradas
  4. Análise de rótulos: Rótulos do YOLO, COCO e NDJSON extraídos
  5. Estatísticas: Distribuições de classes e dimensões das imagens calculadas
Codificação de imagem armazenada

Os originais AVIF e WebP são armazenados byte a byte quando não é necessário redimensionamento ou alteração de cor. Tudo o resto é recodificado — fontes WebP continuam WebP, e todos os outros formatos (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) tornam-se JPEG com qualidade 92. O teu nome de ficheiro original e a extensão de origem são mantidos como metadados.

Ultralytics Platform Datasets Upload Progress Bar

Validar antes de carregar

Podes validar o teu conjunto de dados localmente antes de o carregares:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Requisitos de tamanho de imagem

As imagens devem ter pelo menos 28px no seu lado mais curto. Imagens menores do que isto são rejeitadas durante o processamento. Imagens maiores do que 4096px no seu lado mais longo são redimensionadas automaticamente com a proporção preservada.

Vê as imagens do teu conjunto de dados em múltiplos layouts.

Abre o painel Clustering a partir da barra de ferramentas da galeria para explorar o teu conjunto de dados como um gráfico de dispersão 2D interativo.

VerDescrição
GrelhaGrelha de miniaturas com sobreposições de anotação (padrão)
CompactoMiniaturas menores para leitura rápida
TabelaLista com miniatura, nome do ficheiro, dimensões, tamanho, divisão, classes e contagens de rótulos

Ultralytics Platform Datasets Gallery Grid View With Annotations

Ordenação e filtragem#

As imagens podem ser ordenadas e filtradas para uma navegação eficiente:

Cada opção alterna entre ascendente (↑) e descendente (↓):

OrdenarDescrição
Criado ↑/↓Ordem de envio (padrão ↓)
Nome ↑/↓Nome do arquivo alfabético
Altura ↑/↓Altura da imagem em pixels
Largura ↑/↓Largura da imagem em pixels
Tamanho ↑/↓Tamanho do arquivo em disco
Anotações ↑/↓Contagem de anotações por imagem
Datasets Grandes

Para conjuntos de dados com mais de 100.000 imagens, as ordenações por nome, largura, altura e tamanho são ocultadas para manter a galeria responsiva. As ordenações por data de criação e contagem de anotações permanecem disponíveis.

Encontrando Imagens Não Rotuladas

Usa o conjunto de filtros Annotations definido como Unannotated para encontrar rapidamente imagens que ainda precisam de anotação. Isto é especialmente útil para grandes conjuntos de dados onde queres monitorizar o progresso da rotulagem.

A pesquisar Metadados Personalizados

A caixa de pesquisa fica à direita da barra de ferramentas da galeria e filtra todos os modos de visualização — grelha, compacto e tabela. Ela corresponde ao nome do ficheiro da imagem (a extensão do ficheiro é opcional), bem como a chaves de metadados personalizados, valores escalares e entradas de matriz, de modo que uma imagem chamada img_0042 que contenha {"ship_type": "yacht"} é encontrada pesquisando por img_0042 ou yacht.

Valores aninhados dentro de subobjetos não são correspondidos. Colar um ID de imagem de 24 caracteres procura essa imagem exata diretamente, ignorando a pesquisa de texto.

Visualizador em Tela Cheia#

Clique em qualquer imagem para abrir o visualizador em tela cheia com:

  • Navegação: Teclas de seta ou visualizações em miniatura para navegar
  • Informações da imagem: Reveem as propriedades geradas pela Platform, metadados personalizados e metadados de ficheiro incorporados, como EXIF
  • Metadados personalizados: Os proprietários e editores podem adicionar ou substituir um objeto JSON, incluindo valores aninhados até 500.000 caracteres serializados e chaves de nível superior até 128 caracteres
  • Anotações: Alternar a visibilidade da sobreposição de anotações
  • Detalhamento de Classe: Contagem de rótulos por classe com indicadores de cor
  • Annotate: Quando tens acesso de edição, os controlos de anotação ficam ativos imediatamente quando o visualizador em tela cheia é aberto no desktop
  • Download: Baixe o arquivo da imagem original
  • Excluir: Exclua a imagem do dataset
  • Zoom: Cmd/Ctrl+Scroll, Cmd/Ctrl++ ou Cmd/Ctrl+= para aproximar e Cmd/Ctrl+- para afastar
  • Repor vista: Cmd/Ctrl + 0 ou o botão de reposição para ajustar a imagem ao visualizador
  • Deslocamento (Pan): Mantém pressionado Space e arrasta para deslocar a tela quando estiver com zoom
  • Visualização de pixel: Alternar a renderização pixelada para inspeção detalhada
  • Cortina de profundidade: Em conjuntos de dados de profundidade, um divisor arrastável limpa e alterna entre a imagem RGB e o seu mapa de profundidade colorizado

Ultralytics Platform Datasets Fullscreen Viewer With Metadata Panel

Filtrar por Divisão#

Filtrar imagens por sua divisão de dataset:

DivisãoObjetivo
TreinarUsado para treinamento de modelo
ValUsado para validação durante o treinamento
TesteUsado para avaliação final

Clustering#

O painel Clustering projeta o teu conjunto de dados num gráfico de dispersão 2D interativo, onde imagens visualmente semelhantes ficam próximas umas das outras. Usa-o para detetar aglomerados, identificar duplicados e valores atípicos, e inspecionar como as divisões ou classes estão distribuídas pelos teus dados — sem sair da galeria. Abre-o a partir do ícone de gráfico de dispersão na barra de ferramentas da galeria em qualquer página de conjunto de dados.

Ultralytics Platform Datasets Clustering Empty State

Executando Análise#

Inicie uma análise:

  1. Abra um dataset e clique no ícone de gráfico de dispersão na barra de ferramentas da galeria
  2. Clique em Analyze Dataset
  3. Aguarde a barra de progresso terminar — os resultados aparecem no mesmo painel

A análise é executada em segundo plano em duas etapas, Computing embeddings e Clustering, podendo demorar alguns minutos dependendo do tamanho do teu conjunto de dados. Podes fechar o painel ou sair da página e voltar mais tarde.

Requisitos de análise

Um conjunto de dados precisa de pelo menos 20 e no máximo 200.000 imagens sem erros para ser analisado. Connected datasets suportados por armazenamento em nuvem ou On Premise ainda não são suportados.

Visualização#

Assim que a análise for concluída, o painel exibe um gráfico de dispersão 2D de todas as imagens analisadas com uma legenda e um contador de pontos. Os filtros da galeria (divisão, classe, rotulado/não rotulado) esmaecem os pontos fora do filtro para que possas focar-te no subconjunto que te interessa — o contador exibe então visible / total points.

Ultralytics Platform Datasets Clustering Scatter Plot

Colorir Por#

Altera a forma como os pontos de dados são coloridos com o menu suspensivo Color by na barra de ferramentas do painel. Alterna entre os modos de visualização a qualquer momento — o gráfico é recolorido instantaneamente para que possas ver como as divisões, classes ou propriedades de imagem estão distribuídas pelos teus aglomerados:

OpçãoSombreamento
DivisõesTreino / Val / Teste
ClassesPrimeira classe de anotação em cada imagem
LarguraLargura da imagem
AlturaAltura da imagem
TamanhoTamanho do arquivo
AnotaçõesNúmero de anotações por imagem

Ultralytics Platform Datasets Clustering Color Modes

Seleção de Laço (Lasso)#

Desenha uma seleção de forma livre em torno de uma região para destacar pontos no gráfico. A galeria filtra as imagens correspondentes para que possas inspecioná-las, rotulá-las novamente, movê-las ou eliminá-las usando as operações de imagem habituais.

Limpar Seleção

Um chip acima do gráfico mostra quantos pontos estão selecionados — clica em × para limpar o laço e voltar à vista de galeria completa.

Tamanho da seleção

Uma seleção em laço (lasso) resulta num máximo de 1.000 imagens. Se a tua seleção corresponder a mais, o Platform mostra uma amostra de 1.000 e sugere desenhar uma região menor.

Pan e Zoom#

Navega por dispersões grandes diretamente com o rato e o teclado, ou com os botões de zoom no canto inferior esquerdo do gráfico:

EntradaAção
ScrollMover o gráfico em 2D
Cmd/Ctrl+ScrollAumentar ou diminuir zoom, ancorado no cursor
Manter EspaçoAlternar para o modo arrastar para mover
Botão RedefinirRetornar à extensão total do gráfico

Reanalisando#

Se o teu conjunto de dados mudar após a análise — novas imagens chegam ou a contagem analisada deixa de corresponder ao conjunto de dados — um botão Re-analyze aparece na parte superior do painel para proprietários e editores.

Clica em Re-analyze para recalcular as incorporações (embeddings) e a projeção 2D de raiz.

Abas do Dataset#

Cada página de dataset pode exibir até seis abas, dependendo do estado do dataset e das suas permissões:

Aba de Imagens#

A visualização padrão mostrando a galeria de imagens com sobreposições de anotação. Suporta modos de visualização em grade, compacto e tabela. Arraste e solte arquivos aqui para adicionar mais imagens.

Aba de Classes#

Este separador aparece quando o conjunto de dados tem imagens e a respetiva tarefa tem classes.

Gerencie as classes de anotação para seu dataset:

  • Histograma de classes: Gráfico de barras que mostra a contagem de anotações por classe, ordenadas por frequência, com um alternador de escala linear/logarítmica
  • Tabela de classes: Tabela classificável e pesquisável com índice, nome, contagem de anotações e contagem de imagens
  • Editar nomes de classes: Clique em qualquer nome de classe para renomeá-lo diretamente
  • Editar cores de classes: Clique em uma amostra de cor para alterar a cor da classe
  • Adicionar nova classe: Use a entrada na parte inferior para adicionar classes
  • Mesclar classes: Seleciona duas ou mais linhas e clica em Merge into one
  • Eliminar classes: Seleciona uma ou mais linhas e clica em Delete

Ultralytics Platform Datasets Classes Tab Histogram And Table

Escala Logarítmica para Conjuntos de Dados Desbalanceados

Se o teu conjunto de dados tiver desequilíbrio de classes (por exemplo, 10.000 anotações de "pessoa", mas apenas 50 de "bicicleta"), usa o botão de alternância Log Scale no histograma de classes para visualizar todas as classes com clareza.

Mesclar classes#

A mesclagem consolida rótulos duplicados ou sobrepostos — por exemplo, combinando car, automobile e vehicle numa única classe:

  1. Seleciona duas ou mais classes usando as caixas de seleção de linha
  2. Clica em Merge into one no cabeçalho da tabela ou clica com o botão direito na seleção
  3. Escolhe qual das classes selecionadas é o destino para o qual as outras serão mescladas
  4. Confirma

Cada anotação pertencente às classes de origem é reatribuída à classe de destino, e as classes de origem são removidas. Nenhuma anotação é eliminada, portanto a contagem total de anotações do conjunto de dados permanece inalterada.

Eliminar classes#

  1. Seleciona uma ou mais classes usando as caixas de seleção de linha
  2. Clica em Delete no cabeçalho da tabela ou clica com o botão direito na seleção
  3. Confirma

Eliminar uma classe remove a classe e todas as suas anotações. Para conjuntos de dados de classificação, os rótulos são removidos, mas as imagens permanecem, tornando-se não rotuladas.

Deslocamento de índices de classe

Os IDs de classe são posicionais. Mesclar ou eliminar uma classe desloca cada índice de classe superior para baixo para preencher a lacuna, de modo que exportações e ficheiros de rótulos escritos antes da alteração deixam de coincidir com os novos índices. Cria primeiro uma version se precisares da numeração antiga.

Amostragem de estatísticas

As contagens de classes são calculadas a partir de no máximo 100.000 imagens. Em conjuntos de dados maiores, uma nota acima do histograma diz "Com base num subconjunto de 100.000 imagens deste conjunto de dados."

Aba de Gráficos#

Esta aba aparece quando o dataset possui imagens.

Estatísticas automáticas calculadas a partir do seu conjunto de dados:

Os gráficos aparecem nesta ordem, e cada um é omitido quando o conjunto de dados não possui dados para ele — um conjunto de dados de imagens puras não mostra gráficos de anotações, e Points per Instance aparece apenas para dados de segmentação e pose:

GráficoDescrição
Distribuição de Divisão (Split Distribution)Gráfico de rosca com contagens de imagens de treino/validação/teste e porcentagem rotulada
Principais ClassesGráfico de rosca das 10 classes de anotação mais frequentes, com o restante como "Outros"
Dimensões da ImagemHistograma da distribuição de largura e altura da imagem (sobreposto) com média
Tamanho do Arquivo de ImagemHistograma da distribuição do tamanho dos arquivos de imagem
Dimensões da Imagem 2DMapa de calor 2D de largura vs altura com linhas guia de proporção
Localizações de AnotaçãoMapa de calor 2D das posições centrais das BBox
Formatos de ImagemDistribuição dos formatos de imagem de origem (JPG, PNG, etc.)
Dimensões da Bounding BoxHistograma da largura e altura das bounding boxes (sobreposto)
Objetos por ImagemHistograma da contagem de anotações por imagem
Pontos por InstânciaContagem de vértices de polígono ou keypoints por anotação (segmentação/pose)

Ultralytics Platform Datasets Charts Tab Statistics Grid

Cache de Estatísticas

O Platform armazena em cache as estatísticas calculadas e invalida-as quando imagens, anotações, classes ou divisões são alteradas. Em conjuntos de dados maiores que 100.000 imagens, os gráficos são calculados a partir de um subconjunto de 100.000 imagens, indicado acima da grelha.

Mapas de Calor em Tela Cheia

Clique no botão de expandir em qualquer mapa de calor para visualizá-lo em modo de tela cheia. Isso oferece uma visualização maior e mais detalhada — útil para entender padrões espaciais em grandes conjuntos de dados.

Aba de Modelos#

Veja todos os modelos treinados neste conjunto de dados em uma tabela pesquisável:

ColunaDescrição
NomeNome do modelo com link
ProjetoProjeto pai com ícone
VersãoVersão de dataset imutável usada para treinamento, se houver
StatusBadge de status de treinamento
TarefaTipo de tarefa YOLO
ÉpocasMelhor época / total de épocas
mAP50-95Precisão média (mean average precision)
mAP50mAP com IoU 0.50
CriadoData de criação

Ultralytics Platform Datasets Models Tab Trained Models Table

Aba de Erros#

Esta aba aparece apenas quando um ou mais arquivos falham no processamento.

Imagens que falharam no processamento são listadas aqui com:

  • Banner de erro: Contagem total de imagens com falha e orientação
  • Tabela de erros: Nome do arquivo, descrição amigável do erro, dicas de correção e miniatura de visualização
  • Erros comuns incluem arquivos corrompidos, formatos não suportados, imagens muito pequenas (mínimo 28px) e modos de cor não suportados

Ultralytics Platform Datasets Errors Tab Processing Failures

Erros Comuns de Processamento
ErroCausaCorreção
Incapaz de ler o arquivo de imagemFormato corrompido ou não suportadoExporte novamente a partir do editor de imagens
Incompleto ou corrompidoO arquivo foi truncado durante a transferênciaBaixe novamente o arquivo original
Formato de imagem não suportadoFormato que o Platform não consegue descodificarConverte para JPG, PNG ou WebP
Erro de permissão de ficheiroO ficheiro está bloqueado ou protegido contra leituraDesbloqueia o ficheiro e envia-o novamente
Imagem muito pequenaDimensão mínima abaixo de 28pxUse imagens de origem com resolução maior
Modo de cor não suportadoModo de cor CMYK ou indexadoConverta para o modo RGB

Aba de Versões#

Crie snapshots NDJSON imutáveis do seu conjunto de dados para treinamento reprodutível. Cada versão captura contagens de imagens, contagens de classes, contagens de anotações e tamanho do arquivo no momento da criação.

ColunaDescrição
VersãoNúmero da versão (v1, v2, ...)
DescriçãoDescrição fornecida pelo usuário (editável)
ImagensContagem de imagens no momento do snapshot
ClassesContagem de classes no momento do snapshot
AnotaçõesContagem de anotações no momento do snapshot
TamanhoTamanho do arquivo de exportação NDJSON
CriadoQuando a versão foi criada
AçõesDescarregar ou restaurar

Para criar uma versão:

  1. Abra a aba Versões
  2. Opcionalmente, insira uma descrição (por exemplo, "Adicionadas 500 imagens de treino" ou "Corrigidas classes com rótulos errados")
  3. Clica em New Version
  4. A nova versão aparece na tabela

Cada versão é numerada sequencialmente (v1, v2, v3...) e é imutável — as versões não podem ser editadas ou removidas, apenas as suas descrições podem ser alteradas. Utiliza as ações de linha para descarregar ou restaurar qualquer versão a qualquer momento.

A restaurar uma Versão

A restauração substitui as imagens, divisões, classes e anotações atuais do conjunto de dados pelo instantâneo selecionado e não pode ser desfeita, a menos que guardes primeiro o estado atual como outra versão. O conjunto de dados fica bloqueado no estado processing enquanto é reconstruído. Nada é reenviado durante uma restauração, portanto as restaurações são normalmente rápidas mesmo em conjuntos de dados grandes.

Salvar uma Versão Durante o Treinamento

Ativa Save Dataset Version no diálogo de Treino na Nuvem para associar um modelo ao conjunto de dados exato utilizado no treino. A Platform reutiliza uma versão correspondente quando o conteúdo do conjunto de dados não foi alterado e cria uma nova versão apenas quando este sofre alterações.

Apenas Conjuntos de Dados Prontos

A criação e a restauração de versões estão disponíveis após o conjunto de dados atingir o estado ready. As versões não estão disponíveis para conjuntos de dados connected na nuvem ou On Premise.

Quando Criar Versões

Crie uma versão antes e depois de grandes alterações no seu conjunto de dados — adicionar imagens, corrigir anotações ou rebalancear divisões. Isso permite comparar o desempenho do modelo entre diferentes estados do conjunto de dados.

Tamanho do Arquivo NDJSON

O tamanho exibido é o tamanho do ficheiro de exportação NDJSON, que contém URLs de imagens e anotações — e não as imagens em si. Os dados reais das imagens são armazenados separadamente e acedidos através de URLs assinados. O ficheiro de instantâneo ainda conta para a tua storage quota do espaço de trabalho, pelo que a criação de versões falha se não tiveres margem de manobra restante.

Exportar Dataset#

Exporte seu conjunto de dados para uso offline com um download NDJSON a partir do cabeçalho do conjunto de dados ou da aba Versões.

Para exportar:

  1. Clique no botão Download (ícone de download) no cabeçalho do conjunto de dados
  2. Baixe o snapshot NDJSON atual diretamente
  3. Use a aba Versions quando quiser um snapshot numerado e imutável que você possa baixar novamente mais tarde

Ultralytics Platform Datasets Export Ndjson Download O formato NDJSON armazena um objeto JSON por linha. A primeira linha contém os metadados do conjunto de dados, seguida por uma linha por imagem:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

O objeto opcional a nível de imagem metadata é preservado quando um ficheiro NDJSON é importado para o Platform. Podes inspecioná-lo ou editá-lo no painel de informações em ecrã inteiro da imagem. Para envios programáticos de arquivos, a Ingest Dataset Data API aceita o mapa de caminhos equivalente imageMetadata.

Os conjuntos de dados de pose também contêm um campo kpt_shape na linha de cabeçalho do conjunto de dados, inferido a partir das anotações quando ainda não estiver definido.

As exportações de profundidade declaram "task": "depth" e "depth_scale": 1000 na linha do conjunto de dados. Cada linha de imagem inclui um depth.url para o seu PNG uint16 simples emparelhado. O Ultralytics descarrega URLs de imagem e profundidade simultaneamente e grava um YAML de treino com a mesma escala, para que o arquivo NDJSON possa ser passado diretamente para model.train(data=...).

URLs assinadas

Os URLs de imagem no NDJSON exportado são assinados e válidos por 7 dias. O Platform reutiliza uma exportação em cache por até 6 dias quando o conjunto de dados não foi alterado, de modo que uma transferência recente tem sempre pelo menos um dia de validade restante. Se precisares de novos URLs mais cedo, altera o conjunto de dados ou cria uma nova versão.

Conjuntos de dados On Premise

A exportação não está disponível para conjuntos de dados On Premise, cujos bytes de imagem nunca chegam ao Platform.

Consulta a documentação do formato Ultralytics NDJSON para obteres a especificação completa.

Operações de imagem#

Ações rápidas#

Clique com o botão direito em qualquer imagem na visualização Grid ou Compact para acessar ações rápidas:

AçãoDescrição
Move to SplitReatribua a imagem para a divisão de Treino, Validação ou Teste
DownloadBaixe o arquivo de imagem original
DeleteExclua a imagem do conjunto de dados

Ultralytics Platform Datasets Image Card Context Menu

Individual vs em lote

O menu de contexto da imagem opera em uma única imagem. Para operações em lote com várias imagens, use a visualização Table com seleção por checkbox.

Mover divisão em lote#

Reatribua imagens selecionadas para uma divisão diferente dentro do mesmo conjunto de dados:

  1. Mude para a visualização Table
  2. Selecione as imagens usando os checkboxes
  3. Clique com o botão direito para abrir o menu de contexto
  4. Escolhe Move to split > Train, Validation ou Test

Também podes arrastar e largar imagens nos separadores de filtros de divisão na vista de grelha. Se mover uma imagem entrar em conflito com uma imagem idêntica já presente na divisão de destino, o Platform perguntará se pretendes ignorar, manter ambas ou substituir.

Organizando divisões de Treino/Validação

Envie todas as imagens para um conjunto de dados e, em seguida, use a movimentação em lote para organizar subconjuntos em divisões de treino, validação e teste.

Redistribuição de divisão#

Redistribua todas as imagens entre as divisões de treino, validação e teste usando proporções personalizadas:

  1. Clique na barra de divisão na barra de ferramentas do conjunto de dados para abrir a caixa de diálogo Redistribute Splits
  2. Ajuste as porcentagens da divisão usando qualquer um dos métodos abaixo
  3. Revise a prévia da contagem de imagens ao vivo para confirmar a distribuição
  4. Clique em Apply para reatribuir aleatoriamente todas as imagens de acordo com suas porcentagens

Ultralytics Platform Datasets Split Redistribution Dialog O diálogo disponibiliza três formas de definir os teus rácios de divisão alvo:

MétodoDescrição
DragArraste as alças entre os segmentos coloridos para ajustar visualmente os limites da divisão
TypeEdite a entrada de porcentagem para qualquer divisão (as outras duas divisões são rebalanceadas automaticamente de forma proporcional)
AutoUm clique para definir instantaneamente uma divisão 80/20 de treino/validação com a divisão de teste definida como 0%

Uma prévia ao vivo mostra exatamente quantas imagens ficarão em cada divisão antes de aplicar.

Divisão rápida 80/20

Clique no botão Auto para definir instantaneamente a divisão 80/20 recomendada de treino/validação. Esta é a proporção mais comum para treinamento.

Exclusão em lote#

Exclua várias imagens de uma vez:

  1. Selecione imagens na visualização de tabela
  2. Clica com o botão direito e escolhe Delete, ou prime Cmd/Ctrl+Delete
  3. Confirme a exclusão

URI do conjunto de dados#

Faz referência a conjuntos de dados da Platform utilizando o formato de URI ul:// (consulta Utilizar conjuntos de dados da Platform):

ul://username/datasets/dataset-slug

Também podes colar diretamente um URL web de um conjunto de dados ou modelo (por exemplo, https://platform.ultralytics.com/username/datasets/dataset-slug); este é reescrito automaticamente para o URI ul://. Passar uma lista de conjuntos de dados ajusta finamente um modelo base em cada um deles em série, por exemplo, model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Use esta URI para treinar modelos de qualquer lugar:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Treine de qualquer lugar com dados da plataforma

O URI ul:// funciona a partir de qualquer ambiente:

  • Máquina local: Treine no seu hardware, dados baixados automaticamente
  • Google Colab: Acesse seus conjuntos de dados da plataforma em notebooks
  • Servidores remotos: Treine em VMs em nuvem com acesso total ao conjunto de dados

Licenças disponíveis#

A plataforma suporta as seguintes licenças para conjuntos de dados:

LicençaTipo
NenhumaNenhuma licença selecionada
CC0-1.0Domínio público
PDM-1.0Domínio público
CC-BY-2.5Permissiva
CC-BY-4.0Permissiva
CC-BY-NC-2.0Não comercial
CC-BY-SA-4.0Copyleft
CC-BY-NC-4.0Não comercial
CC-BY-NC-SA-3.0Copyleft
CC-BY-NC-SA-4.0Copyleft
CC-BY-ND-4.0Sem derivados
CC-BY-NC-ND-4.0Não comercial
Apache-2.0Permissiva
MITPermissiva
AGPL-3.0Copyleft
GPL-3.0Copyleft
Apenas pesquisaRestrita
OutraPersonalizada
Licenças Copyleft

Ao clonar um conjunto de dados com uma licença copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), o clone herda a licença e o seletor de licenças fica bloqueado.

Configurações de visibilidade#

Controle quem pode ver seu conjunto de dados:

ConfiguraçãoDescrição
PrivadoTu e os membros autorizados do espaço de trabalho podem aceder
PúblicoQualquer pessoa pode ver, inclusive a partir da página Explore

A visibilidade é definida ao criar um conjunto de dados no diálogo New Dataset através de um botão de alternância. Os conjuntos de dados públicos ficam visíveis na página Explore.

Editar conjunto de dados#

Os metadados do conjunto de dados são editados em linha diretamente na página — nenhuma caixa de diálogo é necessária:

  • Nome: Clica no nome do conjunto de dados para o editares. As alterações são guardadas automaticamente ao perder o foco ou em Enter. Os nomes estão limitados a 100 caracteres.
  • Descrição: Clica na descrição (ou no marcador "Adicionar uma descrição...") para editar. As alterações são guardadas automaticamente. As descrições estão limitadas a 1.000 caracteres.
  • Tipo de tarefa: Clique no selo da tarefa para selecionar um tipo de tarefa diferente.
  • Licença: Clique no seletor de licença para alterar a licença do conjunto de dados.
  • Ícone: Clica no ícone do conjunto de dados para carregar a tua própria imagem, promover uma das imagens do próprio conjunto de dados para ícone, ou escolher uma letra e cor.
Alterando o tipo de tarefa

Cada imagem armazena anotações para todos os tipos de tarefas em conjunto. Mudar o tipo de tarefa do conjunto de dados controla quais anotações ficam visíveis no editor e incluídas em exportações e treinamentos. As anotações para outros tipos de tarefas são preservadas na base de dados e reaparecem quando voltas a mudar. Depth é a exceção: a sua verdade fundamental (ground truth) é um ficheiro emparelhado em vez de uma anotação, pelo que um conjunto de dados só pode mudar para ou de profundidade enquanto não tiver imagens — deves reimportá-lo em vez disso.

Metadados Personalizados#

Abre Mais ações e seleciona Informação para rever duas secções:

  • Metadados do Ultralytics: Detalhes da Platform apenas de leitura, tais como o ID do conjunto de dados, proprietário, tarefa, contagens de imagens e anotações, região de armazenamento e carimbos de data/hora
  • Metadados Personalizados: O teu próprio objeto JSON para proveniência, condições de captura, IDs de clientes, governação ou outros dados contextuais

Os visualizadores do Workspace podem inspecionar metadados, enquanto os membros com acesso de edição podem substituir o objeto de metadados personalizados. O objeto de metadados serializado está limitado a 500.000 caracteres e cada chave de nível superior está limitada a 128 caracteres. Guarda um objeto vazio ({}) para limpar os metadados personalizados.

Clonar Dataset#

Ao visualizar um conjunto de dados público que não te pertence, clica em Clone Dataset para abrir o diálogo de clonagem. Revisa o espaço de trabalho de destino, o nome, a visibilidade e a licença, e depois confirma a clonagem. A cópia inclui todas as imagens, anotações e definições de classe. Os conjuntos de dados de origem pública permanecem públicos por predefinição em espaços de trabalho cuja visibilidade padrão seja pública; os clones em espaços de trabalho Enterprise têm como predefinição o formato privado. Se o conjunto de dados original tiver uma licença copyleft, o clone herda-a e o seletor de licença fica bloqueado.

O slug de destino é renomeado automaticamente se já estiver a ser utilizado, e a clonagem requer quota de armazenamento restante suficiente para conter a cópia.

Conjuntos de Dados Ligados

Os conjuntos de dados suportados por fontes de armazenamento em nuvem ou On Premise não podem ser clonados, porque a Platform não retém os bytes das suas imagens.

Marcar com Estrela e Partilhar#

  • Marcar com Estrela: Clica no botão de estrela para marcar um dataset como favorito. O número de estrelas é visível para todos os utilizadores.
  • Partilhar: Para conjuntos de dados públicos, clica no botão de partilha para copiar uma ligação, obter um fragmento de incorporação ou partilhar em redes sociais.

Eliminar Dataset#

Apaga um dataset de que já não precises:

  1. Abre Mais ações (o botão ) no cabeçalho do conjunto de dados
  2. Escolhe Eliminar Conjunto de Dados
  3. Confirma na caixa de diálogo: "Isto moverá [name] para o lixo. Podes restaurá-lo no prazo de 30 dias."

O mesmo menu contém Informação, que abre a caixa de diálogo de metadados descrita em Metadados Personalizados, e Atualizar, que relê o conjunto de dados a partir do servidor.

Lixo e Restauro

Os conjuntos de dados eliminados são movidos para o Lixo — não são eliminados permanentemente. Podes restaurá-los no prazo de 30 dias a partir de Settings > Trash.

Treinar num Dataset#

Começa o treino diretamente a partir do teu dataset:

  1. Clica em New Model na página do conjunto de dados
  2. Seleciona um projeto ou cria um novo
  3. Configura os parâmetros de treino
  4. Começa o treino
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Consulta Cloud Training para obteres mais detalhes.

FAQ#

  • Os teus dados são processados e armazenados na região selecionada (US, EU ou AP). As imagens são:

    1. Validadas quanto ao formato e tamanho
    2. Rejeitadas se a dimensão mínima for inferior a 28px
    3. Normalizadas se forem maiores que 4096px (preservando a proporção; codificadas para armazenamento otimizado)
    4. Armazenado com desduplicação, para que as imagens idênticas sejam guardadas apenas uma vez
    5. Miniaturas geradas em WebP de 256px para uma navegação rápida
  • A Ultralytics Platform gere o armazenamento de forma eficiente:

    • Deduplicação: Imagens idênticas na mesma região de dados são armazenadas uma única vez
    • Integridade: Os uploads são verificados quanto à integridade dos dados
    • Eficiência: Os clones reutilizam imagens armazenadas em vez de as copiar, contando ainda assim para a quota de armazenamento do espaço de trabalho de destino
    • Regional: Os dados permanecem na região selecionada (US, EU ou AP)
  • Sim. Arrasta arquivos para a galeria do conjunto de dados ou clica no ícone de upload no cabeçalho da página, que abre o seletor de arquivos nativo do navegador diretamente. Novas estatísticas são computadas automaticamente após o processamento.

  • Usa a funcionalidade de mover em massa para divisão:

    1. Selecione imagens na visualização de tabela
    2. Clica com o botão direito e escolhe Move to split
    3. Seleciona a divisão de destino (Train, Validation ou Test)
  • A Ultralytics Platform suporta rótulos YOLO, COCO JSON, Ultralytics NDJSON e carregamentos de imagens em bruto. Os rótulos Pascal VOC XML são detetados mas não importados:

    Um ficheiro .txt por imagem com coordenadas normalizadas (intervalo 0-1):

    TarefaFormatoExemplo
    Detectarclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentarclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Poseclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    ClassificarEstrutura de diretóriostrain/cats/, train/dogs/

    Sinalizadores de visibilidade de pose: 0=não rotulado, 1=rotulado mas ocluído, 2=rotulado e visível.

  • Sim. Cada imagem armazena anotações para todos os 6 tipos de tarefas de anotação (detect, segment, semantic, classify, pose, OBB) em conjunto. Podes mudar o tipo de tarefa ativo do conjunto de dados a qualquer momento sem perder as anotações existentes. Apenas as anotações correspondentes ao tipo de tarefa ativo são mostradas no editor e incluídas em exportações e treinamentos — as anotações para outras tarefas são preservadas e reaparecem quando voltas a mudar.

  • Sim:

    LimiteValor
    Classes por conjunto de dados25,000
    Anotações por imagem10,000
    Coordenadas por anotação10,000
    Nome do conjunto de dados100 caracteres
    Descrição do conjunto de dados1.000 caracteres
    Metadados personalizados500.000 caracteres serializados
    Chave de nível superior de metadados128 caracteres
  • Os conjuntos de dados que lêem a partir de fontes de armazenamento em nuvem ou On Premise mantêm os seus píxeis fora da Platform, pelo que as funcionalidades que necessitam de cópias dos bytes de imagem pertencentes à Platform não estão disponíveis:

    FuncionalidadeLigado à nuvemOn Premise
    Anotação inteligenteIndisponívelIndisponível
    Análise de agrupamentoIndisponívelIndisponível
    ClonagemIndisponívelIndisponível
    Instantâneos de versãoIndisponívelIndisponível
    Exportação NDJSONDisponívelIndisponível

    A navegação, anotação manual, gestão de classes, divisões, estatísticas e treino funcionam normalmente.

Comentários