Ultralytics YOLO27:

Conjuntos de dados#

Os conjuntos de dados da Ultralytics Platform fornecem uma solução simplificada para gerir os teus dados de treino. Após o carregamento, a plataforma processa automaticamente imagens, etiquetas e estatísticas.

Um conjunto de dados está pronto para treino quando o processamento termina e contém pelo menos uma imagem na divisão train, pelo menos uma imagem na divisão val ou test, e pelo menos uma imagem etiquetada. O cabeçalho do conjunto de dados apresenta um emblema Ready quando as três condições são cumpridas e um emblema Not Ready caso contrário — clica no emblema para veres exatamente qual condição está em falta.

Recolhe imagens com agentes#

Usa Agents para adicionar imagens a um conjunto de dados quando a deteção de um modelo cumpre uma condição, como uma confiança dentro de um intervalo escolhido. Liga a condição a um bloco Dataset e seleciona um destino que podes editar. As imagens chegam sem etiquetas na divisão train; as cópias existentes são ignoradas. Revisa e etiqueta as imagens com o editor de anotações existente.

Carregar conjunto de dados#

A Ultralytics Platform aceita vários formatos de carregamento para maior flexibilidade.

Já tens dados noutro local?

Se já tens conjuntos de dados no Roboflow, usa as Integrações para os importar diretamente — não é necessária qualquer exportação ou novo carregamento manual. Os dados no Google Cloud Storage, Amazon S3 ou Azure Blob Storage podem ser utilizados no local através do Armazenamento na cloud. Os espaços de trabalho Enterprise podem usar On Premise para indexar e treinar com dados locais sem enviar píxeis para a Platform.

Formatos suportados#

FormatoExtensõesNotasTamanho máx.
JPEG.jpg, .jpegMais comum, recomendado50 MB
PNG.pngSuporta transparência50 MB
WebP.webpModerno, boa compressão50 MB
BMP.bmpNão comprimido50 MB
TIFF.tiff, .tifAlta qualidade50 MB
HEIC.heicFotografias de iPhone50 MB
AVIF.avifFormato de nova geração50 MB
JP2.jp2JPEG 200050 MB
DNG.dngCâmara em bruto50 MB
MPO.mpoObjeto com várias imagens50 MB

Suporte de codecs de vídeo#

A extensão do ficheiro, por si só, não é suficiente: um vídeo pode continuar a falhar se não for possível descodificar o respetivo codec durante o processamento.

Usa H.264 MP4

O vídeo H.264 num contentor MP4 tem o suporte de descodificação mais abrangente e é a opção mais segura. Se um vídeo não for processado, volta a codificá-lo com o FFmpeg:

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Preparar o teu conjunto de dados#

A plataforma suporta Ultralytics YOLO, COCO, máscaras PNG semânticas, conjuntos de dados de profundidade, Ultralytics NDJSON e uploads brutos (não anotados):

Usa a estrutura de diretórios YOLO padrão com um ficheiro data.yaml:

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

O ficheiro YAML define a configuração do teu conjunto de dados:

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Carregamentos em bruto

Em bruto: carrega imagens sem anotações (sem etiquetas). É útil quando planeias fazer as anotações diretamente na plataforma através do editor de anotações.

Estrutura de diretório plana

Também podes carregar imagens sem pastas de divisão explícitas. A Platform respeita o destino da divisão ativa durante o carregamento. Se não estiver definido nenhum destino de divisão e o carregamento deixar val vazio — ou com menos de dois mapas emparelhados para profundidade — os conjuntos de dados que não sejam de classificação movem automaticamente as imagens de treino para val, para que o conjunto de dados fique imediatamente pronto para treino. Os conjuntos de dados de classificação são ignorados porque utilizam divisões baseadas em diretórios. Podes sempre reatribuir imagens mais tarde através de mover em massa para a divisão ou da redistribuição de divisões.

Deteção automática do formato

O formato é detetado automaticamente: os conjuntos de dados com um data.yaml que contenha as chaves names, train ou val são tratados como YOLO. Os conjuntos de dados com ficheiros JSON COCO (que contenham os vetores images, annotations e categories) são tratados como COCO. As exportações .ndjson são importadas como Ultralytics NDJSON. Os conjuntos de dados que contenham apenas imagens e nenhuma anotação são tratados como dados em bruto.

Quando um arquivo contém vários ficheiros YAML, a Platform dá preferência aos nomes padrão (data.yaml, data.yml, dataset.yaml, dataset.yml) mais próximos da raiz do arquivo. Mantém um único YAML com nome claro por arquivo para evitar ambiguidades.

O XML Pascal VOC não é importado

Os ficheiros de etiquetas no formato XML Pascal VOC são detetados, mas as respetivas anotações não são importadas — as imagens são carregadas sem anotações. A Platform avisa-te antes do início do carregamento ("Etiquetas Pascal VOC detetadas"). Converte primeiro o XML VOC para YOLO ou COCO; consulta as ferramentas de conversão de formatos.

Se as etiquetas fizerem referência a IDs de classes, mas não forem fornecidos nomes de classes, a Platform gera nomes de marcador densos (class0, class1, …) que podes renomear mais tarde no separador Classes.

Para obteres detalhes específicos do formato por tarefa, consulta as tarefas suportadas e a Visão geral dos conjuntos de dados.

Processo de carregamento#

Para criares um conjunto de dados:

  1. Navega até Annotate na barra lateral
  2. Clica em New Dataset
  3. Escolhe um separador de origem de dados (consulta Origens de dados abaixo)
  4. Adiciona um nome — o slug do URL é derivado automaticamente e pode ser editado — e uma descrição opcional
  5. Seleciona o tipo de tarefa (consulta as tarefas suportadas), uma licença opcional (consulta as licenças disponíveis) e a visibilidade (pública ou privada)
  6. Clica em Create & Upload para ficheiros locais, em Create & Import para um URL ou uma origem ligada, ou em Create Dataset para começares vazio

Ultralytics Platform Datasets Upload Dialog Task Selector

Para adicionares ficheiros a um conjunto de dados existente, abre a página do conjunto de dados e arrasta os ficheiros para a galeria ou clica no ícone de carregamento no cabeçalho da página. O ícone de carregamento abre diretamente o selecionador de ficheiros nativo do teu navegador porque a tarefa do conjunto de dados já está definida.

Fontes de dados#

A caixa de diálogo New Dataset disponibiliza quatro origens:

OrigemDescrição
CarregarArrasta ficheiros para aqui ou procura-os — imagens, vídeos, arquivos ou NDJSON
URLCola uma ligação direta para um ficheiro .zip, .tar, .tar.gz, .tgz ou .ndjson; a Platform descarrega-o e ingere-o no lado do servidor
CloudUsa dados no local a partir do Google Cloud Storage, Amazon S3 ou Azure Blob Storage (Pro e Enterprise)
No LocalIndexa e treina com dados que nunca saem das tuas próprias máquinas através de trabalhadores On Premise (Enterprise)
Limites de importação por URL

Uma importação por URL está limitada tanto pelo limite do teu plano por carregamento (10 GB Free / 20 GB Pro / 50 GB Enterprise) como pela tua quota de armazenamento restante, aplicando-se o que for menor. A ligação tem de estar acessível publicamente através de HTTP ou HTTPS e terminar numa extensão suportada.

Antes de começar o carregamento#

A Platform valida os teus ficheiros no navegador antes de carregar qualquer conteúdo, para que os problemas comuns surjam imediatamente, em vez de só aparecerem após uma transferência longa. Os arquivos são verificados quanto a corrupção, ausência de conteúdo, proteção por palavra-passe e erros de sintaxe YAML, e os ficheiros demasiado grandes são listados pelo nome.

Podem então aparecer duas caixas de diálogo:

Quando o arquivo declara nomes de classes e o teu conjunto de dados já tem classes, a caixa de diálogo Map imported classes apresenta uma linha por cada classe recebida. Para cada uma, escolhe uma classe existente para fundir, cria uma nova classe ou ignora-a. As correspondências exatas de nomes são pré-selecionadas, e as classes ignoradas e as respetivas anotações não são importadas.

Após o carregamento, a plataforma processa os teus dados automaticamente:

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Validação: Verificações de formato e tamanho
  2. Normalização: Imagens grandes redimensionadas (máximo de 4096px, dimensão mínima de 28px), imagens em tons de cinzento convertidas para RGB, transparência aplicada sobre fundo branco e orientação EXIF aplicada
  3. Miniaturas: Pré-visualizações WebP de 256px geradas
  4. Análise de etiquetas: Etiquetas YOLO, COCO e NDJSON extraídas
  5. Estatísticas: Distribuições de classes e dimensões das imagens calculadas
Codificação de imagens armazenadas

Os originais AVIF e WebP são armazenados byte a byte quando não é necessário redimensionar nem alterar a cor. Todos os restantes são recodificados — as fontes WebP permanecem em WebP e todos os outros formatos (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) são convertidos para JPEG com qualidade 92. O nome de ficheiro original e a extensão de origem são mantidos como metadados.

Barra de progresso do carregamento de conjuntos de dados da Ultralytics Platform

Validar antes do carregamento

Podes validar o teu conjunto de dados localmente antes de o carregares:

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Requisitos de tamanho das imagens

As imagens devem ter pelo menos 28px no lado mais curto. As imagens menores são rejeitadas durante o processamento. As imagens com mais de 4096px no lado mais longo são redimensionadas automaticamente, mantendo a proporção.

Explorar imagens#

Visualiza as imagens do teu conjunto de dados em vários esquemas.

Abre o painel Clustering na barra de ferramentas da galeria para explorar o teu conjunto de dados como um gráfico de dispersão 2D interativo.

VistaDescrição
GrelhaGrelha de miniaturas com sobreposições de anotações (predefinido)
CompactoMiniaturas mais pequenas para uma análise rápida
TabelaLista com miniatura, nome de ficheiro, dimensões, tamanho, divisão, classes e contagens de etiquetas

Vista em grelha da galeria de conjuntos de dados da Ultralytics Platform com anotações

Ordenação e filtragem#

As imagens podem ser ordenadas e filtradas para uma exploração eficiente:

Cada opção alterna entre ascendente (↑) e descendente (↓):

OrdenarDescrição
Criado ↑/↓Ordem de carregamento (predefinido ↓)
Nome ↑/↓Nome de ficheiro por ordem alfabética
Altura ↑/↓Altura da imagem em píxeis
Largura ↑/↓Largura da imagem em píxeis
Tamanho ↑/↓Tamanho do ficheiro no disco
Anotações ↑/↓Contagem de anotações por imagem
Conjuntos de dados grandes

Para conjuntos de dados com mais de 100.000 imagens, as ordenações por nome, largura, altura e tamanho são ocultadas para manter a capacidade de resposta da galeria. As ordenações por data de criação e contagem de anotações continuam disponíveis.

Encontrar imagens sem etiquetas

Usa o filtro Annotations definido como Unannotated para encontrares rapidamente imagens que ainda precisam de anotação. Isto é especialmente útil para conjuntos de dados grandes nos quais queres acompanhar o progresso da etiquetagem.

Pesquisar metadados personalizados

A caixa de pesquisa encontra-se à direita da barra de ferramentas da galeria e filtra todos os modos de vista — grelha, compacto e tabela. Corresponde ao nome de ficheiro da imagem (a extensão do ficheiro é opcional), bem como a chaves de metadados personalizados, valores escalares e entradas de matrizes; assim, uma imagem chamada img_0042 que contenha {"ship_type": "yacht"} é encontrada ao pesquisar img_0042 ou yacht.

Os valores aninhados em subobjetos não são correspondidos. Colar um ID de imagem com 24 caracteres procura diretamente essa imagem exata, ignorando a pesquisa de texto.

Visualizador em ecrã inteiro#

Clica numa imagem para abrir o visualizador em ecrã inteiro com:

  • Navegação: Teclas de seta ou pré-visualizações de miniaturas para explorar
  • Informações da imagem: Consulta propriedades geradas pela Platform, metadados personalizados e metadados incorporados no ficheiro, como EXIF
  • Metadados personalizados: Proprietários e editores podem adicionar ou substituir um objeto JSON, incluindo valores aninhados com até 500.000 caracteres serializados e chaves de nível superior com até 128 caracteres
  • Anotações: Alterna a visibilidade da sobreposição de anotações
  • Detalhes por classe: Contagens de etiquetas por classe com indicadores de cor
  • Anotar: Quando tens acesso de edição, os controlos de anotação ficam imediatamente ativos quando o visualizador em ecrã inteiro é aberto no computador
  • Transferir: Transfere o ficheiro de imagem original
  • Eliminar: Elimina a imagem do conjunto de dados
  • Zoom: Cmd/Ctrl+Scroll, Cmd/Ctrl++ ou Cmd/Ctrl+= para ampliar, e Cmd/Ctrl+- para reduzir
  • Repor vista: Cmd/Ctrl + 0 ou o botão de reposição para ajustar a imagem ao visualizador
  • Deslocar: Mantém premida a tecla Space e arrasta para deslocar a tela quando o zoom está ativo
  • Vista de píxeis: Alterna a renderização pixelizada para uma inspeção detalhada
  • Cortina de profundidade: Em conjuntos de dados de profundidade, um separador arrastável alterna entre a imagem RGB e o respetivo mapa de profundidade colorido

Visualizador em ecrã inteiro de conjuntos de dados da Ultralytics Platform com painel de metadados

Filtrar por divisão#

Filtra as imagens pela divisão do conjunto de dados:

DivisãoFinalidade
TreinarUtilizado para o treino do modelo
ValUtilizado para validação durante o treino
TestUtilizado para a avaliação final

Clustering#

O painel Clustering projeta o teu conjunto de dados num gráfico de dispersão 2D interativo, no qual as imagens visualmente semelhantes ficam próximas umas das outras. Usa-o para revelar grupos, identificar duplicados e valores atípicos e inspecionar como as divisões ou classes estão distribuídas nos teus dados — sem sair da galeria. Abre-o através do ícone do gráfico de dispersão na barra de ferramentas da galeria, em qualquer página de conjunto de dados.

Estado vazio do clustering de conjuntos de dados da Ultralytics Platform

Executar análise#

Inicia uma análise:

  1. Abre um conjunto de dados e clica no ícone do gráfico de dispersão na barra de ferramentas da galeria
  2. Clica em Analyze Dataset
  3. Aguarda até a barra de progresso terminar — os resultados aparecem no mesmo painel

A análise é executada em segundo plano em duas fases, Computing embeddings e Clustering, e pode demorar alguns minutos, dependendo do tamanho do teu conjunto de dados. Podes fechar o painel ou sair da página e voltar mais tarde.

Requisitos da análise

Um conjunto de dados precisa de ter pelo menos 20 e, no máximo, 200.000 imagens sem erros para ser analisado. Os conjuntos de dados ligados suportados por armazenamento na cloud ou On Premise ainda não são compatíveis.

Visualização#

Quando a análise termina, o painel apresenta um gráfico de dispersão 2D de todas as imagens analisadas, com uma legenda e um contador de pontos. Os filtros da galeria (divisão, classe, etiquetadas/não etiquetadas) escurecem os pontos fora do filtro para que te possas concentrar no subconjunto pretendido — o contador passa então a apresentar visible / total points.

Gráfico de dispersão do agrupamento de conjuntos de dados da Ultralytics Platform

Colorir por#

Altera a forma como os pontos de dados são sombreados com o menu suspenso Color by na barra de ferramentas do painel. Muda os modos de visualização a qualquer momento — o gráfico muda de cor instantaneamente para que possas ver como as divisões, classes ou propriedades das imagens estão distribuídas pelos teus agrupamentos:

OpçãoSombreamento
DivisõesTreino / Validação / Teste
ClassesPrimeira classe de anotação em cada imagem
LarguraLargura da imagem
AlturaAltura da imagem
TamanhoTamanho do ficheiro
AnotaçõesNúmero de anotações por imagem

Modos de cores do agrupamento de conjuntos de dados da Ultralytics Platform

Seleção com laço#

Desenha uma seleção de forma livre à volta de uma região para realçar pontos no gráfico. A galeria é filtrada para mostrar as imagens correspondentes, para que possas inspecioná-las, voltar a etiquetá-las, movê-las ou eliminá-las utilizando as operações de imagem habituais.

Limpar seleção

Um chip acima do gráfico mostra quantos pontos estão selecionados — clica em × para limpar o laço e voltar à vista completa da galeria.

Tamanho da seleção

Um laço pode selecionar no máximo 1.000 imagens. Se a tua seleção corresponder a mais imagens, a Platform mostra uma amostra de 1.000 e sugere que desenhes uma região mais pequena.

Deslocar e ampliar#

Navega diretamente por gráficos de dispersão grandes com o rato e o teclado, ou através dos botões de zoom no canto inferior esquerdo do gráfico:

EntradaAção
DeslocamentoDesloca o gráfico em 2D
Cmd/Ctrl+DeslocamentoAmplia ou reduz, mantendo o cursor como ponto de referência
Manter Espaço premidoMuda para o modo de deslocamento por arrasto
Botão ReporVolta à extensão total do gráfico

Voltar a analisar#

Se o teu conjunto de dados mudar após a análise — forem adicionadas novas imagens ou a contagem analisada deixar de corresponder ao conjunto de dados — aparece um botão Re-analyze na parte superior do painel para proprietários e editores.

Clica em Re-analyze para recalcular as incorporações e a projeção 2D desde o início.

Encontrar Imagens Semelhantes#

Os mesmos embeddings alimentam a pesquisa de similaridade em conjuntos de dados públicos. Em um conjunto de dados que podes editar, clica com o botão direito em uma imagem na visualização Grade ou Compacta (ou em uma única linha selecionada na visualização Tabela) e escolhe Encontrar imagens semelhantes. A caixa de diálogo lista até 24 das imagens públicas mais próximas com seu conjunto de dados de origem, licença e pontuação de similaridade, excluindo imagens que teu conjunto de dados já possui e cópias da imagem selecionada em outros conjuntos de dados. Seleciona as que queres e clica em Adicionar ao conjunto de dados: elas são adicionadas à divisão train como imagens não rotuladas, contabilizadas no teu armazenamento e prontas para anotação.

Uma imagem sem um embedding — em um conjunto de dados ainda não analisado, ou adicionado desde a última análise — mostra Analyze this dataset in Clustering to find similar images. A caixa de diálogo não está disponível em conjuntos de dados conectados. Os diagnósticos de validação por imagem de um modelo executam a mesma pesquisa a partir de suas imagens com pior desempenho.

Separadores do conjunto de dados#

Cada página de conjunto de dados pode mostrar até seis separadores, dependendo do estado do conjunto de dados e das tuas permissões:

Separador Imagens#

A vista predefinida, que mostra a galeria de imagens com sobreposições de anotações. Suporta os modos de visualização em grelha, compacto e tabela. Arrasta e larga ficheiros aqui para adicionar mais imagens.

Separador Classes#

Este separador aparece quando o conjunto de dados tem imagens e a sua tarefa tem classes.

Gere as classes de anotação do teu conjunto de dados:

  • Histograma de classes: Gráfico de barras que mostra a contagem de anotações por classe, ordenado por frequência, com uma opção para alternar entre escalas linear e logarítmica
  • Tabela de classes: Tabela pesquisável e ordenável com índice, nome, contagem de anotações e contagem de imagens
  • Editar nomes das classes: Clica em qualquer nome de classe para o mudar diretamente
  • Editar cores das classes: Clica numa amostra de cor para alterar a cor da classe
  • Adicionar nova classe: Utiliza o campo de entrada na parte inferior para adicionar classes
  • Fundir classes: Seleciona duas ou mais linhas e clica em Merge into one
  • Eliminar classes: Seleciona uma ou mais linhas e clica em Delete

Histograma e tabela do separador Classes de conjuntos de dados da Ultralytics Platform

Escala logarítmica para conjuntos de dados desequilibrados

Se o teu conjunto de dados tiver desequilíbrio entre classes (por exemplo, 10.000 anotações de "pessoa", mas apenas 50 de "bicicleta"), utiliza o seletor Log Scale no histograma de classes para visualizar claramente todas as classes.

Fundir classes#

A fusão consolida etiquetas duplicadas ou sobrepostas — por exemplo, combina car, automobile e vehicle numa única classe:

  1. Seleciona duas ou mais classes utilizando as caixas de seleção das linhas
  2. Clica em Merge into one no cabeçalho da tabela ou clica com o botão direito na seleção
  3. Escolhe qual das classes selecionadas será o destino para a fusão das restantes
  4. Confirma

Todas as anotações pertencentes às classes de origem são reatribuídas à classe de destino, e as classes de origem são removidas. Nenhuma anotação é eliminada, pelo que a contagem total de anotações do conjunto de dados permanece inalterada.

Eliminar classes#

  1. Seleciona uma ou mais classes utilizando as caixas de seleção das linhas
  2. Clica em Delete no cabeçalho da tabela ou clica com o botão direito na seleção
  3. Confirma

Eliminar uma classe remove a classe e todas as suas anotações. Nos conjuntos de dados de classificação, as etiquetas são removidas, mas as imagens permanecem, ficando sem anotações.

Deslocação dos índices das classes

Os IDs das classes são posicionais. Fundir ou eliminar uma classe desloca para baixo todos os índices de classes superiores para fechar a lacuna, pelo que as exportações e os ficheiros de etiquetas criados antes da alteração deixam de corresponder aos novos índices. Cria primeiro uma versão se precisares da numeração antiga.

Amostragem de estatísticas

As contagens de classes são calculadas a partir de, no máximo, 100.000 imagens. Em conjuntos de dados maiores, aparece acima do histograma a nota "Com base num subconjunto de 100.000 imagens deste conjunto de dados."

Separador Gráficos#

Este separador aparece quando o conjunto de dados tem imagens.

Estatísticas automáticas calculadas a partir do teu conjunto de dados:

Os gráficos aparecem nesta ordem, e cada um é omitido quando o conjunto de dados não tem dados para ele — um conjunto de dados de imagens sem processamento não mostra gráficos de anotações, e Points per Instance aparece apenas para dados de segmentação e pose:

GráficoDescrição
Distribuição das divisõesGráfico em anel com as contagens de imagens de treino/validação/teste e a percentagem etiquetada
Principais classesGráfico em anel das 10 classes de anotação mais frequentes, com as restantes como "Outras"
Dimensões das imagensHistograma da distribuição da largura e altura das imagens (sobrepostas), com a média
Tamanho dos ficheiros de imagemHistograma da distribuição do tamanho dos ficheiros de imagem
Dimensões 2D das imagensMapa de calor 2D da largura em relação à altura, com linhas de referência da proporção
Localizações das anotaçõesMapa de calor 2D das posições centrais das caixas delimitadoras
Formatos das imagensDistribuição dos formatos das imagens de origem (JPG, PNG, etc.)
Dimensões das caixas delimitadorasHistograma da largura e altura das caixas delimitadoras (sobrepostas)
Objetos por imagemHistograma da contagem de anotações por imagem
Pontos por instânciaContagem de vértices do polígono ou pontos-chave por anotação (segmentação/pose)

Grelha de estatísticas do separador Gráficos de conjuntos de dados da Ultralytics Platform

Armazenamento em cache das estatísticas

A Platform armazena em cache as estatísticas calculadas e invalida-as quando as imagens, anotações, classes ou divisões sofrem alterações. Em conjuntos de dados com mais de 100.000 imagens, os gráficos são calculados a partir de um subconjunto de 100.000 imagens, indicado acima da grelha.

Mapas de calor em ecrã inteiro

Clica no botão de expandir de qualquer mapa de calor para o veres no modo de ecrã inteiro. Isto proporciona uma vista maior e mais detalhada — útil para compreender padrões espaciais em conjuntos de dados grandes.

Separador Modelos#

Vê todos os modelos treinados neste dataset numa tabela pesquisável:

ColunaDescrição
NomeNome do modelo com link
ProjetoProjeto principal com ícone
VersãoVersão imutável do dataset usada no treino, se aplicável
EstadoDistintivo do estado do treino
TarefaTipo de tarefa YOLO
ÉpocasMelhor época / total de épocas
mAP50-95Precisão média média
mAP50mAP com IoU 0.50
CriadoData de criação

Tabela de modelos treinados no separador Modelos dos Datasets da Plataforma Ultralytics

Separador Erros#

Este separador aparece apenas quando um ou mais ficheiros falham durante o processamento.

As imagens cujo processamento falhou são listadas aqui com:

  • Faixa de erro: Contagem total de imagens falhadas e orientações
  • Tabela de erros: Nome do ficheiro, descrição do erro em linguagem simples, sugestões de correção e miniatura de pré-visualização
  • Os erros comuns incluem ficheiros corrompidos, formatos não suportados, imagens demasiado pequenas (mín. 28px) e modos de cor não suportados

Falhas de processamento no separador Erros dos Datasets da Plataforma Ultralytics

Erros comuns de processamento
ErroCausaCorreção
Não foi possível ler o ficheiro de imagemFormato corrompido ou não suportadoVolta a exportar a partir do editor de imagens
Incompleto ou corrompidoO ficheiro foi truncado durante a transferênciaVolta a transferir o ficheiro original
Formato de imagem não suportadoFormato que a Plataforma não consegue descodificarConverte para JPG, PNG ou WebP
Erro de permissões do ficheiroO ficheiro está bloqueado ou protegido contra leituraDesbloqueia o ficheiro e volta a carregá-lo
Imagem demasiado pequenaDimensão mínima inferior a 28pxUsa imagens de origem com maior resolução
Modo de cor não suportadoModo de cor CMYK ou indexadoConverte para o modo RGB

Separador Versões#

Cria snapshots NDJSON imutáveis do teu dataset para um treino reproduzível. Cada versão regista o número de imagens, o número de classes, o número de anotações e o tamanho do ficheiro no momento da criação.

ColunaDescrição
VersãoNúmero da versão (v1, v2, ...)
DescriçãoDescrição fornecida pelo utilizador (editável)
ImagensNúmero de imagens no momento do snapshot
ClassesNúmero de classes no momento do snapshot
AnotaçõesNúmero de anotações no momento do snapshot
TamanhoTamanho do ficheiro de exportação NDJSON
CriadoData de criação da versão
AçõesTransferir ou restaurar

Para criar uma versão:

  1. Abre o separador Versions
  2. Opcionalmente, introduz uma descrição (por exemplo, "Adicionadas 500 imagens de treino" ou "Corrigidas classes com etiquetas incorretas")
  3. Clica em New Version
  4. A nova versão aparece na tabela

Cada versão é numerada sequencialmente (v1, v2, v3...) e é imutável — as versões não podem ser editadas nem removidas; apenas as suas descrições podem ser alteradas. Usa as ações da linha para transferir ou restaurar qualquer versão a qualquer momento.

Restaurar uma versão

A restauração substitui as imagens, divisões, classes e anotações atuais do dataset pelo snapshot selecionado e não pode ser anulada, a menos que guardes primeiro o estado atual como outra versão. O dataset fica bloqueado com o estado processing enquanto é reconstruído. Nada é carregado novamente durante uma restauração, pelo que as restaurações são normalmente rápidas, mesmo em datasets grandes.

Guardar uma versão durante o treino

Ativa Save Dataset Version na caixa de diálogo Cloud Training para associar um modelo ao dataset exato usado no treino. A Plataforma reutiliza uma versão correspondente quando o conteúdo do dataset não mudou e cria uma nova versão apenas quando mudou.

Apenas datasets prontos

A criação e a restauração de versões ficam disponíveis depois de o dataset atingir o estado ready. As versões não estão disponíveis para datasets na cloud connected ou On Premise.

Quando criar versões

Cria uma versão antes e depois de alterações importantes no teu dataset — adicionar imagens, corrigir anotações ou reequilibrar divisões. Isto permite comparar o desempenho do modelo entre diferentes estados do dataset.

Tamanho do ficheiro NDJSON

O tamanho apresentado é o tamanho do ficheiro de exportação NDJSON, que contém URLs de imagens e anotações — não as próprias imagens. Os dados reais das imagens são armazenados separadamente e acedidos através de URLs assinados. O ficheiro de snapshot continua a contar para a tua quota de armazenamento da área de trabalho, pelo que a criação da versão falha se já não tiveres espaço disponível.

Exportar dataset#

Exporta o teu dataset para utilização offline através de uma transferência NDJSON no cabeçalho do dataset ou no separador Versions.

Para exportar:

  1. Clica no botão Download (ícone de transferência) no cabeçalho do dataset
  2. Transfere diretamente o snapshot NDJSON atual
  3. Usa o separador Versions quando quiseres um snapshot numerado e imutável que possas voltar a transferir mais tarde

Ultralytics Platform Datasets Export Ndjson Download

O formato NDJSON armazena um objeto JSON por linha. A primeira linha contém os metadados do conjunto de dados, seguida de uma linha por imagem:

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

O objeto opcional metadata ao nível da imagem é preservado quando um ficheiro NDJSON é importado para a Plataforma. Podes inspecioná-lo ou editá-lo no painel de informações em ecrã inteiro da imagem. Para carregamentos de arquivos programáticos, a Ingest Dataset Data API aceita o mapa de caminhos equivalente imageMetadata.

Os datasets de pose também incluem um campo kpt_shape na linha do cabeçalho do dataset, inferido a partir das anotações quando ainda não está definido.

As exportações de profundidade declaram "task": "depth" e "depth_scale": 1000 na linha do dataset. Cada linha de imagem inclui um depth.url para o PNG uint16 simples correspondente. A Ultralytics transfere os URLs da imagem e da profundidade em simultâneo e escreve um YAML de treino com a mesma escala, pelo que o ficheiro NDJSON pode ser passado diretamente para model.train(data=...).

URLs assinados

Os URLs das imagens no NDJSON exportado são assinados e válidos durante 7 dias. A Plataforma reutiliza uma exportação em cache durante até 6 dias quando o dataset não mudou, pelo que uma nova transferência tem sempre pelo menos um dia de validade restante. Se precisares de novos URLs mais cedo, altera o dataset ou cria uma nova versão.

Datasets On Premise

A exportação não está disponível para datasets On Premise, cujos bytes de imagem nunca chegam à Plataforma.

Consulta a documentação do formato NDJSON da Ultralytics para obter a especificação completa.

Operações de imagem#

Ações rápidas#

Clica com o botão direito do rato em qualquer imagem na vista Grid ou Compact para aceder às ações rápidas:

AçãoDescrição
Move to SplitReatribui a imagem à divisão Train, Val ou Test
Encontrar Imagens SemelhantesPesquisa conjuntos de dados públicos por imagens semelhantes e adiciona-as (consulte Encontrar Imagens Semelhantes)
Gerar Imagens SemelhantesCria até 16 variações geradas por IA da imagem (quatro por padrão) e adiciona as que mantiveres como imagens não rotuladas
DownloadTransfere o ficheiro de imagem original
DeleteElimina a imagem do dataset

Menu de contexto do cartão de imagem dos Datasets da Plataforma Ultralytics

Individual vs. em massa

O menu de contexto da imagem funciona numa única imagem. Para operações em massa com várias imagens, usa a vista Table com seleção por caixas de verificação.

Mover em massa para uma divisão#

Reatribua as imagens selecionadas a uma divisão diferente dentro do mesmo dataset:

  1. Mude para a vista Tabela
  2. Selecione as imagens usando as caixas de seleção
  3. Clique com o botão direito para abrir o menu de contexto
  4. Escolha Move to split > Treino, Validação ou Teste

Também pode arrastar e largar imagens nos separadores de filtro de divisão na vista em grelha. Se mover uma imagem causar conflito com uma imagem idêntica já existente na divisão de destino, a Platform pergunta se quer ignorá-la, manter ambas ou substituí-la.

Organizar divisões de Treino/Validação

Carregue todas as imagens para um único dataset e, em seguida, use a transferência em massa para as divisões para organizar os subconjuntos nas divisões de treino, validação e teste.

Redistribuição das divisões#

Redistribua todas as imagens pelas divisões de treino, validação e teste usando proporções personalizadas:

  1. Clique na barra de divisão da barra de ferramentas do dataset para abrir a caixa de diálogo Redistribuir divisões
  2. Ajuste as percentagens das divisões usando qualquer um dos métodos abaixo
  3. Consulte a pré-visualização atualizada da contagem de imagens para confirmar a distribuição
  4. Clique em Aplicar para reatribuir aleatoriamente todas as imagens de acordo com as suas percentagens

Ultralytics Platform Datasets Split Redistribution Dialog

A caixa de diálogo disponibiliza três formas de definires os teus rácios de divisão de destino:

MétodoDescrição
ArrastarArraste os controlos entre os segmentos coloridos para ajustar visualmente os limites das divisões
IntroduzirEdite a percentagem de qualquer divisão (as outras duas divisões são rebalanceadas automaticamente de forma proporcional)
AutomáticoUm clique define instantaneamente uma divisão de treino/validação 80/20, com a divisão de teste definida como 0%

Uma pré-visualização atualizada mostra exatamente quantas imagens ficarão em cada divisão antes de aplicar.

Divisão rápida 80/20

Clique no botão Automático para definir instantaneamente a divisão recomendada de treino/validação 80/20. Esta é a proporção mais comum para o treino.

Eliminação em massa#

Elimine várias imagens de uma só vez:

  1. Selecione as imagens na vista de tabela
  2. Clique com o botão direito e escolha Delete ou prima Cmd/Ctrl+Delete
  3. Confirma a eliminação

URI do dataset#

Faça referência aos datasets da Platform usando o formato de URI ul:// (consulte Utilizar datasets da Platform):

ul://username/datasets/dataset-slug

Também pode colar diretamente um URL web de um dataset ou modelo (por exemplo, https://platform.ultralytics.com/username/datasets/dataset-slug); este é automaticamente reescrito para a URI ul://. Passar uma lista de datasets ajusta um modelo base em cada dataset, em série, por exemplo model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Use esta URI para treinar modelos a partir de qualquer lugar:

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Treine em qualquer lugar com dados da Platform

A URI ul:// funciona em qualquer ambiente:

  • Máquina local: Treine no seu hardware; os dados são descarregados automaticamente
  • Google Colab: Aceda aos seus datasets da Platform nos notebooks
  • Servidores remotos: Treine em máquinas virtuais na cloud com acesso completo ao dataset

Licenças disponíveis#

A Platform suporta as seguintes licenças para datasets:

LicençaTipo
NenhumNenhuma licença selecionada
CC0-1.0Domínio público
PDM-1.0Domínio público
CC-BY-2.5Permissiva
CC-BY-3.0Permissiva
CC-BY-4.0Permissiva
CC-BY-NC-2.0Não comercial
CC-BY-NC-3.0Não comercial
CC-BY-NC-4.0Não comercial
CC-BY-SA-3.0Copyleft
CC-BY-SA-4.0Copyleft
CC-BY-NC-SA-3.0Copyleft
CC-BY-NC-SA-4.0Copyleft
CC-BY-ND-4.0Sem obras derivadas
CC-BY-NC-ND-2.0Não comercial
CC-BY-NC-ND-4.0Não comercial
Apache-2.0Permissiva
MITPermissiva
BSD-3-ClausePermissiva
AGPL-3.0Copyleft
GPL-2.0Copyleft
GPL-3.0Copyleft
LGPL-3.0Copyleft
ODbL-1.0Copyleft
DbCL-1.0Requer ODbL
Apenas para investigaçãoRestrita
OutraPersonalizada
Licenças Copyleft

Ao clonar um conjunto de dados com uma licença copyleft (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), o conjunto de dados clonado herda a licença e o seletor de licença é bloqueado.

Definições de visibilidade#

Controle quem pode ver o seu dataset:

DefiniçãoDescrição
PrivadoVocê e os membros autorizados do workspace podem aceder
PúblicoQualquer pessoa pode ver, incluindo a partir da página Explorar

A visibilidade é definida ao criar um dataset na caixa de diálogo New Dataset, através de um interruptor. Os datasets públicos ficam visíveis na página Explorar.

Editar dataset#

Os metadados do dataset são editados diretamente na página do dataset, em linha — não é necessária nenhuma caixa de diálogo:

  • Nome: Clique no nome do dataset para o editar. As alterações são guardadas automaticamente ao perder o foco ou ao premir Enter. Os nomes estão limitados a 100 caracteres.
  • Descrição: Clique na descrição (ou no marcador de posição "Add a description...") para a editar. As alterações são guardadas automaticamente. As descrições estão limitadas a 1.000 caracteres.
  • Tipo de tarefa: Clique no emblema da tarefa para selecionar um tipo de tarefa diferente.
  • Licença: Clique no seletor de licenças para alterar a licença do dataset.
  • Ícone: Clique no ícone do dataset para carregar a sua própria imagem, promover uma das imagens do próprio dataset a ícone ou escolher uma letra e uma cor.
Alterar o tipo de tarefa

Cada imagem armazena anotações para todos os tipos de tarefa em conjunto. Alterar o tipo de tarefa do dataset controla quais anotações ficam visíveis no editor e são incluídas nas exportações e no treino. As anotações de outros tipos de tarefa são preservadas na base de dados e reaparecem quando volta a mudar. Profundidade é a exceção: a verdade de terreno é um ficheiro emparelhado, e não uma anotação, pelo que um dataset só pode mudar para ou a partir de profundidade quando não contém imagens — importe-o novamente.

Metadados personalizados#

Abre Mais ações e seleciona Informações para rever duas secções:

  • Metadados da Ultralytics: Detalhes da Platform apenas para leitura, como o ID do dataset, o proprietário, a tarefa, as contagens de imagens e anotações, a região de armazenamento e os carimbos de data/hora
  • Metadados personalizados: O seu próprio objeto JSON para proveniência, condições de captura, IDs de clientes, governação ou outros dados contextuais

Os visualizadores do workspace podem inspecionar os metadados, enquanto os membros com acesso de edição podem substituir o objeto de metadados personalizados. O objeto de metadados serializado está limitado a 500.000 caracteres, e cada chave de nível superior está limitada a 128 caracteres. Guarde um objeto vazio ({}) para limpar os metadados personalizados.

Clonar dataset#

Ao visualizar um dataset público que não lhe pertence, clique em Clone Dataset para abrir a caixa de diálogo de clonagem. Reveja o workspace de destino, o nome, a visibilidade e a licença e, em seguida, confirme a clonagem. A cópia inclui todas as imagens, anotações e definições de classes. Os datasets de origem públicos permanecem públicos por predefinição nos workspaces cuja visibilidade predefinida é pública; os clones em workspaces Enterprise ficam privados por predefinição. Se o dataset original tiver uma licença copyleft, o clone herda-a e o seletor de licenças fica bloqueado.

O slug de destino muda automaticamente se já estiver ocupado, e a clonagem requer quota de armazenamento disponível suficiente para conter a cópia.

Datasets ligados

Os datasets suportados por fontes de armazenamento na cloud ou On Premise não podem ser clonados, porque a Platform não armazena os respetivos bytes de imagem.

Adicionar aos favoritos e partilhar#

  • Favorito: Clique no botão de estrela para adicionar um dataset aos favoritos. A contagem de estrelas é visível para todos os utilizadores.
  • Partilhar: Para datasets públicos, clique no botão de partilha para copiar um link, obter um snippet de incorporação ou partilhar em plataformas sociais.

Eliminar dataset#

Elimine um dataset de que já não precisa:

  1. Abra Mais ações (o botão ) no cabeçalho do dataset
  2. Escolhe Delete Dataset
  3. Confirma na caixa de diálogo: "Isto moverá [name] para o lixo. Podes restaurá-lo no prazo de 30 dias."

O mesmo menu contém Information, que abre a caixa de diálogo de metadados descrita em Metadados personalizados, e Refresh, que volta a ler o dataset a partir do servidor.

Lixo e restauro

Os datasets eliminados são movidos para o Lixo — não são eliminados permanentemente. Podes restaurá-los no prazo de 30 dias a partir de Settings > Trash.

Treinar com o dataset#

Inicia o treino diretamente a partir do teu dataset:

  1. Clica em New Model na página do dataset
  2. Seleciona um projeto ou cria um novo
  3. Configura os parâmetros de treino
  4. Inicia o treino
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Consulta Treino na nuvem para obteres mais detalhes.

Perguntas frequentes#

  • Os teus dados são processados e armazenados na região selecionada (US, EU ou AP). As imagens são:

    1. Validadas quanto ao formato e ao tamanho
    2. Rejeitadas se a dimensão mínima for inferior a 28px
    3. Normalizadas se forem maiores do que 4096px (preservando a proporção; codificadas para armazenamento otimizado)
    4. Armazenadas com desduplicação, para que as imagens idênticas sejam mantidas apenas uma vez
    5. Miniaturas geradas em WebP de 256px para uma navegação rápida
  • A Ultralytics Platform gere o armazenamento de forma eficiente:

    • Desduplicação: as imagens idênticas na mesma região de dados são armazenadas uma vez
    • Integridade: os carregamentos são verificados quanto à integridade dos dados
    • Eficiência: os clones reutilizam as imagens armazenadas em vez de as copiarem, embora continuem a contar para a quota de armazenamento do workspace de destino
    • Regional: os dados permanecem na região selecionada (US, EU ou AP)
  • Sim. Arrasta os ficheiros para a galeria do dataset ou clica no ícone de carregamento no cabeçalho da página, que abre diretamente o seletor de ficheiros nativo do teu browser. As novas estatísticas são calculadas automaticamente após o processamento.

  • Utiliza a funcionalidade de movimentação em massa para uma divisão:

    1. Selecione as imagens na vista de tabela
    2. Clica com o botão direito do rato e escolhe Move to split
    3. Seleciona a divisão de destino (Train, Validation ou Test)
  • A Ultralytics Platform suporta etiquetas YOLO, COCO JSON, Ultralytics NDJSON e carregamentos de imagens não processadas. As etiquetas Pascal VOC XML são detetadas, mas não são importadas:

    Um ficheiro .txt por imagem, com coordenadas normalizadas (intervalo de 0 a 1):

    TarefaFormatoExemplo
    Deteçãoclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentaçãoclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Semânticaclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Poseclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    ClassificaçãoEstrutura de diretóriostrain/cats/, train/dogs/

    Sinalizadores de visibilidade de pose: 0=não rotulado, 1=rotulado mas oculta, 2=rotulado e visível. Os conjuntos de dados semânticos também aceitam máscaras PNG em vez de arquivos de polígono (consulte Máscaras Semânticas).

  • Sim. Cada imagem armazena conjuntamente anotações para os 6 tipos de tarefa de anotação (deteção, segmentação, semântica, classificação, pose e OBB). Podes alterar o tipo de tarefa ativo do dataset a qualquer momento sem perder as anotações existentes. Apenas as anotações correspondentes ao tipo de tarefa ativo são apresentadas no editor e incluídas nas exportações e no treino — as anotações de outras tarefas são preservadas e voltam a aparecer quando regressas a esse tipo de tarefa.

  • Sim:

    LimiteValor
    Classes por dataset25,000
    Anotações por imagem10,000
    Coordenadas por anotação10,000
    Nome do dataset100 caracteres
    Descrição do dataset1.000 caracteres
    Metadados personalizados500.000 caracteres serializados
    Chave de nível superior dos metadados128 caracteres
  • Os datasets que leem a partir de fontes de armazenamento na nuvem ou No local mantêm os píxeis fora da Platform, pelo que as funcionalidades que necessitam de cópias dos bytes das imagens pertencentes à Platform não estão disponíveis:

    RecursoLigado à nuvemNo local
    Anotação Inteligente e em LoteIndisponívelIndisponível
    Análise de agrupamentoIndisponívelIndisponível
    ClonagemIndisponívelIndisponível
    Instantâneos de versõesIndisponívelIndisponível
    Exportação NDJSONDisponívelIndisponível
    Importação de máscara PNG semânticaIndisponívelDisponível

    A navegação, a anotação manual, a gestão de classes, as divisões, as estatísticas e o treino funcionam normalmente.

Comentários