Ultralytics YOLO27:

Dataset SKU-110K#

O dataset SKU-110K é um dataset de deteção de objetos de classe única, composto por 11 743 imagens de prateleiras de lojas com produtos densamente agrupados, dividido em 8 219 imagens de treino, 588 de validação e 2 936 de teste. Cada produto é anotado com uma única caixa delimitadora sob uma classe única, object — o nome refere-se às mais de 110 000 unidades de manutenção de stock (SKUs) únicas representadas nas cenas, não a 110 000 classes de deteção. Criado por Eran Goldman et al. para o artigo da CVPR 2019 Precise Detection in Densely Packed Scenes, contém mais de 1,7 milhões de produtos anotados — uma média de aproximadamente 147 por imagem — o que o torna um benchmark exigente para modelos de visão computacional em ambientes de retalho congestionados.



Watch: How to Train Ultralytics YOLO26 to Detect Every Product on a Retail Shelf | SKU-110K 🛒

Deteção de produtos densamente agrupados em prateleiras de lojas no dataset SKU-110K

Principais funcionalidades#

  • Deteção de classe única: Cada produto é identificado com uma caixa delimitadora sob uma classe única, object (names: {0: object}) — as anotações não contêm etiquetas de categoria por SKU.
  • Densidade extrema de objetos: As imagens de prateleiras de lojas de todo o mundo contêm, em média, cerca de 147 produtos muito próximos entre si, sendo que os objetos frequentemente parecem semelhantes ou até idênticos e estão posicionados a curta distância uns dos outros.
  • Grande escala: Mais de 110 000 SKUs únicos e mais de 1,7 milhões de caixas delimitadoras anotadas em 11 743 imagens desafiam os detetores de objetos de última geração.

Estrutura do Conjunto de Dados#

O dataset SKU-110K está dividido em três subconjuntos, todos partilhando a classe única object:

DivisãoImagensDescrição
Treinar8,219Imagens e anotações para treino do modelo
Validação588Imagens reservadas para avaliação durante o treino
Teste2,936Imagens para a avaliação final do modelo treinado

Aplicações#

O dataset SKU-110K é amplamente utilizado para treinar e avaliar modelos de aprendizagem profunda em tarefas de deteção de objetos, especialmente em cenas densamente agrupadas, como exposições de produtos em prateleiras de lojas. As suas aplicações incluem:

  • Gestão e automatização do inventário de retalho
  • Reconhecimento de produtos em plataformas de comércio eletrónico
  • Verificação da conformidade com planogramas
  • Sistemas de pagamento automático em lojas
  • Recolha e triagem robóticas em armazéns

Para anotar as tuas próprias imagens de prateleiras, treinar e gerir datasets de deteção para retalho no navegador, executa o fluxo de trabalho completo com a Ultralytics Platform.

YAML do Conjunto de Dados#

O ficheiro SKU-110K.yaml define a configuração do dataset — os caminhos do dataset, os nomes das classes e outros metadados. É mantido no repositório da Ultralytics em https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/SKU-110K.yaml.

ultralytics/cfg/datasets/SKU-110K.yaml
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license

# SKU-110K retail items dataset https://github.com/eg4000/SKU110K_CVPR19 by Trax Retail
# Documentation: https://docs.ultralytics.com/datasets/detect/sku-110k
# Example usage: yolo train data=SKU-110K.yaml
# parent
# ├── ultralytics
# └── datasets
#     └── SKU-110K ← downloads here (13.6 GB)

# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: SKU-110K # dataset root dir
train: train.txt # train images (relative to 'path') 8219 images
val: val.txt # val images (relative to 'path') 588 images
test: test.txt # test images (optional) 2936 images

# Classes
names:
  0: object

# Download script/URL (optional) ---------------------------------------------------------------------------------------
download: |
  import shutil
  from pathlib import Path

  import numpy as np
  import polars as pl

  from ultralytics.utils import TQDM
  from ultralytics.utils.downloads import download
  from ultralytics.utils.ops import xyxy2xywh

  # Download
  dir = Path(yaml["path"])  # dataset root dir
  parent = Path(dir.parent)  # download dir
  urls = ["http://trax-geometry.s3.amazonaws.com/cvpr_challenge/SKU110K_fixed.tar.gz"]
  download(urls, dir=parent)

  # Rename directories
  if dir.exists():
      shutil.rmtree(dir)
  (parent / "SKU110K_fixed").rename(dir)  # rename dir
  (dir / "labels").mkdir(parents=True, exist_ok=True)  # create labels dir

  # Convert labels
  names = "image", "x1", "y1", "x2", "y2", "class", "image_width", "image_height"  # column names
  for d in "annotations_train.csv", "annotations_val.csv", "annotations_test.csv":
      x = pl.read_csv(dir / "annotations" / d, has_header=False, new_columns=names, infer_schema_length=None).to_numpy()  # annotations
      images, unique_images = x[:, 0], np.unique(x[:, 0])
      with open((dir / d).with_suffix(".txt").__str__().replace("annotations_", ""), "w", encoding="utf-8") as f:
          f.writelines(f"./images/{s}\n" for s in unique_images)
      for im in TQDM(unique_images, desc=f"Converting {dir / d}"):
          cls = 0  # single-class dataset
          with open((dir / "labels" / im).with_suffix(".txt"), "a", encoding="utf-8") as f:
              for r in x[images == im]:
                  w, h = r[6], r[7]  # image width, height
                  xywh = xyxy2xywh(np.array([[r[1] / w, r[2] / h, r[3] / w, r[4] / h]]))[0]  # instance
                  f.write(f"{cls} {xywh[0]:.5f} {xywh[1]:.5f} {xywh[2]:.5f} {xywh[3]:.5f}\n")  # write label

Utilização#

Transferência de 13,6 GB

O SKU-110K é transferido automaticamente na primeira vez que treinas e requer cerca de 13,6 GB de espaço livre em disco para as suas 11 743 imagens. O script de transferência também obtém as anotações originais e converte-as para o formato YOLO, o que pode demorar alguns minutos.

Para treinar um modelo YOLO26n no dataset SKU-110K durante 100 épocas com um tamanho de imagem de 640, podes utilizar os seguintes excertos de código. Para obter uma lista completa dos argumentos disponíveis, consulta a página de Treino do modelo.

Exemplo de treino
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="SKU-110K.yaml", epochs=100, imgsz=640)

Dados e anotações de exemplo#

As imagens do SKU-110K captam produtos densamente agrupados em prateleiras reais de lojas, onde dezenas de artigos quase idênticos estão lado a lado. Eis um exemplo de imagem com as respetivas anotações:

Deteção de produtos do SKU-110K em prateleiras de lojas

  • Imagem de uma prateleira de loja com produtos densamente agrupados: Esta imagem demonstra um exemplo de objetos densamente agrupados num ambiente de prateleira de loja. Os objetos são anotados com caixas delimitadoras sob a classe única object.

A disposição densa dos produtos torna o SKU-110K particularmente valioso para desenvolver soluções robustas de visão computacional orientadas para o retalho, uma vez que o elevado número de objetos por imagem leva os detetores muito além dos benchmarks típicos.

Citações e agradecimentos#

Se utilizares o dataset SKU-110K no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:

Citação
@inproceedings{goldman2019dense,
  author    = {Eran Goldman and Roei Herzig and Aviv Eisenschtat and Jacob Goldberger and Tal Hassner},
  title     = {Precise Detection in Densely Packed Scenes},
  booktitle = {Proc. Conf. Comput. Vision Pattern Recognition (CVPR)},
  year      = {2019}
}

Gostaríamos de agradecer a Eran Goldman et al. por terem criado e mantido o dataset SKU-110K como um recurso valioso para a comunidade de investigação em visão computacional. Para obteres mais informações sobre o dataset SKU-110K e os seus criadores, visita o repositório do dataset SKU-110K no GitHub.

Perguntas frequentes#

  • O dataset SKU-110K é um dataset de deteção de objetos de classe única, composto por 11 743 imagens de prateleiras de lojas com produtos densamente agrupados, criado por Eran Goldman et al. para o seu artigo da CVPR 2019. Cada produto é identificado com uma caixa delimitadora object, e as imagens abrangem mais de 110 000 unidades de manutenção de stock (SKUs) únicas, o que faz deste dataset um benchmark sólido para detetar objetos em cenas congestionadas e criar sistemas de visão computacional para o retalho.

  • Não. O SKU-110K é de classe única: cada produto é anotado com uma caixa delimitadora sob a classe object (names: {0: object}). O "110K" no nome refere-se ao número de unidades de manutenção de stock (SKUs) únicas representadas nas imagens, não ao número de classes de deteção.

  • O dataset SKU-110K contém 11 743 imagens — 8 219 para treino, 588 para validação e 2 936 para teste — e uma única classe de deteção, object. Consulta a secção Estrutura do Dataset e a configuração SKU-110K.yaml para obteres mais detalhes.

  • O SKU-110K tem cerca de 13,6 GB e é transferido automaticamente na primeira vez que treinas com data="SKU-110K.yaml" — não é necessária qualquer transferência manual. Para veres opções mais pequenas, consulta a visão geral dos datasets de deteção.

  • Treinar um modelo YOLO26 no dataset SKU-110K é simples. Eis um exemplo para treinar um modelo YOLO26n durante 100 épocas com um tamanho de imagem de 640:

    Exemplo de treino
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="SKU-110K.yaml", epochs=100, imgsz=640)

    Para obteres uma lista completa dos argumentos disponíveis, consulta a página de Treino do modelo e as sugestões para o treino de modelos.

Comentários