Dataset ImageNet#
O dataset Ultralytics ImageNet (data="imagenet") é o subconjunto ImageNet-1k / ILSVRC-2012 usado para treinar e avaliar modelos de classificação de imagens. Ele contém 1.000 classes de objetos, com 1.281.167 imagens de treino e 50.000 imagens de validação em um tamanho de imagem de 224x224, e ocupa aproximadamente 144 GB após o download. A base de dados ImageNet mais ampla é muito maior — mais de 14 milhões de imagens de alta resolução anotadas com synsets do WordNet em mais de 20.000 categorias —, mas a Ultralytics treina no subconjunto padronizado de 1.000 classes do ILSVRC, que se tornou o benchmark de facto para aprendizagem profunda em visão computacional.
Modelos ImageNet pré-treinados#
| Modelo | tamanho (píxeis) | acc top1 | acc top5 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) a 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
Principais funcionalidades#
- O dataset
imagenetda Ultralytics fornece 1.000 classes, com 1.281.167 imagens de treino e 50.000 imagens de validação (ILSVRC-2012), o benchmark padrão de pré-treino para classificação de imagens. - As classes são organizadas de acordo com a hierarquia do WordNet, em que cada classe corresponde a um synset (um conjunto de termos sinónimos).
- As imagens são treinadas em 224x224, e o dataset completo requer um download grande de ~144 GB.
- O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) anual foi fundamental para o avanço da investigação em visão computacional.
Estrutura do Conjunto de Dados#
O dataset ImageNet da Ultralytics usa a divisão ILSVRC-2012:
| Divisão | Imagens | Classes |
|---|---|---|
| Treinar | 1,281,167 | 1,000 |
| Validação | 50,000 | 1,000 |
As imagens são armazenadas em pastas por classe, nomeadas pelo ID do synset do WordNet (por exemplo, n01440764), que é a estrutura esperada pelo treino de classificação da Ultralytics. Cada uma das 1.000 classes corresponde a um synset do WordNet e não existe uma divisão de teste separada, pelo que o conjunto de validação com 50.000 imagens é usado para medir a precisão.
O ImageNet-1k requer um download de ~144 GB, por isso certifica-te de que tens espaço suficiente em disco antes de treinar. Para experiências rápidas, os subconjuntos menores ImageNette e ImageNet10 usam o mesmo formato de pastas e permitem treinar numa fração do tempo.
ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#
O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) anual permitia aos investigadores comparar algoritmos num dataset padronizado de grande escala, com métricas de avaliação consistentes. O desafio impulsionou avanços importantes na aprendizagem profunda para classificação de imagens, deteção de objetos e outras tarefas de visão — sobretudo a vitória do AlexNet em 2012, que ajudou a iniciar a era moderna da aprendizagem profunda.
Aplicações#
O dataset ImageNet é amplamente usado para treinar e avaliar modelos de aprendizagem profunda para classificação de imagens, deteção de objetos e localização de objetos. Arquiteturas marcantes, como AlexNet, VGG e ResNet, foram desenvolvidas e avaliadas no ImageNet, e os pesos pré-treinados no ImageNet continuam a ser um ponto de partida comum para a aprendizagem por transferência em várias tarefas de visão.
Utilização#
Para treinar um modelo de classificação YOLO no ImageNet durante 100 épocas, com um tamanho de imagem de 224x224, usa os trechos de código abaixo. Para consultar uma lista completa dos argumentos disponíveis, vê a página de Treino do modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)Também podes gerir datasets de classificação e executar o treino na nuvem com a Ultralytics Platform.
Imagens de exemplo e anotações#
O dataset ImageNet abrange as 1.000 classes do ILSVRC-2012, fornecendo um recurso diversificado e abrangente para treinar e avaliar modelos de visão computacional. Eis alguns exemplos de imagens do dataset:

Citações e agradecimentos#
Se utilizares o dataset ImageNet no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Gostaríamos de agradecer à equipa do ImageNet, liderada por Olga Russakovsky, Jia Deng e Li Fei-Fei, por criar e manter o dataset ImageNet como um recurso valioso para a comunidade de investigação em aprendizagem automática e visão computacional. Para obteres mais informações sobre o dataset ImageNet e os seus criadores, visita o site do ImageNet.
Perguntas frequentes#
O dataset ImageNet é uma base de dados de imagens de grande escala cuja coleção mais ampla contém mais de 14 milhões de imagens de alta resolução anotadas com synsets do WordNet. Na Ultralytics,
data="imagenet"treina no subconjunto padronizado de 1.000 classes do ILSVRC-2012, que é o benchmark de facto para o pré-treino de classificação de imagens. Modelos marcantes, como AlexNet, VGG e ResNet, foram treinados e avaliados no ImageNet, reforçando o seu papel no avanço da visão computacional.O dataset
imagenetda Ultralytics usa o subconjunto ILSVRC-2012 com 1.000 classes, 1.281.167 imagens de treino e 50.000 imagens de validação num tamanho de imagem de 224x224, para um download total de aproximadamente 144 GB. A base de dados ImageNet completa é muito maior (mais de 14 milhões de imagens em mais de 20.000 synsets do WordNet), mas o subconjunto de 1.000 classes é o usado para o treino e a avaliação de classificação.Para treinar um modelo YOLO da Ultralytics no ImageNet, carrega um modelo de classificação pré-treinado e aponta
dataparaimagenet:Exemplo de treinofrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)Para obteres instruções de treino mais detalhadas, consulta a nossa página de Treino.
Os modelos YOLO26 pré-treinados da Ultralytics oferecem desempenho de última geração em termos de velocidade e precisão para várias tarefas de visão computacional. Por exemplo, o modelo YOLO26n-cls, com uma precisão top-1 de 71,4% e uma precisão top-5 de 90,1%, está otimizado para aplicações em tempo real. Os modelos pré-treinados reduzem os recursos computacionais necessários para treinar de raiz e aceleram os ciclos de desenvolvimento. Consulta mais informações sobre as métricas de desempenho dos modelos YOLO26 na secção Modelos ImageNet pré-treinados.
O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) anual impulsionou avanços na visão computacional ao fornecer uma plataforma competitiva para avaliar algoritmos num dataset padronizado de grande escala. As suas métricas de avaliação consistentes estimularam a inovação na classificação de imagens, deteção de objetos e segmentação de imagens, expandindo continuamente os limites da aprendizagem profunda e da visão computacional.