Conjunto de Dados ImageNet#
O conjunto de dados Ultralytics ImageNet (data="imagenet") é o subconjunto do ImageNet-1k / ILSVRC-2012 usado para treinar e avaliar modelos de classificação de imagens. Ele contém 1.000 classes de objetos com 1.281.167 imagens de treinamento e 50.000 imagens de validação em um tamanho de imagem de 224x224, e descarrega aproximadamente 144 GB de dados. A base de dados mais ampla do ImageNet é muito maior — mais de 14 milhões de imagens de alta resolução anotadas com synsets do WordNet em mais de 20.000 categorias —, mas a Ultralytics treina no subconjunto padronizado ILSVRC de 1.000 classes que se tornou a referência de facto para aprendizado profundo em visão computacional.
Modelos Pré-treinados ImageNet#
| Modelo | tamanho (pixels) | acc top1 | acc top5 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | params (M) | FLOPs (B) a 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.5 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.6 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.9 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.2 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.6 |
Principais recursos#
- O conjunto de dados Ultralytics
imagenetfornece 1.000 classes com 1.281.167 imagens de treinamento e 50.000 de validação (ILSVRC-2012), a referência padrão de pré-treinamento para classificação de imagens. - As classes são organizadas de acordo com a hierarquia WordNet, onde cada classe corresponde a um synset (um conjunto de termos sinônimos).
- As imagens são treinadas a 224x224, e o conjunto de dados completo é um download grande de ~144 GB.
- O desafio anual ImageNet Large Scale Visual Recognition Challenge (ILSVRC) tem sido fundamental para o avanço da pesquisa em computer vision.
Estrutura do Dataset#
O conjunto de dados Ultralytics ImageNet usa a divisão ILSVRC-2012:
| Divisão | Imagens | Classes |
|---|---|---|
| Treinar | 1,281,167 | 1,000 |
| Validação | 50,000 | 1,000 |
As imagens são armazenadas em pastas por classe nomeadas pelo ID de synset do WordNet (por exemplo, n01440764), o layout que o treinamento de classificação da Ultralytics espera. Cada uma das 1.000 classes mapeia para um synset do WordNet, e não há uma divisão de teste separada, portanto, o conjunto de validação de 50.000 imagens é usado para medir a precisão.
O ImageNet-1k é um download de ~144 GB, portanto, certifica-te de que tens espaço em disco suficiente antes de treinar. Para experiências rápidas, os subconjuntos menores ImageNette e ImageNet10 usam o mesmo formato de pasta e treinam numa fração do tempo.
ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#
O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) anual permitiu aos investigadores comparar algoritmos num conjunto de dados padronizado e em grande escala com métricas de avaliação consistentes. Impulsionou avanços importantes no aprendizado profundo para classificação de imagens, deteção de objetos e outras tarefas de visão — mais notavelmente a vitória da AlexNet em 2012, que ajudou a lançar a era moderna do aprendizado profundo.
Aplicações#
O conjunto de dados ImageNet é amplamente utilizado para treinar e avaliar modelos de aprendizado profundo para classificação de imagens, deteção de objetos e localização de objetos. Arquiteturas marcantes como AlexNet, VGG e ResNet foram todas desenvolvidas e avaliadas no ImageNet, e os pesos pré-treinados do ImageNet continuam a ser um ponto de partida comum para aprendizagem por transferência em tarefas de visão.
Uso#
Para treinar um modelo de classificação YOLO no ImageNet por 100 épocas com um tamanho de imagem de 224x224, usa os snippets de código abaixo. Para uma lista abrangente de argumentos disponíveis, consulta a página de Treinamento do modelo.
from ultralytics import YOLO
# Load a model
model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training)
# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)Também podes gerir conjuntos de dados de classificação e executar o treinamento na nuvem com a Ultralytics Platform.
Exemplos de Imagens e Anotações#
O conjunto de dados ImageNet abrange as 1.000 classes do ILSVRC-2012, fornecendo um recurso diversificado e extenso para treinar e avaliar modelos de visão computacional. Aqui estão algumas imagens de exemplo do conjunto de dados:

Citações e Agradecimentos#
Se você usar o conjunto de dados ImageNet em seu trabalho de pesquisa ou desenvolvimento, por favor, cite o seguinte artigo:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Gostaríamos de agradecer à equipa do ImageNet, liderada por Olga Russakovsky, Jia Deng e Li Fei-Fei, por criar e manter o conjunto de dados ImageNet como um recurso valioso para a comunidade de investigação em aprendizado de máquina e visão computacional. Para mais informações sobre o conjunto de dados ImageNet e os seus criadores, visita o site do ImageNet.
FAQ#
O conjunto de dados ImageNet é uma base de dados de imagens em grande escala cuja coleção mais ampla contém mais de 14 milhões de imagens de alta resolução anotadas com synsets do WordNet. Na Ultralytics,
data="imagenet"treina no subconjunto padronizado ILSVRC-2012 de 1.000 classes, que é a referência de facto para o pré-treinamento de classificação de imagens. Modelos marcantes como AlexNet, VGG e ResNet foram treinados e avaliados no ImageNet, sublinhando o seu papel no avanço da visão computacional.O conjunto de dados Ultralytics
imagenetusa o subconjunto ILSVRC-2012 com 1.000 classes, 1.281.167 imagens de treinamento e 50.000 imagens de validação a um tamanho de imagem de 224x224, para um download total de cerca de 144 GB. A base de dados completa do ImageNet é muito maior (mais de 14 milhões de imagens em mais de 20.000 synsets do WordNet), mas o subconjunto de 1.000 classes é o utilizado para o treinamento de classificação e avaliação.Para treinar um modelo YOLO da Ultralytics no ImageNet, carrega um modelo de classificação pré-treinado e aponta
dataparaimagenet:Exemplo de Treinamentofrom ultralytics import YOLO # Load a model model = YOLO("yolo26n-cls.pt") # load a pretrained model (recommended for training) # Train the model results = model.train(data="imagenet", epochs=100, imgsz=224)Para instruções de treinamento mais detalhadas, consulta a nossa página de Treinamento.
Os modelos pré-treinados Ultralytics YOLO26 oferecem desempenho de ponta em termos de velocidade e precisão para várias tarefas de visão computacional. Por exemplo, o modelo YOLO26n-cls, com uma precisão top-1 de 71,4% e uma precisão top-5 de 90,1%, está otimizado para aplicações em tempo real. Os modelos pré-treinados reduzem os recursos computacionais necessários para treinar a partir do zero e aceleram os ciclos de desenvolvimento. Sabe mais sobre as métricas de desempenho dos modelos YOLO26 na secção de Modelos Pré-treinados do ImageNet.
O ImageNet Large Scale Visual Recognition Challenge (ILSVRC) anual impulsionou avanços na visão computacional ao fornecer uma plataforma competitiva para avaliar algoritmos num conjunto de dados padronizado e em grande escala. As suas métricas de avaliação consistentes fomentaram a inovação na classificação de imagens, deteção de objetos e segmentação de imagens, empurrando continuamente os limites do aprendizado profundo e da visão computacional.