Conjunto de dados ImageNet#
O conjunto de dados Ultralytics ImageNet (data="imagenet") é o subconjunto ImageNet-1k / ILSVRC-2012 usado para treinar e avaliar modelos de classificação de imagens. Contém 1 000 classes de objetos, com 1 281 167 imagens de treino e 50 000 imagens de validação, é normalmente treinado com um tamanho de imagem de 224x224 e requer a transferência de cerca de 144 GB de dados. A base de dados ImageNet mais abrangente é muito maior — contém mais de 14 milhões de imagens de alta resolução anotadas com synsets WordNet em mais de 20 000 categorias —, mas o Ultralytics treina no subconjunto ILSVRC padronizado de 1 000 classes, que se tornou o benchmark de facto para a aprendizagem profunda em visão computacional.
Modelos pré-treinados no ImageNet#
| Modelo | tamanho (pixels) | acc top1 | acc top5 | Velocidade CPU ONNX (ms) | Velocidade T4 TensorRT10 (ms) | parâmetros (M) | FLOPs (B) a 224 |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0 ± 0.3 | 1.1 ± 0.0 | 2.8 | 0.4 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9 ± 0.2 | 1.3 ± 0.0 | 6.7 | 1.5 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2 ± 0.4 | 2.0 ± 0.0 | 11.6 | 4.8 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2 ± 0.3 | 2.8 ± 0.0 | 14.1 | 6.0 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4 ± 0.9 | 3.8 ± 0.0 | 29.6 | 13.5 |
Principais funcionalidades#
- O conjunto de dados
imagenetdo Ultralytics disponibiliza 1 000 classes, com 1 281 167 imagens de treino e 50 000 imagens de validação (ILSVRC-2012), o benchmark padrão de pré-treino para classificação de imagens. - As classes estão organizadas de acordo com a hierarquia WordNet, em que cada classe corresponde a um synset (um conjunto de termos sinónimos).
- As imagens são treinadas a 224x224, e a transferência do conjunto de dados completo é de aproximadamente ~144 GB.
- O Desafio de Reconhecimento Visual em Grande Escala ImageNet anual (ILSVRC) foi fundamental para o avanço da investigação em visão computacional.
Estrutura do conjunto de dados#
O conjunto de dados ImageNet do Ultralytics usa a divisão ILSVRC-2012:
| Divisão | Imagens | Classes |
|---|---|---|
| Treinar | 1,281,167 | 1,000 |
| Validação | 50,000 | 1,000 |
As imagens são guardadas em pastas por classe, com nomes baseados no ID do synset WordNet (por exemplo, n01440764), a estrutura esperada pelo treino de classificação do Ultralytics. Cada uma das 1 000 classes corresponde a um synset WordNet, e não existe uma divisão de teste separada, pelo que o conjunto de validação de 50 000 imagens é usado para medir a exatidão.
O ImageNet-1k requer uma transferência de aproximadamente ~144 GB, por isso, certifica-te de que tens espaço em disco suficiente antes de treinar. Para experiências rápidas, os subconjuntos mais pequenos ImageNette e ImageNet10 usam o mesmo formato de pastas e permitem treinar numa fração do tempo.
Desafio de Reconhecimento Visual em Grande Escala ImageNet (ILSVRC)#
O Desafio de Reconhecimento Visual em Grande Escala ImageNet (ILSVRC) anual permitia aos investigadores avaliar algoritmos num conjunto de dados padronizado e em grande escala, com métricas de avaliação consistentes. Impulsionou grandes avanços na aprendizagem profunda para classificação de imagens, deteção de objetos e outras tarefas de visão — sobretudo a vitória do AlexNet em 2012, que ajudou a dar início à era moderna da aprendizagem profunda.
Aplicações#
O conjunto de dados ImageNet é amplamente usado para treinar e avaliar modelos de aprendizagem profunda para classificação de imagens, deteção de objetos e localização de objetos. Arquiteturas marcantes como AlexNet, VGG e ResNet foram todas desenvolvidas e avaliadas no ImageNet, e os pesos pré-treinados no ImageNet continuam a ser um ponto de partida comum para a aprendizagem por transferência em tarefas de visão.
Uso#
Para treinar um modelo YOLO de classificação com o ImageNet durante 100 épocas, com um tamanho de imagem de 224x224, usa os seguintes excertos de código. Para consultar a lista completa dos argumentos disponíveis, vê a página de treino do modelo.
from ultralytics import YOLO
# Carregar um modelo
model = YOLO("yolo26n-cls.pt") # carregue um modelo pré-treinado (recomendado para treinamento)
# Treinar o modelo
results = model.train(data="imagenet", epochs=100, imgsz=224)Também podes gerir conjuntos de dados de classificação e executar treinos na cloud com a Ultralytics Platform.
Imagens de exemplo e anotações#
O conjunto de dados ImageNet abrange as 1 000 classes do ILSVRC-2012, oferecendo um recurso diversificado e abrangente para treinar e avaliar modelos de visão computacional. Seguem-se algumas imagens de exemplo do conjunto de dados:

Citações e agradecimentos#
Se usares o conjunto de dados ImageNet no teu trabalho de investigação ou desenvolvimento, cita o seguinte artigo:
@article{ILSVRC15,
author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
title={ImageNet Large Scale Visual Recognition Challenge},
year={2015},
journal={International Journal of Computer Vision (IJCV)},
volume={115},
number={3},
pages={211-252}
}Gostaríamos de reconhecer a equipa do ImageNet, liderada por Olga Russakovsky, Jia Deng e Li Fei-Fei, pela criação e manutenção do conjunto de dados ImageNet, um recurso valioso para a comunidade de investigação em aprendizagem automática e visão computacional. Para obteres mais informações sobre o conjunto de dados ImageNet e os seus criadores, visita o site do ImageNet.
Perguntas frequentes#
O conjunto de dados ImageNet é uma base de dados de imagens em grande escala cuja coleção mais abrangente contém mais de 14 milhões de imagens de alta resolução anotadas com synsets WordNet. No Ultralytics,
data="imagenet"treina no subconjunto ILSVRC-2012 padronizado de 1 000 classes, que é o benchmark de facto para pré-treino de classificação de imagens. Modelos marcantes como AlexNet, VGG e ResNet foram treinados e avaliados no ImageNet, o que evidencia o seu papel no avanço da visão computacional.O conjunto de dados
imagenetdo Ultralytics usa o subconjunto ILSVRC-2012, com 1 000 classes, 1 281 167 imagens de treino e 50 000 imagens de validação, normalmente treinado com um tamanho de imagem de 224x224, e requer uma transferência de aproximadamente 144 GB. A base de dados ImageNet completa é muito maior (mais de 14 milhões de imagens em mais de 20 000 synsets WordNet), mas o subconjunto de 1 000 classes é o usado para treinar e avaliar modelos de classificação.Para treinar um modelo Ultralytics YOLO com o ImageNet, carrega um modelo de classificação pré-treinado e indica
dataparaimagenet:Exemplo de treinofrom ultralytics import YOLO # Carregar um modelo model = YOLO("yolo26n-cls.pt") # carregue um modelo pré-treinado (recomendado para treinamento) # Treinar o modelo results = model.train(data="imagenet", epochs=100, imgsz=224)Para obteres instruções de treino mais detalhadas, consulta a nossa página de treino.
Os modelos pré-treinados Ultralytics YOLO26 oferecem desempenho de ponta em termos de velocidade e exatidão em várias tarefas de visão computacional. Por exemplo, o modelo YOLO26n-cls, com uma exatidão top-1 de 71,4% e uma exatidão top-5 de 90,1%, está otimizado para aplicações em tempo real. Os modelos pré-treinados reduzem os recursos computacionais necessários para treinar de raiz e aceleram os ciclos de desenvolvimento. Consulta mais informações sobre as métricas de desempenho dos modelos YOLO26 na secção de modelos pré-treinados no ImageNet.
O Desafio de Reconhecimento Visual em Grande Escala ImageNet (ILSVRC) anual impulsionou os avanços em visão computacional ao proporcionar uma plataforma competitiva para avaliar algoritmos num conjunto de dados padronizado e em grande escala. As suas métricas de avaliação consistentes promoveram a inovação na classificação de imagens, deteção de objetos e segmentação de imagens, alargando continuamente os limites da aprendizagem profunda e da visão computacional.