Ultralytics YOLO27:

Dataset ImageNet#

Il dataset Ultralytics ImageNet (data="imagenet") è il sottoinsieme ImageNet-1k / ILSVRC-2012 utilizzato per addestrare e valutare modelli di classificazione delle immagini. Contiene 1.000 classi di oggetti, con 1.281.167 immagini di addestramento e 50.000 immagini di convalida a una dimensione di 224x224, e richiede il download di circa 144 GB di dati. Il database ImageNet completo è molto più grande — oltre 14 milioni di immagini ad alta risoluzione annotate con synset WordNet in più di 20.000 categorie — ma Ultralytics addestra il modello sul sottoinsieme ILSVRC standardizzato da 1.000 classi, diventato il benchmark de facto per il deep learning nella computer vision.

Modelli ImageNet preaddestrati#

Modellodimensione
(pixel)
acc
top1
acc
top5
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
parametri
(M)
FLOPs
(B) a 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.4
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.5
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.8
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.0
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.5

Funzionalità principali#

  • Il dataset Ultralytics imagenet fornisce 1.000 classi con 1.281.167 immagini di addestramento e 50.000 immagini di convalida (ILSVRC-2012), il benchmark standard per il preaddestramento nella classificazione delle immagini.
  • Le classi sono organizzate secondo la gerarchia WordNet, dove ogni classe corrisponde a un synset (un insieme di termini sinonimici).
  • Le immagini vengono addestrate a 224x224 e il dataset completo richiede un download di circa ~144 GB.
  • La Sfida annuale di riconoscimento visivo su larga scala di ImageNet (ILSVRC) ha svolto un ruolo fondamentale nel progresso della ricerca sulla computer vision.

Struttura del dataset#

Il dataset Ultralytics ImageNet utilizza la suddivisione ILSVRC-2012:

SuddivisioneImmaginiClassi
Addestramento1,281,1671,000
Convalida50,0001,000

Le immagini sono archiviate in cartelle separate per classe, denominate con l'ID del synset WordNet (ad esempio, n01440764), secondo la struttura prevista dall'addestramento alla classificazione di Ultralytics. Ognuna delle 1.000 classi corrisponde a un synset WordNet e non esiste una suddivisione di test separata, quindi il set di convalida da 50.000 immagini viene utilizzato per misurare l'accuratezza.

Dimensioni del download

ImageNet-1k richiede un download di circa ~144 GB, quindi assicurati di avere spazio sufficiente sul disco prima dell'addestramento. Per esperimenti rapidi, i sottoinsiemi più piccoli ImageNette e ImageNet10 utilizzano lo stesso formato delle cartelle e vengono addestrati in una frazione del tempo.

Sfida di riconoscimento visivo su larga scala di ImageNet (ILSVRC)#

La Sfida annuale di riconoscimento visivo su larga scala di ImageNet (ILSVRC) ha consentito ai ricercatori di valutare gli algoritmi su un dataset standardizzato su larga scala, con metriche di valutazione coerenti. Ha favorito importanti progressi nel deep learning per la classificazione delle immagini, il rilevamento degli oggetti e altre attività di computer vision — in particolare la vittoria di AlexNet nel 2012, che ha contribuito all'avvio dell'era moderna del deep learning.

Applicazioni#

Il dataset ImageNet è ampiamente utilizzato per addestrare e valutare modelli di deep learning per la classificazione delle immagini, il rilevamento degli oggetti e la localizzazione degli oggetti. Architetture di riferimento come AlexNet, VGG e ResNet sono state tutte sviluppate e valutate su ImageNet, e i pesi preaddestrati su ImageNet rimangono un punto di partenza comune per il transfer learning in diverse attività di computer vision.

Utilizzo#

Per addestrare un modello YOLO per la classificazione su ImageNet per 100 epoche con immagini di dimensioni 224x224, utilizza gli snippet di codice riportati di seguito. Per un elenco completo degli argomenti disponibili, consulta la pagina di addestramento del modello.

Esempio di addestramento
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Puoi anche gestire i dataset di classificazione ed eseguire l'addestramento nel cloud con Ultralytics Platform.

Immagini ed esempi di annotazioni#

Il dataset ImageNet comprende le 1.000 classi ILSVRC-2012 e offre una risorsa ampia e diversificata per l'addestramento e la valutazione dei modelli di computer vision. Ecco alcune immagini di esempio del dataset:

Immagini di esempio del dataset di classificazione ImageNet

Citazioni e ringraziamenti#

Se utilizzi il dataset ImageNet nelle tue attività di ricerca o sviluppo, cita il seguente articolo:

Citazione
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Desideriamo ringraziare il team di ImageNet, guidato da Olga Russakovsky, Jia Deng e Li Fei-Fei, per aver creato e mantenuto il dataset ImageNet come risorsa preziosa per la comunità di ricerca sul machine learning e sulla computer vision. Per ulteriori informazioni sul dataset ImageNet e sui suoi creatori, visita il sito web di ImageNet.

FAQ#

  • Il dataset ImageNet è un database di immagini su larga scala, la cui raccolta completa contiene oltre 14 milioni di immagini ad alta risoluzione annotate con synset WordNet. In Ultralytics, data="imagenet" viene addestrato sul sottoinsieme ILSVRC-2012 standardizzato da 1.000 classi, che costituisce il benchmark de facto per il preaddestramento nella classificazione delle immagini. Modelli di riferimento come AlexNet, VGG e ResNet sono stati addestrati e valutati su ImageNet, evidenziandone il ruolo nel progresso della computer vision.

  • Il dataset Ultralytics imagenet utilizza il sottoinsieme ILSVRC-2012 con 1.000 classi, 1.281.167 immagini di addestramento e 50.000 immagini di convalida a una dimensione di 224x224, per un download complessivo di circa 144 GB. Il database ImageNet completo è molto più grande (oltre 14 milioni di immagini distribuite in più di 20.000 synset WordNet), ma il sottoinsieme da 1.000 classi è quello utilizzato per l'addestramento e la valutazione della classificazione.

  • Per addestrare un modello YOLO Ultralytics su ImageNet, carica un modello di classificazione preaddestrato e indirizza data a imagenet:

    Esempio di addestramento
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Per istruzioni di addestramento più approfondite, consulta la nostra pagina sull'addestramento.

  • I modelli YOLO26 preaddestrati di Ultralytics offrono prestazioni all'avanguardia in termini di velocità e accuratezza per diverse attività di computer vision. Ad esempio, il modello YOLO26n-cls, con un'accuratezza top-1 del 71,4% e un'accuratezza top-5 del 90,1%, è ottimizzato per le applicazioni in tempo reale. I modelli preaddestrati riducono le risorse computazionali necessarie per l'addestramento da zero e accelerano i cicli di sviluppo. Scopri di più sulle metriche delle prestazioni dei modelli YOLO26 nella sezione Modelli ImageNet preaddestrati.

  • La Sfida annuale di riconoscimento visivo su larga scala di ImageNet (ILSVRC) ha favorito i progressi nella computer vision fornendo una piattaforma competitiva per valutare gli algoritmi su un dataset standardizzato su larga scala. Le sue metriche di valutazione coerenti hanno stimolato l'innovazione nella classificazione delle immagini, nel rilevamento degli oggetti e nella segmentazione delle immagini, spingendo continuamente i limiti del deep learning e della computer vision.

Commenti