YOLO Vision 2026:

Dataset ImageNet#

Il set di dati Ultralytics ImageNet (data="imagenet") è il sottoinsieme ImageNet-1k / ILSVRC-2012 utilizzato per addestrare e valutare i modelli di image classification. Contiene 1.000 classi di oggetti con 1.281.167 immagini di addestramento e 50.000 immagini di convalida a una dimensione di 224x224 pixel, e richiede il download di circa 144 GB di dati. Il database ImageNet più ampio è notevolmente più vasto (oltre 14 milioni di immagini ad alta risoluzione annotate con synset WordNet in più di 20.000 categorie), ma Ultralytics effettua l'addestramento sul sottoinsieme standardizzato ILSVRC a 1.000 classi che è diventato il punto di riferimento de facto per il deep learning nella computer vision.

Modelli preaddestrati ImageNet#

Modellodimensione
(pixel)
acc
top1
acc
top5
Velocità
CPU ONNX
(ms)
Velocità
T4 TensorRT10
(ms)
params
(M)
FLOPs
(B) a 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.5
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.6
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.9
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.2
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.6

Caratteristiche principali#

  • Il set di dati Ultralytics imagenet fornisce 1.000 classi con 1.281.167 immagini di addestramento e 50.000 immagini di convalida (ILSVRC-2012), il punto di riferimento standard per il pretraining nella classificazione delle immagini.
  • Le classi sono organizzate secondo la gerarchia WordNet, dove ogni classe corrisponde a un synset (un insieme di termini sinonimi).
  • Le immagini vengono addestrate a 224x224 e il dataset completo è un download voluminoso di ~144 GB.
  • L'annuale ImageNet Large Scale Visual Recognition Challenge (ILSVRC) è stato fondamentale per far avanzare la ricerca nella computer vision.

Struttura del dataset#

Il dataset Ultralytics ImageNet utilizza lo split ILSVRC-2012:

SplitImmaginiClassi
Addestramento1,281,1671,000
Validazione50,0001,000

Le immagini sono memorizzate in cartelle per classe denominate tramite l'ID del synset WordNet (ad esempio, n01440764), la struttura prevista dall'addestramento per la classificazione di Ultralytics. Ciascuna delle 1.000 classi corrisponde a un synset WordNet e non è presente uno split di test separato; pertanto, il set di validazione di 50.000 immagini viene utilizzato per misurare l'accuracy.

Dimensioni del download

ImageNet-1k richiede il download di circa 144 GB, quindi assicurati di avere abbastanza spazio su disco prima di iniziare l'addestramento. Per esperimenti rapidi, i sottoinsiemi più piccoli ImageNette e ImageNet10 utilizzano lo stesso formato di cartella e si addestrano in una frazione del tempo.

ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#

L'annuale ImageNet Large Scale Visual Recognition Challenge (ILSVRC) ha permesso ai ricercatori di confrontare gli algoritmi su un set di dati standardizzato su larga scala con metriche di valutazione coerenti. Ha guidato importanti progressi nel deep learning per la classificazione delle immagini, l'object detection e altre attività di visione, in particolare con la vittoria di AlexNet nel 2012, che ha contribuito a dare il via all'era moderna del deep learning.

Applicazioni#

Il set di dati ImageNet è ampiamente utilizzato per addestrare e valutare i modelli di deep learning per la classificazione delle immagini, il rilevamento degli oggetti e la localizzazione degli oggetti. Architetture di riferimento come AlexNet, VGG e ResNet sono state tutte sviluppate e confrontate su ImageNet, e i pesi preaddestrati su ImageNet rimangono un punto di partenza comune per il transfer learning tra attività di visione.

Utilizzo#

Per addestrare un modello di classificazione YOLO su ImageNet per 100 epochs a una dimensione di immagine di 224x224, utilizza i frammenti di codice sottostanti. Per un elenco completo degli argomenti disponibili, fai riferimento alla pagina di Training del modello.

Esempio di Addestramento
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Puoi anche gestire i set di dati di classificazione ed eseguire l'addestramento nel cloud con Ultralytics Platform.

Esempi di immagini e annotazioni#

Il dataset ImageNet copre le 1.000 classi ILSVRC-2012, fornendo una risorsa diversificata ed estesa per addestrare e valutare modelli di computer vision. Ecco alcune immagini di esempio dal dataset:

ImageNet classification dataset sample images

Citazioni e riconoscimenti#

Se utilizzi il dataset ImageNet nella tua attività di ricerca o sviluppo, ti preghiamo di citare il seguente documento:

Citazione
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Desideriamo ringraziare il team di ImageNet, guidato da Olga Russakovsky, Jia Deng e Li Fei-Fei, per aver creato e mantenuto il set di dati ImageNet come risorsa preziosa per la comunità di ricerca di machine learning e computer vision. Per ulteriori informazioni sul set di dati ImageNet e sui suoi creatori, visita il sito Web di ImageNet.

FAQ#

  • Il set di dati ImageNet è un database di immagini su larga scala la cui collezione più ampia contiene oltre 14 milioni di immagini ad alta risoluzione annotate con synset WordNet. In Ultralytics, data="imagenet" si addestra sul sottoinsieme standardizzato ILSVRC-2012 a 1.000 classi, che rappresenta il punto di riferimento de facto per il pretraining della image classification. Modelli di riferimento come AlexNet, VGG e ResNet sono stati addestrati e valutati su ImageNet, sottolineandone il ruolo nell'avanzamento della computer vision.

  • Il set di dati Ultralytics imagenet utilizza il sottoinsieme ILSVRC-2012 con 1.000 classi, 1.281.167 immagini di addestramento e 50.000 immagini di convalida a una dimensione di immagine di 224x224, per un download totale di circa 144 GB. Il database ImageNet completo è molto più grande (oltre 14 milioni di immagini in più di 20.000 synset WordNet), ma il sottoinsieme a 1.000 classi è quello utilizzato per l'addestramento e il benchmarking della classificazione.

  • Per addestrare un modello Ultralytics YOLO su ImageNet, carica un modello di classificazione preaddestrato e punta data su imagenet:

    Esempio di Addestramento
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Per istruzioni di addestramento più approfondite, fai riferimento alla nostra pagina di addestramento.

  • I modelli preaddestrati Ultralytics YOLO26 offrono prestazioni all'avanguardia in termini di velocità e accuracy per varie attività di computer vision. Ad esempio, il modello YOLO26n-cls, con un'accuracy top-1 del 71,4% e un'accuracy top-5 del 90,1%, è ottimizzato per applicazioni in tempo reale. I modelli preaddestrati riducono le risorse computazionali necessarie per l'addestramento da zero e accelerano i cicli di sviluppo. Scopri di più sulle metriche delle prestazioni dei modelli YOLO26 nella sezione dei modelli preaddestrati di ImageNet.

  • L'annuale ImageNet Large Scale Visual Recognition Challenge (ILSVRC) ha guidato i progressi nella computer vision fornendo una piattaforma competitiva per la valutazione degli algoritmi su un set di dati standardizzato su larga scala. Le sue metriche di valutazione coerenti hanno favorito l'innovazione nella classificazione delle immagini, nel rilevamento degli oggetti e nell'image segmentation, spingendo continuamente i confini del deep learning e della computer vision.

Commenti