YOLO Vision 2026:

ImageNet-Datensatz#

Der Ultralytics ImageNet-Datensatz (data="imagenet") ist die Untermenge von ImageNet-1k / ILSVRC-2012, die zum Trainieren und Benchmarking von Image-Classification-Modellen verwendet wird. Er enthält 1.000 Objektklassen mit 1.281.167 Trainingsbildern und 50.000 Validierungsbildern bei einer Bildgröße von 224x224 und wird als ca. 144 GB an Daten heruntergeladen. Die breitere ImageNet-Datenbank ist weitaus größer – über 14 Millionen hochauflösende Bilder, die mit WordNet-Synsets über mehr als 20.000 Kategorien hinweg annotiert sind –, aber Ultralytics trainiert auf der standardisierten 1.000-Klassen-ILSVRC-Untermenge, die zum De-facto-Benchmark für Deep Learning im Bereich Computer Vision wurde.

ImageNet vortrainierte Modelle#

ModellGröße
(Pixel)
acc
top1
acc
top5
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B) bei 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.5
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.6
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.9
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.2
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.6

Hauptfunktionen#

  • Der Ultralytics imagenet-Datensatz bietet 1.000 Klassen mit 1.281.167 Trainings- und 50.000 Validierungsbildern (ILSVRC-2012), dem Standard-Pretraining-Benchmark für die Bildklassifizierung.
  • Die Klassen sind gemäß der WordNet-Hierarchie organisiert, wobei jede Klasse einem Synset (einer Menge synonyme Begriffe) entspricht.
  • Die Bilder werden bei 224x224 trainiert und das vollständige Datenset ist ein großer Download von ~144 GB.
  • Die jährliche ImageNet Large Scale Visual Recognition Challenge (ILSVRC) hat maßgeblich zur Förderung der Computer-Vision-Forschung beigetragen.

Datensatzstruktur#

Das Ultralytics ImageNet Datenset verwendet den ILSVRC-2012 Split:

SplitBilderKlassen
Trainieren1,281,1671,000
Validation50,0001,000

Bilder werden in Ordnern pro Klasse gespeichert, die nach der WordNet-Synset-ID benannt sind (zum Beispiel n01440764), was dem Layout entspricht, das das Ultralytics-Klassifizierungstraining erwartet. Jede der 1.000 Klassen wird auf ein WordNet-Synset abgebildet, und es gibt keinen separaten Testsplit, sodass der 50.000 Bilder umfassende Validierungssatz verwendet wird, um die Genauigkeit zu messen.

Downloadgröße

ImageNet-1k hat einen Download-Umfang von ca. 144 GB, stelle also sicher, dass du vor dem Training genügend Speicherplatz hast. Für schnelle Experimente verwenden die kleineren Untermenge ImageNette und ImageNet10 dasselbe Ordnerformat und trainieren in einem Bruchteil der Zeit.

ImageNet Large Scale Visual Recognition Challenge (ILSVRC)#

Die jährliche ImageNet Large Scale Visual Recognition Challenge (ILSVRC) ermöglichte es Forschern, Algorithmen an einem groß angelegten, standardisierten Datensatz mit konsistenten Evaluierungsmetriken zu benchmarken. Sie trieb große Fortschritte im Deep Learning für die Bildklassifizierung, Objekterkennung und andere Vision-Aufgaben voran – vor allem AlexNets Sieg im Jahr 2012, der dazu beitrug, die Ära des modernen Deep Learning einzuläuten.

Anwendungen#

Der ImageNet-Datensatz wird häufig verwendet, um Deep-Learning-Modelle für Bildklassifizierung, Objekterkennung und Objektlokalisierung zu trainieren und zu evaluieren. Wegweisende Architekturen wie AlexNet, VGG und ResNet wurden alle auf ImageNet entwickelt und gebenchmarkt, und mit ImageNet vor trainierte Gewichte bleiben ein gängiger Ausgangspunkt für Transfer Learning über Vision-Aufgaben hinweg.

Verwendung#

Um ein YOLO-Klassifizierungsmodell auf ImageNet für 100 Epochen bei einer Bildgröße von 224x224 zu trainieren, verwende die Code-Snippets unten. Eine umfassende Liste der verfügbaren Argumente findest du auf der Modellseite für Training.

Trainingsbeispiel
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Du kannst Klassifizierungsdatensätze auch verwalten und das Training in der Cloud mit Ultralytics Platform ausführen.

Beispielbilder und Annotationen#

Das ImageNet Datenset umfasst die 1.000 ILSVRC-2012 Klassen und bietet eine vielfältige und umfangreiche Ressource zum Trainieren und Bewerten von Computer Vision Modellen. Hier sind einige Beispielbilder aus dem Datenset:

ImageNet classification dataset sample images

Zitate und Danksagungen#

Wenn du den ImageNet-Datensatz in deiner Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte das folgende Papier:

Zitat
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Wir möchten dem ImageNet-Team unter der Leitung von Olga Russakovsky, Jia Deng und Li Fei-Fei für die Erstellung und Pflege des ImageNet-Datensatzes als wertvolle Ressource für die Forschungscommunity für Machine Learning und Computer Vision danken. Weitere Informationen über den ImageNet-Datensatz und seine Ersteller findest du auf der ImageNet-Website.

FAQ#

  • Der ImageNet-Datensatz ist eine groß angelegte Bilddatenbank, deren umfassendere Sammlung über 14 Millionen hochauflösende Bilder enthält, die mit WordNet-Synsets annotiert sind. In Ultralytics trainiert data="imagenet" auf der standardisierten 1.000-Klassen-ILSVRC-2012-Untermenge, die der De-facto-Benchmark für das Pretraining von Image Classification ist. Wegweisende Modelle wie AlexNet, VGG und ResNet wurden auf ImageNet trainiert und gebenchmarkt, was seine Rolle bei der Weiterentwicklung von Computer Vision unterstreicht.

  • Der Ultralytics imagenet-Datensatz verwendet die ILSVRC-2012-Untermenge mit 1.000 Klassen, 1.281.167 Trainingsbildern und 50.000 Validierungsbildern bei einer Bildgröße von 224x224, was einem Gesamt-Download von etwa 144 GB entspricht. Die vollständige ImageNet-Datenbank ist viel größer (über 14 Millionen Bilder verteilt auf mehr als 20.000 WordNet-Synsets), aber die 1.000-Klassen-Untermenge ist diejenige, die für das Klassifizierungstraining und Benchmarking verwendet wird.

  • Um ein Ultralytics YOLO-Modell auf ImageNet zu trainieren, lade ein vortrainiertes Klassifizierungsmodell und verweise data auf imagenet:

    Trainingsbeispiel
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Ausführlichere Trainingsanweisungen findest du auf unserer Training-Seite.

  • Vortrainierte Ultralytics YOLO26-Modelle bieten modernste Leistung in Bezug auf Geschwindigkeit und Genauigkeit für verschiedene Computer-Vision-Aufgaben. Beispielsweise ist das YOLO26n-cls-Modell mit einer Top-1-Genauigkeit von 71,4 % und einer Top-5-Genauigkeit von 90,1 % für Echtzeitanwendungen optimiert. Vortrainierte Modelle reduzieren die für das Training von Grund auf erforderlichen Rechenressourcen und beschleunigen Entwicklungszyklen. Erfahre mehr über die Leistungsmetriken von YOLO26-Modellen im Abschnitt „ImageNet Pretrained Models“.

  • Die jährliche ImageNet Large Scale Visual Recognition Challenge (ILSVRC) trieb Fortschritte im Bereich Computer Vision voran, indem sie eine wettbewerbsorientierte Plattform zur Evaluierung von Algorithmen an einem groß angelegten, standardisierten Datensatz bot. Ihre konsistenten Evaluierungsmetriken förderten Innovationen bei der Bildklassifizierung, Objekterkennung und Image Segmentation und verschoben kontinuierlich die Grenzen von Deep Learning und Computer Vision.

Kommentare