Ultralytics YOLO27:

ImageNet-Datensatz#

Der Ultralytics ImageNet-Datensatz (data="imagenet") ist die für das Training und Benchmarking von Modellen zur Bildklassifizierung verwendete Teilmenge ImageNet-1k / ILSVRC-2012. Sie enthält 1.000 Objektklassen mit 1.281.167 Trainingsbildern und 50.000 Validierungsbildern bei einer 224x224 großen Bildauflösung und umfasst beim Download etwa 144 GB Daten. Die umfassendere ImageNet-Datenbank ist deutlich größer – sie enthält über 14 Millionen hochauflösende Bilder, die mit WordNet-Synsets in mehr als 20.000 Kategorien annotiert sind –, aber Ultralytics trainiert mit der standardisierten ILSVRC-Teilmenge mit 1.000 Klassen, die zum De-facto-Benchmark für Deep Learning im Bereich Computer Vision geworden ist.

Mit ImageNet vortrainierte Modelle#

ModellGröße
(Pixel)
acc
top1
acc
top5
Geschwindigkeit
CPU ONNX
(ms)
Geschwindigkeit
T4 TensorRT10
(ms)
Parameter
(M)
FLOPs
(B) bei 224
YOLO26n-cls22471.490.15.0 ± 0.31.1 ± 0.02.80.4
YOLO26s-cls22476.092.97.9 ± 0.21.3 ± 0.06.71.5
YOLO26m-cls22478.194.217.2 ± 0.42.0 ± 0.011.64.8
YOLO26l-cls22479.094.623.2 ± 0.32.8 ± 0.014.16.0
YOLO26x-cls22479.995.041.4 ± 0.93.8 ± 0.029.613.5

Wichtige Funktionen#

  • Der Ultralytics-Datensatz imagenet bietet 1.000 Klassen mit 1.281.167 Trainings- und 50.000 Validierungsbildern (ILSVRC-2012) und dient als standardmäßiger Benchmark für das Vortraining zur Bildklassifizierung.
  • Die Klassen sind gemäß der WordNet-Hierarchie organisiert, wobei jede Klasse einem Synset (einer Menge synonym verwendeter Begriffe) entspricht.
  • Die Bilder werden mit einer Auflösung von 224x224 trainiert, und der vollständige Datensatz umfasst einen großen Download von ~144 GB.
  • Die jährlich stattfindende ImageNet-Herausforderung zur visuellen Erkennung im großen Maßstab (ILSVRC) war maßgeblich für die Weiterentwicklung der Computer-Vision-Forschung.

Datensatzstruktur#

Der Ultralytics-ImageNet-Datensatz verwendet die folgende Aufteilung von ILSVRC-2012:

AufteilungBilderKlassen
Trainieren1,281,1671,000
Validierung50,0001,000

Die Bilder werden in Ordnern pro Klasse gespeichert, die nach der WordNet-Synset-ID benannt sind (zum Beispiel n01440764), entsprechend der von Ultralytics für das Training zur Bildklassifizierung erwarteten Struktur. Jede der 1.000 Klassen ist einem WordNet-Synset zugeordnet. Da es keine separate Testaufteilung gibt, wird der Validierungssatz mit 50.000 Bildern zur Messung der Genauigkeit verwendet.

Downloadgröße

ImageNet-1k umfasst einen Download von ~144 GB. Stelle daher vor dem Training sicher, dass ausreichend Speicherplatz vorhanden ist. Für schnelle Experimente verwenden die kleinere ImageNette- und ImageNet10-Teilmengen dasselbe Ordnerformat und lassen sich in einem Bruchteil der Zeit trainieren.

ImageNet-Herausforderung zur visuellen Erkennung im großen Maßstab (ILSVRC)#

Die jährlich stattfindende ImageNet-Herausforderung zur visuellen Erkennung im großen Maßstab (ILSVRC) ermöglichte es Forschenden, Algorithmen anhand eines standardisierten Datensatzes im großen Maßstab mit einheitlichen Bewertungsmetriken zu vergleichen. Sie trieb wesentliche Fortschritte beim Deep Learning für Bildklassifizierung, Objekterkennung und andere Bildverarbeitungsaufgaben voran – besonders deutlich durch AlexNets Sieg im Jahr 2012, der zum Beginn der modernen Deep-Learning-Ära beitrug.

Anwendungen#

Der ImageNet-Datensatz wird häufig zum Trainieren und Bewerten von Deep-Learning-Modellen für Bildklassifizierung, Objekterkennung und Objektlokalisierung verwendet. Bedeutende Architekturen wie AlexNet, VGG und ResNet wurden auf ImageNet entwickelt und evaluiert. Mit ImageNet vortrainierte Gewichte dienen weiterhin häufig als Ausgangspunkt für Transfer Learning bei verschiedenen Aufgaben im Bereich Computer Vision.

Verwendung#

Um ein YOLO-Klassifizierungsmodell auf ImageNet über 100 Epochen mit einer Bildauflösung von 224x224 zu trainieren, verwende die folgenden Codeausschnitte. Eine umfassende Liste der verfügbaren Argumente findest du auf der Seite zum Training des Modells.

Trainingsbeispiel
from ultralytics import YOLO

# Load a model
model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)

# Train the model
results = model.train(data="imagenet", epochs=100, imgsz=224)

Du kannst Klassifizierungsdatensätze auch mit Ultralytics Platform verwalten und das Training in der Cloud ausführen.

Beispielbilder und Annotationen#

Der ImageNet-Datensatz umfasst die 1.000 Klassen von ILSVRC-2012 und bietet damit eine vielfältige und umfangreiche Ressource zum Trainieren und Bewerten von Computer-Vision-Modellen. Hier sind einige Beispielbilder aus dem Datensatz:

Beispielbilder des ImageNet-Datensatzes zur Bildklassifizierung

Zitate und Danksagungen#

Wenn du den ImageNet-Datensatz für deine Forschungs- oder Entwicklungsarbeit verwendest, zitiere bitte die folgende Publikation:

Zitat
@article{ILSVRC15,
         author = {Olga Russakovsky and Jia Deng and Hao Su and Jonathan Krause and Sanjeev Satheesh and Sean Ma and Zhiheng Huang and Andrej Karpathy and Aditya Khosla and Michael Bernstein and Alexander C. Berg and Li Fei-Fei},
         title={ImageNet Large Scale Visual Recognition Challenge},
         year={2015},
         journal={International Journal of Computer Vision (IJCV)},
         volume={115},
         number={3},
         pages={211-252}
}

Unser Dank gilt dem ImageNet-Team unter der Leitung von Olga Russakovsky, Jia Deng und Li Fei-Fei für die Erstellung und Pflege des ImageNet-Datensatzes als wertvolle Ressource für die Forschungscommunity im Bereich maschinelles Lernen und Computer Vision. Weitere Informationen zum ImageNet-Datensatz und seinen Erstellern findest du auf der ImageNet-Website.

FAQ#

  • Der ImageNet-Datensatz ist eine umfangreiche Bilddatenbank, deren Gesamtsammlung über 14 Millionen hochauflösende Bilder enthält, die mit WordNet-Synsets annotiert sind. Bei Ultralytics wird mit data="imagenet" auf der standardisierten ILSVRC-2012-Teilmenge mit 1.000 Klassen trainiert, die als De-facto-Benchmark für das Vortraining zur Bildklassifizierung gilt. Bedeutende Modelle wie AlexNet, VGG und ResNet wurden auf ImageNet trainiert und evaluiert, was die Rolle des Datensatzes für die Weiterentwicklung von Computer Vision unterstreicht.

  • Der Ultralytics-Datensatz imagenet verwendet die ILSVRC-2012-Teilmenge mit 1.000 Klassen, 1.281.167 Trainingsbildern und 50.000 Validierungsbildern bei einer Bildauflösung von 224x224. Der Download umfasst insgesamt etwa 144 GB. Die vollständige ImageNet-Datenbank ist deutlich größer (über 14 Millionen Bilder in mehr als 20.000 WordNet-Synsets), aber die Teilmenge mit 1.000 Klassen wird für das Training und Benchmarking der Bildklassifizierung verwendet.

  • Um ein Ultralytics-YOLO-Modell auf ImageNet zu trainieren, lade ein vortrainiertes Klassifizierungsmodell und verweise mit data auf imagenet:

    Trainingsbeispiel
    from ultralytics import YOLO
    
    # Load a model
    model = YOLO("yolo26n-cls.pt")  # load a pretrained model (recommended for training)
    
    # Train the model
    results = model.train(data="imagenet", epochs=100, imgsz=224)

    Ausführlichere Anweisungen zum Training findest du auf unserer Trainingsseite.

  • Die vortrainierten Ultralytics-YOLO26-Modelle bieten bei verschiedenen Computer-Vision-Aufgaben eine hohe Geschwindigkeit und Genauigkeit. So ist beispielsweise das Modell YOLO26n-cls mit einer Top-1-Genauigkeit von 71,4 % und einer Top-5-Genauigkeit von 90,1 % für Echtzeitanwendungen optimiert. Vortrainierte Modelle verringern den für das Training von Grund auf erforderlichen Rechenaufwand und beschleunigen die Entwicklungszyklen. Weitere Informationen zu den Leistungsmetriken der YOLO26-Modelle findest du im Abschnitt Mit ImageNet vortrainierte Modelle.

  • Die jährlich stattfindende ImageNet-Herausforderung zur visuellen Erkennung im großen Maßstab (ILSVRC) trieb die Weiterentwicklung von Computer Vision voran, indem sie eine Wettbewerbsplattform zur Bewertung von Algorithmen anhand eines standardisierten Datensatzes im großen Maßstab bereitstellte. Ihre einheitlichen Bewertungsmetriken förderten Innovationen in den Bereichen Bildklassifizierung, Objekterkennung und Bildsegmentierung und verschoben kontinuierlich die Grenzen von Deep Learning und Computer Vision.

Kommentare