Datensätze#
Ultralytics Platform-Datasets bieten eine optimierte Lösung zur Verwaltung deiner Trainingsdaten. Nach dem Upload verarbeitet die Plattform Bilder, Labels und Statistiken automatisch.
Ein Dataset ist bereit für das Training, sobald die Verarbeitung abgeschlossen ist und es mindestens ein Bild im train-Split, mindestens ein Bild in einem der beiden Splits val oder test sowie mindestens ein gelabeltes Bild enthält. Der Dataset-Header zeigt einen Ready-Badge, wenn alle drei Bedingungen erfüllt sind, und andernfalls einen Not Ready-Badge – klicke auf den Badge, um genau zu sehen, welche Bedingung fehlt.
Datensatz hochladen#
Die Ultralytics Platform akzeptiert für mehr Flexibilität verschiedene Upload-Formate.
Wenn du bereits Datasets in Roboflow hast, kannst du diese über Integrations direkt importieren – ganz ohne manuelle Exporte oder erneutes Hochladen. Daten in Google Cloud Storage, Amazon S3 oder Azure Blob Storage können stattdessen über Cloud storage verwendet werden. Enterprise-Arbeitsbereiche können On Premise nutzen, um lokale Daten zu indexieren und damit zu trainieren, ohne Pixel an die Platform zu senden.
Unterstützte Formate#
| Format | Erweiterungen | Hinweise | Maximale Größe |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Am gebräuchlichsten, empfohlen | 50 MB |
| PNG | .png | Unterstützt Transparenz | 50 MB |
| WebP | .webp | Modern, gute Kompression | 50 MB |
| BMP | .bmp | Unkomprimiert | 50 MB |
| TIFF | .tiff, .tif | Hohe Qualität | 50 MB |
| HEIC | .heic | iPhone-Fotos | 50 MB |
| AVIF | .avif | Format der nächsten Generation | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Rohdaten der Kamera | 50 MB |
| MPO | .mpo | Multi-Picture-Objekt | 50 MB |
Video-Codec-Unterstützung#
Die Dateiendung allein reicht nicht aus: Ein Video kann dennoch fehlschlagen, wenn sein Codec während der Verarbeitung nicht decodiert werden kann.
H.264-Video in einem MP4-Container bietet die breiteste Decoder-Unterstützung und ist die sicherste Wahl. Wenn ein Video nicht verarbeitet werden kann, reencodiere es mit FFmpeg:
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4Vorbereitung deines Datensatzes#
Die Platform unterstützt Ultralytics YOLO, COCO, Tiefendatensätze, Ultralytics NDJSON und rohe (unannotierte) Uploads:
Verwende die Standard-YOLO-Verzeichnisstruktur mit einer data.yaml-Datei:
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlDie YAML-Datei definiert deine Datensatzkonfiguration:
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogRohdaten: Lade unannotierte Bilder hoch (ohne Labels). Dies ist nützlich, wenn du direkt auf der Plattform mit dem annotation editor annotieren möchtest.
Du kannst Bilder auch ohne explizite Split-Ordner hochladen. Die Plattform berücksichtigt beim Upload das aktive Split-Ziel. Wenn kein Split-Ziel festgelegt ist und der Upload val leer lässt – oder weniger als zwei gepaarte Maps für Tiefe enthält – verschieben Nicht-Klassifizierungsdatensätze Trainingsbilder automatisch nach val, sodass der Datensatz sofort trainierbar ist. Klassifizierungsdatensätze werden übersprungen, da sie verzeichnisbasierte Splits verwenden. Du kannst Bilder später jederzeit mit Massen-Verschieben-zu-Split oder Split-Neugewichtung neu zuordnen.
Das Format wird automatisch erkannt: Datasets mit einer data.yaml, die die Schlüssel names, train oder val enthält, werden als YOLO behandelt. Datasets mit COCO-JSON-Dateien (die die Arrays images, annotations und categories enthalten) werden als COCO behandelt. .ndjson-Exporte werden als Ultralytics NDJSON importiert. Datasets, die nur aus Bildern und keinen Annotationen bestehen, werden als Rohdaten behandelt.
Wenn ein Archiv mehrere YAML-Dateien enthält, bevorzugt Platform Standardnamen (data.yaml, data.yml, dataset.yaml, dataset.yml), die dem Archiv-Root am nächsten liegen. Behalte pro Archiv eine klar benannte YAML-Datei bei, um Unklarheiten zu vermeiden.
Labelfiles im Pascal-VOC-XML-Format werden erkannt, aber ihre Annotationen werden nicht importiert – die Bilder werden als unannotiert hochgeladen. Platform warnt dich vor Beginn des Uploads ("Pascal VOC labels detected"). Konvertiere VOC-XML zuerst nach YOLO oder COCO; siehe Formatkonvertierungstools.
Wenn Labels Klassen-IDs referenzieren, aber keine Klassennamen angegeben sind, generiert Platform dichte Platzhalternamen (class0, class1, …), die du später im Tab Classes umbenennen kannst.
Details zu formatspezifischen Eigenschaften findest du unter supported tasks und in der Datasets Overview.
Upload-Prozess#
So erstellst du ein Dataset:
- Navigiere in der Seitenleiste zu
Annotate - Klicke auf
New Dataset - Wähle einen Datenquellen-Tab aus (siehe Data Sources unten)
- Füge einen Namen hinzu – der URL-Slug wird automatisch abgeleitet und kann bearbeitet werden – sowie eine optionale Beschreibung
- Wähle den Aufgabentyp (siehe supported tasks), eine optionale Lizenz (siehe available licenses) und die Sichtbarkeit (öffentlich oder privat)
- Klicke auf
Create & Uploadfür lokale Dateien,Create & Importfür eine URL oder eine verbundene Quelle, oderCreate Dataset, um leer zu beginnen
Um Dateien zu einem bestehenden Dataset hinzuzufügen, öffne dessen Dataset-Seite und ziehe die Dateien per Drag-and-Drop in die Galerie oder klicke auf das Upload-Symbol im Header der Seite. Das Upload-Symbol öffnet direkt die Dateiauswahl deines Browsers, da die Aufgabe des Datasets bereits definiert ist.
Datenquellen#
Der New Dataset-Dialog bietet vier Quellen:
| Quelle | Beschreibung |
|---|---|
| Upload | Ziehe Dateien per Drag & Drop hinein oder suche nach ihnen – Bilder, Videos, Archive oder NDJSON |
| URL | Füge einen direkten Link zu einer Datei vom Typ .zip, .tar, .tar.gz, .tgz oder .ndjson ein; Platform lädt sie herunter und verarbeitet sie serverseitig |
| Cloud | Verwende Daten direkt an Ort und Stelle von Google Cloud Storage, Amazon S3 oder Azure Blob Storage (Pro und Enterprise) |
| On-Premise | Indexiere und trainiere Daten, die deine eigenen Maschinen niemals verlassen, über On Premise-Worker (Enterprise) |
Ein URL-Import ist sowohl durch das Limit deines Tarifs pro Upload (10 GB Free / 20 GB Pro / 50 GB Enterprise) als auch durch dein verbleibendes Speicherplatzkontingent begrenzt, je nachdem, welcher Wert kleiner ist. Der Link muss über HTTP oder HTTPS öffentlich erreichbar sein und auf eine unterstützte Endung enden.
Bevor der Upload beginnt#
Platform validiert deine Dateien im Browser, bevor etwas hochgeladen wird, sodass häufige Probleme sofort und nicht erst nach einer langen Übertragung auftreten. Archive werden auf Beschädigung, Leere, Passwortschutz und YAML-Syntaxfehler überprüft, und zu große Dateien werden namentlich aufgelistet.
Danach werden möglicherweise zwei Dialoge angezeigt:
Wenn das Archiv Klassennamen deklariert und dein Dataset bereits Klassen hat, listet der Map imported classes-Dialog eine Zeile pro eingehender Klasse auf. Wähle für jede einzelne eine bestehende Klasse aus, in die sie zusammengeführt werden soll, erstelle eine neue Klasse oder überspringe sie. Exakte Namensübereinstimmungen sind vorab ausgewählt, und übersprungene Klassen sowie deren Annotationen werden nicht importiert.
Nach dem Upload verarbeitet die Plattform deine Daten automatisch:
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Validierung: Format- und Größenprüfungen
- Normalisierung: Große Bilder werden skaliert (max. 4096 px, Mindestdimension 28 px), Graustufen nach RGB erweitert, Transparenz auf Weiß abgeflacht und die EXIF-Ausrichtung angewendet
- Thumbnails: Es werden 256px WebP-Vorschauen generiert
- Label-Parsing: YOLO-, COCO- und NDJSON-Labels extrahiert
- Statistiken: Klassenvorverteilungen und Bildabmessungen werden berechnet
AVIF- und WebP-Originale werden Byte für Byte gespeichert, wenn keine Größenänderung oder Farbänderung erforderlich ist. Alles andere wird neu codiert – WebP-Quellen bleiben WebP, und alle anderen Formate (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) werden zu JPEG mit Qualitätsstufe 92. Dein ursprünglicher Dateiname und die Quellendung werden als Metadaten beibehalten.

Vor dem Hochladen validieren
Du kannst deinen Datensatz vor dem Hochladen lokal validieren:
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")Bilder müssen an ihrer kürzesten Seite mindestens 28px groß sein. Kleinere Bilder werden während der Verarbeitung abgelehnt. Bilder, die an ihrer längsten Seite größer als 4096px sind, werden unter Beibehaltung des Seitenverhältnisses automatisch skaliert.
Bilder durchsuchen#
Zeige deine Datensatzbilder in verschiedenen Layouts an.
Öffne das Clustering-Panel über die Galerie-Symbolleiste, um dein Dataset als interaktives 2D-Streudiagramm zu erkunden.
| Ansicht | Beschreibung |
|---|---|
| Raster | Thumbnail-Raster mit Annotation-Overlays (Standard) |
| Kompakt | Kleinere Thumbnails für schnelles Scannen |
| Tabelle | Liste mit Thumbnail, Dateiname, Abmessungen, Größe, Split, Klassen und Label-Anzahl |

Sortieren und Filtern#
Bilder können für ein effizientes Browsen sortiert und gefiltert werden:
Jede Option schaltet zwischen aufsteigend (↑) und absteigend (↓) um:
| Sortieren | Beschreibung |
|---|---|
| Erstellt ↑/↓ | Upload-Reihenfolge (Standard ↓) |
| Name ↑/↓ | Dateiname alphabetisch |
| Höhe ↑/↓ | Bildhöhe in Pixeln |
| Breite ↑/↓ | Bildbreite in Pixeln |
| Größe ↑/↓ | Dateigröße auf dem Datenträger |
| Anmerkungen ↑/↓ | Anzahl der Anmerkungen pro Bild |
Bei Datasets mit über 100.000 Bildern werden die Sortierungen nach Name, Breite, Höhe und Größe ausgeblendet, damit die Galerie reaktionsfähig bleibt. Die Sortierungen nach Erstellungsdatum und Annotationsanzahl bleiben verfügbar.
Verwende den Annotations-Filter, der auf Unannotated gesetzt ist, um schnell Bilder zu finden, die noch annotiert werden müssen. Dies ist besonders nützlich bei großen Datasets, bei denen du den Fortschritt der Etikettierung verfolgen möchtest.
Das Suchfeld befindet sich rechts in der Galerie-Symbolleiste und filtert jeden Ansichtsmodus – Raster, Kompakt und Tabelle. Es gleicht den Bilddateinamen (die Dateiendung ist optional) sowie benutzerdefinierte Metadatenschlüssel, Skalarwerte und Array-Einträge ab, sodass ein Bild namens img_0042 mit {"ship_type": "yacht"} durch die Suche nach entweder img_0042 oder yacht gefunden wird.
In Unterobjekten verschachtelte Werte werden nicht abgeglichen. Das Einfügen einer 24-stelligen Bild-ID sucht genau dieses Bild direkt auf und umgeht die Textsuche.
Vollbildanzeige#
Klicke auf ein beliebiges Bild, um die Vollbildanzeige zu öffnen mit:
- Navigation: Pfeiltasten oder Miniaturansichten zum Durchsuchen
- Bildinformationen: Überprüfe von der Platform generierte Eigenschaften, benutzerdefinierte Metadaten und eingebettete Dateimetadaten wie EXIF
- Benutzerdefinierte Metadaten: Besitzer und Bearbeiter können ein JSON-Objekt hinzufügen oder ersetzen, einschließlich verschachtelter Werte bis zu 500.000 serialisierten Zeichen und Schlüsseln auf oberster Ebene bis zu 128 Zeichen
- Anmerkungen: Sichtbarkeit der Anmerkungs-Overlays umschalten
- Klassenaufschlüsselung: Anzahl der Labels pro Klasse mit Farbindikatoren
- Annotate: Wenn du über Bearbeitungsrechte verfügst, sind die Annotationssteuerelemente sofort aktiv, sobald sich der Vollbild-Viewer auf dem Desktop öffnet
- Herunterladen: Lade die originale Bilddatei herunter
- Löschen: Lösche das Bild aus dem Datensatz
- Zoom:
Cmd/Ctrl+Scroll,Cmd/Ctrl++oderCmd/Ctrl+=zum Hineinzoomen undCmd/Ctrl+-zum Herauszoomen - Ansicht zurücksetzen:
Cmd/Ctrl + 0oder die Reset-Schaltfläche, um das Bild an den Viewer anzupassen - Verschieben (Pan): Halte
Spacegedrückt und ziehe die Maus, um den Bereich im gezoomten Zustand zu verschieben - Pixelansicht: Schalte die pixelige Darstellung für eine genaue Inspektion ein
- Tiefenvorhang: Bei Tiefendatensätzen blendet ein verschiebbarer Teiler zwischen dem RGB-Bild und seiner farbigen Tiefenkarte hin und her

Nach Split filtern#
Bilder nach ihrem Datensatz-Split filtern:
| Split | Zweck |
|---|---|
| Trainieren | Verwendet für das Modelltraining |
| Val | Verwendet für die Validierung während des Trainings |
| Testen | Verwendet für die abschließende Bewertung |
Clustering#
Das Clustering-Panel projiziert dein Dataset in ein interaktives 2D-Streudiagramm, in dem sich visuell ähnliche Bilder nahe beieinander befinden. Nutze es, um Cluster aufzudecken, Duplikate und Ausreißer zu erkennen und zu untersuchen, wie Splits oder Klassen in deinen Daten verteilt sind – ohne die Galerie zu verlassen. Öffne es über das Streudiagramm-Symbol in der Galerie-Symbolleiste auf einer beliebigen Dataset-Seite.

Analyse ausführen#
Starte eine Analyse:
- Öffne einen Datensatz und klicke auf das Streudiagramm-Symbol in der Galerie-Symbolleiste
- Klicke auf
Analyze Dataset - Warte, bis der Fortschrittsbalken abgeschlossen ist – die Ergebnisse erscheinen im selben Panel
Die Analyse läuft im Hintergrund in zwei Stufen (Computing embeddings und Clustering) ab und kann je nach Größe deines Datasets einige Minuten dauern. Du kannst das Panel schließen oder die Seite verlassen und später zurückkehren.
Ein Dataset benötigt mindestens 20 und höchstens 200.000 fehlerfreie Bilder zur Analyse. Verbundene Datasets, die auf Cloud- oder On-Premise-Speicher basieren, werden noch nicht unterstützt.
Visualisierung#
Sobald die Analyse abgeschlossen ist, zeigt das Panel ein 2D-Punktdiagramm aller analysierten Bilder mit einer Legende und einem Punktzähler. Galeriefilter (Split, Klasse, gelabelt/unselabelt) blenden Punkte außerhalb des Filters ab, sodass du dich auf die von dir gewünschte Teilmenge konzentrieren kannst – der Zähler zeigt dann visible / total points an.

Färben nach#
Ändere die Einfärbung der Datenpunkte über das Dropdown-Menü Color by in der Panel-Symbolleiste. Wechsle jederzeit den Ansichtsmodus – das Diagramm wird sofort neu eingefärbt, sodass du sehen kannst, wie Splits, Klassen oder Bildeigenschaften über deine Cluster verteilt sind:
| Option | Schattierung |
|---|---|
| Splits | Train / Val / Test |
| Klassen | Erste Anmerkungsklasse auf jedem Bild |
| Breite | Bildbreite |
| Höhe | Bildhöhe |
| Größe | Dateigröße |
| Annotationen | Anzahl der Anmerkungen pro Bild |

Lasso-Auswahl#
Zeichne eine freie Auswahl um einen Bereich, um Punkte im Diagramm hervorzuheben. Die Galerie filtert auf die entsprechenden Bilder herunter, sodass du sie mit den üblichen image operations untersuchen, neu beschriften, verschieben oder löschen kannst.
Ein Chip über dem Diagramm zeigt an, wie viele Punkte ausgewählt sind – klicke auf ×, um das Lasso aufzuheben und zur vollständigen Galerieansicht zurückzukehren.
Ein Lasso entspricht höchstens 1.000 Bildern. Wenn deine Auswahl mehr umfasst, zeigt Platform eine Stichprobe von 1.000 an und schlägt vor, einen kleineren Bereich zu zeichnen.
Schwenken und Zoomen#
Navigiere direkt mit Maus und Tastatur durch große Punktdiagramme oder nutze die Zoom-Schaltflächen unten links im Plot:
| Eingabe | Aktion |
|---|---|
| Scrollen | Das Diagramm in 2D schwenken |
| Cmd/Ctrl+Scroll | Hinein- oder herauszoomen, verankert am Cursor |
| Space halten | In den Drag-to-Pan-Modus wechseln |
| Reset-Schaltfläche | Zur vollständigen Ansicht des Plots zurückkehren |
Neu analysieren#
Wenn sich dein Dataset nach der Analyse ändert – neue Bilder hinzukommen oder die Anzahl der analysierten Bilder nicht mehr zum Dataset passt –, erscheint oben im Panel für Besitzer und Redakteure eine Re-analyze-Schaltfläche.
Klicke auf Re-analyze, um Embeddings und die 2D-Projektion von Grund auf neu zu berechnen.
Datensatz-Tabs#
Jede Datensatzseite kann je nach Datensatzstatus und deinen Berechtigungen bis zu sechs Tabs anzeigen:
Bilder-Tab#
Die Standardansicht zeigt die Bildergalerie mit Anmerkungs-Overlays. Unterstützt Raster-, Kompakt- und Tabellenansichtsmodi. Ziehe Dateien per Drag & Drop hierher, um weitere Bilder hinzuzufügen.
Klassen-Tab#
Dieser Tab wird angezeigt, wenn der Datensatz Bilder enthält und seine Aufgabe Klassen hat.
Verwalte Anmerkungsklassen für deinen Datensatz:
- Klassenhistogramm: Balkendiagramm, das die Anzahl der Annotationen pro Klasse zeigt, sortiert nach Häufigkeit, mit Umschalter für lineare/logarithmische Skala
- Klassentabelle: Sortierbare, durchsuchbare Tabelle mit Index, Name, Annotationsanzahl und Bildanzahl
- Klassennamen bearbeiten: Klicke auf einen Klassennamen, um ihn direkt umzubenennen
- Klassenfarben bearbeiten: Klicke auf ein Farbfeld, um die Klassenfarbe zu ändern
- Neue Klasse hinzufügen: Verwende das Eingabefeld unten, um Klassen hinzuzufügen
- Klassen zusammenführen: Wähle zwei oder mehr Zeilen aus und klicke auf
Merge into one - Klassen löschen: Wähle eine oder mehrere Zeilen aus und klicke auf
Delete

Wenn dein Dataset ein Klassenungleichgewicht aufweist (z. B. 10.000 „Personen“-Annotationen, aber nur 50 „Fahrräder“), verwende den Log Scale-Schalter im Klassenhistogramm, um alle Klassen deutlich zu visualisieren.
Klassen zusammenführen#
Das Zusammenführen konsolidiert doppelte oder sich überschneidende Labels – zum Beispiel das Einbinden von car, automobile und vehicle in eine einzige Klasse:
- Wähle zwei oder mehr Klassen über die Kontrollkästchen der Zeilen aus
- Klicke auf
Merge into onein der Tabellenkopfzeile oder mache einen Rechtsklick auf die Auswahl - Wähle aus, welche der ausgewählten Klassen das Ziel ist, in das die anderen zusammengeführt werden
- Bestätigen
Jede Annotation, die zu den Quellklassen gehört, wird der Zielklasse neu zugewiesen, und die Quellklassen werden entfernt. Es werden keine Annotationen gelöscht, sodass die Gesamtzahl der Annotationen des Datasets unverändert bleibt.
Klassen löschen#
- Wähle eine oder mehrere Klassen über die Kontrollkästchen der Zeilen aus
- Klicke auf
Deletein der Tabellenkopfzeile oder mache einen Rechtsklick auf die Auswahl - Bestätigen
Das Löschen einer Klasse entfernt die Klasse sowie alle dazugehörigen Annotationen. Bei Klassifizierungs-Datasets werden die Labels entfernt, aber die Bilder bleiben erhalten und werden unannotiert.
Klassen-IDs sind positional. Das Zusammenführen oder Löschen einer Klasse verschiebt jeden höheren Klassenindex nach unten, um die Lücke zu schließen, sodass Exporte und Labelfiles, die vor der Änderung geschrieben wurden, nicht mehr mit den neuen Indizes übereinstimmen. Erstelle zuerst eine Version, wenn du die alte Nummerierung benötigst.
Klassenanzahlen werden aus höchstens 100.000 Bildern berechnet. Bei größeren Datasets lautet ein Hinweis über dem Histogramm "Based on a 100,000-image subset of this dataset."
Registerkarte Diagramme#
Dieser Tab erscheint, wenn der Datensatz Bilder enthält.
Automatisch berechnete Statistiken aus deinem Datensatz:
Diagramme werden in dieser Reihenfolge angezeigt, und jedes wird ausgelassen, wenn das Dataset keine Daten dafür enthält – ein Rohbild-Dataset zeigt keine Annotationsdiagramme, und Points per Instance erscheint nur für Segmentierungs- und Posedaten:
| Diagramm | Beschreibung |
|---|---|
| Split-Verteilung | Donut-Diagramm der Bildanzahl für Train/Val/Test und der prozentualen Label-Verteilung |
| Top-Klassen | Donut-Diagramm der 10 häufigsten Annotationsklassen, wobei der Rest als "Other" zusammengefasst wird |
| Bildabmessungen | Histogramm der Verteilung von Bildbreite und -höhe (überlagert) mit Mittelwert |
| Bilddateigröße | Histogramm der Verteilung der Bilddateigröße |
| Bildabmessungen 2D | 2D-Heatmap von Breite vs. Höhe mit Hilfslinien für das Seitenverhältnis |
| Annotations-Positionen | 2D-Heatmap der Mittelpunkte der Bounding Boxes |
| Bildformate | Verteilung der Quell-Bildformate (JPG, PNG, etc.) |
| Bounding Box-Abmessungen | Histogramm der Bounding Box-Breite und -höhe (überlagert) |
| Objekte pro Bild | Histogramm der Anzahl der Annotationen pro Bild |
| Punkte pro Instanz | Anzahl der Polygon-Eckpunkte oder Keypoints pro Annotation (Segment/Pose) |

Platform zwischenspeichert berechnete Statistiken und ungültig macht sie, wenn sich Bilder, Annotationen, Klassen oder Splits ändern. Bei Datasets mit mehr als 100.000 Bildern werden die Diagramme aus einer Teilmenge von 100.000 Bildern berechnet, was über dem Raster vermerkt ist.
Klicke auf die Expandieren-Schaltfläche bei einer beliebigen Heatmap, um sie im Vollbildmodus anzuzeigen. Dies bietet eine größere, detailliertere Ansicht – nützlich, um räumliche Muster in großen Datensätzen zu verstehen.
Registerkarte Modelle#
Sieh dir alle mit diesem Datensatz trainierten Modelle in einer durchsuchbaren Tabelle an:
| Spalte | Beschreibung |
|---|---|
| Name | Modellname mit Link |
| Projekt | Übergeordnetes Projekt mit Icon |
| Version | Unveränderliche Dataset-Version, die gegebenenfalls für das Training verwendet wird |
| Status | Trainingsstatus-Badge |
| Aufgabe | YOLO-Aufgabentyp |
| Epochen | Beste Epoche / gesamte Epochen |
| mAP50-95 | Mean Average Precision |
| mAP50 | mAP bei IoU 0,50 |
| Erstellt | Erstellungsdatum |

Registerkarte Fehler#
Diese Registerkarte erscheint nur, wenn eine oder mehrere Dateien bei der Verarbeitung fehlschlagen.
Bilder, deren Verarbeitung fehlgeschlagen ist, werden hier aufgelistet mit:
- Fehlerbanner: Gesamtzahl der fehlgeschlagenen Bilder und Hilfestellung
- Fehlertabelle: Dateiname, benutzerfreundliche Fehlerbeschreibung, Lösungshinweise und Vorschaubild
- Häufige Fehler sind beschädigte Dateien, nicht unterstützte Formate, zu kleine Bilder (mind. 28px) und nicht unterstützte Farbmodi

Häufige Verarbeitungsfehler
| Fehler | Ursache | Lösung |
|---|---|---|
| Bilddatei kann nicht gelesen werden | Beschädigtes oder nicht unterstütztes Format | Erneut aus dem Bildeditor exportieren |
| Unvollständig oder beschädigt | Datei wurde während der Übertragung abgeschnitten | Originaldatei erneut herunterladen |
| Nicht unterstütztes Bildformat | Format kann von Platform nicht decodiert werden | In JPG, PNG oder WebP konvertieren |
| Dateiberechtigungsfehler | Datei ist gesperrt oder schreibgeschützt | Datei entsperren und erneut hochladen |
| Bild zu klein | Mindestdimension unter 28px | Verwende Quellbilder mit höherer Auflösung |
| Nicht unterstützter Farbmodus | CMYK- oder indizierter Farbmodus | In den RGB-Modus konvertieren |
Registerkarte Versionen#
Erstelle unveränderliche NDJSON-Snapshots deines Datensatzes für reproduzierbares Training. Jede Version erfasst die Bildanzahl, Klassenanzahl, Annotationsanzahl und Dateigröße zum Zeitpunkt der Erstellung.
| Spalte | Beschreibung |
|---|---|
| Version | Versionsnummer (v1, v2, ...) |
| Beschreibung | Benutzerdefinierte Beschreibung (bearbeitbar) |
| Bilder | Bildanzahl zum Zeitpunkt des Snapshots |
| Klassen | Klassenanzahl zum Zeitpunkt des Snapshots |
| Annotationen | Annotationsanzahl zum Zeitpunkt des Snapshots |
| Größe | Dateigröße des NDJSON-Exports |
| Erstellt | Zeitpunkt der Versionerstellung |
| Aktionen | Herunterladen oder wiederherstellen |
So erstellst du eine Version:
- Öffne die Registerkarte Versionen
- Gib optional eine Beschreibung ein (z. B. „500 Trainingsbilder hinzugefügt“ oder „Fehlerhaft gelabelte Klassen korrigiert“)
- Klicke auf New Version
- Die neue Version erscheint in der Tabelle
Jede Version wird fortlaufend nummeriert (v1, v2, v3...) und ist unveränderlich – Versionen können nicht bearbeitet oder entfernt werden, nur ihre Beschreibungen können geändert werden. Verwende die Zeilenaktionen, um eine beliebige Version jederzeit herunterzuladen oder wiederherzustellen.
Das Wiederherstellen ersetzt die aktuellen Bilder, Splits, Klassen und Annotationen des Datasets durch den ausgewählten Schnappschuss und kann nicht rückgängig gemacht werden, es sei denn, du speicherst den aktuellen Zustand vorher als eine andere Version. Das Dataset ist während des Wiederaufbaus im Status processing gesperrt. Während einer Wiederherstellung wird nichts neu hochgeladen, weshalb Wiederherstellungen selbst bei großen Datasets normalerweise schnell ablaufen.
Aktiviere Save Dataset Version im Cloud Training dialog, um ein Modell mit dem exakten Dataset zu verknüpfen, das für das Training verwendet wurde. Die Plattform wiederverwendet eine passende Version, wenn sich die Dataset-Inhalte nicht geändert haben, und erstellt nur dann eine neue Version, wenn dies der Fall ist.
Die Erstellung und Wiederherstellung von Versionen ist verfügbar, nachdem das Dataset den Status ready erreicht hat. Versionen sind für verbundene Cloud- oder On Premise-Datasets nicht verfügbar.
Erstelle eine Version vor und nach größeren Änderungen an deinem Datensatz – Hinzufügen von Bildern, Korrigieren von Annotationen oder Neuausbalancieren der Splits. Dies ermöglicht es dir, die Modellleistung über verschiedene Datensatzstände hinweg zu vergleichen.
Die angezeigte Größe ist die Dateigröße des NDJSON-Exports, die Bild-URLs und Annotationen enthält – nicht die Bilder selbst. Die eigentlichen Bilddaten werden separat gespeichert und über signierte URLs aufgerufen. Die Schnappschussdatei zählt dennoch auf dein Speicherkontingent des Workspace, sodass die Versionserstellung fehlschlägt, wenn kein Speicherplatz mehr übrig ist.
Dataset exportieren#
Exportiere deinen Datensatz für die Offline-Nutzung mit einem NDJSON-Download aus dem Datensatz-Header oder der Registerkarte Versionen.
So exportierst du:
- Klicke auf die Download-Schaltfläche (Download-Symbol) im Datensatz-Header
- Lade den aktuellen NDJSON-Snapshot direkt herunter
- Verwende den Versions-Tab, wenn du einen unveränderlichen, nummerierten Snapshot möchtest, den du später erneut herunterladen kannst
Das NDJSON-Format speichert ein JSON-Objekt pro Zeile. Die erste Zeile enthält Dataset-Metadaten, gefolgt von einer Zeile pro Bild:
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}Das optionale bildbasierte metadata-Objekt bleibt erhalten, wenn eine NDJSON-Datei in Platform importiert wird. Du kannst es im Vollbild-Informationspanel des Bildes überprüfen oder bearbeiten. Für programmierbare Archiv-Uploads akzeptiert die Ingest Dataset Data API den äquivalenten imageMetadata-Pfadpfad.
Pose-Datasets enthalten zudem ein kpt_shape-Feld in der Dataset-Header-Zeile, das aus den Annotationen abgeleitet wird, wenn es nicht bereits festgelegt ist.
Tiefenexporte deklarieren "task": "depth" und "depth_scale": 1000 in der Datensatzzeile. Jede Bildzeile enthält eine depth.url für das zugehörige einfache uint16-PNG. Ultralytics lädt Bild- und Tiefen-URLs gleichzeitig herunter und schreibt ein Trainings-YAML mit derselben Skalierung, sodass die NDJSON-Datei direkt an model.train(data=...) übergeben werden kann.
Bild-URLs im exportierten NDJSON sind signiert und 7 Tage lang gültig. Platform verwendet einen gecachten Export bis zu 6 Tage lang wieder, wenn sich das Dataset nicht geändert hat, sodass ein frischer Download immer mindestens einen Tag Gültigkeit behält. Wenn du früher neue URLs benötigst, ändere das Dataset oder erstelle eine neue Version.
Der Export ist für On Premise-Datasets nicht verfügbar, deren Bild-Bytes Platform niemals erreichen.
Die vollständige Spezifikation findest du in der Ultralytics NDJSON format documentation.
Bildoperationen#
Schnellaktionen#
Klicke mit der rechten Maustaste auf ein beliebiges Bild in der Grid- oder Compact-Ansicht, um auf Schnellaktionen zuzugreifen:
| Aktion | Beschreibung |
|---|---|
| Move to Split | Ordne das Bild dem Train-, Val- oder Test-Split zu |
| Download | Lade die ursprüngliche Bilddatei herunter |
| Delete | Lösche das Bild aus dem Dataset |

Das Kontextmenü für Bilder funktioniert für ein einzelnes Bild. Für Massenvorgänge bei mehreren Bildern verwende die Table-Ansicht mit Auswahl per Checkbox.
Bulk Move to Split#
Ordne ausgewählte Bilder einem anderen Split innerhalb desselben Datasets zu:
- Wechsle zur Table-Ansicht
- Wähle Bilder über Checkboxen aus
- Klicke mit der rechten Maustaste, um das Kontextmenü zu öffnen
- Wähle
Move to split> Train, Validation oder Test
Du kannst Bilder auch per Drag & Drop auf die Split-Filter-Tabs in der Rasteransicht ziehen. Wenn das Verschieben eines Bildes mit einem identischen Bild kollidieren würde, das sich bereits im Ziel-Split befindet, fragt Platform, ob übersprungen, beide behalten oder ersetzt werden soll.
Lade alle Bilder in ein Dataset hoch und verwende dann die Bulk-Funktion zum Verschieben, um Teilmengen in Train-, Validation- und Test-Splits zu organisieren.
Split-Umverteilung#
Verteile alle Bilder mittels benutzerdefinierter Verhältnisse auf Train-, Validation- und Test-Splits:
- Klicke auf die Split-Leiste in der Dataset-Symbolleiste, um den Dialog Redistribute Splits zu öffnen
- Passe die Split-Prozentsätze mit einer der unten genannten Methoden an
- Überprüfe die Live-Vorschau der Bildanzahl, um die Verteilung zu bestätigen
- Klicke auf Apply, um alle Bilder zufällig gemäß deinen Prozentsätzen neu zuzuordnen
Der Dialog bietet drei Möglichkeiten, deine Ziel-Split-Verhältnisse festzulegen:
| Methode | Beschreibung |
|---|---|
| Drag | Ziehe die Regler zwischen den farbigen Segmenten, um die Split-Grenzen visuell anzupassen |
| Type | Bearbeite die Prozentangabe für einen Split (die anderen beiden Splits werden automatisch proportional ausgeglichen) |
| Auto | Ein Klick, um sofort einen 80/20 Train/Validation-Split einzustellen, wobei der Test-Split auf 0% gesetzt wird |
Eine Live-Vorschau zeigt genau, wie viele Bilder in jedem Split landen, bevor du die Änderungen anwendest.
Klicke auf den Auto-Button, um sofort den empfohlenen 80/20 Train/Validation-Split einzustellen. Dies ist das gängigste Verhältnis für das Training.
Bulk Delete#
Lösche mehrere Bilder gleichzeitig:
- Wähle Bilder in der Tabellenansicht aus
- Klicke mit der rechten Maustaste und wähle
Deleteoder drückeCmd/Ctrl+Delete - Bestätige das Löschen
Dataset URI#
Referenziere Platform-Datasets über das ul://-URI-Format (siehe Using Platform Datasets):
ul://username/datasets/dataset-slugDu kannst auch direkt eine Dataset- oder Modell-Web-URL einfügen (z. B. https://platform.ultralytics.com/username/datasets/dataset-slug); sie wird automatisch in die ul://-URI umgeschrieben. Die Übergabe einer Liste von Datasets optimiert ein Basismodell nacheinander für jedes einzelne, zum Beispiel model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Verwende diese URI, um Modelle von überall aus zu trainieren:
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100Die ul://-URI funktioniert von jeder Umgebung aus:
- Lokale Maschine: Trainiere auf deiner Hardware, Daten werden automatisch heruntergeladen
- Google Colab: Greife in Notebooks auf deine Platform-Datasets zu
- Remote-Server: Trainiere auf Cloud-VMs mit vollem Zugriff auf das Dataset
Verfügbare Lizenzen#
Die Platform unterstützt die folgenden Lizenzen für Datasets:
| Lizenz | Typ |
|---|---|
| Keine | Keine Lizenz ausgewählt |
| CC0-1.0 | Public Domain |
| PDM-1.0 | Public Domain |
| CC-BY-2.5 | Permissiv |
| CC-BY-4.0 | Permissiv |
| CC-BY-NC-2.0 | Nicht-kommerziell |
| CC-BY-SA-4.0 | Copyleft |
| CC-BY-NC-4.0 | Nicht-kommerziell |
| CC-BY-NC-SA-3.0 | Copyleft |
| CC-BY-NC-SA-4.0 | Copyleft |
| CC-BY-ND-4.0 | Keine Derivate |
| CC-BY-NC-ND-4.0 | Nicht-kommerziell |
| Apache-2.0 | Permissiv |
| MIT | Permissiv |
| AGPL-3.0 | Copyleft |
| GPL-3.0 | Copyleft |
| Nur für die Forschung | Eingeschränkt |
| Sonstiges | Benutzerdefiniert |
Beim Klonen eines Datensatzes mit einer Copyleft-Lizenz (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0) übernimmt der Klon die Lizenz und die Lizenz-Auswahl ist gesperrt.
Sichtbarkeitseinstellungen#
Kontrolliere, wer dein Dataset sehen kann:
| Einstellung | Beschreibung |
|---|---|
| Privat | Du und berechtigte Workspace-Mitglieder haben Zugriff |
| Öffentlich | Jeder kann es anzeigen, auch von der Explore-Seite aus |
Die Sichtbarkeit wird beim Erstellen eines Datasets im New Dataset-Dialog über einen Schalter festgelegt. Öffentliche Datasets sind auf der Explore-Seite sichtbar.
Dataset bearbeiten#
Dataset-Metadaten werden direkt auf der Dataset-Seite inline bearbeitet — kein Dialog erforderlich:
- Name: Klicke auf den Datensatznamen, um ihn zu bearbeiten. Änderungen werden beim Verlassen des Feldes (Blur) oder mit
Enterautomatisch gespeichert. Namen sind auf 100 Zeichen begrenzt. - Beschreibung: Klicke auf die Beschreibung (oder den Platzhalter „Beschreibung hinzufügen...“), um sie zu bearbeiten. Änderungen werden automatisch gespeichert. Beschreibungen sind auf 1.000 Zeichen begrenzt.
- Aufgabentyp: Klicke auf das Aufgaben-Badge, um einen anderen Aufgabentyp auszuwählen.
- Lizenz: Klicke auf die Lizenzauswahl, um die Dataset-Lizenz zu ändern.
- Symbol: Klicke auf das Datensatzsymbol, um dein eigenes Bild hochzuladen, eines der eigenen Bilder des Datensatzes als Symbol zu verwenden oder einen Buchstaben und eine Farbe auszuwählen.
Jedes Bild speichert Annotationen für alle Aufgabentypen zusammen. Das Ändern des Datensatz-Aufgabentyps steuert, welche Annotationen im Editor sichtbar sind und in Exporte sowie das Training einfließen. Annotationen für andere Aufgabentypen bleiben in der Datenbank erhalten und erscheinen wieder, wenn du zurückwechselst. Tiefe ist die Ausnahme: Ihre Ground Truth ist eine gepaarte Datei anstelle einer Annotation, sodass ein Datensatz nur dann zu oder von Tiefe wechseln kann, wenn er keine Bilder enthält – importiere ihn stattdessen neu.
Benutzerdefinierte Metadaten#
Öffne Weitere Aktionen und wähle Informationen, um zwei Abschnitte zu überprüfen:
- Ultralytics-Metadaten: Schreibgeschützte Platform-Details wie Dataset-ID, Besitzer, Aufgabe, Bild- und Annotationsanzahl, Speicherregion und Zeitstempel
- Benutzerdefinierte Metadaten: Dein eigenes JSON-Objekt für Provenienz, Aufnahmebedingungen, Kunden-IDs, Governance oder andere kontextbezogene Daten
Workspace-Betrachter können Metadaten einsehen, während Mitglieder mit Bearbeitungszugriff das benutzerdefinierte Metadatenobjekt ersetzen können. Das serialisierte Metadatenobjekt ist auf 500.000 Zeichen begrenzt, und jeder Schlüssel auf oberster Ebene ist auf 128 Zeichen begrenzt. Speichere ein leeres Objekt ({}), um benutzerdefinierte Metadaten zu löschen.
Dataset klonen#
Wenn du ein öffentliches Dataset anzeigst, das dir nicht gehört, klicke auf Clone Dataset, um den Klon-Dialog zu öffnen. Überprüfe Ziel-Arbeitsbereich, Name, Sichtbarkeit und Lizenz und bestätige dann das Klonen. Die Kopie enthält alle Bilder, Annotationen und Klassendefinitionen. Öffentliche Quelldatasets bleiben in Arbeitsbereichen, deren Standardsichtbarkeit öffentlich ist, standardmäßig öffentlich; Klone von Enterprise-Arbeitsbereichen sind standardmäßig privat. Wenn das Original-Dataset eine Copyleft-Lizenz hat, erbt der Klon diese und der Lizenz-Auswahlschalter ist gesperrt.
Der Ziel-Slug wird automatisch umbenannt, falls er bereits vergeben ist, und das Klonen erfordert genügend verbleibenden Speicherplatz, um die Kopie aufzunehmen.
Datensätze, die auf Cloud-Speicher- oder On-Premise-Quellen basieren, können nicht geklont werden, da Platform deren Bilddaten nicht speichert.
Stern vergeben und teilen#
- Stern vergeben: Klicke auf die Stern-Schaltfläche, um einen Datensatz als Lesezeichen zu speichern. Die Anzahl der Sterne ist für alle Benutzer sichtbar.
- Teilen: Klicke bei öffentlichen Datensätzen auf die Teilen-Schaltfläche, um einen Link zu kopieren, einen Einbettungs-Snippet abzurufen oder auf sozialen Plattformen zu teilen.
Dataset löschen#
Lösche einen Datensatz, den du nicht mehr benötigst:
- Öffne Weitere Aktionen (die Schaltfläche
…) im Datensatz-Header - Wähle Datensatz löschen
- Bestätige im Dialogfeld: "Dies verschiebt [name] in den Papierkorb. Du kannst ihn innerhalb von 30 Tagen wiederherstellen."
Dasselbe Menü enthält Informationen (öffnet den in Benutzerdefinierte Metadaten beschriebenen Metadaten-Dialog) und Aktualisieren (liest den Datensatz erneut vom Server ein).
Gelöschte Datasets werden in den Papierkorb verschoben – sie werden nicht dauerhaft gelöscht. Du kannst sie innerhalb von 30 Tagen aus Settings > Trash wiederherstellen.
Auf Datensatz trainieren#
Starte das Training direkt von deinem Datensatz aus:
- Klicke auf der Dataset-Seite auf
New Model - Wähle ein Projekt aus oder erstelle ein neues
- Konfiguriere die Trainingsparameter
- Starte das Training
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffSiehe Cloud Training für Details.
FAQ#
Deine Daten werden in der von dir gewählten Region (US, EU oder AP) verarbeitet und gespeichert. Bilder werden wie folgt behandelt:
- Validierung von Format und Größe
- Ablehnung, wenn die Mindestdimension unter 28px liegt
- Normalisierung, wenn sie größer als 4096px sind (unter Beibehaltung des Seitenverhältnisses; kodiert für optimierte Speicherung)
- Speicherung mit Deduplizierung, sodass identische Bilder nur einmal behalten werden
- Erstellung von Thumbnails im 256px WebP-Format für schnelles Durchsuchen
Die Ultralytics Platform verwaltet Speicherplatz effizient:
- Deduplizierung: Identische Bilder in derselben Datenregion werden einmal gespeichert
- Integrität: Uploads werden auf Datenintegrität überprüft
- Effizienz: Klone verwenden bereits gespeicherte Bilder wieder, anstatt sie zu kopieren, während sie dennoch auf das Speicherplatz-Kontingent des Ziel-Workspaces angerechnet werden
- Regional: Daten verbleiben in deiner gewählten Region (US, EU oder AP)
Ja. Ziehe Dateien per Drag & Drop in die Dataset-Galerie oder klicke auf das Upload-Symbol im Seitenkopf, wodurch die native Dateiauswahl deines Browsers direkt geöffnet wird. Neue Statistiken werden nach der Verarbeitung automatisch berechnet.
Verwende die Funktion zum massenhaften Verschieben in Splits:
- Wähle Bilder in der Tabellenansicht aus
- Klicke mit der rechten Maustaste und wähle
Move to split - Wähle den Ziel-Split (Train, Validation oder Test)
Ultralytics Platform unterstützt YOLO-Labels, COCO JSON, Ultralytics NDJSON und den Upload roher Bilder. Pascal VOC XML-Labels werden erkannt, aber nicht importiert:
Eine
.txt-Datei pro Bild mit normalisierten Koordinaten (Bereich 0-1):Aufgabe Format Beispiel Detect class cx cy w h0 0.5 0.5 0.2 0.3Segment class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Pose class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9Classify Verzeichnisstruktur train/cats/,train/dogs/Pose-Sichtbarkeits-Flags: 0=nicht annotiert, 1=annotiert aber verdeckt, 2=annotiert und sichtbar.
Ja. Jedes Bild speichert Annotationen für alle 6 Annotationsaufgabentypen (detect, segment, semantic, classify, pose, OBB) zusammen. Du kannst den aktiven Aufgabentypen des Datensatzes jederzeit umschalten, ohne bestehende Annotationen zu verlieren. Nur Annotationen, die zum aktiven Aufgabentyp passen, werden im Editor angezeigt und in Exporte sowie das Training einbezogen – Annotationen für andere Aufgaben bleiben erhalten und erscheinen beim Zurückwechseln wieder.
Ja:
Limit Wert Klassen pro Datensatz 25,000 Annotationen pro Bild 10,000 Koordinaten pro Annotation 10,000 Datensatzname 100 Zeichen Datensatzbeschreibung 1.000 Zeichen Benutzerdefinierte Metadaten 500.000 serialisierte Zeichen Metadaten-Schlüssel der obersten Ebene 128 Zeichen Datensätze, die aus Cloud-Speicher- oder On-Premise-Quellen lesen, halten ihre Pixel außerhalb von Platform, weshalb die Funktionen, die von Platform verwaltete Kopien der Bilddaten benötigen, nicht verfügbar sind:
Funktion Cloud-verbunden On Premise Intelligente Annotation Nicht verfügbar Nicht verfügbar Clustering-Analyse Nicht verfügbar Nicht verfügbar Klonen Nicht verfügbar Nicht verfügbar Versions-Snapshots Nicht verfügbar Nicht verfügbar NDJSON-Export Verfügbar Nicht verfügbar Durchsuchen, manuelle Annotation, Klassenverwaltung, Aufteilungen, Statistiken und Training funktionieren alle normal.