Jeux de données#
Les jeux de données Ultralytics Platform offrent une solution rationalisée pour gérer tes données d'entraînement. Après le téléchargement, la plateforme traite automatiquement les images, les étiquettes et les statistiques.
Un jeu de données est prêt à être entraîné une fois le traitement terminé et s'il contient au moins une image dans la division train, au moins une image dans l'une ou l'autre des divisions val ou test, et au moins une image étiquetée. L'en-tête du jeu de données affiche un badge Ready lorsque ces trois conditions sont remplies, et un badge Not Ready dans le cas contraire — clique sur le badge pour voir exactement quelle condition manque.
Charger un dataset#
Ultralytics Platform accepte plusieurs formats de chargement pour plus de flexibilité.
Si tu as déjà des jeux de données dans Roboflow, utilise Integrations pour les importer directement — aucun export manuel ni re-téléchargement n'est nécessaire. Les données situées dans Google Cloud Storage, Amazon S3 ou Azure Blob Storage peuvent être utilisées directement via Cloud storage. Les espaces de travail Enterprise peuvent utiliser On Premise pour indexer et entraîner des données locales sans envoyer de pixels à la plateforme.
Formats pris en charge#
| Format | Extensions | Notes | Taille max |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Le plus courant, recommandé | 50 MB |
| PNG | .png | Prend en charge la transparence | 50 MB |
| WebP | .webp | Moderne, bonne compression | 50 MB |
| BMP | .bmp | Non compressé | 50 MB |
| TIFF | .tiff, .tif | Haute qualité | 50 MB |
| HEIC | .heic | Photos d'iPhone | 50 MB |
| AVIF | .avif | Format de nouvelle génération | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Appareil photo brut | 50 MB |
| MPO | .mpo | Objet multi-images | 50 MB |
Prise en charge des codecs vidéo#
L'extension de fichier seule ne suffit pas : une vidéo peut toujours échouer si son codec ne peut pas être décodé pendant le traitement.
La vidéo H.264 dans un conteneur MP4 bénéficie de la plus large prise en charge des décodeurs et constitue le choix le plus sûr. Si une vidéo ne se traite pas, réencode-la avec FFmpeg :
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4Préparation de ton dataset#
La plateforme prend en charge Ultralytics YOLO, COCO, des jeux de données de profondeur, Ultralytics NDJSON et les téléversements bruts (non annotés) :
Utilise la structure de répertoire YOLO standard avec un fichier data.yaml :
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlLe fichier YAML définit la configuration de ton dataset :
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogRaw : Télécharge des images non annotées (sans étiquettes). Utile si tu prévois d'annoter directement sur la plateforme à l'aide de l'éditeur d'annotations.
Tu peux aussi télécharger des images sans dossiers de division explicites. La plateforme respecte la cible de division active pendant le téléchargement. Si aucune cible de division n'est définie et que le téléchargement laisse val vide — ou avec moins de deux cartes appariées pour la profondeur —, les datasets de non-classification déplacent automatiquement les images d'entraînement vers val pour que le dataset soit immédiatement entraînable. Les datasets de classification sont ignorés car ils utilisent des divisions basées sur des répertoires. Tu peux toujours réassigner des images plus tard avec le déplacement en masse vers une division ou la redistribution des divisions.
Le format est détecté automatiquement : les jeux de données comportant un data.yaml contenant les clés names, train ou val sont traités comme des jeux de données YOLO. Les jeux de données dotés de fichiers JSON COCO (contenant les tableaux images, annotations et categories) sont traités comme COCO. Les exports .ndjson sont importés sous forme d'Ultralytics NDJSON. Les jeux de données contenant uniquement des images et aucune annotation sont traités comme bruts.
Lorsqu'une archive contient plusieurs fichiers YAML, la plateforme privilégie les noms standard (data.yaml, data.yml, dataset.yaml, dataset.yml) les plus proches de la racine de l'archive. Conserve un seul fichier YAML clairement nommé par archive pour éviter toute ambiguïté.
Les fichiers d'étiquettes au format XML Pascal VOC sont détectés mais leurs annotations ne sont pas importées — les images sont téléchargées sans annotations. La plateforme t'avertit avant le début du téléchargement (« Étiquettes Pascal VOC détectées »). Convertis d'abord le format VOC XML en YOLO ou COCO ; consulte les outils de conversion de format.
Si les étiquettes font référence à des ID de classe mais qu'aucun nom de classe n'est fourni, la plateforme génère des noms de substitution denses (class0, class1, …) que tu pourras renommer plus tard dans l'onglet Classes.
Pour connaître les détails des formats spécifiques aux tâches, consulte les tâches prises en charge et la vue d'ensemble des jeux de données.
Processus de chargement#
Pour créer un dataset :
- Navigue vers
Annotatedans la barre latérale - Clique sur
New Dataset - Sélectionne un onglet de source de données (consulte la section Sources de données ci-dessous)
- Ajoute un nom — l'identifiant URL est dérivé automatiquement et peut être modifié — ainsi qu'une description optionnelle
- Sélectionne le type de tâche (consulte les tâches prises en charge), une licence optionnelle (consulte les licences disponibles) et la visibilité (publique ou privée)
- Clique sur
Create & Uploadpour les fichiers locaux, surCreate & Importpour une URL ou une source connectée, ou surCreate Datasetpour commencer à vide
Pour ajouter des fichiers à un jeu de données existant, ouvre sa page et fais glisser les fichiers dans la galerie ou clique sur l'icône de téléchargement dans l'en-tête de la page. L'icône de téléchargement ouvre directement le sélecteur de fichiers natif de ton navigateur car la tâche du jeu de données est déjà définie.
Sources de données#
La boîte de dialogue New Dataset propose quatre sources :
| Source | Description |
|---|---|
| Upload | Glisse et dépose des fichiers ou recherche-les — images, vidéos, archives ou NDJSON |
| URL | Colle un lien direct vers un fichier .zip, .tar, .tar.gz, .tgz ou .ndjson ; la plateforme le télécharge et l'ingère côté serveur |
| Cloud | Utilise des données en place provenant de Google Cloud Storage, Amazon S3 ou Azure Blob Storage (Pro et Enterprise) |
| Sur site | Indexe et entraîne des données qui ne quittent jamais tes propres machines via des agents On Premise (Enterprise) |
Une importation par URL est limitée à la fois par la limite par téléchargement de ton forfait (10 Go Gratuit / 20 Go Pro / 50 Go Enterprise) et par ton quota de stockage restant, selon la valeur la plus petite. Le lien doit être accessible publiquement via HTTP ou HTTPS et se terminer par une extension prise en charge.
Avant le début du téléchargement#
La plateforme valide tes fichiers dans le navigateur avant de télécharger quoi que ce soit, de sorte que les problèmes courants apparaissent immédiatement plutôt qu'après un long transfert. Les archives sont vérifiées pour détecter la corruption, le vide, la protection par mot de passe et les erreurs de syntaxe YAML, et les fichiers surdimensionnés sont répertoriés par leur nom.
Deux boîtes de dialogue peuvent alors apparaître :
Lorsque l'archive déclare des noms de classes et que ton jeu de données possède déjà des classes, la boîte de dialogue Map imported classes affiche une ligne par classe entrante. Pour chacune d'elles, choisis une classe existante dans laquelle effectuer la fusion, crée une nouvelle classe ou ignore-la. Les correspondances de noms exactes sont pré-sélectionnées, et les classes ignorées ainsi que leurs annotations ne sont pas importées.
Après le téléchargement, la plateforme traite tes données automatiquement :
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Validation : Vérifications du format et de la taille
- Normalisation : Redimensionnement des grandes images (max 4096 px, dimension min 28 px), conversion des niveaux de gris en RVB, aplatissement de la transparence sur fond blanc et application de l'orientation EXIF
- Miniatures : Aperçus WebP 256px générés
- Analyse des étiquettes : Extraction des étiquettes YOLO, COCO et NDJSON
- Statistiques : Distributions des classes et dimensions des images calculées
Les originaux AVIF et WebP sont stockés octet par octet lorsqu'aucun redimensionnement ou changement de couleur n'est nécessaire. Tout le reste est réencodé — les sources WebP restent au format WebP, et tous les autres formats (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) deviennent des fichiers JPEG avec une qualité de 92. Ton nom de fichier d'origine et ton extension source sont conservés en tant métadonnées.

Valider avant le chargement
Tu peux valider ton dataset localement avant de le charger :
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")Les images doivent avoir au moins 28px sur leur côté le plus court. Les images plus petites que cela sont rejetées pendant le traitement. Les images plus grandes que 4096px sur leur côté le plus long sont automatiquement redimensionnées avec conservation du rapport d'aspect.
Parcourir les images#
Visualise les images de ton dataset dans plusieurs mises en page.
Ouvre le panneau Clustering depuis la barre d'outils de la galerie pour explorer ton jeu de données sous forme de nuage de points 2D interactif.
| Vue | Description |
|---|---|
| Grille | Grille de miniatures avec overlays d'annotation (par défaut) |
| Compact | Miniatures plus petites pour un scan rapide |
| Tableau | Liste avec miniature, nom de fichier, dimensions, taille, split, classes et comptes de labels |

Tri et filtrage#
Les images peuvent être triées et filtrées pour une navigation efficace :
Chaque option bascule entre l'ordre croissant (↑) et décroissant (↓) :
| Trier | Description |
|---|---|
| Création ↑/↓ | Ordre de téléchargement (par défaut ↓) |
| Nom ↑/↓ | Nom de fichier alphabétique |
| Hauteur ↑/↓ | Hauteur de l'image en pixels |
| Largeur ↑/↓ | Largeur de l'image en pixels |
| Taille ↑/↓ | Taille du fichier sur le disque |
| Annotations ↑/↓ | Nombre d'annotations par image |
Pour les jeux de données de plus de 100 000 images, les tris par nom, largeur, hauteur et taille sont masqués afin de maintenir la réactivité de la galerie. Les tris par date de création et par nombre d'annotations restent disponibles.
Utilise l'ensemble de filtres Annotations défini sur Unannotated pour trouver rapidement les images qui nécessitent encore des annotations. C'est particulièrement utile pour les grands jeux de données où tu souhaites suivre la progression du marquage.
La barre de recherche se trouve à droite de la barre d'outils de la galerie et filtre tous les modes d'affichage — grille, compact et tableau. Elle correspond au nom de fichier de l'image (l'extension de fichier est facultative) ainsi qu'aux clés de métadonnées personnalisées, aux valeurs scalaires et aux entrées de tableaux, de sorte qu'une image nommée img_0042 contenant {"ship_type": "yacht"} est trouvée en recherchant soit img_0042, soit yacht.
Les valeurs imbriquées à l'intérieur de sous-objets ne sont pas prises en compte. Coller un ID d'image de 24 caractères permet de rechercher directement cette image exacte, en contournant la recherche textuelle.
Visionneuse plein écran#
Clique sur n'importe quelle image pour ouvrir la visionneuse plein écran avec :
- Navigation : Touches fléchées ou aperçus miniatures pour parcourir
- Informations sur l'image : Examine les propriétés générées par la plateforme, les métadonnées personnalisées et les métadonnées de fichier intégrées telles que l'EXIF
- Métadonnées personnalisées : Les propriétaires et les éditeurs peuvent ajouter ou remplacer un objet JSON, comprenant des valeurs imbriquées jusqu'à 500 000 caractères sérialisés et des clés de niveau supérieur jusqu'à 128 caractères
- Annotations : Basculer la visibilité de la superposition d'annotations
- Répartition par classe : Nombre d'étiquettes par classe avec indicateurs colorés
- Annotate : Lorsque tu as les droits de modification, les contrôles d'annotation sont actifs immédiatement dès que la visionneuse plein écran s'ouvre sur le bureau
- Télécharger : Télécharge le fichier image original
- Supprimer : Supprime l'image du jeu de données
- Zoom :
Cmd/Ctrl+Scroll,Cmd/Ctrl++ouCmd/Ctrl+=pour zoomer, etCmd/Ctrl+-pour dézoomer - Réinitialiser la vue :
Cmd/Ctrl + 0ou le bouton de réinitialisation pour adapter l'image à la visionneuse - Panoramique : Maintiens la touche
Spaceenfoncée et fais glisser pour déplacer le canevas lorsque tu as zoomé - Vue pixel : Active le rendu pixélisé pour une inspection détaillée
- Curtain de profondeur : sur les datasets de profondeur, un séparateur déplaçable bascule entre l'image RGB et sa carte de profondeur colorisée

Filtrer par séparation (split)#
Filtrer les images par leur séparation dans le jeu de données :
| Split | Objectif |
|---|---|
| Entraner | Utilisé pour l'entraînement du modèle |
| Val | Utilisé pour la validation pendant l'entraînement |
| Test | Utilisé pour l'évaluation finale |
Clustering#
Le panneau Clustering projette ton jeu de données dans un nuage de points 2D interactif où les images visuellement similaires sont regroupées. Utilise-le pour faire surface aux clusters, repérer les doublons et les valeurs aberrantes, et inspecter la façon dont les divisions ou les classes sont réparties dans tes données, sans quitter la galerie. Ouvre-le depuis l'icône du graphique de dispersion dans la barre d'outils de la galerie sur n'importe quelle page de jeu de données.

Exécution de l'analyse#
Lancer une analyse :
- Ouvre un jeu de données et clique sur l'icône de graphique en nuage de points dans la barre d'outils de la galerie
- Clique sur
Analyze Dataset - Attends que la barre de progression se termine — les résultats apparaissent dans le même panneau
L'analyse s'exécute en arrière-plan en deux étapes, Computing embeddings et Clustering, et peut prendre quelques minutes selon la taille de ton jeu de données. Tu peux fermer le panneau ou quitter la page et y revenir plus tard.
Un jeu de données nécessite au moins 20 et au plus 200 000 images sans erreur pour être analysé. Les jeux de données connectés s'appuyant sur un stockage cloud ou On Premise ne sont pas encore pris en charge.
Visualisation#
Une fois l'analyse terminée, le panneau affiche un nuage de points 2D de toutes les images analysées avec une légende et un compteur de points. Les filtres de la galerie (division, classe, étiqueté/non étiqueté) atténuent les points hors filtre pour te permettre de te concentrer sur le sous-ensemble qui t'intéresse — le compteur indique alors visible / total points.

Colorer par#
Modifie la façon dont les points de données sont colorés à l'aide du menu déroulant Color by dans la barre d'outils du panneau. Change de mode d'affichage à tout moment : le graphique se recolore instantanément pour que tu puisses voir comment les divisions, les classes ou les propriétés des images sont réparties dans tes clusters :
| Option | Ombrage |
|---|---|
| Splits | Train / Val / Test |
| Classes | Première classe d'annotation sur chaque image |
| Width | Largeur de l'image |
| Height | Hauteur de l'image |
| Size | Taille du fichier |
| Annotations | Nombre d'annotations par image |

Sélection au lasso#
Trace une sélection libre autour d'une région pour mettre en valeur des points sur le graphique. La galerie filtre les images correspondantes afin que tu puisses les inspecter, les réétiqueter, les déplacer ou les supprimer à l'aide des opérations sur les images habituelles.
Une puce au-dessus du graphique indique le nombre de points sélectionnés — clique sur × pour effacer le lasso et revenir à la vue complète de la galerie.
Un lasso sélectionne au maximum 1 000 images. Si ta sélection en englobe davantage, la plateforme affiche un échantillon de 1 000 images et suggère de dessiner une zone plus petite.
Déplacer et zoomer#
Navigue dans les grands nuages de points directement à l'aide de ta souris et de ton clavier, ou avec les boutons de zoom en bas à gauche du graphique :
| Entrée | Action |
|---|---|
| Scroll | Déplacer le graphique en 2D |
| Cmd/Ctrl+Scroll | Zoomer ou dézoomer, ancré au curseur |
| Maintenir Space | Passer en mode glisser-pour-déplacer |
| Bouton de réinitialisation | Revenir à l'échelle complète du graphique |
Ré-analyser#
Si ton jeu de données change après l'analyse — de nouvelles images arrivent, ou le nombre d'images analysées ne correspond plus au jeu de données — un bouton Re-analyze apparaît en haut du panneau pour les propriétaires et les éditeurs.
Clique sur Re-analyze pour recalculer les embeddings et la projection 2D à partir de zéro.
Onglets de jeu de données#
Chaque page de jeu de données peut afficher jusqu'à six onglets, selon l'état du jeu de données et tes autorisations :
Onglet Images#
La vue par défaut affichant la galerie d'images avec des superpositions d'annotations. Prend en charge les modes d'affichage grille, compact et tableau. Fais glisser et dépose des fichiers ici pour ajouter plus d'images.
Onglet Classes#
Cet onglet apparaît lorsque le dataset contient des images et que sa tâche possède des classes.
Gérer les classes d'annotation pour ton jeu de données :
- Histogramme des classes : Graphique à barres indiquant le nombre d'annotations par classe, trié par fréquence, avec un sélecteur d'échelle linéaire/logarithmique
- Tableau des classes : Tableau triable et interrogeable comprenant l'index, le nom, le nombre d'annotations et le nombre d'images
- Modifier les noms des classes : clique sur n'importe quel nom de classe pour le renommer directement
- Modifier les couleurs des classes : clique sur un échantillon de couleur pour changer la couleur de la classe
- Ajouter une nouvelle classe : utilise le champ de saisie en bas pour ajouter des classes
- Fusionner des classes : Sélectionne deux lignes ou plus et clique sur
Merge into one - Supprimer des classes : Sélectionne une ou plusieurs lignes et clique sur
Delete

Si ton jeu de données présente un déséquilibre de classes (par exemple, 10 000 annotations "person" mais seulement 50 "bicycle"), utilise le bouton bascule Log Scale sur l'histogramme des classes pour visualiser clairement toutes les classes.
Fusionner des classes#
La fusion consolide les étiquettes en double ou qui se chevauchent — par exemple en regroupant car, automobile et vehicle en une seule classe :
- Sélectionne deux classes ou plus à l'aide des cases à cocher des lignes
- Clique sur
Merge into onedans l'en-tête du tableau, ou fais un clic droit sur la sélection - Choisis laquelle des classes sélectionnées est la cible dans laquelle les autres fusionnent
- Confirmer
Chaque annotation appartenant aux classes sources est réattribuée à la classe cible, et les classes sources sont supprimées. Aucune annotation n'est supprimée, de sorte que le nombre total d'annotations du jeu de données reste inchangé.
Supprimer des classes#
- Sélectionne une ou plusieurs classes à l'aide des cases à cocher des lignes
- Clique sur
Deletedans l'en-tête du tableau, ou fais un clic droit sur la sélection - Confirmer
La suppression d'une classe supprime la classe ainsi que toutes ses annotations. Pour les jeux de données de classification, les étiquettes sont supprimées mais les images demeurent, devenant ainsi non étiquetées.
Les identifiants de classes sont positionnels. Fusionner ou supprimer une classe décale vers le bas tous les indices de classes supérieurs pour combler l'écart, de sorte que les exportations et les fichiers d'étiquettes rédigés avant la modification ne correspondent plus aux nouveaux indices. Crée d'abord une version si tu as besoin de l'ancienne numérotation.
Le nombre de classes est calculé à partir d'un maximum de 100 000 images. Sur les jeux de données plus volumineux, une note au-dessus de l'histogramme indique « Basé sur un sous-ensemble de 100 000 images de ce jeu de données. »
Onglet Graphiques#
Cet onglet apparaît lorsque le jeu de données contient des images.
Statistiques automatiques calculées à partir de ton jeu de données :
Les graphiques s'affichent dans cet ordre, et chacun d'eux est omis lorsque le jeu de données ne contient aucune donnée correspondante — un jeu de données d'images brutes ne présente aucun graphique d'annotation, et Points per Instance n'apparaît que pour les données de segmentation et de pose :
| Graphique | Description |
|---|---|
| Répartition des jeux | Graphique en anneau du nombre d'images d'entraînement/validation/test et du pourcentage étiqueté |
| Classes principales | Graphique en anneau des 10 classes d'annotation les plus fréquentes, le reste étant regroupé sous « Autre » |
| Dimensions des images | Histogramme de la répartition de la largeur et de la hauteur des images (superposées) avec la moyenne |
| Taille du fichier image | Histogramme de la répartition de la taille des fichiers images |
| Dimensions des images 2D | Carte thermique 2D largeur vs hauteur avec lignes de guidage du ratio d'aspect |
| Emplacements des annotations | Carte thermique 2D des positions centrales des boîtes englobantes |
| Formats d'image | Répartition des formats d'image source (JPG, PNG, etc.) |
| Dimensions des boîtes englobantes | Histogramme de la largeur et de la hauteur des boîtes englobantes (superposées) |
| Objets par image | Histogramme du nombre d'annotations par image |
| Points par instance | Nombre de sommets de polygone ou de points clés par annotation (segment/pose) |

La plateforme met en cache les statistiques calculées et les invalide lorsque les images, les annotations, les classes ou les divisions changent. Sur les jeux de données de plus de 100 000 images, les graphiques sont calculés à partir d'un sous-ensemble de 100 000 images, comme indiqué au-dessus de la grille.
Clique sur le bouton d'agrandissement sur n'importe quelle carte thermique pour l'afficher en mode plein écran. Cela offre une vue plus large et détaillée, utile pour comprendre les motifs spatiaux dans les grands jeux de données.
Onglet Modèles#
Affiche tous les modèles entraînés sur ce jeu de données dans un tableau interrogeable :
| Colonne | Description |
|---|---|
| Nom | Nom du modèle avec lien |
| Projet | Projet parent avec icône |
| Version | Version de jeu de données immuable utilisée pour l'entraînement, le cas échéant |
| Statut | Badge de statut d'entraînement |
| Tâche | Type de tâche YOLO |
| Époques | Meilleure époque / époques totales |
| mAP50-95 | Précision moyenne (Mean average precision) |
| mAP50 | mAP à IoU 0.50 |
| Créé | Date de création |

Onglet Erreurs#
Cet onglet n'apparaît que lorsqu'un ou plusieurs fichiers échouent au traitement.
Les images dont le traitement a échoué sont listées ici avec :
- Bannière d'erreur : nombre total d'images ayant échoué et conseils
- Tableau d'erreurs : nom de fichier, description de l'erreur conviviale, conseils de correction et miniature de prévisualisation
- Les erreurs courantes incluent les fichiers corrompus, les formats non pris en charge, les images trop petites (min 28px) et les modes de couleur non pris en charge

Erreurs de traitement courantes
| Erreur | Cause | Correctif |
|---|---|---|
| Impossible de lire le fichier image | Format corrompu ou non pris en charge | Réexporte depuis un éditeur d'image |
| Incomplet ou corrompu | Le fichier a été tronqué pendant le transfert | Retélécharge le fichier original |
| Format d'image non pris en charge | Format que la plateforme ne peut pas décoder | Convertir en JPG, PNG ou WebP |
| Erreur de permission de fichier | Le fichier est verrouillé ou protégé en lecture | Déverrouille le fichier et télécharge-le à nouveau |
| Image trop petite | Dimension minimale inférieure à 28px | Utilise des images sources de plus haute résolution |
| Mode de couleur non pris en charge | Mode de couleur CMYK ou indexé | Convertis en mode RGB |
Onglet Versions#
Crée des instantanés NDJSON immuables de ton jeu de données pour un entraînement reproductible. Chaque version capture le nombre d'images, le nombre de classes, le nombre d'annotations et la taille du fichier au moment de la création.
| Colonne | Description |
|---|---|
| Version | Numéro de version (v1, v2, ...) |
| Description | Description fournie par l'utilisateur (modifiable) |
| Images | Nombre d'images au moment de l'instantané |
| Classes | Nombre de classes au moment de l'instantané |
| Annotations | Nombre d'annotations au moment de l'instantané |
| Taille | Taille du fichier d'export NDJSON |
| Créé | Date de création de la version |
| Actions | Télécharger ou restaurer |
Pour créer une version :
- Ouvre l'onglet Versions
- Optionnellement, saisis une description (par exemple, "Ajout de 500 images d'entraînement" ou "Correction d'annotations mal étiquetées")
- Clique sur Nouvelle version
- La nouvelle version apparaît dans le tableau
Chaque version est numérotée séquentiellement (v1, v2, v3...) et est immuable — les versions ne peuvent pas être modifiées ou supprimées, seules leurs descriptions peuvent être modifiées. Utilise les actions de ligne pour télécharger ou restaurer n'importe quelle version à tout moment.
La restauration remplace les images, divisions, classes et annotations actuelles du jeu de données par l'instantané sélectionné et ne peut pas être annulée à moins d'enregistrer d'abord l'état actuel en tant qu'autre version. Le jeu de données est verrouillé dans l'état processing pendant sa reconstruction. Rien n'est rechargé lors d'une restauration, ce qui rend les restaurations généralement rapides, même sur de grands jeux de données.
Active Save Dataset Version dans la boîte de dialogue d'entraînement Cloud pour associer un modèle au jeu de données exact utilisé pour l'entraînement. La plateforme réutilise une version correspondante lorsque le contenu du jeu de données n'a pas changé et n'en crée une nouvelle que lorsqu'il a changé.
La création et la restauration de versions sont disponibles une fois que le jeu de données atteint l'état ready. Les versions ne sont pas disponibles pour les jeux de données connectés dans le cloud ou On Premise.
Crée une version avant et après des modifications majeures de ton jeu de données — ajout d'images, correction d'annotations ou rééquilibrage des jeux. Cela te permet de comparer les performances du modèle selon différents états du jeu de données.
La taille affichée correspond à la taille du fichier d'exportation NDJSON, qui contient les URL des images et les annotations — et non les images elles-mêmes. Les données d'image réelles sont stockées séparément et accessibles via des URL signées. Le fichier d'instantané compte tout de même dans ton quota de stockage d'espace de travail, de sorte que la création d'une version échoue s'il ne te reste plus de marge.
Exporter le Dataset#
Exporte ton jeu de données pour une utilisation hors ligne avec un téléchargement NDJSON depuis l'en-tête du jeu de données ou l'onglet Versions.
Pour exporter :
- Clique sur le bouton Download (icône de téléchargement) dans l'en-tête du jeu de données
- Télécharge l'instantané NDJSON actuel directement
- Utilise l'onglet Versions quand tu souhaites un instantané numéroté immuable que tu peux retélécharger plus tard
Le format NDJSON stocke un objet JSON par ligne. La première ligne contient les métadonnées du jeu de données, suivies d'une ligne par image :
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}L'objet facultatif au niveau de l'image metadata est conservé lorsqu'un fichier NDJSON est importé dans la plateforme. Tu peux l'inspecter ou le modifier depuis le panneau d'informations en plein écran de l'image. Pour les téléchargements programmatiques d'archives, l'API Ingest Dataset Data API accepte l'arborescence de chemins équivalente imageMetadata.
Les jeux de données de pose comportent également un champ kpt_shape dans la ligne d'en-tête du jeu de données, déduit des annotations lorsqu'il n'est pas déjà défini.
Les exportations de profondeur déclarent "task": "depth" et "depth_scale": 1000 dans la ligne du jeu de données. Chaque ligne d'image inclut un depth.url pour son PNG uint16 simple associé. Ultralytics télécharge simultanément les URL des images et de la profondeur et écrit un fichier YAML d'entraînement avec la même échelle, de sorte que le fichier NDJSON puisse être transmis directement à model.train(data=...).
Les URL des images dans le fichier NDJSON exporté sont signées et valables pendant 7 jours. La plateforme réutilise un export mis en cache pendant un maximum de 6 jours lorsque le jeu de données n'a pas changé, de sorte qu'un nouveau téléchargement dispose toujours d'au moins un jour de validité restante. Si tu as besoin de nouvelles URL plus tôt, modifie le jeu de données ou crée une nouvelle version.
L'exportation n'est pas disponible pour les jeux de données On Premise, dont les octets d'images n'atteignent jamais la plateforme.
Consulte la documentation du format Ultralytics NDJSON pour connaître la spécification complète.
Opérations sur les images#
Actions rapides#
Fais un clic droit sur n'importe quelle image dans la vue Grille ou Compacte pour accéder aux actions rapides :
| Action | Description |
|---|---|
| Déplacer vers une division | Réassigne l'image à la division Entraînement, Validation ou Test |
| Download | Télécharge le fichier image original |
| Supprimer | Supprime l'image du jeu de données |

Le menu contextuel de l'image s'applique à une image unique. Pour des opérations en masse sur plusieurs images, utilise la vue Tableau avec la sélection par cases à cocher.
Déplacement en masse vers une division#
Réassigne les images sélectionnées à une division différente au sein du même jeu de données :
- Passe à la vue Tableau
- Sélectionne les images à l'aide des cases à cocher
- Fais un clic droit pour ouvrir le menu contextuel
- Choisis
Move to split> Train, Validation ou Test
Tu peux également glisser et déposer des images sur les onglets de filtre de division en mode grille. Si le déplacement d'une image entre en collision avec une image identique déjà présente dans la division cible, la plateforme demande s'il faut ignorer, conserver les deux ou remplacer.
Téléverse toutes les images dans un seul jeu de données, puis utilise le déplacement en masse vers une division pour organiser les sous-ensembles en divisions d'entraînement, de validation et de test.
Redistribution des divisions#
Redistribue toutes les images entre les divisions d'entraînement, de validation et de test en utilisant des ratios personnalisés :
- Clique sur la barre de division dans la barre d'outils du jeu de données pour ouvrir la boîte de dialogue Redistribuer les divisions
- Ajuste les pourcentages de division en utilisant l'une des méthodes ci-dessous
- Vérifie l'aperçu en direct du nombre d'images pour confirmer la distribution
- Clique sur Appliquer pour réassigner aléatoirement toutes les images selon tes pourcentages
La boîte de dialogue propose trois façons de définir tes proportions de division cibles :
| Méthode | Description |
|---|---|
| Glisser | Fais glisser les poignées entre les segments colorés pour ajuster visuellement les limites des divisions |
| Saisir | Modifie le pourcentage saisi pour n'importe quelle division (les deux autres divisions se rééquilibrent automatiquement de manière proportionnelle) |
| Auto | Un clic pour définir instantanément une division 80/20 entraînement/validation avec la division test fixée à 0 % |
Un aperçu en direct montre exactement combien d'images atterriront dans chaque division avant que tu n'appliques les changements.
Clique sur le bouton Auto pour définir instantanément la division recommandée 80/20 entraînement/validation. C'est le ratio le plus courant pour l'entraînement.
Suppression en masse#
Supprime plusieurs images en une seule fois :
- Sélectionne les images dans la vue tableau
- Fais un clic droit et choisis
Delete, ou appuie surCmd/Ctrl+Delete - Confirme la suppression
URI du jeu de données#
Fais référence aux jeux de données de la plateforme en utilisant le format d'URI ul:// (voir Utilisation des jeux de données de la plateforme) :
ul://username/datasets/dataset-slugTu peux aussi coller directement une URL web de jeu de données ou de modèle (par exemple https://platform.ultralytics.com/username/datasets/dataset-slug) ; elle est automatiquement convertie vers l'URI ul://. Transmettre une liste de jeux de données permet d'affiner un modèle de base sur chacun d'eux en série, par exemple model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Utilise cet URI pour entraîner des modèles depuis n'importe où :
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100L'URI ul:// fonctionne depuis n'importe quel environnement :
- Machine locale : Entraîne-toi sur ton matériel, les données sont téléchargées automatiquement
- Google Colab : Accède à tes jeux de données Platform dans tes notebooks
- Serveurs distants : Entraîne-toi sur des machines virtuelles cloud avec un accès complet aux jeux de données
Licences disponibles#
La Platform prend en charge les licences suivantes pour les jeux de données :
| Licence | Type |
|---|---|
| Aucune | Aucune licence sélectionnée |
| CC0-1.0 | Domaine public |
| PDM-1.0 | Domaine public |
| CC-BY-2.5 | Permissive |
| CC-BY-4.0 | Permissive |
| CC-BY-NC-2.0 | Non commerciale |
| CC-BY-SA-4.0 | Copyleft |
| CC-BY-NC-4.0 | Non commerciale |
| CC-BY-NC-SA-3.0 | Copyleft |
| CC-BY-NC-SA-4.0 | Copyleft |
| CC-BY-ND-4.0 | Aucune dérivée |
| CC-BY-NC-ND-4.0 | Non commerciale |
| Apache-2.0 | Permissive |
| MIT | Permissive |
| AGPL-3.0 | Copyleft |
| GPL-3.0 | Copyleft |
| Recherche uniquement | Restreint |
| Autre | Personnalisée |
Lors du clonage d'un jeu de données doté d'une licence copyleft (AGPL-3.0, GPL-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), le clone hérite de la licence et le sélecteur de licence est verrouillé.
Paramètres de visibilité#
Contrôle qui peut voir ton jeu de données :
| Paramètre | Description |
|---|---|
| Privé | Toi et les membres autorisés de l'espace de travail pouvez y accéder |
| Public | Tout le monde peut voir, y compris depuis la page Explore |
La visibilité est définie lors de la création d'un jeu de données dans la boîte de dialogue New Dataset à l'aide d'un bouton bascule. Les jeux de données publics sont visibles sur la page Explore.
Modifier le jeu de données#
Les métadonnées du jeu de données sont éditées en ligne directement sur la page du jeu de données — aucune boîte de dialogue nécessaire :
- Nom : Clique sur le nom du jeu de données pour le modifier. Les modifications sont enregistrées automatiquement lors de la perte de focus ou de
Enter. Les noms sont limités à 100 caractères. - Description : Clique sur la description (ou sur le texte fictif "Ajouter une description...") pour la modifier. Les modifications sont enregistrées automatiquement. Les descriptions sont limitées à 1 000 caractères.
- Type de tâche : Clique sur le badge de tâche pour sélectionner un type de tâche différent.
- Licence : Clique sur le sélecteur de licence pour changer la licence du jeu de données.
- Icône : Clique sur l'icône du jeu de données pour importer ta propre image, promouvoir l'une des images du jeu de données en tant qu'icône, ou choisir une lettre et une couleur.
Chaque image stocke ensemble les annotations pour tous les types de tâches. Changer le type de tâche du dataset contrôle quelles annotations sont visibles dans l'éditeur et incluses dans les exportations et l'entraînement. Les annotations pour les autres types de tâches sont conservées dans la base de données et réapparaissent lorsque tu y reviens. La profondeur est l'exception : sa vérité terrain est un fichier apparié plutôt qu'une annotation, donc un dataset ne peut basculer vers ou depuis la profondeur que lorsqu'il ne contient aucune image — réimporte-le à la place.
Métadonnées personnalisées#
Ouvre Plus d'actions et sélectionne Informations pour examiner deux sections :
- Métadonnées Ultralytics : Détails de la Platform en lecture seule tels que l'ID du dataset, le propriétaire, la tâche, les nombres d'images et d'annotations, la région de stockage et les horodatages
- Métadonnées personnalisées : Ton propre objet JSON pour la provenance, les conditions de capture, les ID clients, la gouvernance ou d'autres données contextuelles
Les spectateurs de l'espace de travail peuvent inspecter les métadonnées, tandis que les membres disposant d'un accès en modification peuvent remplacer l'objet de métadonnées personnalisées. L'objet de métadonnées sérialisé est limité à 500 000 caractères, et chaque clé de niveau supérieur est limitée à 128 caractères. Enregistre un objet vide ({}) pour effacer les métadonnées personnalisées.
Cloner un dataset#
Lors de la consultation d'un jeu de données public qui ne t'appartient pas, clique sur Clone Dataset pour ouvrir la boîte de dialogue de clonage. Vérifie l'espace de travail de destination, le nom, la visibilité et la licence, puis confirme le clonage. La copie comprend toutes les images, annotations et définitions de classes. Les jeux de données sources publics restent publics par défaut dans les espaces de travail dont la visibilité par défaut est publique ; les clones d'espaces de travail Enterprise sont privés par défaut. Si le jeu de données d'origine possède une licence copyleft, le clone en hérite et le sélecteur de licence est verrouillé.
Le slug de destination est renommé automatiquement s'il est déjà pris, et le clonage nécessite suffisamment de quota de stockage restant pour contenir la copie.
Les jeux de données s'appuyant sur des sources de stockage cloud ou sur site ne peuvent pas être clonés, car la plateforme ne détient pas leurs octets d'image.
Mettre en favori et partager#
- Mettre en favori (Star) : Clique sur le bouton étoile pour ajouter un jeu de données à tes favoris. Le nombre d'étoiles est visible par tous les utilisateurs.
- Partager : Pour les jeux de données publics, clique sur le bouton de partage pour copier un lien, récupérer un extrait de code d'intégration ou partager sur les réseaux sociaux.
Supprimer le Dataset#
Supprime un jeu de données dont tu n'as plus besoin :
- Ouvre Plus d'actions (le bouton
…) dans l'en-tête du jeu de données - Choisis Supprimer le jeu de données
- Confirme dans la boîte de dialogue : "Ceci déplacera [name] vers la corbeille. Tu pourras le restaurer dans un délai de 30 jours."
Le même menu contient Informations, qui ouvre la boîte de dialogue de métadonnées décrite dans Métadonnées personnalisées, et Actualiser, qui recharge le jeu de données depuis le serveur.
Les jeux de données supprimés sont déplacés vers la Corbeille — ils ne sont pas supprimés définitivement. Tu peux les restaurer dans un délai de 30 jours à partir de Settings > Trash.
Entraîner sur un jeu de données#
Lance l'entraînement directement depuis ton jeu de données :
- Clique sur
New Modelsur la page du jeu de données - Sélectionne un projet ou crée-en un nouveau
- Configure les paramètres d'entraînement
- Lance l'entraînement
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffConsulte Cloud Training pour plus de détails.
FAQ#
Tes données sont traitées et stockées dans la région que tu as sélectionnée (US, EU ou AP). Les images sont :
- Validées pour le format et la taille
- Rejetées si la dimension minimale est inférieure à 28px
- Normalisées si elles sont plus grandes que 4096px (en préservant le rapport hauteur/largeur ; encodées pour un stockage optimisé)
- Stocké avec déduplication, de sorte que les images identiques ne sont conservées qu'une seule fois
- Miniatures générées en WebP 256px pour une navigation rapide
Oui. Glisse les fichiers dans la galerie du dataset ou clique sur l'icône de téléchargement dans l'en-tête de la page, ce qui ouvre directement le sélecteur de fichiers natif de ton navigateur. De nouvelles statistiques sont calculées automatiquement après le traitement.
Utilise la fonctionnalité de déplacement en masse vers un split :
- Sélectionne les images dans la vue tableau
- Fais un clic droit et choisis
Move to split - Sélectionne le split cible (Train, Validation ou Test)
Ultralytics Platform prend en charge les étiquettes YOLO, le format COCO JSON, Ultralytics NDJSON et les téléchargements d'images brutes. Les étiquettes Pascal VOC XML sont détectées mais ne sont pas importées :
Un fichier
.txtpar image avec des coordonnées normalisées (plage 0-1) :Tâche Format Exemple Détection class cx cy w h0 0.5 0.5 0.2 0.3Segmentation class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Pose class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9Classification Structure de répertoire train/cats/,train/dogs/Indicateurs de visibilité pour la pose : 0=non étiqueté, 1=étiqueté mais occlus, 2=étiqueté et visible.
Oui. Chaque image stocke ensemble les annotations pour les 6 types de tâches d'annotation (detect, segment, semantic, classify, pose, OBB). Tu peux changer le type de tâche actif du dataset à tout moment sans perdre les annotations existantes. Seules les annotations correspondant au type de tâche actif sont affichées dans l'éditeur et incluses dans les exportations et l'entraînement — les annotations pour les autres tâches sont conservées et réapparaissent lorsque tu y reviens.
Oui :
Limite Valeur Classes par jeu de données 25,000 Annotations par image 10,000 Coordonnées par annotation 10,000 Nom du jeu de données 100 caractères Description du jeu de données 1 000 caractères Métadonnées personnalisées 500 000 caractères sérialisés Clé de niveau supérieur des métadonnées 128 caractères Les jeux de données qui lisent à partir de sources de stockage cloud ou sur site conservent leurs pixels en dehors de la plateforme, de sorte que les fonctionnalités nécessitant des copies d'octets d'image détenues par la plateforme ne sont pas disponibles :
Fonctionnalité Connecté au cloud Sur site Annotation intelligente Indisponible Indisponible Analyse de clustering Indisponible Indisponible Clonage Indisponible Indisponible Instantanés de version Indisponible Indisponible Exportation NDJSON Disponible Indisponible La navigation, l'annotation manuelle, la gestion des classes, les divisions, les statistiques et l'entraînement fonctionnent tous normalement.
Ultralytics Platform gère le stockage efficacement :