Jeux de données#
Les jeux de données de la plateforme Ultralytics offrent une solution simplifiée pour gérer tes données d'entraînement. Après l'importation, la plateforme traite automatiquement les images, les labels et les statistiques.
Un jeu de données est prêt pour l'entraînement une fois le traitement terminé et s'il contient au moins une image dans le split train, au moins une image dans le split val ou test, ainsi qu'au moins une image annotée. L'en-tête du jeu de données affiche un badge Ready lorsque les trois conditions sont remplies, et un badge Not Ready dans le cas contraire — clique sur le badge pour voir précisément quelle condition manque.
Collecte des images avec des agents#
Utilise Agents pour ajouter des images à un jeu de données lorsqu'une détection de modèle remplit une condition, telle qu'une confiance comprise dans une plage choisie. Connecte la condition à un bloc Dataset et sélectionne une destination que tu peux modifier. Les images arrivent non étiquetées dans la division train ; les copies existantes sont ignorées. Examine les images et étiquette les images avec l'éditeur d'annotations existant.
Importer un jeu de données#
La plateforme Ultralytics accepte plusieurs formats d'importation pour plus de flexibilité.
Si tu as déjà des jeux de données dans Roboflow, utilise les Intégrations pour les importer directement — aucun export ni nouvel import manuel n'est nécessaire. Les données dans Google Cloud Storage, Amazon S3 ou Azure Blob Storage peuvent être utilisées sur place via Stockage cloud. Les espaces de travail Enterprise peuvent utiliser On Premise pour indexer et entraîner des modèles sur des données locales sans envoyer les pixels à la plateforme.
Formats pris en charge#
| Format | Extensions | Remarques | Taille maximale |
|---|---|---|---|
| JPEG | .jpg, .jpeg | Le plus courant, recommandé | 50 MB |
| PNG | .png | Prend en charge la transparence | 50 MB |
| WebP | .webp | Moderne, bonne compression | 50 MB |
| BMP | .bmp | Non compressé | 50 MB |
| TIFF | .tiff, .tif | Haute qualité | 50 MB |
| HEIC | .heic | Photos d'iPhone | 50 MB |
| AVIF | .avif | Format nouvelle génération | 50 MB |
| JP2 | .jp2 | JPEG 2000 | 50 MB |
| DNG | .dng | Appareil photo brut | 50 MB |
| MPO | .mpo | Objet multip image | 50 MB |
Prise en charge des codecs vidéo#
L'extension du fichier ne suffit pas : une vidéo peut tout de même échouer si son codec ne peut pas être décodé pendant le traitement.
La vidéo H.264 dans un conteneur MP4 offre la compatibilité de décodage la plus large et constitue le choix le plus sûr. Si une vidéo ne peut pas être traitée, réencode-la avec FFmpeg :
ffmpeg -i input.mov \
-c:v libx264 -pix_fmt yuv420p \
-c:a aac -movflags +faststart \
output.mp4Préparer ton jeu de données#
La plateforme prend en charge Ultralytics YOLO, COCO, les masques PNG sémantiques, les jeux de données de profondeur, Ultralytics NDJSON et les téléversements bruts (non annotés) :
Utilise la structure de répertoires YOLO standard avec un fichier data.yaml :
my-dataset/
├── images/
│ ├── train/
│ │ ├── img001.jpg
│ │ └── img002.jpg
│ └── val/
│ ├── img003.jpg
│ └── img004.jpg
├── labels/
│ ├── train/
│ │ ├── img001.txt
│ │ └── img002.txt
│ └── val/
│ ├── img003.txt
│ └── img004.txt
└── data.yamlLe fichier YAML définit la configuration de ton jeu de données :
# data.yaml
path: .
train: images/train
val: images/val
names:
0: person
1: car
2: dogBrut : importe des images non annotées (sans labels). Cette option est utile si tu prévois d'annoter directement sur la plateforme à l'aide de l'éditeur d'annotations.
Tu peux également importer des images sans dossiers de split explicites. La plateforme respecte la cible de split active pendant l'importation. Si aucune cible de split n'est définie et que l'importation laisse val vide — ou avec moins de deux cartes appariées pour la profondeur — les jeux de données autres que de classification déplacent automatiquement les images d'entraînement vers val afin que le jeu de données soit immédiatement prêt pour l'entraînement. Les jeux de données de classification sont ignorés, car ils utilisent des splits basés sur les répertoires. Tu peux toujours réaffecter les images ultérieurement avec déplacer en bloc vers un split ou redistribuer les splits.
Le format est détecté automatiquement : les jeux de données contenant un data.yaml avec les clés names, train ou val sont traités comme des jeux de données YOLO. Les jeux de données contenant des fichiers JSON COCO (avec les tableaux images, annotations et categories) sont traités comme des jeux de données COCO. Les exportations .ndjson sont importées en tant qu'Ultralytics NDJSON. Les jeux de données contenant uniquement des images et aucune annotation sont traités comme des données brutes.
Lorsqu'une archive contient plusieurs fichiers YAML, la plateforme privilégie les noms standard (data.yaml, data.yml, dataset.yaml, dataset.yml) les plus proches de la racine de l'archive. Conserve un seul fichier YAML clairement nommé par archive afin d'éviter toute ambiguïté.
Les fichiers de labels au format XML Pascal VOC sont détectés, mais leurs annotations ne sont pas importées — les images sont importées sans annotations. La plateforme t'avertit avant le début de l'importation (« Pascal VOC labels detected »). Convertis d'abord le XML VOC au format YOLO ou COCO ; consulte les outils de conversion de format.
Si les labels font référence à des ID de classe mais qu'aucun nom de classe n'est fourni, la plateforme génère des noms d'espace réservé denses (class0, class1, …) que tu peux renommer ultérieurement dans l'onglet Classes.
Pour les détails des formats spécifiques aux tâches, consulte les tâches prises en charge et la présentation des jeux de données.
Processus d'importation#
Pour créer un jeu de données :
- Accède à
Annotatedans la barre latérale - Clique sur
New Dataset - Choisis un onglet de source de données (voir Sources de données ci-dessous)
- Ajoute un nom — le slug de l'URL est généré automatiquement et peut être modifié — ainsi qu'une description facultative
- Sélectionne le type de tâche (voir les tâches prises en charge), une licence facultative (voir les licences disponibles) et la visibilité (publique ou privée)
- Clique sur
Create & Uploadpour les fichiers locaux, surCreate & Importpour une URL ou une source connectée, ou surCreate Datasetpour commencer avec un jeu vide

Pour ajouter des fichiers à un jeu de données existant, ouvre la page du jeu de données et glisse les fichiers dans la galerie ou clique sur l'icône de téléchargement dans l'en-tête de la page. L'icône de téléchargement ouvre directement le sélecteur de fichiers natif de ton navigateur parce que la tâche du jeu de données est déjà définie.
Sources de données#
La boîte de dialogue New Dataset propose quatre sources :
| Source | Description |
|---|---|
| Importer | Fais glisser des fichiers ou recherche-les — images, vidéos, archives ou NDJSON |
| URL | Colle un lien direct vers un fichier .zip, .tar, .tar.gz, .tgz ou .ndjson ; la plateforme le télécharge et l'ingère côté serveur |
| Cloud | Utilise sur place les données de Google Cloud Storage, Amazon S3 ou Azure Blob Storage (Pro et Enterprise) |
| Sur site | Indexe et entraîne des modèles sur des données qui ne quittent jamais tes propres machines via des workers On Premise (Enterprise) |
Une importation par URL est limitée à la fois par la limite d'importation par fichier de ton forfait (10 Go Free / 20 Go Pro / 50 Go Enterprise) et par l'espace de stockage restant de ton quota, la plus petite de ces deux limites s'appliquant. Le lien doit être accessible publiquement via HTTP ou HTTPS et se terminer par une extension prise en charge.
Avant le début de l'importation#
La plateforme valide tes fichiers dans le navigateur avant d'importer quoi que ce soit, afin que les problèmes courants apparaissent immédiatement plutôt qu'après un long transfert. Les archives sont vérifiées pour détecter toute corruption, absence de contenu, protection par mot de passe ou erreur de syntaxe YAML, et les fichiers trop volumineux sont listés par nom.
Deux boîtes de dialogue peuvent ensuite apparaître :
Lorsque l'archive déclare des noms de classe et que ton jeu de données contient déjà des classes, la boîte de dialogue Map imported classes affiche une ligne par classe entrante. Pour chacune, choisis une classe existante dans laquelle la fusionner, crée une nouvelle classe ou ignore-la. Les correspondances exactes de noms sont présélectionnées, et les classes ignorées ainsi que leurs annotations ne sont pas importées.
Après l'importation, la plateforme traite automatiquement tes données :
graph LR
A[Upload]:::start --> B[Validate]:::proc
B --> C[Normalize]:::proc
C --> D[Thumbnail]:::proc
D --> E[Parse Labels]:::proc
E --> F[Statistics]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff- Validation : vérifications du format et de la taille
- Normalisation : redimensionnement des grandes images (4096 px maximum, dimension minimale de 28 px), conversion des images en niveaux de gris en RGB, aplatissement de la transparence sur un fond blanc et application de l'orientation EXIF
- Miniatures : génération d'aperçus WebP de 256 px
- Analyse des annotations : extraction des annotations YOLO, COCO et NDJSON
- Statistiques : calcul de la répartition des classes et des dimensions des images
Les originaux AVIF et WebP sont stockés octet par octet lorsqu'aucun redimensionnement ni changement de couleur n'est nécessaire. Tous les autres fichiers sont réencodés : les sources WebP restent au format WebP et tous les autres formats (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) sont convertis en JPEG avec une qualité de 92. Ton nom de fichier d'origine et ton extension source sont conservés dans les métadonnées.

Valider avant l'importation
Tu peux valider ton jeu de données localement avant de l'importer :
from ultralytics.data.utils import check_det_dataset
check_det_dataset("path/to/data.yaml")Le côté le plus court des images doit mesurer au moins 28 px. Les images plus petites sont rejetées pendant le traitement. Les images dont le côté le plus long dépasse 4096 px sont automatiquement redimensionnées en conservant leur ratio d'aspect.
Parcourir les images#
Affiche les images de ton jeu de données dans plusieurs dispositions.
Ouvre le panneau Clustering depuis la barre d'outils de la galerie pour explorer ton jeu de données sous forme de nuage de points 2D interactif.
| Affichage | Description |
|---|---|
| Grille | Grille de miniatures avec superposition des annotations (par défaut) |
| Compact | Miniatures plus petites pour un examen rapide |
| Tableau | Liste avec miniature, nom de fichier, dimensions, taille, partition, classes et nombre d'annotations |

Tri et filtrage#
Les images peuvent être triées et filtrées pour faciliter la navigation :
Chaque option alterne entre l'ordre croissant (↑) et décroissant (↓) :
| Trier | Description |
|---|---|
| Création ↑/↓ | Ordre d'importation (décroissant par défaut ↓) |
| Nom ↑/↓ | Noms de fichiers par ordre alphabétique |
| Hauteur ↑/↓ | Hauteur de l'image en pixels |
| Largeur ↑/↓ | Largeur de l'image en pixels |
| Taille ↑/↓ | Taille du fichier sur le disque |
| Annotations ↑/↓ | Nombre d'annotations par image |
Pour les jeux de données contenant plus de 100 000 images, les tris par nom, largeur, hauteur et taille sont masqués afin de préserver la réactivité de la galerie. Les tris par date de création et par nombre d'annotations restent disponibles.
Utilise le filtre Annotations défini sur Unannotated pour trouver rapidement les images qui doivent encore être annotées. Cette fonction est particulièrement utile pour les grands jeux de données dont tu veux suivre l'avancement de l'annotation.
La zone de recherche se trouve à droite de la barre d'outils de la galerie et filtre tous les modes d'affichage : grille, compact et tableau. Elle recherche le nom de fichier de l'image (l'extension est facultative), ainsi que les clés de métadonnées personnalisées, les valeurs scalaires et les entrées de tableaux. Ainsi, une image nommée img_0042 contenant {"ship_type": "yacht"} est trouvée en recherchant img_0042 ou yacht.
Les valeurs imbriquées dans des sous-objets ne sont pas prises en compte. Coller un identifiant d'image de 24 caractères recherche directement cette image exacte, sans passer par la recherche textuelle.
Visionneuse plein écran#
Clique sur une image pour ouvrir la visionneuse plein écran, qui propose :
- Navigation : touches fléchées ou aperçus des miniatures pour parcourir les images
- Informations sur l'image : examine les propriétés générées par la plateforme, les métadonnées personnalisées et les métadonnées intégrées au fichier, comme EXIF
- Métadonnées personnalisées : les propriétaires et les éditeurs peuvent ajouter ou remplacer un objet JSON, avec notamment des valeurs imbriquées pouvant atteindre 500 000 caractères sérialisés et des clés de premier niveau pouvant atteindre 128 caractères
- Annotations : active ou désactive la visibilité de la superposition des annotations
- Répartition des classes : nombre d'annotations par classe avec indicateurs de couleur
- Annoter : lorsque tu as un accès en modification, les commandes d'annotation sont immédiatement actives à l'ouverture de la visionneuse plein écran sur ordinateur
- Télécharger : télécharge le fichier image d'origine
- Supprimer : supprime l'image du jeu de données
- Zoom :
Cmd/Ctrl+Scroll,Cmd/Ctrl++ouCmd/Ctrl+=pour zoomer, etCmd/Ctrl+-pour dézoomer - Réinitialiser l'affichage :
Cmd/Ctrl + 0ou le bouton de réinitialisation pour adapter l'image à la visionneuse - Panoramique : maintiens
Spaceenfoncé et fais glisser pour déplacer la zone de travail lorsque l'image est agrandie - Vue des pixels : active ou désactive le rendu pixellisé pour une inspection détaillée
- Rideau de profondeur : sur les jeux de données de profondeur, un séparateur déplaçable balaie l'image RGB et sa carte de profondeur colorisée

Filtrer par partition#
Filtre les images selon leur partition dans le jeu de données :
| Sous-ensemble | Objectif |
|---|---|
| Entraîner | Utilisé pour l'entraînement du modèle |
| Val | Utilisé pour la validation pendant l'entraînement |
| Test | Utilisé pour l'évaluation finale |
Clustering#
Le panneau Clustering projette ton jeu de données dans un nuage de points 2D interactif où les images visuellement similaires sont proches les unes des autres. Utilise-le pour faire ressortir les groupes, repérer les doublons et les valeurs aberrantes, et examiner la répartition des partitions ou des classes dans tes données, sans quitter la galerie. Ouvre-le depuis l'icône du graphique en nuage de points dans la barre d'outils de la galerie, sur n'importe quelle page de jeu de données.

Exécuter l'analyse#
Démarre une analyse :
- Ouvre un jeu de données et clique sur l'icône du graphique en nuage de points dans la barre d'outils de la galerie
- Clique sur
Analyze Dataset - Attends la fin de la barre de progression : les résultats apparaissent dans le même panneau
L'analyse s'exécute en arrière-plan en deux étapes, Computing embeddings et Clustering, et peut prendre quelques minutes selon la taille de ton jeu de données. Tu peux fermer le panneau ou quitter la page et revenir plus tard.
Un jeu de données doit contenir au moins 20 et au plus 200 000 images sans erreur pour pouvoir être analysé. Les jeux de données connectés reposant sur un stockage cloud ou On Premise ne sont pas encore pris en charge.
Visualisation#
Une fois l'analyse terminée, le panneau affiche un nuage de points 2D de toutes les images analysées, avec une légende et un compteur de points. Les filtres de la galerie (partition, classe, annotées/non annotées) estompent les points hors filtre afin que tu puisses te concentrer sur le sous-ensemble qui t'intéresse ; le compteur affiche alors visible / total points.

Colorer par#
Modifie la manière dont les points de données sont ombrés avec la liste déroulante Color by dans la barre d’outils du panneau. Change de mode d’affichage à tout moment : le graphique recolore instantanément les points pour te permettre de voir comment les partitions, les classes ou les propriétés des images sont réparties entre tes clusters :
| Option | Ombrage |
|---|---|
| Partitions | Entraînement / Validation / Test |
| Classes | Première classe d’annotation de chaque image |
| Largeur | Largeur de l’image |
| Hauteur | Hauteur de l’image |
| Taille | Taille du fichier |
| Annotations | Nombre d’annotations par image |

Sélection au lasso#
Dessine une sélection de forme libre autour d’une région pour mettre en évidence les points du graphique. La galerie se filtre pour n’afficher que les images correspondantes, afin que tu puisses les examiner, réannoter, déplacer ou supprimer à l’aide des opérations sur les images habituelles.
Une pastille au-dessus du graphique indique le nombre de points sélectionnés : clique sur × pour effacer le lasso et revenir à la vue complète de la galerie.
Un lasso prend en compte au maximum 1 000 images. Si ta sélection en correspond à davantage, la plateforme affiche un échantillon de 1 000 images et te suggère de dessiner une région plus petite.
Déplacement et zoom#
Navigue directement dans les nuages de points volumineux avec ta souris et ton clavier, ou avec les boutons de zoom situés en bas à gauche du graphique :
| Entrée | Action |
|---|---|
| Défilement | Déplacer le graphique en 2D |
| Cmd/Ctrl+Défilement | Effectuer un zoom avant ou arrière, centré sur le curseur |
| Maintenir la barre d’espace | Passer en mode déplacement par glissement |
| Bouton Réinitialiser | Revenir à l’étendue complète du graphique |
Nouvelle analyse#
Si ton jeu de données change après l’analyse — de nouvelles images sont ajoutées ou le nombre d’images analysées ne correspond plus au jeu de données — un bouton Re-analyze apparaît en haut du panneau pour les propriétaires et les éditeurs.
Clique sur Re-analyze pour recalculer les embeddings et la projection 2D depuis zéro.
Trouver des images similaires#
Les mêmes descripteurs (embeddings) alimentent la recherche de similarité dans les jeux de données publics. Dans un jeu de données que tu peux modifier, fais un clic droit sur une image dans la vue Grille (Grid) ou Compacte (Compact) (ou sur une seule ligne sélectionnée dans la vue Tableau (Table)) et choisis Trouver des images similaires. La boîte de dialogue liste jusqu'à 24 images publiques les plus proches avec leur jeu de données source, leur licence et leur score de similarité, en excluant les images que ton jeu de données contient déjà et les copies de l'image sélectionnée dans d'autres jeux de données. Sélectionne celles que tu veux et clique sur Ajouter au jeu de données : elles sont ajoutées à la division train en tant qu'images non étiquetées, décomptées de ton stockage, et prêtes pour l'annotation.
Une image sans descripteur — dans un jeu de données non encore analysé, ou ajouté depuis la dernière analyse — affiche Analyze this dataset in Clustering to find similar images. La boîte de dialogue n'est pas disponible sur les jeux de données connectés. Les diagnostics de validation par image d'un modèle exécutent la même recherche à partir de ses images aux moins bonnes performances.
Onglets du jeu de données#
Chaque page de jeu de données peut afficher jusqu’à six onglets, selon l’état du jeu de données et tes autorisations :
Onglet Images#
Vue par défaut affichant la galerie d’images avec les superpositions d’annotations. Elle prend en charge les modes d’affichage en grille, compact et tableau. Fais glisser et dépose des fichiers ici pour ajouter d’autres images.
Onglet Classes#
Cet onglet apparaît lorsque le jeu de données contient des images et que sa tâche comporte des classes.
Gère les classes d’annotation de ton jeu de données :
- Histogramme des classes : graphique à barres affichant le nombre d’annotations par classe, trié par fréquence, avec un basculement entre échelle linéaire et logarithmique
- Tableau des classes : tableau triable et interrogeable avec l’index, le nom, le nombre d’annotations et le nombre d’images
- Modifier les noms des classes : clique sur n’importe quel nom de classe pour le renommer directement
- Modifier les couleurs des classes : clique sur un échantillon de couleur pour modifier la couleur de la classe
- Ajouter une nouvelle classe : utilise le champ situé en bas pour ajouter des classes
- Fusionner des classes : sélectionne au moins deux lignes et clique sur
Merge into one - Supprimer des classes : sélectionne une ou plusieurs lignes et clique sur
Delete

Si ton jeu de données présente un déséquilibre entre les classes (par exemple, 10 000 annotations « person » mais seulement 50 annotations « bicycle »), utilise le bouton bascule Log Scale de l’histogramme des classes pour visualiser clairement toutes les classes.
Fusionner des classes#
La fusion regroupe les étiquettes en double ou qui se chevauchent — par exemple, en regroupant car, automobile et vehicle en une seule classe :
- Sélectionne au moins deux classes à l’aide des cases à cocher des lignes
- Clique sur
Merge into onedans l’en-tête du tableau, ou fais un clic droit sur la sélection - Choisis laquelle des classes sélectionnées sera la cible dans laquelle les autres seront fusionnées
- Confirme
Chaque annotation appartenant aux classes sources est réattribuée à la classe cible, et les classes sources sont supprimées. Aucune annotation n’est supprimée, le nombre total d’annotations du jeu de données reste donc inchangé.
Supprimer des classes#
- Sélectionne une ou plusieurs classes à l’aide des cases à cocher des lignes
- Clique sur
Deletedans l’en-tête du tableau, ou fais un clic droit sur la sélection - Confirme
La suppression d’une classe supprime la classe ainsi que toutes ses annotations. Pour les jeux de données de classification, les étiquettes sont supprimées, mais les images sont conservées et deviennent non annotées.
Les identifiants de classe sont positionnels. La fusion ou la suppression d’une classe décale vers le bas chaque indice de classe supérieur pour combler l’espace, de sorte que les exports et les fichiers d’étiquettes écrits avant la modification ne correspondent plus aux nouveaux indices. Crée d’abord une version si tu dois conserver l’ancienne numérotation.
Les nombres de classes sont calculés à partir d’au plus 100 000 images. Pour les jeux de données plus volumineux, une note au-dessus de l’histogramme indique « Basé sur un sous-ensemble de 100 000 images de ce jeu de données. »
Onglet Graphiques#
Cet onglet apparaît lorsque le jeu de données contient des images.
Statistiques calculées automatiquement à partir de ton jeu de données :
Les graphiques apparaissent dans cet ordre, et chacun est omis lorsque le jeu de données ne contient aucune donnée correspondante — un jeu de données d’images brutes n’affiche aucun graphique d’annotations, et Points per Instance apparaît uniquement pour les données de segmentation et de pose :
| Graphique | Description |
|---|---|
| Répartition des partitions | Graphique en anneau indiquant le nombre d’images d’entraînement, de validation et de test, ainsi que le pourcentage d’images étiquetées |
| Classes principales | Graphique en anneau présentant les 10 classes d’annotations les plus fréquentes, les autres étant regroupées sous « Autres » |
| Dimensions des images | Histogramme de la répartition de la largeur et de la hauteur des images (superposées), avec la moyenne |
| Taille des fichiers image | Histogramme de la répartition de la taille des fichiers image |
| Dimensions 2D des images | Carte thermique 2D de la largeur par rapport à la hauteur, avec des lignes guides du rapport d’aspect |
| Emplacements des annotations | Carte thermique 2D des positions centrales des BBox |
| Formats des images | Répartition des formats des images sources (JPG, PNG, etc.) |
| Dimensions des BBox | Histogramme de la largeur et de la hauteur des BBox (superposées) |
| Objets par image | Histogramme du nombre d’annotations par image |
| Points par instance | Nombre de sommets de polygone ou de points clés par annotation (segmentation/pose) |

La plateforme met en cache les statistiques calculées et les invalide lorsque les images, les annotations, les classes ou les partitions changent. Pour les jeux de données de plus de 100 000 images, les graphiques sont calculés à partir d’un sous-ensemble de 100 000 images, comme indiqué au-dessus de la grille.
Clique sur le bouton d’agrandissement d’une carte thermique pour l’afficher en plein écran. Tu obtiens ainsi une vue plus grande et plus détaillée, utile pour comprendre les structures spatiales des jeux de données volumineux.
Onglet Modèles#
Affiche tous les modèles entraînés sur ce jeu de données dans un tableau interrogeable :
| Colonne | Description |
|---|---|
| Nom | Nom du modèle avec lien |
| Projet | Projet parent avec icône |
| Version | Version immuable du jeu de données utilisée pour l'entraînement, le cas échéant |
| Statut | Badge d'état de l'entraînement |
| Tâche | Type de tâche YOLO |
| Époques | Meilleure époque / nombre total d'époques |
| mAP50-95 | Précision moyenne moyenne |
| mAP50 | mAP à IoU 0.50 |
| Créé le | Date de création |

Onglet des erreurs#
Cet onglet apparaît uniquement lorsqu'un ou plusieurs fichiers ne peuvent pas être traités.
Les images dont le traitement a échoué sont répertoriées ici avec :
- Bannière d'erreur : nombre total d'images ayant échoué et indications
- Tableau des erreurs : nom de fichier, description de l'erreur compréhensible, indications de correction et miniature d'aperçu
- Les erreurs courantes incluent les fichiers corrompus, les formats non pris en charge, les images trop petites (min. 28 px) et les modes colorimétriques non pris en charge

Erreurs de traitement courantes
| Erreur | Cause | Correction |
|---|---|---|
| Impossible de lire le fichier image | Format corrompu ou non pris en charge | Réexporte le fichier depuis l'éditeur d'images |
| Incomplet ou corrompu | Le fichier a été tronqué pendant le transfert | Télécharge à nouveau le fichier d'origine |
| Format d'image non pris en charge | Format que la Platform ne peut pas décoder | Convertis-le au format JPG, PNG ou WebP |
| Erreur d'autorisation sur le fichier | Le fichier est verrouillé ou protégé en lecture | Déverrouille le fichier, puis importe-le à nouveau |
| Image trop petite | Dimension minimale inférieure à 28 px | Utilise des images sources de résolution supérieure |
| Mode colorimétrique non pris en charge | Mode colorimétrique CMYK ou indexé | Convertis-la en mode RGB |
Onglet des versions#
Crée des instantanés NDJSON immuables de ton jeu de données pour garantir la reproductibilité de l'entraînement. Chaque version enregistre le nombre d'images, de classes et d'annotations, ainsi que la taille des fichiers au moment de sa création.
| Colonne | Description |
|---|---|
| Version | Numéro de version (v1, v2, ...) |
| Description | Description fournie par l'utilisateur (modifiable) |
| Images | Nombre d'images au moment de l'instantané |
| Classes | Nombre de classes au moment de l'instantané |
| Annotations | Nombre d'annotations au moment de l'instantané |
| Taille | Taille du fichier d'exportation NDJSON |
| Créé le | Date de création de la version |
| Actions | Télécharger ou restaurer |
Pour créer une version :
- Ouvre l'onglet Versions
- Saisis éventuellement une description (par exemple, "500 images d'entraînement ajoutées" ou "Classes mal étiquetées corrigées")
- Clique sur New Version
- La nouvelle version apparaît dans le tableau
Chaque version est numérotée séquentiellement (v1, v2, v3...) et est immuable : les versions ne peuvent être ni modifiées ni supprimées, seules leurs descriptions peuvent être changées. Utilise les actions de la ligne pour télécharger ou restaurer n'importe quelle version à tout moment.
La restauration remplace les images, les partitions, les classes et les annotations actuelles du jeu de données par ceux de l'instantané sélectionné. Cette opération ne peut pas être annulée, sauf si tu enregistres d'abord l'état actuel en tant qu'autre version. Le jeu de données est verrouillé avec l'état processing pendant sa reconstruction. Aucun fichier n'est réimporté lors d'une restauration : celles-ci sont donc généralement rapides, même pour les jeux de données volumineux.
Active Save Dataset Version dans la boîte de dialogue Cloud Training pour associer un modèle au jeu de données exact utilisé pour l'entraînement. La Platform réutilise une version correspondante lorsque le contenu du jeu de données n'a pas changé et crée une nouvelle version uniquement lorsqu'il a changé.
La création et la restauration de versions sont disponibles une fois que le jeu de données a atteint l'état ready. Les versions ne sont pas disponibles pour les jeux de données cloud connectés ni les jeux de données On Premise.
Crée une version avant et après toute modification importante de ton jeu de données : ajout d'images, correction d'annotations ou rééquilibrage des partitions. Tu peux ainsi comparer les performances du modèle entre différents états du jeu de données.
La taille affichée correspond à celle du fichier d'exportation NDJSON, qui contient les URL des images et les annotations, et non les images elles-mêmes. Les données image réelles sont stockées séparément et accessibles via des URL signées. Le fichier d'instantané est tout de même comptabilisé dans le quota de stockage de ton espace de travail : la création de la version échoue donc si tu n'as plus suffisamment d'espace disponible.
Exporter le jeu de données#
Exporte ton jeu de données pour une utilisation hors ligne en téléchargeant un fichier NDJSON depuis l'en-tête du jeu de données ou l'onglet Versions.
Pour exporter :
- Clique sur le bouton Download (icône de téléchargement) dans l'en-tête du jeu de données
- Télécharge directement l'instantané NDJSON actuel
- Utilise l'onglet Versions lorsque tu veux un instantané numéroté et immuable que tu pourras télécharger à nouveau ultérieurement

Le format NDJSON stocke un objet JSON par ligne. La première ligne contient les métadonnées du jeu de données, suivies d'une ligne par image :
{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}L'objet facultatif metadata au niveau de l'image est conservé lorsqu'un fichier NDJSON est importé dans la Platform. Tu peux l'inspecter ou le modifier depuis le panneau d'informations en plein écran de l'image. Pour les importations d'archives programmatiques, l'API Ingest Dataset Data accepte la mappe de chemins équivalente imageMetadata.
Les jeux de données de pose contiennent également un champ kpt_shape dans la ligne d'en-tête du jeu de données, déduit des annotations lorsqu'il n'est pas déjà défini.
Les exportations de profondeur déclarent "task": "depth" et "depth_scale": 1000 dans la ligne du jeu de données. Chaque ligne d'image inclut un
depth.url pour son fichier PNG uint16 brut associé. Ultralytics télécharge simultanément les URL des images et de la profondeur, puis écrit un fichier YAML d'entraînement avec la même échelle ; le fichier NDJSON peut donc être transmis directement à model.train(data=...).
Les URL des images dans le fichier NDJSON exporté sont signées et valides pendant 7 jours. La Platform réutilise un export mis en cache pendant 6 jours au maximum lorsque le jeu de données n'a pas changé ; un nouveau téléchargement dispose donc toujours d'au moins un jour de validité restant. Si tu as besoin de nouvelles URL plus tôt, modifie le jeu de données ou crée une nouvelle version.
L'exportation n'est pas disponible pour les jeux de données On Premise, dont les octets des images ne parviennent jamais à la Platform.
Consulte la documentation du format NDJSON d'Ultralytics pour connaître la spécification complète.
Opérations sur les images#
Actions rapides#
Fais un clic droit sur n'importe quelle image dans la vue Grid ou Compact pour accéder aux actions rapides :
| Action | Description |
|---|---|
| Move to Split | Réattribue l'image à la partition Train, Val ou Test |
| Trouver des images similaires | Recherche des images similaires dans les jeux de données publics et ajoute-les (voir Trouver des images similaires) |
| Générer des images similaires | Crée jusqu'à 16 variations générées par IA de l'image (quatre par défaut) et ajoute celles que tu conserves en tant qu'images non étiquetées |
| Download | Télécharge le fichier image d'origine |
| Delete | Supprime l'image du jeu de données |

Le menu contextuel de l'image s'applique à une seule image. Pour effectuer des opérations groupées sur plusieurs images, utilise la vue Table avec la sélection par cases à cocher.
Déplacement groupé vers une partition#
Réattribue les images sélectionnées à une autre partition du même jeu de données :
- Passe à la vue Tableau
- Sélectionne les images à l’aide des cases à cocher
- Fais un clic droit pour ouvrir le menu contextuel
- Choisis
Move to split> Entraînement, Validation ou Test
Tu peux également faire glisser-déposer des images sur les onglets de filtre des répartitions en vue grille. Si le déplacement d’une image crée un conflit avec une image identique déjà présente dans la répartition cible, Platform te demande si tu veux l’ignorer, conserver les deux ou la remplacer.
Téléverse toutes les images dans un même jeu de données, puis utilise le déplacement groupé vers une répartition pour organiser les sous-ensembles en répartitions d’entraînement, de validation et de test.
Redistribution des répartitions#
Redistribue toutes les images entre les répartitions d’entraînement, de validation et de test à l’aide de ratios personnalisés :
- Clique sur la barre de répartition dans la barre d’outils du jeu de données pour ouvrir la boîte de dialogue Redistribuer les répartitions
- Ajuste les pourcentages des répartitions à l’aide de l’une des méthodes ci-dessous
- Consulte l’aperçu en direct du nombre d’images pour confirmer la distribution
- Clique sur Appliquer pour réaffecter aléatoirement toutes les images selon tes pourcentages

La boîte de dialogue propose trois façons de définir tes rapports de répartition cibles :
| Méthode | Description |
|---|---|
| Faire glisser | Fais glisser les poignées entre les segments colorés pour ajuster visuellement les limites des répartitions |
| Saisir | Modifie le champ de pourcentage de n’importe quelle répartition (les deux autres se rééquilibrent automatiquement proportionnellement) |
| Automatique | Un clic suffit pour définir instantanément une répartition 80/20 entre l’entraînement et la validation, avec la répartition de test définie à 0 % |
Un aperçu en direct indique exactement combien d’images seront affectées à chaque répartition avant l’application.
Clique sur le bouton Automatique pour définir instantanément la répartition recommandée 80/20 entre l’entraînement et la validation. Il s’agit du ratio le plus courant pour l’entraînement.
Suppression groupée#
Supprime plusieurs images à la fois :
- Sélectionne les images dans la vue tableau
- Fais un clic droit et choisis
Delete, ou appuie surCmd/Ctrl+Delete - Confirme la suppression
URI du jeu de données#
Référence les jeux de données Platform à l’aide du format d’URI ul:// (voir Utiliser les jeux de données Platform) :
ul://username/datasets/dataset-slugTu peux également coller directement l’URL web d’un jeu de données ou d’un modèle (par exemple https://platform.ultralytics.com/username/datasets/dataset-slug) ; elle est automatiquement réécrite en URI ul://. Le passage d’une liste de jeux de données affine un modèle de base sur chacun d’eux successivement, par exemple model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).
Utilise cette URI pour entraîner des modèles depuis n’importe où :
export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100L’URI ul:// fonctionne depuis n’importe quel environnement :
- Machine locale : entraîne sur ton matériel, les données sont téléchargées automatiquement
- Google Colab : accède à tes jeux de données Platform dans les notebooks
- Serveurs distants : entraîne sur des machines virtuelles cloud avec un accès complet au jeu de données
Licences disponibles#
Platform prend en charge les licences suivantes pour les jeux de données :
| Licence | Type |
|---|---|
| Aucun | Aucune licence sélectionnée |
| CC0-1.0 | Domaine public |
| PDM-1.0 | Domaine public |
| CC-BY-2.5 | Permissive |
| CC-BY-3.0 | Permissive |
| CC-BY-4.0 | Permissive |
| CC-BY-NC-2.0 | Non commercial |
| CC-BY-NC-3.0 | Non commercial |
| CC-BY-NC-4.0 | Non commercial |
| CC-BY-SA-3.0 | Copyleft |
| CC-BY-SA-4.0 | Copyleft |
| CC-BY-NC-SA-3.0 | Copyleft |
| CC-BY-NC-SA-4.0 | Copyleft |
| CC-BY-ND-4.0 | Aucune œuvre dérivée |
| CC-BY-NC-ND-2.0 | Non commercial |
| CC-BY-NC-ND-4.0 | Non commercial |
| Apache-2.0 | Permissive |
| MIT | Permissive |
| BSD-3-Clause | Permissive |
| AGPL-3.0 | Copyleft |
| GPL-2.0 | Copyleft |
| GPL-3.0 | Copyleft |
| LGPL-3.0 | Copyleft |
| ODbL-1.0 | Copyleft |
| DbCL-1.0 | Requérant ODbL |
| Réservée à la recherche | Restreinte |
| Autre | Personnalisée |
Lors de la duplication d'un jeu de données sous licence copyleft (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), le jeu de données dupliqué hérite de la licence et le sélecteur de licence est verrouillé.
Paramètres de visibilité#
Contrôle qui peut voir ton jeu de données :
| Paramètre | Description |
|---|---|
| Privé | Toi et les membres autorisés de l’espace de travail pouvez y accéder |
| Public | Tout le monde peut le consulter, notamment depuis la page Explore |
La visibilité est définie lors de la création d’un jeu de données dans la boîte de dialogue New Dataset à l’aide d’un bouton bascule. Les jeux de données publics sont visibles sur la page Explore.
Modifier le jeu de données#
Les métadonnées du jeu de données se modifient directement en ligne sur la page du jeu de données — aucune boîte de dialogue n’est nécessaire :
- Nom : clique sur le nom du jeu de données pour le modifier. Les modifications sont enregistrées automatiquement lorsque le champ perd le focus ou avec
Enter. Les noms sont limités à 100 caractères. - Description : clique sur la description (ou sur l’espace réservé « Add a description... ») pour la modifier. Les modifications sont enregistrées automatiquement. Les descriptions sont limitées à 1 000 caractères.
- Type de tâche : clique sur le badge de la tâche pour sélectionner un autre type de tâche.
- Licence : clique sur le sélecteur de licence pour modifier la licence du jeu de données.
- Icône : clique sur l’icône du jeu de données pour téléverser ta propre image, promouvoir l’une des images du jeu de données au rang d’icône, ou choisir une lettre et une couleur.
Chaque image stocke simultanément les annotations de tous les types de tâches. La modification du type de tâche du jeu de données détermine les annotations visibles dans l’éditeur et incluses dans les exportations et l’entraînement. Les annotations des autres types de tâches sont conservées dans la base de données et réapparaissent lorsque tu reviens au type précédent. Depth est une exception : sa vérité terrain est un fichier associé plutôt qu’une annotation, donc un jeu de données ne peut passer vers ou depuis Depth que lorsqu’il ne contient aucune image — réimporte-le à la place.
Métadonnées personnalisées#
Ouvre Plus d’actions et sélectionne Informations pour consulter deux sections :
- Métadonnées Ultralytics : détails Platform en lecture seule, tels que l’identifiant du jeu de données, le propriétaire, la tâche, le nombre d’images et d’annotations, la région de stockage et les horodatages
- Métadonnées personnalisées : ton propre objet JSON pour la provenance, les conditions de capture, les identifiants client, la gouvernance ou d’autres données contextuelles
Les lecteurs de l’espace de travail peuvent consulter les métadonnées, tandis que les membres disposant d’un accès en modification peuvent remplacer l’objet de métadonnées personnalisées. L’objet de métadonnées sérialisé est limité à 500 000 caractères, et chaque clé de premier niveau est limitée à 128 caractères. Enregistre un objet vide ({}) pour effacer les métadonnées personnalisées.
Cloner le jeu de données#
Lorsque tu consultes un jeu de données public dont tu n’es pas propriétaire, clique sur Clone Dataset pour ouvrir la boîte de dialogue de clonage. Vérifie l’espace de travail de destination, le nom, la visibilité et la licence, puis confirme le clonage. La copie comprend toutes les images, annotations et définitions de classes. Les jeux de données sources publics restent publics par défaut dans les espaces de travail dont la visibilité par défaut est publique ; les clones dans les espaces de travail Enterprise sont privés par défaut. Si le jeu de données d’origine possède une licence copyleft, le clone en hérite et le sélecteur de licence est verrouillé.
Le slug de destination est renommé automatiquement s’il est déjà utilisé, et le clonage nécessite un quota de stockage restant suffisant pour héberger la copie.
Les jeux de données reposant sur des sources de stockage cloud ou On Premise ne peuvent pas être clonés, car Platform ne détient pas leurs octets d’image.
Ajouter aux favoris et partager#
- Ajouter aux favoris : clique sur le bouton en forme d’étoile pour ajouter un jeu de données aux favoris. Le nombre d’ajouts aux favoris est visible par tous les utilisateurs.
- Partager : pour les jeux de données publics, clique sur le bouton de partage pour copier un lien, récupérer un extrait d’intégration ou partager sur les plateformes sociales.
Supprimer le jeu de données#
Supprime un jeu de données dont tu n’as plus besoin :
- Ouvre Plus d’actions (le bouton
…) dans l’en-tête du jeu de données - Choisis Supprimer le jeu de données
- Confirme dans la boîte de dialogue : "Cela déplacera [name] dans la corbeille. Tu peux le restaurer dans les 30 jours."
Le même menu contient Informations, qui ouvre la boîte de dialogue des métadonnées décrite dans Métadonnées personnalisées, ainsi que Actualiser, qui relit le dataset depuis le serveur.
Les datasets supprimés sont déplacés dans la Corbeille — ils ne sont pas supprimés définitivement. Tu peux les restaurer dans les 30 jours depuis Settings > Trash.
Entraîner sur un dataset#
Lance l'entraînement directement depuis ton dataset :
- Clique sur
New Modelsur la page du dataset - Sélectionne un projet ou crée-en un nouveau
- Configure les paramètres d'entraînement
- Lance l'entraînement
graph LR
A[Dataset]:::start --> B[New Model]:::proc
B --> C[Select Project]:::proc
C --> D[Configure]:::proc
D --> E[Start Training]:::out
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fffConsulte Entraînement dans le cloud pour plus de détails.
FAQ#
Tes données sont traitées et stockées dans la région que tu as sélectionnée (US, EU ou AP). Les images sont :
- Validées quant à leur format et leur taille
- Rejetées si leur dimension minimale est inférieure à 28 px
- Normalisées si elles font plus de 4096 px (en conservant leur format d'image ; encodées pour un stockage optimisé)
- Stockées avec déduplication, de sorte que les images identiques ne sont conservées qu'une seule fois
- Miniatures générées au format WebP en 256 px pour une navigation rapide
Oui. Fais glisser les fichiers dans la galerie du dataset ou clique sur l'icône d'importation dans l'en-tête de la page pour ouvrir directement le sélecteur de fichiers natif de ton navigateur. Les nouvelles statistiques sont calculées automatiquement après le traitement.
Utilise la fonctionnalité de déplacement groupé vers un sous-ensemble :
- Sélectionne les images dans la vue tableau
- Fais un clic droit et sélectionne
Move to split - Sélectionne le sous-ensemble cible (Train, Validation ou Test)
Ultralytics Platform prend en charge les annotations YOLO, COCO JSON, Ultralytics NDJSON et les importations d'images brutes. Les annotations Pascal VOC XML sont détectées, mais ne sont pas importées :
Un fichier
.txtpar image avec des coordonnées normalisées (plage de 0 à 1) :Tâche Format Exemple Détection class cx cy w h0 0.5 0.5 0.2 0.3Segmentation class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Sémantique class x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9Pose class cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2OBB class x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9Classification Structure des répertoires train/cats/,train/dogs/Indicateurs de visibilité de pose : 0 = non étiqueté, 1 = étiqueté mais occlus, 2 = étiqueté et visible. Les jeux de données sémantiques acceptent également les masques PNG à la place des fichiers de polygones (voir Masques sémantiques).
Oui. Chaque image stocke ensemble les annotations correspondant aux 6 types de tâches d'annotation (détection, segmentation, sémantique, classification, pose et OBB). Tu peux changer à tout moment le type de tâche actif du dataset sans perdre les annotations existantes. Seules les annotations correspondant au type de tâche actif sont affichées dans l'éditeur et incluses dans les exportations et l'entraînement ; les annotations des autres tâches sont conservées et réapparaissent lorsque tu reviens à leur type de tâche.
Oui :
Limite Valeur Classes par dataset 25,000 Annotations par image 10,000 Coordonnées par annotation 10,000 Nom du dataset 100 caractères Description du dataset 1 000 caractères Métadonnées personnalisées 500 000 caractères sérialisés Clé de niveau supérieur des métadonnées 128 caractères Les datasets qui lisent leurs données depuis des sources de stockage cloud ou sur site conservent leurs pixels en dehors de Platform. Les fonctionnalités qui nécessitent des copies des octets d'image détenues par Platform ne sont donc pas disponibles :
Fonctionnalité Connecté au cloud Sur site Annotation intelligente et par lots Indisponible Indisponible Analyse de regroupement Indisponible Indisponible Clonage Indisponible Indisponible Instantanés de versions Indisponible Indisponible Exportation NDJSON Disponible Indisponible Importation de masques PNG sémantiques Indisponible Disponible La navigation, l'annotation manuelle, la gestion des classes, les sous-ensembles, les statistiques et l'entraînement fonctionnent normalement.
Ultralytics Platform gère efficacement le stockage :