Ultralytics YOLO27 :

Jeux de données#

Les jeux de données de la plateforme Ultralytics offrent une solution simplifiée pour gérer tes données d'entraînement. Après l'importation, la plateforme traite automatiquement les images, les labels et les statistiques.

Un jeu de données est prêt pour l'entraînement une fois le traitement terminé et s'il contient au moins une image dans le split train, au moins une image dans le split val ou test, ainsi qu'au moins une image annotée. L'en-tête du jeu de données affiche un badge Ready lorsque les trois conditions sont remplies, et un badge Not Ready dans le cas contraire — clique sur le badge pour voir précisément quelle condition manque.

Collecte des images avec des agents#

Utilise Agents pour ajouter des images à un jeu de données lorsqu'une détection de modèle remplit une condition, telle qu'une confiance comprise dans une plage choisie. Connecte la condition à un bloc Dataset et sélectionne une destination que tu peux modifier. Les images arrivent non étiquetées dans la division train ; les copies existantes sont ignorées. Examine les images et étiquette les images avec l'éditeur d'annotations existant.

Importer un jeu de données#

La plateforme Ultralytics accepte plusieurs formats d'importation pour plus de flexibilité.

Tes données sont déjà ailleurs ?

Si tu as déjà des jeux de données dans Roboflow, utilise les Intégrations pour les importer directement — aucun export ni nouvel import manuel n'est nécessaire. Les données dans Google Cloud Storage, Amazon S3 ou Azure Blob Storage peuvent être utilisées sur place via Stockage cloud. Les espaces de travail Enterprise peuvent utiliser On Premise pour indexer et entraîner des modèles sur des données locales sans envoyer les pixels à la plateforme.

Formats pris en charge#

FormatExtensionsRemarquesTaille maximale
JPEG.jpg, .jpegLe plus courant, recommandé50 MB
PNG.pngPrend en charge la transparence50 MB
WebP.webpModerne, bonne compression50 MB
BMP.bmpNon compressé50 MB
TIFF.tiff, .tifHaute qualité50 MB
HEIC.heicPhotos d'iPhone50 MB
AVIF.avifFormat nouvelle génération50 MB
JP2.jp2JPEG 200050 MB
DNG.dngAppareil photo brut50 MB
MPO.mpoObjet multip image50 MB

Prise en charge des codecs vidéo#

L'extension du fichier ne suffit pas : une vidéo peut tout de même échouer si son codec ne peut pas être décodé pendant le traitement.

Utiliser H.264 MP4

La vidéo H.264 dans un conteneur MP4 offre la compatibilité de décodage la plus large et constitue le choix le plus sûr. Si une vidéo ne peut pas être traitée, réencode-la avec FFmpeg :

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Préparer ton jeu de données#

La plateforme prend en charge Ultralytics YOLO, COCO, les masques PNG sémantiques, les jeux de données de profondeur, Ultralytics NDJSON et les téléversements bruts (non annotés) :

Utilise la structure de répertoires YOLO standard avec un fichier data.yaml :

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

Le fichier YAML définit la configuration de ton jeu de données :

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Importations brutes

Brut : importe des images non annotées (sans labels). Cette option est utile si tu prévois d'annoter directement sur la plateforme à l'aide de l'éditeur d'annotations.

Structure de répertoires plate

Tu peux également importer des images sans dossiers de split explicites. La plateforme respecte la cible de split active pendant l'importation. Si aucune cible de split n'est définie et que l'importation laisse val vide — ou avec moins de deux cartes appariées pour la profondeur — les jeux de données autres que de classification déplacent automatiquement les images d'entraînement vers val afin que le jeu de données soit immédiatement prêt pour l'entraînement. Les jeux de données de classification sont ignorés, car ils utilisent des splits basés sur les répertoires. Tu peux toujours réaffecter les images ultérieurement avec déplacer en bloc vers un split ou redistribuer les splits.

Détection automatique du format

Le format est détecté automatiquement : les jeux de données contenant un data.yaml avec les clés names, train ou val sont traités comme des jeux de données YOLO. Les jeux de données contenant des fichiers JSON COCO (avec les tableaux images, annotations et categories) sont traités comme des jeux de données COCO. Les exportations .ndjson sont importées en tant qu'Ultralytics NDJSON. Les jeux de données contenant uniquement des images et aucune annotation sont traités comme des données brutes.

Lorsqu'une archive contient plusieurs fichiers YAML, la plateforme privilégie les noms standard (data.yaml, data.yml, dataset.yaml, dataset.yml) les plus proches de la racine de l'archive. Conserve un seul fichier YAML clairement nommé par archive afin d'éviter toute ambiguïté.

Les fichiers XML Pascal VOC ne sont pas importés

Les fichiers de labels au format XML Pascal VOC sont détectés, mais leurs annotations ne sont pas importées — les images sont importées sans annotations. La plateforme t'avertit avant le début de l'importation (« Pascal VOC labels detected »). Convertis d'abord le XML VOC au format YOLO ou COCO ; consulte les outils de conversion de format.

Si les labels font référence à des ID de classe mais qu'aucun nom de classe n'est fourni, la plateforme génère des noms d'espace réservé denses (class0, class1, …) que tu peux renommer ultérieurement dans l'onglet Classes.

Pour les détails des formats spécifiques aux tâches, consulte les tâches prises en charge et la présentation des jeux de données.

Processus d'importation#

Pour créer un jeu de données :

  1. Accède à Annotate dans la barre latérale
  2. Clique sur New Dataset
  3. Choisis un onglet de source de données (voir Sources de données ci-dessous)
  4. Ajoute un nom — le slug de l'URL est généré automatiquement et peut être modifié — ainsi qu'une description facultative
  5. Sélectionne le type de tâche (voir les tâches prises en charge), une licence facultative (voir les licences disponibles) et la visibilité (publique ou privée)
  6. Clique sur Create & Upload pour les fichiers locaux, sur Create & Import pour une URL ou une source connectée, ou sur Create Dataset pour commencer avec un jeu vide

Ultralytics Platform Datasets Upload Dialog Task Selector

Pour ajouter des fichiers à un jeu de données existant, ouvre la page du jeu de données et glisse les fichiers dans la galerie ou clique sur l'icône de téléchargement dans l'en-tête de la page. L'icône de téléchargement ouvre directement le sélecteur de fichiers natif de ton navigateur parce que la tâche du jeu de données est déjà définie.

Sources de données#

La boîte de dialogue New Dataset propose quatre sources :

SourceDescription
ImporterFais glisser des fichiers ou recherche-les — images, vidéos, archives ou NDJSON
URLColle un lien direct vers un fichier .zip, .tar, .tar.gz, .tgz ou .ndjson ; la plateforme le télécharge et l'ingère côté serveur
CloudUtilise sur place les données de Google Cloud Storage, Amazon S3 ou Azure Blob Storage (Pro et Enterprise)
Sur siteIndexe et entraîne des modèles sur des données qui ne quittent jamais tes propres machines via des workers On Premise (Enterprise)
Limites des importations par URL

Une importation par URL est limitée à la fois par la limite d'importation par fichier de ton forfait (10 Go Free / 20 Go Pro / 50 Go Enterprise) et par l'espace de stockage restant de ton quota, la plus petite de ces deux limites s'appliquant. Le lien doit être accessible publiquement via HTTP ou HTTPS et se terminer par une extension prise en charge.

Avant le début de l'importation#

La plateforme valide tes fichiers dans le navigateur avant d'importer quoi que ce soit, afin que les problèmes courants apparaissent immédiatement plutôt qu'après un long transfert. Les archives sont vérifiées pour détecter toute corruption, absence de contenu, protection par mot de passe ou erreur de syntaxe YAML, et les fichiers trop volumineux sont listés par nom.

Deux boîtes de dialogue peuvent ensuite apparaître :

Lorsque l'archive déclare des noms de classe et que ton jeu de données contient déjà des classes, la boîte de dialogue Map imported classes affiche une ligne par classe entrante. Pour chacune, choisis une classe existante dans laquelle la fusionner, crée une nouvelle classe ou ignore-la. Les correspondances exactes de noms sont présélectionnées, et les classes ignorées ainsi que leurs annotations ne sont pas importées.

Après l'importation, la plateforme traite automatiquement tes données :

graph LR
    A[Upload]:::start --> B[Validate]:::proc
    B --> C[Normalize]:::proc
    C --> D[Thumbnail]:::proc
    D --> E[Parse Labels]:::proc
    E --> F[Statistics]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
  1. Validation : vérifications du format et de la taille
  2. Normalisation : redimensionnement des grandes images (4096 px maximum, dimension minimale de 28 px), conversion des images en niveaux de gris en RGB, aplatissement de la transparence sur un fond blanc et application de l'orientation EXIF
  3. Miniatures : génération d'aperçus WebP de 256 px
  4. Analyse des annotations : extraction des annotations YOLO, COCO et NDJSON
  5. Statistiques : calcul de la répartition des classes et des dimensions des images
Encodage des images stockées

Les originaux AVIF et WebP sont stockés octet par octet lorsqu'aucun redimensionnement ni changement de couleur n'est nécessaire. Tous les autres fichiers sont réencodés : les sources WebP restent au format WebP et tous les autres formats (JPEG, PNG, BMP, TIFF, HEIC, JP2, DNG, MPO) sont convertis en JPEG avec une qualité de 92. Ton nom de fichier d'origine et ton extension source sont conservés dans les métadonnées.

Barre de progression de l'importation des jeux de données de la plateforme Ultralytics

Valider avant l'importation

Tu peux valider ton jeu de données localement avant de l'importer :

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Exigences relatives à la taille des images

Le côté le plus court des images doit mesurer au moins 28 px. Les images plus petites sont rejetées pendant le traitement. Les images dont le côté le plus long dépasse 4096 px sont automatiquement redimensionnées en conservant leur ratio d'aspect.

Parcourir les images#

Affiche les images de ton jeu de données dans plusieurs dispositions.

Ouvre le panneau Clustering depuis la barre d'outils de la galerie pour explorer ton jeu de données sous forme de nuage de points 2D interactif.

AffichageDescription
GrilleGrille de miniatures avec superposition des annotations (par défaut)
CompactMiniatures plus petites pour un examen rapide
TableauListe avec miniature, nom de fichier, dimensions, taille, partition, classes et nombre d'annotations

Vue en grille de la galerie des jeux de données de la plateforme Ultralytics avec annotations

Tri et filtrage#

Les images peuvent être triées et filtrées pour faciliter la navigation :

Chaque option alterne entre l'ordre croissant (↑) et décroissant (↓) :

TrierDescription
Création ↑/↓Ordre d'importation (décroissant par défaut ↓)
Nom ↑/↓Noms de fichiers par ordre alphabétique
Hauteur ↑/↓Hauteur de l'image en pixels
Largeur ↑/↓Largeur de l'image en pixels
Taille ↑/↓Taille du fichier sur le disque
Annotations ↑/↓Nombre d'annotations par image
Grands jeux de données

Pour les jeux de données contenant plus de 100 000 images, les tris par nom, largeur, hauteur et taille sont masqués afin de préserver la réactivité de la galerie. Les tris par date de création et par nombre d'annotations restent disponibles.

Rechercher les images non annotées

Utilise le filtre Annotations défini sur Unannotated pour trouver rapidement les images qui doivent encore être annotées. Cette fonction est particulièrement utile pour les grands jeux de données dont tu veux suivre l'avancement de l'annotation.

Rechercher dans les métadonnées personnalisées

La zone de recherche se trouve à droite de la barre d'outils de la galerie et filtre tous les modes d'affichage : grille, compact et tableau. Elle recherche le nom de fichier de l'image (l'extension est facultative), ainsi que les clés de métadonnées personnalisées, les valeurs scalaires et les entrées de tableaux. Ainsi, une image nommée img_0042 contenant {"ship_type": "yacht"} est trouvée en recherchant img_0042 ou yacht.

Les valeurs imbriquées dans des sous-objets ne sont pas prises en compte. Coller un identifiant d'image de 24 caractères recherche directement cette image exacte, sans passer par la recherche textuelle.

Visionneuse plein écran#

Clique sur une image pour ouvrir la visionneuse plein écran, qui propose :

  • Navigation : touches fléchées ou aperçus des miniatures pour parcourir les images
  • Informations sur l'image : examine les propriétés générées par la plateforme, les métadonnées personnalisées et les métadonnées intégrées au fichier, comme EXIF
  • Métadonnées personnalisées : les propriétaires et les éditeurs peuvent ajouter ou remplacer un objet JSON, avec notamment des valeurs imbriquées pouvant atteindre 500 000 caractères sérialisés et des clés de premier niveau pouvant atteindre 128 caractères
  • Annotations : active ou désactive la visibilité de la superposition des annotations
  • Répartition des classes : nombre d'annotations par classe avec indicateurs de couleur
  • Annoter : lorsque tu as un accès en modification, les commandes d'annotation sont immédiatement actives à l'ouverture de la visionneuse plein écran sur ordinateur
  • Télécharger : télécharge le fichier image d'origine
  • Supprimer : supprime l'image du jeu de données
  • Zoom : Cmd/Ctrl+Scroll, Cmd/Ctrl++ ou Cmd/Ctrl+= pour zoomer, et Cmd/Ctrl+- pour dézoomer
  • Réinitialiser l'affichage : Cmd/Ctrl + 0 ou le bouton de réinitialisation pour adapter l'image à la visionneuse
  • Panoramique : maintiens Space enfoncé et fais glisser pour déplacer la zone de travail lorsque l'image est agrandie
  • Vue des pixels : active ou désactive le rendu pixellisé pour une inspection détaillée
  • Rideau de profondeur : sur les jeux de données de profondeur, un séparateur déplaçable balaie l'image RGB et sa carte de profondeur colorisée

Visionneuse plein écran des jeux de données de la plateforme Ultralytics avec panneau de métadonnées

Filtrer par partition#

Filtre les images selon leur partition dans le jeu de données :

Sous-ensembleObjectif
EntraînerUtilisé pour l'entraînement du modèle
ValUtilisé pour la validation pendant l'entraînement
TestUtilisé pour l'évaluation finale

Clustering#

Le panneau Clustering projette ton jeu de données dans un nuage de points 2D interactif où les images visuellement similaires sont proches les unes des autres. Utilise-le pour faire ressortir les groupes, repérer les doublons et les valeurs aberrantes, et examiner la répartition des partitions ou des classes dans tes données, sans quitter la galerie. Ouvre-le depuis l'icône du graphique en nuage de points dans la barre d'outils de la galerie, sur n'importe quelle page de jeu de données.

État vide du clustering des jeux de données de la plateforme Ultralytics

Exécuter l'analyse#

Démarre une analyse :

  1. Ouvre un jeu de données et clique sur l'icône du graphique en nuage de points dans la barre d'outils de la galerie
  2. Clique sur Analyze Dataset
  3. Attends la fin de la barre de progression : les résultats apparaissent dans le même panneau

L'analyse s'exécute en arrière-plan en deux étapes, Computing embeddings et Clustering, et peut prendre quelques minutes selon la taille de ton jeu de données. Tu peux fermer le panneau ou quitter la page et revenir plus tard.

Exigences relatives à l'analyse

Un jeu de données doit contenir au moins 20 et au plus 200 000 images sans erreur pour pouvoir être analysé. Les jeux de données connectés reposant sur un stockage cloud ou On Premise ne sont pas encore pris en charge.

Visualisation#

Une fois l'analyse terminée, le panneau affiche un nuage de points 2D de toutes les images analysées, avec une légende et un compteur de points. Les filtres de la galerie (partition, classe, annotées/non annotées) estompent les points hors filtre afin que tu puisses te concentrer sur le sous-ensemble qui t'intéresse ; le compteur affiche alors visible / total points.

Nuage de points du clustering des jeux de données de la plateforme Ultralytics

Colorer par#

Modifie la manière dont les points de données sont ombrés avec la liste déroulante Color by dans la barre d’outils du panneau. Change de mode d’affichage à tout moment : le graphique recolore instantanément les points pour te permettre de voir comment les partitions, les classes ou les propriétés des images sont réparties entre tes clusters :

OptionOmbrage
PartitionsEntraînement / Validation / Test
ClassesPremière classe d’annotation de chaque image
LargeurLargeur de l’image
HauteurHauteur de l’image
TailleTaille du fichier
AnnotationsNombre d’annotations par image

Modes de couleur du clustering des jeux de données de la plateforme Ultralytics

Sélection au lasso#

Dessine une sélection de forme libre autour d’une région pour mettre en évidence les points du graphique. La galerie se filtre pour n’afficher que les images correspondantes, afin que tu puisses les examiner, réannoter, déplacer ou supprimer à l’aide des opérations sur les images habituelles.

Effacer la sélection

Une pastille au-dessus du graphique indique le nombre de points sélectionnés : clique sur × pour effacer le lasso et revenir à la vue complète de la galerie.

Taille de la sélection

Un lasso prend en compte au maximum 1 000 images. Si ta sélection en correspond à davantage, la plateforme affiche un échantillon de 1 000 images et te suggère de dessiner une région plus petite.

Déplacement et zoom#

Navigue directement dans les nuages de points volumineux avec ta souris et ton clavier, ou avec les boutons de zoom situés en bas à gauche du graphique :

EntréeAction
DéfilementDéplacer le graphique en 2D
Cmd/Ctrl+DéfilementEffectuer un zoom avant ou arrière, centré sur le curseur
Maintenir la barre d’espacePasser en mode déplacement par glissement
Bouton RéinitialiserRevenir à l’étendue complète du graphique

Nouvelle analyse#

Si ton jeu de données change après l’analyse — de nouvelles images sont ajoutées ou le nombre d’images analysées ne correspond plus au jeu de données — un bouton Re-analyze apparaît en haut du panneau pour les propriétaires et les éditeurs.

Clique sur Re-analyze pour recalculer les embeddings et la projection 2D depuis zéro.

Trouver des images similaires#

Les mêmes descripteurs (embeddings) alimentent la recherche de similarité dans les jeux de données publics. Dans un jeu de données que tu peux modifier, fais un clic droit sur une image dans la vue Grille (Grid) ou Compacte (Compact) (ou sur une seule ligne sélectionnée dans la vue Tableau (Table)) et choisis Trouver des images similaires. La boîte de dialogue liste jusqu'à 24 images publiques les plus proches avec leur jeu de données source, leur licence et leur score de similarité, en excluant les images que ton jeu de données contient déjà et les copies de l'image sélectionnée dans d'autres jeux de données. Sélectionne celles que tu veux et clique sur Ajouter au jeu de données : elles sont ajoutées à la division train en tant qu'images non étiquetées, décomptées de ton stockage, et prêtes pour l'annotation.

Une image sans descripteur — dans un jeu de données non encore analysé, ou ajouté depuis la dernière analyse — affiche Analyze this dataset in Clustering to find similar images. La boîte de dialogue n'est pas disponible sur les jeux de données connectés. Les diagnostics de validation par image d'un modèle exécutent la même recherche à partir de ses images aux moins bonnes performances.

Onglets du jeu de données#

Chaque page de jeu de données peut afficher jusqu’à six onglets, selon l’état du jeu de données et tes autorisations :

Onglet Images#

Vue par défaut affichant la galerie d’images avec les superpositions d’annotations. Elle prend en charge les modes d’affichage en grille, compact et tableau. Fais glisser et dépose des fichiers ici pour ajouter d’autres images.

Onglet Classes#

Cet onglet apparaît lorsque le jeu de données contient des images et que sa tâche comporte des classes.

Gère les classes d’annotation de ton jeu de données :

  • Histogramme des classes : graphique à barres affichant le nombre d’annotations par classe, trié par fréquence, avec un basculement entre échelle linéaire et logarithmique
  • Tableau des classes : tableau triable et interrogeable avec l’index, le nom, le nombre d’annotations et le nombre d’images
  • Modifier les noms des classes : clique sur n’importe quel nom de classe pour le renommer directement
  • Modifier les couleurs des classes : clique sur un échantillon de couleur pour modifier la couleur de la classe
  • Ajouter une nouvelle classe : utilise le champ situé en bas pour ajouter des classes
  • Fusionner des classes : sélectionne au moins deux lignes et clique sur Merge into one
  • Supprimer des classes : sélectionne une ou plusieurs lignes et clique sur Delete

Histogramme et tableau de l’onglet Classes des jeux de données de la plateforme Ultralytics

Échelle logarithmique pour les jeux de données déséquilibrés

Si ton jeu de données présente un déséquilibre entre les classes (par exemple, 10 000 annotations « person » mais seulement 50 annotations « bicycle »), utilise le bouton bascule Log Scale de l’histogramme des classes pour visualiser clairement toutes les classes.

Fusionner des classes#

La fusion regroupe les étiquettes en double ou qui se chevauchent — par exemple, en regroupant car, automobile et vehicle en une seule classe :

  1. Sélectionne au moins deux classes à l’aide des cases à cocher des lignes
  2. Clique sur Merge into one dans l’en-tête du tableau, ou fais un clic droit sur la sélection
  3. Choisis laquelle des classes sélectionnées sera la cible dans laquelle les autres seront fusionnées
  4. Confirme

Chaque annotation appartenant aux classes sources est réattribuée à la classe cible, et les classes sources sont supprimées. Aucune annotation n’est supprimée, le nombre total d’annotations du jeu de données reste donc inchangé.

Supprimer des classes#

  1. Sélectionne une ou plusieurs classes à l’aide des cases à cocher des lignes
  2. Clique sur Delete dans l’en-tête du tableau, ou fais un clic droit sur la sélection
  3. Confirme

La suppression d’une classe supprime la classe ainsi que toutes ses annotations. Pour les jeux de données de classification, les étiquettes sont supprimées, mais les images sont conservées et deviennent non annotées.

Décalage des indices de classe

Les identifiants de classe sont positionnels. La fusion ou la suppression d’une classe décale vers le bas chaque indice de classe supérieur pour combler l’espace, de sorte que les exports et les fichiers d’étiquettes écrits avant la modification ne correspondent plus aux nouveaux indices. Crée d’abord une version si tu dois conserver l’ancienne numérotation.

Échantillonnage des statistiques

Les nombres de classes sont calculés à partir d’au plus 100 000 images. Pour les jeux de données plus volumineux, une note au-dessus de l’histogramme indique « Basé sur un sous-ensemble de 100 000 images de ce jeu de données. »

Onglet Graphiques#

Cet onglet apparaît lorsque le jeu de données contient des images.

Statistiques calculées automatiquement à partir de ton jeu de données :

Les graphiques apparaissent dans cet ordre, et chacun est omis lorsque le jeu de données ne contient aucune donnée correspondante — un jeu de données d’images brutes n’affiche aucun graphique d’annotations, et Points per Instance apparaît uniquement pour les données de segmentation et de pose :

GraphiqueDescription
Répartition des partitionsGraphique en anneau indiquant le nombre d’images d’entraînement, de validation et de test, ainsi que le pourcentage d’images étiquetées
Classes principalesGraphique en anneau présentant les 10 classes d’annotations les plus fréquentes, les autres étant regroupées sous « Autres »
Dimensions des imagesHistogramme de la répartition de la largeur et de la hauteur des images (superposées), avec la moyenne
Taille des fichiers imageHistogramme de la répartition de la taille des fichiers image
Dimensions 2D des imagesCarte thermique 2D de la largeur par rapport à la hauteur, avec des lignes guides du rapport d’aspect
Emplacements des annotationsCarte thermique 2D des positions centrales des BBox
Formats des imagesRépartition des formats des images sources (JPG, PNG, etc.)
Dimensions des BBoxHistogramme de la largeur et de la hauteur des BBox (superposées)
Objets par imageHistogramme du nombre d’annotations par image
Points par instanceNombre de sommets de polygone ou de points clés par annotation (segmentation/pose)

Grille de statistiques de l’onglet Graphiques des jeux de données de la plateforme Ultralytics

Mise en cache des statistiques

La plateforme met en cache les statistiques calculées et les invalide lorsque les images, les annotations, les classes ou les partitions changent. Pour les jeux de données de plus de 100 000 images, les graphiques sont calculés à partir d’un sous-ensemble de 100 000 images, comme indiqué au-dessus de la grille.

Cartes thermiques en plein écran

Clique sur le bouton d’agrandissement d’une carte thermique pour l’afficher en plein écran. Tu obtiens ainsi une vue plus grande et plus détaillée, utile pour comprendre les structures spatiales des jeux de données volumineux.

Onglet Modèles#

Affiche tous les modèles entraînés sur ce jeu de données dans un tableau interrogeable :

ColonneDescription
NomNom du modèle avec lien
ProjetProjet parent avec icône
VersionVersion immuable du jeu de données utilisée pour l'entraînement, le cas échéant
StatutBadge d'état de l'entraînement
TâcheType de tâche YOLO
ÉpoquesMeilleure époque / nombre total d'époques
mAP50-95Précision moyenne moyenne
mAP50mAP à IoU 0.50
Créé leDate de création

Onglet Datasets de la Platform Ultralytics — tableau des modèles entraînés

Onglet des erreurs#

Cet onglet apparaît uniquement lorsqu'un ou plusieurs fichiers ne peuvent pas être traités.

Les images dont le traitement a échoué sont répertoriées ici avec :

  • Bannière d'erreur : nombre total d'images ayant échoué et indications
  • Tableau des erreurs : nom de fichier, description de l'erreur compréhensible, indications de correction et miniature d'aperçu
  • Les erreurs courantes incluent les fichiers corrompus, les formats non pris en charge, les images trop petites (min. 28 px) et les modes colorimétriques non pris en charge

Onglet des erreurs de la Platform Ultralytics — échecs de traitement

Erreurs de traitement courantes
ErreurCauseCorrection
Impossible de lire le fichier imageFormat corrompu ou non pris en chargeRéexporte le fichier depuis l'éditeur d'images
Incomplet ou corrompuLe fichier a été tronqué pendant le transfertTélécharge à nouveau le fichier d'origine
Format d'image non pris en chargeFormat que la Platform ne peut pas décoderConvertis-le au format JPG, PNG ou WebP
Erreur d'autorisation sur le fichierLe fichier est verrouillé ou protégé en lectureDéverrouille le fichier, puis importe-le à nouveau
Image trop petiteDimension minimale inférieure à 28 pxUtilise des images sources de résolution supérieure
Mode colorimétrique non pris en chargeMode colorimétrique CMYK ou indexéConvertis-la en mode RGB

Onglet des versions#

Crée des instantanés NDJSON immuables de ton jeu de données pour garantir la reproductibilité de l'entraînement. Chaque version enregistre le nombre d'images, de classes et d'annotations, ainsi que la taille des fichiers au moment de sa création.

ColonneDescription
VersionNuméro de version (v1, v2, ...)
DescriptionDescription fournie par l'utilisateur (modifiable)
ImagesNombre d'images au moment de l'instantané
ClassesNombre de classes au moment de l'instantané
AnnotationsNombre d'annotations au moment de l'instantané
TailleTaille du fichier d'exportation NDJSON
Créé leDate de création de la version
ActionsTélécharger ou restaurer

Pour créer une version :

  1. Ouvre l'onglet Versions
  2. Saisis éventuellement une description (par exemple, "500 images d'entraînement ajoutées" ou "Classes mal étiquetées corrigées")
  3. Clique sur New Version
  4. La nouvelle version apparaît dans le tableau

Chaque version est numérotée séquentiellement (v1, v2, v3...) et est immuable : les versions ne peuvent être ni modifiées ni supprimées, seules leurs descriptions peuvent être changées. Utilise les actions de la ligne pour télécharger ou restaurer n'importe quelle version à tout moment.

Restaurer une version

La restauration remplace les images, les partitions, les classes et les annotations actuelles du jeu de données par ceux de l'instantané sélectionné. Cette opération ne peut pas être annulée, sauf si tu enregistres d'abord l'état actuel en tant qu'autre version. Le jeu de données est verrouillé avec l'état processing pendant sa reconstruction. Aucun fichier n'est réimporté lors d'une restauration : celles-ci sont donc généralement rapides, même pour les jeux de données volumineux.

Enregistrer une version pendant l'entraînement

Active Save Dataset Version dans la boîte de dialogue Cloud Training pour associer un modèle au jeu de données exact utilisé pour l'entraînement. La Platform réutilise une version correspondante lorsque le contenu du jeu de données n'a pas changé et crée une nouvelle version uniquement lorsqu'il a changé.

Jeux de données prêts uniquement

La création et la restauration de versions sont disponibles une fois que le jeu de données a atteint l'état ready. Les versions ne sont pas disponibles pour les jeux de données cloud connectés ni les jeux de données On Premise.

Quand créer des versions

Crée une version avant et après toute modification importante de ton jeu de données : ajout d'images, correction d'annotations ou rééquilibrage des partitions. Tu peux ainsi comparer les performances du modèle entre différents états du jeu de données.

Taille du fichier NDJSON

La taille affichée correspond à celle du fichier d'exportation NDJSON, qui contient les URL des images et les annotations, et non les images elles-mêmes. Les données image réelles sont stockées séparément et accessibles via des URL signées. Le fichier d'instantané est tout de même comptabilisé dans le quota de stockage de ton espace de travail : la création de la version échoue donc si tu n'as plus suffisamment d'espace disponible.

Exporter le jeu de données#

Exporte ton jeu de données pour une utilisation hors ligne en téléchargeant un fichier NDJSON depuis l'en-tête du jeu de données ou l'onglet Versions.

Pour exporter :

  1. Clique sur le bouton Download (icône de téléchargement) dans l'en-tête du jeu de données
  2. Télécharge directement l'instantané NDJSON actuel
  3. Utilise l'onglet Versions lorsque tu veux un instantané numéroté et immuable que tu pourras télécharger à nouveau ultérieurement

Ultralytics Platform Datasets Export Ndjson Download

Le format NDJSON stocke un objet JSON par ligne. La première ligne contient les métadonnées du jeu de données, suivies d'une ligne par image :

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

L'objet facultatif metadata au niveau de l'image est conservé lorsqu'un fichier NDJSON est importé dans la Platform. Tu peux l'inspecter ou le modifier depuis le panneau d'informations en plein écran de l'image. Pour les importations d'archives programmatiques, l'API Ingest Dataset Data accepte la mappe de chemins équivalente imageMetadata.

Les jeux de données de pose contiennent également un champ kpt_shape dans la ligne d'en-tête du jeu de données, déduit des annotations lorsqu'il n'est pas déjà défini.

Les exportations de profondeur déclarent "task": "depth" et "depth_scale": 1000 dans la ligne du jeu de données. Chaque ligne d'image inclut un depth.url pour son fichier PNG uint16 brut associé. Ultralytics télécharge simultanément les URL des images et de la profondeur, puis écrit un fichier YAML d'entraînement avec la même échelle ; le fichier NDJSON peut donc être transmis directement à model.train(data=...).

URL signées

Les URL des images dans le fichier NDJSON exporté sont signées et valides pendant 7 jours. La Platform réutilise un export mis en cache pendant 6 jours au maximum lorsque le jeu de données n'a pas changé ; un nouveau téléchargement dispose donc toujours d'au moins un jour de validité restant. Si tu as besoin de nouvelles URL plus tôt, modifie le jeu de données ou crée une nouvelle version.

Jeux de données On Premise

L'exportation n'est pas disponible pour les jeux de données On Premise, dont les octets des images ne parviennent jamais à la Platform.

Consulte la documentation du format NDJSON d'Ultralytics pour connaître la spécification complète.

Opérations sur les images#

Actions rapides#

Fais un clic droit sur n'importe quelle image dans la vue Grid ou Compact pour accéder aux actions rapides :

ActionDescription
Move to SplitRéattribue l'image à la partition Train, Val ou Test
Trouver des images similairesRecherche des images similaires dans les jeux de données publics et ajoute-les (voir Trouver des images similaires)
Générer des images similairesCrée jusqu'à 16 variations générées par IA de l'image (quatre par défaut) et ajoute celles que tu conserves en tant qu'images non étiquetées
DownloadTélécharge le fichier image d'origine
DeleteSupprime l'image du jeu de données

Platform Ultralytics — menu contextuel de la carte d'image des jeux de données

Individuelle ou groupée

Le menu contextuel de l'image s'applique à une seule image. Pour effectuer des opérations groupées sur plusieurs images, utilise la vue Table avec la sélection par cases à cocher.

Déplacement groupé vers une partition#

Réattribue les images sélectionnées à une autre partition du même jeu de données :

  1. Passe à la vue Tableau
  2. Sélectionne les images à l’aide des cases à cocher
  3. Fais un clic droit pour ouvrir le menu contextuel
  4. Choisis Move to split > Entraînement, Validation ou Test

Tu peux également faire glisser-déposer des images sur les onglets de filtre des répartitions en vue grille. Si le déplacement d’une image crée un conflit avec une image identique déjà présente dans la répartition cible, Platform te demande si tu veux l’ignorer, conserver les deux ou la remplacer.

Organisation des répartitions Entraînement/Validation

Téléverse toutes les images dans un même jeu de données, puis utilise le déplacement groupé vers une répartition pour organiser les sous-ensembles en répartitions d’entraînement, de validation et de test.

Redistribution des répartitions#

Redistribue toutes les images entre les répartitions d’entraînement, de validation et de test à l’aide de ratios personnalisés :

  1. Clique sur la barre de répartition dans la barre d’outils du jeu de données pour ouvrir la boîte de dialogue Redistribuer les répartitions
  2. Ajuste les pourcentages des répartitions à l’aide de l’une des méthodes ci-dessous
  3. Consulte l’aperçu en direct du nombre d’images pour confirmer la distribution
  4. Clique sur Appliquer pour réaffecter aléatoirement toutes les images selon tes pourcentages

Ultralytics Platform Datasets Split Redistribution Dialog

La boîte de dialogue propose trois façons de définir tes rapports de répartition cibles :

MéthodeDescription
Faire glisserFais glisser les poignées entre les segments colorés pour ajuster visuellement les limites des répartitions
SaisirModifie le champ de pourcentage de n’importe quelle répartition (les deux autres se rééquilibrent automatiquement proportionnellement)
AutomatiqueUn clic suffit pour définir instantanément une répartition 80/20 entre l’entraînement et la validation, avec la répartition de test définie à 0 %

Un aperçu en direct indique exactement combien d’images seront affectées à chaque répartition avant l’application.

Répartition rapide 80/20

Clique sur le bouton Automatique pour définir instantanément la répartition recommandée 80/20 entre l’entraînement et la validation. Il s’agit du ratio le plus courant pour l’entraînement.

Suppression groupée#

Supprime plusieurs images à la fois :

  1. Sélectionne les images dans la vue tableau
  2. Fais un clic droit et choisis Delete, ou appuie sur Cmd/Ctrl+Delete
  3. Confirme la suppression

URI du jeu de données#

Référence les jeux de données Platform à l’aide du format d’URI ul:// (voir Utiliser les jeux de données Platform) :

ul://username/datasets/dataset-slug

Tu peux également coller directement l’URL web d’un jeu de données ou d’un modèle (par exemple https://platform.ultralytics.com/username/datasets/dataset-slug) ; elle est automatiquement réécrite en URI ul://. Le passage d’une liste de jeux de données affine un modèle de base sur chacun d’eux successivement, par exemple model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Utilise cette URI pour entraîner des modèles depuis n’importe où :

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Entraîner n’importe où avec les données Platform

L’URI ul:// fonctionne depuis n’importe quel environnement :

  • Machine locale : entraîne sur ton matériel, les données sont téléchargées automatiquement
  • Google Colab : accède à tes jeux de données Platform dans les notebooks
  • Serveurs distants : entraîne sur des machines virtuelles cloud avec un accès complet au jeu de données

Licences disponibles#

Platform prend en charge les licences suivantes pour les jeux de données :

LicenceType
AucunAucune licence sélectionnée
CC0-1.0Domaine public
PDM-1.0Domaine public
CC-BY-2.5Permissive
CC-BY-3.0Permissive
CC-BY-4.0Permissive
CC-BY-NC-2.0Non commercial
CC-BY-NC-3.0Non commercial
CC-BY-NC-4.0Non commercial
CC-BY-SA-3.0Copyleft
CC-BY-SA-4.0Copyleft
CC-BY-NC-SA-3.0Copyleft
CC-BY-NC-SA-4.0Copyleft
CC-BY-ND-4.0Aucune œuvre dérivée
CC-BY-NC-ND-2.0Non commercial
CC-BY-NC-ND-4.0Non commercial
Apache-2.0Permissive
MITPermissive
BSD-3-ClausePermissive
AGPL-3.0Copyleft
GPL-2.0Copyleft
GPL-3.0Copyleft
LGPL-3.0Copyleft
ODbL-1.0Copyleft
DbCL-1.0Requérant ODbL
Réservée à la rechercheRestreinte
AutrePersonnalisée
Licences copyleft

Lors de la duplication d'un jeu de données sous licence copyleft (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), le jeu de données dupliqué hérite de la licence et le sélecteur de licence est verrouillé.

Paramètres de visibilité#

Contrôle qui peut voir ton jeu de données :

ParamètreDescription
PrivéToi et les membres autorisés de l’espace de travail pouvez y accéder
PublicTout le monde peut le consulter, notamment depuis la page Explore

La visibilité est définie lors de la création d’un jeu de données dans la boîte de dialogue New Dataset à l’aide d’un bouton bascule. Les jeux de données publics sont visibles sur la page Explore.

Modifier le jeu de données#

Les métadonnées du jeu de données se modifient directement en ligne sur la page du jeu de données — aucune boîte de dialogue n’est nécessaire :

  • Nom : clique sur le nom du jeu de données pour le modifier. Les modifications sont enregistrées automatiquement lorsque le champ perd le focus ou avec Enter. Les noms sont limités à 100 caractères.
  • Description : clique sur la description (ou sur l’espace réservé « Add a description... ») pour la modifier. Les modifications sont enregistrées automatiquement. Les descriptions sont limitées à 1 000 caractères.
  • Type de tâche : clique sur le badge de la tâche pour sélectionner un autre type de tâche.
  • Licence : clique sur le sélecteur de licence pour modifier la licence du jeu de données.
  • Icône : clique sur l’icône du jeu de données pour téléverser ta propre image, promouvoir l’une des images du jeu de données au rang d’icône, ou choisir une lettre et une couleur.
Modifier le type de tâche

Chaque image stocke simultanément les annotations de tous les types de tâches. La modification du type de tâche du jeu de données détermine les annotations visibles dans l’éditeur et incluses dans les exportations et l’entraînement. Les annotations des autres types de tâches sont conservées dans la base de données et réapparaissent lorsque tu reviens au type précédent. Depth est une exception : sa vérité terrain est un fichier associé plutôt qu’une annotation, donc un jeu de données ne peut passer vers ou depuis Depth que lorsqu’il ne contient aucune image — réimporte-le à la place.

Métadonnées personnalisées#

Ouvre Plus d’actions et sélectionne Informations pour consulter deux sections :

  • Métadonnées Ultralytics : détails Platform en lecture seule, tels que l’identifiant du jeu de données, le propriétaire, la tâche, le nombre d’images et d’annotations, la région de stockage et les horodatages
  • Métadonnées personnalisées : ton propre objet JSON pour la provenance, les conditions de capture, les identifiants client, la gouvernance ou d’autres données contextuelles

Les lecteurs de l’espace de travail peuvent consulter les métadonnées, tandis que les membres disposant d’un accès en modification peuvent remplacer l’objet de métadonnées personnalisées. L’objet de métadonnées sérialisé est limité à 500 000 caractères, et chaque clé de premier niveau est limitée à 128 caractères. Enregistre un objet vide ({}) pour effacer les métadonnées personnalisées.

Cloner le jeu de données#

Lorsque tu consultes un jeu de données public dont tu n’es pas propriétaire, clique sur Clone Dataset pour ouvrir la boîte de dialogue de clonage. Vérifie l’espace de travail de destination, le nom, la visibilité et la licence, puis confirme le clonage. La copie comprend toutes les images, annotations et définitions de classes. Les jeux de données sources publics restent publics par défaut dans les espaces de travail dont la visibilité par défaut est publique ; les clones dans les espaces de travail Enterprise sont privés par défaut. Si le jeu de données d’origine possède une licence copyleft, le clone en hérite et le sélecteur de licence est verrouillé.

Le slug de destination est renommé automatiquement s’il est déjà utilisé, et le clonage nécessite un quota de stockage restant suffisant pour héberger la copie.

Jeux de données connectés

Les jeux de données reposant sur des sources de stockage cloud ou On Premise ne peuvent pas être clonés, car Platform ne détient pas leurs octets d’image.

Ajouter aux favoris et partager#

  • Ajouter aux favoris : clique sur le bouton en forme d’étoile pour ajouter un jeu de données aux favoris. Le nombre d’ajouts aux favoris est visible par tous les utilisateurs.
  • Partager : pour les jeux de données publics, clique sur le bouton de partage pour copier un lien, récupérer un extrait d’intégration ou partager sur les plateformes sociales.

Supprimer le jeu de données#

Supprime un jeu de données dont tu n’as plus besoin :

  1. Ouvre Plus d’actions (le bouton ) dans l’en-tête du jeu de données
  2. Choisis Supprimer le jeu de données
  3. Confirme dans la boîte de dialogue : "Cela déplacera [name] dans la corbeille. Tu peux le restaurer dans les 30 jours."

Le même menu contient Informations, qui ouvre la boîte de dialogue des métadonnées décrite dans Métadonnées personnalisées, ainsi que Actualiser, qui relit le dataset depuis le serveur.

Corbeille et restauration

Les datasets supprimés sont déplacés dans la Corbeille — ils ne sont pas supprimés définitivement. Tu peux les restaurer dans les 30 jours depuis Settings > Trash.

Entraîner sur un dataset#

Lance l'entraînement directement depuis ton dataset :

  1. Clique sur New Model sur la page du dataset
  2. Sélectionne un projet ou crée-en un nouveau
  3. Configure les paramètres d'entraînement
  4. Lance l'entraînement
graph LR
    A[Dataset]:::start --> B[New Model]:::proc
    B --> C[Select Project]:::proc
    C --> D[Configure]:::proc
    D --> E[Start Training]:::out

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff

Consulte Entraînement dans le cloud pour plus de détails.

FAQ#

  • Tes données sont traitées et stockées dans la région que tu as sélectionnée (US, EU ou AP). Les images sont :

    1. Validées quant à leur format et leur taille
    2. Rejetées si leur dimension minimale est inférieure à 28 px
    3. Normalisées si elles font plus de 4096 px (en conservant leur format d'image ; encodées pour un stockage optimisé)
    4. Stockées avec déduplication, de sorte que les images identiques ne sont conservées qu'une seule fois
    5. Miniatures générées au format WebP en 256 px pour une navigation rapide
  • Ultralytics Platform gère efficacement le stockage :

    • Déduplication : les images identiques dans une même région de données ne sont stockées qu'une seule fois
    • Intégrité : l'intégrité des données des importations est vérifiée
    • Efficacité : les clones réutilisent les images stockées au lieu de les copier, tout en étant comptabilisés dans le quota de stockage de l'espace de travail de destination
    • Régional : les données restent dans la région que tu as sélectionnée (US, EU ou AP)
  • Oui. Fais glisser les fichiers dans la galerie du dataset ou clique sur l'icône d'importation dans l'en-tête de la page pour ouvrir directement le sélecteur de fichiers natif de ton navigateur. Les nouvelles statistiques sont calculées automatiquement après le traitement.

  • Utilise la fonctionnalité de déplacement groupé vers un sous-ensemble :

    1. Sélectionne les images dans la vue tableau
    2. Fais un clic droit et sélectionne Move to split
    3. Sélectionne le sous-ensemble cible (Train, Validation ou Test)
  • Ultralytics Platform prend en charge les annotations YOLO, COCO JSON, Ultralytics NDJSON et les importations d'images brutes. Les annotations Pascal VOC XML sont détectées, mais ne sont pas importées :

    Un fichier .txt par image avec des coordonnées normalisées (plage de 0 à 1) :

    TâcheFormatExemple
    Détectionclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentationclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Sémantiqueclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Poseclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    ClassificationStructure des répertoirestrain/cats/, train/dogs/

    Indicateurs de visibilité de pose : 0 = non étiqueté, 1 = étiqueté mais occlus, 2 = étiqueté et visible. Les jeux de données sémantiques acceptent également les masques PNG à la place des fichiers de polygones (voir Masques sémantiques).

  • Oui. Chaque image stocke ensemble les annotations correspondant aux 6 types de tâches d'annotation (détection, segmentation, sémantique, classification, pose et OBB). Tu peux changer à tout moment le type de tâche actif du dataset sans perdre les annotations existantes. Seules les annotations correspondant au type de tâche actif sont affichées dans l'éditeur et incluses dans les exportations et l'entraînement ; les annotations des autres tâches sont conservées et réapparaissent lorsque tu reviens à leur type de tâche.

  • Oui :

    LimiteValeur
    Classes par dataset25,000
    Annotations par image10,000
    Coordonnées par annotation10,000
    Nom du dataset100 caractères
    Description du dataset1 000 caractères
    Métadonnées personnalisées500 000 caractères sérialisés
    Clé de niveau supérieur des métadonnées128 caractères
  • Les datasets qui lisent leurs données depuis des sources de stockage cloud ou sur site conservent leurs pixels en dehors de Platform. Les fonctionnalités qui nécessitent des copies des octets d'image détenues par Platform ne sont donc pas disponibles :

    FonctionnalitéConnecté au cloudSur site
    Annotation intelligente et par lotsIndisponibleIndisponible
    Analyse de regroupementIndisponibleIndisponible
    ClonageIndisponibleIndisponible
    Instantanés de versionsIndisponibleIndisponible
    Exportation NDJSONDisponibleIndisponible
    Importation de masques PNG sémantiquesIndisponibleDisponible

    La navigation, l'annotation manuelle, la gestion des classes, les sous-ensembles, les statistiques et l'entraînement fonctionnent normalement.

Commentaires