Ultralytics YOLO27 :
Get Started

Ensembles de données#

Les ensembles de données Ultralytics Platform offrent une solution simplifiée pour gérer tes données d’entraînement. Après leur importation, la plateforme traite automatiquement les images, les annotations et les statistiques.

Un ensemble de données est prêt pour l’entraînement une fois son traitement terminé, s’il contient au moins une image dans la partition train, au moins une image dans la partition val ou test, et au moins une image annotée. L’en-tête de l’ensemble de données affiche le badge Ready lorsque ces trois conditions sont remplies, et le badge Not Ready dans le cas contraire. Clique sur le badge pour savoir exactement quelle condition n’est pas remplie.

Collecter des images avec des agents#

Utilise les Agents pour ajouter des images à un ensemble de données lorsqu’une détection de modèle satisfait une condition, par exemple lorsque son niveau de confiance se situe dans une plage choisie. Relie la condition à un bloc Ensemble de données et sélectionne une destination que tu peux modifier. Les images arrivent sans annotation dans la partition train ; les doublons existants sont ignorés. Examine-les et annote-les avec l’éditeur d’annotations existant.

Importer un ensemble de données#

Ultralytics Platform accepte plusieurs formats d’importation pour plus de flexibilité.

Tu as déjà des données ailleurs ?

Si tu as déjà des ensembles de données dans Roboflow, utilise les Intégrations pour les importer directement, sans exportation ni nouvel envoi manuel. Les données dans Google Cloud Storage, Amazon S3 ou Azure Blob Storage peuvent être utilisées directement via le stockage cloud. Les espaces de travail Enterprise peuvent utiliser On Premise pour indexer les données locales et effectuer des entraînements sans envoyer les pixels à Platform.

Formats pris en charge#

FormatExtensionsRemarquesTaille max.
JPEG.jpg, .jpegLe plus courant, recommandé50 MB
PNG.pngPrend en charge la transparence50 MB
WebP.webpModerne, bonne compression50 MB
BMP.bmpNon compressé50 MB
TIFF.tiff, .tifHaute qualité50 MB
HEIC.heicPhotos d’iPhone50 MB
AVIF.avifFormat de nouvelle génération50 MB
JP2.jp2JPEG 200050 MB
DNG.dngImages brutes de l’appareil photo50 MB
MPO.mpoObjet multi-image50 MB

Prise en charge des codecs vidéo#

L’extension de fichier ne suffit pas : le traitement d’une vidéo peut échouer si son codec ne peut pas être décodé.

Utilise MP4 avec H.264

Les vidéos H.264 dans un conteneur MP4 sont compatibles avec le plus grand nombre de décodeurs et constituent le choix le plus sûr. Si le traitement d’une vidéo échoue, réencode-la avec FFmpeg :

ffmpeg -i input.mov \
  -c:v libx264 -pix_fmt yuv420p \
  -c:a aac -movflags +faststart \
  output.mp4

Préparer ton ensemble de données#

Platform prend en charge Ultralytics YOLO, COCO, les fichiers JSON LabelMe, les masques PNG sémantiques, les ensembles de données de profondeur, Ultralytics NDJSON et Labelbox NDJSON, ainsi que les fichiers bruts (non annotés) :

Utilise la structure de répertoires YOLO standard avec un fichier data.yaml :

my-dataset/
├── images/
│   ├── train/
│   │   ├── img001.jpg
│   │   └── img002.jpg
│   └── val/
│       ├── img003.jpg
│       └── img004.jpg
├── labels/
│   ├── train/
│   │   ├── img001.txt
│   │   └── img002.txt
│   └── val/
│       ├── img003.txt
│       └── img004.txt
└── data.yaml

Le fichier YAML définit la configuration de ton ensemble de données :

# data.yaml
path: .
train: images/train
val: images/val

names:
    0: person
    1: car
    2: dog
Importations brutes

Brut : importe des images non annotées (sans annotations). Cette option est utile si tu prévois de les annoter directement sur la plateforme à l’aide de l’éditeur d’annotations.

Structure de répertoires plate

Tu peux aussi importer des images sans dossiers de partition explicites. Platform respecte la partition cible active lors de l’importation. Si aucune partition cible n’est définie et que l’importation laisse val vide — ou avec moins de deux cartes appariées pour les données de profondeur —, les images d’entraînement des ensembles de données autres que ceux de classification sont automatiquement déplacées vers val afin que l’ensemble de données puisse être entraîné immédiatement. Les ensembles de données de classification sont ignorés, car leurs partitions sont définies par répertoire. Tu peux toujours réattribuer les images plus tard à l’aide du déplacement groupé vers une partition ou de la redistribution des partitions.

Détection automatique du format

Le format est détecté automatiquement : les jeux de données contenant un fichier data.yaml avec des clés names, train ou val sont traités comme des jeux de données YOLO. Les jeux de données avec des fichiers JSON COCO (contenant les tableaux images, annotations et categories) sont traités comme des jeux de données COCO. En l’absence de fichier COCO, les fichiers JSON LabelMe par image (contenant shapes et imagePath) sont lus comme des annotations LabelMe. Les exports .ndjson sont importés au format NDJSON Ultralytics, ou comme des exports Labelbox lorsque leurs lignes contiennent une clé data_row. Les jeux de données contenant uniquement des images et aucune annotation sont traités comme des données brutes.

Lorsqu’une archive contient plusieurs fichiers YAML, Platform privilégie les noms standard (data.yaml, data.yml, dataset.yaml, dataset.yml) les plus proches de la racine de l’archive. Pour éviter toute ambiguïté, conserve un seul fichier YAML clairement nommé par archive.

Les fichiers XML Pascal VOC ne sont pas importés

Les fichiers d’annotation au format XML Pascal VOC sont détectés, mais leurs annotations ne sont pas importées : les images sont chargées sans elles, et au moins cinq images placées dans un dossier comme images/ ou JPEGImages/ héritent également d’une classe portant le nom de ce dossier. Platform t’avertit avant le début du chargement (« Étiquettes Pascal VOC détectées »). Convertis d’abord les fichiers XML VOC au format YOLO ou COCO ; consulte les outils de conversion de format.

Si les étiquettes font référence à des identifiants de classe, mais qu’aucun nom de classe n’est fourni, Platform remappe les identifiants en une séquence dense commençant à 0 et nomme chaque classe d’après son identifiant source (class0, class3, …), que tu peux ensuite renommer dans l’onglet Classes.

Pour en savoir plus sur les formats propres à chaque tâche, consulte les tâches prises en charge et la présentation des jeux de données.

Processus de chargement#

Pour créer un jeu de données :

  1. Dans la barre latérale, accède à Annotate
  2. Clique sur New Dataset
  3. Choisis un onglet de source de données (voir les sources de données ci-dessous)
  4. Ajoute un nom — le segment d’URL est généré automatiquement et peut être modifié — ainsi qu’une description facultative
  5. Sélectionne le type de tâche (voir les tâches prises en charge), une licence facultative (voir les licences disponibles) et la visibilité (publique ou privée). Un nouveau jeu de données public est créé avec CC BY 4.0 sélectionné ; choisis une autre licence ou Aucune pour la modifier
  6. Clique sur Create & Upload pour les fichiers locaux, sur Create & Import pour une URL ou une source connectée, ou sur Create Dataset pour commencer avec un jeu de données vide

Sélecteur de tâche dans la boîte de dialogue de chargement des jeux de données d’Ultralytics Platform

Pour ajouter des fichiers à un jeu de données existant, ouvre sa page et fais glisser les fichiers dans la galerie ou clique sur l’icône de chargement dans l’en-tête de la page. L’icône de chargement ouvre directement le sélecteur de fichiers natif de ton navigateur, car la tâche du jeu de données est déjà définie.

Sources de données#

La boîte de dialogue New Dataset propose quatre sources :

SourceDescription
TéléverserFais glisser les fichiers ou sélectionne-les : images, vidéos, archives ou fichiers NDJSON
URLColle un lien direct vers un fichier .zip, .tar, .tar.gz, .tgz ou .ndjson ; Platform le télécharge et l’ingère côté serveur
CloudUtilise les données sur place depuis Google Cloud Storage, Amazon S3 ou Azure Blob Storage (Pro et Enterprise)
Sur siteIndexe les données et entraîne un modèle sans qu’elles quittent tes propres machines grâce aux workers On Premise (Enterprise)

Les jeux de données de profondeur peuvent être créés uniquement depuis Upload ou URL ; les onglets Cloud et On Premise sont désactivés pour la tâche de profondeur.

Limites d’importation par URL

L’importation par URL est limitée à la fois par la limite de chargement de ton forfait (10 Go Free / 20 Go Pro / 50 Go Enterprise) et par ton espace de stockage restant, selon la limite la plus basse. Le lien doit être accessible publiquement via HTTP ou HTTPS et se terminer par une extension prise en charge.

Avant le début du chargement#

Platform valide tes fichiers dans le navigateur avant de les charger, afin que les problèmes courants apparaissent immédiatement plutôt qu’après un long transfert. Les archives sont vérifiées pour détecter toute corruption, tout contenu vide ou protégé par mot de passe, ainsi que les erreurs de syntaxe YAML ; les fichiers trop volumineux sont répertoriés par nom.

Deux boîtes de dialogue peuvent ensuite s’afficher :

Lorsqu’une archive ZIP déclare des noms de classes et que ton jeu de données contient déjà des classes, la boîte de dialogue Map classes affiche une ligne par classe entrante. Associe chaque classe à une classe existante ou crée une nouvelle classe, ou décoche sa case Inclure pour l’ignorer. Les noms correspondants (sans tenir compte de la casse, sauf pour les noms d’un ou deux caractères) sont présélectionnés, et les annotations des classes ignorées ne sont pas importées.

Après le chargement, la plateforme traite automatiquement tes données :

  1. Validation : vérification du format et de la taille
  2. Normalisation : redimensionnement des grandes images (4096 px max., dimension minimale de 28 px), conversion des images en niveaux de gris en RGB, aplatissement de la transparence sur un fond blanc et application de l’orientation EXIF ; les fichiers TIFF d’origine sont stockés tels qu’ils ont été chargés
  3. Vignettes : génération d’aperçus WebP de 256 px
  4. Analyse des étiquettes : extraction des étiquettes YOLO, COCO, LabelMe et NDJSON Ultralytics ou Labelbox
  5. Statistiques : calcul de la distribution des classes et des dimensions des images
Encodage des images stockées

Les fichiers TIFF d’origine sont toujours stockés octet pour octet, tout comme les fichiers AVIF et WebP d’origine lorsqu’aucun redimensionnement ni changement de couleur n’est nécessaire. Tous les autres fichiers sont réencodés : les sources WebP restent au format WebP, tandis que toutes les autres sources (JPEG, PNG, BMP, HEIC, JP2, DNG, MPO, ainsi que les fichiers AVIF redimensionnés ou dont les couleurs ont été modifiées) deviennent des fichiers JPEG de qualité 92. Le nom de fichier d’origine et l’extension source sont conservés dans les métadonnées.

Barre de progression du chargement des jeux de données d’Ultralytics Platform

Valider avant le chargement

Tu peux valider ton jeu de données localement avant de le charger :

from ultralytics.data.utils import check_det_dataset

check_det_dataset("path/to/data.yaml")
Exigences relatives à la taille des images

Le côté le plus court des images doit mesurer au moins 28 px. Les images plus petites sont rejetées pendant le traitement. Les images dont le côté le plus long dépasse 4096 px sont automatiquement redimensionnées en conservant leur rapport hauteur/largeur, à l’exception des fichiers TIFF d’origine, qui sont stockés tels qu’ils ont été chargés.

Parcourir les images#

Affiche les images de ton jeu de données selon plusieurs mises en page.

Ouvre le panneau Clustering depuis la barre d’outils de la galerie pour explorer ton jeu de données sous forme de nuage de points 2D interactif.

AffichageDescription
GrilleGrille de vignettes avec superposition des annotations (par défaut)
CompactVignettes plus petites pour parcourir rapidement les images
TableauListe avec vignette, nom de fichier, dimensions, taille, partition, classes et nombre d’étiquettes

Vue en grille de la galerie des jeux de données d’Ultralytics Platform avec annotations

Tri et filtrage#

Tu peux trier et filtrer les images pour les parcourir efficacement :

Chaque option bascule entre l’ordre croissant (↑) et décroissant (↓) :

TrierDescription
Date de création ↑/↓Ordre de chargement (↓ par défaut)
Nom ↑/↓Ordre alphabétique des noms de fichier
Hauteur ↑/↓Hauteur de l’image en pixels
Largeur ↑/↓Largeur de l’image en pixels
Taille ↑/↓Taille du fichier sur le disque
Annotations ↑/↓Nombre d’annotations par image
Grands jeux de données

Pour les jeux de données de plus de 100 000 images, les tris par nom, largeur, hauteur et taille sont masqués afin de préserver la réactivité de la galerie. Les tris par date de création et par nombre d’annotations restent disponibles.

Trouver les images sans étiquette

Utilise le filtre Annotations avec la valeur Unannotated pour trouver rapidement les images qui doivent encore être annotées. C’est particulièrement utile pour les grands jeux de données dont tu veux suivre l’avancement de l’annotation.

Rechercher des images

La barre de recherche se trouve à droite de la barre d’outils de la galerie et filtre tous les modes d’affichage — grille, compact et tableau. Elle recherche le nom de fichier de l’image (l’extension du fichier est facultative), le nom de toute classe annotée dans l’image, ainsi que les clés de métadonnées personnalisées, les valeurs scalaires et les éléments de tableau. Une image nommée img_0042, comportant une annotation boat et des métadonnées {"ship_type": "yacht"}, peut donc être trouvée en recherchant img_0042, boat ou yacht.

Les valeurs imbriquées dans des sous-objets ne sont pas prises en compte. Si tu colles un ID d’image de 24 caractères ou un hachage de contenu de 32 caractères, l’image correspondante est recherchée directement, sans passer par la recherche textuelle.

Les résultats sont classés par pertinence : les images dont le nom de fichier, la classe ou les métadonnées correspondent s’affichent d’abord, puis jusqu’à 1 000 autres images similaires à la recherche, comme forklift near a doorway. Le tri n’est pas disponible lorsqu’une recherche est en cours, et une recherche se terminant par une extension de fichier ignore les images similaires.

Visionneuse plein écran#

Clique sur une image pour ouvrir la visionneuse plein écran, qui propose :

  • Navigation : parcours les images avec les touches fléchées ou les aperçus des vignettes
  • Informations sur l’image : consulte les propriétés générées par Platform, les métadonnées personnalisées et les métadonnées intégrées au fichier, comme EXIF
  • Métadonnées personnalisées : les propriétaires et les éditeurs peuvent ajouter ou remplacer un objet JSON, y compris des valeurs imbriquées, jusqu’à 500 000 caractères sérialisés et des clés de premier niveau de 128 caractères maximum
  • Annotations : afficher ou masquer les annotations superposées
  • Répartition des classes : nombre d’annotations par classe avec des indicateurs de couleur
  • Annoter : lorsque tu as un accès en modification, les commandes d’annotation sont immédiatement actives à l’ouverture de la visionneuse plein écran sur ordinateur
  • Flouter les visages : fais un clic droit sur une annotation pour prévisualiser et appliquer le floutage des visages à l’image, lorsque cette option est disponible
  • Télécharger : télécharger le fichier image d’origine
  • Supprimer : supprimer l’image du jeu de données
  • Zoom : Cmd/Ctrl+Scroll, Cmd/Ctrl++ ou Cmd/Ctrl+= pour zoomer, et Cmd/Ctrl+- pour dézoomer
  • Réinitialiser l’affichage : Cmd/Ctrl + 0 ou le bouton de réinitialisation pour ajuster l’image à la visionneuse
  • Déplacer : maintiens Space enfoncée et fais glisser, ou fais glisser avec le bouton central de la souris, pour déplacer la zone de travail quel que soit le niveau de zoom
  • Vue pixelisée : activer ou désactiver le rendu pixelisé pour examiner les détails de près
  • Curseur de profondeur : dans les jeux de données de profondeur, un séparateur déplaçable permet de passer de l’image RGB à sa carte de profondeur colorisée

Visionneuse plein écran des jeux de données Ultralytics Platform avec panneau de métadonnées

Filtrer par partition#

Filtrer les images selon leur partition dans le jeu de données :

PartitionRôle
EntraînerUtilisé pour l’entraînement du modèle
ValUtilisé pour la validation pendant l’entraînement
TestUtilisé pour l’évaluation finale

Regroupement en clusters#

Le panneau Clustering projette ton jeu de données sous forme de nuage de points 2D interactif, où les images visuellement similaires sont proches les unes des autres. Utilise-le pour faire ressortir les groupes, repérer les doublons et les valeurs aberrantes, et examiner la répartition des partitions ou des classes dans tes données, sans quitter la galerie. Ouvre-le depuis l’icône de nuage de points dans la barre d’outils de la galerie, sur n’importe quelle page de jeu de données. Ce panneau est uniquement disponible sur ordinateur, et les personnes qui n’ont pas d’accès en modification voient l’icône une fois l’analyse du jeu de données terminée.

État initial du regroupement des jeux de données Ultralytics Platform

Exécuter une analyse#

Lancer une analyse :

  1. Ouvre un jeu de données et clique sur l’icône de nuage de points dans la barre d’outils de la galerie
  2. Clique sur Analyze Dataset
  3. Attends la fin de la barre de progression : les résultats s’affichent dans le même panneau

L’analyse s’exécute en arrière-plan en deux étapes, Computing embeddings et Clustering, et peut prendre quelques minutes selon la taille de ton jeu de données. Tu peux fermer le panneau ou quitter la page et revenir plus tard.

Conditions requises pour l’analyse

Un jeu de données doit contenir au moins 20 et au plus 200 000 images sans erreur pour être analysé. Les jeux de données connectés reposant sur un stockage cloud ou sur site ne sont pas encore pris en charge.

Visualisation#

Une fois l’analyse terminée, le panneau affiche un nuage de points 2D de toutes les images analysées, avec une légende et un compteur de points. Les filtres de la galerie (partition, classe, avec ou sans annotation) estompent les points qui ne correspondent pas aux filtres pour que tu puisses te concentrer sur le sous-ensemble qui t’intéresse ; le compteur affiche alors visible / total points.

Nuage de points de regroupement des jeux de données Ultralytics Platform

Colorer par#

Modifie la façon dont les points de données sont colorés avec le menu déroulant Color by dans la barre d’outils du panneau. Change de mode d’affichage à tout moment : le nuage de points est recoloré instantanément pour te permettre de visualiser la répartition des partitions, des classes ou des propriétés des images dans tes groupes :

OptionColoration
PartitionsTrain / Val / Test
ClassesPremière classe d’annotation de chaque image
GroupesÎlot visuel dans la disposition, du plus grand au plus petit ; Dispersés pour les points qui ne se trouvent dans aucun îlot, Non calculé pour les dispositions analysées avant l’ajout de cette option
LargeurLargeur de l’image
HauteurHauteur de l’image
TailleTaille du fichier
AnnotationsNombre d’annotations par image

Modes de coloration du regroupement des jeux de données Ultralytics Platform

Sélection par lasso et clic#

Dessine une sélection de forme libre autour d’une région pour mettre en évidence les points du nuage, ou clique sur un point pour sélectionner tous les points représentés par la même couleur (uniquement ce point si la coloration est basée sur la largeur, la hauteur, la taille ou le nombre d’annotations) ; clique sur une zone vide du nuage pour effacer la sélection. La galerie est filtrée pour n’afficher que les images correspondantes, afin que tu puisses les examiner, réannoter, déplacer ou supprimer à l’aide des opérations habituelles sur les images.

Effacer la sélection

Une pastille au-dessus du graphique indique le nombre de points sélectionnés : clique sur × ou sur une zone vide du nuage pour effacer la sélection et revenir à la vue complète de la galerie.

Taille de la sélection

Une sélection par lasso ou par clic porte sur 1 000 images au maximum. Si ta sélection en contient davantage, Platform en affiche un échantillon de 1 000 et te suggère de dessiner une région plus petite.

Déplacement et zoom#

Explore les grands nuages de points directement avec ta souris et ton clavier, ou avec les boutons de zoom en bas à gauche du graphique :

EntréeAction
DéfilementDéplacer le nuage de points en 2D
Cmd/Ctrl+DéfilementZoomer ou dézoomer autour du curseur
Maintenir EspacePasser en mode déplacement par glisser-déposer
Bouton de réinitialisationRétablir l’étendue complète du nuage de points

Relancer l’analyse#

Si ton jeu de données change après l’analyse — de nouvelles images sont ajoutées ou le nombre d’images analysées ne correspond plus à celui du jeu de données — ou si l’analyse date d’avant l’option de coloration Groupes, un bouton Re-analyze apparaît en haut du panneau pour les propriétaires et les éditeurs.

Clique sur Re-analyze pour recalculer les représentations vectorielles et la projection 2D depuis le début.

Trouver des images similaires#

Les mêmes représentations vectorielles alimentent la recherche de similarité dans les jeux de données publics, les tiens et ceux de ton équipe. Dans un jeu de données que tu peux modifier, fais un clic droit sur une image en vue Grille ou Compacte (ou sur une seule ligne sélectionnée en vue Tableau) et choisis Trouver des images similaires. La boîte de dialogue affiche l’image source à côté de jusqu’à 24 images les plus proches, chacune accompagnée de son score de similarité, à l’exclusion des images déjà présentes dans ton jeu de données et des copies de l’image sélectionnée dans d’autres jeux de données. Clique sur une image pour l’afficher en taille réelle et consulter son jeu de données source, sa licence et son score de similarité. Sélectionne des images à l’aide de leurs cases à cocher (ou sélectionne-les toutes), puis clique sur Ajouter N au jeu de données : elles sont ajoutées à la partition train comme images sans annotation, comptabilisées dans ton espace de stockage et prêtes pour l’annotation.

Boîte de dialogue de recherche d’images similaires dans les jeux de données Ultralytics Platform

Une image sans représentation vectorielle — dans un jeu de données qui n’a pas encore été analysé ou ajoutée depuis la dernière analyse — est convertie en représentation vectorielle à l’ouverture de la boîte de dialogue ; il n’est donc pas nécessaire d’exécuter d’abord une analyse de regroupement. La boîte de dialogue n’est pas disponible pour les jeux de données connectés. Les diagnostics de validation par image d’un modèle exécutent la même recherche à partir de ses images les moins performantes.

Onglets des jeux de données#

Chaque page de jeu de données peut afficher jusqu’à six onglets, selon l’état du jeu de données et tes autorisations :

Onglet Images#

La vue par défaut affiche la galerie d’images avec les annotations superposées. Elle propose les modes d’affichage grille, compact et tableau. Glisse-dépose des fichiers ici pour ajouter des images.

Onglet Classes#

Cet onglet apparaît lorsque le jeu de données contient des images et que sa tâche comporte des classes.

Gère les classes d’annotation de ton jeu de données :

  • Histogramme des classes : graphique en barres indiquant le nombre d’annotations par classe, triées par fréquence, avec une option pour basculer entre une échelle linéaire et logarithmique
  • Tableau des classes : tableau triable et consultable avec l’index, le nom, le nombre d’annotations et le nombre d’images
  • Modifier les noms des classes : clique sur le nom d’une classe pour le renommer directement
  • Modifier les couleurs des classes : clique sur un échantillon de couleur pour changer la couleur de la classe
  • Ajouter une classe : utilise le champ de saisie en bas pour ajouter des classes
  • Fusionner des classes : sélectionne au moins deux lignes et clique sur Merge into one
  • Supprimer des classes : sélectionne une ou plusieurs lignes et clique sur Delete

Onglet Classes des jeux de données Ultralytics Platform : histogramme et tableau

Échelle logarithmique pour les jeux de données déséquilibrés

Si ton jeu de données présente un déséquilibre entre les classes (par exemple, 10 000 annotations « personne », mais seulement 50 « vélo »), utilise l’option Log Scale de l’histogramme des classes pour visualiser clairement toutes les classes.

Fusionner des classes#

La fusion regroupe les étiquettes en double ou qui se chevauchent ; par exemple, fusionne car, automobile et vehicle dans une seule classe :

  1. Sélectionne au moins deux classes à l’aide des cases à cocher des lignes
  2. Clique sur Merge into one dans l’en-tête du tableau, ou fais un clic droit sur la sélection
  3. Choisis laquelle des classes sélectionnées sera la cible dans laquelle les autres seront fusionnées
  4. Confirme

Chaque annotation appartenant aux classes sources est réaffectée à la classe cible, et les classes sources sont supprimées. Aucune annotation n’est supprimée ; le nombre total d’annotations du jeu de données reste donc inchangé.

Supprimer des classes#

  1. Sélectionne une ou plusieurs classes à l’aide des cases à cocher des lignes
  2. Clique sur Delete dans l’en-tête du tableau, ou fais un clic droit sur la sélection
  3. Confirme

La suppression d’une classe supprime la classe et toutes ses annotations. Pour les jeux de données de classification, les étiquettes sont supprimées, mais les images sont conservées et deviennent non annotées.

Les indices de classe changent

Les identifiants de classe sont positionnels. La fusion ou la suppression d’une classe décale tous les indices de classe supérieurs d’une position pour combler l’écart ; les exports et fichiers d’annotations créés avant cette modification ne correspondent donc plus aux nouveaux indices. Crée d’abord une version si tu as besoin de conserver l’ancienne numérotation.

Échantillonnage des statistiques

Le nombre de classes est calculé sur un maximum de 100 000 images. Pour les jeux de données plus volumineux, une note au-dessus de l’histogramme indique « Basé sur un sous-ensemble de 100 000 images de ce jeu de données. »

Onglet Graphiques#

Cet onglet s’affiche lorsque le jeu de données contient des images.

Statistiques calculées automatiquement à partir de ton jeu de données :

Les graphiques apparaissent dans cet ordre, et chacun est omis si le jeu de données ne contient aucune donnée correspondante : un jeu de données d’images brutes n’affiche aucun graphique d’annotations, et Points per Instance n’apparaît que pour les données de segmentation et de pose :

GraphiqueDescription
Répartition des ensemblesDiagramme en anneau du nombre d’images d’entraînement, de validation et de test, ainsi que du pourcentage d’images annotées
Principales classesDiagramme en anneau des 10 classes d’annotations les plus fréquentes, les autres étant regroupées sous « Autres »
Dimensions des imagesHistogramme superposé de la répartition de la largeur et de la hauteur des images, avec la moyenne
Taille des fichiers imageHistogramme de la répartition de la taille des fichiers image
Dimensions des images en 2DCarte thermique 2D de la largeur en fonction de la hauteur, avec des lignes de référence du rapport hauteur/largeur
Emplacements des annotationsCarte thermique 2D des positions centrales des boîtes englobantes
Formats d’imageRépartition des formats des images sources (JPG, PNG, etc.)
Dimensions des boîtes englobantesHistogramme superposé de la largeur et de la hauteur des boîtes englobantes
Objets par imageHistogramme du nombre d’annotations par image
Points par instanceNombre de sommets de polygone ou de points clés par annotation (segmentation/pose)

Grille des statistiques de l’onglet Graphiques des jeux de données Ultralytics Platform

Mise en cache des statistiques

La Platform met en cache les statistiques calculées et les invalide lorsque les images, les annotations, les classes ou les ensembles changent. Pour les jeux de données de plus de 100 000 images, les graphiques sont calculés à partir d’un sous-ensemble de 100 000 images, comme indiqué au-dessus de la grille.

Cartes thermiques en plein écran

Clique sur le bouton d’agrandissement d’une carte thermique pour l’afficher en plein écran. Tu obtiens ainsi une vue plus grande et plus détaillée, utile pour comprendre les motifs spatiaux dans les grands jeux de données.

Onglet Modèles#

Consulte tous les modèles entraînés sur ce jeu de données dans un tableau consultable :

ColonneDescription
ModèleProjet parent et nom du modèle, avec des liens
VersionVersion immuable du jeu de données utilisée pour l’entraînement, affichée lorsqu’un modèle répertorié en utilise une
StatutBadge d’état de l’entraînement
TâcheType de tâche YOLO
ÉpoquesMeilleure époque / nombre total d’époques
MétriquesDeux métriques principales pour chaque tâche du tableau, telles que mAP50 et mAP50-95 pour la détection, ou les précisions Top-1 et Top-5
Date de créationDate de création

Tableau des modèles entraînés de l’onglet Modèles des jeux de données Ultralytics Platform

Onglet Erreurs#

Cet onglet s’affiche uniquement lorsqu’un ou plusieurs fichiers ne sont pas traités correctement.

Les images dont le traitement a échoué sont répertoriées ici avec :

  • Bannière d’erreur : nombre total d’images dont le traitement a échoué et conseils
  • Tableau des erreurs : nom du fichier, description de l’erreur facile à comprendre, conseils de résolution et vignette d’aperçu
  • Les erreurs courantes comprennent les fichiers endommagés, les formats non pris en charge, les images trop petites (min. 28 px) et les modes colorimétriques non pris en charge

Échecs de traitement dans l’onglet Erreurs des jeux de données Ultralytics Platform

Erreurs de traitement courantes
ErreurCauseSolution
Impossible de lire le fichier imageFormat endommagé ou non pris en chargeRéexporte l’image depuis l’éditeur
Fichier incomplet ou endommagéLe fichier a été tronqué pendant le transfertTélécharge à nouveau le fichier d’origine
Format d’image non pris en chargeLa Platform ne peut pas décoder ce formatConvertis l’image au format JPG, PNG ou WebP
Erreur d’autorisation sur le fichierLe fichier est verrouillé ou protégé en lectureDéverrouille le fichier et téléverse-le à nouveau
Image trop petiteLa dimension minimale est inférieure à 28 pxUtilise des images sources de plus haute résolution
Mode colorimétrique non pris en chargeMode colorimétrique CMYK ou indexéConvertis l’image en mode RGB

Onglet Versions#

Crée des instantanés NDJSON immuables de ton jeu de données pour garantir la reproductibilité de l’entraînement. Chaque version enregistre le nombre d’images, de classes et d’annotations, ainsi que l’espace de stockage ajouté au moment de sa création.

ColonneDescription
VersionNuméro de version (v1, v2, ...)
DescriptionDescription fournie par l’utilisateur (modifiable)
ImagesNombre d’images au moment de l’instantané
ClassesNombre de classes au moment de l’instantané
AnnotationsNombre d’annotations au moment de l’instantané
TailleEspace de stockage ajouté par cette version
Date de créationDate de création de la version
ActionsComparer, télécharger ou restaurer

Pour créer une version :

  1. Ouvre l’onglet Versions
  2. Saisis éventuellement une description (par exemple, « 500 images d’entraînement ajoutées » ou « Classes mal étiquetées corrigées »)
  3. Clique sur Nouvelle version
  4. La nouvelle version apparaît dans le tableau. Si le jeu de données correspond à une version existante, par exemple juste après sa restauration, cette version est réutilisée et reçoit la nouvelle description si tu en as saisi une

Chaque version est numérotée séquentiellement (v1, v2, v3...) et est immuable : les versions ne peuvent être ni modifiées ni supprimées, mais leurs descriptions peuvent être changées. Utilise les actions de la ligne pour télécharger ou restaurer une version à tout moment.

Comparer les versions#

Clique sur l’icône de comparaison d’une version après v1 pour voir les changements depuis une version antérieure. Comparer les versions commence par la version précédente ; choisis-en une autre dans le menu De. Les puces regroupées sous Images, Annotations, Classes et Paramètres comptabilisent les images ajoutées, supprimées, modifiées et déplacées vers une autre partition, ainsi que les annotations ajoutées et supprimées ; elles indiquent également les classes ajoutées, supprimées ou renommées et les paramètres du jeu de données qui ont changé. Chaque image modifiée est répertoriée avec son badge. Sélectionne une image pour l’afficher Avant et Après, chaque côté présentant les étiquettes enregistrées dans cette version. Lorsque les métadonnées de l’image ont changé, Modifications des métadonnées répertorie chaque clé ajoutée, supprimée ou modifiée, avec sa valeur dans les deux versions. Lorsque les images, leurs métadonnées et les annotations sont identiques, la boîte de dialogue indique Aucune modification, ou Aucune modification des images si seules les définitions des classes ou les paramètres du jeu de données diffèrent.

Restaurer une version

La restauration remplace les images, les ensembles, les classes et les annotations actuels du jeu de données par ceux de l’instantané sélectionné. Cette opération est irréversible, sauf si tu enregistres d’abord l’état actuel dans une autre version. Le jeu de données est verrouillé avec l’état processing pendant sa reconstruction. Aucune donnée n’est téléversée à nouveau lors d’une restauration, qui est donc généralement rapide, même pour les grands jeux de données.

Enregistrer une version pendant l’entraînement

Active Enregistrer la version du jeu de données dans la boîte de dialogue d’entraînement dans le cloud pour associer un modèle au jeu de données exact utilisé pour l’entraînement. La Platform réutilise une version correspondante si le contenu du jeu de données n’a pas changé et n’en crée une nouvelle que s’il a changé.

Jeux de données à l’état prêt uniquement

La création et la restauration de versions sont disponibles une fois que le jeu de données a atteint l’état ready. Les versions ne sont pas disponibles pour les jeux de données cloud connectés ou sur site.

Quand créer des versions

Crée une version avant et après les changements majeurs apportés à ton jeu de données — ajout d’images, correction d’annotations ou rééquilibrage des partitions. Tu peux ainsi comparer les performances du modèle entre différents états du jeu de données.

Taille de la version

La taille affichée correspond au stockage de l’instantané compressé ajouté par la version : les enregistrements d’images (URL, partitions, annotations et métadonnées) et les paramètres du jeu de données, pas les pixels des images. Les données d’instantané inchangées depuis une version antérieure sont partagées et comptabilisées pour la version qui les a stockées en premier. Les données réelles des images sont stockées séparément et accessibles via des URL signées. Le stockage des instantanés est déduit du quota de stockage de ton espace de travail ; la création d’une version échoue donc si tu n’as plus de marge disponible. Ce n’est pas le cas lorsque tu réutilises une version correspondante.

Exporter un jeu de données#

Exporte ton jeu de données pour une utilisation hors ligne en téléchargeant un fichier NDJSON depuis l’en-tête du jeu de données ou l’onglet Versions.

Pour exporter :

  1. Clique sur le bouton Télécharger (icône de téléchargement) dans l’en-tête du jeu de données
  2. Télécharge directement l’instantané NDJSON actuel
  3. Utilise l’onglet Versions si tu veux un instantané numéroté immuable que tu pourras télécharger à nouveau plus tard

Export NDJSON des jeux de données sur Ultralytics Platform

Le format NDJSON stocke un objet JSON par ligne. La première ligne contient les métadonnées du jeu de données, suivies d’une ligne par image :

{"type": "dataset", "task": "detect", "name": "my-dataset", "description": "...", "bytes": 12345678, "url": "https://platform.ultralytics.com/...", "class_names": {"0": "person", "1": "car"}, "version": 1, "created_at": "2026-01-15T10:00:00Z", "updated_at": "2026-02-20T14:30:00Z"}
{"type": "image", "file": "img001.jpg", "url": "https://...", "width": 640, "height": 480, "split": "train", "metadata": {"location": {"site": "factory-1"}, "reviewed": true}, "annotations": {"boxes": [[0, 0.5, 0.5, 0.2, 0.3]]}}
{"type": "image", "file": "img002.jpg", "url": "https://...", "width": 1280, "height": 720, "split": "val"}

L’objet facultatif metadata au niveau de l’image est conservé lors de l’importation d’un fichier NDJSON dans Platform. Tu peux le consulter ou le modifier dans le panneau d’informations plein écran de l’image. Pour les téléversements d’archives par programmation, l’API d’ingestion des données des jeux de données accepte la table de correspondance de chemins équivalente imageMetadata.

Les jeux de données de pose comportent également un champ kpt_shape dans la ligne d’en-tête du jeu de données, déduit des annotations s’il n’est pas déjà défini.

Les exportations de profondeur déclarent "task": "depth" et "depth_scale": 1000 dans la ligne du jeu de données. Chaque ligne d’image comprend un depth.url pour son fichier PNG uint16 simple associé. Ultralytics télécharge simultanément les URL des images et des données de profondeur, et crée un fichier YAML d’entraînement avec la même échelle ; le fichier NDJSON peut donc être transmis directement à model.train(data=...).

URL signées

Les URL des images dans le fichier NDJSON exporté sont signées et valides pendant 7 jours. Platform réutilise une exportation en cache pendant 6 jours maximum si le jeu de données n’a pas changé ; un nouveau téléchargement conserve donc toujours au moins un jour de validité. Si tu as besoin de nouvelles URL plus tôt, modifie le jeu de données ou crée une nouvelle version.

Jeux de données sur site

L’exportation n’est pas disponible pour les jeux de données sur site, dont les octets des images ne parviennent jamais à Platform.

Consulte la documentation du format NDJSON d’Ultralytics pour obtenir la spécification complète.

Opérations sur les images#

Actions rapides#

Fais un clic droit sur une image en vue Grille ou Compacte, ou sur une seule ligne sélectionnée en vue Tableau, pour accéder aux actions rapides. Les actions disponibles dépendent de tes autorisations de modification et de la source du jeu de données :

ActionDescription
Déplacer vers une partitionRéaffecte l’image à la partition Train, Val ou Test
Rechercher des images similairesRecherche des images ressemblantes à ajouter dans les jeux de données publics, les tiens et ceux de ton équipe (voir Rechercher des images similaires)
Générer des images similairesCrée des variantes générées par l’IA, puis ajoute celles que tu conserves (voir Générer des images similaires)
Flouter les visagesFloute les visages détectés dans l’image (voir Flouter les visages)
Copier / CouperCopie ou coupe l’image pour la coller dans un autre jeu de données (voir Copier et déplacer des images)
CollerColle les images copiées ou coupées dans ce jeu de données ; cette option apparaît lorsque le presse-papiers contient des images provenant d’un autre jeu de données
TéléchargerTélécharge le fichier image d’origine
SupprimerSupprime l’image du jeu de données

Menu contextuel des cartes d’image des jeux de données sur Ultralytics Platform

Action individuelle ou groupée

Le menu contextuel de l’image agit sur l’image sur laquelle tu as cliqué, sauf Coller, qui ajoute les images du presse-papiers. Pour effectuer des opérations groupées sur plusieurs images, utilise la vue Tableau et coche les cases correspondantes.

Déplacer plusieurs images vers une partition#

Réaffecte les images sélectionnées à une autre partition du même jeu de données :

  1. Passe en vue Tableau
  2. Sélectionne les images à l’aide des cases à cocher
  3. Fais un clic droit pour ouvrir le menu contextuel
  4. Choisis Move to split > Train, Validation ou Test

Tu peux aussi faire glisser des images vers les onglets de filtre des partitions en vue Grille. Si le déplacement d’une image crée un doublon avec une image identique déjà présente dans la partition cible, Platform te demande si tu veux ignorer l’image, conserver les deux ou la remplacer.

Organiser les partitions Train/Val

Téléverse toutes les images dans un seul jeu de données, puis utilise le déplacement groupé vers une partition pour organiser les sous-ensembles en partitions d’entraînement, de validation et de test.

Redistribution des partitions#

Redistribue toutes les images entre les partitions d’entraînement, de validation et de test à l’aide de proportions personnalisées :

  1. Clique sur la barre des partitions dans la barre d’outils du jeu de données pour ouvrir la boîte de dialogue Redistribuer les partitions
  2. Ajuste les pourcentages des partitions à l’aide de l’une des méthodes ci-dessous
  3. Vérifie l’aperçu actualisé du nombre d’images pour confirmer la répartition
  4. Clique sur Appliquer pour réaffecter aléatoirement toutes les images selon tes pourcentages

Boîte de dialogue de redistribution des partitions des jeux de données sur Ultralytics Platform

La boîte de dialogue propose trois façons de définir les proportions des partitions cibles :

MéthodeDescription
Faire glisserFais glisser les poignées entre les segments colorés pour ajuster visuellement les limites des partitions
SaisirModifie le pourcentage d’une partition (les deux autres partitions se rééquilibrent automatiquement de façon proportionnelle)
AutomatiqueEn un clic, définis instantanément une répartition 80/20 entre entraînement et validation, avec une partition de test à 0 %

Un aperçu actualisé indique précisément le nombre d’images qui seront affectées à chaque partition avant l’application.

Répartition rapide 80/20

Clique sur le bouton Automatique pour définir instantanément la répartition recommandée 80/20 entre entraînement et validation. C’est la proportion la plus courante pour l’entraînement.

Suppression groupée#

Supprime plusieurs images à la fois :

  1. Sélectionne des images dans la vue Tableau
  2. Fais un clic droit et choisis Delete, ou appuie sur Cmd/Ctrl+Delete
  3. Confirme la suppression

Copier et déplacer des images#

Copie ou déplace des images d’un jeu de données que tu peux modifier vers un autre, y compris un jeu de données situé dans un autre espace de travail :

  1. Dans le jeu de données source, fais un clic droit sur une image en vue Grille ou Compacte et choisis Copier ou Couper, ou sélectionne des images en vue Tableau et appuie sur Cmd/Ctrl+C ou Cmd/Ctrl+X. Esc vide le presse-papiers.
  2. Ouvre le jeu de données de destination, fais un clic droit sur une image et choisis Coller, ou appuie sur Cmd/Ctrl+V.

Les images collées conservent leurs étiquettes et leurs partitions ; les images déjà présentes dans la destination et dans la même partition sont ignorées. Couper supprime les images collées du jeu de données source ; Copier ne le modifie pas. Le jeu de données source et celui de destination doivent avoir la même tâche et des canaux d’image, des paramètres de points clés de pose et une échelle de profondeur compatibles, même si les images copiées ne comportent pas d’étiquettes. Une destination vide peut hériter des paramètres de canaux d’image et de pose non définis. Les images ne peuvent pas être collées dans un jeu de données connecté.

Les classes sont mises en correspondance par nom, sans tenir compte de la casse sauf pour les noms d’un ou deux caractères, et une destination sans classes reprend la liste de classes de la source. Lorsqu’une image collée utilise une classe absente de la destination, la boîte de dialogue Mapper les classes te demande d’associer chaque classe concernée à une classe du jeu de données ou à une nouvelle classe, ou de décocher sa case Inclure pour ignorer les étiquettes de cette classe ; les images sont collées dans tous les cas.

Générer des images similaires#

Crée de nouvelles images d’entraînement à partir d’une image que tu possèdes déjà. Dans un jeu de données que tu peux modifier, fais un clic droit sur une image en vue Grille ou Compacte (ou sur une seule ligne sélectionnée en vue Tableau) et choisis Générer des images similaires. Platform décrit de nouvelles scènes inspirées de l’image et génère une image pour chacune d’elles ; les résultats reprennent donc les sujets et le style de la source sans la copier.

ParamètreDescription
ModèleUltralytics Image 4B (par défaut) est le plus rapide ; Ultralytics Image 6B a un style différent et prend plus de temps
Nombre d’imagesNombre de variantes à créer, de 1 à 16 (par défaut 4)
Taille de l'imageLongueur du plus grand côté, de 256 à 2048 px, par incréments de 64 (par défaut 1024)
InstructionsDescription facultative des éléments à modifier ou à conserver, comme l’éclairage, le point de vue, l’arrière-plan ou les objets

Boîte de dialogue de génération d’images similaires des jeux de données sur Ultralytics Platform

Ultralytics Image 9B et Krea 2 Turbo sont également répertoriés, mais tu ne peux les sélectionner qu’après avoir activé l’Accès anticipé. Krea 2 Turbo est l’option la plus lente. Les proportions de la source sont conservées lorsque cette option est prise en charge. Les images très étroites peuvent nécessiter une dimension maximale plus grande, et les dimensions de sortie sont arrondies et limitées aux tailles prises en charge par le générateur.

Clique sur Générer, ou appuie sur ⌘/Ctrl+Entrée dans Instructions. Les images apparaissent dès qu’elles sont prêtes et sont toutes sélectionnées ; Arrêter met fin à un lot en cours tout en conservant les images déjà obtenues. Pour essayer d’autres instructions ou paramètres, modifie-les et clique sur Générer plus : chaque nouveau lot apparaît au-dessus des précédents, dont la sélection est conservée. Clique sur une image pour l’afficher en taille réelle, décoche celles que tu ne veux pas, puis clique sur Ajouter N au jeu de données. Les images conservées sont téléversées au format JPEG, portent le nom de l’image source, ne comportent pas d’étiquettes, sont comptabilisées dans ton stockage et sont prêtes pour l’annotation. Elles utilisent le filtre de partition actif : sélectionne Train avant la génération pour les ajouter à train. Si Tout est sélectionné, l’affectation normale des partitions lors du téléversement s’applique, y compris la répartition automatique vers la validation lorsque nécessaire. Annuler supprime les aperçus sans les ajouter. Les images générées suivent le paramètre de floutage des visages lors du téléversement du jeu de données. Cette action n’est pas disponible pour les jeux de données connectés.

Flouter les visages#

Dans un jeu de données que tu peux modifier, floute les visages de ses images, par exemple pour protéger la vie privée des personnes figurant dans tes données. Le floutage des visages n’est pas disponible pour les jeux de données connectés ni pour les jeux de données comportant plus de trois canaux d’image.

  • Une image : fais un clic droit sur l’image en vue Grille ou Compacte (ou sur une seule ligne sélectionnée en vue Tableau), ou fais un clic droit sur une annotation dans le lecteur plein écran, puis choisis Flouter les visages.
  • Tout le jeu de données : ouvre Autres actions (⋯) sur la page du jeu de données, puis choisis Flouter les visages.

La boîte de dialogue affiche d’abord un aperçu des visages détectés dans six images maximum (ou dans l’image sélectionnée), sans les modifier. Ajuste Confiance (par défaut 0.25) et Échelle de la boîte (0.5–1.5, par défaut 1, qui redimensionne la boîte de chaque visage autour de son centre) pour relancer l’aperçu, puis clique sur Appliquer afin de remplacer les pixels d’origine de chaque image où des visages sont détectés. Les images sans visage détecté restent inchangées, les étiquettes et les partitions sont conservées, et certains visages peuvent ne pas être détectés ; vérifie donc le résultat. Le floutage ne crée pas automatiquement d’instantané de version. Le floutage d’un jeu de données entier coûte 1,00 $ par tranche de 1 000 images traitées, avec un minimum de 0,01 $ par exécution (facturé comme Annotation automatique) ; la boîte de dialogue affiche l’estimation avant l’application. Les aperçus et le floutage d’une seule image sont gratuits.

Aperçu de la boîte de dialogue de floutage des visages des jeux de données sur Ultralytics Platform

Pour flouter les visages des images au fur et à mesure de leur téléversement, active Flouter les visages lorsque tu crées un jeu de données à partir d’un Téléversement ou d’une URL, ou active Flouter les futurs téléversements dans la boîte de dialogue Flouter les visages pour tout le jeu de données. Le réglage Flouter les futurs téléversements est enregistré immédiatement, même si tu fermes la boîte de dialogue sans cliquer sur Appliquer. Les images téléversées ensuite dans le jeu de données sont floutées pendant le traitement, sans frais ; la modification de ce paramètre ne floute pas les images déjà présentes dans le jeu de données.

URI du jeu de données#

Fais référence aux jeux de données Platform à l’aide du format d’URI ul:// (voir Utiliser les jeux de données Platform) :

ul://username/datasets/dataset-slug

Tu peux aussi coller directement l’URL Web d’un jeu de données ou d’un modèle (par exemple https://platform.ultralytics.com/username/datasets/dataset-slug) ; elle est automatiquement convertie en URI ul://. Fournir une liste de jeux de données permet d’affiner un modèle de base sur chacun d’eux, successivement, par exemple model.train(data=["ul://username/datasets/a", "ul://username/datasets/b"]).

Utilise cet URI pour entraîner des modèles depuis n’importe où :

export ULTRALYTICS_API_KEY="YOUR_API_KEY"
yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100
Entraîne-toi n’importe où avec les données de la plateforme

L’URI ul:// fonctionne depuis n’importe quel environnement :

  • Machine locale : entraîne-toi sur ton matériel, les données sont téléchargées automatiquement
  • Google Colab : accède aux jeux de données de ta plateforme dans des notebooks
  • Serveurs distants : entraîne-toi sur des machines virtuelles cloud avec un accès complet aux jeux de données

Licences disponibles#

La plateforme prend en charge les licences suivantes pour les jeux de données :

LicenceType
AucunAucune licence sélectionnée
CC0-1.0Domaine public
PDM-1.0Domaine public
CC-BY-2.5Permissive
CC-BY-3.0Permissive
CC-BY-4.0Permissive
CC-BY-NC-2.0Usage non commercial
CC-BY-NC-3.0Usage non commercial
CC-BY-NC-4.0Usage non commercial
CC-BY-SA-3.0Copyleft
CC-BY-SA-4.0Copyleft
CC-BY-NC-SA-3.0Copyleft
CC-BY-NC-SA-4.0Copyleft
CC-BY-ND-4.0Pas de travaux dérivés
CC-BY-NC-ND-2.0Usage non commercial
CC-BY-NC-ND-4.0Usage non commercial
Apache-2.0Permissive
MITPermissive
BSD-3-ClausePermissive
AGPL-3.0Copyleft
GPL-2.0Copyleft
GPL-3.0Copyleft
LGPL-3.0Copyleft
ODbL-1.0Copyleft
DbCL-1.0ODbL requise
Recherche uniquementRestreinte
AutrePersonnalisée
Licences copyleft

Lorsque tu clones un jeu de données sous une licence copyleft (AGPL-3.0, GPL-2.0, GPL-3.0, LGPL-3.0, ODbL-1.0, CC-BY-SA-3.0, CC-BY-SA-4.0, CC-BY-NC-SA-3.0, CC-BY-NC-SA-4.0), le clone hérite de la licence et le sélecteur de licence est verrouillé.

Paramètres de visibilité#

Contrôle qui peut voir ton jeu de données :

ParamètreDescription
PrivéToi et les membres autorisés de l’espace de travail pouvez y accéder
PublicTout le monde peut le consulter, y compris depuis la page Explore

La visibilité est définie lors de la création d’un jeu de données dans la boîte de dialogue New Dataset, à l’aide d’un interrupteur. Pour la modifier ultérieurement, clique sur le badge Public ou Privé à côté du nom du jeu de données dans le fil d’Ariane de la page ; le passage d’un jeu de données au mode public demande une confirmation. Les jeux de données On Premise sont toujours privés. Les jeux de données publics sont visibles sur la page Explore.

Modifier le jeu de données#

Les métadonnées du jeu de données se modifient directement sur sa page, sans boîte de dialogue :

  • Nom : clique sur le nom du jeu de données pour le modifier. Les modifications sont enregistrées automatiquement lorsque le champ perd le focus ou avec Enter. Le nom ne peut pas dépasser 100 caractères.
  • Description : clique sur la description (ou sur l’espace réservé « Ajouter une description... ») pour la modifier. Les modifications sont enregistrées automatiquement. La description ne peut pas dépasser 1 000 caractères.
  • Type de tâche : clique sur le badge de la tâche pour sélectionner un autre type de tâche.
  • Licence : clique sur le sélecteur de licence pour modifier la licence du jeu de données.
  • Icône : clique sur l’icône du jeu de données pour importer ta propre image, utiliser l’une des images du jeu de données comme icône, ou choisir une lettre et une couleur.
Modifier le type de tâche

Chaque image stocke les annotations de tous les types de tâche. Le type de tâche du jeu de données détermine les annotations visibles dans l’éditeur et celles incluses dans les exports et l’entraînement. Les annotations des autres types de tâche sont conservées dans la base de données et réapparaissent lorsque tu reviens à ces types. Depth fait exception : la vérité terrain correspond à un fichier associé plutôt qu’à une annotation. Un jeu de données ne peut donc passer au type depth ou en sortir que s’il ne contient aucune image — importe-le à nouveau à la place.

Métadonnées personnalisées#

Ouvre Plus d’actions et sélectionne Informations pour consulter deux sections :

  • Métadonnées Ultralytics : informations en lecture seule sur la plateforme, telles que l’ID du jeu de données, le propriétaire, la tâche, le nombre d’images et d’annotations, la région de stockage et les horodatages
  • Métadonnées personnalisées : ton propre objet JSON pour la provenance, les conditions de capture, les ID client, la gouvernance ou d’autres données contextuelles

Les personnes qui consultent l’espace de travail peuvent examiner les métadonnées, tandis que les membres autorisés à modifier le contenu peuvent remplacer l’objet de métadonnées personnalisées. L’objet de métadonnées sérialisé est limité à 500 000 caractères, et chaque clé de premier niveau est limitée à 128 caractères. Enregistre un objet vide ({}) pour effacer les métadonnées personnalisées.

Cloner le jeu de données#

Lorsque tu consultes un jeu de données public dont tu n’es pas propriétaire, clique sur Clone Dataset pour ouvrir la boîte de dialogue de clonage. Vérifie l’espace de travail de destination, le nom, la visibilité et la licence, puis confirme le clonage. La copie comprend toutes les images, les annotations et les définitions de classes. Par défaut, les jeux de données sources publics restent publics dans les espaces de travail dont la visibilité par défaut est publique ; les clones dans les espaces de travail Enterprise sont privés par défaut. Si le jeu de données d’origine a une licence copyleft, le clone en hérite et le sélecteur de licence est verrouillé.

La boîte de dialogue de clonage désactive Cloner le jeu de données si l’URL est déjà utilisée dans l’espace de travail cible. Le clonage nécessite également un quota de stockage restant suffisant pour accueillir la copie.

Jeux de données connectés

Les jeux de données associés à des sources de stockage cloud ou On Premise ne peuvent pas être clonés, car la plateforme ne stocke pas leurs données d’image.

Ajouter aux favoris et partager#

  • Ajouter aux favoris : clique sur l’étoile pour ajouter un jeu de données à tes favoris. Le nombre d’étoiles est visible par tous les utilisateurs.
  • Partager : pour les jeux de données publics, clique sur le bouton de partage pour copier un lien, récupérer un extrait d’intégration ou partager sur les réseaux sociaux.

Supprimer le jeu de données#

Supprime un jeu de données dont tu n’as plus besoin :

  1. Ouvre Plus d’actions (le bouton …) dans l’en-tête du jeu de données
  2. Choisis Supprimer le jeu de données
  3. Confirme dans la boîte de dialogue : « \[name] sera déplacé dans la corbeille. Tu peux le restaurer dans les 30 jours. »

Le même menu contient Informations, qui ouvre la boîte de dialogue des métadonnées décrite dans Métadonnées personnalisées, et Actualiser, qui relit le jeu de données depuis le serveur.

Corbeille et restauration

Les jeux de données supprimés sont déplacés dans la corbeille — ils ne sont pas supprimés définitivement. Tu peux les restaurer dans les 30 jours depuis Settings > Trash.

Entraîner sur un jeu de données#

Lance l’entraînement directement depuis ton jeu de données :

  1. Clique sur New Model sur la page du jeu de données
  2. Sélectionne un projet ou crée-en un
  3. Configure les paramètres d’entraînement
  4. Lance l’entraînement

Consulte Entraînement dans le cloud pour en savoir plus.

FAQ#

  • Tes données sont traitées et stockées dans la région sélectionnée (US, EU ou AP). Les images sont :

    1. Validées pour vérifier leur format et leur taille
    2. Rejetées si leur dimension minimale est inférieure à 28px
    3. Normalisées si elles dépassent 4096px (en préservant le rapport hauteur/largeur ; encodées pour optimiser le stockage ; les fichiers TIFF sont stockés tels qu’importés)
    4. Stockées avec déduplication, de sorte que les images identiques ne sont conservées qu’une seule fois
    5. Vignettes générées au format WebP de 256px pour accélérer la navigation
  • Ultralytics Platform gère efficacement le stockage :

    • Déduplication : les images identiques dans une même région de données ne sont stockées qu’une seule fois
    • Intégrité : l’intégrité des données est vérifiée lors des téléversements
    • Efficacité : les clones réutilisent les images stockées au lieu de les copier, tout en étant comptabilisés dans le quota de stockage de l’espace de travail de destination
    • Régional : les données restent dans la région sélectionnée (US, EU ou AP)
  • Oui. Fais glisser les fichiers dans la galerie du jeu de données ou clique sur l’icône de téléversement dans l’en-tête de la page : le sélecteur de fichiers natif de ton navigateur s’ouvre directement. Les nouvelles statistiques sont calculées automatiquement après le traitement.

  • Oui. Copie ou coupe des images dans un jeu de données, puis colle-les dans un autre jeu de données que tu peux modifier ; elles conservent leurs étiquettes et leurs répartitions, et Couper les supprime de la source. Les classes sont associées par nom, et la boîte de dialogue Associer les classes gère celles qui n’existent pas dans la destination. Consulte Copier et déplacer des images.

  • La plateforme exporte les jeux de données au format NDJSON, et non sous forme de dossiers YOLO. Tu n’as généralement pas besoin de le convertir : transmets directement le fichier NDJSON, ou l’URI du jeu de données ul:// URI, à model.train(data=...), et Ultralytics télécharge les images et crée les dossiers YOLO pour toi. Pour obtenir les dossiers sans lancer d’entraînement, convertis le fichier localement :

    import asyncio
    
    from ultralytics.data.converter import convert_ndjson_to_yolo
    
    yaml_path = asyncio.run(convert_ndjson_to_yolo("my-dataset.ndjson", output_path="datasets"))

    Les liens vers les images d'un export expirent 7 jours après sa génération, et un export mis en cache peut n'avoir plus qu'un jour de validité ; convertis-le donc rapidement. Les jeux de données sur site ne peuvent pas être exportés.

  • C'est ton téléversement qui détermine la répartition. Lorsque le filtre Toutes est sélectionné, les images placées dans les dossiers train/, val/ ou test/ conservent cette répartition. Si tu sélectionnes Entraînement, Validation ou Test avant le téléversement, chaque nouvelle image sera affectée à cette répartition. Si un téléversement effectué sans sélection de répartition laisse val vide, la plateforme déplace environ 20 % des images d'entraînement (au moins une) vers val. Les jeux de données de classification utilisent plutôt leur structure de dossiers, et les jeux de données de profondeur suivent des règles distinctes pour les cartes de profondeur appariées. Vérifie le badge Ready du jeu de données avant l'entraînement.

    Pour modifier la répartition par la suite :

    • Modifier les proportions : clique sur la barre de répartition dans la barre d'outils du jeu de données et définis les pourcentages, ou clique sur Automatique pour obtenir une répartition 80/20 entre entraînement et validation. Consulte Redistribution des répartitions.
    • Déplacer des images spécifiques : sélectionne-les dans la vue Tableau, fais un clic droit, puis choisis Move to split. Consulte Déplacement groupé vers une répartition.
  • Vérifie le paramètre de visibilité avant de créer un jeu de données : les nouveaux jeux de données sont publics par défaut avec les offres Gratuit et Pro, et privés avec l'offre Entreprise. Un jeu de données public peut être consulté par tout le monde, y compris par les personnes qui ne sont pas connectées, et apparaît dans Explorer. Un jeu de données privé n'est visible que par toi et les membres autorisés de l'espace de travail. Les membres disposant d'un accès en modification peuvent changer la visibilité depuis le badge situé à côté du nom du jeu de données, et les jeux de données sur site sont toujours privés. Rendre un jeu de données privé ne supprime pas les copies déjà clonées par d'autres utilisateurs. Consulte Paramètres de visibilité.

  • Ultralytics Platform prend en charge les étiquettes YOLO, le format JSON COCO, le format JSON LabelMe, les formats NDJSON Ultralytics et Labelbox, les masques PNG sémantiques et les cartes de profondeur, ainsi que le téléversement d’images brutes. Les étiquettes XML Pascal VOC sont détectées, mais ne sont pas importées :

    Un fichier .txt par image, avec des coordonnées normalisées (plage de 0 à 1) :

    TâcheFormatExemple
    Détectionclass cx cy w h0 0.5 0.5 0.2 0.3
    Segmentationclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Sémantiqueclass x1 y1 x2 y2 ...0 0.1 0.1 0.9 0.1 0.9 0.9
    Poseclass cx cy w h kx1 ky1 v1 ...0 0.5 0.5 0.2 0.3 0.6 0.7 2
    OBBclass x1 y1 x2 y2 x3 y3 x4 y40 0.1 0.1 0.9 0.1 0.9 0.9 0.1 0.9
    ClassificationStructure des répertoirestrain/cats/, train/dogs/

    Indicateurs de visibilité des poses : 0=non étiqueté, 1=étiqueté mais occulté, 2=étiqueté et visible. Les jeux de données sémantiques acceptent également les masques PNG au lieu des fichiers polygonaux (voir Masques sémantiques).

  • Oui. Chaque image stocke ensemble les annotations des 6 types de tâches d’annotation (détection, segmentation, sémantique, classification, pose, OBB). Tu peux changer le type de tâche actif du jeu de données à tout moment sans perdre les annotations existantes. Seules les annotations correspondant au type de tâche actif sont affichées dans l’éditeur et incluses dans les exportations et l’entraînement ; les annotations des autres tâches sont conservées et réapparaissent lorsque tu reviens à leur type de tâche.

  • Oui :

    LimiteValeur
    Classes par jeu de données25,000
    Annotations par image10,000
    Coordonnées par annotation10,000
    Nom du jeu de données100 caractères
    Description du jeu de données1 000 caractères
    Métadonnées personnalisées500 000 caractères sérialisés
    Clé de premier niveau des métadonnées128 caractères
  • Les jeux de données qui lisent les données depuis des sources de stockage cloud ou sur site conservent leurs pixels en dehors de Platform. Les fonctionnalités qui nécessitent des copies des données d’image détenues par Platform ne sont donc pas disponibles :

    FonctionnalitéConnecté au cloudSur site
    Annotation intelligente et par lotsIndisponibleIndisponible
    Analyse de regroupementIndisponibleIndisponible
    ClonageIndisponibleIndisponible
    Instantanés de versionIndisponibleIndisponible
    Exportation NDJSONDisponibleIndisponible
    Importation de masques PNG sémantiquesIndisponibleDisponible
    Flouter les visagesIndisponibleIndisponible
    Rechercher des images similairesIndisponibleIndisponible
    Générer des images similairesIndisponibleIndisponible
    Collage d’images dans le jeu de donnéesIndisponibleIndisponible

    La navigation, l’annotation manuelle, la gestion des classes, les répartitions, les statistiques et l’entraînement fonctionnent normalement.

Commentaires