Préparation des données#
La préparation des données est le fondement de modèles performants de vision par ordinateur. Ultralytics Platform fournit des outils complets pour gérer tes données d’entraînement, du téléversement à l’annotation, puis à l’analyse.
À regarder : Bien démarrer avec la plateforme Ultralytics - Données
Présentation#
La section Data d’Ultralytics Platform t’aide à :
- Téléverser des images, des vidéos et des fichiers de jeu de données (ZIP, TAR, y compris
.tar.gz/.tgz, NDJSON) - Importer depuis une URL en collant un lien direct vers une archive ou un export NDJSON, ou depuis Roboflow
- Connecter Google Cloud Storage, Amazon S3 ou Azure Blob Storage et utiliser tes données sur place, sans en téléverser une copie
- Garder les pixels sur site grâce aux workers CPU/GPU Enterprise On Premise
- Annoter à l’aide d’outils de dessin manuel et de l’annotation intelligente avec SAM (SAM 2.1, SAM 3 ou SAM 3.1, le modèle par défaut), des modèles YOLO ou des modèles guidés par des classes — modèles open source hébergés ou modèles payants de fournisseurs — sur des jeux de données de détection comportant de 1 à 200 classes
- Gérer les classes en les renommant, en changeant leur couleur, en les fusionnant et en les supprimant dans l’ensemble du jeu de données
- Enrichir les jeux de données avec Rechercher des images similaires ou Générer des images similaires, puis annoter les images que tu conserves
- Flouter les visages dans les images existantes ou les futurs téléversements
- Analyser tes données à l’aide de statistiques, de visualisations et d’un regroupement par clusters basé sur les embeddings
- Exporter au format NDJSON pour l’entraînement local

Flux de travail#
| Étape | Description |
|---|---|
| Téléverser | Importer des images, des vidéos ou des archives avec un traitement automatique |
| Annoter | Étiqueter les données avec des outils manuels ou utiliser l’annotation intelligente avec SAM (détection, segmentation, sémantique et OBB), YOLO ou des modèles guidés par des classes — modèles open source hébergés ou modèles payants de fournisseurs — sur des jeux de données de détection comportant de 1 à 200 classes |
| Analyser | Afficher les répartitions des classes, les cartes thermiques spatiales, les statistiques de dimensions et les clusters d’embeddings |
| Exporter | Télécharger au format NDJSON pour une utilisation hors ligne |
Tâches prises en charge#
Les jeux de données d’Ultralytics Platform prennent en charge les 7 types de tâches YOLO :
| Tâche | Description | Outil d’annotation |
|---|---|---|
| Détection | Détection d’objets avec des boîtes englobantes | Outil rectangle |
| Segmentation | Segmentation d’instances avec des masques de pixels | Outil polygone |
| Sémantique | Segmentation sémantique avec des régions de pixels par classe | Outil polygone |
| Profondeur | Cartes de profondeur métrique par pixel | Cibles importées |
| Classification | Classification au niveau de l’image | Sélecteur de classe |
| Pose | Estimation des points clés avec des modèles de squelette intégrés et personnalisés | Outil points clés |
| OBB | Boîtes englobantes orientées pour les objets inclinés | Outil boîte orientée |
Le type de tâche est défini lors de la création d’un jeu de données et détermine les outils d’annotation disponibles. Tu peux le modifier plus tard à l’aide du sélecteur de tâche dans l’en-tête du jeu de données, mais les annotations incompatibles ne seront plus affichées après le changement. Le passage à la profondeur ou depuis celle-ci n’est autorisé que si le jeu de données est vide — voir Modifier le jeu de données.
Fonctionnalités clés#
Stockage intelligent#
Ultralytics Platform gère efficacement le stockage :
- Déduplication : les images identiques dans une même région de données ne sont stockées qu’une seule fois
- Intégrité : l’intégrité des données est vérifiée lors des téléversements
- Efficacité : stockage optimisé et traitement rapide
URI des jeux de données#
Référence les jeux de données à l’aide du format d’URI ul:// (voir Utiliser les jeux de données Platform) :
yolo train model=yolo26n.pt data=ul://username/datasets/my-datasetCela permet d’entraîner des modèles sur les jeux de données de la plateforme depuis n’importe quelle machine où ta clé API est configurée.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)Versionnage des jeux de données#
Crée des instantanés NDJSON immuables de ton jeu de données pour assurer la reproductibilité de l’entraînement. Chaque version enregistre le nombre d’images, de classes et d’annotations au moment de sa création. Consulte l’onglet Versions pour en savoir plus.
Onglets des jeux de données#
Les pages des jeux de données peuvent afficher jusqu’à six onglets, selon l’état du jeu de données et tes autorisations :
| Onglet | Description |
|---|---|
| Images | Parcourir les images en vue grille, compacte ou tableau, avec les annotations superposées |
| Classes | Afficher, renommer, recolorer, fusionner et supprimer des classes, avec le nombre d’étiquettes par classe |
| Graphiques | Statistiques automatiques : répartition des partitions, nombre de classes, cartes thermiques |
| Modèles | Modèles entraînés sur ce jeu de données, avec leurs métriques et leur état |
| Versions | Créer, comparer, télécharger et restaurer des instantanés NDJSON immuables |
| Erreurs | Images dont le traitement a échoué, avec des détails sur les erreurs et des indications pour les corriger |
Classes apparaît lorsque le jeu de données contient des images et que sa tâche comporte des classes, tandis que Charts apparaît dès qu’il contient des images. Errors apparaît uniquement en cas d’échec du traitement. Versions apparaît lorsque tu as un accès en modification, ou en mode lecture seule si des versions existent déjà.
Regroupement en clusters#
Explore ton jeu de données sous forme de nuage de points interactif en 2D, où les images visuellement similaires sont proches les unes des autres — un outil utile pour repérer les clusters, les doublons et les valeurs aberrantes, ainsi que pour examiner la répartition des partitions ou des classes dans tes données. Sélectionne une zone au lasso ou clique sur un point pour filtrer la galerie et afficher ces images. L’analyse nécessite entre 20 et 200 000 images sans erreur. Les mêmes embeddings te permettent de trouver des images similaires dans les jeux de données publics, les tiens et ceux de ton équipe, puis de les ajouter au tien. Consulte Regroupement en clusters pour en savoir plus.
Statistiques et visualisation#
L’onglet Charts fournit une analyse automatique comprenant :
- Répartition des partitions : diagramme en anneau du nombre d’images train/val/test
- Principales classes : diagramme en anneau des 10 classes d’annotation les plus fréquentes
- Dimensions des images : histogramme de la répartition de la largeur et de la hauteur des images (en pixels)
- Dimensions des images en 2D : carte thermique 2D de la largeur en fonction de la hauteur, avec des lignes de repère du rapport hauteur/largeur
- Emplacements des annotations : carte thermique 2D des positions centrales des boîtes englobantes
- Points par instance : répartition du nombre de sommets de polygone ou de points clés (ensembles de données de segmentation/de pose)
Voir l’onglet Graphiques pour consulter la liste complète.
Liens rapides#
- Ensembles de données : importe, gère et exporte tes données d’entraînement
- Annotation : annote les données à l’aide d’outils manuels et assistés par l’IA
- Entraînement dans le cloud : entraîne des modèles sur tes ensembles de données annotés
- URI d’ensemble de données : utilise des URI
ul://pour entraîner depuis n’importe où
FAQ#
Ultralytics Platform accepte les formats suivants :
Images : JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (50 Mo max. chacune)
Vidéos : MP4, WebM, MOV, MKV, M4V (1 Go max., images extraites à 1 FPS, 100 images max.)
Fichiers d’ensemble de données : archives ZIP ou TAR contenant
.tar.gzet.tgz(10 Go max. avec l’offre Free, 20 Go avec l’offre Pro, 50 Go avec l’offre Enterprise), avec des images et, en option, des annotations au format YOLO, au format JSON COCO ou au format JSON LabelMe, des masques PNG sémantiques ou des cartes de profondeur, ainsi que des exports Ultralytics NDJSON ou Labelbox NDJSONTu peux aussi importer ces formats d’archive ou NDJSON en collant un lien HTTP(S) direct dans l’onglet
URLde la boîte de dialogueNew Dataset. Les annotations XML Pascal VOC sont détectées, mais ne sont pas importées.Les limites de stockage dépendent de ton offre :
Offre Limite de stockage Free 100 GB Pro 500 GB Enterprise Illimité Limites par fichier : images 50 Mo, vidéos 1 Go, ensembles de données 10 Go avec l’offre Free / 20 Go avec l’offre Pro / 50 Go avec l’offre Enterprise
Oui ! Utilise le format d’URI d’ensemble de données pour entraîner tes modèles en local :
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100Tu peux aussi exporter ton ensemble de données au format NDJSON pour transférer ses métadonnées, ses partitions, ses annotations et ses URL d’images signées.