Préparation des données#
La préparation des données est la base de modèles de vision par ordinateur performants. Ultralytics Platform fournit des outils complets pour gérer tes données d’entraînement, du téléversement à l’annotation et à l’analyse.
Watch: Get Started with Ultralytics Platform - Data
Présentation#
La section Données d’Ultralytics Platform t’aide à :
- Téléverser des images, des vidéos et des fichiers de dataset (ZIP, TAR incluant
.tar.gz/.tgz, NDJSON) - Importer depuis une URL en collant un lien direct vers une archive ou une exportation NDJSON, ou depuis Roboflow
- Connecter Google Cloud Storage, Amazon S3 ou Azure Blob Storage, puis utiliser tes données sur place sans téléverser de copie
- Conserver les pixels sur site avec des workers CPU/GPU Enterprise sur site
- Annote avec des outils de dessin manuel et un étiquetage intelligent alimenté par SAM — choisis entre SAM 2.1, SAM 3 ou le SAM 3.1 par défaut
- Gérer les classes en les renommant, en modifiant leur couleur, en les fusionnant et en les supprimant dans tout le dataset
- Analyser tes données avec des statistiques, des visualisations et un clustering basé sur les embeddings
- Exporter au format NDJSON pour l’entraînement local

Flux de travail#
graph LR
A[Upload]:::start --> B[Annotate]:::proc
B --> D[Train]:::out
B --> C[Analyze]:::proc
classDef start fill:#4CAF50,color:#fff
classDef proc fill:#2196F3,color:#fff
classDef out fill:#9C27B0,color:#fff| Étape | Description |
|---|---|
| Importer | Importer des images, des vidéos ou des archives avec un traitement automatique |
| Annoter | Étiqueter les données avec des outils manuels ou utiliser l’annotation SAM pour la détection, la segmentation, la segmentation sémantique et l’OBB |
| Analyser | Afficher la distribution des classes, les cartes thermiques spatiales, les statistiques de dimensions et les clusters d’embeddings |
| Exporter | Télécharger au format NDJSON pour une utilisation hors ligne |
Tâches prises en charge#
Les datasets d’Ultralytics Platform prennent en charge les 7 types de tâches YOLO :
| Tâche | Description | Outil d’annotation |
|---|---|---|
| Détection | Détection d’objets avec des boîtes englobantes | Outil rectangle |
| Segmentation | Segmentation d’instances avec des masques de pixels | Outil polygone |
| Sémantique | Segmentation sémantique avec des régions de pixels par classe | Outil polygone |
| Profondeur | Cartes de profondeur métrique par pixel | Cibles importées |
| Classification | Classification au niveau de l’image | Sélecteur de classe |
| Pose | Estimation des points clés avec des modèles de squelette intégrés et personnalisés | Outil de points clés |
| OBB | Boîtes englobantes orientées pour les objets pivotés | Outil de boîte orientée |
Le type de tâche est défini lors de la création d’un dataset et détermine les outils d’annotation disponibles. Tu peux le modifier ultérieurement depuis le sélecteur de tâche dans l’en-tête du dataset, mais les annotations incompatibles ne seront plus affichées après le changement. Le passage vers ou depuis la profondeur n’est autorisé que lorsque le dataset est vide — voir Modifier le dataset.
Fonctionnalités clés#
Stockage intelligent#
Ultralytics Platform gère efficacement le stockage :
- Déduplication : les images identiques dans une même région de données ne sont stockées qu'une seule fois
- Intégrité : l'intégrité des données des importations est vérifiée
- Efficacité : stockage optimisé et traitement rapide
URI des datasets#
Référence aux datasets avec le format d’URI ul:// (voir Utiliser les datasets de Platform) :
yolo train data=ul://username/datasets/my-datasetCela permet d’entraîner sur les datasets de la plateforme depuis n’importe quelle machine où ta clé API est configurée.
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)Gestion des versions des datasets#
Crée des instantanés NDJSON immuables de ton dataset pour un entraînement reproductible. Chaque version capture le nombre d’images, de classes et d’annotations au moment de sa création. Consulte l’onglet Versions pour plus de détails.
Onglets du jeu de données#
Les pages des datasets peuvent afficher jusqu’à six onglets, selon l’état du dataset et tes autorisations :
| Onglet | Description |
|---|---|
| Images | Parcourir les images en vue grille, compacte ou tableau avec des superpositions d’annotations |
| Classes | Afficher, renommer, recolorer, fusionner et supprimer les classes avec le nombre d’étiquettes par classe |
| Graphiques | Statistiques automatiques : distribution des splits, nombre de classes, cartes thermiques |
| Modèles | Modèles entraînés sur ce dataset avec leurs métriques et leur état |
| Versions | Créer, télécharger et restaurer des instantanés NDJSON immuables pour assurer la reproductibilité |
| Erreurs | Images dont le traitement a échoué, avec les détails de l’erreur et des conseils de correction |
Classes apparaît lorsque le dataset contient des images et que sa tâche possède des classes, tandis que Charts apparaît dès qu’il contient des images. Errors apparaît uniquement lorsque des échecs de traitement existent. Versions apparaît lorsque tu disposes d’un accès en modification, ou en mode lecture seule lorsque des versions existent déjà.
Clustering#
Explore ton jeu de données sous forme de nuage de points 2D interactif où les images visuellement similaires sont regroupées — utile pour mettre en évidence les clusters, les doublons et les valeurs aberrantes, et pour inspecter la répartition des divisions ou des classes dans tes données. Entoure une région du graphique au lasso pour filtrer la galerie sur ces images. L'analyse nécessite entre 20 et 200 000 images sans erreur. Les mêmes embeddings te permettent de trouver des images similaires dans des jeux de données publics et de les ajouter aux tiens. Consulte Clustering pour plus de détails.
Statistiques et visualisation#
L’onglet Charts fournit une analyse automatique comprenant :
- Distribution des splits : diagramme en anneau du nombre d’images d’entraînement, de validation et de test
- Principales classes : diagramme en anneau des 10 classes d’annotations les plus fréquentes
- Dimensions des images : histogramme de la distribution de la largeur et de la hauteur des images (en pixels)
- Dimensions des images en 2D : carte thermique 2D de la largeur par rapport à la hauteur avec des lignes guides du ratio d’aspect
- Emplacements des annotations : carte thermique 2D des positions centrales des boîtes englobantes
- Points par instance : distribution du nombre de sommets de polygone ou de points clés (datasets de segmentation/pose)
Consulte l’onglet Graphiques pour obtenir la liste complète.
Liens rapides#
- Datasets : téléverser, gérer et exporter tes données d’entraînement
- Annotation : étiqueter les données avec des outils manuels et assistés par IA
- Entraînement dans le cloud : entraîner des modèles sur tes datasets annotés
- URI de dataset : utiliser les URI
ul://pour entraîner depuis n’importe où
FAQ#
Ultralytics Platform prend en charge :
Images : JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (50 Mo maximum chacune)
Vidéos : MP4, WebM, MOV, MKV, M4V (1 Go maximum, images extraites à 1 FPS, 100 images maximum)
Fichiers de données : des archives ZIP ou TAR comprenant
.tar.gzet.tgz(maximum 10 Go sur Free, 20 Go sur Pro, 50 Go sur Enterprise) contenant des images avec des étiquettes optionnelles au format YOLO ou COCO JSON ou des masques PNG sémantiques, ainsi que des exportations NDJSONTous ces formats d’archives ou NDJSON peuvent également être importés en collant un lien HTTP(S) direct dans l’onglet
URLde la boîte de dialogueNew Dataset. Les étiquettes Pascal VOC XML sont détectées mais ne sont pas importées.Les limites de stockage dépendent de ton forfait :
Forfait Limite de stockage Free 100 GB Pro 500 GB Enterprise Illimité Limites par fichier : images 50 Mo, vidéos 1 Go, datasets 10 Go avec Free / 20 Go avec Pro / 50 Go avec Enterprise
Oui ! Utilise le format d’URI du dataset pour entraîner localement :
export ULTRALYTICS_API_KEY="YOUR_API_KEY" yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100Ou exporte ton jeu de données au format NDJSON pour transférer ses métadonnées, ses partitions, ses annotations et ses URL d’images signées.