Ultralytics YOLO27 :
Get Started

Préparation des données#

La préparation des données est le fondement de modèles performants de vision par ordinateur. Ultralytics Platform fournit des outils complets pour gérer tes données d’entraînement, du téléversement à l’annotation, puis à l’analyse.



À regarder : Bien démarrer avec la plateforme Ultralytics - Données

Présentation#

La section Data d’Ultralytics Platform t’aide à :

  • Téléverser des images, des vidéos et des fichiers de jeu de données (ZIP, TAR, y compris .tar.gz/.tgz, NDJSON)
  • Importer depuis une URL en collant un lien direct vers une archive ou un export NDJSON, ou depuis Roboflow
  • Connecter Google Cloud Storage, Amazon S3 ou Azure Blob Storage et utiliser tes données sur place, sans en téléverser une copie
  • Garder les pixels sur site grâce aux workers CPU/GPU Enterprise On Premise
  • Annoter à l’aide d’outils de dessin manuel et de l’annotation intelligente avec SAM (SAM 2.1, SAM 3 ou SAM 3.1, le modèle par défaut), des modèles YOLO ou des modèles guidés par des classes — modèles open source hébergés ou modèles payants de fournisseurs — sur des jeux de données de détection comportant de 1 à 200 classes
  • Gérer les classes en les renommant, en changeant leur couleur, en les fusionnant et en les supprimant dans l’ensemble du jeu de données
  • Enrichir les jeux de données avec Rechercher des images similaires ou Générer des images similaires, puis annoter les images que tu conserves
  • Flouter les visages dans les images existantes ou les futurs téléversements
  • Analyser tes données à l’aide de statistiques, de visualisations et d’un regroupement par clusters basé sur les embeddings
  • Exporter au format NDJSON pour l’entraînement local

Barre latérale Data Overview Datasets d’Ultralytics Platform

Flux de travail#

ÉtapeDescription
TéléverserImporter des images, des vidéos ou des archives avec un traitement automatique
AnnoterÉtiqueter les données avec des outils manuels ou utiliser l’annotation intelligente avec SAM (détection, segmentation, sémantique et OBB), YOLO ou des modèles guidés par des classes — modèles open source hébergés ou modèles payants de fournisseurs — sur des jeux de données de détection comportant de 1 à 200 classes
AnalyserAfficher les répartitions des classes, les cartes thermiques spatiales, les statistiques de dimensions et les clusters d’embeddings
ExporterTélécharger au format NDJSON pour une utilisation hors ligne

Tâches prises en charge#

Les jeux de données d’Ultralytics Platform prennent en charge les 7 types de tâches YOLO :

TâcheDescriptionOutil d’annotation
DétectionDétection d’objets avec des boîtes englobantesOutil rectangle
SegmentationSegmentation d’instances avec des masques de pixelsOutil polygone
SémantiqueSegmentation sémantique avec des régions de pixels par classeOutil polygone
ProfondeurCartes de profondeur métrique par pixelCibles importées
ClassificationClassification au niveau de l’imageSélecteur de classe
PoseEstimation des points clés avec des modèles de squelette intégrés et personnalisésOutil points clés
OBBBoîtes englobantes orientées pour les objets inclinésOutil boîte orientée
Sélection du type de tâche

Le type de tâche est défini lors de la création d’un jeu de données et détermine les outils d’annotation disponibles. Tu peux le modifier plus tard à l’aide du sélecteur de tâche dans l’en-tête du jeu de données, mais les annotations incompatibles ne seront plus affichées après le changement. Le passage à la profondeur ou depuis celle-ci n’est autorisé que si le jeu de données est vide — voir Modifier le jeu de données.

Fonctionnalités clés#

Stockage intelligent#

Ultralytics Platform gère efficacement le stockage :

  • Déduplication : les images identiques dans une même région de données ne sont stockées qu’une seule fois
  • Intégrité : l’intégrité des données est vérifiée lors des téléversements
  • Efficacité : stockage optimisé et traitement rapide

URI des jeux de données#

Référence les jeux de données à l’aide du format d’URI ul:// (voir Utiliser les jeux de données Platform) :

yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset

Cela permet d’entraîner des modèles sur les jeux de données de la plateforme depuis n’importe quelle machine où ta clé API est configurée.

Utiliser les données Platform depuis Python
from ultralytics import YOLO

model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)

Versionnage des jeux de données#

Crée des instantanés NDJSON immuables de ton jeu de données pour assurer la reproductibilité de l’entraînement. Chaque version enregistre le nombre d’images, de classes et d’annotations au moment de sa création. Consulte l’onglet Versions pour en savoir plus.

Onglets des jeux de données#

Les pages des jeux de données peuvent afficher jusqu’à six onglets, selon l’état du jeu de données et tes autorisations :

OngletDescription
ImagesParcourir les images en vue grille, compacte ou tableau, avec les annotations superposées
ClassesAfficher, renommer, recolorer, fusionner et supprimer des classes, avec le nombre d’étiquettes par classe
GraphiquesStatistiques automatiques : répartition des partitions, nombre de classes, cartes thermiques
ModèlesModèles entraînés sur ce jeu de données, avec leurs métriques et leur état
VersionsCréer, comparer, télécharger et restaurer des instantanés NDJSON immuables
ErreursImages dont le traitement a échoué, avec des détails sur les erreurs et des indications pour les corriger

Classes apparaît lorsque le jeu de données contient des images et que sa tâche comporte des classes, tandis que Charts apparaît dès qu’il contient des images. Errors apparaît uniquement en cas d’échec du traitement. Versions apparaît lorsque tu as un accès en modification, ou en mode lecture seule si des versions existent déjà.

Regroupement en clusters#

Explore ton jeu de données sous forme de nuage de points interactif en 2D, où les images visuellement similaires sont proches les unes des autres — un outil utile pour repérer les clusters, les doublons et les valeurs aberrantes, ainsi que pour examiner la répartition des partitions ou des classes dans tes données. Sélectionne une zone au lasso ou clique sur un point pour filtrer la galerie et afficher ces images. L’analyse nécessite entre 20 et 200 000 images sans erreur. Les mêmes embeddings te permettent de trouver des images similaires dans les jeux de données publics, les tiens et ceux de ton équipe, puis de les ajouter au tien. Consulte Regroupement en clusters pour en savoir plus.

Statistiques et visualisation#

L’onglet Charts fournit une analyse automatique comprenant :

  • Répartition des partitions : diagramme en anneau du nombre d’images train/val/test
  • Principales classes : diagramme en anneau des 10 classes d’annotation les plus fréquentes
  • Dimensions des images : histogramme de la répartition de la largeur et de la hauteur des images (en pixels)
  • Dimensions des images en 2D : carte thermique 2D de la largeur en fonction de la hauteur, avec des lignes de repère du rapport hauteur/largeur
  • Emplacements des annotations : carte thermique 2D des positions centrales des boîtes englobantes
  • Points par instance : répartition du nombre de sommets de polygone ou de points clés (ensembles de données de segmentation/de pose)

Voir l’onglet Graphiques pour consulter la liste complète.

FAQ#

  • Ultralytics Platform accepte les formats suivants :

    Images : JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (50 Mo max. chacune)

    Vidéos : MP4, WebM, MOV, MKV, M4V (1 Go max., images extraites à 1 FPS, 100 images max.)

    Fichiers d’ensemble de données : archives ZIP ou TAR contenant .tar.gz et .tgz (10 Go max. avec l’offre Free, 20 Go avec l’offre Pro, 50 Go avec l’offre Enterprise), avec des images et, en option, des annotations au format YOLO, au format JSON COCO ou au format JSON LabelMe, des masques PNG sémantiques ou des cartes de profondeur, ainsi que des exports Ultralytics NDJSON ou Labelbox NDJSON

    Tu peux aussi importer ces formats d’archive ou NDJSON en collant un lien HTTP(S) direct dans l’onglet URL de la boîte de dialogue New Dataset. Les annotations XML Pascal VOC sont détectées, mais ne sont pas importées.

  • Les limites de stockage dépendent de ton offre :

    OffreLimite de stockage
    Free100 GB
    Pro500 GB
    EnterpriseIllimité

    Limites par fichier : images 50 Mo, vidéos 1 Go, ensembles de données 10 Go avec l’offre Free / 20 Go avec l’offre Pro / 50 Go avec l’offre Enterprise

  • Oui ! Utilise le format d’URI d’ensemble de données pour entraîner tes modèles en local :

    export ULTRALYTICS_API_KEY="YOUR_API_KEY"
    yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100

    Tu peux aussi exporter ton ensemble de données au format NDJSON pour transférer ses métadonnées, ses partitions, ses annotations et ses URL d’images signées.

Commentaires