Ultralytics YOLO27 :

Préparation des données#

La préparation des données est la base de modèles de vision par ordinateur performants. Ultralytics Platform fournit des outils complets pour gérer tes données d’entraînement, du téléversement à l’annotation et à l’analyse.



Watch: Get Started with Ultralytics Platform - Data

Présentation#

La section Données d’Ultralytics Platform t’aide à :

  • Téléverser des images, des vidéos et des fichiers de dataset (ZIP, TAR incluant .tar.gz/.tgz, NDJSON)
  • Importer depuis une URL en collant un lien direct vers une archive ou une exportation NDJSON, ou depuis Roboflow
  • Connecter Google Cloud Storage, Amazon S3 ou Azure Blob Storage, puis utiliser tes données sur place sans téléverser de copie
  • Conserver les pixels sur site avec des workers CPU/GPU Enterprise sur site
  • Annote avec des outils de dessin manuel et un étiquetage intelligent alimenté par SAM — choisis entre SAM 2.1, SAM 3 ou le SAM 3.1 par défaut
  • Gérer les classes en les renommant, en modifiant leur couleur, en les fusionnant et en les supprimant dans tout le dataset
  • Analyser tes données avec des statistiques, des visualisations et un clustering basé sur les embeddings
  • Exporter au format NDJSON pour l’entraînement local

Barre latérale d’aperçu des datasets d’Ultralytics Platform

Flux de travail#

graph LR
    A[Upload]:::start --> B[Annotate]:::proc
    B --> D[Train]:::out
    B --> C[Analyze]:::proc

    classDef start fill:#4CAF50,color:#fff
    classDef proc fill:#2196F3,color:#fff
    classDef out fill:#9C27B0,color:#fff
ÉtapeDescription
ImporterImporter des images, des vidéos ou des archives avec un traitement automatique
AnnoterÉtiqueter les données avec des outils manuels ou utiliser l’annotation SAM pour la détection, la segmentation, la segmentation sémantique et l’OBB
AnalyserAfficher la distribution des classes, les cartes thermiques spatiales, les statistiques de dimensions et les clusters d’embeddings
ExporterTélécharger au format NDJSON pour une utilisation hors ligne

Tâches prises en charge#

Les datasets d’Ultralytics Platform prennent en charge les 7 types de tâches YOLO :

TâcheDescriptionOutil d’annotation
DétectionDétection d’objets avec des boîtes englobantesOutil rectangle
SegmentationSegmentation d’instances avec des masques de pixelsOutil polygone
SémantiqueSegmentation sémantique avec des régions de pixels par classeOutil polygone
ProfondeurCartes de profondeur métrique par pixelCibles importées
ClassificationClassification au niveau de l’imageSélecteur de classe
PoseEstimation des points clés avec des modèles de squelette intégrés et personnalisésOutil de points clés
OBBBoîtes englobantes orientées pour les objets pivotésOutil de boîte orientée
Sélection du type de tâche

Le type de tâche est défini lors de la création d’un dataset et détermine les outils d’annotation disponibles. Tu peux le modifier ultérieurement depuis le sélecteur de tâche dans l’en-tête du dataset, mais les annotations incompatibles ne seront plus affichées après le changement. Le passage vers ou depuis la profondeur n’est autorisé que lorsque le dataset est vide — voir Modifier le dataset.

Fonctionnalités clés#

Stockage intelligent#

Ultralytics Platform gère efficacement le stockage :

  • Déduplication : les images identiques dans une même région de données ne sont stockées qu'une seule fois
  • Intégrité : l'intégrité des données des importations est vérifiée
  • Efficacité : stockage optimisé et traitement rapide

URI des datasets#

Référence aux datasets avec le format d’URI ul:// (voir Utiliser les datasets de Platform) :

yolo train data=ul://username/datasets/my-dataset

Cela permet d’entraîner sur les datasets de la plateforme depuis n’importe quelle machine où ta clé API est configurée.

Utiliser les données de Platform depuis Python
from ultralytics import YOLO

model = YOLO("yolo26n.pt")
model.train(data="ul://username/datasets/my-dataset", epochs=100)

Gestion des versions des datasets#

Crée des instantanés NDJSON immuables de ton dataset pour un entraînement reproductible. Chaque version capture le nombre d’images, de classes et d’annotations au moment de sa création. Consulte l’onglet Versions pour plus de détails.

Onglets du jeu de données#

Les pages des datasets peuvent afficher jusqu’à six onglets, selon l’état du dataset et tes autorisations :

OngletDescription
ImagesParcourir les images en vue grille, compacte ou tableau avec des superpositions d’annotations
ClassesAfficher, renommer, recolorer, fusionner et supprimer les classes avec le nombre d’étiquettes par classe
GraphiquesStatistiques automatiques : distribution des splits, nombre de classes, cartes thermiques
ModèlesModèles entraînés sur ce dataset avec leurs métriques et leur état
VersionsCréer, télécharger et restaurer des instantanés NDJSON immuables pour assurer la reproductibilité
ErreursImages dont le traitement a échoué, avec les détails de l’erreur et des conseils de correction

Classes apparaît lorsque le dataset contient des images et que sa tâche possède des classes, tandis que Charts apparaît dès qu’il contient des images. Errors apparaît uniquement lorsque des échecs de traitement existent. Versions apparaît lorsque tu disposes d’un accès en modification, ou en mode lecture seule lorsque des versions existent déjà.

Clustering#

Explore ton jeu de données sous forme de nuage de points 2D interactif où les images visuellement similaires sont regroupées — utile pour mettre en évidence les clusters, les doublons et les valeurs aberrantes, et pour inspecter la répartition des divisions ou des classes dans tes données. Entoure une région du graphique au lasso pour filtrer la galerie sur ces images. L'analyse nécessite entre 20 et 200 000 images sans erreur. Les mêmes embeddings te permettent de trouver des images similaires dans des jeux de données publics et de les ajouter aux tiens. Consulte Clustering pour plus de détails.

Statistiques et visualisation#

L’onglet Charts fournit une analyse automatique comprenant :

  • Distribution des splits : diagramme en anneau du nombre d’images d’entraînement, de validation et de test
  • Principales classes : diagramme en anneau des 10 classes d’annotations les plus fréquentes
  • Dimensions des images : histogramme de la distribution de la largeur et de la hauteur des images (en pixels)
  • Dimensions des images en 2D : carte thermique 2D de la largeur par rapport à la hauteur avec des lignes guides du ratio d’aspect
  • Emplacements des annotations : carte thermique 2D des positions centrales des boîtes englobantes
  • Points par instance : distribution du nombre de sommets de polygone ou de points clés (datasets de segmentation/pose)

Consulte l’onglet Graphiques pour obtenir la liste complète.

Liens rapides#

  • Datasets : téléverser, gérer et exporter tes données d’entraînement
  • Annotation : étiqueter les données avec des outils manuels et assistés par IA
  • Entraînement dans le cloud : entraîner des modèles sur tes datasets annotés
  • URI de dataset : utiliser les URI ul:// pour entraîner depuis n’importe où

FAQ#

  • Ultralytics Platform prend en charge :

    Images : JPEG, PNG, WebP, BMP, TIFF, HEIC, AVIF, JP2, DNG, MPO (50 Mo maximum chacune)

    Vidéos : MP4, WebM, MOV, MKV, M4V (1 Go maximum, images extraites à 1 FPS, 100 images maximum)

    Fichiers de données : des archives ZIP ou TAR comprenant .tar.gz et .tgz (maximum 10 Go sur Free, 20 Go sur Pro, 50 Go sur Enterprise) contenant des images avec des étiquettes optionnelles au format YOLO ou COCO JSON ou des masques PNG sémantiques, ainsi que des exportations NDJSON

    Tous ces formats d’archives ou NDJSON peuvent également être importés en collant un lien HTTP(S) direct dans l’onglet URL de la boîte de dialogue New Dataset. Les étiquettes Pascal VOC XML sont détectées mais ne sont pas importées.

  • Les limites de stockage dépendent de ton forfait :

    ForfaitLimite de stockage
    Free100 GB
    Pro500 GB
    EnterpriseIllimité

    Limites par fichier : images 50 Mo, vidéos 1 Go, datasets 10 Go avec Free / 20 Go avec Pro / 50 Go avec Enterprise

  • Oui ! Utilise le format d’URI du dataset pour entraîner localement :

    export ULTRALYTICS_API_KEY="YOUR_API_KEY"
    yolo train model=yolo26n.pt data=ul://username/datasets/my-dataset epochs=100

    Ou exporte ton jeu de données au format NDJSON pour transférer ses métadonnées, ses partitions, ses annotations et ses URL d’images signées.

Commentaires