Jeu de données COCO128-Seg#
Introduction#
Le jeu de données COCO128-Seg d’Ultralytics est un jeu de données de segmentation d’instances petit mais polyvalent, composé des 128 premières images du jeu COCO train 2017. Il est idéal pour tester et déboguer des modèles de segmentation ou expérimenter de nouvelles approches de segmentation. Avec 128 images, il est assez petit pour être facilement géré, tout en étant assez varié pour tester les pipelines d’entraînement et détecter les erreurs, et servir de vérification rapide avant d’entraîner des modèles sur des jeux de données plus grands.
Structure du jeu de données#
- Images : 128 au total, réparties à l’identique entre l’entraînement et la validation (voir la remarque ci-dessous).
- Classes : les mêmes 80 catégories d’objets que dans COCO.
- Étiquettes : polygones au format YOLO stockés dans
labels/train2017, pour le répertoire partagé d’images d’entraînement et de validation. - Taille du téléchargement : ~7 MB.
Le fichier YAML par défaut indique les mêmes 128 images pour l’entraînement et la validation ; les métriques de validation mesurent donc l’ajustement sur le jeu d’entraînement plutôt que la généralisation à des données mises de côté. Duplique ou personnalise la répartition si tu as besoin d’un véritable jeu de données de validation indépendant.
Ce jeu de données est destiné à être utilisé avec Ultralytics Platform et YOLO26.
Fichier YAML du jeu de données#
Un fichier YAML définit la configuration du jeu de données. Il contient des informations sur les chemins d’accès, les classes et d’autres éléments pertinents. Pour le jeu de données COCO128-Seg, le fichier coco128-seg.yaml est maintenu à https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco128-seg.yaml.
# Ultralytics 🚀 AGPL-3.0 License - https://ultralytics.com/license
# COCO128-seg dataset https://www.kaggle.com/datasets/ultralytics/coco128 (first 128 images from COCO train2017) by Ultralytics
# Documentation: https://docs.ultralytics.com/datasets/segment/coco128-seg
# Example usage: yolo train data=coco128-seg.yaml
# parent
# ├── ultralytics
# └── datasets
# └── coco128-seg ← downloads here (7 MB)
# Train/val/test sets as 1) dir: path/to/imgs, 2) file: path/to/imgs.txt, or 3) list: [path/to/imgs1, path/to/imgs2, ..]
path: coco128-seg # dataset root dir
train: images/train2017 # train images (relative to 'path') 128 images
val: images/train2017 # val images (relative to 'path') 128 images
test: # test images (optional)
# Classes
names:
0: person
1: bicycle
2: car
3: motorcycle
4: airplane
5: bus
6: train
7: truck
8: boat
9: traffic light
10: fire hydrant
11: stop sign
12: parking meter
13: bench
14: bird
15: cat
16: dog
17: horse
18: sheep
19: cow
20: elephant
21: bear
22: zebra
23: giraffe
24: backpack
25: umbrella
26: handbag
27: tie
28: suitcase
29: frisbee
30: skis
31: snowboard
32: sports ball
33: kite
34: baseball bat
35: baseball glove
36: skateboard
37: surfboard
38: tennis racket
39: bottle
40: wine glass
41: cup
42: fork
43: knife
44: spoon
45: bowl
46: banana
47: apple
48: sandwich
49: orange
50: broccoli
51: carrot
52: hot dog
53: pizza
54: donut
55: cake
56: chair
57: couch
58: potted plant
59: bed
60: dining table
61: toilet
62: tv
63: laptop
64: mouse
65: remote
66: keyboard
67: cell phone
68: microwave
69: oven
70: toaster
71: sink
72: refrigerator
73: book
74: clock
75: vase
76: scissors
77: teddy bear
78: hair drier
79: toothbrush
# Download script/URL (optional)
download: https://github.com/ultralytics/assets/releases/download/v0.0.0/coco128-seg.zipUtilisation#
Pour entraîner un modèle YOLO26n-seg sur le jeu de données COCO128-Seg pendant 100 époques avec une taille d’image de 640, tu peux utiliser les extraits de code suivants. Pour obtenir la liste complète des arguments disponibles, consulte la page Entraînement du modèle.
from ultralytics import YOLO
# Charger un modèle
model = YOLO("yolo26n-seg.pt") # charger un modèle préentraîné (recommandé pour l’entraînement)
# Entraîner le modèle
results = model.train(data="coco128-seg.yaml", epochs=100, imgsz=640)Exemples d’images et annotations#
Voici quelques exemples d’images du jeu de données COCO128-Seg, accompagnées de leurs annotations correspondantes :
- Image en mosaïque : cette image montre un lot d’entraînement composé d’images du jeu de données assemblées en mosaïque. La mosaïque est une technique utilisée pendant l’entraînement qui combine plusieurs images en une seule afin d’augmenter la variété des objets et des scènes dans chaque lot d’entraînement. Elle aide le modèle à mieux généraliser à différentes tailles d’objets, proportions et contextes.
Citations et remerciements#
Si tu utilises le jeu de données COCO dans tes travaux de recherche ou de développement, cite l’article suivant :
@misc{lin2015microsoft,
title={Microsoft COCO: Common Objects in Context},
author={Tsung-Yi Lin and Michael Maire and Serge Belongie and Lubomir Bourdev and Ross Girshick and James Hays and Pietro Perona and Deva Ramanan and C. Lawrence Zitnick and Piotr Dollár},
year={2015},
eprint={1405.0312},
archivePrefix={arXiv},
primaryClass={cs.CV}
}Nous tenons à remercier le consortium COCO d’avoir créé et maintenu cette ressource précieuse pour la communauté de la vision par ordinateur. Pour en savoir plus sur le jeu de données COCO et ses créateurs, consulte le site Web du jeu de données COCO.
FAQ#
Le jeu de données COCO128-Seg est un jeu de données compact de segmentation d’instances proposé par Ultralytics. Il comprend les 128 premières images du jeu COCO train 2017. Il est conçu pour tester et déboguer des modèles de segmentation ou expérimenter de nouvelles méthodes de segmentation. Il est particulièrement utile avec YOLO26 et Platform d’Ultralytics pour itérer rapidement et vérifier les erreurs du pipeline avant de passer à des jeux de données plus grands. Pour des instructions détaillées, consulte la page Entraînement du modèle.
Pour entraîner un modèle YOLO26n-seg sur le jeu de données COCO128-Seg pendant 100 époques avec une taille d’image de 640, tu peux utiliser des commandes Python ou CLI. Voici un exemple rapide :
Exemple d’entraînementfrom ultralytics import YOLO # Charger un modèle model = YOLO("yolo26n-seg.pt") # Charger un modèle préentraîné (recommandé pour l’entraînement) # Entraîner le modèle results = model.train(data="coco128-seg.yaml", epochs=100, imgsz=640)Pour obtenir une explication détaillée des arguments disponibles et des options de configuration, consulte la documentation sur l’Entraînement.
Comme le téléchargement et la boucle d’entraînement/validation sont bien plus légers qu’avec COCO complet, COCO128-Seg te permet d’effectuer une vérification rapide d’une époque sur un nouveau pipeline — pour vérifier que le modèle s’entraîne, effectue la validation et enregistre correctement les points de contrôle — avant de passer au jeu de données COCO-Seg complet. Pour en savoir plus sur les formats de jeux de données pris en charge, consulte le guide des jeux de données de segmentation Ultralytics.
Le fichier de configuration YAML du jeu de données COCO128-Seg est disponible dans le dépôt Ultralytics. Tu peux accéder directement au fichier à l’adresse https://github.com/ultralytics/ultralytics/blob/main/ultralytics/cfg/datasets/coco128-seg.yaml. Le fichier YAML contient les informations essentielles sur les chemins d’accès au jeu de données, les classes et les paramètres de configuration requis pour l’entraînement et la validation du modèle.
En termes de taille, COCO128-Seg (128 images) se situe entre COCO8-Seg (8 images) et le jeu de données COCO-Seg complet (118 287 images d’entraînement) :
- COCO8-Seg : 8 images (4 pour l’entraînement, 4 pour la validation) — idéal pour des vérifications rapides et le débogage.
- COCO128-Seg : 128 images — un équilibre entre taille et diversité, avec les images d’entraînement et de validation dans le même répertoire.
- COCO-Seg complet : 118 287 images d’entraînement — complet, mais gourmand en ressources, avec un téléchargement initial nécessitant ~20 GB.
COCO128-Seg offre plus de diversité que COCO8-Seg, tout en restant bien plus facile à gérer que le jeu de données COCO-Seg complet pour l’expérimentation et le développement initial de modèles.



