Ultralytics YOLO27 :

Jeu de données Caltech-101#

Le jeu de données Caltech-101 est un benchmark classique de classification d’images composé de 9 144 images couvrant 101 catégories d’objets, plus une classe d’arrière-plan. Chaque catégorie comprend environ 40 à 800 images d’objets du monde réel — animaux, véhicules, articles ménagers et personnes — ce qui en fait un benchmark compact mais exigeant pour les modèles de reconnaissance d’objets.

Explore Caltech-101 sur Ultralytics Platform pour prévisualiser des échantillons, examiner les statistiques du jeu de données et le cloner pour l’entraînement.



Regarder : Comment entraîner un modèle de classification d’images avec le jeu de données Caltech-101 sur la plateforme Ultralytics
Fractionnement automatique des données

Caltech-101 est fourni sans fractionnement prédéfini entre entraînement et validation. Les commandes d’entraînement ci-dessous le répartissent automatiquement à 80 % pour l’entraînement et 20 % pour la validation ; aucune préparation manuelle n’est donc nécessaire.

Fonctionnalités clés#

  • Caltech-101 contient 9 144 images couleur réparties entre 101 catégories d’objets et une classe BACKGROUND_Google (102 dossiers de classes au total).
  • Les catégories couvrent une grande variété d’objets du monde réel, notamment des animaux, des véhicules, des articles ménagers et des personnes.
  • Chaque catégorie comprend environ 40 à 800 images ; les tailles des classes sont donc déséquilibrées.
  • Les images ont des dimensions variables, la plupart mesurant environ 300x200 pixels (résolution moyenne).
  • Caltech-101 est largement utilisé pour évaluer les algorithmes de classification d’images et de reconnaissance d’objets.

Structure du jeu de données#

Caltech-101 est distribué sous la forme de 102 dossiers — un par classe, couvrant 101 catégories d’objets et une classe BACKGROUND_Google — sans fractionnement prédéfini entre entraînement et validation. Au lancement de l’entraînement, Ultralytics répartit automatiquement les images afin que les modèles s’entraînent sur l’ensemble des 102 classes, sans configuration manuelle :

  • Classes : 102 (101 catégories d’objets + 1 arrière-plan)
  • Nombre total d’images : 9 144
  • Répartition entraînement/validation : automatique, 80 % / 20 % (≈7 280 pour l’entraînement, ≈1 864 pour la validation)
  • Images par classe : environ 40 à 800 (déséquilibré)

Applications#

Caltech-101 est largement utilisé pour entraîner et évaluer des modèles de classification d’images et de reconnaissance d’objets, notamment les réseaux de neurones convolutifs (CNNs) et les machines à vecteurs de support (SVMs). La grande diversité des catégories et la qualité des images annotées en font un benchmark populaire pour la recherche et le prototypage en apprentissage automatique et en vision par ordinateur.

Utilisation#

Entraîne un modèle YOLO sur Caltech-101 pendant 100 époques, avec une taille d’image de 416. Pour consulter la liste complète des arguments disponibles, reporte-toi à la page Entraînement et au guide de la tâche de classification d’images.

Exemple d’entraînement
from ultralytics import YOLO

# Charger un modèle
model = YOLO("yolo26n-cls.pt")  # charger un modèle préentraîné (recommandé pour l’entraînement)

# Entraîner le modèle
results = model.train(data="caltech101", epochs=100, imgsz=416)

Exemples d’images et annotations#

Le jeu de données Caltech-101 contient des images couleur de haute qualité représentant divers objets. Il constitue un jeu de données bien structuré pour les tâches de classification d’images. Voici quelques exemples d’images du jeu de données :

Exemples d’images du jeu de données de classification d’images Caltech-101

Les exemples illustrent la variété des catégories et le cadrage naturel, centré, caractéristique de Caltech-101, ce qui en fait un bon point de départ pour entraîner des modèles robustes de reconnaissance d’objets.

Citations et remerciements#

Si tu utilises le jeu de données Caltech-101 dans tes travaux de recherche ou de développement, cite l’article suivant :

Citation
@article{fei2007learning,
  title={Learning generative visual models from few training examples: An incremental Bayesian approach tested on 101 object categories},
  author={Fei-Fei, Li and Fergus, Rob and Perona, Pietro},
  journal={Computer vision and Image understanding},
  volume={106},
  number={1},
  pages={59--70},
  year={2007},
  publisher={Elsevier}
}

Nous tenons à remercier Li Fei-Fei, Rob Fergus et Pietro Perona d’avoir créé et maintenu le jeu de données Caltech-101, une ressource précieuse pour la communauté de recherche en apprentissage automatique et en vision par ordinateur. Pour en savoir plus sur le jeu de données Caltech-101 et ses créateurs, consulte le site web du jeu de données Caltech-101.

FAQ#

  • Le jeu de données Caltech-101 est largement utilisé pour entraîner et évaluer des modèles de classification d’images et de reconnaissance d’objets. Il contient 9 144 images réparties dans 101 catégories d’objets, auxquelles s’ajoute une classe d’arrière-plan, ce qui en fait un benchmark exigeant pour évaluer des algorithmes tels que les réseaux de neurones convolutifs (CNNs) et les machines à vecteurs de support (SVMs).

  • Pour entraîner un modèle Ultralytics YOLO sur Caltech-101, utilise les extraits de code ci-dessous. Le jeu de données est téléchargé automatiquement lors de sa première utilisation. Pour consulter la liste complète des arguments, reporte-toi à la page d’entraînement du modèle.

    Exemple d’entraînement
    from ultralytics import YOLO
    
    # Charger un modèle
    model = YOLO("yolo26n-cls.pt")  # charger un modèle préentraîné (recommandé pour l’entraînement)
    
    # Entraîner le modèle
    results = model.train(data="caltech101", epochs=100, imgsz=416)
  • Caltech-101 contient 101 catégories d’objets et une classe d’arrière-plan BACKGROUND_Google, soit 102 dossiers de classes et 9 144 images au total. Lors de l’entraînement avec Ultralytics, le modèle apprend les 102 classes. Le nombre d’images par catégorie est déséquilibré et varie d’environ 40 à 800.

  • Caltech-101 ne dispose d’aucune répartition prédéfinie. Lors du premier entraînement, Ultralytics le répartit automatiquement entre 80 % pour l’entraînement et 20 % pour la validation — soit environ 7 280 images d’entraînement et 1 864 images de validation —, tu n’as donc pas besoin de créer les partitions manuellement. Pour contrôler toi-même la répartition, organise les images dans les dossiers train/ et val/ avant l’entraînement.

  • Oui. Ultralytics Platform te permet de gérer des jeux de données, d’entraîner des modèles de classification d’images et de les déployer sans avoir à écrire beaucoup de code. C’est une solution pratique pour mener des expériences sur Caltech-101 dans le cloud. Tu trouveras d’autres options dans notre aperçu des jeux de données de classification.

Commentaires