Clothing1M
Clothing1M est un dataset de plus d’un million d’images de vêtements issues de sites e-commerce. Les étiquettes sont bruitées, car extraites automatiquement, mais un sous-ensemble de 74 000 images est proprement annoté pour l’entraînement, la validation et le test.
Plus de 1 million d’images JPEG réparties en 14 classes, avec données annotées bruitées et propres
Téléchargement gratuit, licence non précisée explicitement
Description
Clothing1M est un jeu de données d’envergure contenant plus d’un million d’images de vêtements, répartis en 14 catégories. Les images ont été collectées à partir de plusieurs plateformes de shopping en ligne, ce qui entraîne un taux élevé d’étiquettes erronées. Le dataset inclut cependant 50 000 images annotées proprement pour l’entraînement, 14 000 pour la validation et 10 000 pour le test.
À quoi sert ce dataset ?
- Tester la robustesse des modèles de classification face à des données bruitées
- Expérimenter des techniques de nettoyage ou de re-labellisation automatique
- Former des modèles d’IA appliqués à l’e-commerce et à la reconnaissance de vêtements
Peut-on l’enrichir ou l’améliorer ?
Oui, on peut raffiner les étiquettes, regrouper les classes, ou intégrer des métadonnées produits (couleur, genre, style). Il est aussi possible de croiser ce dataset avec d'autres jeux de données e-commerce ou sociaux pour enrichir les représentations visuelles.
🔎 En résumé
🧠 Recommandé pour
- Projets de robustesse NLP/vision
- Chercheurs sur le bruit d’étiquettes
- IA e-commerce
🔧 Outils compatibles
- PyTorch
- TensorFlow
- FastAI
- Cleanlab
💡 Astuce
Utiliser des méthodes de correction d’étiquettes (confident learning) pour extraire un sous-ensemble plus fiable.
Questions fréquemment posées
Quel est l’intérêt principal de Clothing1M malgré le bruit dans les données ?
Il permet d’évaluer la robustesse des modèles face à des annotations erronées, un cas courant en données réelles.
Le dataset contient-il un sous-ensemble proprement annoté ?
Oui, 50 000 images pour l'entraînement, 14 000 pour la validation et 10 000 pour le test sont correctement étiquetées.
Peut-on utiliser ce dataset pour un projet commercial ?
La licence n’étant pas précisée, il est recommandé de contacter les auteurs pour un usage commercial.




