En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Clothing1M
Image

Clothing1M

Clothing1M est un dataset de plus d’un million d’images de vêtements issues de sites e-commerce. Les étiquettes sont bruitées, car extraites automatiquement, mais un sous-ensemble de 74 000 images est proprement annoté pour l’entraînement, la validation et le test.

Télécharger le dataset
Taille

Plus de 1 million d’images JPEG réparties en 14 classes, avec données annotées bruitées et propres

Licence

Téléchargement gratuit, licence non précisée explicitement

Description

‍

Clothing1M est un jeu de données d’envergure contenant plus d’un million d’images de vêtements, répartis en 14 catégories. Les images ont été collectées à partir de plusieurs plateformes de shopping en ligne, ce qui entraîne un taux élevé d’étiquettes erronées. Le dataset inclut cependant 50 000 images annotées proprement pour l’entraînement, 14 000 pour la validation et 10 000 pour le test.

‍

‍

À quoi sert ce dataset ?

‍

  • Tester la robustesse des modèles de classification face à des données bruitées
  • Expérimenter des techniques de nettoyage ou de re-labellisation automatique
  • Former des modèles d’IA appliqués à l’e-commerce et à la reconnaissance de vêtements

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, on peut raffiner les étiquettes, regrouper les classes, ou intégrer des métadonnées produits (couleur, genre, style). Il est aussi possible de croiser ce dataset avec d'autres jeux de données e-commerce ou sociaux pour enrichir les représentations visuelles.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Volume important, nécessite filtrage préalable)
🧼 Besoin de nettoyage⭐⭐✩✩✩ (Élevé : présence massive de labels erronés)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Faible sur le global, propre sur un sous-ensemble)
📜 Licence commerciale⚠️ Non précisée, à vérifier selon usage spécifique
👨‍💻 Idéal pour les débutants⚠️ Modérément, bon pour expérimenter mais peut être complexe à exploiter
🔁 Réutilisable en fine-tuning✅ Très adapté pour fine-tuning de modèles robustes
🌍 Diversité culturelle⚠️ Faible : styles issus de plateformes e-commerce asiatiques et occidentales

‍

‍

🧠 Recommandé pour

  • Projets de robustesse NLP/vision
  • Chercheurs sur le bruit d’étiquettes
  • IA e-commerce

‍

‍

🔧 Outils compatibles

  • PyTorch
  • TensorFlow
  • FastAI
  • Cleanlab

‍

‍

💡 Astuce

Utiliser des méthodes de correction d’étiquettes (confident learning) pour extraire un sous-ensemble plus fiable.

Questions fréquemment posées

Quel est l’intérêt principal de Clothing1M malgré le bruit dans les données ?

Il permet d’évaluer la robustesse des modèles face à des annotations erronées, un cas courant en données réelles.

Le dataset contient-il un sous-ensemble proprement annoté ?

Oui, 50 000 images pour l'entraînement, 14 000 pour la validation et 10 000 pour le test sont correctement étiquetées.

Peut-on utiliser ce dataset pour un projet commercial ?

La licence n’étant pas précisée, il est recommandé de contacter les auteurs pour un usage commercial.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.