En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Amazon Polarity
Texte

Amazon Polarity

Dataset contenant des avis produits Amazon sur 18 ans, annotés positifs ou négatifs. Chaque exemple comprend un titre, un contenu textuel et un label de polarité. Idéal pour entraîner des modèles de classification de sentiment.

Télécharger le dataset
Taille

Environ 4 millions d’avis (train + test), format JSON avec champs titre, contenu et label binaire

Licence

Apache 2.0

Description

Amazon Polarity est un corpus massif d’avis clients anglophones, annotés pour la classification de sentiment en positif ou négatif. Les données couvrent une période de 18 ans et incluent titres et contenus des avis.

À quoi sert ce dataset ?

  • Entraîner des modèles de classification de sentiment pour e-commerce
  • Améliorer les systèmes de recommandation et d’analyse de feedback client
  • Tester la robustesse des modèles NLP sur de grandes quantités de données réelles

Peut-on l’enrichir ou l’améliorer ?

Le dataset peut être enrichi par l’ajout d’annotations plus fines (par ex. aspects spécifiques des produits), ou fusionné avec d’autres sources d’avis pour créer des corpus multilingues.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Données bien structurées, format JSON simple)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – données textuelles prêtes à l’usage)
🏷️ Richesse des annotations⭐⭐✩✩✩ (Binaire - positif/négatif, basique mais efficace)
📜 Licence commerciale✅ Oui (Apache 2.0)
👨‍💻 Idéal pour les débutants🌟 Oui, excellent pour apprendre la classification
🔁 Réutilisable en fine-tuning🎯 Parfait pour fine-tuning de modèles NLP
🌍 Diversité culturelle⚠️ Anglais, large éventail de produits et catégories

🧠 Recommandé pour

  • Data scientists
  • Développeurs NLP
  • Chercheurs en analyse de sentiment

🔧 Outils compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • Scikit-learn

💡 Astuce

Combinez ce dataset avec des avis détaillés pour un apprentissage plus contextuel et précis.

Questions fréquemment posées

Ce dataset couvre-t-il plusieurs langues ?

Non, les avis sont principalement en anglais.

Quels sont les labels utilisés pour la classification ?

Deux labels binaires : 0 pour négatif (notes 1 et 2), 1 pour positif (notes 4 et 5).

Peut-on utiliser ce dataset pour des tâches autres que la classification de sentiment ?

Principalement conçu pour la classification de sentiment, mais il peut être exploité pour l’analyse de texte général.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.