Amazon Polarity
Dataset contenant des avis produits Amazon sur 18 ans, annotés positifs ou négatifs. Chaque exemple comprend un titre, un contenu textuel et un label de polarité. Idéal pour entraîner des modèles de classification de sentiment.
Environ 4 millions d’avis (train + test), format JSON avec champs titre, contenu et label binaire
Apache 2.0
Description
Amazon Polarity est un corpus massif d’avis clients anglophones, annotés pour la classification de sentiment en positif ou négatif. Les données couvrent une période de 18 ans et incluent titres et contenus des avis.
À quoi sert ce dataset ?
- Entraîner des modèles de classification de sentiment pour e-commerce
- Améliorer les systèmes de recommandation et d’analyse de feedback client
- Tester la robustesse des modèles NLP sur de grandes quantités de données réelles
Peut-on l’enrichir ou l’améliorer ?
Le dataset peut être enrichi par l’ajout d’annotations plus fines (par ex. aspects spécifiques des produits), ou fusionné avec d’autres sources d’avis pour créer des corpus multilingues.
🔎 En résumé
🧠 Recommandé pour
- Data scientists
- Développeurs NLP
- Chercheurs en analyse de sentiment
🔧 Outils compatibles
- Hugging Face Transformers
- TensorFlow
- PyTorch
- Scikit-learn
💡 Astuce
Combinez ce dataset avec des avis détaillés pour un apprentissage plus contextuel et précis.
Questions fréquemment posées
Ce dataset couvre-t-il plusieurs langues ?
Non, les avis sont principalement en anglais.
Quels sont les labels utilisés pour la classification ?
Deux labels binaires : 0 pour négatif (notes 1 et 2), 1 pour positif (notes 4 et 5).
Peut-on utiliser ce dataset pour des tâches autres que la classification de sentiment ?
Principalement conçu pour la classification de sentiment, mais il peut être exploité pour l’analyse de texte général.




