Hate Speech Detection Dataset for Social Media
Dataset synthétique conçu pour entraîner et évaluer des modèles NLP de détection de discours haineux et offensant sur les réseaux sociaux. Il couvre des catégories neutre, offensant et haineux, avec un contenu respectant la confidentialité et sans données réelles sensibles.
1 829 posts en CSV, avec champs texte, label, plateforme, date, et ID utilisateur
CC0: Public Domain
Description
Le dataset Hate Speech Detection Dataset for Social Media comprend 1 829 posts synthétiques issus de plateformes comme Twitter et Reddit, annotés pour détecter les discours haineux, offensants ou neutres. Les données incluent également des métadonnées telles que l’heure, la plateforme, et l’ID utilisateur.
À quoi sert ce dataset ?
- Former des modèles de classification pour la modération automatique en temps réel
- Évaluer des pipelines NLP pour la détection des discours haineux sur les réseaux sociaux
- Contribuer à la recherche sur la sécurité et la surveillance des contenus en ligne
Peut-on l’enrichir ou l’améliorer ?
Le dataset peut être étendu avec des exemples réels ou plus volumineux, et amélioré par des annotations plus fines (ex. degrés d’intensité, cibles spécifiques). L’intégration de contextes multi-langues serait également bénéfique.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Développeurs de systèmes de modération
- Étudiants en apprentissage automatique
🔧 Outils compatibles
- Scikit-learn
- Hugging Face Transformers
- SpaCy
- TensorFlow
- PyTorch
💡 Astuce
Entraîner avec des jeux de données complémentaires pour améliorer la robustesse en conditions réelles.
Questions fréquemment posées
Ce dataset peut-il être utilisé pour détecter automatiquement le discours haineux en temps réel ?
Oui, il est spécifiquement conçu pour entraîner et évaluer des modèles de classification en temps réel sur les réseaux sociaux.
Ce dataset contient-il des données réelles ou sensibles ?
Non, il s’agit d’un dataset synthétique garantissant la confidentialité et l’absence de contenu réellement sensible.
Le dataset couvre-t-il plusieurs langues ?
Non, le dataset est principalement en anglais et ne propose pas d’annotations multilingues.




