En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Hate Speech Detection Dataset for Social Media
Texte

Hate Speech Detection Dataset for Social Media

Dataset synthétique conçu pour entraîner et évaluer des modèles NLP de détection de discours haineux et offensant sur les réseaux sociaux. Il couvre des catégories neutre, offensant et haineux, avec un contenu respectant la confidentialité et sans données réelles sensibles.

Télécharger le dataset
Taille

1 829 posts en CSV, avec champs texte, label, plateforme, date, et ID utilisateur

Licence

CC0: Public Domain

Description

Le dataset Hate Speech Detection Dataset for Social Media comprend 1 829 posts synthétiques issus de plateformes comme Twitter et Reddit, annotés pour détecter les discours haineux, offensants ou neutres. Les données incluent également des métadonnées telles que l’heure, la plateforme, et l’ID utilisateur.

À quoi sert ce dataset ?

  • Former des modèles de classification pour la modération automatique en temps réel
  • Évaluer des pipelines NLP pour la détection des discours haineux sur les réseaux sociaux
  • Contribuer à la recherche sur la sécurité et la surveillance des contenus en ligne

Peut-on l’enrichir ou l’améliorer ?

Le dataset peut être étendu avec des exemples réels ou plus volumineux, et amélioré par des annotations plus fines (ex. degrés d’intensité, cibles spécifiques). L’intégration de contextes multi-langues serait également bénéfique.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐✩ (Format CSV simple, prêt à l’emploi)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – données synthétiques bien structurées)
🏷️ Richesse des annotations⭐⭐⭐✩✩ (Trois classes claires, pas d’annotations complexes)
📜 Licence commerciale✅ Oui (CC0)
👨‍💻 Idéal pour les débutants✅ Oui, accessible pour premiers projets NLP
🔁 Réutilisable en fine-tuning📝 Adapté pour fine-tuning de modèles de détection
🌍 Diversité culturelle⚠️ Synthétique, sans indication spécifique sur la diversité linguistique

🧠 Recommandé pour

  • Chercheurs en NLP
  • Développeurs de systèmes de modération
  • Étudiants en apprentissage automatique

🔧 Outils compatibles

  • Scikit-learn
  • Hugging Face Transformers
  • SpaCy
  • TensorFlow
  • PyTorch

💡 Astuce

Entraîner avec des jeux de données complémentaires pour améliorer la robustesse en conditions réelles.

Questions fréquemment posées

Ce dataset peut-il être utilisé pour détecter automatiquement le discours haineux en temps réel ?

Oui, il est spécifiquement conçu pour entraîner et évaluer des modèles de classification en temps réel sur les réseaux sociaux.

Ce dataset contient-il des données réelles ou sensibles ?

Non, il s’agit d’un dataset synthétique garantissant la confidentialité et l’absence de contenu réellement sensible.

Le dataset couvre-t-il plusieurs langues ?

Non, le dataset est principalement en anglais et ne propose pas d’annotations multilingues.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.