Coarse Discourse - Corpus annoté de discours sur forums Reddit
Le dataset <strong>Coarse Discourse</strong> regroupe plus de 116 000 commentaires extraits de discussions Reddit, annotés manuellement avec des actes de discours (ex. élaboration). Les données contiennent aussi les liens entre commentaires, la profondeur des posts, et les métadonnées des subreddits.
Environ 116 000 commentaires annotés sur Reddit, format JSON, taille ~50 Mo
CC-BY 4.0
Description
Coarse Discourse est un corpus volumineux d’annotations de discours dans les discussions en ligne, extrait de Reddit. Chaque commentaire est annoté avec des actes de discours, ce qui facilite l’analyse des dynamiques conversationnelles et la compréhension des structures discursives dans les forums.
À quoi sert ce dataset ?
- Entraîner des modèles de compréhension et classification des actes de discours
- Analyser les interactions conversationnelles sur forums et réseaux sociaux
- Améliorer les systèmes de modération et détection de comportements discursifs
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’ajouter des annotations supplémentaires, par exemple des niveaux plus fins d’actes de discours, ou d’intégrer d’autres plateformes pour enrichir la diversité des interactions.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Développeurs de chatbots
- Analystes de réseaux sociaux
🔧 Outils compatibles
- Python (pandas, json)
- Frameworks NLP (SpaCy, Transformers)
- Outils d’annotation
💡 Astuce
Utiliser les métadonnées de profondeur et de lien pour reconstruire le fil de discussion lors de l’analyse.
Questions fréquemment posées
Quels types d’actes de discours sont annotés dans ce dataset ?
Principalement des actes grossiers comme « élaboration », « justification », permettant de caractériser la fonction discursive des commentaires.
Combien de commentaires contient ce dataset ?
Environ 116 000 commentaires annotés provenant de plus de 9 000 fils de discussion Reddit.
Ce dataset est-il adapté aux projets commerciaux ?
Oui, sous licence CC-BY 4.0, il peut être utilisé librement y compris dans des projets commerciaux en respectant l’attribution.




