En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Coarse Discourse - Corpus annoté de discours sur forums Reddit
Texte

Coarse Discourse - Corpus annoté de discours sur forums Reddit

Le dataset <strong>Coarse Discourse</strong> regroupe plus de 116 000 commentaires extraits de discussions Reddit, annotés manuellement avec des actes de discours (ex. élaboration). Les données contiennent aussi les liens entre commentaires, la profondeur des posts, et les métadonnées des subreddits.

Télécharger le dataset
Taille

Environ 116 000 commentaires annotés sur Reddit, format JSON, taille ~50 Mo

Licence

CC-BY 4.0

Description

‍

Coarse Discourse est un corpus volumineux d’annotations de discours dans les discussions en ligne, extrait de Reddit. Chaque commentaire est annoté avec des actes de discours, ce qui facilite l’analyse des dynamiques conversationnelles et la compréhension des structures discursives dans les forums.

‍

‍

À quoi sert ce dataset ?

‍

  • Entraîner des modèles de compréhension et classification des actes de discours
  • Analyser les interactions conversationnelles sur forums et réseaux sociaux
  • Améliorer les systèmes de modération et détection de comportements discursifs

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, il est possible d’ajouter des annotations supplémentaires, par exemple des niveaux plus fins d’actes de discours, ou d’intégrer d’autres plateformes pour enrichir la diversité des interactions.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Données en JSON, nécessite compréhension des annotations)
🧼 Besoin de nettoyage⭐⭐⭐✩✩ (Modéré, gestion des liens et métadonnées)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne, actes de discours manuellement validés)
📜 Licence commerciale✅ Oui (CC-BY 4.0)
👨‍💻 Idéal pour les débutants⚠️ Moyen – utile pour projets avancés en NLP conversationnel
🔁 Réutilisable en fine-tuning🎯 Parfait pour classification d’actes de discours et modélisation
🌍 Diversité culturelle⚠️ Anglais, basé sur communauté Reddit variée

‍

‍

🧠 Recommandé pour

  • Chercheurs en NLP
  • Développeurs de chatbots
  • Analystes de réseaux sociaux

‍

‍

🔧 Outils compatibles

  • Python (pandas, json)
  • Frameworks NLP (SpaCy, Transformers)
  • Outils d’annotation

‍

‍

💡 Astuce

Utiliser les métadonnées de profondeur et de lien pour reconstruire le fil de discussion lors de l’analyse.

Questions fréquemment posées

Quels types d’actes de discours sont annotés dans ce dataset ?

Principalement des actes grossiers comme « élaboration », « justification », permettant de caractériser la fonction discursive des commentaires.

Combien de commentaires contient ce dataset ?

Environ 116 000 commentaires annotés provenant de plus de 9 000 fils de discussion Reddit.

Ce dataset est-il adapté aux projets commerciaux ?

Oui, sous licence CC-BY 4.0, il peut être utilisé librement y compris dans des projets commerciaux en respectant l’attribution.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.