IRC Disentangle
Ce dataset fournit des logs IRC annotés manuellement avec des structures de réponse, permettant de reconstituer les conversations enchevêtrées. Une ressource précieuse pour entraîner ou évaluer des modèles de compréhension du dialogue.
77 563 messages IRC annotés en JSON, avec graphes de réponse
CC-BY 4.0
Description
Le dataset IRC Disentangle propose plus de 77 000 messages issus de canaux IRC, chacun annoté manuellement pour indiquer les liens de réponse entre messages. Il permet ainsi de reconstituer les conversations mélangées typiques des chats en ligne. Chaque message est fourni avec une version brute, une version ASCII, une tokenisation, et des graphes de réponse indiquant les messages associés. Le jeu est divisé en canaux et dates, avec une attention particulière portée à la qualité des annotations.
À quoi sert ce dataset ?
- Entraîner des modèles de désentrelacement conversationnel (disentanglement)
- Tester la capacité d’un agent conversationnel à identifier les fils de discussion dans un flux désorganisé
- Améliorer les outils de modération et d’analyse de dialogues en ligne
Peut-on l’enrichir ou l’améliorer ?
Oui, le dataset peut être enrichi par l’ajout d'autres canaux IRC, la traduction vers d’autres langues, ou des annotations supplémentaires (émotions, intentions, etc.). Les graphes peuvent également être utilisés pour générer des conversations synthétiques réalistes, utiles pour le fine-tuning de modèles de dialogue.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP dialogue
- Modérateurs IA
- Projets de reconstitution de conversation
🔧 Outils compatibles
- PyTorch
- Hugging Face Datasets
- NetworkX
- Transformers
💡 Astuce
Utilisez les graphes de réponse pour segmenter automatiquement des dialogues multi-fils avant de fine-tuner un modèle conversationnel.
Questions fréquemment posées
Ce dataset contient-il des dialogues complets ou seulement des messages isolés ?
Il contient des messages reliés entre eux via des graphes d’annotation, permettant de reconstruire les conversations complètes.
Peut-on l’utiliser pour entraîner un chatbot multi-utilisateurs ?
Oui, il est idéal pour entraîner un modèle capable de gérer plusieurs conversations imbriquées dans un même flux.
Existe-t-il des outils fournis pour traiter ce dataset ?
Oui, des scripts sont disponibles dans le dépôt GitHub associé pour la conversion, l’évaluation et le prétraitement des données.




