En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
IRC Disentangle
Texte

IRC Disentangle

Ce dataset fournit des logs IRC annotés manuellement avec des structures de réponse, permettant de reconstituer les conversations enchevêtrées. Une ressource précieuse pour entraîner ou évaluer des modèles de compréhension du dialogue.

Télécharger le dataset
Taille

77 563 messages IRC annotés en JSON, avec graphes de réponse

Licence

CC-BY 4.0

Description

‍

Le dataset IRC Disentangle propose plus de 77 000 messages issus de canaux IRC, chacun annoté manuellement pour indiquer les liens de réponse entre messages. Il permet ainsi de reconstituer les conversations mélangées typiques des chats en ligne. Chaque message est fourni avec une version brute, une version ASCII, une tokenisation, et des graphes de réponse indiquant les messages associés. Le jeu est divisé en canaux et dates, avec une attention particulière portée à la qualité des annotations.

‍

‍

À quoi sert ce dataset ?

‍

  • Entraîner des modèles de désentrelacement conversationnel (disentanglement)
  • Tester la capacité d’un agent conversationnel à identifier les fils de discussion dans un flux désorganisé
  • Améliorer les outils de modération et d’analyse de dialogues en ligne

‍

‍

Peut-on l’enrichir ou l’améliorer ?

‍

Oui, le dataset peut être enrichi par l’ajout d'autres canaux IRC, la traduction vers d’autres langues, ou des annotations supplémentaires (émotions, intentions, etc.). Les graphes peuvent également être utilisés pour générer des conversations synthétiques réalistes, utiles pour le fine-tuning de modèles de dialogue.

‍

‍

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Structure claire mais nécessite familiarité avec les graphes)
🧼 Besoin de nettoyage⭐⭐⭐⭐⭐ (Faible – Données déjà normalisées)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Très bonnes – connexions explicites entre messages)
📜 Licence commerciale✅ Oui (CC-BY 4.0)
👨‍💻 Idéal pour les débutants⚠️ Accessible mais requiert compréhension des graphes
🔁 Réutilisable en fine-tuning🎯 Oui, pour dialogue disentanglement ou chatbots multiturn
🌍 Diversité culturelle⚠️ Moyenne – uniquement en anglais (logs Ubuntu)

‍

‍

🧠 Recommandé pour

  • Chercheurs en NLP dialogue
  • Modérateurs IA
  • Projets de reconstitution de conversation

‍

‍

🔧 Outils compatibles

  • PyTorch
  • Hugging Face Datasets
  • NetworkX
  • Transformers

‍

‍

💡 Astuce

Utilisez les graphes de réponse pour segmenter automatiquement des dialogues multi-fils avant de fine-tuner un modèle conversationnel.

Questions fréquemment posées

Ce dataset contient-il des dialogues complets ou seulement des messages isolés ?

Il contient des messages reliés entre eux via des graphes d’annotation, permettant de reconstruire les conversations complètes.

Peut-on l’utiliser pour entraîner un chatbot multi-utilisateurs ?

Oui, il est idéal pour entraîner un modèle capable de gérer plusieurs conversations imbriquées dans un même flux.

Existe-t-il des outils fournis pour traiter ce dataset ?

Oui, des scripts sont disponibles dans le dépôt GitHub associé pour la conversion, l’évaluation et le prétraitement des données.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.