Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
IRC Disentangle
Texto

IRC Disentangle

Este conjunto de datos proporciona registros de IRC anotados manualmente con estructuras de respuesta, lo que te permite reconstruir conversaciones enredadas. Un recurso valioso para capacitar o evaluar modelos para entender el diálogo.

Obtén el dataset
Tamaño

77.563 mensajes IRC anotados en JSON con gráficos de respuesta

Licencia

CC-BY 4.0

Descripción

‍

El conjunto de datos IRC Disentangle ofrece más de 77 000 mensajes de canales de IRC, cada uno anotado manualmente para indicar los enlaces de respuesta entre los mensajes. De este modo, permite reconstruir las conversaciones mixtas típicas de los chats en línea. Cada mensaje viene con una versión sin procesar, una versión ASCII, una tokenización y gráficos de respuesta que muestran los mensajes asociados. El juego se divide en canales y fechas, prestando especial atención a la calidad de las anotaciones.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Entrene modelos de desentrelazado conversacional (desentrelazamiento)
  • Probar la capacidad de un chatbot para identificar hilos en un flujo desorganizado
  • Mejorar las herramientas para moderar y analizar los diálogos en línea

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, el conjunto de datos se puede enriquecer añadiendo otros canales de IRC, traduciéndolo a otros idiomas o añadiendo anotaciones adicionales (emociones, intenciones, etc.). Los gráficos también se pueden usar para generar conversaciones sintéticas realistas, útiles para ajustar los modelos de diálogo.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Estructura clara pero requiere familiaridad con grafos)
🧼 Necesidad de limpieza⭐⭐⭐⭐⭐ (Bajo – datos ya normalizados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Muy buenas – conexiones explícitas entre mensajes)
📜 Licencia comercial✅ Sí (CC-BY 4.0)
👨‍💻 Ideal para principiantes⚠️ Accesible pero requiere comprensión de grafos
🔁 Reutilizable para fine-tuning🎯 Sí, para disentanglement de diálogos o chatbots multiturn
🌍 Diversidad cultural⚠️ Moderado – solo en inglés (logs Ubuntu)

‍

‍

🧠 Recomendado para

  • Los investigadores en el diálogo sobre la PNL
  • Moderadores de IA
  • Proyectos de recreación de conversaciones

‍

‍

🔧 Herramientas compatibles

  • PyTorch
  • Hugging Face Datasets
  • NetworkX
  • Transformers

‍

‍

💡 Consejo

Usa gráficos de respuestas para segmentar automáticamente los diálogos con varios subprocesos antes de ajustar un modelo conversacional.

Preguntas frecuentes

¿Este conjunto de datos contiene cuadros de diálogo completos o solo mensajes aislados?

Contiene mensajes enlazados entre sí mediante gráficos de anotación, lo que permite reconstruir conversaciones completas.

¿Se puede usar para entrenar a un chatbot multiusuario?

Sí, es ideal para entrenar un modelo que pueda gestionar varias conversaciones integradas en el mismo flujo.

¿Se proporcionan herramientas para procesar este conjunto de datos?

Sí, los scripts están disponibles en el repositorio de GitHub asociado para la conversión, la evaluación y el preprocesamiento de datos.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.