Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Coarse Discourse: corpus anotado de discursos en los foros de Reddit
Texto

Coarse Discourse: corpus anotado de discursos en los foros de Reddit

El conjunto de datos <strong>Coarse-Discourse</strong> contiene más de 116 000 comentarios extraídos de las discusiones de Reddit, anotados manualmente con actos de discurso (por ejemplo, elaboración). Los datos también contienen enlaces entre los comentarios, la profundidad de las publicaciones y los metadatos de los subreddit.

Obtén el dataset
Tamaño

Aproximadamente 116 000 comentarios comentados en Reddit, formato JSON, tamaño ~50 MB

Licencia

CC-BY 4.0

Descripción

‍

Coarse Discourse es una gran cantidad de anotaciones de discursos en debates en línea, extraídas de Reddit. Cada comentario está anotado con actos de discurso, lo que facilita el análisis de la dinámica conversacional y la comprensión de las estructuras discursivas en los foros.

‍

‍

¿Para qué sirve este conjunto de datos?

‍

  • Modelos de entrenamiento para comprender y clasificar los actos del habla
  • Analice las interacciones conversacionales en foros y redes sociales
  • Mejorar los sistemas de moderación y la detección de conductas discursivas

‍

‍

¿Se puede enriquecer o mejorar?

‍

Sí, es posible añadir anotaciones adicionales, por ejemplo, niveles más precisos de actos de discurso, o integrar otras plataformas para enriquecer la diversidad de interacciones.

‍

‍

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Datos en JSON, requiere comprensión de anotaciones)
🧼 Necesidad de limpieza⭐⭐⭐✩✩ (Moderado, gestión de enlaces y metadatos)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno, actos de discurso validados manualmente)
📜 Licencia comercial✅ Sí (CC-BY 4.0)
👨‍💻 Ideal para principiantes⚠️ Medio – útil para proyectos avanzados en NLP conversacional
🔁 Reutilizable para fine-tuning🎯 Perfecto para clasificación de actos de discurso y modelado
🌍 Diversidad cultural⚠️ Inglés, basado en comunidad variada de Reddit

‍

‍

🧠 Recomendado para

  • Investigadores de PNL
  • Desarrolladores de chatbots
  • Analistas de redes sociales

‍

‍

🔧 Herramientas compatibles

  • Python (pandas, json)
  • Frameworks NLP (SpaCy, Transformers)
  • Herramientas de anotación

‍

‍

💡 Consejo

Utilice los metadatos de profundidad y enlace para reconstruir el hilo durante el análisis.

Preguntas frecuentes

¿Qué tipos de actos de habla se anotan en este conjunto de datos?

Actos mayoritariamente burdos como la «elaboración», la «justificación», que permiten caracterizar la función discursiva de los comentarios.

¿Cuántos comentarios contiene este conjunto de datos?

Aproximadamente 116 000 comentarios comentados de más de 9 000 hilos de Reddit.

¿Este conjunto de datos es adecuado para proyectos comerciales?

Sí, con licencia CC-BY 4.0, se puede usar libremente, incluso en proyectos comerciales, respetando la atribución.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.