Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Texto

TLDR-17

Conjunto de datos masivo de publicaciones de Reddit en inglés con contenido y resumen asociado, diseñado para entrenar y evaluar modelos de resumen automático.

Obtén el dataset
Tamaño

Aproximadamente 3,8 millones de publicaciones con resumen, archivos JSON, tamaño total de aproximadamente 19 GB

Licencia

CC-BY 4.0

Descripción

El conjunto de datos TLDR-17 contiene más de 3,8 millones de publicaciones de Reddit en inglés, cada una con un breve resumen (una media de 28 palabras). Los datos se procesan previamente y se proporcionan en formato JSON con varios campos, como el autor, el contenido, el resumen y el subreddit original.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de resumen automáticos (resumen abstracto)
  • Evalúe el rendimiento de los modelos de PNL en contenido social real
  • Desarrollar sistemas de síntesis de contenido para foros y redes sociales

¿Se puede enriquecer o mejorar?

Este conjunto de datos se puede enriquecer añadiendo anotaciones cualitativas sobre la calidad de los resúmenes o creando versiones en varios idiomas. La selección y la limpieza pueden mejorar el rendimiento del modelo.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐✩✩ (Gran volumen, requiere recursos y preprocesamiento)
🧼 Necesidad de limpieza⭐⭐⭐✩✩ (Moderado a alto, datos de Reddit con posible ruido)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno, resumen humano proporcionado)
📜 Licencia comercial✅ Sí (CC-BY 4.0)
👨‍💻 Ideal para principiantes⚠️ Medio, más bien para usuarios con recursos considerables
🔁 Reutilizable para fine-tuning🎯 Perfecto para fine-tuning de modelos de summarization
🌍 Diversidad cultural⚡ Inglés, contenido amplio de comunidades Reddit

🧠 Recomendado para

  • Investigadores de PNL
  • Equipos de redes sociales de IA
  • Desarrolladores y asistentes de chatbots

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • SpaCy
  • Cuadernos Jupyter

💡 Consejo

Filtra previamente los datos para limitar el ruido asociado con ciertos subreddits o publicaciones fuera de tema.

Preguntas frecuentes

¿Este conjunto de datos incluye metadatos sobre los autores o la fecha de las publicaciones?

Sí, se incluyen campos como autor, subreddit y subreddit_id, pero las fechas específicas no siempre están presentes.

¿Se puede usar este conjunto de datos para tareas distintas del resumen automático?

Principalmente está orientado a resúmenes, pero el contenido se puede reutilizar para otras tareas de PNL, como la clasificación de textos.

¿Cuál es el tamaño total del conjunto de datos descargado?

Se generaron aproximadamente 19 GB de datos, con 3,14 GB de archivos comprimidos para descargar.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.