Al hacer clic en "Aceptar", usted acepta que se almacenen cookies en su dispositivo para mejorar la navegación del sitio, analizar su uso y contribuir a nuestros esfuerzos de marketing. Consulte nuestra política de privacidad para más información.  pour plus d'informations.
Open Datasets
Newspaper Text Summarization CNN DailyMail
Texto

Newspaper Text Summarization CNN DailyMail

Conjunto de datos que contiene más de 300 000 artículos de noticias en inglés de CNN y Daily Mail, con sus resúmenes manuscritos escritos por periodistas. Es compatible con el resumen extractivo y abstracto.

Obtén el dataset
Tamaño

Aproximadamente 312 000 artículos en inglés, formato JSON/texto, incluido el artículo completo y los puntos destacados

Licencia

CC0: Dominio público

Descripción

El conjunto de datos Newspaper Text Summarization CNN DailyMail incluye más de 300 000 artículos de noticias en inglés de la CNN y el Daily Mail. Cada artículo va acompañado de un resumen («puntos destacados») escrito por el periodista, lo que permite aprender a utilizar modelos de resumen automáticos. El conjunto de datos está estructurado en tres partes: entrenamiento, validación y prueba, para facilitar la evaluación.

¿Para qué sirve este conjunto de datos?

  • Entrene modelos de resumen automáticos, extractivos o abstractivos
  • Evaluar la calidad de los resúmenes generados por los sistemas de PNL
  • Estudiar la comprensión automática de textos largos

¿Se puede enriquecer o mejorar?

Sí, añadiendo anotaciones adicionales, por ejemplo metadatos sobre el estilo periodístico, o creando versiones multilingües. Las limpiezas pueden mejorar la calidad del texto de entrada y las técnicas de aumento de datos pueden enriquecer el corpus.

🔎 En resumen

Criterio Evaluación
🧩 Facilidad de uso⭐⭐⭐⭐⭐ (Muy accesible, formato claro)
🧼 Necesidad de limpieza⭐⭐⭐⭐✩ (Bajo – datos bien formateados)
🏷️ Riqueza de anotaciones⭐⭐⭐⭐✩ (Bueno – artículos completos y resúmenes)
📜 Licencia comercial✅ Libre (CC0)
👨‍💻 Ideal para principiantes👍 Sí, perfecto para empezar
🔁 Reutilizable para fine-tuning✅ Muy adecuado para resumen automático
🌍 Diversidad cultural⚠️ Inglés US & UK, perspectivas occidentales

🧠 Recomendado para

  • Investigadores de PNL
  • Desarrolladores de IA
  • Estudiantes de aprendizaje automático

🔧 Herramientas compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • SpaCy
  • AllenNLP

💡 Consejo

Para obtener los mejores resultados, utilice las divisiones de entrenamiento/validación/prueba proporcionadas y considere la evaluación con RED.

Preguntas frecuentes

¿Este conjunto de datos contiene artículos en varios idiomas?

No, solo artículos en inglés, la mayoría de los Estados Unidos y el Reino Unido.

¿Se puede usar este conjunto de datos para generar resúmenes automáticamente?

Sí, este es el objetivo principal, entrenar y probar modelos de resumen extractivos y abstractivos.

¿Cuál es el tamaño aproximado del conjunto de datos?

Aproximadamente 312.000 artículos con resúmenes, con un total de más de 1 GB de datos textuales.

Otros datasets

Ver más
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.