Newspaper Text Summarization CNN DailyMail
Conjunto de datos que contiene más de 300 000 artículos de noticias en inglés de CNN y Daily Mail, con sus resúmenes manuscritos escritos por periodistas. Es compatible con el resumen extractivo y abstracto.
Aproximadamente 312 000 artículos en inglés, formato JSON/texto, incluido el artículo completo y los puntos destacados
CC0: Dominio público
Descripción
El conjunto de datos Newspaper Text Summarization CNN DailyMail incluye más de 300 000 artículos de noticias en inglés de la CNN y el Daily Mail. Cada artículo va acompañado de un resumen («puntos destacados») escrito por el periodista, lo que permite aprender a utilizar modelos de resumen automáticos. El conjunto de datos está estructurado en tres partes: entrenamiento, validación y prueba, para facilitar la evaluación.
¿Para qué sirve este conjunto de datos?
- Entrene modelos de resumen automáticos, extractivos o abstractivos
- Evaluar la calidad de los resúmenes generados por los sistemas de PNL
- Estudiar la comprensión automática de textos largos
¿Se puede enriquecer o mejorar?
Sí, añadiendo anotaciones adicionales, por ejemplo metadatos sobre el estilo periodístico, o creando versiones multilingües. Las limpiezas pueden mejorar la calidad del texto de entrada y las técnicas de aumento de datos pueden enriquecer el corpus.
🔎 En resumen
🧠 Recomendado para
- Investigadores de PNL
- Desarrolladores de IA
- Estudiantes de aprendizaje automático
🔧 Herramientas compatibles
- Hugging Face Transformers
- TensorFlow
- PyTorch
- SpaCy
- AllenNLP
💡 Consejo
Para obtener los mejores resultados, utilice las divisiones de entrenamiento/validación/prueba proporcionadas y considere la evaluación con RED.
Preguntas frecuentes
¿Este conjunto de datos contiene artículos en varios idiomas?
No, solo artículos en inglés, la mayoría de los Estados Unidos y el Reino Unido.
¿Se puede usar este conjunto de datos para generar resúmenes automáticamente?
Sí, este es el objetivo principal, entrenar y probar modelos de resumen extractivos y abstractivos.
¿Cuál es el tamaño aproximado del conjunto de datos?
Aproximadamente 312.000 artículos con resúmenes, con un total de más de 1 GB de datos textuales.




