En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Open Datasets
Newspaper Text Summarization CNN DailyMail
Texte

Newspaper Text Summarization CNN DailyMail

Dataset contenant plus de 300 000 articles d’actualité en anglais issus de CNN et Daily Mail, avec leurs résumés manuels écrits par les journalistes. Il supporte la summarisation extractive et abstractive.

Télécharger le dataset
Taille

Environ 312 000 articles en anglais, format JSON/texte, incluant article complet et résumés (highlights)

Licence

CC0: Public Domain

Description

Le dataset Newspaper Text Summarization CNN DailyMail comprend plus de 300 000 articles d’actualité en anglais, provenant de CNN et du Daily Mail. Chaque article est accompagné d’un résumé ("highlights") écrit par le journaliste, permettant l’entraînement de modèles de summarisation automatique. Le dataset est structuré en trois parties : train, validation et test, pour faciliter l’évaluation.

À quoi sert ce dataset ?

  • Entraîner des modèles de summarisation automatique, extractive ou abstractive
  • Évaluer la qualité des résumés générés par des systèmes NLP
  • Étudier la compréhension automatique de textes longs

Peut-on l’enrichir ou l’améliorer ?

Oui, en ajoutant des annotations supplémentaires, par exemple des métadonnées sur le style journalistique, ou en créant des versions multilingues. Des nettoyages peuvent améliorer la qualité du texte d’entrée, et des techniques d’augmentation de données peuvent enrichir le corpus.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐⭐⭐ (Très accessible, format clair)
🧼 Besoin de nettoyage⭐⭐⭐⭐✩ (Faible – données bien formatées)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne – articles complets et résumés)
📜 Licence commerciale✅ Libre (CC0)
👨‍💻 Idéal pour les débutants👍 Oui, parfait pour démarrer
🔁 Réutilisable en fine-tuning✅ Très adapté pour summarisation
🌍 Diversité culturelle⚠️ Anglais US & UK, perspectives occidentales

🧠 Recommandé pour

  • Chercheurs NLP
  • Développeurs IA
  • Étudiants en machine learning

🔧 Outils compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • SpaCy
  • AllenNLP

💡 Astuce

Pour de meilleurs résultats, utilisez les splits train/validation/test fournis et considérez l’évaluation avec ROUGE.

Questions fréquemment posées

Ce dataset contient-il des articles dans plusieurs langues ?

Non, uniquement des articles en anglais, principalement des États-Unis et du Royaume-Uni.

Peut-on utiliser ce dataset pour la génération automatique de résumés ?

Oui, c’est l’objectif principal, pour entraîner et tester des modèles de summarisation extractive et abstractive.

Quelle est la taille approximative du dataset ?

Environ 312 000 articles avec résumés, totalisant plus de 1 Go de données textuelles.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.