En cliquant sur "Accepter ", vous acceptez que des cookies soient stockés sur votre appareil afin d'améliorer la navigation sur le site, d'analyser son utilisation et de contribuer à nos efforts de marketing. Consultez notre politique de confidentialité pour plus d'informations.
Texte

TLDR-17

Dataset massif de posts Reddit en anglais avec contenu et résumé associé, conçu pour entraîner et évaluer des modèles de résumé automatique (summarization).

Télécharger le dataset
Taille

Environ 3,8 millions de posts avec résumé, fichiers JSON, taille totale ~19 Go

Licence

CC-BY 4.0

Description

Le dataset TLDR-17 regroupe plus de 3,8 millions de posts Reddit en anglais, chacun accompagné d’un résumé court (en moyenne 28 mots). Les données sont prétraitées et fournies en format JSON avec plusieurs champs comme l’auteur, le contenu, le résumé et le subreddit d’origine.

À quoi sert ce dataset ?

  • Entraîner des modèles de résumé automatique (abstractive summarization)
  • Évaluer les performances de modèles NLP sur des contenus sociaux réels
  • Développer des systèmes de synthèse de contenu pour forums et réseaux sociaux

Peut-on l’enrichir ou l’améliorer ?

Ce dataset peut être enrichi par l’ajout d’annotations qualitatives sur la qualité des résumés, ou par la création de versions multi-langues. La sélection et le nettoyage peuvent améliorer les performances des modèles.

🔎 En résumé

Critère Évaluation
🧩 Facilité d’utilisation⭐⭐⭐✩✩ (Volume important, nécessite ressources et prétraitement)
🧼 Besoin de nettoyage⭐⭐⭐✩✩ (Modéré à élevé, données issues de Reddit avec bruit possible)
🏷️ Richesse des annotations⭐⭐⭐⭐✩ (Bonne, résumé humain fourni)
📜 Licence commerciale✅ Oui (CC-BY 4.0)
👨‍💻 Idéal pour les débutants⚠️ Moyennement, plutôt pour utilisateurs avec ressources conséquentes
🔁 Réutilisable en fine-tuning🎯 Parfait pour fine-tuning de modèles de summarization
🌍 Diversité culturelle⚡ Anglais, contenu large des communautés Reddit

🧠 Recommandé pour

  • Chercheurs en NLP
  • Équipes IA social media
  • Développeurs de chatbots et assistants

🔧 Outils compatibles

  • Hugging Face Transformers
  • TensorFlow
  • PyTorch
  • SpaCy
  • Jupyter notebooks

💡 Astuce

Pré-filtrer les données pour limiter le bruit lié à certains subreddits ou posts hors sujet.

Questions fréquemment posées

Ce dataset inclut-il des métadonnées sur les auteurs ou la date des posts ?

Oui, des champs comme l’auteur, subreddit et subreddit_id sont inclus, mais les dates précises ne sont pas toujours présentes.

Peut-on utiliser ce dataset pour des tâches autres que le résumé automatique ?

Principalement orienté résumé, mais les contenus peuvent être réutilisés pour d’autres tâches NLP comme classification de texte.

Quelle est la taille totale du dataset téléchargé ?

Environ 19 Go en données générées, avec 3,14 Go de fichiers compressés à télécharger.

Datasets similaires

Voir plus
Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.

Category

Lorem ipsum dolor sit amet, consectetur adipiscing elit. Suspendisse varius enim in eros elementum tristique.