TLDR-17
Dataset massif de posts Reddit en anglais avec contenu et résumé associé, conçu pour entraîner et évaluer des modèles de résumé automatique (summarization).
Environ 3,8 millions de posts avec résumé, fichiers JSON, taille totale ~19 Go
CC-BY 4.0
Description
Le dataset TLDR-17 regroupe plus de 3,8 millions de posts Reddit en anglais, chacun accompagné d’un résumé court (en moyenne 28 mots). Les données sont prétraitées et fournies en format JSON avec plusieurs champs comme l’auteur, le contenu, le résumé et le subreddit d’origine.
À quoi sert ce dataset ?
- Entraîner des modèles de résumé automatique (abstractive summarization)
- Évaluer les performances de modèles NLP sur des contenus sociaux réels
- Développer des systèmes de synthèse de contenu pour forums et réseaux sociaux
Peut-on l’enrichir ou l’améliorer ?
Ce dataset peut être enrichi par l’ajout d’annotations qualitatives sur la qualité des résumés, ou par la création de versions multi-langues. La sélection et le nettoyage peuvent améliorer les performances des modèles.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Équipes IA social media
- Développeurs de chatbots et assistants
🔧 Outils compatibles
- Hugging Face Transformers
- TensorFlow
- PyTorch
- SpaCy
- Jupyter notebooks
💡 Astuce
Pré-filtrer les données pour limiter le bruit lié à certains subreddits ou posts hors sujet.
Questions fréquemment posées
Ce dataset inclut-il des métadonnées sur les auteurs ou la date des posts ?
Oui, des champs comme l’auteur, subreddit et subreddit_id sont inclus, mais les dates précises ne sont pas toujours présentes.
Peut-on utiliser ce dataset pour des tâches autres que le résumé automatique ?
Principalement orienté résumé, mais les contenus peuvent être réutilisés pour d’autres tâches NLP comme classification de texte.
Quelle est la taille totale du dataset téléchargé ?
Environ 19 Go en données générées, avec 3,14 Go de fichiers compressés à télécharger.




