7K Books with Metadata
Ce dataset regroupe plus de 6 500 livres avec leurs métadonnées (titre, auteur, description, ISBN, etc.), obtenues via l’API Google Books à partir de données Goodreads. Il est idéal pour entraîner un moteur de recommandation, faire du clustering ou encore appliquer des techniques de NLP (analyse de texte littéraire, classification de genre, etc.).
6542 lignes au format CSV, contenant titres, auteurs, descriptions, ISBN, langue, catégories
CC0: Public Domain
Description
Le dataset 7K Books with Metadata a été construit à partir de l’API Google Books et de Goodreads. Il contient plus de 6 500 livres, avec pour chacun une fiche complète : titre, auteur(s), description, ISBN, langue, catégories et autres attributs utiles. Il est particulièrement adapté aux travaux en traitement automatique des langues (TAL) et en science des données appliquée à la littérature ou l’édition.
À quoi sert ce dataset ?
- Créer un moteur de recommandation de livres (filtrage basé sur le contenu)
- Analyser les tendances littéraires selon les catégories ou les descriptions
- Expérimenter avec le NLP : résumé automatique, classification par genre, clustering sémantique
Peut-on l’enrichir ou l’améliorer ?
Oui. Il est possible de compléter les métadonnées avec d’autres sources (Amazon, OpenLibrary), d’extraire des mots-clés depuis les résumés, ou encore de filtrer par langue pour affiner les modèles NLP. L’auteur envisage lui-même d’élargir le dataset avec de futures requêtes API plus larges.
🔎 En résumé
🧠 Recommandé pour
- Étudiants en data science
- Passionnés de littérature
- Chercheurs en IA littéraire
🔧 Outils compatibles
- Pandas
- Scikit-learn
- SpaCy
- HuggingFace Transformers
💡 Astuce
Utilisez l’analyse TF-IDF des résumés pour générer des clusters thématiques ou lancer un moteur de recherche interne de livres.
Questions fréquemment posées
Ce dataset contient-il les textes complets des livres ?
Non, seules les métadonnées sont présentes (titre, auteur, résumé, catégories…), mais pas le contenu intégral des œuvres.
Peut-on filtrer par langue ou par catégorie ?
Oui, certaines colonnes permettent de connaître la langue et les genres associés à chaque livre.
Peut-on entraîner un moteur de recommandation avec ce dataset ?
Oui, c’est même un de ses usages principaux. Le champ "description" permet un filtrage basé sur le contenu ou la similarité.




