PhilPapers Papers Summarized Labeled
Dataset textuel contenant 3 776 papiers philosophiques avec résumés générés par LLM et classification multi-label dans 17 écoles philosophiques.
3 776 documents en format JSON, incluant titres, résumés, labels multi-étiquettes
MIT
Description
PhilPapers Papers Summarized Labeled est un dataset composé de 3 776 documents philosophiques issus de PhilPapers. Chaque document contient le titre, un résumé synthétique de 2-3 phrases généré par un LLM, ainsi qu’une classification multi-label en 17 écoles philosophiques différentes, telles que l’Existentialisme, le Stoïcisme, ou l’Utilitarisme.
À quoi sert ce dataset ?
- Entraîner des modèles de classification multi-label sur des textes académiques
- Développer des outils de résumé automatique dans le domaine philosophique
- Analyser et explorer les tendances dans les écoles de pensée à travers les documents
Peut-on l’enrichir ou l’améliorer ?
Oui, il est possible d’ajouter d’autres langues, d’améliorer les résumés avec des modèles plus récents, ou de compléter les annotations avec des sous-catégories plus fines.
🔎 En résumé
🧠 Recommandé pour
- Chercheurs en NLP
- Étudiants en philosophie
- Développeurs d’outils académiques
🔧 Outils compatibles
- Hugging Face Datasets
- Scikit-learn
- PyTorch
- Transformers
💡 Astuce
Utilisez la classification multi-label pour entraîner des modèles capables de gérer des thèmes complexes et multiples dans un même document.
Questions fréquemment posées
Quel est le format des résumés fournis dans ce dataset ?
Les résumés sont des phrases courtes (2-3 phrases) générées automatiquement par un LLM.
Ce dataset peut-il être utilisé pour la classification multi-label ?
Oui, il contient des labels multi-étiquettes pour 17 écoles philosophiques.
Peut-on ajouter d’autres catégories philosophiques au dataset ?
Oui, le dataset peut être enrichi avec des annotations supplémentaires ou sous-catégories plus précises.




